@meetkai/mka1 0.54.23 → 0.54.24
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/README.md +294 -276
- package/bin/mcp-server.js +3844 -1779
- package/bin/mcp-server.js.map +42 -17
- package/dist/commonjs/funcs/llmEvalsAppendAgentTrials.d.ts +19 -0
- package/dist/commonjs/funcs/llmEvalsAppendAgentTrials.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmEvalsAppendAgentTrials.js +136 -0
- package/dist/commonjs/funcs/llmEvalsAppendAgentTrials.js.map +1 -0
- package/dist/commonjs/funcs/llmEvalsGetRunOverview.d.ts +20 -0
- package/dist/commonjs/funcs/llmEvalsGetRunOverview.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmEvalsGetRunOverview.js +138 -0
- package/dist/commonjs/funcs/llmEvalsGetRunOverview.js.map +1 -0
- package/dist/commonjs/funcs/llmEvalsGetSampleTrajectory.d.ts +19 -0
- package/dist/commonjs/funcs/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmEvalsGetSampleTrajectory.js +142 -0
- package/dist/commonjs/funcs/llmEvalsGetSampleTrajectory.js.map +1 -0
- package/dist/commonjs/funcs/llmEvalsGetSuiteLeaderboard.d.ts +20 -0
- package/dist/commonjs/funcs/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmEvalsGetSuiteLeaderboard.js +142 -0
- package/dist/commonjs/funcs/llmEvalsGetSuiteLeaderboard.js.map +1 -0
- package/dist/commonjs/funcs/llmEvalsImportAgentRun.d.ts +19 -0
- package/dist/commonjs/funcs/llmEvalsImportAgentRun.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmEvalsImportAgentRun.js +130 -0
- package/dist/commonjs/funcs/llmEvalsImportAgentRun.js.map +1 -0
- package/dist/commonjs/funcs/llmEvalsUploadSampleTrajectory.d.ts +20 -0
- package/dist/commonjs/funcs/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmEvalsUploadSampleTrajectory.js +146 -0
- package/dist/commonjs/funcs/llmEvalsUploadSampleTrajectory.js.map +1 -0
- package/dist/commonjs/lib/config.d.ts +2 -2
- package/dist/commonjs/lib/config.js +2 -2
- package/dist/commonjs/mcp-server/mcp-server.js +1 -1
- package/dist/commonjs/mcp-server/server.d.ts.map +1 -1
- package/dist/commonjs/mcp-server/server.js +13 -1
- package/dist/commonjs/mcp-server/server.js.map +1 -1
- package/dist/commonjs/mcp-server/tools/llmEvalsAppendAgentTrials.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsAppendAgentTrials.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsAppendAgentTrials.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsAppendAgentTrials.js.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetRunOverview.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetRunOverview.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetRunOverview.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetRunOverview.js.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSampleTrajectory.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSampleTrajectory.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSampleTrajectory.js.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSuiteLeaderboard.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSuiteLeaderboard.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSuiteLeaderboard.js.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsImportAgentRun.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsImportAgentRun.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsImportAgentRun.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsImportAgentRun.js.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsUploadSampleTrajectory.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsUploadSampleTrajectory.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsUploadSampleTrajectory.js.map +1 -0
- package/dist/commonjs/models/components/appendagenttrialsrequest.d.ts +111 -0
- package/dist/commonjs/models/components/appendagenttrialsrequest.d.ts.map +1 -0
- package/dist/commonjs/models/components/appendagenttrialsrequest.js +136 -0
- package/dist/commonjs/models/components/appendagenttrialsrequest.js.map +1 -0
- package/dist/commonjs/models/components/evalleaderboardrow.d.ts +85 -0
- package/dist/commonjs/models/components/evalleaderboardrow.d.ts.map +1 -0
- package/dist/commonjs/models/components/evalleaderboardrow.js +129 -0
- package/dist/commonjs/models/components/evalleaderboardrow.js.map +1 -0
- package/dist/commonjs/models/components/evalrunoverview.d.ts +101 -0
- package/dist/commonjs/models/components/evalrunoverview.d.ts.map +1 -0
- package/dist/commonjs/models/components/evalrunoverview.js +150 -0
- package/dist/commonjs/models/components/evalrunoverview.js.map +1 -0
- package/dist/commonjs/models/components/evalsampleobject.d.ts +32 -0
- package/dist/commonjs/models/components/evalsampleobject.d.ts.map +1 -1
- package/dist/commonjs/models/components/evalsampleobject.js +20 -0
- package/dist/commonjs/models/components/evalsampleobject.js.map +1 -1
- package/dist/commonjs/models/components/evalsampletrajectoryuploadedobject.d.ts +32 -0
- package/dist/commonjs/models/components/evalsampletrajectoryuploadedobject.d.ts.map +1 -0
- package/dist/commonjs/models/components/evalsampletrajectoryuploadedobject.js +87 -0
- package/dist/commonjs/models/components/evalsampletrajectoryuploadedobject.js.map +1 -0
- package/dist/commonjs/models/components/evalsuiteleaderboard.d.ts +35 -0
- package/dist/commonjs/models/components/evalsuiteleaderboard.d.ts.map +1 -0
- package/dist/commonjs/models/components/evalsuiteleaderboard.js +78 -0
- package/dist/commonjs/models/components/evalsuiteleaderboard.js.map +1 -0
- package/dist/commonjs/models/components/importagentrunrequest.d.ts +164 -0
- package/dist/commonjs/models/components/importagentrunrequest.d.ts.map +1 -0
- package/dist/commonjs/models/components/importagentrunrequest.js +182 -0
- package/dist/commonjs/models/components/importagentrunrequest.js.map +1 -0
- package/dist/commonjs/models/components/index.d.ts +7 -0
- package/dist/commonjs/models/components/index.d.ts.map +1 -1
- package/dist/commonjs/models/components/index.js +7 -0
- package/dist/commonjs/models/components/index.js.map +1 -1
- package/dist/commonjs/models/components/uploadevalsampletrajectoryrequest.d.ts +34 -0
- package/dist/commonjs/models/components/uploadevalsampletrajectoryrequest.d.ts.map +1 -0
- package/dist/commonjs/models/components/uploadevalsampletrajectoryrequest.js +71 -0
- package/dist/commonjs/models/components/uploadevalsampletrajectoryrequest.js.map +1 -0
- package/dist/commonjs/models/operations/appendagentevaltrials.d.ts +264 -0
- package/dist/commonjs/models/operations/appendagentevaltrials.d.ts.map +1 -0
- package/dist/commonjs/models/operations/appendagentevaltrials.js +371 -0
- package/dist/commonjs/models/operations/appendagentevaltrials.js.map +1 -0
- package/dist/commonjs/models/operations/cancelevalrun.d.ts +20 -0
- package/dist/commonjs/models/operations/cancelevalrun.d.ts.map +1 -1
- package/dist/commonjs/models/operations/cancelevalrun.js +16 -0
- package/dist/commonjs/models/operations/cancelevalrun.js.map +1 -1
- package/dist/commonjs/models/operations/createevalrun.d.ts +20 -0
- package/dist/commonjs/models/operations/createevalrun.d.ts.map +1 -1
- package/dist/commonjs/models/operations/createevalrun.js +16 -0
- package/dist/commonjs/models/operations/createevalrun.js.map +1 -1
- package/dist/commonjs/models/operations/getevalrun.d.ts +20 -0
- package/dist/commonjs/models/operations/getevalrun.d.ts.map +1 -1
- package/dist/commonjs/models/operations/getevalrun.js +16 -0
- package/dist/commonjs/models/operations/getevalrun.js.map +1 -1
- package/dist/commonjs/models/operations/getevalrunoverview.d.ts +24 -0
- package/dist/commonjs/models/operations/getevalrunoverview.d.ts.map +1 -0
- package/dist/commonjs/models/operations/getevalrunoverview.js +73 -0
- package/dist/commonjs/models/operations/getevalrunoverview.js.map +1 -0
- package/dist/commonjs/models/operations/getevalsampletrajectory.d.ts +75 -0
- package/dist/commonjs/models/operations/getevalsampletrajectory.d.ts.map +1 -0
- package/dist/commonjs/models/operations/getevalsampletrajectory.js +133 -0
- package/dist/commonjs/models/operations/getevalsampletrajectory.js.map +1 -0
- package/dist/commonjs/models/operations/getevalsuiteleaderboard.d.ts +32 -0
- package/dist/commonjs/models/operations/getevalsuiteleaderboard.d.ts.map +1 -0
- package/dist/commonjs/models/operations/getevalsuiteleaderboard.js +83 -0
- package/dist/commonjs/models/operations/getevalsuiteleaderboard.js.map +1 -0
- package/dist/commonjs/models/operations/importagentevalrun.d.ts +262 -0
- package/dist/commonjs/models/operations/importagentevalrun.d.ts.map +1 -0
- package/dist/commonjs/models/operations/importagentevalrun.js +367 -0
- package/dist/commonjs/models/operations/importagentevalrun.js.map +1 -0
- package/dist/commonjs/models/operations/index.d.ts +6 -0
- package/dist/commonjs/models/operations/index.d.ts.map +1 -1
- package/dist/commonjs/models/operations/index.js +6 -0
- package/dist/commonjs/models/operations/index.js.map +1 -1
- package/dist/commonjs/models/operations/listevalruns.d.ts +20 -0
- package/dist/commonjs/models/operations/listevalruns.d.ts.map +1 -1
- package/dist/commonjs/models/operations/listevalruns.js +16 -0
- package/dist/commonjs/models/operations/listevalruns.js.map +1 -1
- package/dist/commonjs/models/operations/listevalscheduleruns.d.ts +20 -0
- package/dist/commonjs/models/operations/listevalscheduleruns.d.ts.map +1 -1
- package/dist/commonjs/models/operations/listevalscheduleruns.js +16 -0
- package/dist/commonjs/models/operations/listevalscheduleruns.js.map +1 -1
- package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.d.ts +20 -0
- package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.d.ts.map +1 -1
- package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.js +16 -0
- package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.js.map +1 -1
- package/dist/commonjs/models/operations/rerunfailedevalsamples.d.ts +20 -0
- package/dist/commonjs/models/operations/rerunfailedevalsamples.d.ts.map +1 -1
- package/dist/commonjs/models/operations/rerunfailedevalsamples.js +16 -0
- package/dist/commonjs/models/operations/rerunfailedevalsamples.js.map +1 -1
- package/dist/commonjs/models/operations/retryfailedevalrun.d.ts +20 -0
- package/dist/commonjs/models/operations/retryfailedevalrun.d.ts.map +1 -1
- package/dist/commonjs/models/operations/retryfailedevalrun.js +16 -0
- package/dist/commonjs/models/operations/retryfailedevalrun.js.map +1 -1
- package/dist/commonjs/models/operations/uploadevalsampletrajectory.d.ts +31 -0
- package/dist/commonjs/models/operations/uploadevalsampletrajectory.d.ts.map +1 -0
- package/dist/commonjs/models/operations/uploadevalsampletrajectory.js +86 -0
- package/dist/commonjs/models/operations/uploadevalsampletrajectory.js.map +1 -0
- package/dist/commonjs/react-query/index.d.ts +6 -0
- package/dist/commonjs/react-query/index.d.ts.map +1 -1
- package/dist/commonjs/react-query/index.js +6 -0
- package/dist/commonjs/react-query/index.js.map +1 -1
- package/dist/commonjs/react-query/llmEvalsAppendAgentTrials.d.ts +28 -0
- package/dist/commonjs/react-query/llmEvalsAppendAgentTrials.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsAppendAgentTrials.js +47 -0
- package/dist/commonjs/react-query/llmEvalsAppendAgentTrials.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.core.d.ts +16 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.core.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.core.js +37 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.core.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.d.ts +40 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.js +60 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.core.d.ts +16 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.core.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.core.js +45 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.core.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.d.ts +44 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.js +65 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.core.d.ts +20 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.core.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.core.js +41 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.core.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.d.ts +48 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.js +65 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsImportAgentRun.d.ts +28 -0
- package/dist/commonjs/react-query/llmEvalsImportAgentRun.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsImportAgentRun.js +47 -0
- package/dist/commonjs/react-query/llmEvalsImportAgentRun.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsUploadSampleTrajectory.d.ts +29 -0
- package/dist/commonjs/react-query/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsUploadSampleTrajectory.js +47 -0
- package/dist/commonjs/react-query/llmEvalsUploadSampleTrajectory.js.map +1 -0
- package/dist/commonjs/sdk/evals.d.ts +42 -0
- package/dist/commonjs/sdk/evals.d.ts.map +1 -1
- package/dist/commonjs/sdk/evals.js +60 -0
- package/dist/commonjs/sdk/evals.js.map +1 -1
- package/dist/esm/funcs/llmEvalsAppendAgentTrials.d.ts +19 -0
- package/dist/esm/funcs/llmEvalsAppendAgentTrials.d.ts.map +1 -0
- package/dist/esm/funcs/llmEvalsAppendAgentTrials.js +100 -0
- package/dist/esm/funcs/llmEvalsAppendAgentTrials.js.map +1 -0
- package/dist/esm/funcs/llmEvalsGetRunOverview.d.ts +20 -0
- package/dist/esm/funcs/llmEvalsGetRunOverview.d.ts.map +1 -0
- package/dist/esm/funcs/llmEvalsGetRunOverview.js +102 -0
- package/dist/esm/funcs/llmEvalsGetRunOverview.js.map +1 -0
- package/dist/esm/funcs/llmEvalsGetSampleTrajectory.d.ts +19 -0
- package/dist/esm/funcs/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
- package/dist/esm/funcs/llmEvalsGetSampleTrajectory.js +106 -0
- package/dist/esm/funcs/llmEvalsGetSampleTrajectory.js.map +1 -0
- package/dist/esm/funcs/llmEvalsGetSuiteLeaderboard.d.ts +20 -0
- package/dist/esm/funcs/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
- package/dist/esm/funcs/llmEvalsGetSuiteLeaderboard.js +106 -0
- package/dist/esm/funcs/llmEvalsGetSuiteLeaderboard.js.map +1 -0
- package/dist/esm/funcs/llmEvalsImportAgentRun.d.ts +19 -0
- package/dist/esm/funcs/llmEvalsImportAgentRun.d.ts.map +1 -0
- package/dist/esm/funcs/llmEvalsImportAgentRun.js +94 -0
- package/dist/esm/funcs/llmEvalsImportAgentRun.js.map +1 -0
- package/dist/esm/funcs/llmEvalsUploadSampleTrajectory.d.ts +20 -0
- package/dist/esm/funcs/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
- package/dist/esm/funcs/llmEvalsUploadSampleTrajectory.js +110 -0
- package/dist/esm/funcs/llmEvalsUploadSampleTrajectory.js.map +1 -0
- package/dist/esm/lib/config.d.ts +2 -2
- package/dist/esm/lib/config.js +2 -2
- package/dist/esm/mcp-server/mcp-server.js +1 -1
- package/dist/esm/mcp-server/server.d.ts.map +1 -1
- package/dist/esm/mcp-server/server.js +13 -1
- package/dist/esm/mcp-server/server.js.map +1 -1
- package/dist/esm/mcp-server/tools/llmEvalsAppendAgentTrials.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmEvalsAppendAgentTrials.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsAppendAgentTrials.js +28 -0
- package/dist/esm/mcp-server/tools/llmEvalsAppendAgentTrials.js.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetRunOverview.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetRunOverview.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetRunOverview.js +28 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetRunOverview.js.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSampleTrajectory.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSampleTrajectory.js +28 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSampleTrajectory.js.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSuiteLeaderboard.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSuiteLeaderboard.js +28 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSuiteLeaderboard.js.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsImportAgentRun.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmEvalsImportAgentRun.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsImportAgentRun.js +28 -0
- package/dist/esm/mcp-server/tools/llmEvalsImportAgentRun.js.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsUploadSampleTrajectory.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsUploadSampleTrajectory.js +28 -0
- package/dist/esm/mcp-server/tools/llmEvalsUploadSampleTrajectory.js.map +1 -0
- package/dist/esm/models/components/appendagenttrialsrequest.d.ts +111 -0
- package/dist/esm/models/components/appendagenttrialsrequest.d.ts.map +1 -0
- package/dist/esm/models/components/appendagenttrialsrequest.js +96 -0
- package/dist/esm/models/components/appendagenttrialsrequest.js.map +1 -0
- package/dist/esm/models/components/evalleaderboardrow.d.ts +85 -0
- package/dist/esm/models/components/evalleaderboardrow.d.ts.map +1 -0
- package/dist/esm/models/components/evalleaderboardrow.js +89 -0
- package/dist/esm/models/components/evalleaderboardrow.js.map +1 -0
- package/dist/esm/models/components/evalrunoverview.d.ts +101 -0
- package/dist/esm/models/components/evalrunoverview.d.ts.map +1 -0
- package/dist/esm/models/components/evalrunoverview.js +108 -0
- package/dist/esm/models/components/evalrunoverview.js.map +1 -0
- package/dist/esm/models/components/evalsampleobject.d.ts +32 -0
- package/dist/esm/models/components/evalsampleobject.d.ts.map +1 -1
- package/dist/esm/models/components/evalsampleobject.js +20 -0
- package/dist/esm/models/components/evalsampleobject.js.map +1 -1
- package/dist/esm/models/components/evalsampletrajectoryuploadedobject.d.ts +32 -0
- package/dist/esm/models/components/evalsampletrajectoryuploadedobject.d.ts.map +1 -0
- package/dist/esm/models/components/evalsampletrajectoryuploadedobject.js +49 -0
- package/dist/esm/models/components/evalsampletrajectoryuploadedobject.js.map +1 -0
- package/dist/esm/models/components/evalsuiteleaderboard.d.ts +35 -0
- package/dist/esm/models/components/evalsuiteleaderboard.d.ts.map +1 -0
- package/dist/esm/models/components/evalsuiteleaderboard.js +40 -0
- package/dist/esm/models/components/evalsuiteleaderboard.js.map +1 -0
- package/dist/esm/models/components/importagentrunrequest.d.ts +164 -0
- package/dist/esm/models/components/importagentrunrequest.d.ts.map +1 -0
- package/dist/esm/models/components/importagentrunrequest.js +142 -0
- package/dist/esm/models/components/importagentrunrequest.js.map +1 -0
- package/dist/esm/models/components/index.d.ts +7 -0
- package/dist/esm/models/components/index.d.ts.map +1 -1
- package/dist/esm/models/components/index.js +7 -0
- package/dist/esm/models/components/index.js.map +1 -1
- package/dist/esm/models/components/uploadevalsampletrajectoryrequest.d.ts +34 -0
- package/dist/esm/models/components/uploadevalsampletrajectoryrequest.d.ts.map +1 -0
- package/dist/esm/models/components/uploadevalsampletrajectoryrequest.js +33 -0
- package/dist/esm/models/components/uploadevalsampletrajectoryrequest.js.map +1 -0
- package/dist/esm/models/operations/appendagentevaltrials.d.ts +264 -0
- package/dist/esm/models/operations/appendagentevaltrials.d.ts.map +1 -0
- package/dist/esm/models/operations/appendagentevaltrials.js +323 -0
- package/dist/esm/models/operations/appendagentevaltrials.js.map +1 -0
- package/dist/esm/models/operations/cancelevalrun.d.ts +20 -0
- package/dist/esm/models/operations/cancelevalrun.d.ts.map +1 -1
- package/dist/esm/models/operations/cancelevalrun.js +16 -0
- package/dist/esm/models/operations/cancelevalrun.js.map +1 -1
- package/dist/esm/models/operations/createevalrun.d.ts +20 -0
- package/dist/esm/models/operations/createevalrun.d.ts.map +1 -1
- package/dist/esm/models/operations/createevalrun.js +16 -0
- package/dist/esm/models/operations/createevalrun.js.map +1 -1
- package/dist/esm/models/operations/getevalrun.d.ts +20 -0
- package/dist/esm/models/operations/getevalrun.d.ts.map +1 -1
- package/dist/esm/models/operations/getevalrun.js +16 -0
- package/dist/esm/models/operations/getevalrun.js.map +1 -1
- package/dist/esm/models/operations/getevalrunoverview.d.ts +24 -0
- package/dist/esm/models/operations/getevalrunoverview.d.ts.map +1 -0
- package/dist/esm/models/operations/getevalrunoverview.js +35 -0
- package/dist/esm/models/operations/getevalrunoverview.js.map +1 -0
- package/dist/esm/models/operations/getevalsampletrajectory.d.ts +75 -0
- package/dist/esm/models/operations/getevalsampletrajectory.d.ts.map +1 -0
- package/dist/esm/models/operations/getevalsampletrajectory.js +93 -0
- package/dist/esm/models/operations/getevalsampletrajectory.js.map +1 -0
- package/dist/esm/models/operations/getevalsuiteleaderboard.d.ts +32 -0
- package/dist/esm/models/operations/getevalsuiteleaderboard.d.ts.map +1 -0
- package/dist/esm/models/operations/getevalsuiteleaderboard.js +45 -0
- package/dist/esm/models/operations/getevalsuiteleaderboard.js.map +1 -0
- package/dist/esm/models/operations/importagentevalrun.d.ts +262 -0
- package/dist/esm/models/operations/importagentevalrun.d.ts.map +1 -0
- package/dist/esm/models/operations/importagentevalrun.js +319 -0
- package/dist/esm/models/operations/importagentevalrun.js.map +1 -0
- package/dist/esm/models/operations/index.d.ts +6 -0
- package/dist/esm/models/operations/index.d.ts.map +1 -1
- package/dist/esm/models/operations/index.js +6 -0
- package/dist/esm/models/operations/index.js.map +1 -1
- package/dist/esm/models/operations/listevalruns.d.ts +20 -0
- package/dist/esm/models/operations/listevalruns.d.ts.map +1 -1
- package/dist/esm/models/operations/listevalruns.js +16 -0
- package/dist/esm/models/operations/listevalruns.js.map +1 -1
- package/dist/esm/models/operations/listevalscheduleruns.d.ts +20 -0
- package/dist/esm/models/operations/listevalscheduleruns.d.ts.map +1 -1
- package/dist/esm/models/operations/listevalscheduleruns.js +16 -0
- package/dist/esm/models/operations/listevalscheduleruns.js.map +1 -1
- package/dist/esm/models/operations/listevalsuiteleaderboardruns.d.ts +20 -0
- package/dist/esm/models/operations/listevalsuiteleaderboardruns.d.ts.map +1 -1
- package/dist/esm/models/operations/listevalsuiteleaderboardruns.js +16 -0
- package/dist/esm/models/operations/listevalsuiteleaderboardruns.js.map +1 -1
- package/dist/esm/models/operations/rerunfailedevalsamples.d.ts +20 -0
- package/dist/esm/models/operations/rerunfailedevalsamples.d.ts.map +1 -1
- package/dist/esm/models/operations/rerunfailedevalsamples.js +16 -0
- package/dist/esm/models/operations/rerunfailedevalsamples.js.map +1 -1
- package/dist/esm/models/operations/retryfailedevalrun.d.ts +20 -0
- package/dist/esm/models/operations/retryfailedevalrun.d.ts.map +1 -1
- package/dist/esm/models/operations/retryfailedevalrun.js +16 -0
- package/dist/esm/models/operations/retryfailedevalrun.js.map +1 -1
- package/dist/esm/models/operations/uploadevalsampletrajectory.d.ts +31 -0
- package/dist/esm/models/operations/uploadevalsampletrajectory.d.ts.map +1 -0
- package/dist/esm/models/operations/uploadevalsampletrajectory.js +48 -0
- package/dist/esm/models/operations/uploadevalsampletrajectory.js.map +1 -0
- package/dist/esm/react-query/index.d.ts +6 -0
- package/dist/esm/react-query/index.d.ts.map +1 -1
- package/dist/esm/react-query/index.js +6 -0
- package/dist/esm/react-query/index.js.map +1 -1
- package/dist/esm/react-query/llmEvalsAppendAgentTrials.d.ts +28 -0
- package/dist/esm/react-query/llmEvalsAppendAgentTrials.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsAppendAgentTrials.js +42 -0
- package/dist/esm/react-query/llmEvalsAppendAgentTrials.js.map +1 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.core.d.ts +16 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.core.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.core.js +32 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.core.js.map +1 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.d.ts +40 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.js +50 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.js.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.core.d.ts +16 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.core.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.core.js +40 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.core.js.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.d.ts +44 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.js +55 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.js.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.core.d.ts +20 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.core.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.core.js +36 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.core.js.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.d.ts +48 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.js +55 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.js.map +1 -0
- package/dist/esm/react-query/llmEvalsImportAgentRun.d.ts +28 -0
- package/dist/esm/react-query/llmEvalsImportAgentRun.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsImportAgentRun.js +42 -0
- package/dist/esm/react-query/llmEvalsImportAgentRun.js.map +1 -0
- package/dist/esm/react-query/llmEvalsUploadSampleTrajectory.d.ts +29 -0
- package/dist/esm/react-query/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsUploadSampleTrajectory.js +42 -0
- package/dist/esm/react-query/llmEvalsUploadSampleTrajectory.js.map +1 -0
- package/dist/esm/sdk/evals.d.ts +42 -0
- package/dist/esm/sdk/evals.d.ts.map +1 -1
- package/dist/esm/sdk/evals.js +60 -0
- package/dist/esm/sdk/evals.js.map +1 -1
- package/jsr.json +1 -1
- package/package.json +1 -1
- package/src/funcs/llmEvalsAppendAgentTrials.ts +188 -0
- package/src/funcs/llmEvalsGetRunOverview.ts +192 -0
- package/src/funcs/llmEvalsGetSampleTrajectory.ts +197 -0
- package/src/funcs/llmEvalsGetSuiteLeaderboard.ts +197 -0
- package/src/funcs/llmEvalsImportAgentRun.ts +181 -0
- package/src/funcs/llmEvalsUploadSampleTrajectory.ts +201 -0
- package/src/lib/config.ts +2 -2
- package/src/mcp-server/mcp-server.ts +1 -1
- package/src/mcp-server/server.ts +13 -1
- package/src/mcp-server/tools/llmEvalsAppendAgentTrials.ts +37 -0
- package/src/mcp-server/tools/llmEvalsGetRunOverview.ts +37 -0
- package/src/mcp-server/tools/llmEvalsGetSampleTrajectory.ts +37 -0
- package/src/mcp-server/tools/llmEvalsGetSuiteLeaderboard.ts +37 -0
- package/src/mcp-server/tools/llmEvalsImportAgentRun.ts +37 -0
- package/src/mcp-server/tools/llmEvalsUploadSampleTrajectory.ts +38 -0
- package/src/models/components/appendagenttrialsrequest.ts +224 -0
- package/src/models/components/evalleaderboardrow.ts +200 -0
- package/src/models/components/evalrunoverview.ts +240 -0
- package/src/models/components/evalsampleobject.ts +48 -0
- package/src/models/components/evalsampletrajectoryuploadedobject.ts +98 -0
- package/src/models/components/evalsuiteleaderboard.ts +93 -0
- package/src/models/components/importagentrunrequest.ts +319 -0
- package/src/models/components/index.ts +7 -0
- package/src/models/components/uploadevalsampletrajectoryrequest.ts +79 -0
- package/src/models/operations/appendagentevaltrials.ts +678 -0
- package/src/models/operations/cancelevalrun.ts +36 -0
- package/src/models/operations/createevalrun.ts +36 -0
- package/src/models/operations/getevalrun.ts +36 -0
- package/src/models/operations/getevalrunoverview.ts +73 -0
- package/src/models/operations/getevalsampletrajectory.ts +199 -0
- package/src/models/operations/getevalsuiteleaderboard.ts +93 -0
- package/src/models/operations/importagentevalrun.ts +665 -0
- package/src/models/operations/index.ts +6 -0
- package/src/models/operations/listevalruns.ts +36 -0
- package/src/models/operations/listevalscheduleruns.ts +36 -0
- package/src/models/operations/listevalsuiteleaderboardruns.ts +36 -0
- package/src/models/operations/rerunfailedevalsamples.ts +36 -0
- package/src/models/operations/retryfailedevalrun.ts +36 -0
- package/src/models/operations/uploadevalsampletrajectory.ts +98 -0
- package/src/react-query/index.ts +6 -0
- package/src/react-query/llmEvalsAppendAgentTrials.ts +109 -0
- package/src/react-query/llmEvalsGetRunOverview.core.ts +77 -0
- package/src/react-query/llmEvalsGetRunOverview.ts +150 -0
- package/src/react-query/llmEvalsGetSampleTrajectory.core.ts +94 -0
- package/src/react-query/llmEvalsGetSampleTrajectory.ts +159 -0
- package/src/react-query/llmEvalsGetSuiteLeaderboard.core.ts +89 -0
- package/src/react-query/llmEvalsGetSuiteLeaderboard.ts +163 -0
- package/src/react-query/llmEvalsImportAgentRun.ts +109 -0
- package/src/react-query/llmEvalsUploadSampleTrajectory.ts +110 -0
- package/src/sdk/evals.ts +108 -0
|
@@ -0,0 +1,29 @@
|
|
|
1
|
+
import { MutationKey, UseMutationResult } from "@tanstack/react-query";
|
|
2
|
+
import { SDKCore } from "../core.js";
|
|
3
|
+
import { RequestOptions } from "../lib/sdks.js";
|
|
4
|
+
import * as components from "../models/components/index.js";
|
|
5
|
+
import { ConnectionError, InvalidRequestError, RequestAbortedError, RequestTimeoutError, UnexpectedClientError } from "../models/errors/httpclienterrors.js";
|
|
6
|
+
import { ResponseValidationError } from "../models/errors/responsevalidationerror.js";
|
|
7
|
+
import { SDKError } from "../models/errors/sdkerror.js";
|
|
8
|
+
import { SDKValidationError } from "../models/errors/sdkvalidationerror.js";
|
|
9
|
+
import * as operations from "../models/operations/index.js";
|
|
10
|
+
import { MutationHookOptions } from "./_types.js";
|
|
11
|
+
export type LlmEvalsUploadSampleTrajectoryMutationVariables = {
|
|
12
|
+
request: operations.UploadEvalSampleTrajectoryRequest;
|
|
13
|
+
options?: RequestOptions;
|
|
14
|
+
};
|
|
15
|
+
export type LlmEvalsUploadSampleTrajectoryMutationData = components.EvalSampleTrajectoryUploadedObject;
|
|
16
|
+
export type LlmEvalsUploadSampleTrajectoryMutationError = SDKError | ResponseValidationError | ConnectionError | RequestAbortedError | RequestTimeoutError | InvalidRequestError | UnexpectedClientError | SDKValidationError;
|
|
17
|
+
/**
|
|
18
|
+
* Upload an eval sample trajectory
|
|
19
|
+
*
|
|
20
|
+
* @remarks
|
|
21
|
+
* Stores one coding-agent trial's session, in whatever interchange format the harness produced (record it in `schema_version`, e.g. `ATIF-v1.7`). `steps` is stored verbatim and never validated, so a harness format change needs no gateway release. Separate from the run import because a trajectory averages ~92 KB and a whole run's worth would not fit in one request. Upserts, so re-sending after a timeout replaces the trajectory rather than failing. Sample indices are unique per (task, model), not per run, so pass `task_id` and/or `model` when the run covers more than one — an ambiguous index returns 400 rather than writing to the wrong trial. Rejects a payload whose `steps` and `logs` together exceed 16 MiB with 413.
|
|
22
|
+
*/
|
|
23
|
+
export declare function useLlmEvalsUploadSampleTrajectoryMutation(options?: MutationHookOptions<LlmEvalsUploadSampleTrajectoryMutationData, LlmEvalsUploadSampleTrajectoryMutationError, LlmEvalsUploadSampleTrajectoryMutationVariables>): UseMutationResult<LlmEvalsUploadSampleTrajectoryMutationData, LlmEvalsUploadSampleTrajectoryMutationError, LlmEvalsUploadSampleTrajectoryMutationVariables>;
|
|
24
|
+
export declare function mutationKeyLlmEvalsUploadSampleTrajectory(): MutationKey;
|
|
25
|
+
export declare function buildLlmEvalsUploadSampleTrajectoryMutation(client$: SDKCore, hookOptions?: RequestOptions): {
|
|
26
|
+
mutationKey: MutationKey;
|
|
27
|
+
mutationFn: (variables: LlmEvalsUploadSampleTrajectoryMutationVariables) => Promise<LlmEvalsUploadSampleTrajectoryMutationData>;
|
|
28
|
+
};
|
|
29
|
+
//# sourceMappingURL=llmEvalsUploadSampleTrajectory.d.ts.map
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"llmEvalsUploadSampleTrajectory.d.ts","sourceRoot":"","sources":["../../../src/react-query/llmEvalsUploadSampleTrajectory.ts"],"names":[],"mappings":"AAIA,OAAO,EACL,WAAW,EAEX,iBAAiB,EAClB,MAAM,uBAAuB,CAAC;AAC/B,OAAO,EAAE,OAAO,EAAE,MAAM,YAAY,CAAC;AAGrC,OAAO,EAAE,cAAc,EAAE,MAAM,gBAAgB,CAAC;AAChD,OAAO,KAAK,UAAU,MAAM,+BAA+B,CAAC;AAC5D,OAAO,EACL,eAAe,EACf,mBAAmB,EACnB,mBAAmB,EACnB,mBAAmB,EACnB,qBAAqB,EACtB,MAAM,sCAAsC,CAAC;AAC9C,OAAO,EAAE,uBAAuB,EAAE,MAAM,6CAA6C,CAAC;AACtF,OAAO,EAAE,QAAQ,EAAE,MAAM,8BAA8B,CAAC;AACxD,OAAO,EAAE,kBAAkB,EAAE,MAAM,wCAAwC,CAAC;AAC5E,OAAO,KAAK,UAAU,MAAM,+BAA+B,CAAC;AAG5D,OAAO,EAAE,mBAAmB,EAAE,MAAM,aAAa,CAAC;AAElD,MAAM,MAAM,+CAA+C,GAAG;IAC5D,OAAO,EAAE,UAAU,CAAC,iCAAiC,CAAC;IACtD,OAAO,CAAC,EAAE,cAAc,CAAC;CAC1B,CAAC;AAEF,MAAM,MAAM,0CAA0C,GACpD,UAAU,CAAC,kCAAkC,CAAC;AAEhD,MAAM,MAAM,2CAA2C,GACnD,QAAQ,GACR,uBAAuB,GACvB,eAAe,GACf,mBAAmB,GACnB,mBAAmB,GACnB,mBAAmB,GACnB,qBAAqB,GACrB,kBAAkB,CAAC;AAEvB;;;;;GAKG;AACH,wBAAgB,yCAAyC,CACvD,OAAO,CAAC,EAAE,mBAAmB,CAC3B,0CAA0C,EAC1C,2CAA2C,EAC3C,+CAA+C,CAChD,GACA,iBAAiB,CAClB,0CAA0C,EAC1C,2CAA2C,EAC3C,+CAA+C,CAChD,CAMA;AAED,wBAAgB,yCAAyC,IAAI,WAAW,CAEvE;AAED,wBAAgB,2CAA2C,CACzD,OAAO,EAAE,OAAO,EAChB,WAAW,CAAC,EAAE,cAAc,GAC3B;IACD,WAAW,EAAE,WAAW,CAAC;IACzB,UAAU,EAAE,CACV,SAAS,EAAE,+CAA+C,KACvD,OAAO,CAAC,0CAA0C,CAAC,CAAC;CAC1D,CA0BA"}
|
|
@@ -0,0 +1,42 @@
|
|
|
1
|
+
/*
|
|
2
|
+
* Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
|
|
3
|
+
*/
|
|
4
|
+
import { useMutation, } from "@tanstack/react-query";
|
|
5
|
+
import { llmEvalsUploadSampleTrajectory } from "../funcs/llmEvalsUploadSampleTrajectory.js";
|
|
6
|
+
import { combineSignals } from "../lib/primitives.js";
|
|
7
|
+
import { unwrapAsync } from "../types/fp.js";
|
|
8
|
+
import { useSDKContext } from "./_context.js";
|
|
9
|
+
/**
|
|
10
|
+
* Upload an eval sample trajectory
|
|
11
|
+
*
|
|
12
|
+
* @remarks
|
|
13
|
+
* Stores one coding-agent trial's session, in whatever interchange format the harness produced (record it in `schema_version`, e.g. `ATIF-v1.7`). `steps` is stored verbatim and never validated, so a harness format change needs no gateway release. Separate from the run import because a trajectory averages ~92 KB and a whole run's worth would not fit in one request. Upserts, so re-sending after a timeout replaces the trajectory rather than failing. Sample indices are unique per (task, model), not per run, so pass `task_id` and/or `model` when the run covers more than one — an ambiguous index returns 400 rather than writing to the wrong trial. Rejects a payload whose `steps` and `logs` together exceed 16 MiB with 413.
|
|
14
|
+
*/
|
|
15
|
+
export function useLlmEvalsUploadSampleTrajectoryMutation(options) {
|
|
16
|
+
const client = useSDKContext();
|
|
17
|
+
return useMutation({
|
|
18
|
+
...buildLlmEvalsUploadSampleTrajectoryMutation(client, options),
|
|
19
|
+
...options,
|
|
20
|
+
});
|
|
21
|
+
}
|
|
22
|
+
export function mutationKeyLlmEvalsUploadSampleTrajectory() {
|
|
23
|
+
return ["@meetkai/mka1", "evals", "uploadSampleTrajectory"];
|
|
24
|
+
}
|
|
25
|
+
export function buildLlmEvalsUploadSampleTrajectoryMutation(client$, hookOptions) {
|
|
26
|
+
return {
|
|
27
|
+
mutationKey: mutationKeyLlmEvalsUploadSampleTrajectory(),
|
|
28
|
+
mutationFn: function llmEvalsUploadSampleTrajectoryMutationFn({ request, options, }) {
|
|
29
|
+
const mergedOptions = {
|
|
30
|
+
...hookOptions,
|
|
31
|
+
...options,
|
|
32
|
+
fetchOptions: {
|
|
33
|
+
...hookOptions?.fetchOptions,
|
|
34
|
+
...options?.fetchOptions,
|
|
35
|
+
signal: combineSignals(hookOptions?.fetchOptions?.signal, options?.fetchOptions?.signal),
|
|
36
|
+
},
|
|
37
|
+
};
|
|
38
|
+
return unwrapAsync(llmEvalsUploadSampleTrajectory(client$, request, mergedOptions));
|
|
39
|
+
},
|
|
40
|
+
};
|
|
41
|
+
}
|
|
42
|
+
//# sourceMappingURL=llmEvalsUploadSampleTrajectory.js.map
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"llmEvalsUploadSampleTrajectory.js","sourceRoot":"","sources":["../../../src/react-query/llmEvalsUploadSampleTrajectory.ts"],"names":[],"mappings":"AAAA;;GAEG;AAEH,OAAO,EAEL,WAAW,GAEZ,MAAM,uBAAuB,CAAC;AAE/B,OAAO,EAAE,8BAA8B,EAAE,MAAM,4CAA4C,CAAC;AAC5F,OAAO,EAAE,cAAc,EAAE,MAAM,sBAAsB,CAAC;AActD,OAAO,EAAE,WAAW,EAAE,MAAM,gBAAgB,CAAC;AAC7C,OAAO,EAAE,aAAa,EAAE,MAAM,eAAe,CAAC;AAqB9C;;;;;GAKG;AACH,MAAM,UAAU,yCAAyC,CACvD,OAIC;IAMD,MAAM,MAAM,GAAG,aAAa,EAAE,CAAC;IAC/B,OAAO,WAAW,CAAC;QACjB,GAAG,2CAA2C,CAAC,MAAM,EAAE,OAAO,CAAC;QAC/D,GAAG,OAAO;KACX,CAAC,CAAC;AACL,CAAC;AAED,MAAM,UAAU,yCAAyC;IACvD,OAAO,CAAC,eAAe,EAAE,OAAO,EAAE,wBAAwB,CAAC,CAAC;AAC9D,CAAC;AAED,MAAM,UAAU,2CAA2C,CACzD,OAAgB,EAChB,WAA4B;IAO5B,OAAO;QACL,WAAW,EAAE,yCAAyC,EAAE;QACxD,UAAU,EAAE,SAAS,wCAAwC,CAAC,EAC5D,OAAO,EACP,OAAO,GACR;YACC,MAAM,aAAa,GAAG;gBACpB,GAAG,WAAW;gBACd,GAAG,OAAO;gBACV,YAAY,EAAE;oBACZ,GAAG,WAAW,EAAE,YAAY;oBAC5B,GAAG,OAAO,EAAE,YAAY;oBACxB,MAAM,EAAE,cAAc,CACpB,WAAW,EAAE,YAAY,EAAE,MAAM,EACjC,OAAO,EAAE,YAAY,EAAE,MAAM,CAC9B;iBACF;aACF,CAAC;YACF,OAAO,WAAW,CAAC,8BAA8B,CAC/C,OAAO,EACP,OAAO,EACP,aAAa,CACd,CAAC,CAAC;QACL,CAAC;KACF,CAAC;AACJ,CAAC"}
|
package/dist/esm/sdk/evals.d.ts
CHANGED
|
@@ -58,6 +58,13 @@ export declare class Evals extends ClientSDK {
|
|
|
58
58
|
* Returns each ranking group's most recent completed runs for a suite in one request, with the group assignments in `groups`. A group is (model, targeted task) for task_ids-restricted runs and (model) for unrestricted runs (task_id null). Build boards from `groups`, not from run.models/run.task_ids — a returned run may name models or tasks whose groups it did not rank in. `truncated: true` means a server ceiling trimmed the aggregate; whole runs are kept in (best rank, first model, first task, id) order, so every group's newest runs survive before any group's fallbacks and no group is dropped for being old. Resume a truncated board by passing `next_cursor` back as `cursor` and unioning the responses. See the evals docs for grouping rationale and cost characteristics.
|
|
59
59
|
*/
|
|
60
60
|
listSuiteLeaderboardRuns(request: operations.ListEvalSuiteLeaderboardRunsRequest, options?: RequestOptions): Promise<operations.ListEvalSuiteLeaderboardRunsResponseBody>;
|
|
61
|
+
/**
|
|
62
|
+
* Get the coding-agent leaderboard for an eval suite
|
|
63
|
+
*
|
|
64
|
+
* @remarks
|
|
65
|
+
* Ranks the suite's completed coding-agent runs, one row per (agent, model, effort). Only runs that recorded an `agent_name` participate — a QA or transcription run of the same suite has no agent to attribute a score to and is not a board row. `accuracy` is the mean of `metric` (default `reward`) over the row's scored trials, and `accuracy_ci` is the 95% Wald interval around it; both are derived per request rather than stored, so rerunning a failed trial moves them instead of leaving a stale copy behind. `agent_version` is reported but is not part of the row identity, so an agent upgrade does not split a row in two. Rows are ordered by accuracy descending, nulls last. Pass `suite_version` when the suite has more than one, otherwise the board mixes task sets.
|
|
66
|
+
*/
|
|
67
|
+
getSuiteLeaderboard(request: operations.GetEvalSuiteLeaderboardRequest, options?: RequestOptions): Promise<components.EvalSuiteLeaderboard>;
|
|
61
68
|
/**
|
|
62
69
|
* Create an eval run
|
|
63
70
|
*
|
|
@@ -107,6 +114,13 @@ export declare class Evals extends ClientSDK {
|
|
|
107
114
|
* Queues a failed or cancelled eval run to retry in place. Completed samples keep their results, generated-but-unscored cancelled samples resume at scoring, unfinished samples are requeued, and runs with no persisted samples are prepared from scratch with the same run ID.
|
|
108
115
|
*/
|
|
109
116
|
retryFailedRun(request: operations.RetryFailedEvalRunRequest, options?: RequestOptions): Promise<operations.RetryFailedEvalRunResponseBody>;
|
|
117
|
+
/**
|
|
118
|
+
* Get an eval run overview
|
|
119
|
+
*
|
|
120
|
+
* @remarks
|
|
121
|
+
* Aggregate header for one run's trials view: trial counts, average reward, cost, and the input/output/cached token split. Its own route rather than fields on the run object because it scans the run's samples — folding it into `GET /evals/runs/{run_id}` would charge that scan to every run list and to the status polling that runs for the whole length of an eval. `trials.errored` overlaps `trials.failed` instead of partitioning it: a coding-agent trial can carry an agent timeout in `error` and still be completed and scored. `trials.retried` counts trials rerun through rerun-failed, read from the pre-rerun snapshot, since a rerun overwrites the sample in place.
|
|
122
|
+
*/
|
|
123
|
+
getRunOverview(request: operations.GetEvalRunOverviewRequest, options?: RequestOptions): Promise<components.EvalRunOverview>;
|
|
110
124
|
/**
|
|
111
125
|
* List eval samples
|
|
112
126
|
*
|
|
@@ -121,6 +135,20 @@ export declare class Evals extends ClientSDK {
|
|
|
121
135
|
* Returns `{ object, audio, sample_index, task_id, model }` for a single transcription sample — the clip reference (a base64 `data:` URI or a URL) read from the un-redacted `dataset_row` (list responses redact inline `data:` blobs), plus the resolved task/model. Prefers the task's configured `audio_column`, falling back to a heuristic scan. The clip differs across tasks, so pass `task_id` when a run has more than one transcription task; if the index spans multiple tasks and `task_id` is omitted, returns 400 rather than guessing. `model` is optional (the clip is identical across models) and only extends the index prefix. Returns 404 when the sample or its audio is absent, 413 when the inline clip is too large. Returns 503 when object storage is briefly unreachable, as distinct from 404 for a clip that is genuinely gone.
|
|
122
136
|
*/
|
|
123
137
|
getSampleAudio(request: operations.GetEvalSampleAudioRequest, options?: RequestOptions): Promise<components.EvalSampleAudioObject>;
|
|
138
|
+
/**
|
|
139
|
+
* Get an eval sample trajectory
|
|
140
|
+
*
|
|
141
|
+
* @remarks
|
|
142
|
+
* Returns one coding-agent trial's session — the steps the agent took, verbatim in the harness's interchange format (see `schema_version`, e.g. `ATIF-v1.7`). Deliberately not part of the samples list: a trajectory averages ~92 KB and that list pages up to 500 rows. Sample indices are unique per (task, model), not per run, so pass `task_id` and/or `model` when the run covers more than one; an index that matches several trials returns 400 rather than guessing, and never falls back to another trial's session. Returns 404 when the sample does not exist or recorded no trajectory.
|
|
143
|
+
*/
|
|
144
|
+
getSampleTrajectory(request: operations.GetEvalSampleTrajectoryRequest, options?: RequestOptions): Promise<operations.GetEvalSampleTrajectoryResponseBody>;
|
|
145
|
+
/**
|
|
146
|
+
* Upload an eval sample trajectory
|
|
147
|
+
*
|
|
148
|
+
* @remarks
|
|
149
|
+
* Stores one coding-agent trial's session, in whatever interchange format the harness produced (record it in `schema_version`, e.g. `ATIF-v1.7`). `steps` is stored verbatim and never validated, so a harness format change needs no gateway release. Separate from the run import because a trajectory averages ~92 KB and a whole run's worth would not fit in one request. Upserts, so re-sending after a timeout replaces the trajectory rather than failing. Sample indices are unique per (task, model), not per run, so pass `task_id` and/or `model` when the run covers more than one — an ambiguous index returns 400 rather than writing to the wrong trial. Rejects a payload whose `steps` and `logs` together exceed 16 MiB with 413.
|
|
150
|
+
*/
|
|
151
|
+
uploadSampleTrajectory(request: operations.UploadEvalSampleTrajectoryRequest, options?: RequestOptions): Promise<components.EvalSampleTrajectoryUploadedObject>;
|
|
124
152
|
/**
|
|
125
153
|
* Get eval run artifacts
|
|
126
154
|
*
|
|
@@ -128,6 +156,20 @@ export declare class Evals extends ClientSDK {
|
|
|
128
156
|
* Returns generated result and sample artifact file IDs for a completed eval run.
|
|
129
157
|
*/
|
|
130
158
|
getArtifacts(request: operations.GetEvalArtifactsRequest, options?: RequestOptions): Promise<components.EvalArtifactsObject>;
|
|
159
|
+
/**
|
|
160
|
+
* Import a finished coding-agent run
|
|
161
|
+
*
|
|
162
|
+
* @remarks
|
|
163
|
+
* Uploads one completed harness job — the run and its trials — directly, so results never round-trip through external storage the way the Hugging Face importer does. Every `task_id` must already exist in the target suite version's manifest; unknown ids are rejected rather than invented, because a typo would otherwise import as a task the suite does not have and read as a model that never covered the version. The run is recorded as `completed` and is not executed: this is a write, not a run request, so no workflow is started. Trials that cover every task of the version get `task_ids: null`, which is what lets the run rank as a complete sweep. Trajectories are NOT part of this payload — a full 91-task run measured 8.3 MB of them — so upload each one against `PUT /evals/runs/{run_id}/samples/{sample_index}/trajectory` afterwards. Pass `idempotency_key` and a retried upload returns the first run instead of doubling the trials behind a board row.
|
|
164
|
+
*/
|
|
165
|
+
importAgentRun(request: operations.ImportAgentEvalRunRequest, options?: RequestOptions): Promise<operations.ImportAgentEvalRunResponseBody>;
|
|
166
|
+
/**
|
|
167
|
+
* Append trials to an open coding-agent run
|
|
168
|
+
*
|
|
169
|
+
* @remarks
|
|
170
|
+
* Adds finished trials to a run opened with `finalize: false`, so a job started from MKA1 can be watched while it runs instead of appearing complete out of nowhere at the end. Each trial pins its own `sample_index` and upserts on (task, model, sample_index): a harness cannot tell a timeout from a lost response, so re-sending a batch is safe and replaces rather than duplicates. The whole batch and its aggregate recompute land in one transaction, serialized per run. Counts, metrics and cost are recomputed from the stored rows on every call, never accumulated from the request, so a replayed batch cannot double them. Send `finalize: true` (usually with an empty `trials`) to close the run — until then it stays `in_progress` and off the leaderboards, which only count completed runs. Appending to an already-completed or cancelled run is rejected: that record is finished, and rewriting it would silently move a number someone may have already read.
|
|
171
|
+
*/
|
|
172
|
+
appendAgentTrials(request: operations.AppendAgentEvalTrialsRequest, options?: RequestOptions): Promise<operations.AppendAgentEvalTrialsResponseBody>;
|
|
131
173
|
/**
|
|
132
174
|
* Import historical eval results from Hugging Face
|
|
133
175
|
*
|
|
@@ -1 +1 @@
|
|
|
1
|
-
{"version":3,"file":"evals.d.ts","sourceRoot":"","sources":["../../../src/sdk/evals.ts"],"names":[],"mappings":"
|
|
1
|
+
{"version":3,"file":"evals.d.ts","sourceRoot":"","sources":["../../../src/sdk/evals.ts"],"names":[],"mappings":"AAoCA,OAAO,EAAE,SAAS,EAAE,cAAc,EAAE,MAAM,gBAAgB,CAAC;AAC3D,OAAO,KAAK,UAAU,MAAM,+BAA+B,CAAC;AAC5D,OAAO,KAAK,UAAU,MAAM,+BAA+B,CAAC;AAG5D,qBAAa,KAAM,SAAQ,SAAS;IAClC;;;;;OAKG;IACG,WAAW,CACf,OAAO,EAAE,UAAU,CAAC,sBAAsB,EAC1C,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,eAAe,CAAC;IAQtC;;;;;OAKG;IACG,UAAU,CACd,OAAO,EAAE,UAAU,CAAC,qBAAqB,EACzC,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,aAAa,CAAC;IAQpC;;;;;OAKG;IACG,QAAQ,CACZ,OAAO,EAAE,UAAU,CAAC,mBAAmB,EACvC,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,eAAe,CAAC;IAQtC;;;;;OAKG;IACG,WAAW,CACf,OAAO,EAAE,UAAU,CAAC,sBAAsB,EAC1C,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,sBAAsB,CAAC;IAQ7C;;;;;OAKG;IACG,kBAAkB,CACtB,OAAO,EAAE,UAAU,CAAC,6BAA6B,EACjD,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,kCAAkC,CAAC;IAQzD;;;;;OAKG;IACG,iBAAiB,CACrB,OAAO,EAAE,UAAU,CAAC,4BAA4B,EAChD,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,iCAAiC,CAAC;IAQxD;;;;;OAKG;IACG,eAAe,CACnB,OAAO,EAAE,UAAU,CAAC,0BAA0B,EAC9C,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,+BAA+B,CAAC;IAQtD;;;;;OAKG;IACG,wBAAwB,CAC5B,OAAO,EAAE,UAAU,CAAC,mCAAmC,EACvD,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,wCAAwC,CAAC;IAQ/D;;;;;OAKG;IACG,mBAAmB,CACvB,OAAO,EAAE,UAAU,CAAC,8BAA8B,EAClD,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,oBAAoB,CAAC;IAQ3C;;;;;OAKG;IACG,SAAS,CACb,OAAO,EAAE,UAAU,CAAC,oBAAoB,EACxC,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,yBAAyB,CAAC;IAQhD;;;;;OAKG;IACG,QAAQ,CACZ,OAAO,EAAE,UAAU,CAAC,mBAAmB,EACvC,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,wBAAwB,CAAC;IAQ/C;;;;;OAKG;IACG,MAAM,CACV,OAAO,EAAE,UAAU,CAAC,iBAAiB,EACrC,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,sBAAsB,CAAC;IAQ7C;;;;;OAKG;IACG,SAAS,CACb,OAAO,EAAE,UAAU,CAAC,oBAAoB,EACxC,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,oBAAoB,CAAC;IAQ3C;;;;;OAKG;IACG,SAAS,CACb,OAAO,EAAE,UAAU,CAAC,oBAAoB,EACxC,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,yBAAyB,CAAC;IAQhD;;;;;OAKG;IACG,kBAAkB,CACtB,OAAO,EAAE,UAAU,CAAC,6BAA6B,EACjD,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,kCAAkC,CAAC;IAQzD;;;;;OAKG;IACG,cAAc,CAClB,OAAO,EAAE,UAAU,CAAC,yBAAyB,EAC7C,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,8BAA8B,CAAC;IAQrD;;;;;OAKG;IACG,cAAc,CAClB,OAAO,EAAE,UAAU,CAAC,yBAAyB,EAC7C,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,eAAe,CAAC;IAQtC;;;;;OAKG;IACG,WAAW,CACf,OAAO,EAAE,UAAU,CAAC,sBAAsB,EAC1C,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,cAAc,CAAC;IAQrC;;;;;OAKG;IACG,cAAc,CAClB,OAAO,EAAE,UAAU,CAAC,yBAAyB,EAC7C,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,qBAAqB,CAAC;IAQ5C;;;;;OAKG;IACG,mBAAmB,CACvB,OAAO,EAAE,UAAU,CAAC,8BAA8B,EAClD,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,mCAAmC,CAAC;IAQ1D;;;;;OAKG;IACG,sBAAsB,CAC1B,OAAO,EAAE,UAAU,CAAC,iCAAiC,EACrD,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,kCAAkC,CAAC;IAQzD;;;;;OAKG;IACG,YAAY,CAChB,OAAO,EAAE,UAAU,CAAC,uBAAuB,EAC3C,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,mBAAmB,CAAC;IAQ1C;;;;;OAKG;IACG,cAAc,CAClB,OAAO,EAAE,UAAU,CAAC,yBAAyB,EAC7C,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,8BAA8B,CAAC;IAQrD;;;;;OAKG;IACG,iBAAiB,CACrB,OAAO,EAAE,UAAU,CAAC,4BAA4B,EAChD,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,iCAAiC,CAAC;IAQxD;;;;;OAKG;IACG,uBAAuB,CAC3B,OAAO,EAAE,UAAU,CAAC,kCAAkC,EACtD,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,0BAA0B,CAAC;IAQjD;;;;;OAKG;IACG,cAAc,CAClB,OAAO,EAAE,UAAU,CAAC,yBAAyB,EAC7C,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,8BAA8B,CAAC;IAQrD;;;;;OAKG;IACG,aAAa,CACjB,OAAO,EAAE,UAAU,CAAC,wBAAwB,EAC5C,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,6BAA6B,CAAC;IAQpD;;;;;OAKG;IACG,WAAW,CACf,OAAO,EAAE,UAAU,CAAC,sBAAsB,EAC1C,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,2BAA2B,CAAC;IAQlD;;;;;OAKG;IACG,cAAc,CAClB,OAAO,EAAE,UAAU,CAAC,yBAAyB,EAC7C,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,8BAA8B,CAAC;IAQrD;;;;;OAKG;IACG,cAAc,CAClB,OAAO,EAAE,UAAU,CAAC,yBAAyB,EAC7C,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,yBAAyB,CAAC;IAQhD;;;;;OAKG;IACG,eAAe,CACnB,OAAO,EAAE,UAAU,CAAC,0BAA0B,EAC9C,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,+BAA+B,CAAC;IAQtD;;;;;OAKG;IACG,gBAAgB,CACpB,OAAO,EAAE,UAAU,CAAC,2BAA2B,EAC/C,OAAO,CAAC,EAAE,cAAc,GACvB,OAAO,CAAC,UAAU,CAAC,gCAAgC,CAAC;CAOxD"}
|
package/dist/esm/sdk/evals.js
CHANGED
|
@@ -1,6 +1,7 @@
|
|
|
1
1
|
/*
|
|
2
2
|
* Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
|
|
3
3
|
*/
|
|
4
|
+
import { llmEvalsAppendAgentTrials } from "../funcs/llmEvalsAppendAgentTrials.js";
|
|
4
5
|
import { llmEvalsCancelRun } from "../funcs/llmEvalsCancelRun.js";
|
|
5
6
|
import { llmEvalsCreateRun } from "../funcs/llmEvalsCreateRun.js";
|
|
6
7
|
import { llmEvalsCreateSchedule } from "../funcs/llmEvalsCreateSchedule.js";
|
|
@@ -11,10 +12,14 @@ import { llmEvalsDeleteSchedule } from "../funcs/llmEvalsDeleteSchedule.js";
|
|
|
11
12
|
import { llmEvalsDeleteSuite } from "../funcs/llmEvalsDeleteSuite.js";
|
|
12
13
|
import { llmEvalsGetArtifacts } from "../funcs/llmEvalsGetArtifacts.js";
|
|
13
14
|
import { llmEvalsGetRun } from "../funcs/llmEvalsGetRun.js";
|
|
15
|
+
import { llmEvalsGetRunOverview } from "../funcs/llmEvalsGetRunOverview.js";
|
|
14
16
|
import { llmEvalsGetSampleAudio } from "../funcs/llmEvalsGetSampleAudio.js";
|
|
17
|
+
import { llmEvalsGetSampleTrajectory } from "../funcs/llmEvalsGetSampleTrajectory.js";
|
|
15
18
|
import { llmEvalsGetSchedule } from "../funcs/llmEvalsGetSchedule.js";
|
|
16
19
|
import { llmEvalsGetSuite } from "../funcs/llmEvalsGetSuite.js";
|
|
20
|
+
import { llmEvalsGetSuiteLeaderboard } from "../funcs/llmEvalsGetSuiteLeaderboard.js";
|
|
17
21
|
import { llmEvalsGetSuiteVersion } from "../funcs/llmEvalsGetSuiteVersion.js";
|
|
22
|
+
import { llmEvalsImportAgentRun } from "../funcs/llmEvalsImportAgentRun.js";
|
|
18
23
|
import { llmEvalsImportHistoricalResults } from "../funcs/llmEvalsImportHistoricalResults.js";
|
|
19
24
|
import { llmEvalsListRuns } from "../funcs/llmEvalsListRuns.js";
|
|
20
25
|
import { llmEvalsListSamples } from "../funcs/llmEvalsListSamples.js";
|
|
@@ -27,6 +32,7 @@ import { llmEvalsRerunFailedSamples } from "../funcs/llmEvalsRerunFailedSamples.
|
|
|
27
32
|
import { llmEvalsRetryFailedRun } from "../funcs/llmEvalsRetryFailedRun.js";
|
|
28
33
|
import { llmEvalsTriggerSchedule } from "../funcs/llmEvalsTriggerSchedule.js";
|
|
29
34
|
import { llmEvalsUpdateSchedule } from "../funcs/llmEvalsUpdateSchedule.js";
|
|
35
|
+
import { llmEvalsUploadSampleTrajectory } from "../funcs/llmEvalsUploadSampleTrajectory.js";
|
|
30
36
|
import { ClientSDK } from "../lib/sdks.js";
|
|
31
37
|
import { unwrapAsync } from "../types/fp.js";
|
|
32
38
|
export class Evals extends ClientSDK {
|
|
@@ -102,6 +108,15 @@ export class Evals extends ClientSDK {
|
|
|
102
108
|
async listSuiteLeaderboardRuns(request, options) {
|
|
103
109
|
return unwrapAsync(llmEvalsListSuiteLeaderboardRuns(this, request, options));
|
|
104
110
|
}
|
|
111
|
+
/**
|
|
112
|
+
* Get the coding-agent leaderboard for an eval suite
|
|
113
|
+
*
|
|
114
|
+
* @remarks
|
|
115
|
+
* Ranks the suite's completed coding-agent runs, one row per (agent, model, effort). Only runs that recorded an `agent_name` participate — a QA or transcription run of the same suite has no agent to attribute a score to and is not a board row. `accuracy` is the mean of `metric` (default `reward`) over the row's scored trials, and `accuracy_ci` is the 95% Wald interval around it; both are derived per request rather than stored, so rerunning a failed trial moves them instead of leaving a stale copy behind. `agent_version` is reported but is not part of the row identity, so an agent upgrade does not split a row in two. Rows are ordered by accuracy descending, nulls last. Pass `suite_version` when the suite has more than one, otherwise the board mixes task sets.
|
|
116
|
+
*/
|
|
117
|
+
async getSuiteLeaderboard(request, options) {
|
|
118
|
+
return unwrapAsync(llmEvalsGetSuiteLeaderboard(this, request, options));
|
|
119
|
+
}
|
|
105
120
|
/**
|
|
106
121
|
* Create an eval run
|
|
107
122
|
*
|
|
@@ -165,6 +180,15 @@ export class Evals extends ClientSDK {
|
|
|
165
180
|
async retryFailedRun(request, options) {
|
|
166
181
|
return unwrapAsync(llmEvalsRetryFailedRun(this, request, options));
|
|
167
182
|
}
|
|
183
|
+
/**
|
|
184
|
+
* Get an eval run overview
|
|
185
|
+
*
|
|
186
|
+
* @remarks
|
|
187
|
+
* Aggregate header for one run's trials view: trial counts, average reward, cost, and the input/output/cached token split. Its own route rather than fields on the run object because it scans the run's samples — folding it into `GET /evals/runs/{run_id}` would charge that scan to every run list and to the status polling that runs for the whole length of an eval. `trials.errored` overlaps `trials.failed` instead of partitioning it: a coding-agent trial can carry an agent timeout in `error` and still be completed and scored. `trials.retried` counts trials rerun through rerun-failed, read from the pre-rerun snapshot, since a rerun overwrites the sample in place.
|
|
188
|
+
*/
|
|
189
|
+
async getRunOverview(request, options) {
|
|
190
|
+
return unwrapAsync(llmEvalsGetRunOverview(this, request, options));
|
|
191
|
+
}
|
|
168
192
|
/**
|
|
169
193
|
* List eval samples
|
|
170
194
|
*
|
|
@@ -183,6 +207,24 @@ export class Evals extends ClientSDK {
|
|
|
183
207
|
async getSampleAudio(request, options) {
|
|
184
208
|
return unwrapAsync(llmEvalsGetSampleAudio(this, request, options));
|
|
185
209
|
}
|
|
210
|
+
/**
|
|
211
|
+
* Get an eval sample trajectory
|
|
212
|
+
*
|
|
213
|
+
* @remarks
|
|
214
|
+
* Returns one coding-agent trial's session — the steps the agent took, verbatim in the harness's interchange format (see `schema_version`, e.g. `ATIF-v1.7`). Deliberately not part of the samples list: a trajectory averages ~92 KB and that list pages up to 500 rows. Sample indices are unique per (task, model), not per run, so pass `task_id` and/or `model` when the run covers more than one; an index that matches several trials returns 400 rather than guessing, and never falls back to another trial's session. Returns 404 when the sample does not exist or recorded no trajectory.
|
|
215
|
+
*/
|
|
216
|
+
async getSampleTrajectory(request, options) {
|
|
217
|
+
return unwrapAsync(llmEvalsGetSampleTrajectory(this, request, options));
|
|
218
|
+
}
|
|
219
|
+
/**
|
|
220
|
+
* Upload an eval sample trajectory
|
|
221
|
+
*
|
|
222
|
+
* @remarks
|
|
223
|
+
* Stores one coding-agent trial's session, in whatever interchange format the harness produced (record it in `schema_version`, e.g. `ATIF-v1.7`). `steps` is stored verbatim and never validated, so a harness format change needs no gateway release. Separate from the run import because a trajectory averages ~92 KB and a whole run's worth would not fit in one request. Upserts, so re-sending after a timeout replaces the trajectory rather than failing. Sample indices are unique per (task, model), not per run, so pass `task_id` and/or `model` when the run covers more than one — an ambiguous index returns 400 rather than writing to the wrong trial. Rejects a payload whose `steps` and `logs` together exceed 16 MiB with 413.
|
|
224
|
+
*/
|
|
225
|
+
async uploadSampleTrajectory(request, options) {
|
|
226
|
+
return unwrapAsync(llmEvalsUploadSampleTrajectory(this, request, options));
|
|
227
|
+
}
|
|
186
228
|
/**
|
|
187
229
|
* Get eval run artifacts
|
|
188
230
|
*
|
|
@@ -192,6 +234,24 @@ export class Evals extends ClientSDK {
|
|
|
192
234
|
async getArtifacts(request, options) {
|
|
193
235
|
return unwrapAsync(llmEvalsGetArtifacts(this, request, options));
|
|
194
236
|
}
|
|
237
|
+
/**
|
|
238
|
+
* Import a finished coding-agent run
|
|
239
|
+
*
|
|
240
|
+
* @remarks
|
|
241
|
+
* Uploads one completed harness job — the run and its trials — directly, so results never round-trip through external storage the way the Hugging Face importer does. Every `task_id` must already exist in the target suite version's manifest; unknown ids are rejected rather than invented, because a typo would otherwise import as a task the suite does not have and read as a model that never covered the version. The run is recorded as `completed` and is not executed: this is a write, not a run request, so no workflow is started. Trials that cover every task of the version get `task_ids: null`, which is what lets the run rank as a complete sweep. Trajectories are NOT part of this payload — a full 91-task run measured 8.3 MB of them — so upload each one against `PUT /evals/runs/{run_id}/samples/{sample_index}/trajectory` afterwards. Pass `idempotency_key` and a retried upload returns the first run instead of doubling the trials behind a board row.
|
|
242
|
+
*/
|
|
243
|
+
async importAgentRun(request, options) {
|
|
244
|
+
return unwrapAsync(llmEvalsImportAgentRun(this, request, options));
|
|
245
|
+
}
|
|
246
|
+
/**
|
|
247
|
+
* Append trials to an open coding-agent run
|
|
248
|
+
*
|
|
249
|
+
* @remarks
|
|
250
|
+
* Adds finished trials to a run opened with `finalize: false`, so a job started from MKA1 can be watched while it runs instead of appearing complete out of nowhere at the end. Each trial pins its own `sample_index` and upserts on (task, model, sample_index): a harness cannot tell a timeout from a lost response, so re-sending a batch is safe and replaces rather than duplicates. The whole batch and its aggregate recompute land in one transaction, serialized per run. Counts, metrics and cost are recomputed from the stored rows on every call, never accumulated from the request, so a replayed batch cannot double them. Send `finalize: true` (usually with an empty `trials`) to close the run — until then it stays `in_progress` and off the leaderboards, which only count completed runs. Appending to an already-completed or cancelled run is rejected: that record is finished, and rewriting it would silently move a number someone may have already read.
|
|
251
|
+
*/
|
|
252
|
+
async appendAgentTrials(request, options) {
|
|
253
|
+
return unwrapAsync(llmEvalsAppendAgentTrials(this, request, options));
|
|
254
|
+
}
|
|
195
255
|
/**
|
|
196
256
|
* Import historical eval results from Hugging Face
|
|
197
257
|
*
|
|
@@ -1 +1 @@
|
|
|
1
|
-
{"version":3,"file":"evals.js","sourceRoot":"","sources":["../../../src/sdk/evals.ts"],"names":[],"mappings":"AAAA;;GAEG;AAEH,OAAO,EAAE,iBAAiB,EAAE,MAAM,+BAA+B,CAAC;AAClE,OAAO,EAAE,iBAAiB,EAAE,MAAM,+BAA+B,CAAC;AAClE,OAAO,EAAE,sBAAsB,EAAE,MAAM,oCAAoC,CAAC;AAC5E,OAAO,EAAE,mBAAmB,EAAE,MAAM,iCAAiC,CAAC;AACtE,OAAO,EAAE,0BAA0B,EAAE,MAAM,wCAAwC,CAAC;AACpF,OAAO,EAAE,iBAAiB,EAAE,MAAM,+BAA+B,CAAC;AAClE,OAAO,EAAE,sBAAsB,EAAE,MAAM,oCAAoC,CAAC;AAC5E,OAAO,EAAE,mBAAmB,EAAE,MAAM,iCAAiC,CAAC;AACtE,OAAO,EAAE,oBAAoB,EAAE,MAAM,kCAAkC,CAAC;AACxE,OAAO,EAAE,cAAc,EAAE,MAAM,4BAA4B,CAAC;AAC5D,OAAO,EAAE,sBAAsB,EAAE,MAAM,oCAAoC,CAAC;AAC5E,OAAO,EAAE,mBAAmB,EAAE,MAAM,iCAAiC,CAAC;AACtE,OAAO,EAAE,gBAAgB,EAAE,MAAM,8BAA8B,CAAC;AAChE,OAAO,EAAE,uBAAuB,EAAE,MAAM,qCAAqC,CAAC;AAC9E,OAAO,EAAE,+BAA+B,EAAE,MAAM,6CAA6C,CAAC;AAC9F,OAAO,EAAE,gBAAgB,EAAE,MAAM,8BAA8B,CAAC;AAChE,OAAO,EAAE,mBAAmB,EAAE,MAAM,iCAAiC,CAAC;AACtE,OAAO,EAAE,wBAAwB,EAAE,MAAM,sCAAsC,CAAC;AAChF,OAAO,EAAE,qBAAqB,EAAE,MAAM,mCAAmC,CAAC;AAC1E,OAAO,EAAE,gCAAgC,EAAE,MAAM,8CAA8C,CAAC;AAChG,OAAO,EAAE,kBAAkB,EAAE,MAAM,gCAAgC,CAAC;AACpE,OAAO,EAAE,yBAAyB,EAAE,MAAM,uCAAuC,CAAC;AAClF,OAAO,EAAE,0BAA0B,EAAE,MAAM,wCAAwC,CAAC;AACpF,OAAO,EAAE,sBAAsB,EAAE,MAAM,oCAAoC,CAAC;AAC5E,OAAO,EAAE,uBAAuB,EAAE,MAAM,qCAAqC,CAAC;AAC9E,OAAO,EAAE,sBAAsB,EAAE,MAAM,oCAAoC,CAAC;AAC5E,OAAO,EAAE,SAAS,EAAkB,MAAM,gBAAgB,CAAC;AAG3D,OAAO,EAAE,WAAW,EAAE,MAAM,gBAAgB,CAAC;AAE7C,MAAM,OAAO,KAAM,SAAQ,SAAS;IAClC;;;;;OAKG;IACH,KAAK,CAAC,WAAW,CACf,OAA0C,EAC1C,OAAwB;QAExB,OAAO,WAAW,CAAC,mBAAmB,CACpC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,UAAU,CACd,OAAyC,EACzC,OAAwB;QAExB,OAAO,WAAW,CAAC,kBAAkB,CACnC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,QAAQ,CACZ,OAAuC,EACvC,OAAwB;QAExB,OAAO,WAAW,CAAC,gBAAgB,CACjC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,WAAW,CACf,OAA0C,EAC1C,OAAwB;QAExB,OAAO,WAAW,CAAC,mBAAmB,CACpC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,kBAAkB,CACtB,OAAiD,EACjD,OAAwB;QAExB,OAAO,WAAW,CAAC,0BAA0B,CAC3C,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,iBAAiB,CACrB,OAAgD,EAChD,OAAwB;QAExB,OAAO,WAAW,CAAC,yBAAyB,CAC1C,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,eAAe,CACnB,OAA8C,EAC9C,OAAwB;QAExB,OAAO,WAAW,CAAC,uBAAuB,CACxC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,wBAAwB,CAC5B,OAAuD,EACvD,OAAwB;QAExB,OAAO,WAAW,CAAC,gCAAgC,CACjD,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,SAAS,CACb,OAAwC,EACxC,OAAwB;QAExB,OAAO,WAAW,CAAC,iBAAiB,CAClC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,QAAQ,CACZ,OAAuC,EACvC,OAAwB;QAExB,OAAO,WAAW,CAAC,gBAAgB,CACjC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,MAAM,CACV,OAAqC,EACrC,OAAwB;QAExB,OAAO,WAAW,CAAC,cAAc,CAC/B,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,SAAS,CACb,OAAwC,EACxC,OAAwB;QAExB,OAAO,WAAW,CAAC,iBAAiB,CAClC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,SAAS,CACb,OAAwC,EACxC,OAAwB;QAExB,OAAO,WAAW,CAAC,iBAAiB,CAClC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,kBAAkB,CACtB,OAAiD,EACjD,OAAwB;QAExB,OAAO,WAAW,CAAC,0BAA0B,CAC3C,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,cAAc,CAClB,OAA6C,EAC7C,OAAwB;QAExB,OAAO,WAAW,CAAC,sBAAsB,CACvC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,WAAW,CACf,OAA0C,EAC1C,OAAwB;QAExB,OAAO,WAAW,CAAC,mBAAmB,CACpC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,cAAc,CAClB,OAA6C,EAC7C,OAAwB;QAExB,OAAO,WAAW,CAAC,sBAAsB,CACvC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,YAAY,CAChB,OAA2C,EAC3C,OAAwB;QAExB,OAAO,WAAW,CAAC,oBAAoB,CACrC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,uBAAuB,CAC3B,OAAsD,EACtD,OAAwB;QAExB,OAAO,WAAW,CAAC,+BAA+B,CAChD,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,cAAc,CAClB,OAA6C,EAC7C,OAAwB;QAExB,OAAO,WAAW,CAAC,sBAAsB,CACvC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,aAAa,CACjB,OAA4C,EAC5C,OAAwB;QAExB,OAAO,WAAW,CAAC,qBAAqB,CACtC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,WAAW,CACf,OAA0C,EAC1C,OAAwB;QAExB,OAAO,WAAW,CAAC,mBAAmB,CACpC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,cAAc,CAClB,OAA6C,EAC7C,OAAwB;QAExB,OAAO,WAAW,CAAC,sBAAsB,CACvC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,cAAc,CAClB,OAA6C,EAC7C,OAAwB;QAExB,OAAO,WAAW,CAAC,sBAAsB,CACvC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,eAAe,CACnB,OAA8C,EAC9C,OAAwB;QAExB,OAAO,WAAW,CAAC,uBAAuB,CACxC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,gBAAgB,CACpB,OAA+C,EAC/C,OAAwB;QAExB,OAAO,WAAW,CAAC,wBAAwB,CACzC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;CACF"}
|
|
1
|
+
{"version":3,"file":"evals.js","sourceRoot":"","sources":["../../../src/sdk/evals.ts"],"names":[],"mappings":"AAAA;;GAEG;AAEH,OAAO,EAAE,yBAAyB,EAAE,MAAM,uCAAuC,CAAC;AAClF,OAAO,EAAE,iBAAiB,EAAE,MAAM,+BAA+B,CAAC;AAClE,OAAO,EAAE,iBAAiB,EAAE,MAAM,+BAA+B,CAAC;AAClE,OAAO,EAAE,sBAAsB,EAAE,MAAM,oCAAoC,CAAC;AAC5E,OAAO,EAAE,mBAAmB,EAAE,MAAM,iCAAiC,CAAC;AACtE,OAAO,EAAE,0BAA0B,EAAE,MAAM,wCAAwC,CAAC;AACpF,OAAO,EAAE,iBAAiB,EAAE,MAAM,+BAA+B,CAAC;AAClE,OAAO,EAAE,sBAAsB,EAAE,MAAM,oCAAoC,CAAC;AAC5E,OAAO,EAAE,mBAAmB,EAAE,MAAM,iCAAiC,CAAC;AACtE,OAAO,EAAE,oBAAoB,EAAE,MAAM,kCAAkC,CAAC;AACxE,OAAO,EAAE,cAAc,EAAE,MAAM,4BAA4B,CAAC;AAC5D,OAAO,EAAE,sBAAsB,EAAE,MAAM,oCAAoC,CAAC;AAC5E,OAAO,EAAE,sBAAsB,EAAE,MAAM,oCAAoC,CAAC;AAC5E,OAAO,EAAE,2BAA2B,EAAE,MAAM,yCAAyC,CAAC;AACtF,OAAO,EAAE,mBAAmB,EAAE,MAAM,iCAAiC,CAAC;AACtE,OAAO,EAAE,gBAAgB,EAAE,MAAM,8BAA8B,CAAC;AAChE,OAAO,EAAE,2BAA2B,EAAE,MAAM,yCAAyC,CAAC;AACtF,OAAO,EAAE,uBAAuB,EAAE,MAAM,qCAAqC,CAAC;AAC9E,OAAO,EAAE,sBAAsB,EAAE,MAAM,oCAAoC,CAAC;AAC5E,OAAO,EAAE,+BAA+B,EAAE,MAAM,6CAA6C,CAAC;AAC9F,OAAO,EAAE,gBAAgB,EAAE,MAAM,8BAA8B,CAAC;AAChE,OAAO,EAAE,mBAAmB,EAAE,MAAM,iCAAiC,CAAC;AACtE,OAAO,EAAE,wBAAwB,EAAE,MAAM,sCAAsC,CAAC;AAChF,OAAO,EAAE,qBAAqB,EAAE,MAAM,mCAAmC,CAAC;AAC1E,OAAO,EAAE,gCAAgC,EAAE,MAAM,8CAA8C,CAAC;AAChG,OAAO,EAAE,kBAAkB,EAAE,MAAM,gCAAgC,CAAC;AACpE,OAAO,EAAE,yBAAyB,EAAE,MAAM,uCAAuC,CAAC;AAClF,OAAO,EAAE,0BAA0B,EAAE,MAAM,wCAAwC,CAAC;AACpF,OAAO,EAAE,sBAAsB,EAAE,MAAM,oCAAoC,CAAC;AAC5E,OAAO,EAAE,uBAAuB,EAAE,MAAM,qCAAqC,CAAC;AAC9E,OAAO,EAAE,sBAAsB,EAAE,MAAM,oCAAoC,CAAC;AAC5E,OAAO,EAAE,8BAA8B,EAAE,MAAM,4CAA4C,CAAC;AAC5F,OAAO,EAAE,SAAS,EAAkB,MAAM,gBAAgB,CAAC;AAG3D,OAAO,EAAE,WAAW,EAAE,MAAM,gBAAgB,CAAC;AAE7C,MAAM,OAAO,KAAM,SAAQ,SAAS;IAClC;;;;;OAKG;IACH,KAAK,CAAC,WAAW,CACf,OAA0C,EAC1C,OAAwB;QAExB,OAAO,WAAW,CAAC,mBAAmB,CACpC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,UAAU,CACd,OAAyC,EACzC,OAAwB;QAExB,OAAO,WAAW,CAAC,kBAAkB,CACnC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,QAAQ,CACZ,OAAuC,EACvC,OAAwB;QAExB,OAAO,WAAW,CAAC,gBAAgB,CACjC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,WAAW,CACf,OAA0C,EAC1C,OAAwB;QAExB,OAAO,WAAW,CAAC,mBAAmB,CACpC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,kBAAkB,CACtB,OAAiD,EACjD,OAAwB;QAExB,OAAO,WAAW,CAAC,0BAA0B,CAC3C,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,iBAAiB,CACrB,OAAgD,EAChD,OAAwB;QAExB,OAAO,WAAW,CAAC,yBAAyB,CAC1C,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,eAAe,CACnB,OAA8C,EAC9C,OAAwB;QAExB,OAAO,WAAW,CAAC,uBAAuB,CACxC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,wBAAwB,CAC5B,OAAuD,EACvD,OAAwB;QAExB,OAAO,WAAW,CAAC,gCAAgC,CACjD,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,mBAAmB,CACvB,OAAkD,EAClD,OAAwB;QAExB,OAAO,WAAW,CAAC,2BAA2B,CAC5C,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,SAAS,CACb,OAAwC,EACxC,OAAwB;QAExB,OAAO,WAAW,CAAC,iBAAiB,CAClC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,QAAQ,CACZ,OAAuC,EACvC,OAAwB;QAExB,OAAO,WAAW,CAAC,gBAAgB,CACjC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,MAAM,CACV,OAAqC,EACrC,OAAwB;QAExB,OAAO,WAAW,CAAC,cAAc,CAC/B,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,SAAS,CACb,OAAwC,EACxC,OAAwB;QAExB,OAAO,WAAW,CAAC,iBAAiB,CAClC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,SAAS,CACb,OAAwC,EACxC,OAAwB;QAExB,OAAO,WAAW,CAAC,iBAAiB,CAClC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,kBAAkB,CACtB,OAAiD,EACjD,OAAwB;QAExB,OAAO,WAAW,CAAC,0BAA0B,CAC3C,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,cAAc,CAClB,OAA6C,EAC7C,OAAwB;QAExB,OAAO,WAAW,CAAC,sBAAsB,CACvC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,cAAc,CAClB,OAA6C,EAC7C,OAAwB;QAExB,OAAO,WAAW,CAAC,sBAAsB,CACvC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,WAAW,CACf,OAA0C,EAC1C,OAAwB;QAExB,OAAO,WAAW,CAAC,mBAAmB,CACpC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,cAAc,CAClB,OAA6C,EAC7C,OAAwB;QAExB,OAAO,WAAW,CAAC,sBAAsB,CACvC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,mBAAmB,CACvB,OAAkD,EAClD,OAAwB;QAExB,OAAO,WAAW,CAAC,2BAA2B,CAC5C,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,sBAAsB,CAC1B,OAAqD,EACrD,OAAwB;QAExB,OAAO,WAAW,CAAC,8BAA8B,CAC/C,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,YAAY,CAChB,OAA2C,EAC3C,OAAwB;QAExB,OAAO,WAAW,CAAC,oBAAoB,CACrC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,cAAc,CAClB,OAA6C,EAC7C,OAAwB;QAExB,OAAO,WAAW,CAAC,sBAAsB,CACvC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,iBAAiB,CACrB,OAAgD,EAChD,OAAwB;QAExB,OAAO,WAAW,CAAC,yBAAyB,CAC1C,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,uBAAuB,CAC3B,OAAsD,EACtD,OAAwB;QAExB,OAAO,WAAW,CAAC,+BAA+B,CAChD,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,cAAc,CAClB,OAA6C,EAC7C,OAAwB;QAExB,OAAO,WAAW,CAAC,sBAAsB,CACvC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,aAAa,CACjB,OAA4C,EAC5C,OAAwB;QAExB,OAAO,WAAW,CAAC,qBAAqB,CACtC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,WAAW,CACf,OAA0C,EAC1C,OAAwB;QAExB,OAAO,WAAW,CAAC,mBAAmB,CACpC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,cAAc,CAClB,OAA6C,EAC7C,OAAwB;QAExB,OAAO,WAAW,CAAC,sBAAsB,CACvC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,cAAc,CAClB,OAA6C,EAC7C,OAAwB;QAExB,OAAO,WAAW,CAAC,sBAAsB,CACvC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,eAAe,CACnB,OAA8C,EAC9C,OAAwB;QAExB,OAAO,WAAW,CAAC,uBAAuB,CACxC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;IAED;;;;;OAKG;IACH,KAAK,CAAC,gBAAgB,CACpB,OAA+C,EAC/C,OAAwB;QAExB,OAAO,WAAW,CAAC,wBAAwB,CACzC,IAAI,EACJ,OAAO,EACP,OAAO,CACR,CAAC,CAAC;IACL,CAAC;CACF"}
|
package/jsr.json
CHANGED
package/package.json
CHANGED
|
@@ -0,0 +1,188 @@
|
|
|
1
|
+
/*
|
|
2
|
+
* Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
|
|
3
|
+
*/
|
|
4
|
+
|
|
5
|
+
import { SDKCore } from "../core.js";
|
|
6
|
+
import { encodeJSON, encodeSimple } from "../lib/encodings.js";
|
|
7
|
+
import { matchStatusCode } from "../lib/http.js";
|
|
8
|
+
import * as M from "../lib/matchers.js";
|
|
9
|
+
import { compactMap } from "../lib/primitives.js";
|
|
10
|
+
import { safeParse } from "../lib/schemas.js";
|
|
11
|
+
import { RequestOptions } from "../lib/sdks.js";
|
|
12
|
+
import { extractSecurity, resolveGlobalSecurity } from "../lib/security.js";
|
|
13
|
+
import { pathToFunc } from "../lib/url.js";
|
|
14
|
+
import {
|
|
15
|
+
ConnectionError,
|
|
16
|
+
InvalidRequestError,
|
|
17
|
+
RequestAbortedError,
|
|
18
|
+
RequestTimeoutError,
|
|
19
|
+
UnexpectedClientError,
|
|
20
|
+
} from "../models/errors/httpclienterrors.js";
|
|
21
|
+
import { ResponseValidationError } from "../models/errors/responsevalidationerror.js";
|
|
22
|
+
import { SDKError } from "../models/errors/sdkerror.js";
|
|
23
|
+
import { SDKValidationError } from "../models/errors/sdkvalidationerror.js";
|
|
24
|
+
import * as operations from "../models/operations/index.js";
|
|
25
|
+
import { APICall, APIPromise } from "../types/async.js";
|
|
26
|
+
import { Result } from "../types/fp.js";
|
|
27
|
+
|
|
28
|
+
/**
|
|
29
|
+
* Append trials to an open coding-agent run
|
|
30
|
+
*
|
|
31
|
+
* @remarks
|
|
32
|
+
* Adds finished trials to a run opened with `finalize: false`, so a job started from MKA1 can be watched while it runs instead of appearing complete out of nowhere at the end. Each trial pins its own `sample_index` and upserts on (task, model, sample_index): a harness cannot tell a timeout from a lost response, so re-sending a batch is safe and replaces rather than duplicates. The whole batch and its aggregate recompute land in one transaction, serialized per run. Counts, metrics and cost are recomputed from the stored rows on every call, never accumulated from the request, so a replayed batch cannot double them. Send `finalize: true` (usually with an empty `trials`) to close the run — until then it stays `in_progress` and off the leaderboards, which only count completed runs. Appending to an already-completed or cancelled run is rejected: that record is finished, and rewriting it would silently move a number someone may have already read.
|
|
33
|
+
*
|
|
34
|
+
* If set, this operation will use {@link Security.bearerAuth} from the global security.
|
|
35
|
+
*/
|
|
36
|
+
export function llmEvalsAppendAgentTrials(
|
|
37
|
+
client: SDKCore,
|
|
38
|
+
request: operations.AppendAgentEvalTrialsRequest,
|
|
39
|
+
options?: RequestOptions,
|
|
40
|
+
): APIPromise<
|
|
41
|
+
Result<
|
|
42
|
+
operations.AppendAgentEvalTrialsResponseBody,
|
|
43
|
+
| SDKError
|
|
44
|
+
| ResponseValidationError
|
|
45
|
+
| ConnectionError
|
|
46
|
+
| RequestAbortedError
|
|
47
|
+
| RequestTimeoutError
|
|
48
|
+
| InvalidRequestError
|
|
49
|
+
| UnexpectedClientError
|
|
50
|
+
| SDKValidationError
|
|
51
|
+
>
|
|
52
|
+
> {
|
|
53
|
+
return new APIPromise($do(
|
|
54
|
+
client,
|
|
55
|
+
request,
|
|
56
|
+
options,
|
|
57
|
+
));
|
|
58
|
+
}
|
|
59
|
+
|
|
60
|
+
async function $do(
|
|
61
|
+
client: SDKCore,
|
|
62
|
+
request: operations.AppendAgentEvalTrialsRequest,
|
|
63
|
+
options?: RequestOptions,
|
|
64
|
+
): Promise<
|
|
65
|
+
[
|
|
66
|
+
Result<
|
|
67
|
+
operations.AppendAgentEvalTrialsResponseBody,
|
|
68
|
+
| SDKError
|
|
69
|
+
| ResponseValidationError
|
|
70
|
+
| ConnectionError
|
|
71
|
+
| RequestAbortedError
|
|
72
|
+
| RequestTimeoutError
|
|
73
|
+
| InvalidRequestError
|
|
74
|
+
| UnexpectedClientError
|
|
75
|
+
| SDKValidationError
|
|
76
|
+
>,
|
|
77
|
+
APICall,
|
|
78
|
+
]
|
|
79
|
+
> {
|
|
80
|
+
const parsed = safeParse(
|
|
81
|
+
request,
|
|
82
|
+
(value) =>
|
|
83
|
+
operations.AppendAgentEvalTrialsRequest$outboundSchema.parse(value),
|
|
84
|
+
"Input validation failed",
|
|
85
|
+
);
|
|
86
|
+
if (!parsed.ok) {
|
|
87
|
+
return [parsed, { status: "invalid" }];
|
|
88
|
+
}
|
|
89
|
+
const payload = parsed.value;
|
|
90
|
+
const body = encodeJSON("body", payload.AppendAgentTrialsRequest, {
|
|
91
|
+
explode: true,
|
|
92
|
+
});
|
|
93
|
+
|
|
94
|
+
const pathParams = {
|
|
95
|
+
run_id: encodeSimple("run_id", payload.run_id, {
|
|
96
|
+
explode: false,
|
|
97
|
+
charEncoding: "percent",
|
|
98
|
+
}),
|
|
99
|
+
};
|
|
100
|
+
const path = pathToFunc("/api/v1/llm/evals/runs/{run_id}/trials")(pathParams);
|
|
101
|
+
|
|
102
|
+
const headers = new Headers(compactMap({
|
|
103
|
+
"Content-Type": "application/json",
|
|
104
|
+
Accept: "application/json",
|
|
105
|
+
"X-On-Behalf-Of": encodeSimple(
|
|
106
|
+
"X-On-Behalf-Of",
|
|
107
|
+
payload["X-On-Behalf-Of"],
|
|
108
|
+
{ explode: false, charEncoding: "none" },
|
|
109
|
+
),
|
|
110
|
+
}));
|
|
111
|
+
|
|
112
|
+
const secConfig = await extractSecurity(client._options.bearerAuth);
|
|
113
|
+
const securityInput = secConfig == null ? {} : { bearerAuth: secConfig };
|
|
114
|
+
const requestSecurity = resolveGlobalSecurity(securityInput, [0]);
|
|
115
|
+
|
|
116
|
+
const context = {
|
|
117
|
+
options: client._options,
|
|
118
|
+
baseURL: options?.serverURL ?? client._baseURL ?? "",
|
|
119
|
+
operationID: "appendAgentEvalTrials",
|
|
120
|
+
oAuth2Scopes: null,
|
|
121
|
+
|
|
122
|
+
resolvedSecurity: requestSecurity,
|
|
123
|
+
|
|
124
|
+
securitySource: client._options.bearerAuth,
|
|
125
|
+
retryConfig: options?.retries
|
|
126
|
+
|| client._options.retryConfig
|
|
127
|
+
|| {
|
|
128
|
+
strategy: "backoff",
|
|
129
|
+
backoff: {
|
|
130
|
+
initialInterval: 500,
|
|
131
|
+
maxInterval: 5000,
|
|
132
|
+
exponent: 1.5,
|
|
133
|
+
maxElapsedTime: 15000,
|
|
134
|
+
},
|
|
135
|
+
retryConnectionErrors: true,
|
|
136
|
+
}
|
|
137
|
+
|| { strategy: "none" },
|
|
138
|
+
retryCodes: options?.retryCodes || ["429", "500", "502", "503", "504"],
|
|
139
|
+
};
|
|
140
|
+
|
|
141
|
+
const requestRes = client._createRequest(context, {
|
|
142
|
+
security: requestSecurity,
|
|
143
|
+
method: "POST",
|
|
144
|
+
baseURL: options?.serverURL,
|
|
145
|
+
path: path,
|
|
146
|
+
headers: headers,
|
|
147
|
+
body: body,
|
|
148
|
+
userAgent: client._options.userAgent,
|
|
149
|
+
timeoutMs: options?.timeoutMs || client._options.timeoutMs || -1,
|
|
150
|
+
}, options);
|
|
151
|
+
if (!requestRes.ok) {
|
|
152
|
+
return [requestRes, { status: "invalid" }];
|
|
153
|
+
}
|
|
154
|
+
const req = requestRes.value;
|
|
155
|
+
|
|
156
|
+
const doResult = await client._do(req, {
|
|
157
|
+
context,
|
|
158
|
+
isErrorStatusCode: (statusCode: number) =>
|
|
159
|
+
matchStatusCode({ status: statusCode } as Response, ["4XX", "5XX"]),
|
|
160
|
+
retryConfig: context.retryConfig,
|
|
161
|
+
retryCodes: context.retryCodes,
|
|
162
|
+
});
|
|
163
|
+
if (!doResult.ok) {
|
|
164
|
+
return [doResult, { status: "request-error", request: req }];
|
|
165
|
+
}
|
|
166
|
+
const response = doResult.value;
|
|
167
|
+
|
|
168
|
+
const [result] = await M.match<
|
|
169
|
+
operations.AppendAgentEvalTrialsResponseBody,
|
|
170
|
+
| SDKError
|
|
171
|
+
| ResponseValidationError
|
|
172
|
+
| ConnectionError
|
|
173
|
+
| RequestAbortedError
|
|
174
|
+
| RequestTimeoutError
|
|
175
|
+
| InvalidRequestError
|
|
176
|
+
| UnexpectedClientError
|
|
177
|
+
| SDKValidationError
|
|
178
|
+
>(
|
|
179
|
+
M.json(200, operations.AppendAgentEvalTrialsResponseBody$inboundSchema),
|
|
180
|
+
M.fail("4XX"),
|
|
181
|
+
M.fail("5XX"),
|
|
182
|
+
)(response, req);
|
|
183
|
+
if (!result.ok) {
|
|
184
|
+
return [result, { status: "complete", request: req, response }];
|
|
185
|
+
}
|
|
186
|
+
|
|
187
|
+
return [result, { status: "complete", request: req, response }];
|
|
188
|
+
}
|