@meetkai/mka1 0.54.23 → 0.54.24
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/README.md +294 -276
- package/bin/mcp-server.js +3844 -1779
- package/bin/mcp-server.js.map +42 -17
- package/dist/commonjs/funcs/llmEvalsAppendAgentTrials.d.ts +19 -0
- package/dist/commonjs/funcs/llmEvalsAppendAgentTrials.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmEvalsAppendAgentTrials.js +136 -0
- package/dist/commonjs/funcs/llmEvalsAppendAgentTrials.js.map +1 -0
- package/dist/commonjs/funcs/llmEvalsGetRunOverview.d.ts +20 -0
- package/dist/commonjs/funcs/llmEvalsGetRunOverview.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmEvalsGetRunOverview.js +138 -0
- package/dist/commonjs/funcs/llmEvalsGetRunOverview.js.map +1 -0
- package/dist/commonjs/funcs/llmEvalsGetSampleTrajectory.d.ts +19 -0
- package/dist/commonjs/funcs/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmEvalsGetSampleTrajectory.js +142 -0
- package/dist/commonjs/funcs/llmEvalsGetSampleTrajectory.js.map +1 -0
- package/dist/commonjs/funcs/llmEvalsGetSuiteLeaderboard.d.ts +20 -0
- package/dist/commonjs/funcs/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmEvalsGetSuiteLeaderboard.js +142 -0
- package/dist/commonjs/funcs/llmEvalsGetSuiteLeaderboard.js.map +1 -0
- package/dist/commonjs/funcs/llmEvalsImportAgentRun.d.ts +19 -0
- package/dist/commonjs/funcs/llmEvalsImportAgentRun.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmEvalsImportAgentRun.js +130 -0
- package/dist/commonjs/funcs/llmEvalsImportAgentRun.js.map +1 -0
- package/dist/commonjs/funcs/llmEvalsUploadSampleTrajectory.d.ts +20 -0
- package/dist/commonjs/funcs/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmEvalsUploadSampleTrajectory.js +146 -0
- package/dist/commonjs/funcs/llmEvalsUploadSampleTrajectory.js.map +1 -0
- package/dist/commonjs/lib/config.d.ts +2 -2
- package/dist/commonjs/lib/config.js +2 -2
- package/dist/commonjs/mcp-server/mcp-server.js +1 -1
- package/dist/commonjs/mcp-server/server.d.ts.map +1 -1
- package/dist/commonjs/mcp-server/server.js +13 -1
- package/dist/commonjs/mcp-server/server.js.map +1 -1
- package/dist/commonjs/mcp-server/tools/llmEvalsAppendAgentTrials.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsAppendAgentTrials.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsAppendAgentTrials.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsAppendAgentTrials.js.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetRunOverview.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetRunOverview.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetRunOverview.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetRunOverview.js.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSampleTrajectory.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSampleTrajectory.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSampleTrajectory.js.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSuiteLeaderboard.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSuiteLeaderboard.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSuiteLeaderboard.js.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsImportAgentRun.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsImportAgentRun.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsImportAgentRun.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsImportAgentRun.js.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsUploadSampleTrajectory.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsUploadSampleTrajectory.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsUploadSampleTrajectory.js.map +1 -0
- package/dist/commonjs/models/components/appendagenttrialsrequest.d.ts +111 -0
- package/dist/commonjs/models/components/appendagenttrialsrequest.d.ts.map +1 -0
- package/dist/commonjs/models/components/appendagenttrialsrequest.js +136 -0
- package/dist/commonjs/models/components/appendagenttrialsrequest.js.map +1 -0
- package/dist/commonjs/models/components/evalleaderboardrow.d.ts +85 -0
- package/dist/commonjs/models/components/evalleaderboardrow.d.ts.map +1 -0
- package/dist/commonjs/models/components/evalleaderboardrow.js +129 -0
- package/dist/commonjs/models/components/evalleaderboardrow.js.map +1 -0
- package/dist/commonjs/models/components/evalrunoverview.d.ts +101 -0
- package/dist/commonjs/models/components/evalrunoverview.d.ts.map +1 -0
- package/dist/commonjs/models/components/evalrunoverview.js +150 -0
- package/dist/commonjs/models/components/evalrunoverview.js.map +1 -0
- package/dist/commonjs/models/components/evalsampleobject.d.ts +32 -0
- package/dist/commonjs/models/components/evalsampleobject.d.ts.map +1 -1
- package/dist/commonjs/models/components/evalsampleobject.js +20 -0
- package/dist/commonjs/models/components/evalsampleobject.js.map +1 -1
- package/dist/commonjs/models/components/evalsampletrajectoryuploadedobject.d.ts +32 -0
- package/dist/commonjs/models/components/evalsampletrajectoryuploadedobject.d.ts.map +1 -0
- package/dist/commonjs/models/components/evalsampletrajectoryuploadedobject.js +87 -0
- package/dist/commonjs/models/components/evalsampletrajectoryuploadedobject.js.map +1 -0
- package/dist/commonjs/models/components/evalsuiteleaderboard.d.ts +35 -0
- package/dist/commonjs/models/components/evalsuiteleaderboard.d.ts.map +1 -0
- package/dist/commonjs/models/components/evalsuiteleaderboard.js +78 -0
- package/dist/commonjs/models/components/evalsuiteleaderboard.js.map +1 -0
- package/dist/commonjs/models/components/importagentrunrequest.d.ts +164 -0
- package/dist/commonjs/models/components/importagentrunrequest.d.ts.map +1 -0
- package/dist/commonjs/models/components/importagentrunrequest.js +182 -0
- package/dist/commonjs/models/components/importagentrunrequest.js.map +1 -0
- package/dist/commonjs/models/components/index.d.ts +7 -0
- package/dist/commonjs/models/components/index.d.ts.map +1 -1
- package/dist/commonjs/models/components/index.js +7 -0
- package/dist/commonjs/models/components/index.js.map +1 -1
- package/dist/commonjs/models/components/uploadevalsampletrajectoryrequest.d.ts +34 -0
- package/dist/commonjs/models/components/uploadevalsampletrajectoryrequest.d.ts.map +1 -0
- package/dist/commonjs/models/components/uploadevalsampletrajectoryrequest.js +71 -0
- package/dist/commonjs/models/components/uploadevalsampletrajectoryrequest.js.map +1 -0
- package/dist/commonjs/models/operations/appendagentevaltrials.d.ts +264 -0
- package/dist/commonjs/models/operations/appendagentevaltrials.d.ts.map +1 -0
- package/dist/commonjs/models/operations/appendagentevaltrials.js +371 -0
- package/dist/commonjs/models/operations/appendagentevaltrials.js.map +1 -0
- package/dist/commonjs/models/operations/cancelevalrun.d.ts +20 -0
- package/dist/commonjs/models/operations/cancelevalrun.d.ts.map +1 -1
- package/dist/commonjs/models/operations/cancelevalrun.js +16 -0
- package/dist/commonjs/models/operations/cancelevalrun.js.map +1 -1
- package/dist/commonjs/models/operations/createevalrun.d.ts +20 -0
- package/dist/commonjs/models/operations/createevalrun.d.ts.map +1 -1
- package/dist/commonjs/models/operations/createevalrun.js +16 -0
- package/dist/commonjs/models/operations/createevalrun.js.map +1 -1
- package/dist/commonjs/models/operations/getevalrun.d.ts +20 -0
- package/dist/commonjs/models/operations/getevalrun.d.ts.map +1 -1
- package/dist/commonjs/models/operations/getevalrun.js +16 -0
- package/dist/commonjs/models/operations/getevalrun.js.map +1 -1
- package/dist/commonjs/models/operations/getevalrunoverview.d.ts +24 -0
- package/dist/commonjs/models/operations/getevalrunoverview.d.ts.map +1 -0
- package/dist/commonjs/models/operations/getevalrunoverview.js +73 -0
- package/dist/commonjs/models/operations/getevalrunoverview.js.map +1 -0
- package/dist/commonjs/models/operations/getevalsampletrajectory.d.ts +75 -0
- package/dist/commonjs/models/operations/getevalsampletrajectory.d.ts.map +1 -0
- package/dist/commonjs/models/operations/getevalsampletrajectory.js +133 -0
- package/dist/commonjs/models/operations/getevalsampletrajectory.js.map +1 -0
- package/dist/commonjs/models/operations/getevalsuiteleaderboard.d.ts +32 -0
- package/dist/commonjs/models/operations/getevalsuiteleaderboard.d.ts.map +1 -0
- package/dist/commonjs/models/operations/getevalsuiteleaderboard.js +83 -0
- package/dist/commonjs/models/operations/getevalsuiteleaderboard.js.map +1 -0
- package/dist/commonjs/models/operations/importagentevalrun.d.ts +262 -0
- package/dist/commonjs/models/operations/importagentevalrun.d.ts.map +1 -0
- package/dist/commonjs/models/operations/importagentevalrun.js +367 -0
- package/dist/commonjs/models/operations/importagentevalrun.js.map +1 -0
- package/dist/commonjs/models/operations/index.d.ts +6 -0
- package/dist/commonjs/models/operations/index.d.ts.map +1 -1
- package/dist/commonjs/models/operations/index.js +6 -0
- package/dist/commonjs/models/operations/index.js.map +1 -1
- package/dist/commonjs/models/operations/listevalruns.d.ts +20 -0
- package/dist/commonjs/models/operations/listevalruns.d.ts.map +1 -1
- package/dist/commonjs/models/operations/listevalruns.js +16 -0
- package/dist/commonjs/models/operations/listevalruns.js.map +1 -1
- package/dist/commonjs/models/operations/listevalscheduleruns.d.ts +20 -0
- package/dist/commonjs/models/operations/listevalscheduleruns.d.ts.map +1 -1
- package/dist/commonjs/models/operations/listevalscheduleruns.js +16 -0
- package/dist/commonjs/models/operations/listevalscheduleruns.js.map +1 -1
- package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.d.ts +20 -0
- package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.d.ts.map +1 -1
- package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.js +16 -0
- package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.js.map +1 -1
- package/dist/commonjs/models/operations/rerunfailedevalsamples.d.ts +20 -0
- package/dist/commonjs/models/operations/rerunfailedevalsamples.d.ts.map +1 -1
- package/dist/commonjs/models/operations/rerunfailedevalsamples.js +16 -0
- package/dist/commonjs/models/operations/rerunfailedevalsamples.js.map +1 -1
- package/dist/commonjs/models/operations/retryfailedevalrun.d.ts +20 -0
- package/dist/commonjs/models/operations/retryfailedevalrun.d.ts.map +1 -1
- package/dist/commonjs/models/operations/retryfailedevalrun.js +16 -0
- package/dist/commonjs/models/operations/retryfailedevalrun.js.map +1 -1
- package/dist/commonjs/models/operations/uploadevalsampletrajectory.d.ts +31 -0
- package/dist/commonjs/models/operations/uploadevalsampletrajectory.d.ts.map +1 -0
- package/dist/commonjs/models/operations/uploadevalsampletrajectory.js +86 -0
- package/dist/commonjs/models/operations/uploadevalsampletrajectory.js.map +1 -0
- package/dist/commonjs/react-query/index.d.ts +6 -0
- package/dist/commonjs/react-query/index.d.ts.map +1 -1
- package/dist/commonjs/react-query/index.js +6 -0
- package/dist/commonjs/react-query/index.js.map +1 -1
- package/dist/commonjs/react-query/llmEvalsAppendAgentTrials.d.ts +28 -0
- package/dist/commonjs/react-query/llmEvalsAppendAgentTrials.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsAppendAgentTrials.js +47 -0
- package/dist/commonjs/react-query/llmEvalsAppendAgentTrials.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.core.d.ts +16 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.core.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.core.js +37 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.core.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.d.ts +40 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.js +60 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.core.d.ts +16 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.core.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.core.js +45 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.core.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.d.ts +44 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.js +65 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.core.d.ts +20 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.core.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.core.js +41 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.core.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.d.ts +48 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.js +65 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsImportAgentRun.d.ts +28 -0
- package/dist/commonjs/react-query/llmEvalsImportAgentRun.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsImportAgentRun.js +47 -0
- package/dist/commonjs/react-query/llmEvalsImportAgentRun.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsUploadSampleTrajectory.d.ts +29 -0
- package/dist/commonjs/react-query/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsUploadSampleTrajectory.js +47 -0
- package/dist/commonjs/react-query/llmEvalsUploadSampleTrajectory.js.map +1 -0
- package/dist/commonjs/sdk/evals.d.ts +42 -0
- package/dist/commonjs/sdk/evals.d.ts.map +1 -1
- package/dist/commonjs/sdk/evals.js +60 -0
- package/dist/commonjs/sdk/evals.js.map +1 -1
- package/dist/esm/funcs/llmEvalsAppendAgentTrials.d.ts +19 -0
- package/dist/esm/funcs/llmEvalsAppendAgentTrials.d.ts.map +1 -0
- package/dist/esm/funcs/llmEvalsAppendAgentTrials.js +100 -0
- package/dist/esm/funcs/llmEvalsAppendAgentTrials.js.map +1 -0
- package/dist/esm/funcs/llmEvalsGetRunOverview.d.ts +20 -0
- package/dist/esm/funcs/llmEvalsGetRunOverview.d.ts.map +1 -0
- package/dist/esm/funcs/llmEvalsGetRunOverview.js +102 -0
- package/dist/esm/funcs/llmEvalsGetRunOverview.js.map +1 -0
- package/dist/esm/funcs/llmEvalsGetSampleTrajectory.d.ts +19 -0
- package/dist/esm/funcs/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
- package/dist/esm/funcs/llmEvalsGetSampleTrajectory.js +106 -0
- package/dist/esm/funcs/llmEvalsGetSampleTrajectory.js.map +1 -0
- package/dist/esm/funcs/llmEvalsGetSuiteLeaderboard.d.ts +20 -0
- package/dist/esm/funcs/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
- package/dist/esm/funcs/llmEvalsGetSuiteLeaderboard.js +106 -0
- package/dist/esm/funcs/llmEvalsGetSuiteLeaderboard.js.map +1 -0
- package/dist/esm/funcs/llmEvalsImportAgentRun.d.ts +19 -0
- package/dist/esm/funcs/llmEvalsImportAgentRun.d.ts.map +1 -0
- package/dist/esm/funcs/llmEvalsImportAgentRun.js +94 -0
- package/dist/esm/funcs/llmEvalsImportAgentRun.js.map +1 -0
- package/dist/esm/funcs/llmEvalsUploadSampleTrajectory.d.ts +20 -0
- package/dist/esm/funcs/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
- package/dist/esm/funcs/llmEvalsUploadSampleTrajectory.js +110 -0
- package/dist/esm/funcs/llmEvalsUploadSampleTrajectory.js.map +1 -0
- package/dist/esm/lib/config.d.ts +2 -2
- package/dist/esm/lib/config.js +2 -2
- package/dist/esm/mcp-server/mcp-server.js +1 -1
- package/dist/esm/mcp-server/server.d.ts.map +1 -1
- package/dist/esm/mcp-server/server.js +13 -1
- package/dist/esm/mcp-server/server.js.map +1 -1
- package/dist/esm/mcp-server/tools/llmEvalsAppendAgentTrials.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmEvalsAppendAgentTrials.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsAppendAgentTrials.js +28 -0
- package/dist/esm/mcp-server/tools/llmEvalsAppendAgentTrials.js.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetRunOverview.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetRunOverview.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetRunOverview.js +28 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetRunOverview.js.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSampleTrajectory.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSampleTrajectory.js +28 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSampleTrajectory.js.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSuiteLeaderboard.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSuiteLeaderboard.js +28 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSuiteLeaderboard.js.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsImportAgentRun.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmEvalsImportAgentRun.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsImportAgentRun.js +28 -0
- package/dist/esm/mcp-server/tools/llmEvalsImportAgentRun.js.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsUploadSampleTrajectory.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsUploadSampleTrajectory.js +28 -0
- package/dist/esm/mcp-server/tools/llmEvalsUploadSampleTrajectory.js.map +1 -0
- package/dist/esm/models/components/appendagenttrialsrequest.d.ts +111 -0
- package/dist/esm/models/components/appendagenttrialsrequest.d.ts.map +1 -0
- package/dist/esm/models/components/appendagenttrialsrequest.js +96 -0
- package/dist/esm/models/components/appendagenttrialsrequest.js.map +1 -0
- package/dist/esm/models/components/evalleaderboardrow.d.ts +85 -0
- package/dist/esm/models/components/evalleaderboardrow.d.ts.map +1 -0
- package/dist/esm/models/components/evalleaderboardrow.js +89 -0
- package/dist/esm/models/components/evalleaderboardrow.js.map +1 -0
- package/dist/esm/models/components/evalrunoverview.d.ts +101 -0
- package/dist/esm/models/components/evalrunoverview.d.ts.map +1 -0
- package/dist/esm/models/components/evalrunoverview.js +108 -0
- package/dist/esm/models/components/evalrunoverview.js.map +1 -0
- package/dist/esm/models/components/evalsampleobject.d.ts +32 -0
- package/dist/esm/models/components/evalsampleobject.d.ts.map +1 -1
- package/dist/esm/models/components/evalsampleobject.js +20 -0
- package/dist/esm/models/components/evalsampleobject.js.map +1 -1
- package/dist/esm/models/components/evalsampletrajectoryuploadedobject.d.ts +32 -0
- package/dist/esm/models/components/evalsampletrajectoryuploadedobject.d.ts.map +1 -0
- package/dist/esm/models/components/evalsampletrajectoryuploadedobject.js +49 -0
- package/dist/esm/models/components/evalsampletrajectoryuploadedobject.js.map +1 -0
- package/dist/esm/models/components/evalsuiteleaderboard.d.ts +35 -0
- package/dist/esm/models/components/evalsuiteleaderboard.d.ts.map +1 -0
- package/dist/esm/models/components/evalsuiteleaderboard.js +40 -0
- package/dist/esm/models/components/evalsuiteleaderboard.js.map +1 -0
- package/dist/esm/models/components/importagentrunrequest.d.ts +164 -0
- package/dist/esm/models/components/importagentrunrequest.d.ts.map +1 -0
- package/dist/esm/models/components/importagentrunrequest.js +142 -0
- package/dist/esm/models/components/importagentrunrequest.js.map +1 -0
- package/dist/esm/models/components/index.d.ts +7 -0
- package/dist/esm/models/components/index.d.ts.map +1 -1
- package/dist/esm/models/components/index.js +7 -0
- package/dist/esm/models/components/index.js.map +1 -1
- package/dist/esm/models/components/uploadevalsampletrajectoryrequest.d.ts +34 -0
- package/dist/esm/models/components/uploadevalsampletrajectoryrequest.d.ts.map +1 -0
- package/dist/esm/models/components/uploadevalsampletrajectoryrequest.js +33 -0
- package/dist/esm/models/components/uploadevalsampletrajectoryrequest.js.map +1 -0
- package/dist/esm/models/operations/appendagentevaltrials.d.ts +264 -0
- package/dist/esm/models/operations/appendagentevaltrials.d.ts.map +1 -0
- package/dist/esm/models/operations/appendagentevaltrials.js +323 -0
- package/dist/esm/models/operations/appendagentevaltrials.js.map +1 -0
- package/dist/esm/models/operations/cancelevalrun.d.ts +20 -0
- package/dist/esm/models/operations/cancelevalrun.d.ts.map +1 -1
- package/dist/esm/models/operations/cancelevalrun.js +16 -0
- package/dist/esm/models/operations/cancelevalrun.js.map +1 -1
- package/dist/esm/models/operations/createevalrun.d.ts +20 -0
- package/dist/esm/models/operations/createevalrun.d.ts.map +1 -1
- package/dist/esm/models/operations/createevalrun.js +16 -0
- package/dist/esm/models/operations/createevalrun.js.map +1 -1
- package/dist/esm/models/operations/getevalrun.d.ts +20 -0
- package/dist/esm/models/operations/getevalrun.d.ts.map +1 -1
- package/dist/esm/models/operations/getevalrun.js +16 -0
- package/dist/esm/models/operations/getevalrun.js.map +1 -1
- package/dist/esm/models/operations/getevalrunoverview.d.ts +24 -0
- package/dist/esm/models/operations/getevalrunoverview.d.ts.map +1 -0
- package/dist/esm/models/operations/getevalrunoverview.js +35 -0
- package/dist/esm/models/operations/getevalrunoverview.js.map +1 -0
- package/dist/esm/models/operations/getevalsampletrajectory.d.ts +75 -0
- package/dist/esm/models/operations/getevalsampletrajectory.d.ts.map +1 -0
- package/dist/esm/models/operations/getevalsampletrajectory.js +93 -0
- package/dist/esm/models/operations/getevalsampletrajectory.js.map +1 -0
- package/dist/esm/models/operations/getevalsuiteleaderboard.d.ts +32 -0
- package/dist/esm/models/operations/getevalsuiteleaderboard.d.ts.map +1 -0
- package/dist/esm/models/operations/getevalsuiteleaderboard.js +45 -0
- package/dist/esm/models/operations/getevalsuiteleaderboard.js.map +1 -0
- package/dist/esm/models/operations/importagentevalrun.d.ts +262 -0
- package/dist/esm/models/operations/importagentevalrun.d.ts.map +1 -0
- package/dist/esm/models/operations/importagentevalrun.js +319 -0
- package/dist/esm/models/operations/importagentevalrun.js.map +1 -0
- package/dist/esm/models/operations/index.d.ts +6 -0
- package/dist/esm/models/operations/index.d.ts.map +1 -1
- package/dist/esm/models/operations/index.js +6 -0
- package/dist/esm/models/operations/index.js.map +1 -1
- package/dist/esm/models/operations/listevalruns.d.ts +20 -0
- package/dist/esm/models/operations/listevalruns.d.ts.map +1 -1
- package/dist/esm/models/operations/listevalruns.js +16 -0
- package/dist/esm/models/operations/listevalruns.js.map +1 -1
- package/dist/esm/models/operations/listevalscheduleruns.d.ts +20 -0
- package/dist/esm/models/operations/listevalscheduleruns.d.ts.map +1 -1
- package/dist/esm/models/operations/listevalscheduleruns.js +16 -0
- package/dist/esm/models/operations/listevalscheduleruns.js.map +1 -1
- package/dist/esm/models/operations/listevalsuiteleaderboardruns.d.ts +20 -0
- package/dist/esm/models/operations/listevalsuiteleaderboardruns.d.ts.map +1 -1
- package/dist/esm/models/operations/listevalsuiteleaderboardruns.js +16 -0
- package/dist/esm/models/operations/listevalsuiteleaderboardruns.js.map +1 -1
- package/dist/esm/models/operations/rerunfailedevalsamples.d.ts +20 -0
- package/dist/esm/models/operations/rerunfailedevalsamples.d.ts.map +1 -1
- package/dist/esm/models/operations/rerunfailedevalsamples.js +16 -0
- package/dist/esm/models/operations/rerunfailedevalsamples.js.map +1 -1
- package/dist/esm/models/operations/retryfailedevalrun.d.ts +20 -0
- package/dist/esm/models/operations/retryfailedevalrun.d.ts.map +1 -1
- package/dist/esm/models/operations/retryfailedevalrun.js +16 -0
- package/dist/esm/models/operations/retryfailedevalrun.js.map +1 -1
- package/dist/esm/models/operations/uploadevalsampletrajectory.d.ts +31 -0
- package/dist/esm/models/operations/uploadevalsampletrajectory.d.ts.map +1 -0
- package/dist/esm/models/operations/uploadevalsampletrajectory.js +48 -0
- package/dist/esm/models/operations/uploadevalsampletrajectory.js.map +1 -0
- package/dist/esm/react-query/index.d.ts +6 -0
- package/dist/esm/react-query/index.d.ts.map +1 -1
- package/dist/esm/react-query/index.js +6 -0
- package/dist/esm/react-query/index.js.map +1 -1
- package/dist/esm/react-query/llmEvalsAppendAgentTrials.d.ts +28 -0
- package/dist/esm/react-query/llmEvalsAppendAgentTrials.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsAppendAgentTrials.js +42 -0
- package/dist/esm/react-query/llmEvalsAppendAgentTrials.js.map +1 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.core.d.ts +16 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.core.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.core.js +32 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.core.js.map +1 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.d.ts +40 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.js +50 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.js.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.core.d.ts +16 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.core.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.core.js +40 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.core.js.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.d.ts +44 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.js +55 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.js.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.core.d.ts +20 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.core.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.core.js +36 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.core.js.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.d.ts +48 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.js +55 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.js.map +1 -0
- package/dist/esm/react-query/llmEvalsImportAgentRun.d.ts +28 -0
- package/dist/esm/react-query/llmEvalsImportAgentRun.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsImportAgentRun.js +42 -0
- package/dist/esm/react-query/llmEvalsImportAgentRun.js.map +1 -0
- package/dist/esm/react-query/llmEvalsUploadSampleTrajectory.d.ts +29 -0
- package/dist/esm/react-query/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsUploadSampleTrajectory.js +42 -0
- package/dist/esm/react-query/llmEvalsUploadSampleTrajectory.js.map +1 -0
- package/dist/esm/sdk/evals.d.ts +42 -0
- package/dist/esm/sdk/evals.d.ts.map +1 -1
- package/dist/esm/sdk/evals.js +60 -0
- package/dist/esm/sdk/evals.js.map +1 -1
- package/jsr.json +1 -1
- package/package.json +1 -1
- package/src/funcs/llmEvalsAppendAgentTrials.ts +188 -0
- package/src/funcs/llmEvalsGetRunOverview.ts +192 -0
- package/src/funcs/llmEvalsGetSampleTrajectory.ts +197 -0
- package/src/funcs/llmEvalsGetSuiteLeaderboard.ts +197 -0
- package/src/funcs/llmEvalsImportAgentRun.ts +181 -0
- package/src/funcs/llmEvalsUploadSampleTrajectory.ts +201 -0
- package/src/lib/config.ts +2 -2
- package/src/mcp-server/mcp-server.ts +1 -1
- package/src/mcp-server/server.ts +13 -1
- package/src/mcp-server/tools/llmEvalsAppendAgentTrials.ts +37 -0
- package/src/mcp-server/tools/llmEvalsGetRunOverview.ts +37 -0
- package/src/mcp-server/tools/llmEvalsGetSampleTrajectory.ts +37 -0
- package/src/mcp-server/tools/llmEvalsGetSuiteLeaderboard.ts +37 -0
- package/src/mcp-server/tools/llmEvalsImportAgentRun.ts +37 -0
- package/src/mcp-server/tools/llmEvalsUploadSampleTrajectory.ts +38 -0
- package/src/models/components/appendagenttrialsrequest.ts +224 -0
- package/src/models/components/evalleaderboardrow.ts +200 -0
- package/src/models/components/evalrunoverview.ts +240 -0
- package/src/models/components/evalsampleobject.ts +48 -0
- package/src/models/components/evalsampletrajectoryuploadedobject.ts +98 -0
- package/src/models/components/evalsuiteleaderboard.ts +93 -0
- package/src/models/components/importagentrunrequest.ts +319 -0
- package/src/models/components/index.ts +7 -0
- package/src/models/components/uploadevalsampletrajectoryrequest.ts +79 -0
- package/src/models/operations/appendagentevaltrials.ts +678 -0
- package/src/models/operations/cancelevalrun.ts +36 -0
- package/src/models/operations/createevalrun.ts +36 -0
- package/src/models/operations/getevalrun.ts +36 -0
- package/src/models/operations/getevalrunoverview.ts +73 -0
- package/src/models/operations/getevalsampletrajectory.ts +199 -0
- package/src/models/operations/getevalsuiteleaderboard.ts +93 -0
- package/src/models/operations/importagentevalrun.ts +665 -0
- package/src/models/operations/index.ts +6 -0
- package/src/models/operations/listevalruns.ts +36 -0
- package/src/models/operations/listevalscheduleruns.ts +36 -0
- package/src/models/operations/listevalsuiteleaderboardruns.ts +36 -0
- package/src/models/operations/rerunfailedevalsamples.ts +36 -0
- package/src/models/operations/retryfailedevalrun.ts +36 -0
- package/src/models/operations/uploadevalsampletrajectory.ts +98 -0
- package/src/react-query/index.ts +6 -0
- package/src/react-query/llmEvalsAppendAgentTrials.ts +109 -0
- package/src/react-query/llmEvalsGetRunOverview.core.ts +77 -0
- package/src/react-query/llmEvalsGetRunOverview.ts +150 -0
- package/src/react-query/llmEvalsGetSampleTrajectory.core.ts +94 -0
- package/src/react-query/llmEvalsGetSampleTrajectory.ts +159 -0
- package/src/react-query/llmEvalsGetSuiteLeaderboard.core.ts +89 -0
- package/src/react-query/llmEvalsGetSuiteLeaderboard.ts +163 -0
- package/src/react-query/llmEvalsImportAgentRun.ts +109 -0
- package/src/react-query/llmEvalsUploadSampleTrajectory.ts +110 -0
- package/src/sdk/evals.ts +108 -0
|
@@ -0,0 +1,181 @@
|
|
|
1
|
+
/*
|
|
2
|
+
* Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
|
|
3
|
+
*/
|
|
4
|
+
|
|
5
|
+
import { SDKCore } from "../core.js";
|
|
6
|
+
import { encodeJSON, encodeSimple } from "../lib/encodings.js";
|
|
7
|
+
import { matchStatusCode } from "../lib/http.js";
|
|
8
|
+
import * as M from "../lib/matchers.js";
|
|
9
|
+
import { compactMap } from "../lib/primitives.js";
|
|
10
|
+
import { safeParse } from "../lib/schemas.js";
|
|
11
|
+
import { RequestOptions } from "../lib/sdks.js";
|
|
12
|
+
import { extractSecurity, resolveGlobalSecurity } from "../lib/security.js";
|
|
13
|
+
import { pathToFunc } from "../lib/url.js";
|
|
14
|
+
import {
|
|
15
|
+
ConnectionError,
|
|
16
|
+
InvalidRequestError,
|
|
17
|
+
RequestAbortedError,
|
|
18
|
+
RequestTimeoutError,
|
|
19
|
+
UnexpectedClientError,
|
|
20
|
+
} from "../models/errors/httpclienterrors.js";
|
|
21
|
+
import { ResponseValidationError } from "../models/errors/responsevalidationerror.js";
|
|
22
|
+
import { SDKError } from "../models/errors/sdkerror.js";
|
|
23
|
+
import { SDKValidationError } from "../models/errors/sdkvalidationerror.js";
|
|
24
|
+
import * as operations from "../models/operations/index.js";
|
|
25
|
+
import { APICall, APIPromise } from "../types/async.js";
|
|
26
|
+
import { Result } from "../types/fp.js";
|
|
27
|
+
|
|
28
|
+
/**
|
|
29
|
+
* Import a finished coding-agent run
|
|
30
|
+
*
|
|
31
|
+
* @remarks
|
|
32
|
+
* Uploads one completed harness job — the run and its trials — directly, so results never round-trip through external storage the way the Hugging Face importer does. Every `task_id` must already exist in the target suite version's manifest; unknown ids are rejected rather than invented, because a typo would otherwise import as a task the suite does not have and read as a model that never covered the version. The run is recorded as `completed` and is not executed: this is a write, not a run request, so no workflow is started. Trials that cover every task of the version get `task_ids: null`, which is what lets the run rank as a complete sweep. Trajectories are NOT part of this payload — a full 91-task run measured 8.3 MB of them — so upload each one against `PUT /evals/runs/{run_id}/samples/{sample_index}/trajectory` afterwards. Pass `idempotency_key` and a retried upload returns the first run instead of doubling the trials behind a board row.
|
|
33
|
+
*
|
|
34
|
+
* If set, this operation will use {@link Security.bearerAuth} from the global security.
|
|
35
|
+
*/
|
|
36
|
+
export function llmEvalsImportAgentRun(
|
|
37
|
+
client: SDKCore,
|
|
38
|
+
request: operations.ImportAgentEvalRunRequest,
|
|
39
|
+
options?: RequestOptions,
|
|
40
|
+
): APIPromise<
|
|
41
|
+
Result<
|
|
42
|
+
operations.ImportAgentEvalRunResponseBody,
|
|
43
|
+
| SDKError
|
|
44
|
+
| ResponseValidationError
|
|
45
|
+
| ConnectionError
|
|
46
|
+
| RequestAbortedError
|
|
47
|
+
| RequestTimeoutError
|
|
48
|
+
| InvalidRequestError
|
|
49
|
+
| UnexpectedClientError
|
|
50
|
+
| SDKValidationError
|
|
51
|
+
>
|
|
52
|
+
> {
|
|
53
|
+
return new APIPromise($do(
|
|
54
|
+
client,
|
|
55
|
+
request,
|
|
56
|
+
options,
|
|
57
|
+
));
|
|
58
|
+
}
|
|
59
|
+
|
|
60
|
+
async function $do(
|
|
61
|
+
client: SDKCore,
|
|
62
|
+
request: operations.ImportAgentEvalRunRequest,
|
|
63
|
+
options?: RequestOptions,
|
|
64
|
+
): Promise<
|
|
65
|
+
[
|
|
66
|
+
Result<
|
|
67
|
+
operations.ImportAgentEvalRunResponseBody,
|
|
68
|
+
| SDKError
|
|
69
|
+
| ResponseValidationError
|
|
70
|
+
| ConnectionError
|
|
71
|
+
| RequestAbortedError
|
|
72
|
+
| RequestTimeoutError
|
|
73
|
+
| InvalidRequestError
|
|
74
|
+
| UnexpectedClientError
|
|
75
|
+
| SDKValidationError
|
|
76
|
+
>,
|
|
77
|
+
APICall,
|
|
78
|
+
]
|
|
79
|
+
> {
|
|
80
|
+
const parsed = safeParse(
|
|
81
|
+
request,
|
|
82
|
+
(value) => operations.ImportAgentEvalRunRequest$outboundSchema.parse(value),
|
|
83
|
+
"Input validation failed",
|
|
84
|
+
);
|
|
85
|
+
if (!parsed.ok) {
|
|
86
|
+
return [parsed, { status: "invalid" }];
|
|
87
|
+
}
|
|
88
|
+
const payload = parsed.value;
|
|
89
|
+
const body = encodeJSON("body", payload.ImportAgentRunRequest, {
|
|
90
|
+
explode: true,
|
|
91
|
+
});
|
|
92
|
+
|
|
93
|
+
const path = pathToFunc("/api/v1/llm/evals/imports/agent-run")();
|
|
94
|
+
|
|
95
|
+
const headers = new Headers(compactMap({
|
|
96
|
+
"Content-Type": "application/json",
|
|
97
|
+
Accept: "application/json",
|
|
98
|
+
"X-On-Behalf-Of": encodeSimple(
|
|
99
|
+
"X-On-Behalf-Of",
|
|
100
|
+
payload["X-On-Behalf-Of"],
|
|
101
|
+
{ explode: false, charEncoding: "none" },
|
|
102
|
+
),
|
|
103
|
+
}));
|
|
104
|
+
|
|
105
|
+
const secConfig = await extractSecurity(client._options.bearerAuth);
|
|
106
|
+
const securityInput = secConfig == null ? {} : { bearerAuth: secConfig };
|
|
107
|
+
const requestSecurity = resolveGlobalSecurity(securityInput, [0]);
|
|
108
|
+
|
|
109
|
+
const context = {
|
|
110
|
+
options: client._options,
|
|
111
|
+
baseURL: options?.serverURL ?? client._baseURL ?? "",
|
|
112
|
+
operationID: "importAgentEvalRun",
|
|
113
|
+
oAuth2Scopes: null,
|
|
114
|
+
|
|
115
|
+
resolvedSecurity: requestSecurity,
|
|
116
|
+
|
|
117
|
+
securitySource: client._options.bearerAuth,
|
|
118
|
+
retryConfig: options?.retries
|
|
119
|
+
|| client._options.retryConfig
|
|
120
|
+
|| {
|
|
121
|
+
strategy: "backoff",
|
|
122
|
+
backoff: {
|
|
123
|
+
initialInterval: 500,
|
|
124
|
+
maxInterval: 5000,
|
|
125
|
+
exponent: 1.5,
|
|
126
|
+
maxElapsedTime: 15000,
|
|
127
|
+
},
|
|
128
|
+
retryConnectionErrors: true,
|
|
129
|
+
}
|
|
130
|
+
|| { strategy: "none" },
|
|
131
|
+
retryCodes: options?.retryCodes || ["429", "500", "502", "503", "504"],
|
|
132
|
+
};
|
|
133
|
+
|
|
134
|
+
const requestRes = client._createRequest(context, {
|
|
135
|
+
security: requestSecurity,
|
|
136
|
+
method: "POST",
|
|
137
|
+
baseURL: options?.serverURL,
|
|
138
|
+
path: path,
|
|
139
|
+
headers: headers,
|
|
140
|
+
body: body,
|
|
141
|
+
userAgent: client._options.userAgent,
|
|
142
|
+
timeoutMs: options?.timeoutMs || client._options.timeoutMs || -1,
|
|
143
|
+
}, options);
|
|
144
|
+
if (!requestRes.ok) {
|
|
145
|
+
return [requestRes, { status: "invalid" }];
|
|
146
|
+
}
|
|
147
|
+
const req = requestRes.value;
|
|
148
|
+
|
|
149
|
+
const doResult = await client._do(req, {
|
|
150
|
+
context,
|
|
151
|
+
isErrorStatusCode: (statusCode: number) =>
|
|
152
|
+
matchStatusCode({ status: statusCode } as Response, ["4XX", "5XX"]),
|
|
153
|
+
retryConfig: context.retryConfig,
|
|
154
|
+
retryCodes: context.retryCodes,
|
|
155
|
+
});
|
|
156
|
+
if (!doResult.ok) {
|
|
157
|
+
return [doResult, { status: "request-error", request: req }];
|
|
158
|
+
}
|
|
159
|
+
const response = doResult.value;
|
|
160
|
+
|
|
161
|
+
const [result] = await M.match<
|
|
162
|
+
operations.ImportAgentEvalRunResponseBody,
|
|
163
|
+
| SDKError
|
|
164
|
+
| ResponseValidationError
|
|
165
|
+
| ConnectionError
|
|
166
|
+
| RequestAbortedError
|
|
167
|
+
| RequestTimeoutError
|
|
168
|
+
| InvalidRequestError
|
|
169
|
+
| UnexpectedClientError
|
|
170
|
+
| SDKValidationError
|
|
171
|
+
>(
|
|
172
|
+
M.json(200, operations.ImportAgentEvalRunResponseBody$inboundSchema),
|
|
173
|
+
M.fail("4XX"),
|
|
174
|
+
M.fail("5XX"),
|
|
175
|
+
)(response, req);
|
|
176
|
+
if (!result.ok) {
|
|
177
|
+
return [result, { status: "complete", request: req, response }];
|
|
178
|
+
}
|
|
179
|
+
|
|
180
|
+
return [result, { status: "complete", request: req, response }];
|
|
181
|
+
}
|
|
@@ -0,0 +1,201 @@
|
|
|
1
|
+
/*
|
|
2
|
+
* Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
|
|
3
|
+
*/
|
|
4
|
+
|
|
5
|
+
import { SDKCore } from "../core.js";
|
|
6
|
+
import { encodeFormQuery, encodeJSON, encodeSimple } from "../lib/encodings.js";
|
|
7
|
+
import { matchStatusCode } from "../lib/http.js";
|
|
8
|
+
import * as M from "../lib/matchers.js";
|
|
9
|
+
import { compactMap } from "../lib/primitives.js";
|
|
10
|
+
import { safeParse } from "../lib/schemas.js";
|
|
11
|
+
import { RequestOptions } from "../lib/sdks.js";
|
|
12
|
+
import { extractSecurity, resolveGlobalSecurity } from "../lib/security.js";
|
|
13
|
+
import { pathToFunc } from "../lib/url.js";
|
|
14
|
+
import * as components from "../models/components/index.js";
|
|
15
|
+
import {
|
|
16
|
+
ConnectionError,
|
|
17
|
+
InvalidRequestError,
|
|
18
|
+
RequestAbortedError,
|
|
19
|
+
RequestTimeoutError,
|
|
20
|
+
UnexpectedClientError,
|
|
21
|
+
} from "../models/errors/httpclienterrors.js";
|
|
22
|
+
import { ResponseValidationError } from "../models/errors/responsevalidationerror.js";
|
|
23
|
+
import { SDKError } from "../models/errors/sdkerror.js";
|
|
24
|
+
import { SDKValidationError } from "../models/errors/sdkvalidationerror.js";
|
|
25
|
+
import * as operations from "../models/operations/index.js";
|
|
26
|
+
import { APICall, APIPromise } from "../types/async.js";
|
|
27
|
+
import { Result } from "../types/fp.js";
|
|
28
|
+
|
|
29
|
+
/**
|
|
30
|
+
* Upload an eval sample trajectory
|
|
31
|
+
*
|
|
32
|
+
* @remarks
|
|
33
|
+
* Stores one coding-agent trial's session, in whatever interchange format the harness produced (record it in `schema_version`, e.g. `ATIF-v1.7`). `steps` is stored verbatim and never validated, so a harness format change needs no gateway release. Separate from the run import because a trajectory averages ~92 KB and a whole run's worth would not fit in one request. Upserts, so re-sending after a timeout replaces the trajectory rather than failing. Sample indices are unique per (task, model), not per run, so pass `task_id` and/or `model` when the run covers more than one — an ambiguous index returns 400 rather than writing to the wrong trial. Rejects a payload whose `steps` and `logs` together exceed 16 MiB with 413.
|
|
34
|
+
*
|
|
35
|
+
* If set, this operation will use {@link Security.bearerAuth} from the global security.
|
|
36
|
+
*/
|
|
37
|
+
export function llmEvalsUploadSampleTrajectory(
|
|
38
|
+
client: SDKCore,
|
|
39
|
+
request: operations.UploadEvalSampleTrajectoryRequest,
|
|
40
|
+
options?: RequestOptions,
|
|
41
|
+
): APIPromise<
|
|
42
|
+
Result<
|
|
43
|
+
components.EvalSampleTrajectoryUploadedObject,
|
|
44
|
+
| SDKError
|
|
45
|
+
| ResponseValidationError
|
|
46
|
+
| ConnectionError
|
|
47
|
+
| RequestAbortedError
|
|
48
|
+
| RequestTimeoutError
|
|
49
|
+
| InvalidRequestError
|
|
50
|
+
| UnexpectedClientError
|
|
51
|
+
| SDKValidationError
|
|
52
|
+
>
|
|
53
|
+
> {
|
|
54
|
+
return new APIPromise($do(
|
|
55
|
+
client,
|
|
56
|
+
request,
|
|
57
|
+
options,
|
|
58
|
+
));
|
|
59
|
+
}
|
|
60
|
+
|
|
61
|
+
async function $do(
|
|
62
|
+
client: SDKCore,
|
|
63
|
+
request: operations.UploadEvalSampleTrajectoryRequest,
|
|
64
|
+
options?: RequestOptions,
|
|
65
|
+
): Promise<
|
|
66
|
+
[
|
|
67
|
+
Result<
|
|
68
|
+
components.EvalSampleTrajectoryUploadedObject,
|
|
69
|
+
| SDKError
|
|
70
|
+
| ResponseValidationError
|
|
71
|
+
| ConnectionError
|
|
72
|
+
| RequestAbortedError
|
|
73
|
+
| RequestTimeoutError
|
|
74
|
+
| InvalidRequestError
|
|
75
|
+
| UnexpectedClientError
|
|
76
|
+
| SDKValidationError
|
|
77
|
+
>,
|
|
78
|
+
APICall,
|
|
79
|
+
]
|
|
80
|
+
> {
|
|
81
|
+
const parsed = safeParse(
|
|
82
|
+
request,
|
|
83
|
+
(value) =>
|
|
84
|
+
operations.UploadEvalSampleTrajectoryRequest$outboundSchema.parse(value),
|
|
85
|
+
"Input validation failed",
|
|
86
|
+
);
|
|
87
|
+
if (!parsed.ok) {
|
|
88
|
+
return [parsed, { status: "invalid" }];
|
|
89
|
+
}
|
|
90
|
+
const payload = parsed.value;
|
|
91
|
+
const body = encodeJSON("body", payload.UploadEvalSampleTrajectoryRequest, {
|
|
92
|
+
explode: true,
|
|
93
|
+
});
|
|
94
|
+
|
|
95
|
+
const pathParams = {
|
|
96
|
+
run_id: encodeSimple("run_id", payload.run_id, {
|
|
97
|
+
explode: false,
|
|
98
|
+
charEncoding: "percent",
|
|
99
|
+
}),
|
|
100
|
+
sample_index: encodeSimple("sample_index", payload.sample_index, {
|
|
101
|
+
explode: false,
|
|
102
|
+
charEncoding: "percent",
|
|
103
|
+
}),
|
|
104
|
+
};
|
|
105
|
+
const path = pathToFunc(
|
|
106
|
+
"/api/v1/llm/evals/runs/{run_id}/samples/{sample_index}/trajectory",
|
|
107
|
+
)(pathParams);
|
|
108
|
+
|
|
109
|
+
const query = encodeFormQuery({
|
|
110
|
+
"model": payload.model,
|
|
111
|
+
"task_id": payload.task_id,
|
|
112
|
+
});
|
|
113
|
+
|
|
114
|
+
const headers = new Headers(compactMap({
|
|
115
|
+
"Content-Type": "application/json",
|
|
116
|
+
Accept: "application/json",
|
|
117
|
+
"X-On-Behalf-Of": encodeSimple(
|
|
118
|
+
"X-On-Behalf-Of",
|
|
119
|
+
payload["X-On-Behalf-Of"],
|
|
120
|
+
{ explode: false, charEncoding: "none" },
|
|
121
|
+
),
|
|
122
|
+
}));
|
|
123
|
+
|
|
124
|
+
const secConfig = await extractSecurity(client._options.bearerAuth);
|
|
125
|
+
const securityInput = secConfig == null ? {} : { bearerAuth: secConfig };
|
|
126
|
+
const requestSecurity = resolveGlobalSecurity(securityInput, [0]);
|
|
127
|
+
|
|
128
|
+
const context = {
|
|
129
|
+
options: client._options,
|
|
130
|
+
baseURL: options?.serverURL ?? client._baseURL ?? "",
|
|
131
|
+
operationID: "uploadEvalSampleTrajectory",
|
|
132
|
+
oAuth2Scopes: null,
|
|
133
|
+
|
|
134
|
+
resolvedSecurity: requestSecurity,
|
|
135
|
+
|
|
136
|
+
securitySource: client._options.bearerAuth,
|
|
137
|
+
retryConfig: options?.retries
|
|
138
|
+
|| client._options.retryConfig
|
|
139
|
+
|| {
|
|
140
|
+
strategy: "backoff",
|
|
141
|
+
backoff: {
|
|
142
|
+
initialInterval: 500,
|
|
143
|
+
maxInterval: 5000,
|
|
144
|
+
exponent: 1.5,
|
|
145
|
+
maxElapsedTime: 15000,
|
|
146
|
+
},
|
|
147
|
+
retryConnectionErrors: true,
|
|
148
|
+
}
|
|
149
|
+
|| { strategy: "none" },
|
|
150
|
+
retryCodes: options?.retryCodes || ["429", "500", "502", "503", "504"],
|
|
151
|
+
};
|
|
152
|
+
|
|
153
|
+
const requestRes = client._createRequest(context, {
|
|
154
|
+
security: requestSecurity,
|
|
155
|
+
method: "PUT",
|
|
156
|
+
baseURL: options?.serverURL,
|
|
157
|
+
path: path,
|
|
158
|
+
headers: headers,
|
|
159
|
+
query: query,
|
|
160
|
+
body: body,
|
|
161
|
+
userAgent: client._options.userAgent,
|
|
162
|
+
timeoutMs: options?.timeoutMs || client._options.timeoutMs || -1,
|
|
163
|
+
}, options);
|
|
164
|
+
if (!requestRes.ok) {
|
|
165
|
+
return [requestRes, { status: "invalid" }];
|
|
166
|
+
}
|
|
167
|
+
const req = requestRes.value;
|
|
168
|
+
|
|
169
|
+
const doResult = await client._do(req, {
|
|
170
|
+
context,
|
|
171
|
+
isErrorStatusCode: (statusCode: number) =>
|
|
172
|
+
matchStatusCode({ status: statusCode } as Response, ["4XX", "5XX"]),
|
|
173
|
+
retryConfig: context.retryConfig,
|
|
174
|
+
retryCodes: context.retryCodes,
|
|
175
|
+
});
|
|
176
|
+
if (!doResult.ok) {
|
|
177
|
+
return [doResult, { status: "request-error", request: req }];
|
|
178
|
+
}
|
|
179
|
+
const response = doResult.value;
|
|
180
|
+
|
|
181
|
+
const [result] = await M.match<
|
|
182
|
+
components.EvalSampleTrajectoryUploadedObject,
|
|
183
|
+
| SDKError
|
|
184
|
+
| ResponseValidationError
|
|
185
|
+
| ConnectionError
|
|
186
|
+
| RequestAbortedError
|
|
187
|
+
| RequestTimeoutError
|
|
188
|
+
| InvalidRequestError
|
|
189
|
+
| UnexpectedClientError
|
|
190
|
+
| SDKValidationError
|
|
191
|
+
>(
|
|
192
|
+
M.json(200, components.EvalSampleTrajectoryUploadedObject$inboundSchema),
|
|
193
|
+
M.fail("4XX"),
|
|
194
|
+
M.fail("5XX"),
|
|
195
|
+
)(response, req);
|
|
196
|
+
if (!result.ok) {
|
|
197
|
+
return [result, { status: "complete", request: req, response }];
|
|
198
|
+
}
|
|
199
|
+
|
|
200
|
+
return [result, { status: "complete", request: req, response }];
|
|
201
|
+
}
|
package/src/lib/config.ts
CHANGED
|
@@ -65,7 +65,7 @@ export function serverURLFromOptions(options: SDKOptions): URL | null {
|
|
|
65
65
|
export const SDK_METADATA = {
|
|
66
66
|
language: "typescript",
|
|
67
67
|
openapiDocVersion: "1.1.0",
|
|
68
|
-
sdkVersion: "0.54.
|
|
68
|
+
sdkVersion: "0.54.24",
|
|
69
69
|
genVersion: "2.935.1",
|
|
70
|
-
userAgent: "speakeasy-sdk/typescript 0.54.
|
|
70
|
+
userAgent: "speakeasy-sdk/typescript 0.54.24 2.935.1 1.1.0 @meetkai/mka1",
|
|
71
71
|
} as const;
|
package/src/mcp-server/server.ts
CHANGED
|
@@ -171,6 +171,7 @@ import { tool$llmConversationsListItems } from "./tools/llmConversationsListItem
|
|
|
171
171
|
import { tool$llmConversationsUpdate } from "./tools/llmConversationsUpdate.js";
|
|
172
172
|
import { tool$llmEmbeddingsEmbed } from "./tools/llmEmbeddingsEmbed.js";
|
|
173
173
|
import { tool$llmEmbeddingsListModels } from "./tools/llmEmbeddingsListModels.js";
|
|
174
|
+
import { tool$llmEvalsAppendAgentTrials } from "./tools/llmEvalsAppendAgentTrials.js";
|
|
174
175
|
import { tool$llmEvalsCancelRun } from "./tools/llmEvalsCancelRun.js";
|
|
175
176
|
import { tool$llmEvalsCreateRun } from "./tools/llmEvalsCreateRun.js";
|
|
176
177
|
import { tool$llmEvalsCreateSchedule } from "./tools/llmEvalsCreateSchedule.js";
|
|
@@ -181,10 +182,14 @@ import { tool$llmEvalsDeleteSchedule } from "./tools/llmEvalsDeleteSchedule.js";
|
|
|
181
182
|
import { tool$llmEvalsDeleteSuite } from "./tools/llmEvalsDeleteSuite.js";
|
|
182
183
|
import { tool$llmEvalsGetArtifacts } from "./tools/llmEvalsGetArtifacts.js";
|
|
183
184
|
import { tool$llmEvalsGetRun } from "./tools/llmEvalsGetRun.js";
|
|
185
|
+
import { tool$llmEvalsGetRunOverview } from "./tools/llmEvalsGetRunOverview.js";
|
|
184
186
|
import { tool$llmEvalsGetSampleAudio } from "./tools/llmEvalsGetSampleAudio.js";
|
|
187
|
+
import { tool$llmEvalsGetSampleTrajectory } from "./tools/llmEvalsGetSampleTrajectory.js";
|
|
185
188
|
import { tool$llmEvalsGetSchedule } from "./tools/llmEvalsGetSchedule.js";
|
|
186
189
|
import { tool$llmEvalsGetSuite } from "./tools/llmEvalsGetSuite.js";
|
|
190
|
+
import { tool$llmEvalsGetSuiteLeaderboard } from "./tools/llmEvalsGetSuiteLeaderboard.js";
|
|
187
191
|
import { tool$llmEvalsGetSuiteVersion } from "./tools/llmEvalsGetSuiteVersion.js";
|
|
192
|
+
import { tool$llmEvalsImportAgentRun } from "./tools/llmEvalsImportAgentRun.js";
|
|
188
193
|
import { tool$llmEvalsImportHistoricalResults } from "./tools/llmEvalsImportHistoricalResults.js";
|
|
189
194
|
import { tool$llmEvalsListRuns } from "./tools/llmEvalsListRuns.js";
|
|
190
195
|
import { tool$llmEvalsListSamples } from "./tools/llmEvalsListSamples.js";
|
|
@@ -197,6 +202,7 @@ import { tool$llmEvalsRerunFailedSamples } from "./tools/llmEvalsRerunFailedSamp
|
|
|
197
202
|
import { tool$llmEvalsRetryFailedRun } from "./tools/llmEvalsRetryFailedRun.js";
|
|
198
203
|
import { tool$llmEvalsTriggerSchedule } from "./tools/llmEvalsTriggerSchedule.js";
|
|
199
204
|
import { tool$llmEvalsUpdateSchedule } from "./tools/llmEvalsUpdateSchedule.js";
|
|
205
|
+
import { tool$llmEvalsUploadSampleTrajectory } from "./tools/llmEvalsUploadSampleTrajectory.js";
|
|
200
206
|
import { tool$llmExtractCreateSchema } from "./tools/llmExtractCreateSchema.js";
|
|
201
207
|
import { tool$llmExtractDeleteSchema } from "./tools/llmExtractDeleteSchema.js";
|
|
202
208
|
import { tool$llmExtractExtract } from "./tools/llmExtractExtract.js";
|
|
@@ -406,7 +412,7 @@ export function createMCPServer(deps: {
|
|
|
406
412
|
}) {
|
|
407
413
|
const server = new McpServer({
|
|
408
414
|
name: "SDK",
|
|
409
|
-
version: "0.54.
|
|
415
|
+
version: "0.54.24",
|
|
410
416
|
});
|
|
411
417
|
|
|
412
418
|
const client = new SDKCore({
|
|
@@ -627,6 +633,7 @@ export function createMCPServer(deps: {
|
|
|
627
633
|
tool(tool$llmEvalsListSuiteVersions);
|
|
628
634
|
tool(tool$llmEvalsGetSuiteVersion);
|
|
629
635
|
tool(tool$llmEvalsListSuiteLeaderboardRuns);
|
|
636
|
+
tool(tool$llmEvalsGetSuiteLeaderboard);
|
|
630
637
|
tool(tool$llmEvalsCreateRun);
|
|
631
638
|
tool(tool$llmEvalsListRuns);
|
|
632
639
|
tool(tool$llmEvalsGetRun);
|
|
@@ -634,9 +641,14 @@ export function createMCPServer(deps: {
|
|
|
634
641
|
tool(tool$llmEvalsCancelRun);
|
|
635
642
|
tool(tool$llmEvalsRerunFailedSamples);
|
|
636
643
|
tool(tool$llmEvalsRetryFailedRun);
|
|
644
|
+
tool(tool$llmEvalsGetRunOverview);
|
|
637
645
|
tool(tool$llmEvalsListSamples);
|
|
638
646
|
tool(tool$llmEvalsGetSampleAudio);
|
|
647
|
+
tool(tool$llmEvalsGetSampleTrajectory);
|
|
648
|
+
tool(tool$llmEvalsUploadSampleTrajectory);
|
|
639
649
|
tool(tool$llmEvalsGetArtifacts);
|
|
650
|
+
tool(tool$llmEvalsImportAgentRun);
|
|
651
|
+
tool(tool$llmEvalsAppendAgentTrials);
|
|
640
652
|
tool(tool$llmEvalsImportHistoricalResults);
|
|
641
653
|
tool(tool$llmEvalsCreateSchedule);
|
|
642
654
|
tool(tool$llmEvalsListSchedules);
|
|
@@ -0,0 +1,37 @@
|
|
|
1
|
+
/*
|
|
2
|
+
* Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
|
|
3
|
+
*/
|
|
4
|
+
|
|
5
|
+
import { llmEvalsAppendAgentTrials } from "../../funcs/llmEvalsAppendAgentTrials.js";
|
|
6
|
+
import * as operations from "../../models/operations/index.js";
|
|
7
|
+
import { formatResult, ToolDefinition } from "../tools.js";
|
|
8
|
+
|
|
9
|
+
const args = {
|
|
10
|
+
request: operations.AppendAgentEvalTrialsRequest$inboundSchema,
|
|
11
|
+
};
|
|
12
|
+
|
|
13
|
+
export const tool$llmEvalsAppendAgentTrials: ToolDefinition<typeof args> = {
|
|
14
|
+
name: "llm-evals-append-agent-trials",
|
|
15
|
+
description: `Append trials to an open coding-agent run
|
|
16
|
+
|
|
17
|
+
Adds finished trials to a run opened with \`finalize: false\`, so a job started from MKA1 can be watched while it runs instead of appearing complete out of nowhere at the end. Each trial pins its own \`sample_index\` and upserts on (task, model, sample_index): a harness cannot tell a timeout from a lost response, so re-sending a batch is safe and replaces rather than duplicates. The whole batch and its aggregate recompute land in one transaction, serialized per run. Counts, metrics and cost are recomputed from the stored rows on every call, never accumulated from the request, so a replayed batch cannot double them. Send \`finalize: true\` (usually with an empty \`trials\`) to close the run — until then it stays \`in_progress\` and off the leaderboards, which only count completed runs. Appending to an already-completed or cancelled run is rejected: that record is finished, and rewriting it would silently move a number someone may have already read.`,
|
|
18
|
+
args,
|
|
19
|
+
tool: async (client, args, ctx) => {
|
|
20
|
+
const [result, apiCall] = await llmEvalsAppendAgentTrials(
|
|
21
|
+
client,
|
|
22
|
+
args.request,
|
|
23
|
+
{ fetchOptions: { signal: ctx.signal } },
|
|
24
|
+
).$inspect();
|
|
25
|
+
|
|
26
|
+
if (!result.ok) {
|
|
27
|
+
return {
|
|
28
|
+
content: [{ type: "text", text: result.error.message }],
|
|
29
|
+
isError: true,
|
|
30
|
+
};
|
|
31
|
+
}
|
|
32
|
+
|
|
33
|
+
const value = result.value;
|
|
34
|
+
|
|
35
|
+
return formatResult(value, apiCall);
|
|
36
|
+
},
|
|
37
|
+
};
|
|
@@ -0,0 +1,37 @@
|
|
|
1
|
+
/*
|
|
2
|
+
* Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
|
|
3
|
+
*/
|
|
4
|
+
|
|
5
|
+
import { llmEvalsGetRunOverview } from "../../funcs/llmEvalsGetRunOverview.js";
|
|
6
|
+
import * as operations from "../../models/operations/index.js";
|
|
7
|
+
import { formatResult, ToolDefinition } from "../tools.js";
|
|
8
|
+
|
|
9
|
+
const args = {
|
|
10
|
+
request: operations.GetEvalRunOverviewRequest$inboundSchema,
|
|
11
|
+
};
|
|
12
|
+
|
|
13
|
+
export const tool$llmEvalsGetRunOverview: ToolDefinition<typeof args> = {
|
|
14
|
+
name: "llm-evals-get-run-overview",
|
|
15
|
+
description: `Get an eval run overview
|
|
16
|
+
|
|
17
|
+
Aggregate header for one run's trials view: trial counts, average reward, cost, and the input/output/cached token split. Its own route rather than fields on the run object because it scans the run's samples — folding it into \`GET /evals/runs/{run_id}\` would charge that scan to every run list and to the status polling that runs for the whole length of an eval. \`trials.errored\` overlaps \`trials.failed\` instead of partitioning it: a coding-agent trial can carry an agent timeout in \`error\` and still be completed and scored. \`trials.retried\` counts trials rerun through rerun-failed, read from the pre-rerun snapshot, since a rerun overwrites the sample in place.`,
|
|
18
|
+
args,
|
|
19
|
+
tool: async (client, args, ctx) => {
|
|
20
|
+
const [result, apiCall] = await llmEvalsGetRunOverview(
|
|
21
|
+
client,
|
|
22
|
+
args.request,
|
|
23
|
+
{ fetchOptions: { signal: ctx.signal } },
|
|
24
|
+
).$inspect();
|
|
25
|
+
|
|
26
|
+
if (!result.ok) {
|
|
27
|
+
return {
|
|
28
|
+
content: [{ type: "text", text: result.error.message }],
|
|
29
|
+
isError: true,
|
|
30
|
+
};
|
|
31
|
+
}
|
|
32
|
+
|
|
33
|
+
const value = result.value;
|
|
34
|
+
|
|
35
|
+
return formatResult(value, apiCall);
|
|
36
|
+
},
|
|
37
|
+
};
|
|
@@ -0,0 +1,37 @@
|
|
|
1
|
+
/*
|
|
2
|
+
* Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
|
|
3
|
+
*/
|
|
4
|
+
|
|
5
|
+
import { llmEvalsGetSampleTrajectory } from "../../funcs/llmEvalsGetSampleTrajectory.js";
|
|
6
|
+
import * as operations from "../../models/operations/index.js";
|
|
7
|
+
import { formatResult, ToolDefinition } from "../tools.js";
|
|
8
|
+
|
|
9
|
+
const args = {
|
|
10
|
+
request: operations.GetEvalSampleTrajectoryRequest$inboundSchema,
|
|
11
|
+
};
|
|
12
|
+
|
|
13
|
+
export const tool$llmEvalsGetSampleTrajectory: ToolDefinition<typeof args> = {
|
|
14
|
+
name: "llm-evals-get-sample-trajectory",
|
|
15
|
+
description: `Get an eval sample trajectory
|
|
16
|
+
|
|
17
|
+
Returns one coding-agent trial's session — the steps the agent took, verbatim in the harness's interchange format (see \`schema_version\`, e.g. \`ATIF-v1.7\`). Deliberately not part of the samples list: a trajectory averages ~92 KB and that list pages up to 500 rows. Sample indices are unique per (task, model), not per run, so pass \`task_id\` and/or \`model\` when the run covers more than one; an index that matches several trials returns 400 rather than guessing, and never falls back to another trial's session. Returns 404 when the sample does not exist or recorded no trajectory.`,
|
|
18
|
+
args,
|
|
19
|
+
tool: async (client, args, ctx) => {
|
|
20
|
+
const [result, apiCall] = await llmEvalsGetSampleTrajectory(
|
|
21
|
+
client,
|
|
22
|
+
args.request,
|
|
23
|
+
{ fetchOptions: { signal: ctx.signal } },
|
|
24
|
+
).$inspect();
|
|
25
|
+
|
|
26
|
+
if (!result.ok) {
|
|
27
|
+
return {
|
|
28
|
+
content: [{ type: "text", text: result.error.message }],
|
|
29
|
+
isError: true,
|
|
30
|
+
};
|
|
31
|
+
}
|
|
32
|
+
|
|
33
|
+
const value = result.value;
|
|
34
|
+
|
|
35
|
+
return formatResult(value, apiCall);
|
|
36
|
+
},
|
|
37
|
+
};
|
|
@@ -0,0 +1,37 @@
|
|
|
1
|
+
/*
|
|
2
|
+
* Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
|
|
3
|
+
*/
|
|
4
|
+
|
|
5
|
+
import { llmEvalsGetSuiteLeaderboard } from "../../funcs/llmEvalsGetSuiteLeaderboard.js";
|
|
6
|
+
import * as operations from "../../models/operations/index.js";
|
|
7
|
+
import { formatResult, ToolDefinition } from "../tools.js";
|
|
8
|
+
|
|
9
|
+
const args = {
|
|
10
|
+
request: operations.GetEvalSuiteLeaderboardRequest$inboundSchema,
|
|
11
|
+
};
|
|
12
|
+
|
|
13
|
+
export const tool$llmEvalsGetSuiteLeaderboard: ToolDefinition<typeof args> = {
|
|
14
|
+
name: "llm-evals-get-suite-leaderboard",
|
|
15
|
+
description: `Get the coding-agent leaderboard for an eval suite
|
|
16
|
+
|
|
17
|
+
Ranks the suite's completed coding-agent runs, one row per (agent, model, effort). Only runs that recorded an \`agent_name\` participate — a QA or transcription run of the same suite has no agent to attribute a score to and is not a board row. \`accuracy\` is the mean of \`metric\` (default \`reward\`) over the row's scored trials, and \`accuracy_ci\` is the 95% Wald interval around it; both are derived per request rather than stored, so rerunning a failed trial moves them instead of leaving a stale copy behind. \`agent_version\` is reported but is not part of the row identity, so an agent upgrade does not split a row in two. Rows are ordered by accuracy descending, nulls last. Pass \`suite_version\` when the suite has more than one, otherwise the board mixes task sets.`,
|
|
18
|
+
args,
|
|
19
|
+
tool: async (client, args, ctx) => {
|
|
20
|
+
const [result, apiCall] = await llmEvalsGetSuiteLeaderboard(
|
|
21
|
+
client,
|
|
22
|
+
args.request,
|
|
23
|
+
{ fetchOptions: { signal: ctx.signal } },
|
|
24
|
+
).$inspect();
|
|
25
|
+
|
|
26
|
+
if (!result.ok) {
|
|
27
|
+
return {
|
|
28
|
+
content: [{ type: "text", text: result.error.message }],
|
|
29
|
+
isError: true,
|
|
30
|
+
};
|
|
31
|
+
}
|
|
32
|
+
|
|
33
|
+
const value = result.value;
|
|
34
|
+
|
|
35
|
+
return formatResult(value, apiCall);
|
|
36
|
+
},
|
|
37
|
+
};
|
|
@@ -0,0 +1,37 @@
|
|
|
1
|
+
/*
|
|
2
|
+
* Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
|
|
3
|
+
*/
|
|
4
|
+
|
|
5
|
+
import { llmEvalsImportAgentRun } from "../../funcs/llmEvalsImportAgentRun.js";
|
|
6
|
+
import * as operations from "../../models/operations/index.js";
|
|
7
|
+
import { formatResult, ToolDefinition } from "../tools.js";
|
|
8
|
+
|
|
9
|
+
const args = {
|
|
10
|
+
request: operations.ImportAgentEvalRunRequest$inboundSchema,
|
|
11
|
+
};
|
|
12
|
+
|
|
13
|
+
export const tool$llmEvalsImportAgentRun: ToolDefinition<typeof args> = {
|
|
14
|
+
name: "llm-evals-import-agent-run",
|
|
15
|
+
description: `Import a finished coding-agent run
|
|
16
|
+
|
|
17
|
+
Uploads one completed harness job — the run and its trials — directly, so results never round-trip through external storage the way the Hugging Face importer does. Every \`task_id\` must already exist in the target suite version's manifest; unknown ids are rejected rather than invented, because a typo would otherwise import as a task the suite does not have and read as a model that never covered the version. The run is recorded as \`completed\` and is not executed: this is a write, not a run request, so no workflow is started. Trials that cover every task of the version get \`task_ids: null\`, which is what lets the run rank as a complete sweep. Trajectories are NOT part of this payload — a full 91-task run measured 8.3 MB of them — so upload each one against \`PUT /evals/runs/{run_id}/samples/{sample_index}/trajectory\` afterwards. Pass \`idempotency_key\` and a retried upload returns the first run instead of doubling the trials behind a board row.`,
|
|
18
|
+
args,
|
|
19
|
+
tool: async (client, args, ctx) => {
|
|
20
|
+
const [result, apiCall] = await llmEvalsImportAgentRun(
|
|
21
|
+
client,
|
|
22
|
+
args.request,
|
|
23
|
+
{ fetchOptions: { signal: ctx.signal } },
|
|
24
|
+
).$inspect();
|
|
25
|
+
|
|
26
|
+
if (!result.ok) {
|
|
27
|
+
return {
|
|
28
|
+
content: [{ type: "text", text: result.error.message }],
|
|
29
|
+
isError: true,
|
|
30
|
+
};
|
|
31
|
+
}
|
|
32
|
+
|
|
33
|
+
const value = result.value;
|
|
34
|
+
|
|
35
|
+
return formatResult(value, apiCall);
|
|
36
|
+
},
|
|
37
|
+
};
|