@meetkai/mka1 0.54.22 → 0.54.24
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/README.md +302 -285
- package/bin/mcp-server.js +5917 -3364
- package/bin/mcp-server.js.map +47 -18
- package/dist/commonjs/funcs/llmEvalsAppendAgentTrials.d.ts +19 -0
- package/dist/commonjs/funcs/llmEvalsAppendAgentTrials.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmEvalsAppendAgentTrials.js +136 -0
- package/dist/commonjs/funcs/llmEvalsAppendAgentTrials.js.map +1 -0
- package/dist/commonjs/funcs/llmEvalsGetRunOverview.d.ts +20 -0
- package/dist/commonjs/funcs/llmEvalsGetRunOverview.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmEvalsGetRunOverview.js +138 -0
- package/dist/commonjs/funcs/llmEvalsGetRunOverview.js.map +1 -0
- package/dist/commonjs/funcs/llmEvalsGetSampleTrajectory.d.ts +19 -0
- package/dist/commonjs/funcs/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmEvalsGetSampleTrajectory.js +142 -0
- package/dist/commonjs/funcs/llmEvalsGetSampleTrajectory.js.map +1 -0
- package/dist/commonjs/funcs/llmEvalsGetSuiteLeaderboard.d.ts +20 -0
- package/dist/commonjs/funcs/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmEvalsGetSuiteLeaderboard.js +142 -0
- package/dist/commonjs/funcs/llmEvalsGetSuiteLeaderboard.js.map +1 -0
- package/dist/commonjs/funcs/llmEvalsImportAgentRun.d.ts +19 -0
- package/dist/commonjs/funcs/llmEvalsImportAgentRun.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmEvalsImportAgentRun.js +130 -0
- package/dist/commonjs/funcs/llmEvalsImportAgentRun.js.map +1 -0
- package/dist/commonjs/funcs/llmEvalsUploadSampleTrajectory.d.ts +20 -0
- package/dist/commonjs/funcs/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmEvalsUploadSampleTrajectory.js +146 -0
- package/dist/commonjs/funcs/llmEvalsUploadSampleTrajectory.js.map +1 -0
- package/dist/commonjs/funcs/llmResponsesCreate.d.ts +25 -0
- package/dist/commonjs/funcs/llmResponsesCreate.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmResponsesCreate.js +137 -0
- package/dist/commonjs/funcs/llmResponsesCreate.js.map +1 -0
- package/dist/commonjs/lib/config.d.ts +2 -2
- package/dist/commonjs/lib/config.js +2 -2
- package/dist/commonjs/mcp-server/mcp-server.js +1 -1
- package/dist/commonjs/mcp-server/server.d.ts.map +1 -1
- package/dist/commonjs/mcp-server/server.js +15 -1
- package/dist/commonjs/mcp-server/server.js.map +1 -1
- package/dist/commonjs/mcp-server/tools/llmEvalsAppendAgentTrials.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsAppendAgentTrials.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsAppendAgentTrials.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsAppendAgentTrials.js.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetRunOverview.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetRunOverview.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetRunOverview.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetRunOverview.js.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSampleTrajectory.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSampleTrajectory.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSampleTrajectory.js.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSuiteLeaderboard.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSuiteLeaderboard.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsGetSuiteLeaderboard.js.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsImportAgentRun.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsImportAgentRun.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsImportAgentRun.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsImportAgentRun.js.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsUploadSampleTrajectory.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsUploadSampleTrajectory.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsUploadSampleTrajectory.js.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmResponsesCreate.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmResponsesCreate.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmResponsesCreate.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmResponsesCreate.js.map +1 -0
- package/dist/commonjs/models/components/appendagenttrialsrequest.d.ts +111 -0
- package/dist/commonjs/models/components/appendagenttrialsrequest.d.ts.map +1 -0
- package/dist/commonjs/models/components/appendagenttrialsrequest.js +136 -0
- package/dist/commonjs/models/components/appendagenttrialsrequest.js.map +1 -0
- package/dist/commonjs/models/components/evalleaderboardrow.d.ts +85 -0
- package/dist/commonjs/models/components/evalleaderboardrow.d.ts.map +1 -0
- package/dist/commonjs/models/components/evalleaderboardrow.js +129 -0
- package/dist/commonjs/models/components/evalleaderboardrow.js.map +1 -0
- package/dist/commonjs/models/components/evalrunoverview.d.ts +101 -0
- package/dist/commonjs/models/components/evalrunoverview.d.ts.map +1 -0
- package/dist/commonjs/models/components/evalrunoverview.js +150 -0
- package/dist/commonjs/models/components/evalrunoverview.js.map +1 -0
- package/dist/commonjs/models/components/evalsampleobject.d.ts +32 -0
- package/dist/commonjs/models/components/evalsampleobject.d.ts.map +1 -1
- package/dist/commonjs/models/components/evalsampleobject.js +20 -0
- package/dist/commonjs/models/components/evalsampleobject.js.map +1 -1
- package/dist/commonjs/models/components/evalsampletrajectoryuploadedobject.d.ts +32 -0
- package/dist/commonjs/models/components/evalsampletrajectoryuploadedobject.d.ts.map +1 -0
- package/dist/commonjs/models/components/evalsampletrajectoryuploadedobject.js +87 -0
- package/dist/commonjs/models/components/evalsampletrajectoryuploadedobject.js.map +1 -0
- package/dist/commonjs/models/components/evalsuiteleaderboard.d.ts +35 -0
- package/dist/commonjs/models/components/evalsuiteleaderboard.d.ts.map +1 -0
- package/dist/commonjs/models/components/evalsuiteleaderboard.js +78 -0
- package/dist/commonjs/models/components/evalsuiteleaderboard.js.map +1 -0
- package/dist/commonjs/models/components/importagentrunrequest.d.ts +164 -0
- package/dist/commonjs/models/components/importagentrunrequest.d.ts.map +1 -0
- package/dist/commonjs/models/components/importagentrunrequest.js +182 -0
- package/dist/commonjs/models/components/importagentrunrequest.js.map +1 -0
- package/dist/commonjs/models/components/index.d.ts +8 -0
- package/dist/commonjs/models/components/index.d.ts.map +1 -1
- package/dist/commonjs/models/components/index.js +8 -0
- package/dist/commonjs/models/components/index.js.map +1 -1
- package/dist/commonjs/models/components/responsescreaterequest.d.ts +432 -0
- package/dist/commonjs/models/components/responsescreaterequest.d.ts.map +1 -0
- package/dist/commonjs/models/components/responsescreaterequest.js +455 -0
- package/dist/commonjs/models/components/responsescreaterequest.js.map +1 -0
- package/dist/commonjs/models/components/uploadevalsampletrajectoryrequest.d.ts +34 -0
- package/dist/commonjs/models/components/uploadevalsampletrajectoryrequest.d.ts.map +1 -0
- package/dist/commonjs/models/components/uploadevalsampletrajectoryrequest.js +71 -0
- package/dist/commonjs/models/components/uploadevalsampletrajectoryrequest.js.map +1 -0
- package/dist/commonjs/models/operations/appendagentevaltrials.d.ts +264 -0
- package/dist/commonjs/models/operations/appendagentevaltrials.d.ts.map +1 -0
- package/dist/commonjs/models/operations/appendagentevaltrials.js +371 -0
- package/dist/commonjs/models/operations/appendagentevaltrials.js.map +1 -0
- package/dist/commonjs/models/operations/cancelevalrun.d.ts +20 -0
- package/dist/commonjs/models/operations/cancelevalrun.d.ts.map +1 -1
- package/dist/commonjs/models/operations/cancelevalrun.js +16 -0
- package/dist/commonjs/models/operations/cancelevalrun.js.map +1 -1
- package/dist/commonjs/models/operations/createevalrun.d.ts +20 -0
- package/dist/commonjs/models/operations/createevalrun.d.ts.map +1 -1
- package/dist/commonjs/models/operations/createevalrun.js +16 -0
- package/dist/commonjs/models/operations/createevalrun.js.map +1 -1
- package/dist/commonjs/models/operations/createresponse.d.ts +64 -0
- package/dist/commonjs/models/operations/createresponse.d.ts.map +1 -0
- package/dist/commonjs/models/operations/createresponse.js +128 -0
- package/dist/commonjs/models/operations/createresponse.js.map +1 -0
- package/dist/commonjs/models/operations/getevalrun.d.ts +20 -0
- package/dist/commonjs/models/operations/getevalrun.d.ts.map +1 -1
- package/dist/commonjs/models/operations/getevalrun.js +16 -0
- package/dist/commonjs/models/operations/getevalrun.js.map +1 -1
- package/dist/commonjs/models/operations/getevalrunoverview.d.ts +24 -0
- package/dist/commonjs/models/operations/getevalrunoverview.d.ts.map +1 -0
- package/dist/commonjs/models/operations/getevalrunoverview.js +73 -0
- package/dist/commonjs/models/operations/getevalrunoverview.js.map +1 -0
- package/dist/commonjs/models/operations/getevalsampletrajectory.d.ts +75 -0
- package/dist/commonjs/models/operations/getevalsampletrajectory.d.ts.map +1 -0
- package/dist/commonjs/models/operations/getevalsampletrajectory.js +133 -0
- package/dist/commonjs/models/operations/getevalsampletrajectory.js.map +1 -0
- package/dist/commonjs/models/operations/getevalsuiteleaderboard.d.ts +32 -0
- package/dist/commonjs/models/operations/getevalsuiteleaderboard.d.ts.map +1 -0
- package/dist/commonjs/models/operations/getevalsuiteleaderboard.js +83 -0
- package/dist/commonjs/models/operations/getevalsuiteleaderboard.js.map +1 -0
- package/dist/commonjs/models/operations/importagentevalrun.d.ts +262 -0
- package/dist/commonjs/models/operations/importagentevalrun.d.ts.map +1 -0
- package/dist/commonjs/models/operations/importagentevalrun.js +367 -0
- package/dist/commonjs/models/operations/importagentevalrun.js.map +1 -0
- package/dist/commonjs/models/operations/index.d.ts +7 -0
- package/dist/commonjs/models/operations/index.d.ts.map +1 -1
- package/dist/commonjs/models/operations/index.js +7 -0
- package/dist/commonjs/models/operations/index.js.map +1 -1
- package/dist/commonjs/models/operations/listevalruns.d.ts +20 -0
- package/dist/commonjs/models/operations/listevalruns.d.ts.map +1 -1
- package/dist/commonjs/models/operations/listevalruns.js +16 -0
- package/dist/commonjs/models/operations/listevalruns.js.map +1 -1
- package/dist/commonjs/models/operations/listevalscheduleruns.d.ts +20 -0
- package/dist/commonjs/models/operations/listevalscheduleruns.d.ts.map +1 -1
- package/dist/commonjs/models/operations/listevalscheduleruns.js +16 -0
- package/dist/commonjs/models/operations/listevalscheduleruns.js.map +1 -1
- package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.d.ts +20 -0
- package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.d.ts.map +1 -1
- package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.js +16 -0
- package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.js.map +1 -1
- package/dist/commonjs/models/operations/rerunfailedevalsamples.d.ts +20 -0
- package/dist/commonjs/models/operations/rerunfailedevalsamples.d.ts.map +1 -1
- package/dist/commonjs/models/operations/rerunfailedevalsamples.js +16 -0
- package/dist/commonjs/models/operations/rerunfailedevalsamples.js.map +1 -1
- package/dist/commonjs/models/operations/retryfailedevalrun.d.ts +20 -0
- package/dist/commonjs/models/operations/retryfailedevalrun.d.ts.map +1 -1
- package/dist/commonjs/models/operations/retryfailedevalrun.js +16 -0
- package/dist/commonjs/models/operations/retryfailedevalrun.js.map +1 -1
- package/dist/commonjs/models/operations/uploadevalsampletrajectory.d.ts +31 -0
- package/dist/commonjs/models/operations/uploadevalsampletrajectory.d.ts.map +1 -0
- package/dist/commonjs/models/operations/uploadevalsampletrajectory.js +86 -0
- package/dist/commonjs/models/operations/uploadevalsampletrajectory.js.map +1 -0
- package/dist/commonjs/react-query/index.d.ts +7 -0
- package/dist/commonjs/react-query/index.d.ts.map +1 -1
- package/dist/commonjs/react-query/index.js +7 -0
- package/dist/commonjs/react-query/index.js.map +1 -1
- package/dist/commonjs/react-query/llmEvalsAppendAgentTrials.d.ts +28 -0
- package/dist/commonjs/react-query/llmEvalsAppendAgentTrials.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsAppendAgentTrials.js +47 -0
- package/dist/commonjs/react-query/llmEvalsAppendAgentTrials.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.core.d.ts +16 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.core.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.core.js +37 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.core.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.d.ts +40 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.js +60 -0
- package/dist/commonjs/react-query/llmEvalsGetRunOverview.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.core.d.ts +16 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.core.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.core.js +45 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.core.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.d.ts +44 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.js +65 -0
- package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.core.d.ts +20 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.core.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.core.js +41 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.core.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.d.ts +48 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.js +65 -0
- package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsImportAgentRun.d.ts +28 -0
- package/dist/commonjs/react-query/llmEvalsImportAgentRun.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsImportAgentRun.js +47 -0
- package/dist/commonjs/react-query/llmEvalsImportAgentRun.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsUploadSampleTrajectory.d.ts +29 -0
- package/dist/commonjs/react-query/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsUploadSampleTrajectory.js +47 -0
- package/dist/commonjs/react-query/llmEvalsUploadSampleTrajectory.js.map +1 -0
- package/dist/commonjs/react-query/llmResponsesCreate.d.ts +34 -0
- package/dist/commonjs/react-query/llmResponsesCreate.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmResponsesCreate.js +50 -0
- package/dist/commonjs/react-query/llmResponsesCreate.js.map +1 -0
- package/dist/commonjs/sdk/evals.d.ts +42 -0
- package/dist/commonjs/sdk/evals.d.ts.map +1 -1
- package/dist/commonjs/sdk/evals.js +60 -0
- package/dist/commonjs/sdk/evals.js.map +1 -1
- package/dist/commonjs/sdk/responses.d.ts +11 -0
- package/dist/commonjs/sdk/responses.d.ts.map +1 -1
- package/dist/commonjs/sdk/responses.js +13 -1
- package/dist/commonjs/sdk/responses.js.map +1 -1
- package/dist/esm/funcs/llmEvalsAppendAgentTrials.d.ts +19 -0
- package/dist/esm/funcs/llmEvalsAppendAgentTrials.d.ts.map +1 -0
- package/dist/esm/funcs/llmEvalsAppendAgentTrials.js +100 -0
- package/dist/esm/funcs/llmEvalsAppendAgentTrials.js.map +1 -0
- package/dist/esm/funcs/llmEvalsGetRunOverview.d.ts +20 -0
- package/dist/esm/funcs/llmEvalsGetRunOverview.d.ts.map +1 -0
- package/dist/esm/funcs/llmEvalsGetRunOverview.js +102 -0
- package/dist/esm/funcs/llmEvalsGetRunOverview.js.map +1 -0
- package/dist/esm/funcs/llmEvalsGetSampleTrajectory.d.ts +19 -0
- package/dist/esm/funcs/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
- package/dist/esm/funcs/llmEvalsGetSampleTrajectory.js +106 -0
- package/dist/esm/funcs/llmEvalsGetSampleTrajectory.js.map +1 -0
- package/dist/esm/funcs/llmEvalsGetSuiteLeaderboard.d.ts +20 -0
- package/dist/esm/funcs/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
- package/dist/esm/funcs/llmEvalsGetSuiteLeaderboard.js +106 -0
- package/dist/esm/funcs/llmEvalsGetSuiteLeaderboard.js.map +1 -0
- package/dist/esm/funcs/llmEvalsImportAgentRun.d.ts +19 -0
- package/dist/esm/funcs/llmEvalsImportAgentRun.d.ts.map +1 -0
- package/dist/esm/funcs/llmEvalsImportAgentRun.js +94 -0
- package/dist/esm/funcs/llmEvalsImportAgentRun.js.map +1 -0
- package/dist/esm/funcs/llmEvalsUploadSampleTrajectory.d.ts +20 -0
- package/dist/esm/funcs/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
- package/dist/esm/funcs/llmEvalsUploadSampleTrajectory.js +110 -0
- package/dist/esm/funcs/llmEvalsUploadSampleTrajectory.js.map +1 -0
- package/dist/esm/funcs/llmResponsesCreate.d.ts +25 -0
- package/dist/esm/funcs/llmResponsesCreate.d.ts.map +1 -0
- package/dist/esm/funcs/llmResponsesCreate.js +100 -0
- package/dist/esm/funcs/llmResponsesCreate.js.map +1 -0
- package/dist/esm/lib/config.d.ts +2 -2
- package/dist/esm/lib/config.js +2 -2
- package/dist/esm/mcp-server/mcp-server.js +1 -1
- package/dist/esm/mcp-server/server.d.ts.map +1 -1
- package/dist/esm/mcp-server/server.js +15 -1
- package/dist/esm/mcp-server/server.js.map +1 -1
- package/dist/esm/mcp-server/tools/llmEvalsAppendAgentTrials.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmEvalsAppendAgentTrials.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsAppendAgentTrials.js +28 -0
- package/dist/esm/mcp-server/tools/llmEvalsAppendAgentTrials.js.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetRunOverview.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetRunOverview.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetRunOverview.js +28 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetRunOverview.js.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSampleTrajectory.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSampleTrajectory.js +28 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSampleTrajectory.js.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSuiteLeaderboard.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSuiteLeaderboard.js +28 -0
- package/dist/esm/mcp-server/tools/llmEvalsGetSuiteLeaderboard.js.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsImportAgentRun.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmEvalsImportAgentRun.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsImportAgentRun.js +28 -0
- package/dist/esm/mcp-server/tools/llmEvalsImportAgentRun.js.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsUploadSampleTrajectory.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsUploadSampleTrajectory.js +28 -0
- package/dist/esm/mcp-server/tools/llmEvalsUploadSampleTrajectory.js.map +1 -0
- package/dist/esm/mcp-server/tools/llmResponsesCreate.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmResponsesCreate.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmResponsesCreate.js +28 -0
- package/dist/esm/mcp-server/tools/llmResponsesCreate.js.map +1 -0
- package/dist/esm/models/components/appendagenttrialsrequest.d.ts +111 -0
- package/dist/esm/models/components/appendagenttrialsrequest.d.ts.map +1 -0
- package/dist/esm/models/components/appendagenttrialsrequest.js +96 -0
- package/dist/esm/models/components/appendagenttrialsrequest.js.map +1 -0
- package/dist/esm/models/components/evalleaderboardrow.d.ts +85 -0
- package/dist/esm/models/components/evalleaderboardrow.d.ts.map +1 -0
- package/dist/esm/models/components/evalleaderboardrow.js +89 -0
- package/dist/esm/models/components/evalleaderboardrow.js.map +1 -0
- package/dist/esm/models/components/evalrunoverview.d.ts +101 -0
- package/dist/esm/models/components/evalrunoverview.d.ts.map +1 -0
- package/dist/esm/models/components/evalrunoverview.js +108 -0
- package/dist/esm/models/components/evalrunoverview.js.map +1 -0
- package/dist/esm/models/components/evalsampleobject.d.ts +32 -0
- package/dist/esm/models/components/evalsampleobject.d.ts.map +1 -1
- package/dist/esm/models/components/evalsampleobject.js +20 -0
- package/dist/esm/models/components/evalsampleobject.js.map +1 -1
- package/dist/esm/models/components/evalsampletrajectoryuploadedobject.d.ts +32 -0
- package/dist/esm/models/components/evalsampletrajectoryuploadedobject.d.ts.map +1 -0
- package/dist/esm/models/components/evalsampletrajectoryuploadedobject.js +49 -0
- package/dist/esm/models/components/evalsampletrajectoryuploadedobject.js.map +1 -0
- package/dist/esm/models/components/evalsuiteleaderboard.d.ts +35 -0
- package/dist/esm/models/components/evalsuiteleaderboard.d.ts.map +1 -0
- package/dist/esm/models/components/evalsuiteleaderboard.js +40 -0
- package/dist/esm/models/components/evalsuiteleaderboard.js.map +1 -0
- package/dist/esm/models/components/importagentrunrequest.d.ts +164 -0
- package/dist/esm/models/components/importagentrunrequest.d.ts.map +1 -0
- package/dist/esm/models/components/importagentrunrequest.js +142 -0
- package/dist/esm/models/components/importagentrunrequest.js.map +1 -0
- package/dist/esm/models/components/index.d.ts +8 -0
- package/dist/esm/models/components/index.d.ts.map +1 -1
- package/dist/esm/models/components/index.js +8 -0
- package/dist/esm/models/components/index.js.map +1 -1
- package/dist/esm/models/components/responsescreaterequest.d.ts +432 -0
- package/dist/esm/models/components/responsescreaterequest.d.ts.map +1 -0
- package/dist/esm/models/components/responsescreaterequest.js +403 -0
- package/dist/esm/models/components/responsescreaterequest.js.map +1 -0
- package/dist/esm/models/components/uploadevalsampletrajectoryrequest.d.ts +34 -0
- package/dist/esm/models/components/uploadevalsampletrajectoryrequest.d.ts.map +1 -0
- package/dist/esm/models/components/uploadevalsampletrajectoryrequest.js +33 -0
- package/dist/esm/models/components/uploadevalsampletrajectoryrequest.js.map +1 -0
- package/dist/esm/models/operations/appendagentevaltrials.d.ts +264 -0
- package/dist/esm/models/operations/appendagentevaltrials.d.ts.map +1 -0
- package/dist/esm/models/operations/appendagentevaltrials.js +323 -0
- package/dist/esm/models/operations/appendagentevaltrials.js.map +1 -0
- package/dist/esm/models/operations/cancelevalrun.d.ts +20 -0
- package/dist/esm/models/operations/cancelevalrun.d.ts.map +1 -1
- package/dist/esm/models/operations/cancelevalrun.js +16 -0
- package/dist/esm/models/operations/cancelevalrun.js.map +1 -1
- package/dist/esm/models/operations/createevalrun.d.ts +20 -0
- package/dist/esm/models/operations/createevalrun.d.ts.map +1 -1
- package/dist/esm/models/operations/createevalrun.js +16 -0
- package/dist/esm/models/operations/createevalrun.js.map +1 -1
- package/dist/esm/models/operations/createresponse.d.ts +64 -0
- package/dist/esm/models/operations/createresponse.d.ts.map +1 -0
- package/dist/esm/models/operations/createresponse.js +86 -0
- package/dist/esm/models/operations/createresponse.js.map +1 -0
- package/dist/esm/models/operations/getevalrun.d.ts +20 -0
- package/dist/esm/models/operations/getevalrun.d.ts.map +1 -1
- package/dist/esm/models/operations/getevalrun.js +16 -0
- package/dist/esm/models/operations/getevalrun.js.map +1 -1
- package/dist/esm/models/operations/getevalrunoverview.d.ts +24 -0
- package/dist/esm/models/operations/getevalrunoverview.d.ts.map +1 -0
- package/dist/esm/models/operations/getevalrunoverview.js +35 -0
- package/dist/esm/models/operations/getevalrunoverview.js.map +1 -0
- package/dist/esm/models/operations/getevalsampletrajectory.d.ts +75 -0
- package/dist/esm/models/operations/getevalsampletrajectory.d.ts.map +1 -0
- package/dist/esm/models/operations/getevalsampletrajectory.js +93 -0
- package/dist/esm/models/operations/getevalsampletrajectory.js.map +1 -0
- package/dist/esm/models/operations/getevalsuiteleaderboard.d.ts +32 -0
- package/dist/esm/models/operations/getevalsuiteleaderboard.d.ts.map +1 -0
- package/dist/esm/models/operations/getevalsuiteleaderboard.js +45 -0
- package/dist/esm/models/operations/getevalsuiteleaderboard.js.map +1 -0
- package/dist/esm/models/operations/importagentevalrun.d.ts +262 -0
- package/dist/esm/models/operations/importagentevalrun.d.ts.map +1 -0
- package/dist/esm/models/operations/importagentevalrun.js +319 -0
- package/dist/esm/models/operations/importagentevalrun.js.map +1 -0
- package/dist/esm/models/operations/index.d.ts +7 -0
- package/dist/esm/models/operations/index.d.ts.map +1 -1
- package/dist/esm/models/operations/index.js +7 -0
- package/dist/esm/models/operations/index.js.map +1 -1
- package/dist/esm/models/operations/listevalruns.d.ts +20 -0
- package/dist/esm/models/operations/listevalruns.d.ts.map +1 -1
- package/dist/esm/models/operations/listevalruns.js +16 -0
- package/dist/esm/models/operations/listevalruns.js.map +1 -1
- package/dist/esm/models/operations/listevalscheduleruns.d.ts +20 -0
- package/dist/esm/models/operations/listevalscheduleruns.d.ts.map +1 -1
- package/dist/esm/models/operations/listevalscheduleruns.js +16 -0
- package/dist/esm/models/operations/listevalscheduleruns.js.map +1 -1
- package/dist/esm/models/operations/listevalsuiteleaderboardruns.d.ts +20 -0
- package/dist/esm/models/operations/listevalsuiteleaderboardruns.d.ts.map +1 -1
- package/dist/esm/models/operations/listevalsuiteleaderboardruns.js +16 -0
- package/dist/esm/models/operations/listevalsuiteleaderboardruns.js.map +1 -1
- package/dist/esm/models/operations/rerunfailedevalsamples.d.ts +20 -0
- package/dist/esm/models/operations/rerunfailedevalsamples.d.ts.map +1 -1
- package/dist/esm/models/operations/rerunfailedevalsamples.js +16 -0
- package/dist/esm/models/operations/rerunfailedevalsamples.js.map +1 -1
- package/dist/esm/models/operations/retryfailedevalrun.d.ts +20 -0
- package/dist/esm/models/operations/retryfailedevalrun.d.ts.map +1 -1
- package/dist/esm/models/operations/retryfailedevalrun.js +16 -0
- package/dist/esm/models/operations/retryfailedevalrun.js.map +1 -1
- package/dist/esm/models/operations/uploadevalsampletrajectory.d.ts +31 -0
- package/dist/esm/models/operations/uploadevalsampletrajectory.d.ts.map +1 -0
- package/dist/esm/models/operations/uploadevalsampletrajectory.js +48 -0
- package/dist/esm/models/operations/uploadevalsampletrajectory.js.map +1 -0
- package/dist/esm/react-query/index.d.ts +7 -0
- package/dist/esm/react-query/index.d.ts.map +1 -1
- package/dist/esm/react-query/index.js +7 -0
- package/dist/esm/react-query/index.js.map +1 -1
- package/dist/esm/react-query/llmEvalsAppendAgentTrials.d.ts +28 -0
- package/dist/esm/react-query/llmEvalsAppendAgentTrials.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsAppendAgentTrials.js +42 -0
- package/dist/esm/react-query/llmEvalsAppendAgentTrials.js.map +1 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.core.d.ts +16 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.core.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.core.js +32 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.core.js.map +1 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.d.ts +40 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.js +50 -0
- package/dist/esm/react-query/llmEvalsGetRunOverview.js.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.core.d.ts +16 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.core.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.core.js +40 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.core.js.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.d.ts +44 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.js +55 -0
- package/dist/esm/react-query/llmEvalsGetSampleTrajectory.js.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.core.d.ts +20 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.core.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.core.js +36 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.core.js.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.d.ts +48 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.js +55 -0
- package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.js.map +1 -0
- package/dist/esm/react-query/llmEvalsImportAgentRun.d.ts +28 -0
- package/dist/esm/react-query/llmEvalsImportAgentRun.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsImportAgentRun.js +42 -0
- package/dist/esm/react-query/llmEvalsImportAgentRun.js.map +1 -0
- package/dist/esm/react-query/llmEvalsUploadSampleTrajectory.d.ts +29 -0
- package/dist/esm/react-query/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsUploadSampleTrajectory.js +42 -0
- package/dist/esm/react-query/llmEvalsUploadSampleTrajectory.js.map +1 -0
- package/dist/esm/react-query/llmResponsesCreate.d.ts +34 -0
- package/dist/esm/react-query/llmResponsesCreate.d.ts.map +1 -0
- package/dist/esm/react-query/llmResponsesCreate.js +43 -0
- package/dist/esm/react-query/llmResponsesCreate.js.map +1 -0
- package/dist/esm/sdk/evals.d.ts +42 -0
- package/dist/esm/sdk/evals.d.ts.map +1 -1
- package/dist/esm/sdk/evals.js +60 -0
- package/dist/esm/sdk/evals.js.map +1 -1
- package/dist/esm/sdk/responses.d.ts +11 -0
- package/dist/esm/sdk/responses.d.ts.map +1 -1
- package/dist/esm/sdk/responses.js +11 -0
- package/dist/esm/sdk/responses.js.map +1 -1
- package/jsr.json +1 -1
- package/package.json +1 -1
- package/src/funcs/llmEvalsAppendAgentTrials.ts +188 -0
- package/src/funcs/llmEvalsGetRunOverview.ts +192 -0
- package/src/funcs/llmEvalsGetSampleTrajectory.ts +197 -0
- package/src/funcs/llmEvalsGetSuiteLeaderboard.ts +197 -0
- package/src/funcs/llmEvalsImportAgentRun.ts +181 -0
- package/src/funcs/llmEvalsUploadSampleTrajectory.ts +201 -0
- package/src/funcs/llmResponsesCreate.ts +188 -0
- package/src/lib/config.ts +2 -2
- package/src/mcp-server/mcp-server.ts +1 -1
- package/src/mcp-server/server.ts +15 -1
- package/src/mcp-server/tools/llmEvalsAppendAgentTrials.ts +37 -0
- package/src/mcp-server/tools/llmEvalsGetRunOverview.ts +37 -0
- package/src/mcp-server/tools/llmEvalsGetSampleTrajectory.ts +37 -0
- package/src/mcp-server/tools/llmEvalsGetSuiteLeaderboard.ts +37 -0
- package/src/mcp-server/tools/llmEvalsImportAgentRun.ts +37 -0
- package/src/mcp-server/tools/llmEvalsUploadSampleTrajectory.ts +38 -0
- package/src/mcp-server/tools/llmResponsesCreate.ts +37 -0
- package/src/models/components/appendagenttrialsrequest.ts +224 -0
- package/src/models/components/evalleaderboardrow.ts +200 -0
- package/src/models/components/evalrunoverview.ts +240 -0
- package/src/models/components/evalsampleobject.ts +48 -0
- package/src/models/components/evalsampletrajectoryuploadedobject.ts +98 -0
- package/src/models/components/evalsuiteleaderboard.ts +93 -0
- package/src/models/components/importagentrunrequest.ts +319 -0
- package/src/models/components/index.ts +8 -0
- package/src/models/components/responsescreaterequest.ts +1076 -0
- package/src/models/components/uploadevalsampletrajectoryrequest.ts +79 -0
- package/src/models/operations/appendagentevaltrials.ts +678 -0
- package/src/models/operations/cancelevalrun.ts +36 -0
- package/src/models/operations/createevalrun.ts +36 -0
- package/src/models/operations/createresponse.ts +198 -0
- package/src/models/operations/getevalrun.ts +36 -0
- package/src/models/operations/getevalrunoverview.ts +73 -0
- package/src/models/operations/getevalsampletrajectory.ts +199 -0
- package/src/models/operations/getevalsuiteleaderboard.ts +93 -0
- package/src/models/operations/importagentevalrun.ts +665 -0
- package/src/models/operations/index.ts +7 -0
- package/src/models/operations/listevalruns.ts +36 -0
- package/src/models/operations/listevalscheduleruns.ts +36 -0
- package/src/models/operations/listevalsuiteleaderboardruns.ts +36 -0
- package/src/models/operations/rerunfailedevalsamples.ts +36 -0
- package/src/models/operations/retryfailedevalrun.ts +36 -0
- package/src/models/operations/uploadevalsampletrajectory.ts +98 -0
- package/src/react-query/index.ts +7 -0
- package/src/react-query/llmEvalsAppendAgentTrials.ts +109 -0
- package/src/react-query/llmEvalsGetRunOverview.core.ts +77 -0
- package/src/react-query/llmEvalsGetRunOverview.ts +150 -0
- package/src/react-query/llmEvalsGetSampleTrajectory.core.ts +94 -0
- package/src/react-query/llmEvalsGetSampleTrajectory.ts +159 -0
- package/src/react-query/llmEvalsGetSuiteLeaderboard.core.ts +89 -0
- package/src/react-query/llmEvalsGetSuiteLeaderboard.ts +163 -0
- package/src/react-query/llmEvalsImportAgentRun.ts +109 -0
- package/src/react-query/llmEvalsUploadSampleTrajectory.ts +110 -0
- package/src/react-query/llmResponsesCreate.ts +113 -0
- package/src/sdk/evals.ts +108 -0
- package/src/sdk/responses.ts +23 -0
|
@@ -0,0 +1,201 @@
|
|
|
1
|
+
/*
|
|
2
|
+
* Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
|
|
3
|
+
*/
|
|
4
|
+
|
|
5
|
+
import { SDKCore } from "../core.js";
|
|
6
|
+
import { encodeFormQuery, encodeJSON, encodeSimple } from "../lib/encodings.js";
|
|
7
|
+
import { matchStatusCode } from "../lib/http.js";
|
|
8
|
+
import * as M from "../lib/matchers.js";
|
|
9
|
+
import { compactMap } from "../lib/primitives.js";
|
|
10
|
+
import { safeParse } from "../lib/schemas.js";
|
|
11
|
+
import { RequestOptions } from "../lib/sdks.js";
|
|
12
|
+
import { extractSecurity, resolveGlobalSecurity } from "../lib/security.js";
|
|
13
|
+
import { pathToFunc } from "../lib/url.js";
|
|
14
|
+
import * as components from "../models/components/index.js";
|
|
15
|
+
import {
|
|
16
|
+
ConnectionError,
|
|
17
|
+
InvalidRequestError,
|
|
18
|
+
RequestAbortedError,
|
|
19
|
+
RequestTimeoutError,
|
|
20
|
+
UnexpectedClientError,
|
|
21
|
+
} from "../models/errors/httpclienterrors.js";
|
|
22
|
+
import { ResponseValidationError } from "../models/errors/responsevalidationerror.js";
|
|
23
|
+
import { SDKError } from "../models/errors/sdkerror.js";
|
|
24
|
+
import { SDKValidationError } from "../models/errors/sdkvalidationerror.js";
|
|
25
|
+
import * as operations from "../models/operations/index.js";
|
|
26
|
+
import { APICall, APIPromise } from "../types/async.js";
|
|
27
|
+
import { Result } from "../types/fp.js";
|
|
28
|
+
|
|
29
|
+
/**
|
|
30
|
+
* Upload an eval sample trajectory
|
|
31
|
+
*
|
|
32
|
+
* @remarks
|
|
33
|
+
* Stores one coding-agent trial's session, in whatever interchange format the harness produced (record it in `schema_version`, e.g. `ATIF-v1.7`). `steps` is stored verbatim and never validated, so a harness format change needs no gateway release. Separate from the run import because a trajectory averages ~92 KB and a whole run's worth would not fit in one request. Upserts, so re-sending after a timeout replaces the trajectory rather than failing. Sample indices are unique per (task, model), not per run, so pass `task_id` and/or `model` when the run covers more than one — an ambiguous index returns 400 rather than writing to the wrong trial. Rejects a payload whose `steps` and `logs` together exceed 16 MiB with 413.
|
|
34
|
+
*
|
|
35
|
+
* If set, this operation will use {@link Security.bearerAuth} from the global security.
|
|
36
|
+
*/
|
|
37
|
+
export function llmEvalsUploadSampleTrajectory(
|
|
38
|
+
client: SDKCore,
|
|
39
|
+
request: operations.UploadEvalSampleTrajectoryRequest,
|
|
40
|
+
options?: RequestOptions,
|
|
41
|
+
): APIPromise<
|
|
42
|
+
Result<
|
|
43
|
+
components.EvalSampleTrajectoryUploadedObject,
|
|
44
|
+
| SDKError
|
|
45
|
+
| ResponseValidationError
|
|
46
|
+
| ConnectionError
|
|
47
|
+
| RequestAbortedError
|
|
48
|
+
| RequestTimeoutError
|
|
49
|
+
| InvalidRequestError
|
|
50
|
+
| UnexpectedClientError
|
|
51
|
+
| SDKValidationError
|
|
52
|
+
>
|
|
53
|
+
> {
|
|
54
|
+
return new APIPromise($do(
|
|
55
|
+
client,
|
|
56
|
+
request,
|
|
57
|
+
options,
|
|
58
|
+
));
|
|
59
|
+
}
|
|
60
|
+
|
|
61
|
+
async function $do(
|
|
62
|
+
client: SDKCore,
|
|
63
|
+
request: operations.UploadEvalSampleTrajectoryRequest,
|
|
64
|
+
options?: RequestOptions,
|
|
65
|
+
): Promise<
|
|
66
|
+
[
|
|
67
|
+
Result<
|
|
68
|
+
components.EvalSampleTrajectoryUploadedObject,
|
|
69
|
+
| SDKError
|
|
70
|
+
| ResponseValidationError
|
|
71
|
+
| ConnectionError
|
|
72
|
+
| RequestAbortedError
|
|
73
|
+
| RequestTimeoutError
|
|
74
|
+
| InvalidRequestError
|
|
75
|
+
| UnexpectedClientError
|
|
76
|
+
| SDKValidationError
|
|
77
|
+
>,
|
|
78
|
+
APICall,
|
|
79
|
+
]
|
|
80
|
+
> {
|
|
81
|
+
const parsed = safeParse(
|
|
82
|
+
request,
|
|
83
|
+
(value) =>
|
|
84
|
+
operations.UploadEvalSampleTrajectoryRequest$outboundSchema.parse(value),
|
|
85
|
+
"Input validation failed",
|
|
86
|
+
);
|
|
87
|
+
if (!parsed.ok) {
|
|
88
|
+
return [parsed, { status: "invalid" }];
|
|
89
|
+
}
|
|
90
|
+
const payload = parsed.value;
|
|
91
|
+
const body = encodeJSON("body", payload.UploadEvalSampleTrajectoryRequest, {
|
|
92
|
+
explode: true,
|
|
93
|
+
});
|
|
94
|
+
|
|
95
|
+
const pathParams = {
|
|
96
|
+
run_id: encodeSimple("run_id", payload.run_id, {
|
|
97
|
+
explode: false,
|
|
98
|
+
charEncoding: "percent",
|
|
99
|
+
}),
|
|
100
|
+
sample_index: encodeSimple("sample_index", payload.sample_index, {
|
|
101
|
+
explode: false,
|
|
102
|
+
charEncoding: "percent",
|
|
103
|
+
}),
|
|
104
|
+
};
|
|
105
|
+
const path = pathToFunc(
|
|
106
|
+
"/api/v1/llm/evals/runs/{run_id}/samples/{sample_index}/trajectory",
|
|
107
|
+
)(pathParams);
|
|
108
|
+
|
|
109
|
+
const query = encodeFormQuery({
|
|
110
|
+
"model": payload.model,
|
|
111
|
+
"task_id": payload.task_id,
|
|
112
|
+
});
|
|
113
|
+
|
|
114
|
+
const headers = new Headers(compactMap({
|
|
115
|
+
"Content-Type": "application/json",
|
|
116
|
+
Accept: "application/json",
|
|
117
|
+
"X-On-Behalf-Of": encodeSimple(
|
|
118
|
+
"X-On-Behalf-Of",
|
|
119
|
+
payload["X-On-Behalf-Of"],
|
|
120
|
+
{ explode: false, charEncoding: "none" },
|
|
121
|
+
),
|
|
122
|
+
}));
|
|
123
|
+
|
|
124
|
+
const secConfig = await extractSecurity(client._options.bearerAuth);
|
|
125
|
+
const securityInput = secConfig == null ? {} : { bearerAuth: secConfig };
|
|
126
|
+
const requestSecurity = resolveGlobalSecurity(securityInput, [0]);
|
|
127
|
+
|
|
128
|
+
const context = {
|
|
129
|
+
options: client._options,
|
|
130
|
+
baseURL: options?.serverURL ?? client._baseURL ?? "",
|
|
131
|
+
operationID: "uploadEvalSampleTrajectory",
|
|
132
|
+
oAuth2Scopes: null,
|
|
133
|
+
|
|
134
|
+
resolvedSecurity: requestSecurity,
|
|
135
|
+
|
|
136
|
+
securitySource: client._options.bearerAuth,
|
|
137
|
+
retryConfig: options?.retries
|
|
138
|
+
|| client._options.retryConfig
|
|
139
|
+
|| {
|
|
140
|
+
strategy: "backoff",
|
|
141
|
+
backoff: {
|
|
142
|
+
initialInterval: 500,
|
|
143
|
+
maxInterval: 5000,
|
|
144
|
+
exponent: 1.5,
|
|
145
|
+
maxElapsedTime: 15000,
|
|
146
|
+
},
|
|
147
|
+
retryConnectionErrors: true,
|
|
148
|
+
}
|
|
149
|
+
|| { strategy: "none" },
|
|
150
|
+
retryCodes: options?.retryCodes || ["429", "500", "502", "503", "504"],
|
|
151
|
+
};
|
|
152
|
+
|
|
153
|
+
const requestRes = client._createRequest(context, {
|
|
154
|
+
security: requestSecurity,
|
|
155
|
+
method: "PUT",
|
|
156
|
+
baseURL: options?.serverURL,
|
|
157
|
+
path: path,
|
|
158
|
+
headers: headers,
|
|
159
|
+
query: query,
|
|
160
|
+
body: body,
|
|
161
|
+
userAgent: client._options.userAgent,
|
|
162
|
+
timeoutMs: options?.timeoutMs || client._options.timeoutMs || -1,
|
|
163
|
+
}, options);
|
|
164
|
+
if (!requestRes.ok) {
|
|
165
|
+
return [requestRes, { status: "invalid" }];
|
|
166
|
+
}
|
|
167
|
+
const req = requestRes.value;
|
|
168
|
+
|
|
169
|
+
const doResult = await client._do(req, {
|
|
170
|
+
context,
|
|
171
|
+
isErrorStatusCode: (statusCode: number) =>
|
|
172
|
+
matchStatusCode({ status: statusCode } as Response, ["4XX", "5XX"]),
|
|
173
|
+
retryConfig: context.retryConfig,
|
|
174
|
+
retryCodes: context.retryCodes,
|
|
175
|
+
});
|
|
176
|
+
if (!doResult.ok) {
|
|
177
|
+
return [doResult, { status: "request-error", request: req }];
|
|
178
|
+
}
|
|
179
|
+
const response = doResult.value;
|
|
180
|
+
|
|
181
|
+
const [result] = await M.match<
|
|
182
|
+
components.EvalSampleTrajectoryUploadedObject,
|
|
183
|
+
| SDKError
|
|
184
|
+
| ResponseValidationError
|
|
185
|
+
| ConnectionError
|
|
186
|
+
| RequestAbortedError
|
|
187
|
+
| RequestTimeoutError
|
|
188
|
+
| InvalidRequestError
|
|
189
|
+
| UnexpectedClientError
|
|
190
|
+
| SDKValidationError
|
|
191
|
+
>(
|
|
192
|
+
M.json(200, components.EvalSampleTrajectoryUploadedObject$inboundSchema),
|
|
193
|
+
M.fail("4XX"),
|
|
194
|
+
M.fail("5XX"),
|
|
195
|
+
)(response, req);
|
|
196
|
+
if (!result.ok) {
|
|
197
|
+
return [result, { status: "complete", request: req, response }];
|
|
198
|
+
}
|
|
199
|
+
|
|
200
|
+
return [result, { status: "complete", request: req, response }];
|
|
201
|
+
}
|
|
@@ -0,0 +1,188 @@
|
|
|
1
|
+
/*
|
|
2
|
+
* Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
|
|
3
|
+
*/
|
|
4
|
+
|
|
5
|
+
import { SDKCore } from "../core.js";
|
|
6
|
+
import { encodeJSON, encodeSimple } from "../lib/encodings.js";
|
|
7
|
+
import { matchStatusCode } from "../lib/http.js";
|
|
8
|
+
import * as M from "../lib/matchers.js";
|
|
9
|
+
import { compactMap } from "../lib/primitives.js";
|
|
10
|
+
import { safeParse } from "../lib/schemas.js";
|
|
11
|
+
import { RequestOptions } from "../lib/sdks.js";
|
|
12
|
+
import { extractSecurity, resolveGlobalSecurity } from "../lib/security.js";
|
|
13
|
+
import { pathToFunc } from "../lib/url.js";
|
|
14
|
+
import {
|
|
15
|
+
ConnectionError,
|
|
16
|
+
InvalidRequestError,
|
|
17
|
+
RequestAbortedError,
|
|
18
|
+
RequestTimeoutError,
|
|
19
|
+
UnexpectedClientError,
|
|
20
|
+
} from "../models/errors/httpclienterrors.js";
|
|
21
|
+
import { ResponseValidationError } from "../models/errors/responsevalidationerror.js";
|
|
22
|
+
import { SDKError } from "../models/errors/sdkerror.js";
|
|
23
|
+
import { SDKValidationError } from "../models/errors/sdkvalidationerror.js";
|
|
24
|
+
import * as operations from "../models/operations/index.js";
|
|
25
|
+
import { APICall, APIPromise } from "../types/async.js";
|
|
26
|
+
import { Result } from "../types/fp.js";
|
|
27
|
+
|
|
28
|
+
export enum CreateAcceptEnum {
|
|
29
|
+
applicationJson = "application/json",
|
|
30
|
+
textEventStream = "text/event-stream",
|
|
31
|
+
}
|
|
32
|
+
|
|
33
|
+
/**
|
|
34
|
+
* Create an agent-powered response with tool support
|
|
35
|
+
*
|
|
36
|
+
* @remarks
|
|
37
|
+
* Creates a new AI agent response using advanced language models with autonomous tool usage capabilities.
|
|
38
|
+
*
|
|
39
|
+
* If set, this operation will use {@link Security.bearerAuth} from the global security.
|
|
40
|
+
*/
|
|
41
|
+
export function llmResponsesCreate(
|
|
42
|
+
client: SDKCore,
|
|
43
|
+
request: operations.CreateResponseRequest,
|
|
44
|
+
options?: RequestOptions & { acceptHeaderOverride?: CreateAcceptEnum },
|
|
45
|
+
): APIPromise<
|
|
46
|
+
Result<
|
|
47
|
+
operations.CreateResponseResponse,
|
|
48
|
+
| SDKError
|
|
49
|
+
| ResponseValidationError
|
|
50
|
+
| ConnectionError
|
|
51
|
+
| RequestAbortedError
|
|
52
|
+
| RequestTimeoutError
|
|
53
|
+
| InvalidRequestError
|
|
54
|
+
| UnexpectedClientError
|
|
55
|
+
| SDKValidationError
|
|
56
|
+
>
|
|
57
|
+
> {
|
|
58
|
+
return new APIPromise($do(
|
|
59
|
+
client,
|
|
60
|
+
request,
|
|
61
|
+
options,
|
|
62
|
+
));
|
|
63
|
+
}
|
|
64
|
+
|
|
65
|
+
async function $do(
|
|
66
|
+
client: SDKCore,
|
|
67
|
+
request: operations.CreateResponseRequest,
|
|
68
|
+
options?: RequestOptions & { acceptHeaderOverride?: CreateAcceptEnum },
|
|
69
|
+
): Promise<
|
|
70
|
+
[
|
|
71
|
+
Result<
|
|
72
|
+
operations.CreateResponseResponse,
|
|
73
|
+
| SDKError
|
|
74
|
+
| ResponseValidationError
|
|
75
|
+
| ConnectionError
|
|
76
|
+
| RequestAbortedError
|
|
77
|
+
| RequestTimeoutError
|
|
78
|
+
| InvalidRequestError
|
|
79
|
+
| UnexpectedClientError
|
|
80
|
+
| SDKValidationError
|
|
81
|
+
>,
|
|
82
|
+
APICall,
|
|
83
|
+
]
|
|
84
|
+
> {
|
|
85
|
+
const parsed = safeParse(
|
|
86
|
+
request,
|
|
87
|
+
(value) => operations.CreateResponseRequest$outboundSchema.parse(value),
|
|
88
|
+
"Input validation failed",
|
|
89
|
+
);
|
|
90
|
+
if (!parsed.ok) {
|
|
91
|
+
return [parsed, { status: "invalid" }];
|
|
92
|
+
}
|
|
93
|
+
const payload = parsed.value;
|
|
94
|
+
const body = encodeJSON("body", payload.ResponsesCreateRequest, {
|
|
95
|
+
explode: true,
|
|
96
|
+
});
|
|
97
|
+
|
|
98
|
+
const path = pathToFunc("/api/v1/llm/responses")();
|
|
99
|
+
|
|
100
|
+
const headers = new Headers(compactMap({
|
|
101
|
+
"Content-Type": "application/json",
|
|
102
|
+
Accept: options?.acceptHeaderOverride
|
|
103
|
+
|| "application/json;q=1, text/event-stream;q=0",
|
|
104
|
+
"X-On-Behalf-Of": encodeSimple(
|
|
105
|
+
"X-On-Behalf-Of",
|
|
106
|
+
payload["X-On-Behalf-Of"],
|
|
107
|
+
{ explode: false, charEncoding: "none" },
|
|
108
|
+
),
|
|
109
|
+
}));
|
|
110
|
+
|
|
111
|
+
const secConfig = await extractSecurity(client._options.bearerAuth);
|
|
112
|
+
const securityInput = secConfig == null ? {} : { bearerAuth: secConfig };
|
|
113
|
+
const requestSecurity = resolveGlobalSecurity(securityInput, [0]);
|
|
114
|
+
|
|
115
|
+
const context = {
|
|
116
|
+
options: client._options,
|
|
117
|
+
baseURL: options?.serverURL ?? client._baseURL ?? "",
|
|
118
|
+
operationID: "createResponse",
|
|
119
|
+
oAuth2Scopes: null,
|
|
120
|
+
|
|
121
|
+
resolvedSecurity: requestSecurity,
|
|
122
|
+
|
|
123
|
+
securitySource: client._options.bearerAuth,
|
|
124
|
+
retryConfig: options?.retries
|
|
125
|
+
|| client._options.retryConfig
|
|
126
|
+
|| {
|
|
127
|
+
strategy: "backoff",
|
|
128
|
+
backoff: {
|
|
129
|
+
initialInterval: 500,
|
|
130
|
+
maxInterval: 5000,
|
|
131
|
+
exponent: 1.5,
|
|
132
|
+
maxElapsedTime: 15000,
|
|
133
|
+
},
|
|
134
|
+
retryConnectionErrors: true,
|
|
135
|
+
}
|
|
136
|
+
|| { strategy: "none" },
|
|
137
|
+
retryCodes: options?.retryCodes || ["429", "500", "502", "503", "504"],
|
|
138
|
+
};
|
|
139
|
+
|
|
140
|
+
const requestRes = client._createRequest(context, {
|
|
141
|
+
security: requestSecurity,
|
|
142
|
+
method: "POST",
|
|
143
|
+
baseURL: options?.serverURL,
|
|
144
|
+
path: path,
|
|
145
|
+
headers: headers,
|
|
146
|
+
body: body,
|
|
147
|
+
userAgent: client._options.userAgent,
|
|
148
|
+
timeoutMs: options?.timeoutMs || client._options.timeoutMs || 600000,
|
|
149
|
+
}, options);
|
|
150
|
+
if (!requestRes.ok) {
|
|
151
|
+
return [requestRes, { status: "invalid" }];
|
|
152
|
+
}
|
|
153
|
+
const req = requestRes.value;
|
|
154
|
+
|
|
155
|
+
const doResult = await client._do(req, {
|
|
156
|
+
context,
|
|
157
|
+
isErrorStatusCode: (statusCode: number) =>
|
|
158
|
+
matchStatusCode({ status: statusCode } as Response, ["4XX", "5XX"]),
|
|
159
|
+
retryConfig: context.retryConfig,
|
|
160
|
+
retryCodes: context.retryCodes,
|
|
161
|
+
});
|
|
162
|
+
if (!doResult.ok) {
|
|
163
|
+
return [doResult, { status: "request-error", request: req }];
|
|
164
|
+
}
|
|
165
|
+
const response = doResult.value;
|
|
166
|
+
|
|
167
|
+
const [result] = await M.match<
|
|
168
|
+
operations.CreateResponseResponse,
|
|
169
|
+
| SDKError
|
|
170
|
+
| ResponseValidationError
|
|
171
|
+
| ConnectionError
|
|
172
|
+
| RequestAbortedError
|
|
173
|
+
| RequestTimeoutError
|
|
174
|
+
| InvalidRequestError
|
|
175
|
+
| UnexpectedClientError
|
|
176
|
+
| SDKValidationError
|
|
177
|
+
>(
|
|
178
|
+
M.json(200, operations.CreateResponseResponse$inboundSchema),
|
|
179
|
+
M.sse(200, operations.CreateResponseResponse$inboundSchema),
|
|
180
|
+
M.fail("4XX"),
|
|
181
|
+
M.fail("5XX"),
|
|
182
|
+
)(response, req);
|
|
183
|
+
if (!result.ok) {
|
|
184
|
+
return [result, { status: "complete", request: req, response }];
|
|
185
|
+
}
|
|
186
|
+
|
|
187
|
+
return [result, { status: "complete", request: req, response }];
|
|
188
|
+
}
|
package/src/lib/config.ts
CHANGED
|
@@ -65,7 +65,7 @@ export function serverURLFromOptions(options: SDKOptions): URL | null {
|
|
|
65
65
|
export const SDK_METADATA = {
|
|
66
66
|
language: "typescript",
|
|
67
67
|
openapiDocVersion: "1.1.0",
|
|
68
|
-
sdkVersion: "0.54.
|
|
68
|
+
sdkVersion: "0.54.24",
|
|
69
69
|
genVersion: "2.935.1",
|
|
70
|
-
userAgent: "speakeasy-sdk/typescript 0.54.
|
|
70
|
+
userAgent: "speakeasy-sdk/typescript 0.54.24 2.935.1 1.1.0 @meetkai/mka1",
|
|
71
71
|
} as const;
|
package/src/mcp-server/server.ts
CHANGED
|
@@ -171,6 +171,7 @@ import { tool$llmConversationsListItems } from "./tools/llmConversationsListItem
|
|
|
171
171
|
import { tool$llmConversationsUpdate } from "./tools/llmConversationsUpdate.js";
|
|
172
172
|
import { tool$llmEmbeddingsEmbed } from "./tools/llmEmbeddingsEmbed.js";
|
|
173
173
|
import { tool$llmEmbeddingsListModels } from "./tools/llmEmbeddingsListModels.js";
|
|
174
|
+
import { tool$llmEvalsAppendAgentTrials } from "./tools/llmEvalsAppendAgentTrials.js";
|
|
174
175
|
import { tool$llmEvalsCancelRun } from "./tools/llmEvalsCancelRun.js";
|
|
175
176
|
import { tool$llmEvalsCreateRun } from "./tools/llmEvalsCreateRun.js";
|
|
176
177
|
import { tool$llmEvalsCreateSchedule } from "./tools/llmEvalsCreateSchedule.js";
|
|
@@ -181,10 +182,14 @@ import { tool$llmEvalsDeleteSchedule } from "./tools/llmEvalsDeleteSchedule.js";
|
|
|
181
182
|
import { tool$llmEvalsDeleteSuite } from "./tools/llmEvalsDeleteSuite.js";
|
|
182
183
|
import { tool$llmEvalsGetArtifacts } from "./tools/llmEvalsGetArtifacts.js";
|
|
183
184
|
import { tool$llmEvalsGetRun } from "./tools/llmEvalsGetRun.js";
|
|
185
|
+
import { tool$llmEvalsGetRunOverview } from "./tools/llmEvalsGetRunOverview.js";
|
|
184
186
|
import { tool$llmEvalsGetSampleAudio } from "./tools/llmEvalsGetSampleAudio.js";
|
|
187
|
+
import { tool$llmEvalsGetSampleTrajectory } from "./tools/llmEvalsGetSampleTrajectory.js";
|
|
185
188
|
import { tool$llmEvalsGetSchedule } from "./tools/llmEvalsGetSchedule.js";
|
|
186
189
|
import { tool$llmEvalsGetSuite } from "./tools/llmEvalsGetSuite.js";
|
|
190
|
+
import { tool$llmEvalsGetSuiteLeaderboard } from "./tools/llmEvalsGetSuiteLeaderboard.js";
|
|
187
191
|
import { tool$llmEvalsGetSuiteVersion } from "./tools/llmEvalsGetSuiteVersion.js";
|
|
192
|
+
import { tool$llmEvalsImportAgentRun } from "./tools/llmEvalsImportAgentRun.js";
|
|
188
193
|
import { tool$llmEvalsImportHistoricalResults } from "./tools/llmEvalsImportHistoricalResults.js";
|
|
189
194
|
import { tool$llmEvalsListRuns } from "./tools/llmEvalsListRuns.js";
|
|
190
195
|
import { tool$llmEvalsListSamples } from "./tools/llmEvalsListSamples.js";
|
|
@@ -197,6 +202,7 @@ import { tool$llmEvalsRerunFailedSamples } from "./tools/llmEvalsRerunFailedSamp
|
|
|
197
202
|
import { tool$llmEvalsRetryFailedRun } from "./tools/llmEvalsRetryFailedRun.js";
|
|
198
203
|
import { tool$llmEvalsTriggerSchedule } from "./tools/llmEvalsTriggerSchedule.js";
|
|
199
204
|
import { tool$llmEvalsUpdateSchedule } from "./tools/llmEvalsUpdateSchedule.js";
|
|
205
|
+
import { tool$llmEvalsUploadSampleTrajectory } from "./tools/llmEvalsUploadSampleTrajectory.js";
|
|
200
206
|
import { tool$llmExtractCreateSchema } from "./tools/llmExtractCreateSchema.js";
|
|
201
207
|
import { tool$llmExtractDeleteSchema } from "./tools/llmExtractDeleteSchema.js";
|
|
202
208
|
import { tool$llmExtractExtract } from "./tools/llmExtractExtract.js";
|
|
@@ -287,6 +293,7 @@ import { tool$llmPromptsRollback } from "./tools/llmPromptsRollback.js";
|
|
|
287
293
|
import { tool$llmPromptsUpdate } from "./tools/llmPromptsUpdate.js";
|
|
288
294
|
import { tool$llmResponsesCancel } from "./tools/llmResponsesCancel.js";
|
|
289
295
|
import { tool$llmResponsesCompact } from "./tools/llmResponsesCompact.js";
|
|
296
|
+
import { tool$llmResponsesCreate } from "./tools/llmResponsesCreate.js";
|
|
290
297
|
import { tool$llmResponsesDelete } from "./tools/llmResponsesDelete.js";
|
|
291
298
|
import { tool$llmResponsesGet } from "./tools/llmResponsesGet.js";
|
|
292
299
|
import { tool$llmResponsesList } from "./tools/llmResponsesList.js";
|
|
@@ -405,7 +412,7 @@ export function createMCPServer(deps: {
|
|
|
405
412
|
}) {
|
|
406
413
|
const server = new McpServer({
|
|
407
414
|
name: "SDK",
|
|
408
|
-
version: "0.54.
|
|
415
|
+
version: "0.54.24",
|
|
409
416
|
});
|
|
410
417
|
|
|
411
418
|
const client = new SDKCore({
|
|
@@ -626,6 +633,7 @@ export function createMCPServer(deps: {
|
|
|
626
633
|
tool(tool$llmEvalsListSuiteVersions);
|
|
627
634
|
tool(tool$llmEvalsGetSuiteVersion);
|
|
628
635
|
tool(tool$llmEvalsListSuiteLeaderboardRuns);
|
|
636
|
+
tool(tool$llmEvalsGetSuiteLeaderboard);
|
|
629
637
|
tool(tool$llmEvalsCreateRun);
|
|
630
638
|
tool(tool$llmEvalsListRuns);
|
|
631
639
|
tool(tool$llmEvalsGetRun);
|
|
@@ -633,9 +641,14 @@ export function createMCPServer(deps: {
|
|
|
633
641
|
tool(tool$llmEvalsCancelRun);
|
|
634
642
|
tool(tool$llmEvalsRerunFailedSamples);
|
|
635
643
|
tool(tool$llmEvalsRetryFailedRun);
|
|
644
|
+
tool(tool$llmEvalsGetRunOverview);
|
|
636
645
|
tool(tool$llmEvalsListSamples);
|
|
637
646
|
tool(tool$llmEvalsGetSampleAudio);
|
|
647
|
+
tool(tool$llmEvalsGetSampleTrajectory);
|
|
648
|
+
tool(tool$llmEvalsUploadSampleTrajectory);
|
|
638
649
|
tool(tool$llmEvalsGetArtifacts);
|
|
650
|
+
tool(tool$llmEvalsImportAgentRun);
|
|
651
|
+
tool(tool$llmEvalsAppendAgentTrials);
|
|
639
652
|
tool(tool$llmEvalsImportHistoricalResults);
|
|
640
653
|
tool(tool$llmEvalsCreateSchedule);
|
|
641
654
|
tool(tool$llmEvalsListSchedules);
|
|
@@ -726,6 +739,7 @@ export function createMCPServer(deps: {
|
|
|
726
739
|
tool(tool$llmPromptsListVersions);
|
|
727
740
|
tool(tool$llmPromptsGetVersion);
|
|
728
741
|
tool(tool$llmPromptsRollback);
|
|
742
|
+
tool(tool$llmResponsesCreate);
|
|
729
743
|
tool(tool$llmResponsesList);
|
|
730
744
|
tool(tool$llmResponsesGet);
|
|
731
745
|
tool(tool$llmResponsesUpdate);
|
|
@@ -0,0 +1,37 @@
|
|
|
1
|
+
/*
|
|
2
|
+
* Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
|
|
3
|
+
*/
|
|
4
|
+
|
|
5
|
+
import { llmEvalsAppendAgentTrials } from "../../funcs/llmEvalsAppendAgentTrials.js";
|
|
6
|
+
import * as operations from "../../models/operations/index.js";
|
|
7
|
+
import { formatResult, ToolDefinition } from "../tools.js";
|
|
8
|
+
|
|
9
|
+
const args = {
|
|
10
|
+
request: operations.AppendAgentEvalTrialsRequest$inboundSchema,
|
|
11
|
+
};
|
|
12
|
+
|
|
13
|
+
export const tool$llmEvalsAppendAgentTrials: ToolDefinition<typeof args> = {
|
|
14
|
+
name: "llm-evals-append-agent-trials",
|
|
15
|
+
description: `Append trials to an open coding-agent run
|
|
16
|
+
|
|
17
|
+
Adds finished trials to a run opened with \`finalize: false\`, so a job started from MKA1 can be watched while it runs instead of appearing complete out of nowhere at the end. Each trial pins its own \`sample_index\` and upserts on (task, model, sample_index): a harness cannot tell a timeout from a lost response, so re-sending a batch is safe and replaces rather than duplicates. The whole batch and its aggregate recompute land in one transaction, serialized per run. Counts, metrics and cost are recomputed from the stored rows on every call, never accumulated from the request, so a replayed batch cannot double them. Send \`finalize: true\` (usually with an empty \`trials\`) to close the run — until then it stays \`in_progress\` and off the leaderboards, which only count completed runs. Appending to an already-completed or cancelled run is rejected: that record is finished, and rewriting it would silently move a number someone may have already read.`,
|
|
18
|
+
args,
|
|
19
|
+
tool: async (client, args, ctx) => {
|
|
20
|
+
const [result, apiCall] = await llmEvalsAppendAgentTrials(
|
|
21
|
+
client,
|
|
22
|
+
args.request,
|
|
23
|
+
{ fetchOptions: { signal: ctx.signal } },
|
|
24
|
+
).$inspect();
|
|
25
|
+
|
|
26
|
+
if (!result.ok) {
|
|
27
|
+
return {
|
|
28
|
+
content: [{ type: "text", text: result.error.message }],
|
|
29
|
+
isError: true,
|
|
30
|
+
};
|
|
31
|
+
}
|
|
32
|
+
|
|
33
|
+
const value = result.value;
|
|
34
|
+
|
|
35
|
+
return formatResult(value, apiCall);
|
|
36
|
+
},
|
|
37
|
+
};
|
|
@@ -0,0 +1,37 @@
|
|
|
1
|
+
/*
|
|
2
|
+
* Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
|
|
3
|
+
*/
|
|
4
|
+
|
|
5
|
+
import { llmEvalsGetRunOverview } from "../../funcs/llmEvalsGetRunOverview.js";
|
|
6
|
+
import * as operations from "../../models/operations/index.js";
|
|
7
|
+
import { formatResult, ToolDefinition } from "../tools.js";
|
|
8
|
+
|
|
9
|
+
const args = {
|
|
10
|
+
request: operations.GetEvalRunOverviewRequest$inboundSchema,
|
|
11
|
+
};
|
|
12
|
+
|
|
13
|
+
export const tool$llmEvalsGetRunOverview: ToolDefinition<typeof args> = {
|
|
14
|
+
name: "llm-evals-get-run-overview",
|
|
15
|
+
description: `Get an eval run overview
|
|
16
|
+
|
|
17
|
+
Aggregate header for one run's trials view: trial counts, average reward, cost, and the input/output/cached token split. Its own route rather than fields on the run object because it scans the run's samples — folding it into \`GET /evals/runs/{run_id}\` would charge that scan to every run list and to the status polling that runs for the whole length of an eval. \`trials.errored\` overlaps \`trials.failed\` instead of partitioning it: a coding-agent trial can carry an agent timeout in \`error\` and still be completed and scored. \`trials.retried\` counts trials rerun through rerun-failed, read from the pre-rerun snapshot, since a rerun overwrites the sample in place.`,
|
|
18
|
+
args,
|
|
19
|
+
tool: async (client, args, ctx) => {
|
|
20
|
+
const [result, apiCall] = await llmEvalsGetRunOverview(
|
|
21
|
+
client,
|
|
22
|
+
args.request,
|
|
23
|
+
{ fetchOptions: { signal: ctx.signal } },
|
|
24
|
+
).$inspect();
|
|
25
|
+
|
|
26
|
+
if (!result.ok) {
|
|
27
|
+
return {
|
|
28
|
+
content: [{ type: "text", text: result.error.message }],
|
|
29
|
+
isError: true,
|
|
30
|
+
};
|
|
31
|
+
}
|
|
32
|
+
|
|
33
|
+
const value = result.value;
|
|
34
|
+
|
|
35
|
+
return formatResult(value, apiCall);
|
|
36
|
+
},
|
|
37
|
+
};
|
|
@@ -0,0 +1,37 @@
|
|
|
1
|
+
/*
|
|
2
|
+
* Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
|
|
3
|
+
*/
|
|
4
|
+
|
|
5
|
+
import { llmEvalsGetSampleTrajectory } from "../../funcs/llmEvalsGetSampleTrajectory.js";
|
|
6
|
+
import * as operations from "../../models/operations/index.js";
|
|
7
|
+
import { formatResult, ToolDefinition } from "../tools.js";
|
|
8
|
+
|
|
9
|
+
const args = {
|
|
10
|
+
request: operations.GetEvalSampleTrajectoryRequest$inboundSchema,
|
|
11
|
+
};
|
|
12
|
+
|
|
13
|
+
export const tool$llmEvalsGetSampleTrajectory: ToolDefinition<typeof args> = {
|
|
14
|
+
name: "llm-evals-get-sample-trajectory",
|
|
15
|
+
description: `Get an eval sample trajectory
|
|
16
|
+
|
|
17
|
+
Returns one coding-agent trial's session — the steps the agent took, verbatim in the harness's interchange format (see \`schema_version\`, e.g. \`ATIF-v1.7\`). Deliberately not part of the samples list: a trajectory averages ~92 KB and that list pages up to 500 rows. Sample indices are unique per (task, model), not per run, so pass \`task_id\` and/or \`model\` when the run covers more than one; an index that matches several trials returns 400 rather than guessing, and never falls back to another trial's session. Returns 404 when the sample does not exist or recorded no trajectory.`,
|
|
18
|
+
args,
|
|
19
|
+
tool: async (client, args, ctx) => {
|
|
20
|
+
const [result, apiCall] = await llmEvalsGetSampleTrajectory(
|
|
21
|
+
client,
|
|
22
|
+
args.request,
|
|
23
|
+
{ fetchOptions: { signal: ctx.signal } },
|
|
24
|
+
).$inspect();
|
|
25
|
+
|
|
26
|
+
if (!result.ok) {
|
|
27
|
+
return {
|
|
28
|
+
content: [{ type: "text", text: result.error.message }],
|
|
29
|
+
isError: true,
|
|
30
|
+
};
|
|
31
|
+
}
|
|
32
|
+
|
|
33
|
+
const value = result.value;
|
|
34
|
+
|
|
35
|
+
return formatResult(value, apiCall);
|
|
36
|
+
},
|
|
37
|
+
};
|
|
@@ -0,0 +1,37 @@
|
|
|
1
|
+
/*
|
|
2
|
+
* Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
|
|
3
|
+
*/
|
|
4
|
+
|
|
5
|
+
import { llmEvalsGetSuiteLeaderboard } from "../../funcs/llmEvalsGetSuiteLeaderboard.js";
|
|
6
|
+
import * as operations from "../../models/operations/index.js";
|
|
7
|
+
import { formatResult, ToolDefinition } from "../tools.js";
|
|
8
|
+
|
|
9
|
+
const args = {
|
|
10
|
+
request: operations.GetEvalSuiteLeaderboardRequest$inboundSchema,
|
|
11
|
+
};
|
|
12
|
+
|
|
13
|
+
export const tool$llmEvalsGetSuiteLeaderboard: ToolDefinition<typeof args> = {
|
|
14
|
+
name: "llm-evals-get-suite-leaderboard",
|
|
15
|
+
description: `Get the coding-agent leaderboard for an eval suite
|
|
16
|
+
|
|
17
|
+
Ranks the suite's completed coding-agent runs, one row per (agent, model, effort). Only runs that recorded an \`agent_name\` participate — a QA or transcription run of the same suite has no agent to attribute a score to and is not a board row. \`accuracy\` is the mean of \`metric\` (default \`reward\`) over the row's scored trials, and \`accuracy_ci\` is the 95% Wald interval around it; both are derived per request rather than stored, so rerunning a failed trial moves them instead of leaving a stale copy behind. \`agent_version\` is reported but is not part of the row identity, so an agent upgrade does not split a row in two. Rows are ordered by accuracy descending, nulls last. Pass \`suite_version\` when the suite has more than one, otherwise the board mixes task sets.`,
|
|
18
|
+
args,
|
|
19
|
+
tool: async (client, args, ctx) => {
|
|
20
|
+
const [result, apiCall] = await llmEvalsGetSuiteLeaderboard(
|
|
21
|
+
client,
|
|
22
|
+
args.request,
|
|
23
|
+
{ fetchOptions: { signal: ctx.signal } },
|
|
24
|
+
).$inspect();
|
|
25
|
+
|
|
26
|
+
if (!result.ok) {
|
|
27
|
+
return {
|
|
28
|
+
content: [{ type: "text", text: result.error.message }],
|
|
29
|
+
isError: true,
|
|
30
|
+
};
|
|
31
|
+
}
|
|
32
|
+
|
|
33
|
+
const value = result.value;
|
|
34
|
+
|
|
35
|
+
return formatResult(value, apiCall);
|
|
36
|
+
},
|
|
37
|
+
};
|
|
@@ -0,0 +1,37 @@
|
|
|
1
|
+
/*
|
|
2
|
+
* Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
|
|
3
|
+
*/
|
|
4
|
+
|
|
5
|
+
import { llmEvalsImportAgentRun } from "../../funcs/llmEvalsImportAgentRun.js";
|
|
6
|
+
import * as operations from "../../models/operations/index.js";
|
|
7
|
+
import { formatResult, ToolDefinition } from "../tools.js";
|
|
8
|
+
|
|
9
|
+
const args = {
|
|
10
|
+
request: operations.ImportAgentEvalRunRequest$inboundSchema,
|
|
11
|
+
};
|
|
12
|
+
|
|
13
|
+
export const tool$llmEvalsImportAgentRun: ToolDefinition<typeof args> = {
|
|
14
|
+
name: "llm-evals-import-agent-run",
|
|
15
|
+
description: `Import a finished coding-agent run
|
|
16
|
+
|
|
17
|
+
Uploads one completed harness job — the run and its trials — directly, so results never round-trip through external storage the way the Hugging Face importer does. Every \`task_id\` must already exist in the target suite version's manifest; unknown ids are rejected rather than invented, because a typo would otherwise import as a task the suite does not have and read as a model that never covered the version. The run is recorded as \`completed\` and is not executed: this is a write, not a run request, so no workflow is started. Trials that cover every task of the version get \`task_ids: null\`, which is what lets the run rank as a complete sweep. Trajectories are NOT part of this payload — a full 91-task run measured 8.3 MB of them — so upload each one against \`PUT /evals/runs/{run_id}/samples/{sample_index}/trajectory\` afterwards. Pass \`idempotency_key\` and a retried upload returns the first run instead of doubling the trials behind a board row.`,
|
|
18
|
+
args,
|
|
19
|
+
tool: async (client, args, ctx) => {
|
|
20
|
+
const [result, apiCall] = await llmEvalsImportAgentRun(
|
|
21
|
+
client,
|
|
22
|
+
args.request,
|
|
23
|
+
{ fetchOptions: { signal: ctx.signal } },
|
|
24
|
+
).$inspect();
|
|
25
|
+
|
|
26
|
+
if (!result.ok) {
|
|
27
|
+
return {
|
|
28
|
+
content: [{ type: "text", text: result.error.message }],
|
|
29
|
+
isError: true,
|
|
30
|
+
};
|
|
31
|
+
}
|
|
32
|
+
|
|
33
|
+
const value = result.value;
|
|
34
|
+
|
|
35
|
+
return formatResult(value, apiCall);
|
|
36
|
+
},
|
|
37
|
+
};
|