@meetkai/mka1 0.54.22 → 0.54.24

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (497) hide show
  1. package/README.md +302 -285
  2. package/bin/mcp-server.js +5917 -3364
  3. package/bin/mcp-server.js.map +47 -18
  4. package/dist/commonjs/funcs/llmEvalsAppendAgentTrials.d.ts +19 -0
  5. package/dist/commonjs/funcs/llmEvalsAppendAgentTrials.d.ts.map +1 -0
  6. package/dist/commonjs/funcs/llmEvalsAppendAgentTrials.js +136 -0
  7. package/dist/commonjs/funcs/llmEvalsAppendAgentTrials.js.map +1 -0
  8. package/dist/commonjs/funcs/llmEvalsGetRunOverview.d.ts +20 -0
  9. package/dist/commonjs/funcs/llmEvalsGetRunOverview.d.ts.map +1 -0
  10. package/dist/commonjs/funcs/llmEvalsGetRunOverview.js +138 -0
  11. package/dist/commonjs/funcs/llmEvalsGetRunOverview.js.map +1 -0
  12. package/dist/commonjs/funcs/llmEvalsGetSampleTrajectory.d.ts +19 -0
  13. package/dist/commonjs/funcs/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
  14. package/dist/commonjs/funcs/llmEvalsGetSampleTrajectory.js +142 -0
  15. package/dist/commonjs/funcs/llmEvalsGetSampleTrajectory.js.map +1 -0
  16. package/dist/commonjs/funcs/llmEvalsGetSuiteLeaderboard.d.ts +20 -0
  17. package/dist/commonjs/funcs/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
  18. package/dist/commonjs/funcs/llmEvalsGetSuiteLeaderboard.js +142 -0
  19. package/dist/commonjs/funcs/llmEvalsGetSuiteLeaderboard.js.map +1 -0
  20. package/dist/commonjs/funcs/llmEvalsImportAgentRun.d.ts +19 -0
  21. package/dist/commonjs/funcs/llmEvalsImportAgentRun.d.ts.map +1 -0
  22. package/dist/commonjs/funcs/llmEvalsImportAgentRun.js +130 -0
  23. package/dist/commonjs/funcs/llmEvalsImportAgentRun.js.map +1 -0
  24. package/dist/commonjs/funcs/llmEvalsUploadSampleTrajectory.d.ts +20 -0
  25. package/dist/commonjs/funcs/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
  26. package/dist/commonjs/funcs/llmEvalsUploadSampleTrajectory.js +146 -0
  27. package/dist/commonjs/funcs/llmEvalsUploadSampleTrajectory.js.map +1 -0
  28. package/dist/commonjs/funcs/llmResponsesCreate.d.ts +25 -0
  29. package/dist/commonjs/funcs/llmResponsesCreate.d.ts.map +1 -0
  30. package/dist/commonjs/funcs/llmResponsesCreate.js +137 -0
  31. package/dist/commonjs/funcs/llmResponsesCreate.js.map +1 -0
  32. package/dist/commonjs/lib/config.d.ts +2 -2
  33. package/dist/commonjs/lib/config.js +2 -2
  34. package/dist/commonjs/mcp-server/mcp-server.js +1 -1
  35. package/dist/commonjs/mcp-server/server.d.ts.map +1 -1
  36. package/dist/commonjs/mcp-server/server.js +15 -1
  37. package/dist/commonjs/mcp-server/server.js.map +1 -1
  38. package/dist/commonjs/mcp-server/tools/llmEvalsAppendAgentTrials.d.ts +8 -0
  39. package/dist/commonjs/mcp-server/tools/llmEvalsAppendAgentTrials.d.ts.map +1 -0
  40. package/dist/commonjs/mcp-server/tools/llmEvalsAppendAgentTrials.js +64 -0
  41. package/dist/commonjs/mcp-server/tools/llmEvalsAppendAgentTrials.js.map +1 -0
  42. package/dist/commonjs/mcp-server/tools/llmEvalsGetRunOverview.d.ts +8 -0
  43. package/dist/commonjs/mcp-server/tools/llmEvalsGetRunOverview.d.ts.map +1 -0
  44. package/dist/commonjs/mcp-server/tools/llmEvalsGetRunOverview.js +64 -0
  45. package/dist/commonjs/mcp-server/tools/llmEvalsGetRunOverview.js.map +1 -0
  46. package/dist/commonjs/mcp-server/tools/llmEvalsGetSampleTrajectory.d.ts +8 -0
  47. package/dist/commonjs/mcp-server/tools/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
  48. package/dist/commonjs/mcp-server/tools/llmEvalsGetSampleTrajectory.js +64 -0
  49. package/dist/commonjs/mcp-server/tools/llmEvalsGetSampleTrajectory.js.map +1 -0
  50. package/dist/commonjs/mcp-server/tools/llmEvalsGetSuiteLeaderboard.d.ts +8 -0
  51. package/dist/commonjs/mcp-server/tools/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
  52. package/dist/commonjs/mcp-server/tools/llmEvalsGetSuiteLeaderboard.js +64 -0
  53. package/dist/commonjs/mcp-server/tools/llmEvalsGetSuiteLeaderboard.js.map +1 -0
  54. package/dist/commonjs/mcp-server/tools/llmEvalsImportAgentRun.d.ts +8 -0
  55. package/dist/commonjs/mcp-server/tools/llmEvalsImportAgentRun.d.ts.map +1 -0
  56. package/dist/commonjs/mcp-server/tools/llmEvalsImportAgentRun.js +64 -0
  57. package/dist/commonjs/mcp-server/tools/llmEvalsImportAgentRun.js.map +1 -0
  58. package/dist/commonjs/mcp-server/tools/llmEvalsUploadSampleTrajectory.d.ts +8 -0
  59. package/dist/commonjs/mcp-server/tools/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
  60. package/dist/commonjs/mcp-server/tools/llmEvalsUploadSampleTrajectory.js +64 -0
  61. package/dist/commonjs/mcp-server/tools/llmEvalsUploadSampleTrajectory.js.map +1 -0
  62. package/dist/commonjs/mcp-server/tools/llmResponsesCreate.d.ts +8 -0
  63. package/dist/commonjs/mcp-server/tools/llmResponsesCreate.d.ts.map +1 -0
  64. package/dist/commonjs/mcp-server/tools/llmResponsesCreate.js +64 -0
  65. package/dist/commonjs/mcp-server/tools/llmResponsesCreate.js.map +1 -0
  66. package/dist/commonjs/models/components/appendagenttrialsrequest.d.ts +111 -0
  67. package/dist/commonjs/models/components/appendagenttrialsrequest.d.ts.map +1 -0
  68. package/dist/commonjs/models/components/appendagenttrialsrequest.js +136 -0
  69. package/dist/commonjs/models/components/appendagenttrialsrequest.js.map +1 -0
  70. package/dist/commonjs/models/components/evalleaderboardrow.d.ts +85 -0
  71. package/dist/commonjs/models/components/evalleaderboardrow.d.ts.map +1 -0
  72. package/dist/commonjs/models/components/evalleaderboardrow.js +129 -0
  73. package/dist/commonjs/models/components/evalleaderboardrow.js.map +1 -0
  74. package/dist/commonjs/models/components/evalrunoverview.d.ts +101 -0
  75. package/dist/commonjs/models/components/evalrunoverview.d.ts.map +1 -0
  76. package/dist/commonjs/models/components/evalrunoverview.js +150 -0
  77. package/dist/commonjs/models/components/evalrunoverview.js.map +1 -0
  78. package/dist/commonjs/models/components/evalsampleobject.d.ts +32 -0
  79. package/dist/commonjs/models/components/evalsampleobject.d.ts.map +1 -1
  80. package/dist/commonjs/models/components/evalsampleobject.js +20 -0
  81. package/dist/commonjs/models/components/evalsampleobject.js.map +1 -1
  82. package/dist/commonjs/models/components/evalsampletrajectoryuploadedobject.d.ts +32 -0
  83. package/dist/commonjs/models/components/evalsampletrajectoryuploadedobject.d.ts.map +1 -0
  84. package/dist/commonjs/models/components/evalsampletrajectoryuploadedobject.js +87 -0
  85. package/dist/commonjs/models/components/evalsampletrajectoryuploadedobject.js.map +1 -0
  86. package/dist/commonjs/models/components/evalsuiteleaderboard.d.ts +35 -0
  87. package/dist/commonjs/models/components/evalsuiteleaderboard.d.ts.map +1 -0
  88. package/dist/commonjs/models/components/evalsuiteleaderboard.js +78 -0
  89. package/dist/commonjs/models/components/evalsuiteleaderboard.js.map +1 -0
  90. package/dist/commonjs/models/components/importagentrunrequest.d.ts +164 -0
  91. package/dist/commonjs/models/components/importagentrunrequest.d.ts.map +1 -0
  92. package/dist/commonjs/models/components/importagentrunrequest.js +182 -0
  93. package/dist/commonjs/models/components/importagentrunrequest.js.map +1 -0
  94. package/dist/commonjs/models/components/index.d.ts +8 -0
  95. package/dist/commonjs/models/components/index.d.ts.map +1 -1
  96. package/dist/commonjs/models/components/index.js +8 -0
  97. package/dist/commonjs/models/components/index.js.map +1 -1
  98. package/dist/commonjs/models/components/responsescreaterequest.d.ts +432 -0
  99. package/dist/commonjs/models/components/responsescreaterequest.d.ts.map +1 -0
  100. package/dist/commonjs/models/components/responsescreaterequest.js +455 -0
  101. package/dist/commonjs/models/components/responsescreaterequest.js.map +1 -0
  102. package/dist/commonjs/models/components/uploadevalsampletrajectoryrequest.d.ts +34 -0
  103. package/dist/commonjs/models/components/uploadevalsampletrajectoryrequest.d.ts.map +1 -0
  104. package/dist/commonjs/models/components/uploadevalsampletrajectoryrequest.js +71 -0
  105. package/dist/commonjs/models/components/uploadevalsampletrajectoryrequest.js.map +1 -0
  106. package/dist/commonjs/models/operations/appendagentevaltrials.d.ts +264 -0
  107. package/dist/commonjs/models/operations/appendagentevaltrials.d.ts.map +1 -0
  108. package/dist/commonjs/models/operations/appendagentevaltrials.js +371 -0
  109. package/dist/commonjs/models/operations/appendagentevaltrials.js.map +1 -0
  110. package/dist/commonjs/models/operations/cancelevalrun.d.ts +20 -0
  111. package/dist/commonjs/models/operations/cancelevalrun.d.ts.map +1 -1
  112. package/dist/commonjs/models/operations/cancelevalrun.js +16 -0
  113. package/dist/commonjs/models/operations/cancelevalrun.js.map +1 -1
  114. package/dist/commonjs/models/operations/createevalrun.d.ts +20 -0
  115. package/dist/commonjs/models/operations/createevalrun.d.ts.map +1 -1
  116. package/dist/commonjs/models/operations/createevalrun.js +16 -0
  117. package/dist/commonjs/models/operations/createevalrun.js.map +1 -1
  118. package/dist/commonjs/models/operations/createresponse.d.ts +64 -0
  119. package/dist/commonjs/models/operations/createresponse.d.ts.map +1 -0
  120. package/dist/commonjs/models/operations/createresponse.js +128 -0
  121. package/dist/commonjs/models/operations/createresponse.js.map +1 -0
  122. package/dist/commonjs/models/operations/getevalrun.d.ts +20 -0
  123. package/dist/commonjs/models/operations/getevalrun.d.ts.map +1 -1
  124. package/dist/commonjs/models/operations/getevalrun.js +16 -0
  125. package/dist/commonjs/models/operations/getevalrun.js.map +1 -1
  126. package/dist/commonjs/models/operations/getevalrunoverview.d.ts +24 -0
  127. package/dist/commonjs/models/operations/getevalrunoverview.d.ts.map +1 -0
  128. package/dist/commonjs/models/operations/getevalrunoverview.js +73 -0
  129. package/dist/commonjs/models/operations/getevalrunoverview.js.map +1 -0
  130. package/dist/commonjs/models/operations/getevalsampletrajectory.d.ts +75 -0
  131. package/dist/commonjs/models/operations/getevalsampletrajectory.d.ts.map +1 -0
  132. package/dist/commonjs/models/operations/getevalsampletrajectory.js +133 -0
  133. package/dist/commonjs/models/operations/getevalsampletrajectory.js.map +1 -0
  134. package/dist/commonjs/models/operations/getevalsuiteleaderboard.d.ts +32 -0
  135. package/dist/commonjs/models/operations/getevalsuiteleaderboard.d.ts.map +1 -0
  136. package/dist/commonjs/models/operations/getevalsuiteleaderboard.js +83 -0
  137. package/dist/commonjs/models/operations/getevalsuiteleaderboard.js.map +1 -0
  138. package/dist/commonjs/models/operations/importagentevalrun.d.ts +262 -0
  139. package/dist/commonjs/models/operations/importagentevalrun.d.ts.map +1 -0
  140. package/dist/commonjs/models/operations/importagentevalrun.js +367 -0
  141. package/dist/commonjs/models/operations/importagentevalrun.js.map +1 -0
  142. package/dist/commonjs/models/operations/index.d.ts +7 -0
  143. package/dist/commonjs/models/operations/index.d.ts.map +1 -1
  144. package/dist/commonjs/models/operations/index.js +7 -0
  145. package/dist/commonjs/models/operations/index.js.map +1 -1
  146. package/dist/commonjs/models/operations/listevalruns.d.ts +20 -0
  147. package/dist/commonjs/models/operations/listevalruns.d.ts.map +1 -1
  148. package/dist/commonjs/models/operations/listevalruns.js +16 -0
  149. package/dist/commonjs/models/operations/listevalruns.js.map +1 -1
  150. package/dist/commonjs/models/operations/listevalscheduleruns.d.ts +20 -0
  151. package/dist/commonjs/models/operations/listevalscheduleruns.d.ts.map +1 -1
  152. package/dist/commonjs/models/operations/listevalscheduleruns.js +16 -0
  153. package/dist/commonjs/models/operations/listevalscheduleruns.js.map +1 -1
  154. package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.d.ts +20 -0
  155. package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.d.ts.map +1 -1
  156. package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.js +16 -0
  157. package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.js.map +1 -1
  158. package/dist/commonjs/models/operations/rerunfailedevalsamples.d.ts +20 -0
  159. package/dist/commonjs/models/operations/rerunfailedevalsamples.d.ts.map +1 -1
  160. package/dist/commonjs/models/operations/rerunfailedevalsamples.js +16 -0
  161. package/dist/commonjs/models/operations/rerunfailedevalsamples.js.map +1 -1
  162. package/dist/commonjs/models/operations/retryfailedevalrun.d.ts +20 -0
  163. package/dist/commonjs/models/operations/retryfailedevalrun.d.ts.map +1 -1
  164. package/dist/commonjs/models/operations/retryfailedevalrun.js +16 -0
  165. package/dist/commonjs/models/operations/retryfailedevalrun.js.map +1 -1
  166. package/dist/commonjs/models/operations/uploadevalsampletrajectory.d.ts +31 -0
  167. package/dist/commonjs/models/operations/uploadevalsampletrajectory.d.ts.map +1 -0
  168. package/dist/commonjs/models/operations/uploadevalsampletrajectory.js +86 -0
  169. package/dist/commonjs/models/operations/uploadevalsampletrajectory.js.map +1 -0
  170. package/dist/commonjs/react-query/index.d.ts +7 -0
  171. package/dist/commonjs/react-query/index.d.ts.map +1 -1
  172. package/dist/commonjs/react-query/index.js +7 -0
  173. package/dist/commonjs/react-query/index.js.map +1 -1
  174. package/dist/commonjs/react-query/llmEvalsAppendAgentTrials.d.ts +28 -0
  175. package/dist/commonjs/react-query/llmEvalsAppendAgentTrials.d.ts.map +1 -0
  176. package/dist/commonjs/react-query/llmEvalsAppendAgentTrials.js +47 -0
  177. package/dist/commonjs/react-query/llmEvalsAppendAgentTrials.js.map +1 -0
  178. package/dist/commonjs/react-query/llmEvalsGetRunOverview.core.d.ts +16 -0
  179. package/dist/commonjs/react-query/llmEvalsGetRunOverview.core.d.ts.map +1 -0
  180. package/dist/commonjs/react-query/llmEvalsGetRunOverview.core.js +37 -0
  181. package/dist/commonjs/react-query/llmEvalsGetRunOverview.core.js.map +1 -0
  182. package/dist/commonjs/react-query/llmEvalsGetRunOverview.d.ts +40 -0
  183. package/dist/commonjs/react-query/llmEvalsGetRunOverview.d.ts.map +1 -0
  184. package/dist/commonjs/react-query/llmEvalsGetRunOverview.js +60 -0
  185. package/dist/commonjs/react-query/llmEvalsGetRunOverview.js.map +1 -0
  186. package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.core.d.ts +16 -0
  187. package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.core.d.ts.map +1 -0
  188. package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.core.js +45 -0
  189. package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.core.js.map +1 -0
  190. package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.d.ts +44 -0
  191. package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
  192. package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.js +65 -0
  193. package/dist/commonjs/react-query/llmEvalsGetSampleTrajectory.js.map +1 -0
  194. package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.core.d.ts +20 -0
  195. package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.core.d.ts.map +1 -0
  196. package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.core.js +41 -0
  197. package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.core.js.map +1 -0
  198. package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.d.ts +48 -0
  199. package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
  200. package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.js +65 -0
  201. package/dist/commonjs/react-query/llmEvalsGetSuiteLeaderboard.js.map +1 -0
  202. package/dist/commonjs/react-query/llmEvalsImportAgentRun.d.ts +28 -0
  203. package/dist/commonjs/react-query/llmEvalsImportAgentRun.d.ts.map +1 -0
  204. package/dist/commonjs/react-query/llmEvalsImportAgentRun.js +47 -0
  205. package/dist/commonjs/react-query/llmEvalsImportAgentRun.js.map +1 -0
  206. package/dist/commonjs/react-query/llmEvalsUploadSampleTrajectory.d.ts +29 -0
  207. package/dist/commonjs/react-query/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
  208. package/dist/commonjs/react-query/llmEvalsUploadSampleTrajectory.js +47 -0
  209. package/dist/commonjs/react-query/llmEvalsUploadSampleTrajectory.js.map +1 -0
  210. package/dist/commonjs/react-query/llmResponsesCreate.d.ts +34 -0
  211. package/dist/commonjs/react-query/llmResponsesCreate.d.ts.map +1 -0
  212. package/dist/commonjs/react-query/llmResponsesCreate.js +50 -0
  213. package/dist/commonjs/react-query/llmResponsesCreate.js.map +1 -0
  214. package/dist/commonjs/sdk/evals.d.ts +42 -0
  215. package/dist/commonjs/sdk/evals.d.ts.map +1 -1
  216. package/dist/commonjs/sdk/evals.js +60 -0
  217. package/dist/commonjs/sdk/evals.js.map +1 -1
  218. package/dist/commonjs/sdk/responses.d.ts +11 -0
  219. package/dist/commonjs/sdk/responses.d.ts.map +1 -1
  220. package/dist/commonjs/sdk/responses.js +13 -1
  221. package/dist/commonjs/sdk/responses.js.map +1 -1
  222. package/dist/esm/funcs/llmEvalsAppendAgentTrials.d.ts +19 -0
  223. package/dist/esm/funcs/llmEvalsAppendAgentTrials.d.ts.map +1 -0
  224. package/dist/esm/funcs/llmEvalsAppendAgentTrials.js +100 -0
  225. package/dist/esm/funcs/llmEvalsAppendAgentTrials.js.map +1 -0
  226. package/dist/esm/funcs/llmEvalsGetRunOverview.d.ts +20 -0
  227. package/dist/esm/funcs/llmEvalsGetRunOverview.d.ts.map +1 -0
  228. package/dist/esm/funcs/llmEvalsGetRunOverview.js +102 -0
  229. package/dist/esm/funcs/llmEvalsGetRunOverview.js.map +1 -0
  230. package/dist/esm/funcs/llmEvalsGetSampleTrajectory.d.ts +19 -0
  231. package/dist/esm/funcs/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
  232. package/dist/esm/funcs/llmEvalsGetSampleTrajectory.js +106 -0
  233. package/dist/esm/funcs/llmEvalsGetSampleTrajectory.js.map +1 -0
  234. package/dist/esm/funcs/llmEvalsGetSuiteLeaderboard.d.ts +20 -0
  235. package/dist/esm/funcs/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
  236. package/dist/esm/funcs/llmEvalsGetSuiteLeaderboard.js +106 -0
  237. package/dist/esm/funcs/llmEvalsGetSuiteLeaderboard.js.map +1 -0
  238. package/dist/esm/funcs/llmEvalsImportAgentRun.d.ts +19 -0
  239. package/dist/esm/funcs/llmEvalsImportAgentRun.d.ts.map +1 -0
  240. package/dist/esm/funcs/llmEvalsImportAgentRun.js +94 -0
  241. package/dist/esm/funcs/llmEvalsImportAgentRun.js.map +1 -0
  242. package/dist/esm/funcs/llmEvalsUploadSampleTrajectory.d.ts +20 -0
  243. package/dist/esm/funcs/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
  244. package/dist/esm/funcs/llmEvalsUploadSampleTrajectory.js +110 -0
  245. package/dist/esm/funcs/llmEvalsUploadSampleTrajectory.js.map +1 -0
  246. package/dist/esm/funcs/llmResponsesCreate.d.ts +25 -0
  247. package/dist/esm/funcs/llmResponsesCreate.d.ts.map +1 -0
  248. package/dist/esm/funcs/llmResponsesCreate.js +100 -0
  249. package/dist/esm/funcs/llmResponsesCreate.js.map +1 -0
  250. package/dist/esm/lib/config.d.ts +2 -2
  251. package/dist/esm/lib/config.js +2 -2
  252. package/dist/esm/mcp-server/mcp-server.js +1 -1
  253. package/dist/esm/mcp-server/server.d.ts.map +1 -1
  254. package/dist/esm/mcp-server/server.js +15 -1
  255. package/dist/esm/mcp-server/server.js.map +1 -1
  256. package/dist/esm/mcp-server/tools/llmEvalsAppendAgentTrials.d.ts +8 -0
  257. package/dist/esm/mcp-server/tools/llmEvalsAppendAgentTrials.d.ts.map +1 -0
  258. package/dist/esm/mcp-server/tools/llmEvalsAppendAgentTrials.js +28 -0
  259. package/dist/esm/mcp-server/tools/llmEvalsAppendAgentTrials.js.map +1 -0
  260. package/dist/esm/mcp-server/tools/llmEvalsGetRunOverview.d.ts +8 -0
  261. package/dist/esm/mcp-server/tools/llmEvalsGetRunOverview.d.ts.map +1 -0
  262. package/dist/esm/mcp-server/tools/llmEvalsGetRunOverview.js +28 -0
  263. package/dist/esm/mcp-server/tools/llmEvalsGetRunOverview.js.map +1 -0
  264. package/dist/esm/mcp-server/tools/llmEvalsGetSampleTrajectory.d.ts +8 -0
  265. package/dist/esm/mcp-server/tools/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
  266. package/dist/esm/mcp-server/tools/llmEvalsGetSampleTrajectory.js +28 -0
  267. package/dist/esm/mcp-server/tools/llmEvalsGetSampleTrajectory.js.map +1 -0
  268. package/dist/esm/mcp-server/tools/llmEvalsGetSuiteLeaderboard.d.ts +8 -0
  269. package/dist/esm/mcp-server/tools/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
  270. package/dist/esm/mcp-server/tools/llmEvalsGetSuiteLeaderboard.js +28 -0
  271. package/dist/esm/mcp-server/tools/llmEvalsGetSuiteLeaderboard.js.map +1 -0
  272. package/dist/esm/mcp-server/tools/llmEvalsImportAgentRun.d.ts +8 -0
  273. package/dist/esm/mcp-server/tools/llmEvalsImportAgentRun.d.ts.map +1 -0
  274. package/dist/esm/mcp-server/tools/llmEvalsImportAgentRun.js +28 -0
  275. package/dist/esm/mcp-server/tools/llmEvalsImportAgentRun.js.map +1 -0
  276. package/dist/esm/mcp-server/tools/llmEvalsUploadSampleTrajectory.d.ts +8 -0
  277. package/dist/esm/mcp-server/tools/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
  278. package/dist/esm/mcp-server/tools/llmEvalsUploadSampleTrajectory.js +28 -0
  279. package/dist/esm/mcp-server/tools/llmEvalsUploadSampleTrajectory.js.map +1 -0
  280. package/dist/esm/mcp-server/tools/llmResponsesCreate.d.ts +8 -0
  281. package/dist/esm/mcp-server/tools/llmResponsesCreate.d.ts.map +1 -0
  282. package/dist/esm/mcp-server/tools/llmResponsesCreate.js +28 -0
  283. package/dist/esm/mcp-server/tools/llmResponsesCreate.js.map +1 -0
  284. package/dist/esm/models/components/appendagenttrialsrequest.d.ts +111 -0
  285. package/dist/esm/models/components/appendagenttrialsrequest.d.ts.map +1 -0
  286. package/dist/esm/models/components/appendagenttrialsrequest.js +96 -0
  287. package/dist/esm/models/components/appendagenttrialsrequest.js.map +1 -0
  288. package/dist/esm/models/components/evalleaderboardrow.d.ts +85 -0
  289. package/dist/esm/models/components/evalleaderboardrow.d.ts.map +1 -0
  290. package/dist/esm/models/components/evalleaderboardrow.js +89 -0
  291. package/dist/esm/models/components/evalleaderboardrow.js.map +1 -0
  292. package/dist/esm/models/components/evalrunoverview.d.ts +101 -0
  293. package/dist/esm/models/components/evalrunoverview.d.ts.map +1 -0
  294. package/dist/esm/models/components/evalrunoverview.js +108 -0
  295. package/dist/esm/models/components/evalrunoverview.js.map +1 -0
  296. package/dist/esm/models/components/evalsampleobject.d.ts +32 -0
  297. package/dist/esm/models/components/evalsampleobject.d.ts.map +1 -1
  298. package/dist/esm/models/components/evalsampleobject.js +20 -0
  299. package/dist/esm/models/components/evalsampleobject.js.map +1 -1
  300. package/dist/esm/models/components/evalsampletrajectoryuploadedobject.d.ts +32 -0
  301. package/dist/esm/models/components/evalsampletrajectoryuploadedobject.d.ts.map +1 -0
  302. package/dist/esm/models/components/evalsampletrajectoryuploadedobject.js +49 -0
  303. package/dist/esm/models/components/evalsampletrajectoryuploadedobject.js.map +1 -0
  304. package/dist/esm/models/components/evalsuiteleaderboard.d.ts +35 -0
  305. package/dist/esm/models/components/evalsuiteleaderboard.d.ts.map +1 -0
  306. package/dist/esm/models/components/evalsuiteleaderboard.js +40 -0
  307. package/dist/esm/models/components/evalsuiteleaderboard.js.map +1 -0
  308. package/dist/esm/models/components/importagentrunrequest.d.ts +164 -0
  309. package/dist/esm/models/components/importagentrunrequest.d.ts.map +1 -0
  310. package/dist/esm/models/components/importagentrunrequest.js +142 -0
  311. package/dist/esm/models/components/importagentrunrequest.js.map +1 -0
  312. package/dist/esm/models/components/index.d.ts +8 -0
  313. package/dist/esm/models/components/index.d.ts.map +1 -1
  314. package/dist/esm/models/components/index.js +8 -0
  315. package/dist/esm/models/components/index.js.map +1 -1
  316. package/dist/esm/models/components/responsescreaterequest.d.ts +432 -0
  317. package/dist/esm/models/components/responsescreaterequest.d.ts.map +1 -0
  318. package/dist/esm/models/components/responsescreaterequest.js +403 -0
  319. package/dist/esm/models/components/responsescreaterequest.js.map +1 -0
  320. package/dist/esm/models/components/uploadevalsampletrajectoryrequest.d.ts +34 -0
  321. package/dist/esm/models/components/uploadevalsampletrajectoryrequest.d.ts.map +1 -0
  322. package/dist/esm/models/components/uploadevalsampletrajectoryrequest.js +33 -0
  323. package/dist/esm/models/components/uploadevalsampletrajectoryrequest.js.map +1 -0
  324. package/dist/esm/models/operations/appendagentevaltrials.d.ts +264 -0
  325. package/dist/esm/models/operations/appendagentevaltrials.d.ts.map +1 -0
  326. package/dist/esm/models/operations/appendagentevaltrials.js +323 -0
  327. package/dist/esm/models/operations/appendagentevaltrials.js.map +1 -0
  328. package/dist/esm/models/operations/cancelevalrun.d.ts +20 -0
  329. package/dist/esm/models/operations/cancelevalrun.d.ts.map +1 -1
  330. package/dist/esm/models/operations/cancelevalrun.js +16 -0
  331. package/dist/esm/models/operations/cancelevalrun.js.map +1 -1
  332. package/dist/esm/models/operations/createevalrun.d.ts +20 -0
  333. package/dist/esm/models/operations/createevalrun.d.ts.map +1 -1
  334. package/dist/esm/models/operations/createevalrun.js +16 -0
  335. package/dist/esm/models/operations/createevalrun.js.map +1 -1
  336. package/dist/esm/models/operations/createresponse.d.ts +64 -0
  337. package/dist/esm/models/operations/createresponse.d.ts.map +1 -0
  338. package/dist/esm/models/operations/createresponse.js +86 -0
  339. package/dist/esm/models/operations/createresponse.js.map +1 -0
  340. package/dist/esm/models/operations/getevalrun.d.ts +20 -0
  341. package/dist/esm/models/operations/getevalrun.d.ts.map +1 -1
  342. package/dist/esm/models/operations/getevalrun.js +16 -0
  343. package/dist/esm/models/operations/getevalrun.js.map +1 -1
  344. package/dist/esm/models/operations/getevalrunoverview.d.ts +24 -0
  345. package/dist/esm/models/operations/getevalrunoverview.d.ts.map +1 -0
  346. package/dist/esm/models/operations/getevalrunoverview.js +35 -0
  347. package/dist/esm/models/operations/getevalrunoverview.js.map +1 -0
  348. package/dist/esm/models/operations/getevalsampletrajectory.d.ts +75 -0
  349. package/dist/esm/models/operations/getevalsampletrajectory.d.ts.map +1 -0
  350. package/dist/esm/models/operations/getevalsampletrajectory.js +93 -0
  351. package/dist/esm/models/operations/getevalsampletrajectory.js.map +1 -0
  352. package/dist/esm/models/operations/getevalsuiteleaderboard.d.ts +32 -0
  353. package/dist/esm/models/operations/getevalsuiteleaderboard.d.ts.map +1 -0
  354. package/dist/esm/models/operations/getevalsuiteleaderboard.js +45 -0
  355. package/dist/esm/models/operations/getevalsuiteleaderboard.js.map +1 -0
  356. package/dist/esm/models/operations/importagentevalrun.d.ts +262 -0
  357. package/dist/esm/models/operations/importagentevalrun.d.ts.map +1 -0
  358. package/dist/esm/models/operations/importagentevalrun.js +319 -0
  359. package/dist/esm/models/operations/importagentevalrun.js.map +1 -0
  360. package/dist/esm/models/operations/index.d.ts +7 -0
  361. package/dist/esm/models/operations/index.d.ts.map +1 -1
  362. package/dist/esm/models/operations/index.js +7 -0
  363. package/dist/esm/models/operations/index.js.map +1 -1
  364. package/dist/esm/models/operations/listevalruns.d.ts +20 -0
  365. package/dist/esm/models/operations/listevalruns.d.ts.map +1 -1
  366. package/dist/esm/models/operations/listevalruns.js +16 -0
  367. package/dist/esm/models/operations/listevalruns.js.map +1 -1
  368. package/dist/esm/models/operations/listevalscheduleruns.d.ts +20 -0
  369. package/dist/esm/models/operations/listevalscheduleruns.d.ts.map +1 -1
  370. package/dist/esm/models/operations/listevalscheduleruns.js +16 -0
  371. package/dist/esm/models/operations/listevalscheduleruns.js.map +1 -1
  372. package/dist/esm/models/operations/listevalsuiteleaderboardruns.d.ts +20 -0
  373. package/dist/esm/models/operations/listevalsuiteleaderboardruns.d.ts.map +1 -1
  374. package/dist/esm/models/operations/listevalsuiteleaderboardruns.js +16 -0
  375. package/dist/esm/models/operations/listevalsuiteleaderboardruns.js.map +1 -1
  376. package/dist/esm/models/operations/rerunfailedevalsamples.d.ts +20 -0
  377. package/dist/esm/models/operations/rerunfailedevalsamples.d.ts.map +1 -1
  378. package/dist/esm/models/operations/rerunfailedevalsamples.js +16 -0
  379. package/dist/esm/models/operations/rerunfailedevalsamples.js.map +1 -1
  380. package/dist/esm/models/operations/retryfailedevalrun.d.ts +20 -0
  381. package/dist/esm/models/operations/retryfailedevalrun.d.ts.map +1 -1
  382. package/dist/esm/models/operations/retryfailedevalrun.js +16 -0
  383. package/dist/esm/models/operations/retryfailedevalrun.js.map +1 -1
  384. package/dist/esm/models/operations/uploadevalsampletrajectory.d.ts +31 -0
  385. package/dist/esm/models/operations/uploadevalsampletrajectory.d.ts.map +1 -0
  386. package/dist/esm/models/operations/uploadevalsampletrajectory.js +48 -0
  387. package/dist/esm/models/operations/uploadevalsampletrajectory.js.map +1 -0
  388. package/dist/esm/react-query/index.d.ts +7 -0
  389. package/dist/esm/react-query/index.d.ts.map +1 -1
  390. package/dist/esm/react-query/index.js +7 -0
  391. package/dist/esm/react-query/index.js.map +1 -1
  392. package/dist/esm/react-query/llmEvalsAppendAgentTrials.d.ts +28 -0
  393. package/dist/esm/react-query/llmEvalsAppendAgentTrials.d.ts.map +1 -0
  394. package/dist/esm/react-query/llmEvalsAppendAgentTrials.js +42 -0
  395. package/dist/esm/react-query/llmEvalsAppendAgentTrials.js.map +1 -0
  396. package/dist/esm/react-query/llmEvalsGetRunOverview.core.d.ts +16 -0
  397. package/dist/esm/react-query/llmEvalsGetRunOverview.core.d.ts.map +1 -0
  398. package/dist/esm/react-query/llmEvalsGetRunOverview.core.js +32 -0
  399. package/dist/esm/react-query/llmEvalsGetRunOverview.core.js.map +1 -0
  400. package/dist/esm/react-query/llmEvalsGetRunOverview.d.ts +40 -0
  401. package/dist/esm/react-query/llmEvalsGetRunOverview.d.ts.map +1 -0
  402. package/dist/esm/react-query/llmEvalsGetRunOverview.js +50 -0
  403. package/dist/esm/react-query/llmEvalsGetRunOverview.js.map +1 -0
  404. package/dist/esm/react-query/llmEvalsGetSampleTrajectory.core.d.ts +16 -0
  405. package/dist/esm/react-query/llmEvalsGetSampleTrajectory.core.d.ts.map +1 -0
  406. package/dist/esm/react-query/llmEvalsGetSampleTrajectory.core.js +40 -0
  407. package/dist/esm/react-query/llmEvalsGetSampleTrajectory.core.js.map +1 -0
  408. package/dist/esm/react-query/llmEvalsGetSampleTrajectory.d.ts +44 -0
  409. package/dist/esm/react-query/llmEvalsGetSampleTrajectory.d.ts.map +1 -0
  410. package/dist/esm/react-query/llmEvalsGetSampleTrajectory.js +55 -0
  411. package/dist/esm/react-query/llmEvalsGetSampleTrajectory.js.map +1 -0
  412. package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.core.d.ts +20 -0
  413. package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.core.d.ts.map +1 -0
  414. package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.core.js +36 -0
  415. package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.core.js.map +1 -0
  416. package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.d.ts +48 -0
  417. package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.d.ts.map +1 -0
  418. package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.js +55 -0
  419. package/dist/esm/react-query/llmEvalsGetSuiteLeaderboard.js.map +1 -0
  420. package/dist/esm/react-query/llmEvalsImportAgentRun.d.ts +28 -0
  421. package/dist/esm/react-query/llmEvalsImportAgentRun.d.ts.map +1 -0
  422. package/dist/esm/react-query/llmEvalsImportAgentRun.js +42 -0
  423. package/dist/esm/react-query/llmEvalsImportAgentRun.js.map +1 -0
  424. package/dist/esm/react-query/llmEvalsUploadSampleTrajectory.d.ts +29 -0
  425. package/dist/esm/react-query/llmEvalsUploadSampleTrajectory.d.ts.map +1 -0
  426. package/dist/esm/react-query/llmEvalsUploadSampleTrajectory.js +42 -0
  427. package/dist/esm/react-query/llmEvalsUploadSampleTrajectory.js.map +1 -0
  428. package/dist/esm/react-query/llmResponsesCreate.d.ts +34 -0
  429. package/dist/esm/react-query/llmResponsesCreate.d.ts.map +1 -0
  430. package/dist/esm/react-query/llmResponsesCreate.js +43 -0
  431. package/dist/esm/react-query/llmResponsesCreate.js.map +1 -0
  432. package/dist/esm/sdk/evals.d.ts +42 -0
  433. package/dist/esm/sdk/evals.d.ts.map +1 -1
  434. package/dist/esm/sdk/evals.js +60 -0
  435. package/dist/esm/sdk/evals.js.map +1 -1
  436. package/dist/esm/sdk/responses.d.ts +11 -0
  437. package/dist/esm/sdk/responses.d.ts.map +1 -1
  438. package/dist/esm/sdk/responses.js +11 -0
  439. package/dist/esm/sdk/responses.js.map +1 -1
  440. package/jsr.json +1 -1
  441. package/package.json +1 -1
  442. package/src/funcs/llmEvalsAppendAgentTrials.ts +188 -0
  443. package/src/funcs/llmEvalsGetRunOverview.ts +192 -0
  444. package/src/funcs/llmEvalsGetSampleTrajectory.ts +197 -0
  445. package/src/funcs/llmEvalsGetSuiteLeaderboard.ts +197 -0
  446. package/src/funcs/llmEvalsImportAgentRun.ts +181 -0
  447. package/src/funcs/llmEvalsUploadSampleTrajectory.ts +201 -0
  448. package/src/funcs/llmResponsesCreate.ts +188 -0
  449. package/src/lib/config.ts +2 -2
  450. package/src/mcp-server/mcp-server.ts +1 -1
  451. package/src/mcp-server/server.ts +15 -1
  452. package/src/mcp-server/tools/llmEvalsAppendAgentTrials.ts +37 -0
  453. package/src/mcp-server/tools/llmEvalsGetRunOverview.ts +37 -0
  454. package/src/mcp-server/tools/llmEvalsGetSampleTrajectory.ts +37 -0
  455. package/src/mcp-server/tools/llmEvalsGetSuiteLeaderboard.ts +37 -0
  456. package/src/mcp-server/tools/llmEvalsImportAgentRun.ts +37 -0
  457. package/src/mcp-server/tools/llmEvalsUploadSampleTrajectory.ts +38 -0
  458. package/src/mcp-server/tools/llmResponsesCreate.ts +37 -0
  459. package/src/models/components/appendagenttrialsrequest.ts +224 -0
  460. package/src/models/components/evalleaderboardrow.ts +200 -0
  461. package/src/models/components/evalrunoverview.ts +240 -0
  462. package/src/models/components/evalsampleobject.ts +48 -0
  463. package/src/models/components/evalsampletrajectoryuploadedobject.ts +98 -0
  464. package/src/models/components/evalsuiteleaderboard.ts +93 -0
  465. package/src/models/components/importagentrunrequest.ts +319 -0
  466. package/src/models/components/index.ts +8 -0
  467. package/src/models/components/responsescreaterequest.ts +1076 -0
  468. package/src/models/components/uploadevalsampletrajectoryrequest.ts +79 -0
  469. package/src/models/operations/appendagentevaltrials.ts +678 -0
  470. package/src/models/operations/cancelevalrun.ts +36 -0
  471. package/src/models/operations/createevalrun.ts +36 -0
  472. package/src/models/operations/createresponse.ts +198 -0
  473. package/src/models/operations/getevalrun.ts +36 -0
  474. package/src/models/operations/getevalrunoverview.ts +73 -0
  475. package/src/models/operations/getevalsampletrajectory.ts +199 -0
  476. package/src/models/operations/getevalsuiteleaderboard.ts +93 -0
  477. package/src/models/operations/importagentevalrun.ts +665 -0
  478. package/src/models/operations/index.ts +7 -0
  479. package/src/models/operations/listevalruns.ts +36 -0
  480. package/src/models/operations/listevalscheduleruns.ts +36 -0
  481. package/src/models/operations/listevalsuiteleaderboardruns.ts +36 -0
  482. package/src/models/operations/rerunfailedevalsamples.ts +36 -0
  483. package/src/models/operations/retryfailedevalrun.ts +36 -0
  484. package/src/models/operations/uploadevalsampletrajectory.ts +98 -0
  485. package/src/react-query/index.ts +7 -0
  486. package/src/react-query/llmEvalsAppendAgentTrials.ts +109 -0
  487. package/src/react-query/llmEvalsGetRunOverview.core.ts +77 -0
  488. package/src/react-query/llmEvalsGetRunOverview.ts +150 -0
  489. package/src/react-query/llmEvalsGetSampleTrajectory.core.ts +94 -0
  490. package/src/react-query/llmEvalsGetSampleTrajectory.ts +159 -0
  491. package/src/react-query/llmEvalsGetSuiteLeaderboard.core.ts +89 -0
  492. package/src/react-query/llmEvalsGetSuiteLeaderboard.ts +163 -0
  493. package/src/react-query/llmEvalsImportAgentRun.ts +109 -0
  494. package/src/react-query/llmEvalsUploadSampleTrajectory.ts +110 -0
  495. package/src/react-query/llmResponsesCreate.ts +113 -0
  496. package/src/sdk/evals.ts +108 -0
  497. package/src/sdk/responses.ts +23 -0
@@ -0,0 +1,163 @@
1
+ /*
2
+ * Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
3
+ */
4
+
5
+ import {
6
+ InvalidateQueryFilters,
7
+ QueryClient,
8
+ useQuery,
9
+ UseQueryResult,
10
+ useSuspenseQuery,
11
+ UseSuspenseQueryResult,
12
+ } from "@tanstack/react-query";
13
+ import {
14
+ ConnectionError,
15
+ InvalidRequestError,
16
+ RequestAbortedError,
17
+ RequestTimeoutError,
18
+ UnexpectedClientError,
19
+ } from "../models/errors/httpclienterrors.js";
20
+ import { ResponseValidationError } from "../models/errors/responsevalidationerror.js";
21
+ import { SDKError } from "../models/errors/sdkerror.js";
22
+ import { SDKValidationError } from "../models/errors/sdkvalidationerror.js";
23
+ import * as operations from "../models/operations/index.js";
24
+ import { useSDKContext } from "./_context.js";
25
+ import {
26
+ QueryHookOptions,
27
+ SuspenseQueryHookOptions,
28
+ TupleToPrefixes,
29
+ } from "./_types.js";
30
+ import {
31
+ buildLlmEvalsGetSuiteLeaderboardQuery,
32
+ LlmEvalsGetSuiteLeaderboardQueryData,
33
+ prefetchLlmEvalsGetSuiteLeaderboard,
34
+ queryKeyLlmEvalsGetSuiteLeaderboard,
35
+ } from "./llmEvalsGetSuiteLeaderboard.core.js";
36
+ export {
37
+ buildLlmEvalsGetSuiteLeaderboardQuery,
38
+ type LlmEvalsGetSuiteLeaderboardQueryData,
39
+ prefetchLlmEvalsGetSuiteLeaderboard,
40
+ queryKeyLlmEvalsGetSuiteLeaderboard,
41
+ };
42
+
43
+ export type LlmEvalsGetSuiteLeaderboardQueryError =
44
+ | SDKError
45
+ | ResponseValidationError
46
+ | ConnectionError
47
+ | RequestAbortedError
48
+ | RequestTimeoutError
49
+ | InvalidRequestError
50
+ | UnexpectedClientError
51
+ | SDKValidationError;
52
+
53
+ /**
54
+ * Get the coding-agent leaderboard for an eval suite
55
+ *
56
+ * @remarks
57
+ * Ranks the suite's completed coding-agent runs, one row per (agent, model, effort). Only runs that recorded an `agent_name` participate — a QA or transcription run of the same suite has no agent to attribute a score to and is not a board row. `accuracy` is the mean of `metric` (default `reward`) over the row's scored trials, and `accuracy_ci` is the 95% Wald interval around it; both are derived per request rather than stored, so rerunning a failed trial moves them instead of leaving a stale copy behind. `agent_version` is reported but is not part of the row identity, so an agent upgrade does not split a row in two. Rows are ordered by accuracy descending, nulls last. Pass `suite_version` when the suite has more than one, otherwise the board mixes task sets.
58
+ */
59
+ export function useLlmEvalsGetSuiteLeaderboard(
60
+ request: operations.GetEvalSuiteLeaderboardRequest,
61
+ options?: QueryHookOptions<
62
+ LlmEvalsGetSuiteLeaderboardQueryData,
63
+ LlmEvalsGetSuiteLeaderboardQueryError
64
+ >,
65
+ ): UseQueryResult<
66
+ LlmEvalsGetSuiteLeaderboardQueryData,
67
+ LlmEvalsGetSuiteLeaderboardQueryError
68
+ > {
69
+ const client = useSDKContext();
70
+ return useQuery({
71
+ ...buildLlmEvalsGetSuiteLeaderboardQuery(
72
+ client,
73
+ request,
74
+ options,
75
+ ),
76
+ ...options,
77
+ });
78
+ }
79
+
80
+ /**
81
+ * Get the coding-agent leaderboard for an eval suite
82
+ *
83
+ * @remarks
84
+ * Ranks the suite's completed coding-agent runs, one row per (agent, model, effort). Only runs that recorded an `agent_name` participate — a QA or transcription run of the same suite has no agent to attribute a score to and is not a board row. `accuracy` is the mean of `metric` (default `reward`) over the row's scored trials, and `accuracy_ci` is the 95% Wald interval around it; both are derived per request rather than stored, so rerunning a failed trial moves them instead of leaving a stale copy behind. `agent_version` is reported but is not part of the row identity, so an agent upgrade does not split a row in two. Rows are ordered by accuracy descending, nulls last. Pass `suite_version` when the suite has more than one, otherwise the board mixes task sets.
85
+ */
86
+ export function useLlmEvalsGetSuiteLeaderboardSuspense(
87
+ request: operations.GetEvalSuiteLeaderboardRequest,
88
+ options?: SuspenseQueryHookOptions<
89
+ LlmEvalsGetSuiteLeaderboardQueryData,
90
+ LlmEvalsGetSuiteLeaderboardQueryError
91
+ >,
92
+ ): UseSuspenseQueryResult<
93
+ LlmEvalsGetSuiteLeaderboardQueryData,
94
+ LlmEvalsGetSuiteLeaderboardQueryError
95
+ > {
96
+ const client = useSDKContext();
97
+ return useSuspenseQuery({
98
+ ...buildLlmEvalsGetSuiteLeaderboardQuery(
99
+ client,
100
+ request,
101
+ options,
102
+ ),
103
+ ...options,
104
+ });
105
+ }
106
+
107
+ export function setLlmEvalsGetSuiteLeaderboardData(
108
+ client: QueryClient,
109
+ queryKeyBase: [
110
+ suiteId: string,
111
+ parameters: {
112
+ suiteVersion?: number | undefined;
113
+ metric?: string | undefined;
114
+ agent?: string | undefined;
115
+ model?: string | undefined;
116
+ limit?: number | undefined;
117
+ xOnBehalfOf?: string | undefined;
118
+ },
119
+ ],
120
+ data: LlmEvalsGetSuiteLeaderboardQueryData,
121
+ ): LlmEvalsGetSuiteLeaderboardQueryData | undefined {
122
+ const key = queryKeyLlmEvalsGetSuiteLeaderboard(...queryKeyBase);
123
+
124
+ return client.setQueryData<LlmEvalsGetSuiteLeaderboardQueryData>(key, data);
125
+ }
126
+
127
+ export function invalidateLlmEvalsGetSuiteLeaderboard(
128
+ client: QueryClient,
129
+ queryKeyBase: TupleToPrefixes<
130
+ [
131
+ suiteId: string,
132
+ parameters: {
133
+ suiteVersion?: number | undefined;
134
+ metric?: string | undefined;
135
+ agent?: string | undefined;
136
+ model?: string | undefined;
137
+ limit?: number | undefined;
138
+ xOnBehalfOf?: string | undefined;
139
+ },
140
+ ]
141
+ >,
142
+ filters?: Omit<InvalidateQueryFilters, "queryKey" | "predicate" | "exact">,
143
+ ): Promise<void> {
144
+ return client.invalidateQueries({
145
+ ...filters,
146
+ queryKey: [
147
+ "@meetkai/mka1",
148
+ "evals",
149
+ "getSuiteLeaderboard",
150
+ ...queryKeyBase,
151
+ ],
152
+ });
153
+ }
154
+
155
+ export function invalidateAllLlmEvalsGetSuiteLeaderboard(
156
+ client: QueryClient,
157
+ filters?: Omit<InvalidateQueryFilters, "queryKey" | "predicate" | "exact">,
158
+ ): Promise<void> {
159
+ return client.invalidateQueries({
160
+ ...filters,
161
+ queryKey: ["@meetkai/mka1", "evals", "getSuiteLeaderboard"],
162
+ });
163
+ }
@@ -0,0 +1,109 @@
1
+ /*
2
+ * Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
3
+ */
4
+
5
+ import {
6
+ MutationKey,
7
+ useMutation,
8
+ UseMutationResult,
9
+ } from "@tanstack/react-query";
10
+ import { SDKCore } from "../core.js";
11
+ import { llmEvalsImportAgentRun } from "../funcs/llmEvalsImportAgentRun.js";
12
+ import { combineSignals } from "../lib/primitives.js";
13
+ import { RequestOptions } from "../lib/sdks.js";
14
+ import {
15
+ ConnectionError,
16
+ InvalidRequestError,
17
+ RequestAbortedError,
18
+ RequestTimeoutError,
19
+ UnexpectedClientError,
20
+ } from "../models/errors/httpclienterrors.js";
21
+ import { ResponseValidationError } from "../models/errors/responsevalidationerror.js";
22
+ import { SDKError } from "../models/errors/sdkerror.js";
23
+ import { SDKValidationError } from "../models/errors/sdkvalidationerror.js";
24
+ import * as operations from "../models/operations/index.js";
25
+ import { unwrapAsync } from "../types/fp.js";
26
+ import { useSDKContext } from "./_context.js";
27
+ import { MutationHookOptions } from "./_types.js";
28
+
29
+ export type LlmEvalsImportAgentRunMutationVariables = {
30
+ request: operations.ImportAgentEvalRunRequest;
31
+ options?: RequestOptions;
32
+ };
33
+
34
+ export type LlmEvalsImportAgentRunMutationData =
35
+ operations.ImportAgentEvalRunResponseBody;
36
+
37
+ export type LlmEvalsImportAgentRunMutationError =
38
+ | SDKError
39
+ | ResponseValidationError
40
+ | ConnectionError
41
+ | RequestAbortedError
42
+ | RequestTimeoutError
43
+ | InvalidRequestError
44
+ | UnexpectedClientError
45
+ | SDKValidationError;
46
+
47
+ /**
48
+ * Import a finished coding-agent run
49
+ *
50
+ * @remarks
51
+ * Uploads one completed harness job — the run and its trials — directly, so results never round-trip through external storage the way the Hugging Face importer does. Every `task_id` must already exist in the target suite version's manifest; unknown ids are rejected rather than invented, because a typo would otherwise import as a task the suite does not have and read as a model that never covered the version. The run is recorded as `completed` and is not executed: this is a write, not a run request, so no workflow is started. Trials that cover every task of the version get `task_ids: null`, which is what lets the run rank as a complete sweep. Trajectories are NOT part of this payload — a full 91-task run measured 8.3 MB of them — so upload each one against `PUT /evals/runs/{run_id}/samples/{sample_index}/trajectory` afterwards. Pass `idempotency_key` and a retried upload returns the first run instead of doubling the trials behind a board row.
52
+ */
53
+ export function useLlmEvalsImportAgentRunMutation(
54
+ options?: MutationHookOptions<
55
+ LlmEvalsImportAgentRunMutationData,
56
+ LlmEvalsImportAgentRunMutationError,
57
+ LlmEvalsImportAgentRunMutationVariables
58
+ >,
59
+ ): UseMutationResult<
60
+ LlmEvalsImportAgentRunMutationData,
61
+ LlmEvalsImportAgentRunMutationError,
62
+ LlmEvalsImportAgentRunMutationVariables
63
+ > {
64
+ const client = useSDKContext();
65
+ return useMutation({
66
+ ...buildLlmEvalsImportAgentRunMutation(client, options),
67
+ ...options,
68
+ });
69
+ }
70
+
71
+ export function mutationKeyLlmEvalsImportAgentRun(): MutationKey {
72
+ return ["@meetkai/mka1", "evals", "importAgentRun"];
73
+ }
74
+
75
+ export function buildLlmEvalsImportAgentRunMutation(
76
+ client$: SDKCore,
77
+ hookOptions?: RequestOptions,
78
+ ): {
79
+ mutationKey: MutationKey;
80
+ mutationFn: (
81
+ variables: LlmEvalsImportAgentRunMutationVariables,
82
+ ) => Promise<LlmEvalsImportAgentRunMutationData>;
83
+ } {
84
+ return {
85
+ mutationKey: mutationKeyLlmEvalsImportAgentRun(),
86
+ mutationFn: function llmEvalsImportAgentRunMutationFn({
87
+ request,
88
+ options,
89
+ }): Promise<LlmEvalsImportAgentRunMutationData> {
90
+ const mergedOptions = {
91
+ ...hookOptions,
92
+ ...options,
93
+ fetchOptions: {
94
+ ...hookOptions?.fetchOptions,
95
+ ...options?.fetchOptions,
96
+ signal: combineSignals(
97
+ hookOptions?.fetchOptions?.signal,
98
+ options?.fetchOptions?.signal,
99
+ ),
100
+ },
101
+ };
102
+ return unwrapAsync(llmEvalsImportAgentRun(
103
+ client$,
104
+ request,
105
+ mergedOptions,
106
+ ));
107
+ },
108
+ };
109
+ }
@@ -0,0 +1,110 @@
1
+ /*
2
+ * Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
3
+ */
4
+
5
+ import {
6
+ MutationKey,
7
+ useMutation,
8
+ UseMutationResult,
9
+ } from "@tanstack/react-query";
10
+ import { SDKCore } from "../core.js";
11
+ import { llmEvalsUploadSampleTrajectory } from "../funcs/llmEvalsUploadSampleTrajectory.js";
12
+ import { combineSignals } from "../lib/primitives.js";
13
+ import { RequestOptions } from "../lib/sdks.js";
14
+ import * as components from "../models/components/index.js";
15
+ import {
16
+ ConnectionError,
17
+ InvalidRequestError,
18
+ RequestAbortedError,
19
+ RequestTimeoutError,
20
+ UnexpectedClientError,
21
+ } from "../models/errors/httpclienterrors.js";
22
+ import { ResponseValidationError } from "../models/errors/responsevalidationerror.js";
23
+ import { SDKError } from "../models/errors/sdkerror.js";
24
+ import { SDKValidationError } from "../models/errors/sdkvalidationerror.js";
25
+ import * as operations from "../models/operations/index.js";
26
+ import { unwrapAsync } from "../types/fp.js";
27
+ import { useSDKContext } from "./_context.js";
28
+ import { MutationHookOptions } from "./_types.js";
29
+
30
+ export type LlmEvalsUploadSampleTrajectoryMutationVariables = {
31
+ request: operations.UploadEvalSampleTrajectoryRequest;
32
+ options?: RequestOptions;
33
+ };
34
+
35
+ export type LlmEvalsUploadSampleTrajectoryMutationData =
36
+ components.EvalSampleTrajectoryUploadedObject;
37
+
38
+ export type LlmEvalsUploadSampleTrajectoryMutationError =
39
+ | SDKError
40
+ | ResponseValidationError
41
+ | ConnectionError
42
+ | RequestAbortedError
43
+ | RequestTimeoutError
44
+ | InvalidRequestError
45
+ | UnexpectedClientError
46
+ | SDKValidationError;
47
+
48
+ /**
49
+ * Upload an eval sample trajectory
50
+ *
51
+ * @remarks
52
+ * Stores one coding-agent trial's session, in whatever interchange format the harness produced (record it in `schema_version`, e.g. `ATIF-v1.7`). `steps` is stored verbatim and never validated, so a harness format change needs no gateway release. Separate from the run import because a trajectory averages ~92 KB and a whole run's worth would not fit in one request. Upserts, so re-sending after a timeout replaces the trajectory rather than failing. Sample indices are unique per (task, model), not per run, so pass `task_id` and/or `model` when the run covers more than one — an ambiguous index returns 400 rather than writing to the wrong trial. Rejects a payload whose `steps` and `logs` together exceed 16 MiB with 413.
53
+ */
54
+ export function useLlmEvalsUploadSampleTrajectoryMutation(
55
+ options?: MutationHookOptions<
56
+ LlmEvalsUploadSampleTrajectoryMutationData,
57
+ LlmEvalsUploadSampleTrajectoryMutationError,
58
+ LlmEvalsUploadSampleTrajectoryMutationVariables
59
+ >,
60
+ ): UseMutationResult<
61
+ LlmEvalsUploadSampleTrajectoryMutationData,
62
+ LlmEvalsUploadSampleTrajectoryMutationError,
63
+ LlmEvalsUploadSampleTrajectoryMutationVariables
64
+ > {
65
+ const client = useSDKContext();
66
+ return useMutation({
67
+ ...buildLlmEvalsUploadSampleTrajectoryMutation(client, options),
68
+ ...options,
69
+ });
70
+ }
71
+
72
+ export function mutationKeyLlmEvalsUploadSampleTrajectory(): MutationKey {
73
+ return ["@meetkai/mka1", "evals", "uploadSampleTrajectory"];
74
+ }
75
+
76
+ export function buildLlmEvalsUploadSampleTrajectoryMutation(
77
+ client$: SDKCore,
78
+ hookOptions?: RequestOptions,
79
+ ): {
80
+ mutationKey: MutationKey;
81
+ mutationFn: (
82
+ variables: LlmEvalsUploadSampleTrajectoryMutationVariables,
83
+ ) => Promise<LlmEvalsUploadSampleTrajectoryMutationData>;
84
+ } {
85
+ return {
86
+ mutationKey: mutationKeyLlmEvalsUploadSampleTrajectory(),
87
+ mutationFn: function llmEvalsUploadSampleTrajectoryMutationFn({
88
+ request,
89
+ options,
90
+ }): Promise<LlmEvalsUploadSampleTrajectoryMutationData> {
91
+ const mergedOptions = {
92
+ ...hookOptions,
93
+ ...options,
94
+ fetchOptions: {
95
+ ...hookOptions?.fetchOptions,
96
+ ...options?.fetchOptions,
97
+ signal: combineSignals(
98
+ hookOptions?.fetchOptions?.signal,
99
+ options?.fetchOptions?.signal,
100
+ ),
101
+ },
102
+ };
103
+ return unwrapAsync(llmEvalsUploadSampleTrajectory(
104
+ client$,
105
+ request,
106
+ mergedOptions,
107
+ ));
108
+ },
109
+ };
110
+ }
@@ -0,0 +1,113 @@
1
+ /*
2
+ * Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
3
+ */
4
+
5
+ import {
6
+ MutationKey,
7
+ useMutation,
8
+ UseMutationResult,
9
+ } from "@tanstack/react-query";
10
+ import { SDKCore } from "../core.js";
11
+ import {
12
+ CreateAcceptEnum,
13
+ llmResponsesCreate,
14
+ } from "../funcs/llmResponsesCreate.js";
15
+ import { combineSignals } from "../lib/primitives.js";
16
+ import { RequestOptions } from "../lib/sdks.js";
17
+ import {
18
+ ConnectionError,
19
+ InvalidRequestError,
20
+ RequestAbortedError,
21
+ RequestTimeoutError,
22
+ UnexpectedClientError,
23
+ } from "../models/errors/httpclienterrors.js";
24
+ import { ResponseValidationError } from "../models/errors/responsevalidationerror.js";
25
+ import { SDKError } from "../models/errors/sdkerror.js";
26
+ import { SDKValidationError } from "../models/errors/sdkvalidationerror.js";
27
+ import * as operations from "../models/operations/index.js";
28
+ import { unwrapAsync } from "../types/fp.js";
29
+ import { useSDKContext } from "./_context.js";
30
+ import { MutationHookOptions } from "./_types.js";
31
+
32
+ export { CreateAcceptEnum } from "../funcs/llmResponsesCreate.js";
33
+
34
+ export type LlmResponsesCreateMutationVariables = {
35
+ request: operations.CreateResponseRequest;
36
+ options?: RequestOptions & { acceptHeaderOverride?: CreateAcceptEnum };
37
+ };
38
+
39
+ export type LlmResponsesCreateMutationData = operations.CreateResponseResponse;
40
+
41
+ export type LlmResponsesCreateMutationError =
42
+ | SDKError
43
+ | ResponseValidationError
44
+ | ConnectionError
45
+ | RequestAbortedError
46
+ | RequestTimeoutError
47
+ | InvalidRequestError
48
+ | UnexpectedClientError
49
+ | SDKValidationError;
50
+
51
+ /**
52
+ * Create an agent-powered response with tool support
53
+ *
54
+ * @remarks
55
+ * Creates a new AI agent response using advanced language models with autonomous tool usage capabilities.
56
+ */
57
+ export function useLlmResponsesCreateMutation(
58
+ options?: MutationHookOptions<
59
+ LlmResponsesCreateMutationData,
60
+ LlmResponsesCreateMutationError,
61
+ LlmResponsesCreateMutationVariables
62
+ >,
63
+ ): UseMutationResult<
64
+ LlmResponsesCreateMutationData,
65
+ LlmResponsesCreateMutationError,
66
+ LlmResponsesCreateMutationVariables
67
+ > {
68
+ const client = useSDKContext();
69
+ return useMutation({
70
+ ...buildLlmResponsesCreateMutation(client, options),
71
+ ...options,
72
+ });
73
+ }
74
+
75
+ export function mutationKeyLlmResponsesCreate(): MutationKey {
76
+ return ["@meetkai/mka1", "responses", "create"];
77
+ }
78
+
79
+ export function buildLlmResponsesCreateMutation(
80
+ client$: SDKCore,
81
+ hookOptions?: RequestOptions & { acceptHeaderOverride?: CreateAcceptEnum },
82
+ ): {
83
+ mutationKey: MutationKey;
84
+ mutationFn: (
85
+ variables: LlmResponsesCreateMutationVariables,
86
+ ) => Promise<LlmResponsesCreateMutationData>;
87
+ } {
88
+ return {
89
+ mutationKey: mutationKeyLlmResponsesCreate(),
90
+ mutationFn: function llmResponsesCreateMutationFn({
91
+ request,
92
+ options,
93
+ }): Promise<LlmResponsesCreateMutationData> {
94
+ const mergedOptions = {
95
+ ...hookOptions,
96
+ ...options,
97
+ fetchOptions: {
98
+ ...hookOptions?.fetchOptions,
99
+ ...options?.fetchOptions,
100
+ signal: combineSignals(
101
+ hookOptions?.fetchOptions?.signal,
102
+ options?.fetchOptions?.signal,
103
+ ),
104
+ },
105
+ };
106
+ return unwrapAsync(llmResponsesCreate(
107
+ client$,
108
+ request,
109
+ mergedOptions,
110
+ ));
111
+ },
112
+ };
113
+ }
package/src/sdk/evals.ts CHANGED
@@ -2,6 +2,7 @@
2
2
  * Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
3
3
  */
4
4
 
5
+ import { llmEvalsAppendAgentTrials } from "../funcs/llmEvalsAppendAgentTrials.js";
5
6
  import { llmEvalsCancelRun } from "../funcs/llmEvalsCancelRun.js";
6
7
  import { llmEvalsCreateRun } from "../funcs/llmEvalsCreateRun.js";
7
8
  import { llmEvalsCreateSchedule } from "../funcs/llmEvalsCreateSchedule.js";
@@ -12,10 +13,14 @@ import { llmEvalsDeleteSchedule } from "../funcs/llmEvalsDeleteSchedule.js";
12
13
  import { llmEvalsDeleteSuite } from "../funcs/llmEvalsDeleteSuite.js";
13
14
  import { llmEvalsGetArtifacts } from "../funcs/llmEvalsGetArtifacts.js";
14
15
  import { llmEvalsGetRun } from "../funcs/llmEvalsGetRun.js";
16
+ import { llmEvalsGetRunOverview } from "../funcs/llmEvalsGetRunOverview.js";
15
17
  import { llmEvalsGetSampleAudio } from "../funcs/llmEvalsGetSampleAudio.js";
18
+ import { llmEvalsGetSampleTrajectory } from "../funcs/llmEvalsGetSampleTrajectory.js";
16
19
  import { llmEvalsGetSchedule } from "../funcs/llmEvalsGetSchedule.js";
17
20
  import { llmEvalsGetSuite } from "../funcs/llmEvalsGetSuite.js";
21
+ import { llmEvalsGetSuiteLeaderboard } from "../funcs/llmEvalsGetSuiteLeaderboard.js";
18
22
  import { llmEvalsGetSuiteVersion } from "../funcs/llmEvalsGetSuiteVersion.js";
23
+ import { llmEvalsImportAgentRun } from "../funcs/llmEvalsImportAgentRun.js";
19
24
  import { llmEvalsImportHistoricalResults } from "../funcs/llmEvalsImportHistoricalResults.js";
20
25
  import { llmEvalsListRuns } from "../funcs/llmEvalsListRuns.js";
21
26
  import { llmEvalsListSamples } from "../funcs/llmEvalsListSamples.js";
@@ -28,6 +33,7 @@ import { llmEvalsRerunFailedSamples } from "../funcs/llmEvalsRerunFailedSamples.
28
33
  import { llmEvalsRetryFailedRun } from "../funcs/llmEvalsRetryFailedRun.js";
29
34
  import { llmEvalsTriggerSchedule } from "../funcs/llmEvalsTriggerSchedule.js";
30
35
  import { llmEvalsUpdateSchedule } from "../funcs/llmEvalsUpdateSchedule.js";
36
+ import { llmEvalsUploadSampleTrajectory } from "../funcs/llmEvalsUploadSampleTrajectory.js";
31
37
  import { ClientSDK, RequestOptions } from "../lib/sdks.js";
32
38
  import * as components from "../models/components/index.js";
33
39
  import * as operations from "../models/operations/index.js";
@@ -170,6 +176,23 @@ export class Evals extends ClientSDK {
170
176
  ));
171
177
  }
172
178
 
179
+ /**
180
+ * Get the coding-agent leaderboard for an eval suite
181
+ *
182
+ * @remarks
183
+ * Ranks the suite's completed coding-agent runs, one row per (agent, model, effort). Only runs that recorded an `agent_name` participate — a QA or transcription run of the same suite has no agent to attribute a score to and is not a board row. `accuracy` is the mean of `metric` (default `reward`) over the row's scored trials, and `accuracy_ci` is the 95% Wald interval around it; both are derived per request rather than stored, so rerunning a failed trial moves them instead of leaving a stale copy behind. `agent_version` is reported but is not part of the row identity, so an agent upgrade does not split a row in two. Rows are ordered by accuracy descending, nulls last. Pass `suite_version` when the suite has more than one, otherwise the board mixes task sets.
184
+ */
185
+ async getSuiteLeaderboard(
186
+ request: operations.GetEvalSuiteLeaderboardRequest,
187
+ options?: RequestOptions,
188
+ ): Promise<components.EvalSuiteLeaderboard> {
189
+ return unwrapAsync(llmEvalsGetSuiteLeaderboard(
190
+ this,
191
+ request,
192
+ options,
193
+ ));
194
+ }
195
+
173
196
  /**
174
197
  * Create an eval run
175
198
  *
@@ -289,6 +312,23 @@ export class Evals extends ClientSDK {
289
312
  ));
290
313
  }
291
314
 
315
+ /**
316
+ * Get an eval run overview
317
+ *
318
+ * @remarks
319
+ * Aggregate header for one run's trials view: trial counts, average reward, cost, and the input/output/cached token split. Its own route rather than fields on the run object because it scans the run's samples — folding it into `GET /evals/runs/{run_id}` would charge that scan to every run list and to the status polling that runs for the whole length of an eval. `trials.errored` overlaps `trials.failed` instead of partitioning it: a coding-agent trial can carry an agent timeout in `error` and still be completed and scored. `trials.retried` counts trials rerun through rerun-failed, read from the pre-rerun snapshot, since a rerun overwrites the sample in place.
320
+ */
321
+ async getRunOverview(
322
+ request: operations.GetEvalRunOverviewRequest,
323
+ options?: RequestOptions,
324
+ ): Promise<components.EvalRunOverview> {
325
+ return unwrapAsync(llmEvalsGetRunOverview(
326
+ this,
327
+ request,
328
+ options,
329
+ ));
330
+ }
331
+
292
332
  /**
293
333
  * List eval samples
294
334
  *
@@ -323,6 +363,40 @@ export class Evals extends ClientSDK {
323
363
  ));
324
364
  }
325
365
 
366
+ /**
367
+ * Get an eval sample trajectory
368
+ *
369
+ * @remarks
370
+ * Returns one coding-agent trial's session — the steps the agent took, verbatim in the harness's interchange format (see `schema_version`, e.g. `ATIF-v1.7`). Deliberately not part of the samples list: a trajectory averages ~92 KB and that list pages up to 500 rows. Sample indices are unique per (task, model), not per run, so pass `task_id` and/or `model` when the run covers more than one; an index that matches several trials returns 400 rather than guessing, and never falls back to another trial's session. Returns 404 when the sample does not exist or recorded no trajectory.
371
+ */
372
+ async getSampleTrajectory(
373
+ request: operations.GetEvalSampleTrajectoryRequest,
374
+ options?: RequestOptions,
375
+ ): Promise<operations.GetEvalSampleTrajectoryResponseBody> {
376
+ return unwrapAsync(llmEvalsGetSampleTrajectory(
377
+ this,
378
+ request,
379
+ options,
380
+ ));
381
+ }
382
+
383
+ /**
384
+ * Upload an eval sample trajectory
385
+ *
386
+ * @remarks
387
+ * Stores one coding-agent trial's session, in whatever interchange format the harness produced (record it in `schema_version`, e.g. `ATIF-v1.7`). `steps` is stored verbatim and never validated, so a harness format change needs no gateway release. Separate from the run import because a trajectory averages ~92 KB and a whole run's worth would not fit in one request. Upserts, so re-sending after a timeout replaces the trajectory rather than failing. Sample indices are unique per (task, model), not per run, so pass `task_id` and/or `model` when the run covers more than one — an ambiguous index returns 400 rather than writing to the wrong trial. Rejects a payload whose `steps` and `logs` together exceed 16 MiB with 413.
388
+ */
389
+ async uploadSampleTrajectory(
390
+ request: operations.UploadEvalSampleTrajectoryRequest,
391
+ options?: RequestOptions,
392
+ ): Promise<components.EvalSampleTrajectoryUploadedObject> {
393
+ return unwrapAsync(llmEvalsUploadSampleTrajectory(
394
+ this,
395
+ request,
396
+ options,
397
+ ));
398
+ }
399
+
326
400
  /**
327
401
  * Get eval run artifacts
328
402
  *
@@ -340,6 +414,40 @@ export class Evals extends ClientSDK {
340
414
  ));
341
415
  }
342
416
 
417
+ /**
418
+ * Import a finished coding-agent run
419
+ *
420
+ * @remarks
421
+ * Uploads one completed harness job — the run and its trials — directly, so results never round-trip through external storage the way the Hugging Face importer does. Every `task_id` must already exist in the target suite version's manifest; unknown ids are rejected rather than invented, because a typo would otherwise import as a task the suite does not have and read as a model that never covered the version. The run is recorded as `completed` and is not executed: this is a write, not a run request, so no workflow is started. Trials that cover every task of the version get `task_ids: null`, which is what lets the run rank as a complete sweep. Trajectories are NOT part of this payload — a full 91-task run measured 8.3 MB of them — so upload each one against `PUT /evals/runs/{run_id}/samples/{sample_index}/trajectory` afterwards. Pass `idempotency_key` and a retried upload returns the first run instead of doubling the trials behind a board row.
422
+ */
423
+ async importAgentRun(
424
+ request: operations.ImportAgentEvalRunRequest,
425
+ options?: RequestOptions,
426
+ ): Promise<operations.ImportAgentEvalRunResponseBody> {
427
+ return unwrapAsync(llmEvalsImportAgentRun(
428
+ this,
429
+ request,
430
+ options,
431
+ ));
432
+ }
433
+
434
+ /**
435
+ * Append trials to an open coding-agent run
436
+ *
437
+ * @remarks
438
+ * Adds finished trials to a run opened with `finalize: false`, so a job started from MKA1 can be watched while it runs instead of appearing complete out of nowhere at the end. Each trial pins its own `sample_index` and upserts on (task, model, sample_index): a harness cannot tell a timeout from a lost response, so re-sending a batch is safe and replaces rather than duplicates. The whole batch and its aggregate recompute land in one transaction, serialized per run. Counts, metrics and cost are recomputed from the stored rows on every call, never accumulated from the request, so a replayed batch cannot double them. Send `finalize: true` (usually with an empty `trials`) to close the run — until then it stays `in_progress` and off the leaderboards, which only count completed runs. Appending to an already-completed or cancelled run is rejected: that record is finished, and rewriting it would silently move a number someone may have already read.
439
+ */
440
+ async appendAgentTrials(
441
+ request: operations.AppendAgentEvalTrialsRequest,
442
+ options?: RequestOptions,
443
+ ): Promise<operations.AppendAgentEvalTrialsResponseBody> {
444
+ return unwrapAsync(llmEvalsAppendAgentTrials(
445
+ this,
446
+ request,
447
+ options,
448
+ ));
449
+ }
450
+
343
451
  /**
344
452
  * Import historical eval results from Hugging Face
345
453
  *