@avallon-labs/mcp 51.3.0-staging.1139 → 51.4.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
package/dist/index.js CHANGED
@@ -46,5 +46,5 @@ function setupFetch() {
46
46
 
47
47
  // src/index.ts
48
48
  setupFetch();
49
- await import("./server-DACHXX2C.js");
49
+ await import("./server-EZUDCD4M.js");
50
50
  //# sourceMappingURL=index.js.map
@@ -1476,6 +1476,28 @@ var createEvalBenchmark = async (evalId, createEvalBenchmarkBody, options) => {
1476
1476
  const data = body ? JSON.parse(body) : {};
1477
1477
  return { data, status: res.status, headers: res.headers };
1478
1478
  };
1479
+ var getListEvalBenchmarksUrl = (evalId, params) => {
1480
+ const normalizedParams = new URLSearchParams();
1481
+ Object.entries(params || {}).forEach(([key, value]) => {
1482
+ if (value !== void 0) {
1483
+ normalizedParams.append(key, value === null ? "null" : String(value));
1484
+ }
1485
+ });
1486
+ const stringifiedParams = normalizedParams.toString();
1487
+ return stringifiedParams.length > 0 ? `/v1/evals/${evalId}/benchmarks?${stringifiedParams}` : `/v1/evals/${evalId}/benchmarks`;
1488
+ };
1489
+ var listEvalBenchmarks = async (evalId, params, options) => {
1490
+ const res = await fetch(
1491
+ getListEvalBenchmarksUrl(evalId, params),
1492
+ {
1493
+ ...options,
1494
+ method: "GET"
1495
+ }
1496
+ );
1497
+ const body = [204, 205, 304].includes(res.status) ? null : await res.text();
1498
+ const data = body ? JSON.parse(body) : {};
1499
+ return { data, status: res.status, headers: res.headers };
1500
+ };
1479
1501
  var getGetBenchmarkUrl = (benchmarkId) => {
1480
1502
  return `/v1/benchmarks/${benchmarkId}`;
1481
1503
  };
@@ -1491,6 +1513,51 @@ var getBenchmark = async (benchmarkId, options) => {
1491
1513
  const data = body ? JSON.parse(body) : {};
1492
1514
  return { data, status: res.status, headers: res.headers };
1493
1515
  };
1516
+ var getListWorkerEvalsUrl = (workerId, params) => {
1517
+ const normalizedParams = new URLSearchParams();
1518
+ Object.entries(params || {}).forEach(([key, value]) => {
1519
+ if (value !== void 0) {
1520
+ normalizedParams.append(key, value === null ? "null" : String(value));
1521
+ }
1522
+ });
1523
+ const stringifiedParams = normalizedParams.toString();
1524
+ return stringifiedParams.length > 0 ? `/v1/workers/${workerId}/evals?${stringifiedParams}` : `/v1/workers/${workerId}/evals`;
1525
+ };
1526
+ var listWorkerEvals = async (workerId, params, options) => {
1527
+ const res = await fetch(
1528
+ getListWorkerEvalsUrl(workerId, params),
1529
+ {
1530
+ ...options,
1531
+ method: "GET"
1532
+ }
1533
+ );
1534
+ const body = [204, 205, 304].includes(res.status) ? null : await res.text();
1535
+ const data = body ? JSON.parse(body) : {};
1536
+ return { data, status: res.status, headers: res.headers };
1537
+ };
1538
+ var getCreateWorkerBenchmarksUrl = (workerId) => {
1539
+ return `/v1/workers/${workerId}/benchmarks`;
1540
+ };
1541
+ var createWorkerBenchmarks = async (workerId, createWorkerBenchmarksBody, options) => {
1542
+ const getHeaders = (h) => {
1543
+ if (!h) return {};
1544
+ if (h instanceof Headers) return Object.fromEntries(h.entries());
1545
+ if (Array.isArray(h)) return Object.fromEntries(h);
1546
+ return h;
1547
+ };
1548
+ const res = await fetch(
1549
+ getCreateWorkerBenchmarksUrl(workerId),
1550
+ {
1551
+ ...options,
1552
+ method: "POST",
1553
+ headers: { "Content-Type": "application/json", ...getHeaders(options?.headers) },
1554
+ body: JSON.stringify(createWorkerBenchmarksBody)
1555
+ }
1556
+ );
1557
+ const body = [204, 205, 304].includes(res.status) ? null : await res.text();
1558
+ const data = body ? JSON.parse(body) : {};
1559
+ return { data, status: res.status, headers: res.headers };
1560
+ };
1494
1561
  var getCreateExtractorUrl = () => {
1495
1562
  return `/v1/extractors`;
1496
1563
  };
@@ -5074,6 +5141,29 @@ var createEvalBenchmarkHandler = async (args, options) => {
5074
5141
  structuredContent: res.data
5075
5142
  };
5076
5143
  };
5144
+ var listEvalBenchmarksHandler = async (args, options) => {
5145
+ const res = await listEvalBenchmarks(args.pathParams.evalId, args.queryParams, options);
5146
+ if (res.status >= 400) {
5147
+ return {
5148
+ content: [
5149
+ {
5150
+ type: "text",
5151
+ text: JSON.stringify(res.data ?? null)
5152
+ }
5153
+ ],
5154
+ isError: true
5155
+ };
5156
+ }
5157
+ return {
5158
+ content: [
5159
+ {
5160
+ type: "text",
5161
+ text: JSON.stringify(res.data ?? null)
5162
+ }
5163
+ ],
5164
+ structuredContent: res.data
5165
+ };
5166
+ };
5077
5167
  var getBenchmarkHandler = async (args, options) => {
5078
5168
  const res = await getBenchmark(args.pathParams.benchmarkId, options);
5079
5169
  if (res.status >= 400) {
@@ -5097,6 +5187,52 @@ var getBenchmarkHandler = async (args, options) => {
5097
5187
  structuredContent: res.data
5098
5188
  };
5099
5189
  };
5190
+ var listWorkerEvalsHandler = async (args, options) => {
5191
+ const res = await listWorkerEvals(args.pathParams.workerId, args.queryParams, options);
5192
+ if (res.status >= 400) {
5193
+ return {
5194
+ content: [
5195
+ {
5196
+ type: "text",
5197
+ text: JSON.stringify(res.data ?? null)
5198
+ }
5199
+ ],
5200
+ isError: true
5201
+ };
5202
+ }
5203
+ return {
5204
+ content: [
5205
+ {
5206
+ type: "text",
5207
+ text: JSON.stringify(res.data ?? null)
5208
+ }
5209
+ ],
5210
+ structuredContent: res.data
5211
+ };
5212
+ };
5213
+ var createWorkerBenchmarksHandler = async (args, options) => {
5214
+ const res = await createWorkerBenchmarks(args.pathParams.workerId, args.bodyParams, options);
5215
+ if (res.status >= 400) {
5216
+ return {
5217
+ content: [
5218
+ {
5219
+ type: "text",
5220
+ text: JSON.stringify(res.data ?? null)
5221
+ }
5222
+ ],
5223
+ isError: true
5224
+ };
5225
+ }
5226
+ return {
5227
+ content: [
5228
+ {
5229
+ type: "text",
5230
+ text: JSON.stringify(res.data ?? null)
5231
+ }
5232
+ ],
5233
+ structuredContent: res.data
5234
+ };
5235
+ };
5100
5236
  var createExtractorHandler = async (args, options) => {
5101
5237
  const res = await createExtractor(args.bodyParams, options);
5102
5238
  if (res.status >= 400) {
@@ -9289,6 +9425,8 @@ var CreateEvalBenchmarkResponse = zod.object({
9289
9425
  })
9290
9426
  }), zod.null()]),
9291
9427
  "notes": zod.union([zod.array(zod.string()), zod.null()]),
9428
+ "created_at": zod.string().datetime({ "offset": true }),
9429
+ "completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()]),
9292
9430
  "runs": zod.array(zod.object({
9293
9431
  "id": zod.string().uuid(),
9294
9432
  "eval_id": zod.string().uuid(),
@@ -9330,12 +9468,109 @@ var CreateEvalBenchmarkResponse = zod.object({
9330
9468
  "created_at": zod.string().datetime({ "offset": true }),
9331
9469
  "started_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()]),
9332
9470
  "completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
9333
- })),
9334
- "created_at": zod.string().datetime({ "offset": true }),
9335
- "completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
9471
+ }))
9336
9472
  }),
9337
9473
  "message": zod.string()
9338
9474
  });
9475
+ var ListEvalBenchmarksParams = zod.object({
9476
+ "evalId": zod.string().uuid()
9477
+ });
9478
+ var listEvalBenchmarksQueryCountDefault = 50;
9479
+ var listEvalBenchmarksQueryCountMax = 100;
9480
+ var listEvalBenchmarksQueryOffsetDefault = 0;
9481
+ var listEvalBenchmarksQueryOffsetMin = 0;
9482
+ var listEvalBenchmarksQuerySortByDefault = `created_at`;
9483
+ var listEvalBenchmarksQuerySortOrderDefault = `desc`;
9484
+ var ListEvalBenchmarksQueryParams = zod.object({
9485
+ "count": zod.number().min(1).max(listEvalBenchmarksQueryCountMax).default(listEvalBenchmarksQueryCountDefault),
9486
+ "offset": zod.number().min(listEvalBenchmarksQueryOffsetMin).default(listEvalBenchmarksQueryOffsetDefault),
9487
+ "sort_by": zod.enum(["created_at"]).default(listEvalBenchmarksQuerySortByDefault),
9488
+ "sort_order": zod.enum(["asc", "desc"]).default(listEvalBenchmarksQuerySortOrderDefault)
9489
+ });
9490
+ var listEvalBenchmarksResponseDataItemCandidateVersionMin = -9007199254740991;
9491
+ var listEvalBenchmarksResponseDataItemCandidateVersionMax = 9007199254740991;
9492
+ var listEvalBenchmarksResponseDataItemBaselineVersionMin = -9007199254740991;
9493
+ var listEvalBenchmarksResponseDataItemBaselineVersionMax = 9007199254740991;
9494
+ var listEvalBenchmarksResponseDataItemRunsPerConfigurationMin = -9007199254740991;
9495
+ var listEvalBenchmarksResponseDataItemRunsPerConfigurationMax = 9007199254740991;
9496
+ var listEvalBenchmarksResponseDataItemRunSummaryOneCandidateRunsMin = -9007199254740991;
9497
+ var listEvalBenchmarksResponseDataItemRunSummaryOneCandidateRunsMax = 9007199254740991;
9498
+ var listEvalBenchmarksResponseDataItemRunSummaryOneCandidateGradedRunsMin = -9007199254740991;
9499
+ var listEvalBenchmarksResponseDataItemRunSummaryOneCandidateGradedRunsMax = 9007199254740991;
9500
+ var listEvalBenchmarksResponseDataItemRunSummaryOneBaselineRunsMin = -9007199254740991;
9501
+ var listEvalBenchmarksResponseDataItemRunSummaryOneBaselineRunsMax = 9007199254740991;
9502
+ var listEvalBenchmarksResponseDataItemRunSummaryOneBaselineGradedRunsMin = -9007199254740991;
9503
+ var listEvalBenchmarksResponseDataItemRunSummaryOneBaselineGradedRunsMax = 9007199254740991;
9504
+ var listEvalBenchmarksResponseMetaTotalMin = -9007199254740991;
9505
+ var listEvalBenchmarksResponseMetaTotalMax = 9007199254740991;
9506
+ var ListEvalBenchmarksResponse = zod.object({
9507
+ "data": zod.array(zod.object({
9508
+ "id": zod.string().uuid(),
9509
+ "eval_id": zod.string().uuid(),
9510
+ "candidate_version": zod.number().int().min(listEvalBenchmarksResponseDataItemCandidateVersionMin).max(listEvalBenchmarksResponseDataItemCandidateVersionMax),
9511
+ "baseline_version": zod.number().int().min(listEvalBenchmarksResponseDataItemBaselineVersionMin).max(listEvalBenchmarksResponseDataItemBaselineVersionMax),
9512
+ "runs_per_configuration": zod.number().int().min(listEvalBenchmarksResponseDataItemRunsPerConfigurationMin).max(listEvalBenchmarksResponseDataItemRunsPerConfigurationMax),
9513
+ "status": zod.enum(["running", "completed", "error"]),
9514
+ "run_summary": zod.union([zod.object({
9515
+ "candidate": zod.object({
9516
+ "runs": zod.number().int().min(listEvalBenchmarksResponseDataItemRunSummaryOneCandidateRunsMin).max(listEvalBenchmarksResponseDataItemRunSummaryOneCandidateRunsMax),
9517
+ "graded_runs": zod.number().int().min(listEvalBenchmarksResponseDataItemRunSummaryOneCandidateGradedRunsMin).max(listEvalBenchmarksResponseDataItemRunSummaryOneCandidateGradedRunsMax),
9518
+ "pass_rate": zod.union([zod.object({
9519
+ "mean": zod.number(),
9520
+ "stddev": zod.number(),
9521
+ "min": zod.number(),
9522
+ "max": zod.number()
9523
+ }), zod.null()]),
9524
+ "duration_seconds": zod.union([zod.object({
9525
+ "mean": zod.number(),
9526
+ "stddev": zod.number(),
9527
+ "min": zod.number(),
9528
+ "max": zod.number()
9529
+ }), zod.null()]),
9530
+ "fixture_matched_rate": zod.union([zod.object({
9531
+ "mean": zod.number(),
9532
+ "stddev": zod.number(),
9533
+ "min": zod.number(),
9534
+ "max": zod.number()
9535
+ }), zod.null()])
9536
+ }),
9537
+ "baseline": zod.object({
9538
+ "runs": zod.number().int().min(listEvalBenchmarksResponseDataItemRunSummaryOneBaselineRunsMin).max(listEvalBenchmarksResponseDataItemRunSummaryOneBaselineRunsMax),
9539
+ "graded_runs": zod.number().int().min(listEvalBenchmarksResponseDataItemRunSummaryOneBaselineGradedRunsMin).max(listEvalBenchmarksResponseDataItemRunSummaryOneBaselineGradedRunsMax),
9540
+ "pass_rate": zod.union([zod.object({
9541
+ "mean": zod.number(),
9542
+ "stddev": zod.number(),
9543
+ "min": zod.number(),
9544
+ "max": zod.number()
9545
+ }), zod.null()]),
9546
+ "duration_seconds": zod.union([zod.object({
9547
+ "mean": zod.number(),
9548
+ "stddev": zod.number(),
9549
+ "min": zod.number(),
9550
+ "max": zod.number()
9551
+ }), zod.null()]),
9552
+ "fixture_matched_rate": zod.union([zod.object({
9553
+ "mean": zod.number(),
9554
+ "stddev": zod.number(),
9555
+ "min": zod.number(),
9556
+ "max": zod.number()
9557
+ }), zod.null()])
9558
+ }),
9559
+ "delta": zod.object({
9560
+ "pass_rate": zod.union([zod.number(), zod.null()]),
9561
+ "duration_seconds": zod.union([zod.number(), zod.null()]),
9562
+ "fixture_matched_rate": zod.union([zod.number(), zod.null()])
9563
+ })
9564
+ }), zod.null()]),
9565
+ "notes": zod.union([zod.array(zod.string()), zod.null()]),
9566
+ "created_at": zod.string().datetime({ "offset": true }),
9567
+ "completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
9568
+ })),
9569
+ "message": zod.string(),
9570
+ "meta": zod.object({
9571
+ "total": zod.number().int().min(listEvalBenchmarksResponseMetaTotalMin).max(listEvalBenchmarksResponseMetaTotalMax).describe("Total number of benchmarks for the eval")
9572
+ })
9573
+ });
9339
9574
  var GetBenchmarkParams = zod.object({
9340
9575
  "benchmarkId": zod.string().uuid()
9341
9576
  });
@@ -9435,6 +9670,8 @@ var GetBenchmarkResponse = zod.object({
9435
9670
  })
9436
9671
  }), zod.null()]),
9437
9672
  "notes": zod.union([zod.array(zod.string()), zod.null()]),
9673
+ "created_at": zod.string().datetime({ "offset": true }),
9674
+ "completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()]),
9438
9675
  "runs": zod.array(zod.object({
9439
9676
  "id": zod.string().uuid(),
9440
9677
  "eval_id": zod.string().uuid(),
@@ -9476,10 +9713,158 @@ var GetBenchmarkResponse = zod.object({
9476
9713
  "created_at": zod.string().datetime({ "offset": true }),
9477
9714
  "started_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()]),
9478
9715
  "completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
9716
+ }))
9717
+ }),
9718
+ "message": zod.string()
9719
+ });
9720
+ var ListWorkerEvalsParams = zod.object({
9721
+ "workerId": zod.string().uuid()
9722
+ });
9723
+ var listWorkerEvalsQueryCountDefault = 50;
9724
+ var listWorkerEvalsQueryCountMax = 100;
9725
+ var listWorkerEvalsQueryOffsetDefault = 0;
9726
+ var listWorkerEvalsQueryOffsetMin = 0;
9727
+ var listWorkerEvalsQuerySortByDefault = `created_at`;
9728
+ var listWorkerEvalsQuerySortOrderDefault = `desc`;
9729
+ var ListWorkerEvalsQueryParams = zod.object({
9730
+ "count": zod.number().min(1).max(listWorkerEvalsQueryCountMax).default(listWorkerEvalsQueryCountDefault),
9731
+ "offset": zod.number().min(listWorkerEvalsQueryOffsetMin).default(listWorkerEvalsQueryOffsetDefault),
9732
+ "sort_by": zod.enum(["created_at"]).default(listWorkerEvalsQuerySortByDefault),
9733
+ "sort_order": zod.enum(["asc", "desc"]).default(listWorkerEvalsQuerySortOrderDefault)
9734
+ });
9735
+ var listWorkerEvalsResponseMetaTotalMin = -9007199254740991;
9736
+ var listWorkerEvalsResponseMetaTotalMax = 9007199254740991;
9737
+ var ListWorkerEvalsResponse = zod.object({
9738
+ "data": zod.array(zod.object({
9739
+ "id": zod.string().uuid(),
9740
+ "name": zod.string(),
9741
+ "target": zod.object({
9742
+ "type": zod.enum(["worker", "chat_agent", "voice_agent"]),
9743
+ "id": zod.string().uuid()
9744
+ }),
9745
+ "source": zod.object({
9746
+ "type": zod.enum(["worker_run", "chat", "call"]),
9747
+ "id": zod.string().uuid()
9748
+ }),
9749
+ "fixture": zod.object({
9750
+ "version": zod.literal(1),
9751
+ "type": zod.literal("worker_run_replay"),
9752
+ "scope": zod.union([zod.record(zod.string(), zod.unknown()), zod.null()]),
9753
+ "resolved_artifact_ids": zod.array(zod.string().uuid()),
9754
+ "trigger_context": zod.union([zod.string(), zod.null()])
9755
+ }),
9756
+ "tool_mocks": zod.array(zod.object({
9757
+ "mcp_type": zod.string(),
9758
+ "tool_name": zod.string(),
9759
+ "description": zod.string(),
9760
+ "input_schema": zod.record(zod.string(), zod.unknown()),
9761
+ "match": zod.record(zod.string(), zod.unknown()).optional(),
9762
+ "logical_tool_name": zod.union([zod.string(), zod.null()]),
9763
+ "responses": zod.array(zod.unknown()),
9764
+ "inputs": zod.array(zod.unknown()).optional(),
9765
+ "default": zod.unknown().optional()
9479
9766
  })),
9767
+ "grader": zod.object({
9768
+ "type": zod.literal("prompt"),
9769
+ "assertions": zod.array(zod.string()),
9770
+ "criterion": zod.string().describe("Deprecated: assertions joined by newlines. Use assertions.")
9771
+ }),
9772
+ "created_at": zod.string().datetime({ "offset": true })
9773
+ })),
9774
+ "message": zod.string(),
9775
+ "meta": zod.object({
9776
+ "total": zod.number().int().min(listWorkerEvalsResponseMetaTotalMin).max(listWorkerEvalsResponseMetaTotalMax).describe("Total number of evals for the worker")
9777
+ })
9778
+ });
9779
+ var CreateWorkerBenchmarksParams = zod.object({
9780
+ "workerId": zod.string().uuid()
9781
+ });
9782
+ var createWorkerBenchmarksBodyCandidateVersionMax = 9007199254740991;
9783
+ var createWorkerBenchmarksBodyBaselineVersionMax = 9007199254740991;
9784
+ var createWorkerBenchmarksBodyRunsPerConfigurationDefault = 3;
9785
+ var createWorkerBenchmarksBodyRunsPerConfigurationMax = 5;
9786
+ var CreateWorkerBenchmarksBody = zod.object({
9787
+ "candidate_version": zod.number().int().min(1).max(createWorkerBenchmarksBodyCandidateVersionMax),
9788
+ "baseline_version": zod.number().int().min(1).max(createWorkerBenchmarksBodyBaselineVersionMax),
9789
+ "runs_per_configuration": zod.number().int().min(1).max(createWorkerBenchmarksBodyRunsPerConfigurationMax).default(createWorkerBenchmarksBodyRunsPerConfigurationDefault)
9790
+ });
9791
+ var createWorkerBenchmarksResponseDataItemCandidateVersionMin = -9007199254740991;
9792
+ var createWorkerBenchmarksResponseDataItemCandidateVersionMax = 9007199254740991;
9793
+ var createWorkerBenchmarksResponseDataItemBaselineVersionMin = -9007199254740991;
9794
+ var createWorkerBenchmarksResponseDataItemBaselineVersionMax = 9007199254740991;
9795
+ var createWorkerBenchmarksResponseDataItemRunsPerConfigurationMin = -9007199254740991;
9796
+ var createWorkerBenchmarksResponseDataItemRunsPerConfigurationMax = 9007199254740991;
9797
+ var createWorkerBenchmarksResponseDataItemRunSummaryOneCandidateRunsMin = -9007199254740991;
9798
+ var createWorkerBenchmarksResponseDataItemRunSummaryOneCandidateRunsMax = 9007199254740991;
9799
+ var createWorkerBenchmarksResponseDataItemRunSummaryOneCandidateGradedRunsMin = -9007199254740991;
9800
+ var createWorkerBenchmarksResponseDataItemRunSummaryOneCandidateGradedRunsMax = 9007199254740991;
9801
+ var createWorkerBenchmarksResponseDataItemRunSummaryOneBaselineRunsMin = -9007199254740991;
9802
+ var createWorkerBenchmarksResponseDataItemRunSummaryOneBaselineRunsMax = 9007199254740991;
9803
+ var createWorkerBenchmarksResponseDataItemRunSummaryOneBaselineGradedRunsMin = -9007199254740991;
9804
+ var createWorkerBenchmarksResponseDataItemRunSummaryOneBaselineGradedRunsMax = 9007199254740991;
9805
+ var CreateWorkerBenchmarksResponse = zod.object({
9806
+ "data": zod.array(zod.object({
9807
+ "id": zod.string().uuid(),
9808
+ "eval_id": zod.string().uuid(),
9809
+ "candidate_version": zod.number().int().min(createWorkerBenchmarksResponseDataItemCandidateVersionMin).max(createWorkerBenchmarksResponseDataItemCandidateVersionMax),
9810
+ "baseline_version": zod.number().int().min(createWorkerBenchmarksResponseDataItemBaselineVersionMin).max(createWorkerBenchmarksResponseDataItemBaselineVersionMax),
9811
+ "runs_per_configuration": zod.number().int().min(createWorkerBenchmarksResponseDataItemRunsPerConfigurationMin).max(createWorkerBenchmarksResponseDataItemRunsPerConfigurationMax),
9812
+ "status": zod.enum(["running", "completed", "error"]),
9813
+ "run_summary": zod.union([zod.object({
9814
+ "candidate": zod.object({
9815
+ "runs": zod.number().int().min(createWorkerBenchmarksResponseDataItemRunSummaryOneCandidateRunsMin).max(createWorkerBenchmarksResponseDataItemRunSummaryOneCandidateRunsMax),
9816
+ "graded_runs": zod.number().int().min(createWorkerBenchmarksResponseDataItemRunSummaryOneCandidateGradedRunsMin).max(createWorkerBenchmarksResponseDataItemRunSummaryOneCandidateGradedRunsMax),
9817
+ "pass_rate": zod.union([zod.object({
9818
+ "mean": zod.number(),
9819
+ "stddev": zod.number(),
9820
+ "min": zod.number(),
9821
+ "max": zod.number()
9822
+ }), zod.null()]),
9823
+ "duration_seconds": zod.union([zod.object({
9824
+ "mean": zod.number(),
9825
+ "stddev": zod.number(),
9826
+ "min": zod.number(),
9827
+ "max": zod.number()
9828
+ }), zod.null()]),
9829
+ "fixture_matched_rate": zod.union([zod.object({
9830
+ "mean": zod.number(),
9831
+ "stddev": zod.number(),
9832
+ "min": zod.number(),
9833
+ "max": zod.number()
9834
+ }), zod.null()])
9835
+ }),
9836
+ "baseline": zod.object({
9837
+ "runs": zod.number().int().min(createWorkerBenchmarksResponseDataItemRunSummaryOneBaselineRunsMin).max(createWorkerBenchmarksResponseDataItemRunSummaryOneBaselineRunsMax),
9838
+ "graded_runs": zod.number().int().min(createWorkerBenchmarksResponseDataItemRunSummaryOneBaselineGradedRunsMin).max(createWorkerBenchmarksResponseDataItemRunSummaryOneBaselineGradedRunsMax),
9839
+ "pass_rate": zod.union([zod.object({
9840
+ "mean": zod.number(),
9841
+ "stddev": zod.number(),
9842
+ "min": zod.number(),
9843
+ "max": zod.number()
9844
+ }), zod.null()]),
9845
+ "duration_seconds": zod.union([zod.object({
9846
+ "mean": zod.number(),
9847
+ "stddev": zod.number(),
9848
+ "min": zod.number(),
9849
+ "max": zod.number()
9850
+ }), zod.null()]),
9851
+ "fixture_matched_rate": zod.union([zod.object({
9852
+ "mean": zod.number(),
9853
+ "stddev": zod.number(),
9854
+ "min": zod.number(),
9855
+ "max": zod.number()
9856
+ }), zod.null()])
9857
+ }),
9858
+ "delta": zod.object({
9859
+ "pass_rate": zod.union([zod.number(), zod.null()]),
9860
+ "duration_seconds": zod.union([zod.number(), zod.null()]),
9861
+ "fixture_matched_rate": zod.union([zod.number(), zod.null()])
9862
+ })
9863
+ }), zod.null()]),
9864
+ "notes": zod.union([zod.array(zod.string()), zod.null()]),
9480
9865
  "created_at": zod.string().datetime({ "offset": true }),
9481
9866
  "completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
9482
- }),
9867
+ })),
9483
9868
  "message": zod.string()
9484
9869
  });
9485
9870
  var CreateExtractorBody = zod.object({
@@ -12957,6 +13342,23 @@ var createMcpServer = (options) => {
12957
13342
  signal: options?.signal ? AbortSignal.any([options.signal, ctx.signal]) : ctx.signal
12958
13343
  })
12959
13344
  );
13345
+ tools.listEvalBenchmarks = server2.registerTool(
13346
+ "listEvalBenchmarks",
13347
+ {
13348
+ title: "List an eval's benchmarks",
13349
+ description: "Benchmark history of an eval (newest first by default) without per-run details. Use GET /v1/benchmarks/{benchmarkId} for the runs.",
13350
+ inputSchema: {
13351
+ pathParams: ListEvalBenchmarksParams,
13352
+ queryParams: ListEvalBenchmarksQueryParams
13353
+ },
13354
+ outputSchema: ListEvalBenchmarksResponse,
13355
+ annotations: { readOnlyHint: true }
13356
+ },
13357
+ (args, ctx) => listEvalBenchmarksHandler(args, {
13358
+ ...options,
13359
+ signal: options?.signal ? AbortSignal.any([options.signal, ctx.signal]) : ctx.signal
13360
+ })
13361
+ );
12960
13362
  tools.getBenchmark = server2.registerTool(
12961
13363
  "getBenchmark",
12962
13364
  {
@@ -12973,6 +13375,40 @@ var createMcpServer = (options) => {
12973
13375
  signal: options?.signal ? AbortSignal.any([options.signal, ctx.signal]) : ctx.signal
12974
13376
  })
12975
13377
  );
13378
+ tools.listWorkerEvals = server2.registerTool(
13379
+ "listWorkerEvals",
13380
+ {
13381
+ title: "List a worker's evals",
13382
+ description: "List the evals recorded for a worker, newest first by default.",
13383
+ inputSchema: {
13384
+ pathParams: ListWorkerEvalsParams,
13385
+ queryParams: ListWorkerEvalsQueryParams
13386
+ },
13387
+ outputSchema: ListWorkerEvalsResponse,
13388
+ annotations: { readOnlyHint: true }
13389
+ },
13390
+ (args, ctx) => listWorkerEvalsHandler(args, {
13391
+ ...options,
13392
+ signal: options?.signal ? AbortSignal.any([options.signal, ctx.signal]) : ctx.signal
13393
+ })
13394
+ );
13395
+ tools.createWorkerBenchmarks = server2.registerTool(
13396
+ "createWorkerBenchmarks",
13397
+ {
13398
+ title: "Benchmark two worker versions on all of the worker's evals",
13399
+ description: "Create one benchmark per eval of the worker, each queueing runs_per_configuration trials against the candidate and the baseline version. Poll each benchmark with GET /v1/benchmarks/{benchmarkId}.",
13400
+ inputSchema: {
13401
+ pathParams: CreateWorkerBenchmarksParams,
13402
+ bodyParams: CreateWorkerBenchmarksBody.optional()
13403
+ },
13404
+ outputSchema: CreateWorkerBenchmarksResponse,
13405
+ annotations: { destructiveHint: true }
13406
+ },
13407
+ (args, ctx) => createWorkerBenchmarksHandler(args, {
13408
+ ...options,
13409
+ signal: options?.signal ? AbortSignal.any([options.signal, ctx.signal]) : ctx.signal
13410
+ })
13411
+ );
12976
13412
  tools.createExtractor = server2.registerTool(
12977
13413
  "createExtractor",
12978
13414
  {
@@ -14586,4 +15022,4 @@ var transport = new StdioServerTransport();
14586
15022
  server.connect(transport).then(() => {
14587
15023
  console.error("MCP server running on stdio");
14588
15024
  }).catch(console.error);
14589
- //# sourceMappingURL=server-DACHXX2C.js.map
15025
+ //# sourceMappingURL=server-EZUDCD4M.js.map