@avallon-labs/mcp 50.4.0 → 51.0.0-staging.1135

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
package/dist/index.js CHANGED
@@ -46,5 +46,5 @@ function setupFetch() {
46
46
 
47
47
  // src/index.ts
48
48
  setupFetch();
49
- await import("./server-NVU3VZZX.js");
49
+ await import("./server-XM676NBD.js");
50
50
  //# sourceMappingURL=index.js.map
@@ -1453,6 +1453,44 @@ var getEvalRun = async (evalRunId, options) => {
1453
1453
  const data = body ? JSON.parse(body) : {};
1454
1454
  return { data, status: res.status, headers: res.headers };
1455
1455
  };
1456
+ var getCreateEvalBenchmarkUrl = (evalId) => {
1457
+ return `/v1/evals/${evalId}/benchmarks`;
1458
+ };
1459
+ var createEvalBenchmark = async (evalId, createEvalBenchmarkBody, options) => {
1460
+ const getHeaders = (h) => {
1461
+ if (!h) return {};
1462
+ if (h instanceof Headers) return Object.fromEntries(h.entries());
1463
+ if (Array.isArray(h)) return Object.fromEntries(h);
1464
+ return h;
1465
+ };
1466
+ const res = await fetch(
1467
+ getCreateEvalBenchmarkUrl(evalId),
1468
+ {
1469
+ ...options,
1470
+ method: "POST",
1471
+ headers: { "Content-Type": "application/json", ...getHeaders(options?.headers) },
1472
+ body: JSON.stringify(createEvalBenchmarkBody)
1473
+ }
1474
+ );
1475
+ const body = [204, 205, 304].includes(res.status) ? null : await res.text();
1476
+ const data = body ? JSON.parse(body) : {};
1477
+ return { data, status: res.status, headers: res.headers };
1478
+ };
1479
+ var getGetBenchmarkUrl = (benchmarkId) => {
1480
+ return `/v1/benchmarks/${benchmarkId}`;
1481
+ };
1482
+ var getBenchmark = async (benchmarkId, options) => {
1483
+ const res = await fetch(
1484
+ getGetBenchmarkUrl(benchmarkId),
1485
+ {
1486
+ ...options,
1487
+ method: "GET"
1488
+ }
1489
+ );
1490
+ const body = [204, 205, 304].includes(res.status) ? null : await res.text();
1491
+ const data = body ? JSON.parse(body) : {};
1492
+ return { data, status: res.status, headers: res.headers };
1493
+ };
1456
1494
  var getCreateExtractorUrl = () => {
1457
1495
  return `/v1/extractors`;
1458
1496
  };
@@ -4975,6 +5013,52 @@ var getEvalRunHandler = async (args, options) => {
4975
5013
  structuredContent: res.data
4976
5014
  };
4977
5015
  };
5016
+ var createEvalBenchmarkHandler = async (args, options) => {
5017
+ const res = await createEvalBenchmark(args.pathParams.evalId, args.bodyParams, options);
5018
+ if (res.status >= 400) {
5019
+ return {
5020
+ content: [
5021
+ {
5022
+ type: "text",
5023
+ text: JSON.stringify(res.data ?? null)
5024
+ }
5025
+ ],
5026
+ isError: true
5027
+ };
5028
+ }
5029
+ return {
5030
+ content: [
5031
+ {
5032
+ type: "text",
5033
+ text: JSON.stringify(res.data ?? null)
5034
+ }
5035
+ ],
5036
+ structuredContent: res.data
5037
+ };
5038
+ };
5039
+ var getBenchmarkHandler = async (args, options) => {
5040
+ const res = await getBenchmark(args.pathParams.benchmarkId, options);
5041
+ if (res.status >= 400) {
5042
+ return {
5043
+ content: [
5044
+ {
5045
+ type: "text",
5046
+ text: JSON.stringify(res.data ?? null)
5047
+ }
5048
+ ],
5049
+ isError: true
5050
+ };
5051
+ }
5052
+ return {
5053
+ content: [
5054
+ {
5055
+ type: "text",
5056
+ text: JSON.stringify(res.data ?? null)
5057
+ }
5058
+ ],
5059
+ structuredContent: res.data
5060
+ };
5061
+ };
4978
5062
  var createExtractorHandler = async (args, options) => {
4979
5063
  const res = await createExtractor(args.bodyParams, options);
4980
5064
  if (res.status >= 400) {
@@ -8815,13 +8899,18 @@ var CreateWorkerEvalFromRunParams = zod.object({
8815
8899
  "workerRunId": zod.string().uuid()
8816
8900
  });
8817
8901
  var createWorkerEvalFromRunBodyNameMax = 200;
8818
- var createWorkerEvalFromRunBodyGraderCriterionMax = 1e4;
8902
+ var createWorkerEvalFromRunBodyGraderOneAssertionsItemMax = 2e3;
8903
+ var createWorkerEvalFromRunBodyGraderOneAssertionsMax = 50;
8904
+ var createWorkerEvalFromRunBodyGraderTwoCriterionMax = 1e4;
8819
8905
  var CreateWorkerEvalFromRunBody = zod.object({
8820
8906
  "name": zod.string().min(1).max(createWorkerEvalFromRunBodyNameMax),
8821
- "grader": zod.object({
8907
+ "grader": zod.union([zod.object({
8822
8908
  "type": zod.literal("prompt"),
8823
- "criterion": zod.string().min(1).max(createWorkerEvalFromRunBodyGraderCriterionMax)
8824
- })
8909
+ "assertions": zod.array(zod.string().min(1).max(createWorkerEvalFromRunBodyGraderOneAssertionsItemMax)).min(1).max(createWorkerEvalFromRunBodyGraderOneAssertionsMax)
8910
+ }), zod.object({
8911
+ "type": zod.literal("prompt"),
8912
+ "criterion": zod.string().min(1).max(createWorkerEvalFromRunBodyGraderTwoCriterionMax)
8913
+ })])
8825
8914
  });
8826
8915
  var CreateWorkerEvalFromRunResponse = zod.object({
8827
8916
  "data": zod.object({
@@ -8855,7 +8944,8 @@ var CreateWorkerEvalFromRunResponse = zod.object({
8855
8944
  })),
8856
8945
  "grader": zod.object({
8857
8946
  "type": zod.literal("prompt"),
8858
- "criterion": zod.string()
8947
+ "assertions": zod.array(zod.string()),
8948
+ "criterion": zod.string().describe("Deprecated: assertions joined by newlines. Use assertions.")
8859
8949
  }),
8860
8950
  "created_at": zod.string().datetime({ "offset": true })
8861
8951
  }),
@@ -8870,6 +8960,26 @@ var RunEvalBody = zod.object({
8870
8960
  });
8871
8961
  var runEvalResponseDataTargetVersionMin = -9007199254740991;
8872
8962
  var runEvalResponseDataTargetVersionMax = 9007199254740991;
8963
+ var runEvalResponseDataGradingOneSummaryTotalMin = -9007199254740991;
8964
+ var runEvalResponseDataGradingOneSummaryTotalMax = 9007199254740991;
8965
+ var runEvalResponseDataGradingOneSummaryPassedMin = -9007199254740991;
8966
+ var runEvalResponseDataGradingOneSummaryPassedMax = 9007199254740991;
8967
+ var runEvalResponseDataGradingOneSummaryFailedMin = -9007199254740991;
8968
+ var runEvalResponseDataGradingOneSummaryFailedMax = 9007199254740991;
8969
+ var runEvalResponseDataMetricsOneToolCallsMin = -9007199254740991;
8970
+ var runEvalResponseDataMetricsOneToolCallsMax = 9007199254740991;
8971
+ var runEvalResponseDataMetricsOneFixtureHealthExactMin = -9007199254740991;
8972
+ var runEvalResponseDataMetricsOneFixtureHealthExactMax = 9007199254740991;
8973
+ var runEvalResponseDataMetricsOneFixtureHealthPartialMin = -9007199254740991;
8974
+ var runEvalResponseDataMetricsOneFixtureHealthPartialMax = 9007199254740991;
8975
+ var runEvalResponseDataMetricsOneFixtureHealthFifoMin = -9007199254740991;
8976
+ var runEvalResponseDataMetricsOneFixtureHealthFifoMax = 9007199254740991;
8977
+ var runEvalResponseDataMetricsOneFixtureHealthDefaultMin = -9007199254740991;
8978
+ var runEvalResponseDataMetricsOneFixtureHealthDefaultMax = 9007199254740991;
8979
+ var runEvalResponseDataMetricsOneFixtureHealthUnavailableMin = -9007199254740991;
8980
+ var runEvalResponseDataMetricsOneFixtureHealthUnavailableMax = 9007199254740991;
8981
+ var runEvalResponseDataRunNumberOneMin = -9007199254740991;
8982
+ var runEvalResponseDataRunNumberOneMax = 9007199254740991;
8873
8983
  var RunEvalResponse = zod.object({
8874
8984
  "data": zod.object({
8875
8985
  "id": zod.string().uuid(),
@@ -8882,6 +8992,34 @@ var RunEvalResponse = zod.object({
8882
8992
  "judge_model": zod.union([zod.string(), zod.null()]),
8883
8993
  "judge_prompt_version": zod.union([zod.string(), zod.null()]),
8884
8994
  "tool_trace": zod.union([zod.unknown(), zod.null()]),
8995
+ "grading": zod.union([zod.object({
8996
+ "expectations": zod.array(zod.object({
8997
+ "text": zod.string(),
8998
+ "passed": zod.boolean(),
8999
+ "evidence": zod.string()
9000
+ })),
9001
+ "summary": zod.object({
9002
+ "total": zod.number().int().min(runEvalResponseDataGradingOneSummaryTotalMin).max(runEvalResponseDataGradingOneSummaryTotalMax),
9003
+ "passed": zod.number().int().min(runEvalResponseDataGradingOneSummaryPassedMin).max(runEvalResponseDataGradingOneSummaryPassedMax),
9004
+ "failed": zod.number().int().min(runEvalResponseDataGradingOneSummaryFailedMin).max(runEvalResponseDataGradingOneSummaryFailedMax),
9005
+ "pass_rate": zod.number()
9006
+ })
9007
+ }), zod.null()]),
9008
+ "metrics": zod.union([zod.object({
9009
+ "duration_seconds": zod.union([zod.number(), zod.null()]),
9010
+ "tool_calls": zod.number().int().min(runEvalResponseDataMetricsOneToolCallsMin).max(runEvalResponseDataMetricsOneToolCallsMax),
9011
+ "fixture_health": zod.object({
9012
+ "exact": zod.number().int().min(runEvalResponseDataMetricsOneFixtureHealthExactMin).max(runEvalResponseDataMetricsOneFixtureHealthExactMax),
9013
+ "partial": zod.number().int().min(runEvalResponseDataMetricsOneFixtureHealthPartialMin).max(runEvalResponseDataMetricsOneFixtureHealthPartialMax),
9014
+ "fifo": zod.number().int().min(runEvalResponseDataMetricsOneFixtureHealthFifoMin).max(runEvalResponseDataMetricsOneFixtureHealthFifoMax),
9015
+ "default": zod.number().int().min(runEvalResponseDataMetricsOneFixtureHealthDefaultMin).max(runEvalResponseDataMetricsOneFixtureHealthDefaultMax),
9016
+ "unavailable": zod.number().int().min(runEvalResponseDataMetricsOneFixtureHealthUnavailableMin).max(runEvalResponseDataMetricsOneFixtureHealthUnavailableMax),
9017
+ "matched_rate": zod.union([zod.number(), zod.null()])
9018
+ })
9019
+ }), zod.null()]),
9020
+ "benchmark_id": zod.union([zod.string().uuid(), zod.null()]),
9021
+ "configuration": zod.union([zod.enum(["candidate", "baseline"]), zod.null()]),
9022
+ "run_number": zod.union([zod.number().int().min(runEvalResponseDataRunNumberOneMin).max(runEvalResponseDataRunNumberOneMax), zod.null()]),
8885
9023
  "created_at": zod.string().datetime({ "offset": true }),
8886
9024
  "started_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()]),
8887
9025
  "completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
@@ -8893,6 +9031,26 @@ var GetEvalRunParams = zod.object({
8893
9031
  });
8894
9032
  var getEvalRunResponseDataTargetVersionMin = -9007199254740991;
8895
9033
  var getEvalRunResponseDataTargetVersionMax = 9007199254740991;
9034
+ var getEvalRunResponseDataGradingOneSummaryTotalMin = -9007199254740991;
9035
+ var getEvalRunResponseDataGradingOneSummaryTotalMax = 9007199254740991;
9036
+ var getEvalRunResponseDataGradingOneSummaryPassedMin = -9007199254740991;
9037
+ var getEvalRunResponseDataGradingOneSummaryPassedMax = 9007199254740991;
9038
+ var getEvalRunResponseDataGradingOneSummaryFailedMin = -9007199254740991;
9039
+ var getEvalRunResponseDataGradingOneSummaryFailedMax = 9007199254740991;
9040
+ var getEvalRunResponseDataMetricsOneToolCallsMin = -9007199254740991;
9041
+ var getEvalRunResponseDataMetricsOneToolCallsMax = 9007199254740991;
9042
+ var getEvalRunResponseDataMetricsOneFixtureHealthExactMin = -9007199254740991;
9043
+ var getEvalRunResponseDataMetricsOneFixtureHealthExactMax = 9007199254740991;
9044
+ var getEvalRunResponseDataMetricsOneFixtureHealthPartialMin = -9007199254740991;
9045
+ var getEvalRunResponseDataMetricsOneFixtureHealthPartialMax = 9007199254740991;
9046
+ var getEvalRunResponseDataMetricsOneFixtureHealthFifoMin = -9007199254740991;
9047
+ var getEvalRunResponseDataMetricsOneFixtureHealthFifoMax = 9007199254740991;
9048
+ var getEvalRunResponseDataMetricsOneFixtureHealthDefaultMin = -9007199254740991;
9049
+ var getEvalRunResponseDataMetricsOneFixtureHealthDefaultMax = 9007199254740991;
9050
+ var getEvalRunResponseDataMetricsOneFixtureHealthUnavailableMin = -9007199254740991;
9051
+ var getEvalRunResponseDataMetricsOneFixtureHealthUnavailableMax = 9007199254740991;
9052
+ var getEvalRunResponseDataRunNumberOneMin = -9007199254740991;
9053
+ var getEvalRunResponseDataRunNumberOneMax = 9007199254740991;
8896
9054
  var GetEvalRunResponse = zod.object({
8897
9055
  "data": zod.object({
8898
9056
  "id": zod.string().uuid(),
@@ -8905,12 +9063,341 @@ var GetEvalRunResponse = zod.object({
8905
9063
  "judge_model": zod.union([zod.string(), zod.null()]),
8906
9064
  "judge_prompt_version": zod.union([zod.string(), zod.null()]),
8907
9065
  "tool_trace": zod.union([zod.unknown(), zod.null()]),
9066
+ "grading": zod.union([zod.object({
9067
+ "expectations": zod.array(zod.object({
9068
+ "text": zod.string(),
9069
+ "passed": zod.boolean(),
9070
+ "evidence": zod.string()
9071
+ })),
9072
+ "summary": zod.object({
9073
+ "total": zod.number().int().min(getEvalRunResponseDataGradingOneSummaryTotalMin).max(getEvalRunResponseDataGradingOneSummaryTotalMax),
9074
+ "passed": zod.number().int().min(getEvalRunResponseDataGradingOneSummaryPassedMin).max(getEvalRunResponseDataGradingOneSummaryPassedMax),
9075
+ "failed": zod.number().int().min(getEvalRunResponseDataGradingOneSummaryFailedMin).max(getEvalRunResponseDataGradingOneSummaryFailedMax),
9076
+ "pass_rate": zod.number()
9077
+ })
9078
+ }), zod.null()]),
9079
+ "metrics": zod.union([zod.object({
9080
+ "duration_seconds": zod.union([zod.number(), zod.null()]),
9081
+ "tool_calls": zod.number().int().min(getEvalRunResponseDataMetricsOneToolCallsMin).max(getEvalRunResponseDataMetricsOneToolCallsMax),
9082
+ "fixture_health": zod.object({
9083
+ "exact": zod.number().int().min(getEvalRunResponseDataMetricsOneFixtureHealthExactMin).max(getEvalRunResponseDataMetricsOneFixtureHealthExactMax),
9084
+ "partial": zod.number().int().min(getEvalRunResponseDataMetricsOneFixtureHealthPartialMin).max(getEvalRunResponseDataMetricsOneFixtureHealthPartialMax),
9085
+ "fifo": zod.number().int().min(getEvalRunResponseDataMetricsOneFixtureHealthFifoMin).max(getEvalRunResponseDataMetricsOneFixtureHealthFifoMax),
9086
+ "default": zod.number().int().min(getEvalRunResponseDataMetricsOneFixtureHealthDefaultMin).max(getEvalRunResponseDataMetricsOneFixtureHealthDefaultMax),
9087
+ "unavailable": zod.number().int().min(getEvalRunResponseDataMetricsOneFixtureHealthUnavailableMin).max(getEvalRunResponseDataMetricsOneFixtureHealthUnavailableMax),
9088
+ "matched_rate": zod.union([zod.number(), zod.null()])
9089
+ })
9090
+ }), zod.null()]),
9091
+ "benchmark_id": zod.union([zod.string().uuid(), zod.null()]),
9092
+ "configuration": zod.union([zod.enum(["candidate", "baseline"]), zod.null()]),
9093
+ "run_number": zod.union([zod.number().int().min(getEvalRunResponseDataRunNumberOneMin).max(getEvalRunResponseDataRunNumberOneMax), zod.null()]),
8908
9094
  "created_at": zod.string().datetime({ "offset": true }),
8909
9095
  "started_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()]),
8910
9096
  "completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
8911
9097
  }),
8912
9098
  "message": zod.string()
8913
9099
  });
9100
+ var CreateEvalBenchmarkParams = zod.object({
9101
+ "evalId": zod.string().uuid()
9102
+ });
9103
+ var createEvalBenchmarkBodyCandidateVersionMax = 9007199254740991;
9104
+ var createEvalBenchmarkBodyBaselineVersionMax = 9007199254740991;
9105
+ var createEvalBenchmarkBodyRunsPerConfigurationDefault = 3;
9106
+ var createEvalBenchmarkBodyRunsPerConfigurationMax = 5;
9107
+ var CreateEvalBenchmarkBody = zod.object({
9108
+ "candidate_version": zod.number().int().min(1).max(createEvalBenchmarkBodyCandidateVersionMax),
9109
+ "baseline_version": zod.number().int().min(1).max(createEvalBenchmarkBodyBaselineVersionMax),
9110
+ "runs_per_configuration": zod.number().int().min(1).max(createEvalBenchmarkBodyRunsPerConfigurationMax).default(createEvalBenchmarkBodyRunsPerConfigurationDefault)
9111
+ });
9112
+ var createEvalBenchmarkResponseDataCandidateVersionMin = -9007199254740991;
9113
+ var createEvalBenchmarkResponseDataCandidateVersionMax = 9007199254740991;
9114
+ var createEvalBenchmarkResponseDataBaselineVersionMin = -9007199254740991;
9115
+ var createEvalBenchmarkResponseDataBaselineVersionMax = 9007199254740991;
9116
+ var createEvalBenchmarkResponseDataRunsPerConfigurationMin = -9007199254740991;
9117
+ var createEvalBenchmarkResponseDataRunsPerConfigurationMax = 9007199254740991;
9118
+ var createEvalBenchmarkResponseDataRunSummaryOneCandidateRunsMin = -9007199254740991;
9119
+ var createEvalBenchmarkResponseDataRunSummaryOneCandidateRunsMax = 9007199254740991;
9120
+ var createEvalBenchmarkResponseDataRunSummaryOneCandidateGradedRunsMin = -9007199254740991;
9121
+ var createEvalBenchmarkResponseDataRunSummaryOneCandidateGradedRunsMax = 9007199254740991;
9122
+ var createEvalBenchmarkResponseDataRunSummaryOneBaselineRunsMin = -9007199254740991;
9123
+ var createEvalBenchmarkResponseDataRunSummaryOneBaselineRunsMax = 9007199254740991;
9124
+ var createEvalBenchmarkResponseDataRunSummaryOneBaselineGradedRunsMin = -9007199254740991;
9125
+ var createEvalBenchmarkResponseDataRunSummaryOneBaselineGradedRunsMax = 9007199254740991;
9126
+ var createEvalBenchmarkResponseDataRunsItemTargetVersionMin = -9007199254740991;
9127
+ var createEvalBenchmarkResponseDataRunsItemTargetVersionMax = 9007199254740991;
9128
+ var createEvalBenchmarkResponseDataRunsItemGradingOneSummaryTotalMin = -9007199254740991;
9129
+ var createEvalBenchmarkResponseDataRunsItemGradingOneSummaryTotalMax = 9007199254740991;
9130
+ var createEvalBenchmarkResponseDataRunsItemGradingOneSummaryPassedMin = -9007199254740991;
9131
+ var createEvalBenchmarkResponseDataRunsItemGradingOneSummaryPassedMax = 9007199254740991;
9132
+ var createEvalBenchmarkResponseDataRunsItemGradingOneSummaryFailedMin = -9007199254740991;
9133
+ var createEvalBenchmarkResponseDataRunsItemGradingOneSummaryFailedMax = 9007199254740991;
9134
+ var createEvalBenchmarkResponseDataRunsItemMetricsOneToolCallsMin = -9007199254740991;
9135
+ var createEvalBenchmarkResponseDataRunsItemMetricsOneToolCallsMax = 9007199254740991;
9136
+ var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthExactMin = -9007199254740991;
9137
+ var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthExactMax = 9007199254740991;
9138
+ var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthPartialMin = -9007199254740991;
9139
+ var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthPartialMax = 9007199254740991;
9140
+ var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthFifoMin = -9007199254740991;
9141
+ var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthFifoMax = 9007199254740991;
9142
+ var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthDefaultMin = -9007199254740991;
9143
+ var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthDefaultMax = 9007199254740991;
9144
+ var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthUnavailableMin = -9007199254740991;
9145
+ var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthUnavailableMax = 9007199254740991;
9146
+ var createEvalBenchmarkResponseDataRunsItemRunNumberOneMin = -9007199254740991;
9147
+ var createEvalBenchmarkResponseDataRunsItemRunNumberOneMax = 9007199254740991;
9148
+ var CreateEvalBenchmarkResponse = zod.object({
9149
+ "data": zod.object({
9150
+ "id": zod.string().uuid(),
9151
+ "eval_id": zod.string().uuid(),
9152
+ "candidate_version": zod.number().int().min(createEvalBenchmarkResponseDataCandidateVersionMin).max(createEvalBenchmarkResponseDataCandidateVersionMax),
9153
+ "baseline_version": zod.number().int().min(createEvalBenchmarkResponseDataBaselineVersionMin).max(createEvalBenchmarkResponseDataBaselineVersionMax),
9154
+ "runs_per_configuration": zod.number().int().min(createEvalBenchmarkResponseDataRunsPerConfigurationMin).max(createEvalBenchmarkResponseDataRunsPerConfigurationMax),
9155
+ "status": zod.enum(["running", "completed", "error"]),
9156
+ "run_summary": zod.union([zod.object({
9157
+ "candidate": zod.object({
9158
+ "runs": zod.number().int().min(createEvalBenchmarkResponseDataRunSummaryOneCandidateRunsMin).max(createEvalBenchmarkResponseDataRunSummaryOneCandidateRunsMax),
9159
+ "graded_runs": zod.number().int().min(createEvalBenchmarkResponseDataRunSummaryOneCandidateGradedRunsMin).max(createEvalBenchmarkResponseDataRunSummaryOneCandidateGradedRunsMax),
9160
+ "pass_rate": zod.union([zod.object({
9161
+ "mean": zod.number(),
9162
+ "stddev": zod.number(),
9163
+ "min": zod.number(),
9164
+ "max": zod.number()
9165
+ }), zod.null()]),
9166
+ "duration_seconds": zod.union([zod.object({
9167
+ "mean": zod.number(),
9168
+ "stddev": zod.number(),
9169
+ "min": zod.number(),
9170
+ "max": zod.number()
9171
+ }), zod.null()]),
9172
+ "fixture_matched_rate": zod.union([zod.object({
9173
+ "mean": zod.number(),
9174
+ "stddev": zod.number(),
9175
+ "min": zod.number(),
9176
+ "max": zod.number()
9177
+ }), zod.null()])
9178
+ }),
9179
+ "baseline": zod.object({
9180
+ "runs": zod.number().int().min(createEvalBenchmarkResponseDataRunSummaryOneBaselineRunsMin).max(createEvalBenchmarkResponseDataRunSummaryOneBaselineRunsMax),
9181
+ "graded_runs": zod.number().int().min(createEvalBenchmarkResponseDataRunSummaryOneBaselineGradedRunsMin).max(createEvalBenchmarkResponseDataRunSummaryOneBaselineGradedRunsMax),
9182
+ "pass_rate": zod.union([zod.object({
9183
+ "mean": zod.number(),
9184
+ "stddev": zod.number(),
9185
+ "min": zod.number(),
9186
+ "max": zod.number()
9187
+ }), zod.null()]),
9188
+ "duration_seconds": zod.union([zod.object({
9189
+ "mean": zod.number(),
9190
+ "stddev": zod.number(),
9191
+ "min": zod.number(),
9192
+ "max": zod.number()
9193
+ }), zod.null()]),
9194
+ "fixture_matched_rate": zod.union([zod.object({
9195
+ "mean": zod.number(),
9196
+ "stddev": zod.number(),
9197
+ "min": zod.number(),
9198
+ "max": zod.number()
9199
+ }), zod.null()])
9200
+ }),
9201
+ "delta": zod.object({
9202
+ "pass_rate": zod.union([zod.number(), zod.null()]),
9203
+ "duration_seconds": zod.union([zod.number(), zod.null()]),
9204
+ "fixture_matched_rate": zod.union([zod.number(), zod.null()])
9205
+ })
9206
+ }), zod.null()]),
9207
+ "notes": zod.union([zod.array(zod.string()), zod.null()]),
9208
+ "runs": zod.array(zod.object({
9209
+ "id": zod.string().uuid(),
9210
+ "eval_id": zod.string().uuid(),
9211
+ "target_version": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemTargetVersionMin).max(createEvalBenchmarkResponseDataRunsItemTargetVersionMax),
9212
+ "status": zod.enum(["queued", "running", "passed", "failed", "error"]),
9213
+ "passed": zod.union([zod.boolean(), zod.null()]),
9214
+ "reason": zod.union([zod.string(), zod.null()]),
9215
+ "error": zod.union([zod.string(), zod.null()]),
9216
+ "judge_model": zod.union([zod.string(), zod.null()]),
9217
+ "judge_prompt_version": zod.union([zod.string(), zod.null()]),
9218
+ "grading": zod.union([zod.object({
9219
+ "expectations": zod.array(zod.object({
9220
+ "text": zod.string(),
9221
+ "passed": zod.boolean(),
9222
+ "evidence": zod.string()
9223
+ })),
9224
+ "summary": zod.object({
9225
+ "total": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemGradingOneSummaryTotalMin).max(createEvalBenchmarkResponseDataRunsItemGradingOneSummaryTotalMax),
9226
+ "passed": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemGradingOneSummaryPassedMin).max(createEvalBenchmarkResponseDataRunsItemGradingOneSummaryPassedMax),
9227
+ "failed": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemGradingOneSummaryFailedMin).max(createEvalBenchmarkResponseDataRunsItemGradingOneSummaryFailedMax),
9228
+ "pass_rate": zod.number()
9229
+ })
9230
+ }), zod.null()]),
9231
+ "metrics": zod.union([zod.object({
9232
+ "duration_seconds": zod.union([zod.number(), zod.null()]),
9233
+ "tool_calls": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemMetricsOneToolCallsMin).max(createEvalBenchmarkResponseDataRunsItemMetricsOneToolCallsMax),
9234
+ "fixture_health": zod.object({
9235
+ "exact": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthExactMin).max(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthExactMax),
9236
+ "partial": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthPartialMin).max(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthPartialMax),
9237
+ "fifo": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthFifoMin).max(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthFifoMax),
9238
+ "default": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthDefaultMin).max(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthDefaultMax),
9239
+ "unavailable": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthUnavailableMin).max(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthUnavailableMax),
9240
+ "matched_rate": zod.union([zod.number(), zod.null()])
9241
+ })
9242
+ }), zod.null()]),
9243
+ "benchmark_id": zod.union([zod.string().uuid(), zod.null()]),
9244
+ "configuration": zod.union([zod.enum(["candidate", "baseline"]), zod.null()]),
9245
+ "run_number": zod.union([zod.number().int().min(createEvalBenchmarkResponseDataRunsItemRunNumberOneMin).max(createEvalBenchmarkResponseDataRunsItemRunNumberOneMax), zod.null()]),
9246
+ "created_at": zod.string().datetime({ "offset": true }),
9247
+ "started_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()]),
9248
+ "completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
9249
+ })),
9250
+ "created_at": zod.string().datetime({ "offset": true }),
9251
+ "completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
9252
+ }),
9253
+ "message": zod.string()
9254
+ });
9255
+ var GetBenchmarkParams = zod.object({
9256
+ "benchmarkId": zod.string().uuid()
9257
+ });
9258
+ var getBenchmarkResponseDataCandidateVersionMin = -9007199254740991;
9259
+ var getBenchmarkResponseDataCandidateVersionMax = 9007199254740991;
9260
+ var getBenchmarkResponseDataBaselineVersionMin = -9007199254740991;
9261
+ var getBenchmarkResponseDataBaselineVersionMax = 9007199254740991;
9262
+ var getBenchmarkResponseDataRunsPerConfigurationMin = -9007199254740991;
9263
+ var getBenchmarkResponseDataRunsPerConfigurationMax = 9007199254740991;
9264
+ var getBenchmarkResponseDataRunSummaryOneCandidateRunsMin = -9007199254740991;
9265
+ var getBenchmarkResponseDataRunSummaryOneCandidateRunsMax = 9007199254740991;
9266
+ var getBenchmarkResponseDataRunSummaryOneCandidateGradedRunsMin = -9007199254740991;
9267
+ var getBenchmarkResponseDataRunSummaryOneCandidateGradedRunsMax = 9007199254740991;
9268
+ var getBenchmarkResponseDataRunSummaryOneBaselineRunsMin = -9007199254740991;
9269
+ var getBenchmarkResponseDataRunSummaryOneBaselineRunsMax = 9007199254740991;
9270
+ var getBenchmarkResponseDataRunSummaryOneBaselineGradedRunsMin = -9007199254740991;
9271
+ var getBenchmarkResponseDataRunSummaryOneBaselineGradedRunsMax = 9007199254740991;
9272
+ var getBenchmarkResponseDataRunsItemTargetVersionMin = -9007199254740991;
9273
+ var getBenchmarkResponseDataRunsItemTargetVersionMax = 9007199254740991;
9274
+ var getBenchmarkResponseDataRunsItemGradingOneSummaryTotalMin = -9007199254740991;
9275
+ var getBenchmarkResponseDataRunsItemGradingOneSummaryTotalMax = 9007199254740991;
9276
+ var getBenchmarkResponseDataRunsItemGradingOneSummaryPassedMin = -9007199254740991;
9277
+ var getBenchmarkResponseDataRunsItemGradingOneSummaryPassedMax = 9007199254740991;
9278
+ var getBenchmarkResponseDataRunsItemGradingOneSummaryFailedMin = -9007199254740991;
9279
+ var getBenchmarkResponseDataRunsItemGradingOneSummaryFailedMax = 9007199254740991;
9280
+ var getBenchmarkResponseDataRunsItemMetricsOneToolCallsMin = -9007199254740991;
9281
+ var getBenchmarkResponseDataRunsItemMetricsOneToolCallsMax = 9007199254740991;
9282
+ var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthExactMin = -9007199254740991;
9283
+ var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthExactMax = 9007199254740991;
9284
+ var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthPartialMin = -9007199254740991;
9285
+ var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthPartialMax = 9007199254740991;
9286
+ var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthFifoMin = -9007199254740991;
9287
+ var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthFifoMax = 9007199254740991;
9288
+ var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthDefaultMin = -9007199254740991;
9289
+ var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthDefaultMax = 9007199254740991;
9290
+ var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthUnavailableMin = -9007199254740991;
9291
+ var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthUnavailableMax = 9007199254740991;
9292
+ var getBenchmarkResponseDataRunsItemRunNumberOneMin = -9007199254740991;
9293
+ var getBenchmarkResponseDataRunsItemRunNumberOneMax = 9007199254740991;
9294
+ var GetBenchmarkResponse = zod.object({
9295
+ "data": zod.object({
9296
+ "id": zod.string().uuid(),
9297
+ "eval_id": zod.string().uuid(),
9298
+ "candidate_version": zod.number().int().min(getBenchmarkResponseDataCandidateVersionMin).max(getBenchmarkResponseDataCandidateVersionMax),
9299
+ "baseline_version": zod.number().int().min(getBenchmarkResponseDataBaselineVersionMin).max(getBenchmarkResponseDataBaselineVersionMax),
9300
+ "runs_per_configuration": zod.number().int().min(getBenchmarkResponseDataRunsPerConfigurationMin).max(getBenchmarkResponseDataRunsPerConfigurationMax),
9301
+ "status": zod.enum(["running", "completed", "error"]),
9302
+ "run_summary": zod.union([zod.object({
9303
+ "candidate": zod.object({
9304
+ "runs": zod.number().int().min(getBenchmarkResponseDataRunSummaryOneCandidateRunsMin).max(getBenchmarkResponseDataRunSummaryOneCandidateRunsMax),
9305
+ "graded_runs": zod.number().int().min(getBenchmarkResponseDataRunSummaryOneCandidateGradedRunsMin).max(getBenchmarkResponseDataRunSummaryOneCandidateGradedRunsMax),
9306
+ "pass_rate": zod.union([zod.object({
9307
+ "mean": zod.number(),
9308
+ "stddev": zod.number(),
9309
+ "min": zod.number(),
9310
+ "max": zod.number()
9311
+ }), zod.null()]),
9312
+ "duration_seconds": zod.union([zod.object({
9313
+ "mean": zod.number(),
9314
+ "stddev": zod.number(),
9315
+ "min": zod.number(),
9316
+ "max": zod.number()
9317
+ }), zod.null()]),
9318
+ "fixture_matched_rate": zod.union([zod.object({
9319
+ "mean": zod.number(),
9320
+ "stddev": zod.number(),
9321
+ "min": zod.number(),
9322
+ "max": zod.number()
9323
+ }), zod.null()])
9324
+ }),
9325
+ "baseline": zod.object({
9326
+ "runs": zod.number().int().min(getBenchmarkResponseDataRunSummaryOneBaselineRunsMin).max(getBenchmarkResponseDataRunSummaryOneBaselineRunsMax),
9327
+ "graded_runs": zod.number().int().min(getBenchmarkResponseDataRunSummaryOneBaselineGradedRunsMin).max(getBenchmarkResponseDataRunSummaryOneBaselineGradedRunsMax),
9328
+ "pass_rate": zod.union([zod.object({
9329
+ "mean": zod.number(),
9330
+ "stddev": zod.number(),
9331
+ "min": zod.number(),
9332
+ "max": zod.number()
9333
+ }), zod.null()]),
9334
+ "duration_seconds": zod.union([zod.object({
9335
+ "mean": zod.number(),
9336
+ "stddev": zod.number(),
9337
+ "min": zod.number(),
9338
+ "max": zod.number()
9339
+ }), zod.null()]),
9340
+ "fixture_matched_rate": zod.union([zod.object({
9341
+ "mean": zod.number(),
9342
+ "stddev": zod.number(),
9343
+ "min": zod.number(),
9344
+ "max": zod.number()
9345
+ }), zod.null()])
9346
+ }),
9347
+ "delta": zod.object({
9348
+ "pass_rate": zod.union([zod.number(), zod.null()]),
9349
+ "duration_seconds": zod.union([zod.number(), zod.null()]),
9350
+ "fixture_matched_rate": zod.union([zod.number(), zod.null()])
9351
+ })
9352
+ }), zod.null()]),
9353
+ "notes": zod.union([zod.array(zod.string()), zod.null()]),
9354
+ "runs": zod.array(zod.object({
9355
+ "id": zod.string().uuid(),
9356
+ "eval_id": zod.string().uuid(),
9357
+ "target_version": zod.number().int().min(getBenchmarkResponseDataRunsItemTargetVersionMin).max(getBenchmarkResponseDataRunsItemTargetVersionMax),
9358
+ "status": zod.enum(["queued", "running", "passed", "failed", "error"]),
9359
+ "passed": zod.union([zod.boolean(), zod.null()]),
9360
+ "reason": zod.union([zod.string(), zod.null()]),
9361
+ "error": zod.union([zod.string(), zod.null()]),
9362
+ "judge_model": zod.union([zod.string(), zod.null()]),
9363
+ "judge_prompt_version": zod.union([zod.string(), zod.null()]),
9364
+ "grading": zod.union([zod.object({
9365
+ "expectations": zod.array(zod.object({
9366
+ "text": zod.string(),
9367
+ "passed": zod.boolean(),
9368
+ "evidence": zod.string()
9369
+ })),
9370
+ "summary": zod.object({
9371
+ "total": zod.number().int().min(getBenchmarkResponseDataRunsItemGradingOneSummaryTotalMin).max(getBenchmarkResponseDataRunsItemGradingOneSummaryTotalMax),
9372
+ "passed": zod.number().int().min(getBenchmarkResponseDataRunsItemGradingOneSummaryPassedMin).max(getBenchmarkResponseDataRunsItemGradingOneSummaryPassedMax),
9373
+ "failed": zod.number().int().min(getBenchmarkResponseDataRunsItemGradingOneSummaryFailedMin).max(getBenchmarkResponseDataRunsItemGradingOneSummaryFailedMax),
9374
+ "pass_rate": zod.number()
9375
+ })
9376
+ }), zod.null()]),
9377
+ "metrics": zod.union([zod.object({
9378
+ "duration_seconds": zod.union([zod.number(), zod.null()]),
9379
+ "tool_calls": zod.number().int().min(getBenchmarkResponseDataRunsItemMetricsOneToolCallsMin).max(getBenchmarkResponseDataRunsItemMetricsOneToolCallsMax),
9380
+ "fixture_health": zod.object({
9381
+ "exact": zod.number().int().min(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthExactMin).max(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthExactMax),
9382
+ "partial": zod.number().int().min(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthPartialMin).max(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthPartialMax),
9383
+ "fifo": zod.number().int().min(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthFifoMin).max(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthFifoMax),
9384
+ "default": zod.number().int().min(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthDefaultMin).max(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthDefaultMax),
9385
+ "unavailable": zod.number().int().min(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthUnavailableMin).max(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthUnavailableMax),
9386
+ "matched_rate": zod.union([zod.number(), zod.null()])
9387
+ })
9388
+ }), zod.null()]),
9389
+ "benchmark_id": zod.union([zod.string().uuid(), zod.null()]),
9390
+ "configuration": zod.union([zod.enum(["candidate", "baseline"]), zod.null()]),
9391
+ "run_number": zod.union([zod.number().int().min(getBenchmarkResponseDataRunsItemRunNumberOneMin).max(getBenchmarkResponseDataRunsItemRunNumberOneMax), zod.null()]),
9392
+ "created_at": zod.string().datetime({ "offset": true }),
9393
+ "started_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()]),
9394
+ "completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
9395
+ })),
9396
+ "created_at": zod.string().datetime({ "offset": true }),
9397
+ "completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
9398
+ }),
9399
+ "message": zod.string()
9400
+ });
8914
9401
  var CreateExtractorBody = zod.object({
8915
9402
  "name": zod.string().min(1),
8916
9403
  "schema": zod.record(zod.string(), zod.unknown())
@@ -12304,7 +12791,7 @@ var createMcpServer = (options) => {
12304
12791
  "createWorkerEvalFromRun",
12305
12792
  {
12306
12793
  title: "Create a worker eval from a run",
12307
- description: "Snapshot a worker run's trigger and resolved artifacts, and record its MCP tool responses from telemetry for replay.",
12794
+ description: "Snapshot a worker run's trigger and resolved artifacts, and record its MCP tool responses from telemetry for replay. Each assertion is graded PASS/FAIL independently on every run.",
12308
12795
  inputSchema: {
12309
12796
  pathParams: CreateWorkerEvalFromRunParams,
12310
12797
  bodyParams: CreateWorkerEvalFromRunBody.optional()
@@ -12350,6 +12837,39 @@ var createMcpServer = (options) => {
12350
12837
  signal: options?.signal ? AbortSignal.any([options.signal, ctx.signal]) : ctx.signal
12351
12838
  })
12352
12839
  );
12840
+ tools.createEvalBenchmark = server2.registerTool(
12841
+ "createEvalBenchmark",
12842
+ {
12843
+ title: "Benchmark two worker versions on an eval",
12844
+ description: "Queue runs_per_configuration trials of the eval against a candidate and a baseline worker version. When all trials finish, the benchmark reports mean \xB1 stddev pass rate per configuration, the candidate-minus-baseline delta, and analyzer notes.",
12845
+ inputSchema: {
12846
+ pathParams: CreateEvalBenchmarkParams,
12847
+ bodyParams: CreateEvalBenchmarkBody.optional()
12848
+ },
12849
+ outputSchema: CreateEvalBenchmarkResponse,
12850
+ annotations: { destructiveHint: true }
12851
+ },
12852
+ (args, ctx) => createEvalBenchmarkHandler(args, {
12853
+ ...options,
12854
+ signal: options?.signal ? AbortSignal.any([options.signal, ctx.signal]) : ctx.signal
12855
+ })
12856
+ );
12857
+ tools.getBenchmark = server2.registerTool(
12858
+ "getBenchmark",
12859
+ {
12860
+ title: "Get a benchmark",
12861
+ description: "Get a benchmark with its per-run gradings and metrics, and once all runs finished, the per-configuration summary, delta, and analyzer notes.",
12862
+ inputSchema: {
12863
+ pathParams: GetBenchmarkParams
12864
+ },
12865
+ outputSchema: GetBenchmarkResponse,
12866
+ annotations: { readOnlyHint: true }
12867
+ },
12868
+ (args, ctx) => getBenchmarkHandler(args, {
12869
+ ...options,
12870
+ signal: options?.signal ? AbortSignal.any([options.signal, ctx.signal]) : ctx.signal
12871
+ })
12872
+ );
12353
12873
  tools.createExtractor = server2.registerTool(
12354
12874
  "createExtractor",
12355
12875
  {
@@ -13934,4 +14454,4 @@ var transport = new StdioServerTransport();
13934
14454
  server.connect(transport).then(() => {
13935
14455
  console.error("MCP server running on stdio");
13936
14456
  }).catch(console.error);
13937
- //# sourceMappingURL=server-NVU3VZZX.js.map
14457
+ //# sourceMappingURL=server-XM676NBD.js.map