@avallon-labs/mcp 50.4.0 → 51.0.0-staging.1135
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
package/dist/index.js
CHANGED
|
@@ -1453,6 +1453,44 @@ var getEvalRun = async (evalRunId, options) => {
|
|
|
1453
1453
|
const data = body ? JSON.parse(body) : {};
|
|
1454
1454
|
return { data, status: res.status, headers: res.headers };
|
|
1455
1455
|
};
|
|
1456
|
+
var getCreateEvalBenchmarkUrl = (evalId) => {
|
|
1457
|
+
return `/v1/evals/${evalId}/benchmarks`;
|
|
1458
|
+
};
|
|
1459
|
+
var createEvalBenchmark = async (evalId, createEvalBenchmarkBody, options) => {
|
|
1460
|
+
const getHeaders = (h) => {
|
|
1461
|
+
if (!h) return {};
|
|
1462
|
+
if (h instanceof Headers) return Object.fromEntries(h.entries());
|
|
1463
|
+
if (Array.isArray(h)) return Object.fromEntries(h);
|
|
1464
|
+
return h;
|
|
1465
|
+
};
|
|
1466
|
+
const res = await fetch(
|
|
1467
|
+
getCreateEvalBenchmarkUrl(evalId),
|
|
1468
|
+
{
|
|
1469
|
+
...options,
|
|
1470
|
+
method: "POST",
|
|
1471
|
+
headers: { "Content-Type": "application/json", ...getHeaders(options?.headers) },
|
|
1472
|
+
body: JSON.stringify(createEvalBenchmarkBody)
|
|
1473
|
+
}
|
|
1474
|
+
);
|
|
1475
|
+
const body = [204, 205, 304].includes(res.status) ? null : await res.text();
|
|
1476
|
+
const data = body ? JSON.parse(body) : {};
|
|
1477
|
+
return { data, status: res.status, headers: res.headers };
|
|
1478
|
+
};
|
|
1479
|
+
var getGetBenchmarkUrl = (benchmarkId) => {
|
|
1480
|
+
return `/v1/benchmarks/${benchmarkId}`;
|
|
1481
|
+
};
|
|
1482
|
+
var getBenchmark = async (benchmarkId, options) => {
|
|
1483
|
+
const res = await fetch(
|
|
1484
|
+
getGetBenchmarkUrl(benchmarkId),
|
|
1485
|
+
{
|
|
1486
|
+
...options,
|
|
1487
|
+
method: "GET"
|
|
1488
|
+
}
|
|
1489
|
+
);
|
|
1490
|
+
const body = [204, 205, 304].includes(res.status) ? null : await res.text();
|
|
1491
|
+
const data = body ? JSON.parse(body) : {};
|
|
1492
|
+
return { data, status: res.status, headers: res.headers };
|
|
1493
|
+
};
|
|
1456
1494
|
var getCreateExtractorUrl = () => {
|
|
1457
1495
|
return `/v1/extractors`;
|
|
1458
1496
|
};
|
|
@@ -4975,6 +5013,52 @@ var getEvalRunHandler = async (args, options) => {
|
|
|
4975
5013
|
structuredContent: res.data
|
|
4976
5014
|
};
|
|
4977
5015
|
};
|
|
5016
|
+
var createEvalBenchmarkHandler = async (args, options) => {
|
|
5017
|
+
const res = await createEvalBenchmark(args.pathParams.evalId, args.bodyParams, options);
|
|
5018
|
+
if (res.status >= 400) {
|
|
5019
|
+
return {
|
|
5020
|
+
content: [
|
|
5021
|
+
{
|
|
5022
|
+
type: "text",
|
|
5023
|
+
text: JSON.stringify(res.data ?? null)
|
|
5024
|
+
}
|
|
5025
|
+
],
|
|
5026
|
+
isError: true
|
|
5027
|
+
};
|
|
5028
|
+
}
|
|
5029
|
+
return {
|
|
5030
|
+
content: [
|
|
5031
|
+
{
|
|
5032
|
+
type: "text",
|
|
5033
|
+
text: JSON.stringify(res.data ?? null)
|
|
5034
|
+
}
|
|
5035
|
+
],
|
|
5036
|
+
structuredContent: res.data
|
|
5037
|
+
};
|
|
5038
|
+
};
|
|
5039
|
+
var getBenchmarkHandler = async (args, options) => {
|
|
5040
|
+
const res = await getBenchmark(args.pathParams.benchmarkId, options);
|
|
5041
|
+
if (res.status >= 400) {
|
|
5042
|
+
return {
|
|
5043
|
+
content: [
|
|
5044
|
+
{
|
|
5045
|
+
type: "text",
|
|
5046
|
+
text: JSON.stringify(res.data ?? null)
|
|
5047
|
+
}
|
|
5048
|
+
],
|
|
5049
|
+
isError: true
|
|
5050
|
+
};
|
|
5051
|
+
}
|
|
5052
|
+
return {
|
|
5053
|
+
content: [
|
|
5054
|
+
{
|
|
5055
|
+
type: "text",
|
|
5056
|
+
text: JSON.stringify(res.data ?? null)
|
|
5057
|
+
}
|
|
5058
|
+
],
|
|
5059
|
+
structuredContent: res.data
|
|
5060
|
+
};
|
|
5061
|
+
};
|
|
4978
5062
|
var createExtractorHandler = async (args, options) => {
|
|
4979
5063
|
const res = await createExtractor(args.bodyParams, options);
|
|
4980
5064
|
if (res.status >= 400) {
|
|
@@ -8815,13 +8899,18 @@ var CreateWorkerEvalFromRunParams = zod.object({
|
|
|
8815
8899
|
"workerRunId": zod.string().uuid()
|
|
8816
8900
|
});
|
|
8817
8901
|
var createWorkerEvalFromRunBodyNameMax = 200;
|
|
8818
|
-
var
|
|
8902
|
+
var createWorkerEvalFromRunBodyGraderOneAssertionsItemMax = 2e3;
|
|
8903
|
+
var createWorkerEvalFromRunBodyGraderOneAssertionsMax = 50;
|
|
8904
|
+
var createWorkerEvalFromRunBodyGraderTwoCriterionMax = 1e4;
|
|
8819
8905
|
var CreateWorkerEvalFromRunBody = zod.object({
|
|
8820
8906
|
"name": zod.string().min(1).max(createWorkerEvalFromRunBodyNameMax),
|
|
8821
|
-
"grader": zod.object({
|
|
8907
|
+
"grader": zod.union([zod.object({
|
|
8822
8908
|
"type": zod.literal("prompt"),
|
|
8823
|
-
"
|
|
8824
|
-
})
|
|
8909
|
+
"assertions": zod.array(zod.string().min(1).max(createWorkerEvalFromRunBodyGraderOneAssertionsItemMax)).min(1).max(createWorkerEvalFromRunBodyGraderOneAssertionsMax)
|
|
8910
|
+
}), zod.object({
|
|
8911
|
+
"type": zod.literal("prompt"),
|
|
8912
|
+
"criterion": zod.string().min(1).max(createWorkerEvalFromRunBodyGraderTwoCriterionMax)
|
|
8913
|
+
})])
|
|
8825
8914
|
});
|
|
8826
8915
|
var CreateWorkerEvalFromRunResponse = zod.object({
|
|
8827
8916
|
"data": zod.object({
|
|
@@ -8855,7 +8944,8 @@ var CreateWorkerEvalFromRunResponse = zod.object({
|
|
|
8855
8944
|
})),
|
|
8856
8945
|
"grader": zod.object({
|
|
8857
8946
|
"type": zod.literal("prompt"),
|
|
8858
|
-
"
|
|
8947
|
+
"assertions": zod.array(zod.string()),
|
|
8948
|
+
"criterion": zod.string().describe("Deprecated: assertions joined by newlines. Use assertions.")
|
|
8859
8949
|
}),
|
|
8860
8950
|
"created_at": zod.string().datetime({ "offset": true })
|
|
8861
8951
|
}),
|
|
@@ -8870,6 +8960,26 @@ var RunEvalBody = zod.object({
|
|
|
8870
8960
|
});
|
|
8871
8961
|
var runEvalResponseDataTargetVersionMin = -9007199254740991;
|
|
8872
8962
|
var runEvalResponseDataTargetVersionMax = 9007199254740991;
|
|
8963
|
+
var runEvalResponseDataGradingOneSummaryTotalMin = -9007199254740991;
|
|
8964
|
+
var runEvalResponseDataGradingOneSummaryTotalMax = 9007199254740991;
|
|
8965
|
+
var runEvalResponseDataGradingOneSummaryPassedMin = -9007199254740991;
|
|
8966
|
+
var runEvalResponseDataGradingOneSummaryPassedMax = 9007199254740991;
|
|
8967
|
+
var runEvalResponseDataGradingOneSummaryFailedMin = -9007199254740991;
|
|
8968
|
+
var runEvalResponseDataGradingOneSummaryFailedMax = 9007199254740991;
|
|
8969
|
+
var runEvalResponseDataMetricsOneToolCallsMin = -9007199254740991;
|
|
8970
|
+
var runEvalResponseDataMetricsOneToolCallsMax = 9007199254740991;
|
|
8971
|
+
var runEvalResponseDataMetricsOneFixtureHealthExactMin = -9007199254740991;
|
|
8972
|
+
var runEvalResponseDataMetricsOneFixtureHealthExactMax = 9007199254740991;
|
|
8973
|
+
var runEvalResponseDataMetricsOneFixtureHealthPartialMin = -9007199254740991;
|
|
8974
|
+
var runEvalResponseDataMetricsOneFixtureHealthPartialMax = 9007199254740991;
|
|
8975
|
+
var runEvalResponseDataMetricsOneFixtureHealthFifoMin = -9007199254740991;
|
|
8976
|
+
var runEvalResponseDataMetricsOneFixtureHealthFifoMax = 9007199254740991;
|
|
8977
|
+
var runEvalResponseDataMetricsOneFixtureHealthDefaultMin = -9007199254740991;
|
|
8978
|
+
var runEvalResponseDataMetricsOneFixtureHealthDefaultMax = 9007199254740991;
|
|
8979
|
+
var runEvalResponseDataMetricsOneFixtureHealthUnavailableMin = -9007199254740991;
|
|
8980
|
+
var runEvalResponseDataMetricsOneFixtureHealthUnavailableMax = 9007199254740991;
|
|
8981
|
+
var runEvalResponseDataRunNumberOneMin = -9007199254740991;
|
|
8982
|
+
var runEvalResponseDataRunNumberOneMax = 9007199254740991;
|
|
8873
8983
|
var RunEvalResponse = zod.object({
|
|
8874
8984
|
"data": zod.object({
|
|
8875
8985
|
"id": zod.string().uuid(),
|
|
@@ -8882,6 +8992,34 @@ var RunEvalResponse = zod.object({
|
|
|
8882
8992
|
"judge_model": zod.union([zod.string(), zod.null()]),
|
|
8883
8993
|
"judge_prompt_version": zod.union([zod.string(), zod.null()]),
|
|
8884
8994
|
"tool_trace": zod.union([zod.unknown(), zod.null()]),
|
|
8995
|
+
"grading": zod.union([zod.object({
|
|
8996
|
+
"expectations": zod.array(zod.object({
|
|
8997
|
+
"text": zod.string(),
|
|
8998
|
+
"passed": zod.boolean(),
|
|
8999
|
+
"evidence": zod.string()
|
|
9000
|
+
})),
|
|
9001
|
+
"summary": zod.object({
|
|
9002
|
+
"total": zod.number().int().min(runEvalResponseDataGradingOneSummaryTotalMin).max(runEvalResponseDataGradingOneSummaryTotalMax),
|
|
9003
|
+
"passed": zod.number().int().min(runEvalResponseDataGradingOneSummaryPassedMin).max(runEvalResponseDataGradingOneSummaryPassedMax),
|
|
9004
|
+
"failed": zod.number().int().min(runEvalResponseDataGradingOneSummaryFailedMin).max(runEvalResponseDataGradingOneSummaryFailedMax),
|
|
9005
|
+
"pass_rate": zod.number()
|
|
9006
|
+
})
|
|
9007
|
+
}), zod.null()]),
|
|
9008
|
+
"metrics": zod.union([zod.object({
|
|
9009
|
+
"duration_seconds": zod.union([zod.number(), zod.null()]),
|
|
9010
|
+
"tool_calls": zod.number().int().min(runEvalResponseDataMetricsOneToolCallsMin).max(runEvalResponseDataMetricsOneToolCallsMax),
|
|
9011
|
+
"fixture_health": zod.object({
|
|
9012
|
+
"exact": zod.number().int().min(runEvalResponseDataMetricsOneFixtureHealthExactMin).max(runEvalResponseDataMetricsOneFixtureHealthExactMax),
|
|
9013
|
+
"partial": zod.number().int().min(runEvalResponseDataMetricsOneFixtureHealthPartialMin).max(runEvalResponseDataMetricsOneFixtureHealthPartialMax),
|
|
9014
|
+
"fifo": zod.number().int().min(runEvalResponseDataMetricsOneFixtureHealthFifoMin).max(runEvalResponseDataMetricsOneFixtureHealthFifoMax),
|
|
9015
|
+
"default": zod.number().int().min(runEvalResponseDataMetricsOneFixtureHealthDefaultMin).max(runEvalResponseDataMetricsOneFixtureHealthDefaultMax),
|
|
9016
|
+
"unavailable": zod.number().int().min(runEvalResponseDataMetricsOneFixtureHealthUnavailableMin).max(runEvalResponseDataMetricsOneFixtureHealthUnavailableMax),
|
|
9017
|
+
"matched_rate": zod.union([zod.number(), zod.null()])
|
|
9018
|
+
})
|
|
9019
|
+
}), zod.null()]),
|
|
9020
|
+
"benchmark_id": zod.union([zod.string().uuid(), zod.null()]),
|
|
9021
|
+
"configuration": zod.union([zod.enum(["candidate", "baseline"]), zod.null()]),
|
|
9022
|
+
"run_number": zod.union([zod.number().int().min(runEvalResponseDataRunNumberOneMin).max(runEvalResponseDataRunNumberOneMax), zod.null()]),
|
|
8885
9023
|
"created_at": zod.string().datetime({ "offset": true }),
|
|
8886
9024
|
"started_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()]),
|
|
8887
9025
|
"completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
|
|
@@ -8893,6 +9031,26 @@ var GetEvalRunParams = zod.object({
|
|
|
8893
9031
|
});
|
|
8894
9032
|
var getEvalRunResponseDataTargetVersionMin = -9007199254740991;
|
|
8895
9033
|
var getEvalRunResponseDataTargetVersionMax = 9007199254740991;
|
|
9034
|
+
var getEvalRunResponseDataGradingOneSummaryTotalMin = -9007199254740991;
|
|
9035
|
+
var getEvalRunResponseDataGradingOneSummaryTotalMax = 9007199254740991;
|
|
9036
|
+
var getEvalRunResponseDataGradingOneSummaryPassedMin = -9007199254740991;
|
|
9037
|
+
var getEvalRunResponseDataGradingOneSummaryPassedMax = 9007199254740991;
|
|
9038
|
+
var getEvalRunResponseDataGradingOneSummaryFailedMin = -9007199254740991;
|
|
9039
|
+
var getEvalRunResponseDataGradingOneSummaryFailedMax = 9007199254740991;
|
|
9040
|
+
var getEvalRunResponseDataMetricsOneToolCallsMin = -9007199254740991;
|
|
9041
|
+
var getEvalRunResponseDataMetricsOneToolCallsMax = 9007199254740991;
|
|
9042
|
+
var getEvalRunResponseDataMetricsOneFixtureHealthExactMin = -9007199254740991;
|
|
9043
|
+
var getEvalRunResponseDataMetricsOneFixtureHealthExactMax = 9007199254740991;
|
|
9044
|
+
var getEvalRunResponseDataMetricsOneFixtureHealthPartialMin = -9007199254740991;
|
|
9045
|
+
var getEvalRunResponseDataMetricsOneFixtureHealthPartialMax = 9007199254740991;
|
|
9046
|
+
var getEvalRunResponseDataMetricsOneFixtureHealthFifoMin = -9007199254740991;
|
|
9047
|
+
var getEvalRunResponseDataMetricsOneFixtureHealthFifoMax = 9007199254740991;
|
|
9048
|
+
var getEvalRunResponseDataMetricsOneFixtureHealthDefaultMin = -9007199254740991;
|
|
9049
|
+
var getEvalRunResponseDataMetricsOneFixtureHealthDefaultMax = 9007199254740991;
|
|
9050
|
+
var getEvalRunResponseDataMetricsOneFixtureHealthUnavailableMin = -9007199254740991;
|
|
9051
|
+
var getEvalRunResponseDataMetricsOneFixtureHealthUnavailableMax = 9007199254740991;
|
|
9052
|
+
var getEvalRunResponseDataRunNumberOneMin = -9007199254740991;
|
|
9053
|
+
var getEvalRunResponseDataRunNumberOneMax = 9007199254740991;
|
|
8896
9054
|
var GetEvalRunResponse = zod.object({
|
|
8897
9055
|
"data": zod.object({
|
|
8898
9056
|
"id": zod.string().uuid(),
|
|
@@ -8905,12 +9063,341 @@ var GetEvalRunResponse = zod.object({
|
|
|
8905
9063
|
"judge_model": zod.union([zod.string(), zod.null()]),
|
|
8906
9064
|
"judge_prompt_version": zod.union([zod.string(), zod.null()]),
|
|
8907
9065
|
"tool_trace": zod.union([zod.unknown(), zod.null()]),
|
|
9066
|
+
"grading": zod.union([zod.object({
|
|
9067
|
+
"expectations": zod.array(zod.object({
|
|
9068
|
+
"text": zod.string(),
|
|
9069
|
+
"passed": zod.boolean(),
|
|
9070
|
+
"evidence": zod.string()
|
|
9071
|
+
})),
|
|
9072
|
+
"summary": zod.object({
|
|
9073
|
+
"total": zod.number().int().min(getEvalRunResponseDataGradingOneSummaryTotalMin).max(getEvalRunResponseDataGradingOneSummaryTotalMax),
|
|
9074
|
+
"passed": zod.number().int().min(getEvalRunResponseDataGradingOneSummaryPassedMin).max(getEvalRunResponseDataGradingOneSummaryPassedMax),
|
|
9075
|
+
"failed": zod.number().int().min(getEvalRunResponseDataGradingOneSummaryFailedMin).max(getEvalRunResponseDataGradingOneSummaryFailedMax),
|
|
9076
|
+
"pass_rate": zod.number()
|
|
9077
|
+
})
|
|
9078
|
+
}), zod.null()]),
|
|
9079
|
+
"metrics": zod.union([zod.object({
|
|
9080
|
+
"duration_seconds": zod.union([zod.number(), zod.null()]),
|
|
9081
|
+
"tool_calls": zod.number().int().min(getEvalRunResponseDataMetricsOneToolCallsMin).max(getEvalRunResponseDataMetricsOneToolCallsMax),
|
|
9082
|
+
"fixture_health": zod.object({
|
|
9083
|
+
"exact": zod.number().int().min(getEvalRunResponseDataMetricsOneFixtureHealthExactMin).max(getEvalRunResponseDataMetricsOneFixtureHealthExactMax),
|
|
9084
|
+
"partial": zod.number().int().min(getEvalRunResponseDataMetricsOneFixtureHealthPartialMin).max(getEvalRunResponseDataMetricsOneFixtureHealthPartialMax),
|
|
9085
|
+
"fifo": zod.number().int().min(getEvalRunResponseDataMetricsOneFixtureHealthFifoMin).max(getEvalRunResponseDataMetricsOneFixtureHealthFifoMax),
|
|
9086
|
+
"default": zod.number().int().min(getEvalRunResponseDataMetricsOneFixtureHealthDefaultMin).max(getEvalRunResponseDataMetricsOneFixtureHealthDefaultMax),
|
|
9087
|
+
"unavailable": zod.number().int().min(getEvalRunResponseDataMetricsOneFixtureHealthUnavailableMin).max(getEvalRunResponseDataMetricsOneFixtureHealthUnavailableMax),
|
|
9088
|
+
"matched_rate": zod.union([zod.number(), zod.null()])
|
|
9089
|
+
})
|
|
9090
|
+
}), zod.null()]),
|
|
9091
|
+
"benchmark_id": zod.union([zod.string().uuid(), zod.null()]),
|
|
9092
|
+
"configuration": zod.union([zod.enum(["candidate", "baseline"]), zod.null()]),
|
|
9093
|
+
"run_number": zod.union([zod.number().int().min(getEvalRunResponseDataRunNumberOneMin).max(getEvalRunResponseDataRunNumberOneMax), zod.null()]),
|
|
8908
9094
|
"created_at": zod.string().datetime({ "offset": true }),
|
|
8909
9095
|
"started_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()]),
|
|
8910
9096
|
"completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
|
|
8911
9097
|
}),
|
|
8912
9098
|
"message": zod.string()
|
|
8913
9099
|
});
|
|
9100
|
+
var CreateEvalBenchmarkParams = zod.object({
|
|
9101
|
+
"evalId": zod.string().uuid()
|
|
9102
|
+
});
|
|
9103
|
+
var createEvalBenchmarkBodyCandidateVersionMax = 9007199254740991;
|
|
9104
|
+
var createEvalBenchmarkBodyBaselineVersionMax = 9007199254740991;
|
|
9105
|
+
var createEvalBenchmarkBodyRunsPerConfigurationDefault = 3;
|
|
9106
|
+
var createEvalBenchmarkBodyRunsPerConfigurationMax = 5;
|
|
9107
|
+
var CreateEvalBenchmarkBody = zod.object({
|
|
9108
|
+
"candidate_version": zod.number().int().min(1).max(createEvalBenchmarkBodyCandidateVersionMax),
|
|
9109
|
+
"baseline_version": zod.number().int().min(1).max(createEvalBenchmarkBodyBaselineVersionMax),
|
|
9110
|
+
"runs_per_configuration": zod.number().int().min(1).max(createEvalBenchmarkBodyRunsPerConfigurationMax).default(createEvalBenchmarkBodyRunsPerConfigurationDefault)
|
|
9111
|
+
});
|
|
9112
|
+
var createEvalBenchmarkResponseDataCandidateVersionMin = -9007199254740991;
|
|
9113
|
+
var createEvalBenchmarkResponseDataCandidateVersionMax = 9007199254740991;
|
|
9114
|
+
var createEvalBenchmarkResponseDataBaselineVersionMin = -9007199254740991;
|
|
9115
|
+
var createEvalBenchmarkResponseDataBaselineVersionMax = 9007199254740991;
|
|
9116
|
+
var createEvalBenchmarkResponseDataRunsPerConfigurationMin = -9007199254740991;
|
|
9117
|
+
var createEvalBenchmarkResponseDataRunsPerConfigurationMax = 9007199254740991;
|
|
9118
|
+
var createEvalBenchmarkResponseDataRunSummaryOneCandidateRunsMin = -9007199254740991;
|
|
9119
|
+
var createEvalBenchmarkResponseDataRunSummaryOneCandidateRunsMax = 9007199254740991;
|
|
9120
|
+
var createEvalBenchmarkResponseDataRunSummaryOneCandidateGradedRunsMin = -9007199254740991;
|
|
9121
|
+
var createEvalBenchmarkResponseDataRunSummaryOneCandidateGradedRunsMax = 9007199254740991;
|
|
9122
|
+
var createEvalBenchmarkResponseDataRunSummaryOneBaselineRunsMin = -9007199254740991;
|
|
9123
|
+
var createEvalBenchmarkResponseDataRunSummaryOneBaselineRunsMax = 9007199254740991;
|
|
9124
|
+
var createEvalBenchmarkResponseDataRunSummaryOneBaselineGradedRunsMin = -9007199254740991;
|
|
9125
|
+
var createEvalBenchmarkResponseDataRunSummaryOneBaselineGradedRunsMax = 9007199254740991;
|
|
9126
|
+
var createEvalBenchmarkResponseDataRunsItemTargetVersionMin = -9007199254740991;
|
|
9127
|
+
var createEvalBenchmarkResponseDataRunsItemTargetVersionMax = 9007199254740991;
|
|
9128
|
+
var createEvalBenchmarkResponseDataRunsItemGradingOneSummaryTotalMin = -9007199254740991;
|
|
9129
|
+
var createEvalBenchmarkResponseDataRunsItemGradingOneSummaryTotalMax = 9007199254740991;
|
|
9130
|
+
var createEvalBenchmarkResponseDataRunsItemGradingOneSummaryPassedMin = -9007199254740991;
|
|
9131
|
+
var createEvalBenchmarkResponseDataRunsItemGradingOneSummaryPassedMax = 9007199254740991;
|
|
9132
|
+
var createEvalBenchmarkResponseDataRunsItemGradingOneSummaryFailedMin = -9007199254740991;
|
|
9133
|
+
var createEvalBenchmarkResponseDataRunsItemGradingOneSummaryFailedMax = 9007199254740991;
|
|
9134
|
+
var createEvalBenchmarkResponseDataRunsItemMetricsOneToolCallsMin = -9007199254740991;
|
|
9135
|
+
var createEvalBenchmarkResponseDataRunsItemMetricsOneToolCallsMax = 9007199254740991;
|
|
9136
|
+
var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthExactMin = -9007199254740991;
|
|
9137
|
+
var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthExactMax = 9007199254740991;
|
|
9138
|
+
var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthPartialMin = -9007199254740991;
|
|
9139
|
+
var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthPartialMax = 9007199254740991;
|
|
9140
|
+
var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthFifoMin = -9007199254740991;
|
|
9141
|
+
var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthFifoMax = 9007199254740991;
|
|
9142
|
+
var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthDefaultMin = -9007199254740991;
|
|
9143
|
+
var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthDefaultMax = 9007199254740991;
|
|
9144
|
+
var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthUnavailableMin = -9007199254740991;
|
|
9145
|
+
var createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthUnavailableMax = 9007199254740991;
|
|
9146
|
+
var createEvalBenchmarkResponseDataRunsItemRunNumberOneMin = -9007199254740991;
|
|
9147
|
+
var createEvalBenchmarkResponseDataRunsItemRunNumberOneMax = 9007199254740991;
|
|
9148
|
+
var CreateEvalBenchmarkResponse = zod.object({
|
|
9149
|
+
"data": zod.object({
|
|
9150
|
+
"id": zod.string().uuid(),
|
|
9151
|
+
"eval_id": zod.string().uuid(),
|
|
9152
|
+
"candidate_version": zod.number().int().min(createEvalBenchmarkResponseDataCandidateVersionMin).max(createEvalBenchmarkResponseDataCandidateVersionMax),
|
|
9153
|
+
"baseline_version": zod.number().int().min(createEvalBenchmarkResponseDataBaselineVersionMin).max(createEvalBenchmarkResponseDataBaselineVersionMax),
|
|
9154
|
+
"runs_per_configuration": zod.number().int().min(createEvalBenchmarkResponseDataRunsPerConfigurationMin).max(createEvalBenchmarkResponseDataRunsPerConfigurationMax),
|
|
9155
|
+
"status": zod.enum(["running", "completed", "error"]),
|
|
9156
|
+
"run_summary": zod.union([zod.object({
|
|
9157
|
+
"candidate": zod.object({
|
|
9158
|
+
"runs": zod.number().int().min(createEvalBenchmarkResponseDataRunSummaryOneCandidateRunsMin).max(createEvalBenchmarkResponseDataRunSummaryOneCandidateRunsMax),
|
|
9159
|
+
"graded_runs": zod.number().int().min(createEvalBenchmarkResponseDataRunSummaryOneCandidateGradedRunsMin).max(createEvalBenchmarkResponseDataRunSummaryOneCandidateGradedRunsMax),
|
|
9160
|
+
"pass_rate": zod.union([zod.object({
|
|
9161
|
+
"mean": zod.number(),
|
|
9162
|
+
"stddev": zod.number(),
|
|
9163
|
+
"min": zod.number(),
|
|
9164
|
+
"max": zod.number()
|
|
9165
|
+
}), zod.null()]),
|
|
9166
|
+
"duration_seconds": zod.union([zod.object({
|
|
9167
|
+
"mean": zod.number(),
|
|
9168
|
+
"stddev": zod.number(),
|
|
9169
|
+
"min": zod.number(),
|
|
9170
|
+
"max": zod.number()
|
|
9171
|
+
}), zod.null()]),
|
|
9172
|
+
"fixture_matched_rate": zod.union([zod.object({
|
|
9173
|
+
"mean": zod.number(),
|
|
9174
|
+
"stddev": zod.number(),
|
|
9175
|
+
"min": zod.number(),
|
|
9176
|
+
"max": zod.number()
|
|
9177
|
+
}), zod.null()])
|
|
9178
|
+
}),
|
|
9179
|
+
"baseline": zod.object({
|
|
9180
|
+
"runs": zod.number().int().min(createEvalBenchmarkResponseDataRunSummaryOneBaselineRunsMin).max(createEvalBenchmarkResponseDataRunSummaryOneBaselineRunsMax),
|
|
9181
|
+
"graded_runs": zod.number().int().min(createEvalBenchmarkResponseDataRunSummaryOneBaselineGradedRunsMin).max(createEvalBenchmarkResponseDataRunSummaryOneBaselineGradedRunsMax),
|
|
9182
|
+
"pass_rate": zod.union([zod.object({
|
|
9183
|
+
"mean": zod.number(),
|
|
9184
|
+
"stddev": zod.number(),
|
|
9185
|
+
"min": zod.number(),
|
|
9186
|
+
"max": zod.number()
|
|
9187
|
+
}), zod.null()]),
|
|
9188
|
+
"duration_seconds": zod.union([zod.object({
|
|
9189
|
+
"mean": zod.number(),
|
|
9190
|
+
"stddev": zod.number(),
|
|
9191
|
+
"min": zod.number(),
|
|
9192
|
+
"max": zod.number()
|
|
9193
|
+
}), zod.null()]),
|
|
9194
|
+
"fixture_matched_rate": zod.union([zod.object({
|
|
9195
|
+
"mean": zod.number(),
|
|
9196
|
+
"stddev": zod.number(),
|
|
9197
|
+
"min": zod.number(),
|
|
9198
|
+
"max": zod.number()
|
|
9199
|
+
}), zod.null()])
|
|
9200
|
+
}),
|
|
9201
|
+
"delta": zod.object({
|
|
9202
|
+
"pass_rate": zod.union([zod.number(), zod.null()]),
|
|
9203
|
+
"duration_seconds": zod.union([zod.number(), zod.null()]),
|
|
9204
|
+
"fixture_matched_rate": zod.union([zod.number(), zod.null()])
|
|
9205
|
+
})
|
|
9206
|
+
}), zod.null()]),
|
|
9207
|
+
"notes": zod.union([zod.array(zod.string()), zod.null()]),
|
|
9208
|
+
"runs": zod.array(zod.object({
|
|
9209
|
+
"id": zod.string().uuid(),
|
|
9210
|
+
"eval_id": zod.string().uuid(),
|
|
9211
|
+
"target_version": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemTargetVersionMin).max(createEvalBenchmarkResponseDataRunsItemTargetVersionMax),
|
|
9212
|
+
"status": zod.enum(["queued", "running", "passed", "failed", "error"]),
|
|
9213
|
+
"passed": zod.union([zod.boolean(), zod.null()]),
|
|
9214
|
+
"reason": zod.union([zod.string(), zod.null()]),
|
|
9215
|
+
"error": zod.union([zod.string(), zod.null()]),
|
|
9216
|
+
"judge_model": zod.union([zod.string(), zod.null()]),
|
|
9217
|
+
"judge_prompt_version": zod.union([zod.string(), zod.null()]),
|
|
9218
|
+
"grading": zod.union([zod.object({
|
|
9219
|
+
"expectations": zod.array(zod.object({
|
|
9220
|
+
"text": zod.string(),
|
|
9221
|
+
"passed": zod.boolean(),
|
|
9222
|
+
"evidence": zod.string()
|
|
9223
|
+
})),
|
|
9224
|
+
"summary": zod.object({
|
|
9225
|
+
"total": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemGradingOneSummaryTotalMin).max(createEvalBenchmarkResponseDataRunsItemGradingOneSummaryTotalMax),
|
|
9226
|
+
"passed": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemGradingOneSummaryPassedMin).max(createEvalBenchmarkResponseDataRunsItemGradingOneSummaryPassedMax),
|
|
9227
|
+
"failed": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemGradingOneSummaryFailedMin).max(createEvalBenchmarkResponseDataRunsItemGradingOneSummaryFailedMax),
|
|
9228
|
+
"pass_rate": zod.number()
|
|
9229
|
+
})
|
|
9230
|
+
}), zod.null()]),
|
|
9231
|
+
"metrics": zod.union([zod.object({
|
|
9232
|
+
"duration_seconds": zod.union([zod.number(), zod.null()]),
|
|
9233
|
+
"tool_calls": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemMetricsOneToolCallsMin).max(createEvalBenchmarkResponseDataRunsItemMetricsOneToolCallsMax),
|
|
9234
|
+
"fixture_health": zod.object({
|
|
9235
|
+
"exact": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthExactMin).max(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthExactMax),
|
|
9236
|
+
"partial": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthPartialMin).max(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthPartialMax),
|
|
9237
|
+
"fifo": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthFifoMin).max(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthFifoMax),
|
|
9238
|
+
"default": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthDefaultMin).max(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthDefaultMax),
|
|
9239
|
+
"unavailable": zod.number().int().min(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthUnavailableMin).max(createEvalBenchmarkResponseDataRunsItemMetricsOneFixtureHealthUnavailableMax),
|
|
9240
|
+
"matched_rate": zod.union([zod.number(), zod.null()])
|
|
9241
|
+
})
|
|
9242
|
+
}), zod.null()]),
|
|
9243
|
+
"benchmark_id": zod.union([zod.string().uuid(), zod.null()]),
|
|
9244
|
+
"configuration": zod.union([zod.enum(["candidate", "baseline"]), zod.null()]),
|
|
9245
|
+
"run_number": zod.union([zod.number().int().min(createEvalBenchmarkResponseDataRunsItemRunNumberOneMin).max(createEvalBenchmarkResponseDataRunsItemRunNumberOneMax), zod.null()]),
|
|
9246
|
+
"created_at": zod.string().datetime({ "offset": true }),
|
|
9247
|
+
"started_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()]),
|
|
9248
|
+
"completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
|
|
9249
|
+
})),
|
|
9250
|
+
"created_at": zod.string().datetime({ "offset": true }),
|
|
9251
|
+
"completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
|
|
9252
|
+
}),
|
|
9253
|
+
"message": zod.string()
|
|
9254
|
+
});
|
|
9255
|
+
var GetBenchmarkParams = zod.object({
|
|
9256
|
+
"benchmarkId": zod.string().uuid()
|
|
9257
|
+
});
|
|
9258
|
+
var getBenchmarkResponseDataCandidateVersionMin = -9007199254740991;
|
|
9259
|
+
var getBenchmarkResponseDataCandidateVersionMax = 9007199254740991;
|
|
9260
|
+
var getBenchmarkResponseDataBaselineVersionMin = -9007199254740991;
|
|
9261
|
+
var getBenchmarkResponseDataBaselineVersionMax = 9007199254740991;
|
|
9262
|
+
var getBenchmarkResponseDataRunsPerConfigurationMin = -9007199254740991;
|
|
9263
|
+
var getBenchmarkResponseDataRunsPerConfigurationMax = 9007199254740991;
|
|
9264
|
+
var getBenchmarkResponseDataRunSummaryOneCandidateRunsMin = -9007199254740991;
|
|
9265
|
+
var getBenchmarkResponseDataRunSummaryOneCandidateRunsMax = 9007199254740991;
|
|
9266
|
+
var getBenchmarkResponseDataRunSummaryOneCandidateGradedRunsMin = -9007199254740991;
|
|
9267
|
+
var getBenchmarkResponseDataRunSummaryOneCandidateGradedRunsMax = 9007199254740991;
|
|
9268
|
+
var getBenchmarkResponseDataRunSummaryOneBaselineRunsMin = -9007199254740991;
|
|
9269
|
+
var getBenchmarkResponseDataRunSummaryOneBaselineRunsMax = 9007199254740991;
|
|
9270
|
+
var getBenchmarkResponseDataRunSummaryOneBaselineGradedRunsMin = -9007199254740991;
|
|
9271
|
+
var getBenchmarkResponseDataRunSummaryOneBaselineGradedRunsMax = 9007199254740991;
|
|
9272
|
+
var getBenchmarkResponseDataRunsItemTargetVersionMin = -9007199254740991;
|
|
9273
|
+
var getBenchmarkResponseDataRunsItemTargetVersionMax = 9007199254740991;
|
|
9274
|
+
var getBenchmarkResponseDataRunsItemGradingOneSummaryTotalMin = -9007199254740991;
|
|
9275
|
+
var getBenchmarkResponseDataRunsItemGradingOneSummaryTotalMax = 9007199254740991;
|
|
9276
|
+
var getBenchmarkResponseDataRunsItemGradingOneSummaryPassedMin = -9007199254740991;
|
|
9277
|
+
var getBenchmarkResponseDataRunsItemGradingOneSummaryPassedMax = 9007199254740991;
|
|
9278
|
+
var getBenchmarkResponseDataRunsItemGradingOneSummaryFailedMin = -9007199254740991;
|
|
9279
|
+
var getBenchmarkResponseDataRunsItemGradingOneSummaryFailedMax = 9007199254740991;
|
|
9280
|
+
var getBenchmarkResponseDataRunsItemMetricsOneToolCallsMin = -9007199254740991;
|
|
9281
|
+
var getBenchmarkResponseDataRunsItemMetricsOneToolCallsMax = 9007199254740991;
|
|
9282
|
+
var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthExactMin = -9007199254740991;
|
|
9283
|
+
var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthExactMax = 9007199254740991;
|
|
9284
|
+
var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthPartialMin = -9007199254740991;
|
|
9285
|
+
var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthPartialMax = 9007199254740991;
|
|
9286
|
+
var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthFifoMin = -9007199254740991;
|
|
9287
|
+
var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthFifoMax = 9007199254740991;
|
|
9288
|
+
var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthDefaultMin = -9007199254740991;
|
|
9289
|
+
var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthDefaultMax = 9007199254740991;
|
|
9290
|
+
var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthUnavailableMin = -9007199254740991;
|
|
9291
|
+
var getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthUnavailableMax = 9007199254740991;
|
|
9292
|
+
var getBenchmarkResponseDataRunsItemRunNumberOneMin = -9007199254740991;
|
|
9293
|
+
var getBenchmarkResponseDataRunsItemRunNumberOneMax = 9007199254740991;
|
|
9294
|
+
var GetBenchmarkResponse = zod.object({
|
|
9295
|
+
"data": zod.object({
|
|
9296
|
+
"id": zod.string().uuid(),
|
|
9297
|
+
"eval_id": zod.string().uuid(),
|
|
9298
|
+
"candidate_version": zod.number().int().min(getBenchmarkResponseDataCandidateVersionMin).max(getBenchmarkResponseDataCandidateVersionMax),
|
|
9299
|
+
"baseline_version": zod.number().int().min(getBenchmarkResponseDataBaselineVersionMin).max(getBenchmarkResponseDataBaselineVersionMax),
|
|
9300
|
+
"runs_per_configuration": zod.number().int().min(getBenchmarkResponseDataRunsPerConfigurationMin).max(getBenchmarkResponseDataRunsPerConfigurationMax),
|
|
9301
|
+
"status": zod.enum(["running", "completed", "error"]),
|
|
9302
|
+
"run_summary": zod.union([zod.object({
|
|
9303
|
+
"candidate": zod.object({
|
|
9304
|
+
"runs": zod.number().int().min(getBenchmarkResponseDataRunSummaryOneCandidateRunsMin).max(getBenchmarkResponseDataRunSummaryOneCandidateRunsMax),
|
|
9305
|
+
"graded_runs": zod.number().int().min(getBenchmarkResponseDataRunSummaryOneCandidateGradedRunsMin).max(getBenchmarkResponseDataRunSummaryOneCandidateGradedRunsMax),
|
|
9306
|
+
"pass_rate": zod.union([zod.object({
|
|
9307
|
+
"mean": zod.number(),
|
|
9308
|
+
"stddev": zod.number(),
|
|
9309
|
+
"min": zod.number(),
|
|
9310
|
+
"max": zod.number()
|
|
9311
|
+
}), zod.null()]),
|
|
9312
|
+
"duration_seconds": zod.union([zod.object({
|
|
9313
|
+
"mean": zod.number(),
|
|
9314
|
+
"stddev": zod.number(),
|
|
9315
|
+
"min": zod.number(),
|
|
9316
|
+
"max": zod.number()
|
|
9317
|
+
}), zod.null()]),
|
|
9318
|
+
"fixture_matched_rate": zod.union([zod.object({
|
|
9319
|
+
"mean": zod.number(),
|
|
9320
|
+
"stddev": zod.number(),
|
|
9321
|
+
"min": zod.number(),
|
|
9322
|
+
"max": zod.number()
|
|
9323
|
+
}), zod.null()])
|
|
9324
|
+
}),
|
|
9325
|
+
"baseline": zod.object({
|
|
9326
|
+
"runs": zod.number().int().min(getBenchmarkResponseDataRunSummaryOneBaselineRunsMin).max(getBenchmarkResponseDataRunSummaryOneBaselineRunsMax),
|
|
9327
|
+
"graded_runs": zod.number().int().min(getBenchmarkResponseDataRunSummaryOneBaselineGradedRunsMin).max(getBenchmarkResponseDataRunSummaryOneBaselineGradedRunsMax),
|
|
9328
|
+
"pass_rate": zod.union([zod.object({
|
|
9329
|
+
"mean": zod.number(),
|
|
9330
|
+
"stddev": zod.number(),
|
|
9331
|
+
"min": zod.number(),
|
|
9332
|
+
"max": zod.number()
|
|
9333
|
+
}), zod.null()]),
|
|
9334
|
+
"duration_seconds": zod.union([zod.object({
|
|
9335
|
+
"mean": zod.number(),
|
|
9336
|
+
"stddev": zod.number(),
|
|
9337
|
+
"min": zod.number(),
|
|
9338
|
+
"max": zod.number()
|
|
9339
|
+
}), zod.null()]),
|
|
9340
|
+
"fixture_matched_rate": zod.union([zod.object({
|
|
9341
|
+
"mean": zod.number(),
|
|
9342
|
+
"stddev": zod.number(),
|
|
9343
|
+
"min": zod.number(),
|
|
9344
|
+
"max": zod.number()
|
|
9345
|
+
}), zod.null()])
|
|
9346
|
+
}),
|
|
9347
|
+
"delta": zod.object({
|
|
9348
|
+
"pass_rate": zod.union([zod.number(), zod.null()]),
|
|
9349
|
+
"duration_seconds": zod.union([zod.number(), zod.null()]),
|
|
9350
|
+
"fixture_matched_rate": zod.union([zod.number(), zod.null()])
|
|
9351
|
+
})
|
|
9352
|
+
}), zod.null()]),
|
|
9353
|
+
"notes": zod.union([zod.array(zod.string()), zod.null()]),
|
|
9354
|
+
"runs": zod.array(zod.object({
|
|
9355
|
+
"id": zod.string().uuid(),
|
|
9356
|
+
"eval_id": zod.string().uuid(),
|
|
9357
|
+
"target_version": zod.number().int().min(getBenchmarkResponseDataRunsItemTargetVersionMin).max(getBenchmarkResponseDataRunsItemTargetVersionMax),
|
|
9358
|
+
"status": zod.enum(["queued", "running", "passed", "failed", "error"]),
|
|
9359
|
+
"passed": zod.union([zod.boolean(), zod.null()]),
|
|
9360
|
+
"reason": zod.union([zod.string(), zod.null()]),
|
|
9361
|
+
"error": zod.union([zod.string(), zod.null()]),
|
|
9362
|
+
"judge_model": zod.union([zod.string(), zod.null()]),
|
|
9363
|
+
"judge_prompt_version": zod.union([zod.string(), zod.null()]),
|
|
9364
|
+
"grading": zod.union([zod.object({
|
|
9365
|
+
"expectations": zod.array(zod.object({
|
|
9366
|
+
"text": zod.string(),
|
|
9367
|
+
"passed": zod.boolean(),
|
|
9368
|
+
"evidence": zod.string()
|
|
9369
|
+
})),
|
|
9370
|
+
"summary": zod.object({
|
|
9371
|
+
"total": zod.number().int().min(getBenchmarkResponseDataRunsItemGradingOneSummaryTotalMin).max(getBenchmarkResponseDataRunsItemGradingOneSummaryTotalMax),
|
|
9372
|
+
"passed": zod.number().int().min(getBenchmarkResponseDataRunsItemGradingOneSummaryPassedMin).max(getBenchmarkResponseDataRunsItemGradingOneSummaryPassedMax),
|
|
9373
|
+
"failed": zod.number().int().min(getBenchmarkResponseDataRunsItemGradingOneSummaryFailedMin).max(getBenchmarkResponseDataRunsItemGradingOneSummaryFailedMax),
|
|
9374
|
+
"pass_rate": zod.number()
|
|
9375
|
+
})
|
|
9376
|
+
}), zod.null()]),
|
|
9377
|
+
"metrics": zod.union([zod.object({
|
|
9378
|
+
"duration_seconds": zod.union([zod.number(), zod.null()]),
|
|
9379
|
+
"tool_calls": zod.number().int().min(getBenchmarkResponseDataRunsItemMetricsOneToolCallsMin).max(getBenchmarkResponseDataRunsItemMetricsOneToolCallsMax),
|
|
9380
|
+
"fixture_health": zod.object({
|
|
9381
|
+
"exact": zod.number().int().min(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthExactMin).max(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthExactMax),
|
|
9382
|
+
"partial": zod.number().int().min(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthPartialMin).max(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthPartialMax),
|
|
9383
|
+
"fifo": zod.number().int().min(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthFifoMin).max(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthFifoMax),
|
|
9384
|
+
"default": zod.number().int().min(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthDefaultMin).max(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthDefaultMax),
|
|
9385
|
+
"unavailable": zod.number().int().min(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthUnavailableMin).max(getBenchmarkResponseDataRunsItemMetricsOneFixtureHealthUnavailableMax),
|
|
9386
|
+
"matched_rate": zod.union([zod.number(), zod.null()])
|
|
9387
|
+
})
|
|
9388
|
+
}), zod.null()]),
|
|
9389
|
+
"benchmark_id": zod.union([zod.string().uuid(), zod.null()]),
|
|
9390
|
+
"configuration": zod.union([zod.enum(["candidate", "baseline"]), zod.null()]),
|
|
9391
|
+
"run_number": zod.union([zod.number().int().min(getBenchmarkResponseDataRunsItemRunNumberOneMin).max(getBenchmarkResponseDataRunsItemRunNumberOneMax), zod.null()]),
|
|
9392
|
+
"created_at": zod.string().datetime({ "offset": true }),
|
|
9393
|
+
"started_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()]),
|
|
9394
|
+
"completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
|
|
9395
|
+
})),
|
|
9396
|
+
"created_at": zod.string().datetime({ "offset": true }),
|
|
9397
|
+
"completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
|
|
9398
|
+
}),
|
|
9399
|
+
"message": zod.string()
|
|
9400
|
+
});
|
|
8914
9401
|
var CreateExtractorBody = zod.object({
|
|
8915
9402
|
"name": zod.string().min(1),
|
|
8916
9403
|
"schema": zod.record(zod.string(), zod.unknown())
|
|
@@ -12304,7 +12791,7 @@ var createMcpServer = (options) => {
|
|
|
12304
12791
|
"createWorkerEvalFromRun",
|
|
12305
12792
|
{
|
|
12306
12793
|
title: "Create a worker eval from a run",
|
|
12307
|
-
description: "Snapshot a worker run's trigger and resolved artifacts, and record its MCP tool responses from telemetry for replay.",
|
|
12794
|
+
description: "Snapshot a worker run's trigger and resolved artifacts, and record its MCP tool responses from telemetry for replay. Each assertion is graded PASS/FAIL independently on every run.",
|
|
12308
12795
|
inputSchema: {
|
|
12309
12796
|
pathParams: CreateWorkerEvalFromRunParams,
|
|
12310
12797
|
bodyParams: CreateWorkerEvalFromRunBody.optional()
|
|
@@ -12350,6 +12837,39 @@ var createMcpServer = (options) => {
|
|
|
12350
12837
|
signal: options?.signal ? AbortSignal.any([options.signal, ctx.signal]) : ctx.signal
|
|
12351
12838
|
})
|
|
12352
12839
|
);
|
|
12840
|
+
tools.createEvalBenchmark = server2.registerTool(
|
|
12841
|
+
"createEvalBenchmark",
|
|
12842
|
+
{
|
|
12843
|
+
title: "Benchmark two worker versions on an eval",
|
|
12844
|
+
description: "Queue runs_per_configuration trials of the eval against a candidate and a baseline worker version. When all trials finish, the benchmark reports mean \xB1 stddev pass rate per configuration, the candidate-minus-baseline delta, and analyzer notes.",
|
|
12845
|
+
inputSchema: {
|
|
12846
|
+
pathParams: CreateEvalBenchmarkParams,
|
|
12847
|
+
bodyParams: CreateEvalBenchmarkBody.optional()
|
|
12848
|
+
},
|
|
12849
|
+
outputSchema: CreateEvalBenchmarkResponse,
|
|
12850
|
+
annotations: { destructiveHint: true }
|
|
12851
|
+
},
|
|
12852
|
+
(args, ctx) => createEvalBenchmarkHandler(args, {
|
|
12853
|
+
...options,
|
|
12854
|
+
signal: options?.signal ? AbortSignal.any([options.signal, ctx.signal]) : ctx.signal
|
|
12855
|
+
})
|
|
12856
|
+
);
|
|
12857
|
+
tools.getBenchmark = server2.registerTool(
|
|
12858
|
+
"getBenchmark",
|
|
12859
|
+
{
|
|
12860
|
+
title: "Get a benchmark",
|
|
12861
|
+
description: "Get a benchmark with its per-run gradings and metrics, and once all runs finished, the per-configuration summary, delta, and analyzer notes.",
|
|
12862
|
+
inputSchema: {
|
|
12863
|
+
pathParams: GetBenchmarkParams
|
|
12864
|
+
},
|
|
12865
|
+
outputSchema: GetBenchmarkResponse,
|
|
12866
|
+
annotations: { readOnlyHint: true }
|
|
12867
|
+
},
|
|
12868
|
+
(args, ctx) => getBenchmarkHandler(args, {
|
|
12869
|
+
...options,
|
|
12870
|
+
signal: options?.signal ? AbortSignal.any([options.signal, ctx.signal]) : ctx.signal
|
|
12871
|
+
})
|
|
12872
|
+
);
|
|
12353
12873
|
tools.createExtractor = server2.registerTool(
|
|
12354
12874
|
"createExtractor",
|
|
12355
12875
|
{
|
|
@@ -13934,4 +14454,4 @@ var transport = new StdioServerTransport();
|
|
|
13934
14454
|
server.connect(transport).then(() => {
|
|
13935
14455
|
console.error("MCP server running on stdio");
|
|
13936
14456
|
}).catch(console.error);
|
|
13937
|
-
//# sourceMappingURL=server-
|
|
14457
|
+
//# sourceMappingURL=server-XM676NBD.js.map
|