@avallon-labs/mcp 51.3.0-staging.1139 → 51.4.0
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
package/dist/index.js
CHANGED
|
@@ -1476,6 +1476,28 @@ var createEvalBenchmark = async (evalId, createEvalBenchmarkBody, options) => {
|
|
|
1476
1476
|
const data = body ? JSON.parse(body) : {};
|
|
1477
1477
|
return { data, status: res.status, headers: res.headers };
|
|
1478
1478
|
};
|
|
1479
|
+
var getListEvalBenchmarksUrl = (evalId, params) => {
|
|
1480
|
+
const normalizedParams = new URLSearchParams();
|
|
1481
|
+
Object.entries(params || {}).forEach(([key, value]) => {
|
|
1482
|
+
if (value !== void 0) {
|
|
1483
|
+
normalizedParams.append(key, value === null ? "null" : String(value));
|
|
1484
|
+
}
|
|
1485
|
+
});
|
|
1486
|
+
const stringifiedParams = normalizedParams.toString();
|
|
1487
|
+
return stringifiedParams.length > 0 ? `/v1/evals/${evalId}/benchmarks?${stringifiedParams}` : `/v1/evals/${evalId}/benchmarks`;
|
|
1488
|
+
};
|
|
1489
|
+
var listEvalBenchmarks = async (evalId, params, options) => {
|
|
1490
|
+
const res = await fetch(
|
|
1491
|
+
getListEvalBenchmarksUrl(evalId, params),
|
|
1492
|
+
{
|
|
1493
|
+
...options,
|
|
1494
|
+
method: "GET"
|
|
1495
|
+
}
|
|
1496
|
+
);
|
|
1497
|
+
const body = [204, 205, 304].includes(res.status) ? null : await res.text();
|
|
1498
|
+
const data = body ? JSON.parse(body) : {};
|
|
1499
|
+
return { data, status: res.status, headers: res.headers };
|
|
1500
|
+
};
|
|
1479
1501
|
var getGetBenchmarkUrl = (benchmarkId) => {
|
|
1480
1502
|
return `/v1/benchmarks/${benchmarkId}`;
|
|
1481
1503
|
};
|
|
@@ -1491,6 +1513,51 @@ var getBenchmark = async (benchmarkId, options) => {
|
|
|
1491
1513
|
const data = body ? JSON.parse(body) : {};
|
|
1492
1514
|
return { data, status: res.status, headers: res.headers };
|
|
1493
1515
|
};
|
|
1516
|
+
var getListWorkerEvalsUrl = (workerId, params) => {
|
|
1517
|
+
const normalizedParams = new URLSearchParams();
|
|
1518
|
+
Object.entries(params || {}).forEach(([key, value]) => {
|
|
1519
|
+
if (value !== void 0) {
|
|
1520
|
+
normalizedParams.append(key, value === null ? "null" : String(value));
|
|
1521
|
+
}
|
|
1522
|
+
});
|
|
1523
|
+
const stringifiedParams = normalizedParams.toString();
|
|
1524
|
+
return stringifiedParams.length > 0 ? `/v1/workers/${workerId}/evals?${stringifiedParams}` : `/v1/workers/${workerId}/evals`;
|
|
1525
|
+
};
|
|
1526
|
+
var listWorkerEvals = async (workerId, params, options) => {
|
|
1527
|
+
const res = await fetch(
|
|
1528
|
+
getListWorkerEvalsUrl(workerId, params),
|
|
1529
|
+
{
|
|
1530
|
+
...options,
|
|
1531
|
+
method: "GET"
|
|
1532
|
+
}
|
|
1533
|
+
);
|
|
1534
|
+
const body = [204, 205, 304].includes(res.status) ? null : await res.text();
|
|
1535
|
+
const data = body ? JSON.parse(body) : {};
|
|
1536
|
+
return { data, status: res.status, headers: res.headers };
|
|
1537
|
+
};
|
|
1538
|
+
var getCreateWorkerBenchmarksUrl = (workerId) => {
|
|
1539
|
+
return `/v1/workers/${workerId}/benchmarks`;
|
|
1540
|
+
};
|
|
1541
|
+
var createWorkerBenchmarks = async (workerId, createWorkerBenchmarksBody, options) => {
|
|
1542
|
+
const getHeaders = (h) => {
|
|
1543
|
+
if (!h) return {};
|
|
1544
|
+
if (h instanceof Headers) return Object.fromEntries(h.entries());
|
|
1545
|
+
if (Array.isArray(h)) return Object.fromEntries(h);
|
|
1546
|
+
return h;
|
|
1547
|
+
};
|
|
1548
|
+
const res = await fetch(
|
|
1549
|
+
getCreateWorkerBenchmarksUrl(workerId),
|
|
1550
|
+
{
|
|
1551
|
+
...options,
|
|
1552
|
+
method: "POST",
|
|
1553
|
+
headers: { "Content-Type": "application/json", ...getHeaders(options?.headers) },
|
|
1554
|
+
body: JSON.stringify(createWorkerBenchmarksBody)
|
|
1555
|
+
}
|
|
1556
|
+
);
|
|
1557
|
+
const body = [204, 205, 304].includes(res.status) ? null : await res.text();
|
|
1558
|
+
const data = body ? JSON.parse(body) : {};
|
|
1559
|
+
return { data, status: res.status, headers: res.headers };
|
|
1560
|
+
};
|
|
1494
1561
|
var getCreateExtractorUrl = () => {
|
|
1495
1562
|
return `/v1/extractors`;
|
|
1496
1563
|
};
|
|
@@ -5074,6 +5141,29 @@ var createEvalBenchmarkHandler = async (args, options) => {
|
|
|
5074
5141
|
structuredContent: res.data
|
|
5075
5142
|
};
|
|
5076
5143
|
};
|
|
5144
|
+
var listEvalBenchmarksHandler = async (args, options) => {
|
|
5145
|
+
const res = await listEvalBenchmarks(args.pathParams.evalId, args.queryParams, options);
|
|
5146
|
+
if (res.status >= 400) {
|
|
5147
|
+
return {
|
|
5148
|
+
content: [
|
|
5149
|
+
{
|
|
5150
|
+
type: "text",
|
|
5151
|
+
text: JSON.stringify(res.data ?? null)
|
|
5152
|
+
}
|
|
5153
|
+
],
|
|
5154
|
+
isError: true
|
|
5155
|
+
};
|
|
5156
|
+
}
|
|
5157
|
+
return {
|
|
5158
|
+
content: [
|
|
5159
|
+
{
|
|
5160
|
+
type: "text",
|
|
5161
|
+
text: JSON.stringify(res.data ?? null)
|
|
5162
|
+
}
|
|
5163
|
+
],
|
|
5164
|
+
structuredContent: res.data
|
|
5165
|
+
};
|
|
5166
|
+
};
|
|
5077
5167
|
var getBenchmarkHandler = async (args, options) => {
|
|
5078
5168
|
const res = await getBenchmark(args.pathParams.benchmarkId, options);
|
|
5079
5169
|
if (res.status >= 400) {
|
|
@@ -5097,6 +5187,52 @@ var getBenchmarkHandler = async (args, options) => {
|
|
|
5097
5187
|
structuredContent: res.data
|
|
5098
5188
|
};
|
|
5099
5189
|
};
|
|
5190
|
+
var listWorkerEvalsHandler = async (args, options) => {
|
|
5191
|
+
const res = await listWorkerEvals(args.pathParams.workerId, args.queryParams, options);
|
|
5192
|
+
if (res.status >= 400) {
|
|
5193
|
+
return {
|
|
5194
|
+
content: [
|
|
5195
|
+
{
|
|
5196
|
+
type: "text",
|
|
5197
|
+
text: JSON.stringify(res.data ?? null)
|
|
5198
|
+
}
|
|
5199
|
+
],
|
|
5200
|
+
isError: true
|
|
5201
|
+
};
|
|
5202
|
+
}
|
|
5203
|
+
return {
|
|
5204
|
+
content: [
|
|
5205
|
+
{
|
|
5206
|
+
type: "text",
|
|
5207
|
+
text: JSON.stringify(res.data ?? null)
|
|
5208
|
+
}
|
|
5209
|
+
],
|
|
5210
|
+
structuredContent: res.data
|
|
5211
|
+
};
|
|
5212
|
+
};
|
|
5213
|
+
var createWorkerBenchmarksHandler = async (args, options) => {
|
|
5214
|
+
const res = await createWorkerBenchmarks(args.pathParams.workerId, args.bodyParams, options);
|
|
5215
|
+
if (res.status >= 400) {
|
|
5216
|
+
return {
|
|
5217
|
+
content: [
|
|
5218
|
+
{
|
|
5219
|
+
type: "text",
|
|
5220
|
+
text: JSON.stringify(res.data ?? null)
|
|
5221
|
+
}
|
|
5222
|
+
],
|
|
5223
|
+
isError: true
|
|
5224
|
+
};
|
|
5225
|
+
}
|
|
5226
|
+
return {
|
|
5227
|
+
content: [
|
|
5228
|
+
{
|
|
5229
|
+
type: "text",
|
|
5230
|
+
text: JSON.stringify(res.data ?? null)
|
|
5231
|
+
}
|
|
5232
|
+
],
|
|
5233
|
+
structuredContent: res.data
|
|
5234
|
+
};
|
|
5235
|
+
};
|
|
5100
5236
|
var createExtractorHandler = async (args, options) => {
|
|
5101
5237
|
const res = await createExtractor(args.bodyParams, options);
|
|
5102
5238
|
if (res.status >= 400) {
|
|
@@ -9289,6 +9425,8 @@ var CreateEvalBenchmarkResponse = zod.object({
|
|
|
9289
9425
|
})
|
|
9290
9426
|
}), zod.null()]),
|
|
9291
9427
|
"notes": zod.union([zod.array(zod.string()), zod.null()]),
|
|
9428
|
+
"created_at": zod.string().datetime({ "offset": true }),
|
|
9429
|
+
"completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()]),
|
|
9292
9430
|
"runs": zod.array(zod.object({
|
|
9293
9431
|
"id": zod.string().uuid(),
|
|
9294
9432
|
"eval_id": zod.string().uuid(),
|
|
@@ -9330,12 +9468,109 @@ var CreateEvalBenchmarkResponse = zod.object({
|
|
|
9330
9468
|
"created_at": zod.string().datetime({ "offset": true }),
|
|
9331
9469
|
"started_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()]),
|
|
9332
9470
|
"completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
|
|
9333
|
-
}))
|
|
9334
|
-
"created_at": zod.string().datetime({ "offset": true }),
|
|
9335
|
-
"completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
|
|
9471
|
+
}))
|
|
9336
9472
|
}),
|
|
9337
9473
|
"message": zod.string()
|
|
9338
9474
|
});
|
|
9475
|
+
var ListEvalBenchmarksParams = zod.object({
|
|
9476
|
+
"evalId": zod.string().uuid()
|
|
9477
|
+
});
|
|
9478
|
+
var listEvalBenchmarksQueryCountDefault = 50;
|
|
9479
|
+
var listEvalBenchmarksQueryCountMax = 100;
|
|
9480
|
+
var listEvalBenchmarksQueryOffsetDefault = 0;
|
|
9481
|
+
var listEvalBenchmarksQueryOffsetMin = 0;
|
|
9482
|
+
var listEvalBenchmarksQuerySortByDefault = `created_at`;
|
|
9483
|
+
var listEvalBenchmarksQuerySortOrderDefault = `desc`;
|
|
9484
|
+
var ListEvalBenchmarksQueryParams = zod.object({
|
|
9485
|
+
"count": zod.number().min(1).max(listEvalBenchmarksQueryCountMax).default(listEvalBenchmarksQueryCountDefault),
|
|
9486
|
+
"offset": zod.number().min(listEvalBenchmarksQueryOffsetMin).default(listEvalBenchmarksQueryOffsetDefault),
|
|
9487
|
+
"sort_by": zod.enum(["created_at"]).default(listEvalBenchmarksQuerySortByDefault),
|
|
9488
|
+
"sort_order": zod.enum(["asc", "desc"]).default(listEvalBenchmarksQuerySortOrderDefault)
|
|
9489
|
+
});
|
|
9490
|
+
var listEvalBenchmarksResponseDataItemCandidateVersionMin = -9007199254740991;
|
|
9491
|
+
var listEvalBenchmarksResponseDataItemCandidateVersionMax = 9007199254740991;
|
|
9492
|
+
var listEvalBenchmarksResponseDataItemBaselineVersionMin = -9007199254740991;
|
|
9493
|
+
var listEvalBenchmarksResponseDataItemBaselineVersionMax = 9007199254740991;
|
|
9494
|
+
var listEvalBenchmarksResponseDataItemRunsPerConfigurationMin = -9007199254740991;
|
|
9495
|
+
var listEvalBenchmarksResponseDataItemRunsPerConfigurationMax = 9007199254740991;
|
|
9496
|
+
var listEvalBenchmarksResponseDataItemRunSummaryOneCandidateRunsMin = -9007199254740991;
|
|
9497
|
+
var listEvalBenchmarksResponseDataItemRunSummaryOneCandidateRunsMax = 9007199254740991;
|
|
9498
|
+
var listEvalBenchmarksResponseDataItemRunSummaryOneCandidateGradedRunsMin = -9007199254740991;
|
|
9499
|
+
var listEvalBenchmarksResponseDataItemRunSummaryOneCandidateGradedRunsMax = 9007199254740991;
|
|
9500
|
+
var listEvalBenchmarksResponseDataItemRunSummaryOneBaselineRunsMin = -9007199254740991;
|
|
9501
|
+
var listEvalBenchmarksResponseDataItemRunSummaryOneBaselineRunsMax = 9007199254740991;
|
|
9502
|
+
var listEvalBenchmarksResponseDataItemRunSummaryOneBaselineGradedRunsMin = -9007199254740991;
|
|
9503
|
+
var listEvalBenchmarksResponseDataItemRunSummaryOneBaselineGradedRunsMax = 9007199254740991;
|
|
9504
|
+
var listEvalBenchmarksResponseMetaTotalMin = -9007199254740991;
|
|
9505
|
+
var listEvalBenchmarksResponseMetaTotalMax = 9007199254740991;
|
|
9506
|
+
var ListEvalBenchmarksResponse = zod.object({
|
|
9507
|
+
"data": zod.array(zod.object({
|
|
9508
|
+
"id": zod.string().uuid(),
|
|
9509
|
+
"eval_id": zod.string().uuid(),
|
|
9510
|
+
"candidate_version": zod.number().int().min(listEvalBenchmarksResponseDataItemCandidateVersionMin).max(listEvalBenchmarksResponseDataItemCandidateVersionMax),
|
|
9511
|
+
"baseline_version": zod.number().int().min(listEvalBenchmarksResponseDataItemBaselineVersionMin).max(listEvalBenchmarksResponseDataItemBaselineVersionMax),
|
|
9512
|
+
"runs_per_configuration": zod.number().int().min(listEvalBenchmarksResponseDataItemRunsPerConfigurationMin).max(listEvalBenchmarksResponseDataItemRunsPerConfigurationMax),
|
|
9513
|
+
"status": zod.enum(["running", "completed", "error"]),
|
|
9514
|
+
"run_summary": zod.union([zod.object({
|
|
9515
|
+
"candidate": zod.object({
|
|
9516
|
+
"runs": zod.number().int().min(listEvalBenchmarksResponseDataItemRunSummaryOneCandidateRunsMin).max(listEvalBenchmarksResponseDataItemRunSummaryOneCandidateRunsMax),
|
|
9517
|
+
"graded_runs": zod.number().int().min(listEvalBenchmarksResponseDataItemRunSummaryOneCandidateGradedRunsMin).max(listEvalBenchmarksResponseDataItemRunSummaryOneCandidateGradedRunsMax),
|
|
9518
|
+
"pass_rate": zod.union([zod.object({
|
|
9519
|
+
"mean": zod.number(),
|
|
9520
|
+
"stddev": zod.number(),
|
|
9521
|
+
"min": zod.number(),
|
|
9522
|
+
"max": zod.number()
|
|
9523
|
+
}), zod.null()]),
|
|
9524
|
+
"duration_seconds": zod.union([zod.object({
|
|
9525
|
+
"mean": zod.number(),
|
|
9526
|
+
"stddev": zod.number(),
|
|
9527
|
+
"min": zod.number(),
|
|
9528
|
+
"max": zod.number()
|
|
9529
|
+
}), zod.null()]),
|
|
9530
|
+
"fixture_matched_rate": zod.union([zod.object({
|
|
9531
|
+
"mean": zod.number(),
|
|
9532
|
+
"stddev": zod.number(),
|
|
9533
|
+
"min": zod.number(),
|
|
9534
|
+
"max": zod.number()
|
|
9535
|
+
}), zod.null()])
|
|
9536
|
+
}),
|
|
9537
|
+
"baseline": zod.object({
|
|
9538
|
+
"runs": zod.number().int().min(listEvalBenchmarksResponseDataItemRunSummaryOneBaselineRunsMin).max(listEvalBenchmarksResponseDataItemRunSummaryOneBaselineRunsMax),
|
|
9539
|
+
"graded_runs": zod.number().int().min(listEvalBenchmarksResponseDataItemRunSummaryOneBaselineGradedRunsMin).max(listEvalBenchmarksResponseDataItemRunSummaryOneBaselineGradedRunsMax),
|
|
9540
|
+
"pass_rate": zod.union([zod.object({
|
|
9541
|
+
"mean": zod.number(),
|
|
9542
|
+
"stddev": zod.number(),
|
|
9543
|
+
"min": zod.number(),
|
|
9544
|
+
"max": zod.number()
|
|
9545
|
+
}), zod.null()]),
|
|
9546
|
+
"duration_seconds": zod.union([zod.object({
|
|
9547
|
+
"mean": zod.number(),
|
|
9548
|
+
"stddev": zod.number(),
|
|
9549
|
+
"min": zod.number(),
|
|
9550
|
+
"max": zod.number()
|
|
9551
|
+
}), zod.null()]),
|
|
9552
|
+
"fixture_matched_rate": zod.union([zod.object({
|
|
9553
|
+
"mean": zod.number(),
|
|
9554
|
+
"stddev": zod.number(),
|
|
9555
|
+
"min": zod.number(),
|
|
9556
|
+
"max": zod.number()
|
|
9557
|
+
}), zod.null()])
|
|
9558
|
+
}),
|
|
9559
|
+
"delta": zod.object({
|
|
9560
|
+
"pass_rate": zod.union([zod.number(), zod.null()]),
|
|
9561
|
+
"duration_seconds": zod.union([zod.number(), zod.null()]),
|
|
9562
|
+
"fixture_matched_rate": zod.union([zod.number(), zod.null()])
|
|
9563
|
+
})
|
|
9564
|
+
}), zod.null()]),
|
|
9565
|
+
"notes": zod.union([zod.array(zod.string()), zod.null()]),
|
|
9566
|
+
"created_at": zod.string().datetime({ "offset": true }),
|
|
9567
|
+
"completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
|
|
9568
|
+
})),
|
|
9569
|
+
"message": zod.string(),
|
|
9570
|
+
"meta": zod.object({
|
|
9571
|
+
"total": zod.number().int().min(listEvalBenchmarksResponseMetaTotalMin).max(listEvalBenchmarksResponseMetaTotalMax).describe("Total number of benchmarks for the eval")
|
|
9572
|
+
})
|
|
9573
|
+
});
|
|
9339
9574
|
var GetBenchmarkParams = zod.object({
|
|
9340
9575
|
"benchmarkId": zod.string().uuid()
|
|
9341
9576
|
});
|
|
@@ -9435,6 +9670,8 @@ var GetBenchmarkResponse = zod.object({
|
|
|
9435
9670
|
})
|
|
9436
9671
|
}), zod.null()]),
|
|
9437
9672
|
"notes": zod.union([zod.array(zod.string()), zod.null()]),
|
|
9673
|
+
"created_at": zod.string().datetime({ "offset": true }),
|
|
9674
|
+
"completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()]),
|
|
9438
9675
|
"runs": zod.array(zod.object({
|
|
9439
9676
|
"id": zod.string().uuid(),
|
|
9440
9677
|
"eval_id": zod.string().uuid(),
|
|
@@ -9476,10 +9713,158 @@ var GetBenchmarkResponse = zod.object({
|
|
|
9476
9713
|
"created_at": zod.string().datetime({ "offset": true }),
|
|
9477
9714
|
"started_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()]),
|
|
9478
9715
|
"completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
|
|
9716
|
+
}))
|
|
9717
|
+
}),
|
|
9718
|
+
"message": zod.string()
|
|
9719
|
+
});
|
|
9720
|
+
var ListWorkerEvalsParams = zod.object({
|
|
9721
|
+
"workerId": zod.string().uuid()
|
|
9722
|
+
});
|
|
9723
|
+
var listWorkerEvalsQueryCountDefault = 50;
|
|
9724
|
+
var listWorkerEvalsQueryCountMax = 100;
|
|
9725
|
+
var listWorkerEvalsQueryOffsetDefault = 0;
|
|
9726
|
+
var listWorkerEvalsQueryOffsetMin = 0;
|
|
9727
|
+
var listWorkerEvalsQuerySortByDefault = `created_at`;
|
|
9728
|
+
var listWorkerEvalsQuerySortOrderDefault = `desc`;
|
|
9729
|
+
var ListWorkerEvalsQueryParams = zod.object({
|
|
9730
|
+
"count": zod.number().min(1).max(listWorkerEvalsQueryCountMax).default(listWorkerEvalsQueryCountDefault),
|
|
9731
|
+
"offset": zod.number().min(listWorkerEvalsQueryOffsetMin).default(listWorkerEvalsQueryOffsetDefault),
|
|
9732
|
+
"sort_by": zod.enum(["created_at"]).default(listWorkerEvalsQuerySortByDefault),
|
|
9733
|
+
"sort_order": zod.enum(["asc", "desc"]).default(listWorkerEvalsQuerySortOrderDefault)
|
|
9734
|
+
});
|
|
9735
|
+
var listWorkerEvalsResponseMetaTotalMin = -9007199254740991;
|
|
9736
|
+
var listWorkerEvalsResponseMetaTotalMax = 9007199254740991;
|
|
9737
|
+
var ListWorkerEvalsResponse = zod.object({
|
|
9738
|
+
"data": zod.array(zod.object({
|
|
9739
|
+
"id": zod.string().uuid(),
|
|
9740
|
+
"name": zod.string(),
|
|
9741
|
+
"target": zod.object({
|
|
9742
|
+
"type": zod.enum(["worker", "chat_agent", "voice_agent"]),
|
|
9743
|
+
"id": zod.string().uuid()
|
|
9744
|
+
}),
|
|
9745
|
+
"source": zod.object({
|
|
9746
|
+
"type": zod.enum(["worker_run", "chat", "call"]),
|
|
9747
|
+
"id": zod.string().uuid()
|
|
9748
|
+
}),
|
|
9749
|
+
"fixture": zod.object({
|
|
9750
|
+
"version": zod.literal(1),
|
|
9751
|
+
"type": zod.literal("worker_run_replay"),
|
|
9752
|
+
"scope": zod.union([zod.record(zod.string(), zod.unknown()), zod.null()]),
|
|
9753
|
+
"resolved_artifact_ids": zod.array(zod.string().uuid()),
|
|
9754
|
+
"trigger_context": zod.union([zod.string(), zod.null()])
|
|
9755
|
+
}),
|
|
9756
|
+
"tool_mocks": zod.array(zod.object({
|
|
9757
|
+
"mcp_type": zod.string(),
|
|
9758
|
+
"tool_name": zod.string(),
|
|
9759
|
+
"description": zod.string(),
|
|
9760
|
+
"input_schema": zod.record(zod.string(), zod.unknown()),
|
|
9761
|
+
"match": zod.record(zod.string(), zod.unknown()).optional(),
|
|
9762
|
+
"logical_tool_name": zod.union([zod.string(), zod.null()]),
|
|
9763
|
+
"responses": zod.array(zod.unknown()),
|
|
9764
|
+
"inputs": zod.array(zod.unknown()).optional(),
|
|
9765
|
+
"default": zod.unknown().optional()
|
|
9479
9766
|
})),
|
|
9767
|
+
"grader": zod.object({
|
|
9768
|
+
"type": zod.literal("prompt"),
|
|
9769
|
+
"assertions": zod.array(zod.string()),
|
|
9770
|
+
"criterion": zod.string().describe("Deprecated: assertions joined by newlines. Use assertions.")
|
|
9771
|
+
}),
|
|
9772
|
+
"created_at": zod.string().datetime({ "offset": true })
|
|
9773
|
+
})),
|
|
9774
|
+
"message": zod.string(),
|
|
9775
|
+
"meta": zod.object({
|
|
9776
|
+
"total": zod.number().int().min(listWorkerEvalsResponseMetaTotalMin).max(listWorkerEvalsResponseMetaTotalMax).describe("Total number of evals for the worker")
|
|
9777
|
+
})
|
|
9778
|
+
});
|
|
9779
|
+
var CreateWorkerBenchmarksParams = zod.object({
|
|
9780
|
+
"workerId": zod.string().uuid()
|
|
9781
|
+
});
|
|
9782
|
+
var createWorkerBenchmarksBodyCandidateVersionMax = 9007199254740991;
|
|
9783
|
+
var createWorkerBenchmarksBodyBaselineVersionMax = 9007199254740991;
|
|
9784
|
+
var createWorkerBenchmarksBodyRunsPerConfigurationDefault = 3;
|
|
9785
|
+
var createWorkerBenchmarksBodyRunsPerConfigurationMax = 5;
|
|
9786
|
+
var CreateWorkerBenchmarksBody = zod.object({
|
|
9787
|
+
"candidate_version": zod.number().int().min(1).max(createWorkerBenchmarksBodyCandidateVersionMax),
|
|
9788
|
+
"baseline_version": zod.number().int().min(1).max(createWorkerBenchmarksBodyBaselineVersionMax),
|
|
9789
|
+
"runs_per_configuration": zod.number().int().min(1).max(createWorkerBenchmarksBodyRunsPerConfigurationMax).default(createWorkerBenchmarksBodyRunsPerConfigurationDefault)
|
|
9790
|
+
});
|
|
9791
|
+
var createWorkerBenchmarksResponseDataItemCandidateVersionMin = -9007199254740991;
|
|
9792
|
+
var createWorkerBenchmarksResponseDataItemCandidateVersionMax = 9007199254740991;
|
|
9793
|
+
var createWorkerBenchmarksResponseDataItemBaselineVersionMin = -9007199254740991;
|
|
9794
|
+
var createWorkerBenchmarksResponseDataItemBaselineVersionMax = 9007199254740991;
|
|
9795
|
+
var createWorkerBenchmarksResponseDataItemRunsPerConfigurationMin = -9007199254740991;
|
|
9796
|
+
var createWorkerBenchmarksResponseDataItemRunsPerConfigurationMax = 9007199254740991;
|
|
9797
|
+
var createWorkerBenchmarksResponseDataItemRunSummaryOneCandidateRunsMin = -9007199254740991;
|
|
9798
|
+
var createWorkerBenchmarksResponseDataItemRunSummaryOneCandidateRunsMax = 9007199254740991;
|
|
9799
|
+
var createWorkerBenchmarksResponseDataItemRunSummaryOneCandidateGradedRunsMin = -9007199254740991;
|
|
9800
|
+
var createWorkerBenchmarksResponseDataItemRunSummaryOneCandidateGradedRunsMax = 9007199254740991;
|
|
9801
|
+
var createWorkerBenchmarksResponseDataItemRunSummaryOneBaselineRunsMin = -9007199254740991;
|
|
9802
|
+
var createWorkerBenchmarksResponseDataItemRunSummaryOneBaselineRunsMax = 9007199254740991;
|
|
9803
|
+
var createWorkerBenchmarksResponseDataItemRunSummaryOneBaselineGradedRunsMin = -9007199254740991;
|
|
9804
|
+
var createWorkerBenchmarksResponseDataItemRunSummaryOneBaselineGradedRunsMax = 9007199254740991;
|
|
9805
|
+
var CreateWorkerBenchmarksResponse = zod.object({
|
|
9806
|
+
"data": zod.array(zod.object({
|
|
9807
|
+
"id": zod.string().uuid(),
|
|
9808
|
+
"eval_id": zod.string().uuid(),
|
|
9809
|
+
"candidate_version": zod.number().int().min(createWorkerBenchmarksResponseDataItemCandidateVersionMin).max(createWorkerBenchmarksResponseDataItemCandidateVersionMax),
|
|
9810
|
+
"baseline_version": zod.number().int().min(createWorkerBenchmarksResponseDataItemBaselineVersionMin).max(createWorkerBenchmarksResponseDataItemBaselineVersionMax),
|
|
9811
|
+
"runs_per_configuration": zod.number().int().min(createWorkerBenchmarksResponseDataItemRunsPerConfigurationMin).max(createWorkerBenchmarksResponseDataItemRunsPerConfigurationMax),
|
|
9812
|
+
"status": zod.enum(["running", "completed", "error"]),
|
|
9813
|
+
"run_summary": zod.union([zod.object({
|
|
9814
|
+
"candidate": zod.object({
|
|
9815
|
+
"runs": zod.number().int().min(createWorkerBenchmarksResponseDataItemRunSummaryOneCandidateRunsMin).max(createWorkerBenchmarksResponseDataItemRunSummaryOneCandidateRunsMax),
|
|
9816
|
+
"graded_runs": zod.number().int().min(createWorkerBenchmarksResponseDataItemRunSummaryOneCandidateGradedRunsMin).max(createWorkerBenchmarksResponseDataItemRunSummaryOneCandidateGradedRunsMax),
|
|
9817
|
+
"pass_rate": zod.union([zod.object({
|
|
9818
|
+
"mean": zod.number(),
|
|
9819
|
+
"stddev": zod.number(),
|
|
9820
|
+
"min": zod.number(),
|
|
9821
|
+
"max": zod.number()
|
|
9822
|
+
}), zod.null()]),
|
|
9823
|
+
"duration_seconds": zod.union([zod.object({
|
|
9824
|
+
"mean": zod.number(),
|
|
9825
|
+
"stddev": zod.number(),
|
|
9826
|
+
"min": zod.number(),
|
|
9827
|
+
"max": zod.number()
|
|
9828
|
+
}), zod.null()]),
|
|
9829
|
+
"fixture_matched_rate": zod.union([zod.object({
|
|
9830
|
+
"mean": zod.number(),
|
|
9831
|
+
"stddev": zod.number(),
|
|
9832
|
+
"min": zod.number(),
|
|
9833
|
+
"max": zod.number()
|
|
9834
|
+
}), zod.null()])
|
|
9835
|
+
}),
|
|
9836
|
+
"baseline": zod.object({
|
|
9837
|
+
"runs": zod.number().int().min(createWorkerBenchmarksResponseDataItemRunSummaryOneBaselineRunsMin).max(createWorkerBenchmarksResponseDataItemRunSummaryOneBaselineRunsMax),
|
|
9838
|
+
"graded_runs": zod.number().int().min(createWorkerBenchmarksResponseDataItemRunSummaryOneBaselineGradedRunsMin).max(createWorkerBenchmarksResponseDataItemRunSummaryOneBaselineGradedRunsMax),
|
|
9839
|
+
"pass_rate": zod.union([zod.object({
|
|
9840
|
+
"mean": zod.number(),
|
|
9841
|
+
"stddev": zod.number(),
|
|
9842
|
+
"min": zod.number(),
|
|
9843
|
+
"max": zod.number()
|
|
9844
|
+
}), zod.null()]),
|
|
9845
|
+
"duration_seconds": zod.union([zod.object({
|
|
9846
|
+
"mean": zod.number(),
|
|
9847
|
+
"stddev": zod.number(),
|
|
9848
|
+
"min": zod.number(),
|
|
9849
|
+
"max": zod.number()
|
|
9850
|
+
}), zod.null()]),
|
|
9851
|
+
"fixture_matched_rate": zod.union([zod.object({
|
|
9852
|
+
"mean": zod.number(),
|
|
9853
|
+
"stddev": zod.number(),
|
|
9854
|
+
"min": zod.number(),
|
|
9855
|
+
"max": zod.number()
|
|
9856
|
+
}), zod.null()])
|
|
9857
|
+
}),
|
|
9858
|
+
"delta": zod.object({
|
|
9859
|
+
"pass_rate": zod.union([zod.number(), zod.null()]),
|
|
9860
|
+
"duration_seconds": zod.union([zod.number(), zod.null()]),
|
|
9861
|
+
"fixture_matched_rate": zod.union([zod.number(), zod.null()])
|
|
9862
|
+
})
|
|
9863
|
+
}), zod.null()]),
|
|
9864
|
+
"notes": zod.union([zod.array(zod.string()), zod.null()]),
|
|
9480
9865
|
"created_at": zod.string().datetime({ "offset": true }),
|
|
9481
9866
|
"completed_at": zod.union([zod.string().datetime({ "offset": true }), zod.null()])
|
|
9482
|
-
}),
|
|
9867
|
+
})),
|
|
9483
9868
|
"message": zod.string()
|
|
9484
9869
|
});
|
|
9485
9870
|
var CreateExtractorBody = zod.object({
|
|
@@ -12957,6 +13342,23 @@ var createMcpServer = (options) => {
|
|
|
12957
13342
|
signal: options?.signal ? AbortSignal.any([options.signal, ctx.signal]) : ctx.signal
|
|
12958
13343
|
})
|
|
12959
13344
|
);
|
|
13345
|
+
tools.listEvalBenchmarks = server2.registerTool(
|
|
13346
|
+
"listEvalBenchmarks",
|
|
13347
|
+
{
|
|
13348
|
+
title: "List an eval's benchmarks",
|
|
13349
|
+
description: "Benchmark history of an eval (newest first by default) without per-run details. Use GET /v1/benchmarks/{benchmarkId} for the runs.",
|
|
13350
|
+
inputSchema: {
|
|
13351
|
+
pathParams: ListEvalBenchmarksParams,
|
|
13352
|
+
queryParams: ListEvalBenchmarksQueryParams
|
|
13353
|
+
},
|
|
13354
|
+
outputSchema: ListEvalBenchmarksResponse,
|
|
13355
|
+
annotations: { readOnlyHint: true }
|
|
13356
|
+
},
|
|
13357
|
+
(args, ctx) => listEvalBenchmarksHandler(args, {
|
|
13358
|
+
...options,
|
|
13359
|
+
signal: options?.signal ? AbortSignal.any([options.signal, ctx.signal]) : ctx.signal
|
|
13360
|
+
})
|
|
13361
|
+
);
|
|
12960
13362
|
tools.getBenchmark = server2.registerTool(
|
|
12961
13363
|
"getBenchmark",
|
|
12962
13364
|
{
|
|
@@ -12973,6 +13375,40 @@ var createMcpServer = (options) => {
|
|
|
12973
13375
|
signal: options?.signal ? AbortSignal.any([options.signal, ctx.signal]) : ctx.signal
|
|
12974
13376
|
})
|
|
12975
13377
|
);
|
|
13378
|
+
tools.listWorkerEvals = server2.registerTool(
|
|
13379
|
+
"listWorkerEvals",
|
|
13380
|
+
{
|
|
13381
|
+
title: "List a worker's evals",
|
|
13382
|
+
description: "List the evals recorded for a worker, newest first by default.",
|
|
13383
|
+
inputSchema: {
|
|
13384
|
+
pathParams: ListWorkerEvalsParams,
|
|
13385
|
+
queryParams: ListWorkerEvalsQueryParams
|
|
13386
|
+
},
|
|
13387
|
+
outputSchema: ListWorkerEvalsResponse,
|
|
13388
|
+
annotations: { readOnlyHint: true }
|
|
13389
|
+
},
|
|
13390
|
+
(args, ctx) => listWorkerEvalsHandler(args, {
|
|
13391
|
+
...options,
|
|
13392
|
+
signal: options?.signal ? AbortSignal.any([options.signal, ctx.signal]) : ctx.signal
|
|
13393
|
+
})
|
|
13394
|
+
);
|
|
13395
|
+
tools.createWorkerBenchmarks = server2.registerTool(
|
|
13396
|
+
"createWorkerBenchmarks",
|
|
13397
|
+
{
|
|
13398
|
+
title: "Benchmark two worker versions on all of the worker's evals",
|
|
13399
|
+
description: "Create one benchmark per eval of the worker, each queueing runs_per_configuration trials against the candidate and the baseline version. Poll each benchmark with GET /v1/benchmarks/{benchmarkId}.",
|
|
13400
|
+
inputSchema: {
|
|
13401
|
+
pathParams: CreateWorkerBenchmarksParams,
|
|
13402
|
+
bodyParams: CreateWorkerBenchmarksBody.optional()
|
|
13403
|
+
},
|
|
13404
|
+
outputSchema: CreateWorkerBenchmarksResponse,
|
|
13405
|
+
annotations: { destructiveHint: true }
|
|
13406
|
+
},
|
|
13407
|
+
(args, ctx) => createWorkerBenchmarksHandler(args, {
|
|
13408
|
+
...options,
|
|
13409
|
+
signal: options?.signal ? AbortSignal.any([options.signal, ctx.signal]) : ctx.signal
|
|
13410
|
+
})
|
|
13411
|
+
);
|
|
12976
13412
|
tools.createExtractor = server2.registerTool(
|
|
12977
13413
|
"createExtractor",
|
|
12978
13414
|
{
|
|
@@ -14586,4 +15022,4 @@ var transport = new StdioServerTransport();
|
|
|
14586
15022
|
server.connect(transport).then(() => {
|
|
14587
15023
|
console.error("MCP server running on stdio");
|
|
14588
15024
|
}).catch(console.error);
|
|
14589
|
-
//# sourceMappingURL=server-
|
|
15025
|
+
//# sourceMappingURL=server-EZUDCD4M.js.map
|