@meetkai/mka1 0.51.35 → 0.51.36
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/README.md +229 -226
- package/bin/mcp-server.js +1663 -1230
- package/bin/mcp-server.js.map +12 -8
- package/dist/commonjs/funcs/llmEvalsListSuiteLeaderboardRuns.d.ts +17 -0
- package/dist/commonjs/funcs/llmEvalsListSuiteLeaderboardRuns.d.ts.map +1 -0
- package/dist/commonjs/funcs/llmEvalsListSuiteLeaderboardRuns.js +138 -0
- package/dist/commonjs/funcs/llmEvalsListSuiteLeaderboardRuns.js.map +1 -0
- package/dist/commonjs/lib/config.d.ts +2 -2
- package/dist/commonjs/lib/config.js +2 -2
- package/dist/commonjs/mcp-server/mcp-server.js +1 -1
- package/dist/commonjs/mcp-server/server.d.ts.map +1 -1
- package/dist/commonjs/mcp-server/server.js +3 -1
- package/dist/commonjs/mcp-server/server.js.map +1 -1
- package/dist/commonjs/mcp-server/tools/llmEvalsListSuiteLeaderboardRuns.d.ts +8 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsListSuiteLeaderboardRuns.d.ts.map +1 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsListSuiteLeaderboardRuns.js +64 -0
- package/dist/commonjs/mcp-server/tools/llmEvalsListSuiteLeaderboardRuns.js.map +1 -0
- package/dist/commonjs/models/components/evalleaderboardrungroup.d.ts +35 -0
- package/dist/commonjs/models/components/evalleaderboardrungroup.d.ts.map +1 -0
- package/dist/commonjs/models/components/evalleaderboardrungroup.js +75 -0
- package/dist/commonjs/models/components/evalleaderboardrungroup.js.map +1 -0
- package/dist/commonjs/models/components/index.d.ts +1 -0
- package/dist/commonjs/models/components/index.d.ts.map +1 -1
- package/dist/commonjs/models/components/index.js +1 -0
- package/dist/commonjs/models/components/index.js.map +1 -1
- package/dist/commonjs/models/operations/index.d.ts +1 -0
- package/dist/commonjs/models/operations/index.d.ts.map +1 -1
- package/dist/commonjs/models/operations/index.js +1 -0
- package/dist/commonjs/models/operations/index.js.map +1 -1
- package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.d.ts +273 -0
- package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.d.ts.map +1 -0
- package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.js +390 -0
- package/dist/commonjs/models/operations/listevalsuiteleaderboardruns.js.map +1 -0
- package/dist/commonjs/react-query/index.d.ts +1 -0
- package/dist/commonjs/react-query/index.d.ts.map +1 -1
- package/dist/commonjs/react-query/index.js +1 -0
- package/dist/commonjs/react-query/index.js.map +1 -1
- package/dist/commonjs/react-query/llmEvalsListSuiteLeaderboardRuns.core.d.ts +18 -0
- package/dist/commonjs/react-query/llmEvalsListSuiteLeaderboardRuns.core.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsListSuiteLeaderboardRuns.core.js +46 -0
- package/dist/commonjs/react-query/llmEvalsListSuiteLeaderboardRuns.core.js.map +1 -0
- package/dist/commonjs/react-query/llmEvalsListSuiteLeaderboardRuns.d.ts +46 -0
- package/dist/commonjs/react-query/llmEvalsListSuiteLeaderboardRuns.d.ts.map +1 -0
- package/dist/commonjs/react-query/llmEvalsListSuiteLeaderboardRuns.js +65 -0
- package/dist/commonjs/react-query/llmEvalsListSuiteLeaderboardRuns.js.map +1 -0
- package/dist/commonjs/sdk/evals.d.ts +7 -0
- package/dist/commonjs/sdk/evals.d.ts.map +1 -1
- package/dist/commonjs/sdk/evals.js +10 -0
- package/dist/commonjs/sdk/evals.js.map +1 -1
- package/dist/esm/funcs/llmEvalsListSuiteLeaderboardRuns.d.ts +17 -0
- package/dist/esm/funcs/llmEvalsListSuiteLeaderboardRuns.d.ts.map +1 -0
- package/dist/esm/funcs/llmEvalsListSuiteLeaderboardRuns.js +102 -0
- package/dist/esm/funcs/llmEvalsListSuiteLeaderboardRuns.js.map +1 -0
- package/dist/esm/lib/config.d.ts +2 -2
- package/dist/esm/lib/config.js +2 -2
- package/dist/esm/mcp-server/mcp-server.js +1 -1
- package/dist/esm/mcp-server/server.d.ts.map +1 -1
- package/dist/esm/mcp-server/server.js +3 -1
- package/dist/esm/mcp-server/server.js.map +1 -1
- package/dist/esm/mcp-server/tools/llmEvalsListSuiteLeaderboardRuns.d.ts +8 -0
- package/dist/esm/mcp-server/tools/llmEvalsListSuiteLeaderboardRuns.d.ts.map +1 -0
- package/dist/esm/mcp-server/tools/llmEvalsListSuiteLeaderboardRuns.js +28 -0
- package/dist/esm/mcp-server/tools/llmEvalsListSuiteLeaderboardRuns.js.map +1 -0
- package/dist/esm/models/components/evalleaderboardrungroup.d.ts +35 -0
- package/dist/esm/models/components/evalleaderboardrungroup.d.ts.map +1 -0
- package/dist/esm/models/components/evalleaderboardrungroup.js +37 -0
- package/dist/esm/models/components/evalleaderboardrungroup.js.map +1 -0
- package/dist/esm/models/components/index.d.ts +1 -0
- package/dist/esm/models/components/index.d.ts.map +1 -1
- package/dist/esm/models/components/index.js +1 -0
- package/dist/esm/models/components/index.js.map +1 -1
- package/dist/esm/models/operations/index.d.ts +1 -0
- package/dist/esm/models/operations/index.d.ts.map +1 -1
- package/dist/esm/models/operations/index.js +1 -0
- package/dist/esm/models/operations/index.js.map +1 -1
- package/dist/esm/models/operations/listevalsuiteleaderboardruns.d.ts +273 -0
- package/dist/esm/models/operations/listevalsuiteleaderboardruns.d.ts.map +1 -0
- package/dist/esm/models/operations/listevalsuiteleaderboardruns.js +340 -0
- package/dist/esm/models/operations/listevalsuiteleaderboardruns.js.map +1 -0
- package/dist/esm/react-query/index.d.ts +1 -0
- package/dist/esm/react-query/index.d.ts.map +1 -1
- package/dist/esm/react-query/index.js +1 -0
- package/dist/esm/react-query/index.js.map +1 -1
- package/dist/esm/react-query/llmEvalsListSuiteLeaderboardRuns.core.d.ts +18 -0
- package/dist/esm/react-query/llmEvalsListSuiteLeaderboardRuns.core.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsListSuiteLeaderboardRuns.core.js +41 -0
- package/dist/esm/react-query/llmEvalsListSuiteLeaderboardRuns.core.js.map +1 -0
- package/dist/esm/react-query/llmEvalsListSuiteLeaderboardRuns.d.ts +46 -0
- package/dist/esm/react-query/llmEvalsListSuiteLeaderboardRuns.d.ts.map +1 -0
- package/dist/esm/react-query/llmEvalsListSuiteLeaderboardRuns.js +55 -0
- package/dist/esm/react-query/llmEvalsListSuiteLeaderboardRuns.js.map +1 -0
- package/dist/esm/sdk/evals.d.ts +7 -0
- package/dist/esm/sdk/evals.d.ts.map +1 -1
- package/dist/esm/sdk/evals.js +10 -0
- package/dist/esm/sdk/evals.js.map +1 -1
- package/jsr.json +1 -1
- package/package.json +1 -1
- package/src/funcs/llmEvalsListSuiteLeaderboardRuns.ts +198 -0
- package/src/lib/config.ts +2 -2
- package/src/mcp-server/mcp-server.ts +1 -1
- package/src/mcp-server/server.ts +3 -1
- package/src/mcp-server/tools/llmEvalsListSuiteLeaderboardRuns.ts +39 -0
- package/src/models/components/evalleaderboardrungroup.ts +86 -0
- package/src/models/components/index.ts +1 -0
- package/src/models/operations/index.ts +1 -0
- package/src/models/operations/listevalsuiteleaderboardruns.ts +754 -0
- package/src/react-query/index.ts +1 -0
- package/src/react-query/llmEvalsListSuiteLeaderboardRuns.core.ts +92 -0
- package/src/react-query/llmEvalsListSuiteLeaderboardRuns.ts +164 -0
- package/src/sdk/evals.ts +18 -0
package/src/react-query/index.ts
CHANGED
|
@@ -148,6 +148,7 @@ export * from "./llmEvalsListRuns.js";
|
|
|
148
148
|
export * from "./llmEvalsListSamples.js";
|
|
149
149
|
export * from "./llmEvalsListScheduleRuns.js";
|
|
150
150
|
export * from "./llmEvalsListSchedules.js";
|
|
151
|
+
export * from "./llmEvalsListSuiteLeaderboardRuns.js";
|
|
151
152
|
export * from "./llmEvalsListSuites.js";
|
|
152
153
|
export * from "./llmEvalsListSuiteVersions.js";
|
|
153
154
|
export * from "./llmEvalsRerunFailedSamples.js";
|
|
@@ -0,0 +1,92 @@
|
|
|
1
|
+
/*
|
|
2
|
+
* Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
|
|
3
|
+
*/
|
|
4
|
+
|
|
5
|
+
import {
|
|
6
|
+
QueryClient,
|
|
7
|
+
QueryFunctionContext,
|
|
8
|
+
QueryKey,
|
|
9
|
+
} from "@tanstack/react-query";
|
|
10
|
+
import { SDKCore } from "../core.js";
|
|
11
|
+
import { llmEvalsListSuiteLeaderboardRuns } from "../funcs/llmEvalsListSuiteLeaderboardRuns.js";
|
|
12
|
+
import { combineSignals } from "../lib/primitives.js";
|
|
13
|
+
import { RequestOptions } from "../lib/sdks.js";
|
|
14
|
+
import * as operations from "../models/operations/index.js";
|
|
15
|
+
import { unwrapAsync } from "../types/fp.js";
|
|
16
|
+
export type LlmEvalsListSuiteLeaderboardRunsQueryData =
|
|
17
|
+
operations.ListEvalSuiteLeaderboardRunsResponseBody;
|
|
18
|
+
|
|
19
|
+
export function prefetchLlmEvalsListSuiteLeaderboardRuns(
|
|
20
|
+
queryClient: QueryClient,
|
|
21
|
+
client$: SDKCore,
|
|
22
|
+
request: operations.ListEvalSuiteLeaderboardRunsRequest,
|
|
23
|
+
options?: RequestOptions,
|
|
24
|
+
): Promise<void> {
|
|
25
|
+
return queryClient.prefetchQuery({
|
|
26
|
+
...buildLlmEvalsListSuiteLeaderboardRunsQuery(
|
|
27
|
+
client$,
|
|
28
|
+
request,
|
|
29
|
+
options,
|
|
30
|
+
),
|
|
31
|
+
});
|
|
32
|
+
}
|
|
33
|
+
|
|
34
|
+
export function buildLlmEvalsListSuiteLeaderboardRunsQuery(
|
|
35
|
+
client$: SDKCore,
|
|
36
|
+
request: operations.ListEvalSuiteLeaderboardRunsRequest,
|
|
37
|
+
options?: RequestOptions,
|
|
38
|
+
): {
|
|
39
|
+
queryKey: QueryKey;
|
|
40
|
+
queryFn: (
|
|
41
|
+
context: QueryFunctionContext,
|
|
42
|
+
) => Promise<LlmEvalsListSuiteLeaderboardRunsQueryData>;
|
|
43
|
+
} {
|
|
44
|
+
return {
|
|
45
|
+
queryKey: queryKeyLlmEvalsListSuiteLeaderboardRuns(request.suiteId, {
|
|
46
|
+
suiteVersion: request.suiteVersion,
|
|
47
|
+
perGroup: request.perGroup,
|
|
48
|
+
model: request.model,
|
|
49
|
+
cursor: request.cursor,
|
|
50
|
+
xOnBehalfOf: request.xOnBehalfOf,
|
|
51
|
+
}),
|
|
52
|
+
queryFn: async function llmEvalsListSuiteLeaderboardRunsQueryFn(
|
|
53
|
+
ctx,
|
|
54
|
+
): Promise<LlmEvalsListSuiteLeaderboardRunsQueryData> {
|
|
55
|
+
const sig = combineSignals(
|
|
56
|
+
ctx.signal,
|
|
57
|
+
options?.signal,
|
|
58
|
+
options?.fetchOptions?.signal,
|
|
59
|
+
);
|
|
60
|
+
const mergedOptions = {
|
|
61
|
+
...options?.fetchOptions,
|
|
62
|
+
...options,
|
|
63
|
+
signal: sig,
|
|
64
|
+
};
|
|
65
|
+
|
|
66
|
+
return unwrapAsync(llmEvalsListSuiteLeaderboardRuns(
|
|
67
|
+
client$,
|
|
68
|
+
request,
|
|
69
|
+
mergedOptions,
|
|
70
|
+
));
|
|
71
|
+
},
|
|
72
|
+
};
|
|
73
|
+
}
|
|
74
|
+
|
|
75
|
+
export function queryKeyLlmEvalsListSuiteLeaderboardRuns(
|
|
76
|
+
suiteId: string,
|
|
77
|
+
parameters: {
|
|
78
|
+
suiteVersion?: number | undefined;
|
|
79
|
+
perGroup?: number | undefined;
|
|
80
|
+
model?: string | undefined;
|
|
81
|
+
cursor?: string | undefined;
|
|
82
|
+
xOnBehalfOf?: string | undefined;
|
|
83
|
+
},
|
|
84
|
+
): QueryKey {
|
|
85
|
+
return [
|
|
86
|
+
"@meetkai/mka1",
|
|
87
|
+
"evals",
|
|
88
|
+
"listSuiteLeaderboardRuns",
|
|
89
|
+
suiteId,
|
|
90
|
+
parameters,
|
|
91
|
+
];
|
|
92
|
+
}
|
|
@@ -0,0 +1,164 @@
|
|
|
1
|
+
/*
|
|
2
|
+
* Code generated by Speakeasy (https://speakeasy.com). DO NOT EDIT.
|
|
3
|
+
*/
|
|
4
|
+
|
|
5
|
+
import {
|
|
6
|
+
InvalidateQueryFilters,
|
|
7
|
+
QueryClient,
|
|
8
|
+
useQuery,
|
|
9
|
+
UseQueryResult,
|
|
10
|
+
useSuspenseQuery,
|
|
11
|
+
UseSuspenseQueryResult,
|
|
12
|
+
} from "@tanstack/react-query";
|
|
13
|
+
import {
|
|
14
|
+
ConnectionError,
|
|
15
|
+
InvalidRequestError,
|
|
16
|
+
RequestAbortedError,
|
|
17
|
+
RequestTimeoutError,
|
|
18
|
+
UnexpectedClientError,
|
|
19
|
+
} from "../models/errors/httpclienterrors.js";
|
|
20
|
+
import { ResponseValidationError } from "../models/errors/responsevalidationerror.js";
|
|
21
|
+
import { SDKError } from "../models/errors/sdkerror.js";
|
|
22
|
+
import { SDKValidationError } from "../models/errors/sdkvalidationerror.js";
|
|
23
|
+
import * as operations from "../models/operations/index.js";
|
|
24
|
+
import { useSDKContext } from "./_context.js";
|
|
25
|
+
import {
|
|
26
|
+
QueryHookOptions,
|
|
27
|
+
SuspenseQueryHookOptions,
|
|
28
|
+
TupleToPrefixes,
|
|
29
|
+
} from "./_types.js";
|
|
30
|
+
import {
|
|
31
|
+
buildLlmEvalsListSuiteLeaderboardRunsQuery,
|
|
32
|
+
LlmEvalsListSuiteLeaderboardRunsQueryData,
|
|
33
|
+
prefetchLlmEvalsListSuiteLeaderboardRuns,
|
|
34
|
+
queryKeyLlmEvalsListSuiteLeaderboardRuns,
|
|
35
|
+
} from "./llmEvalsListSuiteLeaderboardRuns.core.js";
|
|
36
|
+
export {
|
|
37
|
+
buildLlmEvalsListSuiteLeaderboardRunsQuery,
|
|
38
|
+
type LlmEvalsListSuiteLeaderboardRunsQueryData,
|
|
39
|
+
prefetchLlmEvalsListSuiteLeaderboardRuns,
|
|
40
|
+
queryKeyLlmEvalsListSuiteLeaderboardRuns,
|
|
41
|
+
};
|
|
42
|
+
|
|
43
|
+
export type LlmEvalsListSuiteLeaderboardRunsQueryError =
|
|
44
|
+
| SDKError
|
|
45
|
+
| ResponseValidationError
|
|
46
|
+
| ConnectionError
|
|
47
|
+
| RequestAbortedError
|
|
48
|
+
| RequestTimeoutError
|
|
49
|
+
| InvalidRequestError
|
|
50
|
+
| UnexpectedClientError
|
|
51
|
+
| SDKValidationError;
|
|
52
|
+
|
|
53
|
+
/**
|
|
54
|
+
* List leaderboard runs for an eval suite
|
|
55
|
+
*
|
|
56
|
+
* @remarks
|
|
57
|
+
* Returns each ranking group's most recent completed runs for a suite in one request, with the group assignments in `groups`. A group is (model, targeted task) for task_ids-restricted runs and (model) for unrestricted runs (task_id null). Build boards from `groups`, not from run.models/run.task_ids — a returned run may name models or tasks whose groups it did not rank in. `truncated: true` means a server ceiling trimmed the aggregate; whole runs are kept in (best rank, first model, first task, id) order, so every group's newest runs survive before any group's fallbacks and no group is dropped for being old. Resume a truncated board by passing `next_cursor` back as `cursor` and unioning the responses. See the evals docs for grouping rationale and cost characteristics.
|
|
58
|
+
*/
|
|
59
|
+
export function useLlmEvalsListSuiteLeaderboardRuns(
|
|
60
|
+
request: operations.ListEvalSuiteLeaderboardRunsRequest,
|
|
61
|
+
options?: QueryHookOptions<
|
|
62
|
+
LlmEvalsListSuiteLeaderboardRunsQueryData,
|
|
63
|
+
LlmEvalsListSuiteLeaderboardRunsQueryError
|
|
64
|
+
>,
|
|
65
|
+
): UseQueryResult<
|
|
66
|
+
LlmEvalsListSuiteLeaderboardRunsQueryData,
|
|
67
|
+
LlmEvalsListSuiteLeaderboardRunsQueryError
|
|
68
|
+
> {
|
|
69
|
+
const client = useSDKContext();
|
|
70
|
+
return useQuery({
|
|
71
|
+
...buildLlmEvalsListSuiteLeaderboardRunsQuery(
|
|
72
|
+
client,
|
|
73
|
+
request,
|
|
74
|
+
options,
|
|
75
|
+
),
|
|
76
|
+
...options,
|
|
77
|
+
});
|
|
78
|
+
}
|
|
79
|
+
|
|
80
|
+
/**
|
|
81
|
+
* List leaderboard runs for an eval suite
|
|
82
|
+
*
|
|
83
|
+
* @remarks
|
|
84
|
+
* Returns each ranking group's most recent completed runs for a suite in one request, with the group assignments in `groups`. A group is (model, targeted task) for task_ids-restricted runs and (model) for unrestricted runs (task_id null). Build boards from `groups`, not from run.models/run.task_ids — a returned run may name models or tasks whose groups it did not rank in. `truncated: true` means a server ceiling trimmed the aggregate; whole runs are kept in (best rank, first model, first task, id) order, so every group's newest runs survive before any group's fallbacks and no group is dropped for being old. Resume a truncated board by passing `next_cursor` back as `cursor` and unioning the responses. See the evals docs for grouping rationale and cost characteristics.
|
|
85
|
+
*/
|
|
86
|
+
export function useLlmEvalsListSuiteLeaderboardRunsSuspense(
|
|
87
|
+
request: operations.ListEvalSuiteLeaderboardRunsRequest,
|
|
88
|
+
options?: SuspenseQueryHookOptions<
|
|
89
|
+
LlmEvalsListSuiteLeaderboardRunsQueryData,
|
|
90
|
+
LlmEvalsListSuiteLeaderboardRunsQueryError
|
|
91
|
+
>,
|
|
92
|
+
): UseSuspenseQueryResult<
|
|
93
|
+
LlmEvalsListSuiteLeaderboardRunsQueryData,
|
|
94
|
+
LlmEvalsListSuiteLeaderboardRunsQueryError
|
|
95
|
+
> {
|
|
96
|
+
const client = useSDKContext();
|
|
97
|
+
return useSuspenseQuery({
|
|
98
|
+
...buildLlmEvalsListSuiteLeaderboardRunsQuery(
|
|
99
|
+
client,
|
|
100
|
+
request,
|
|
101
|
+
options,
|
|
102
|
+
),
|
|
103
|
+
...options,
|
|
104
|
+
});
|
|
105
|
+
}
|
|
106
|
+
|
|
107
|
+
export function setLlmEvalsListSuiteLeaderboardRunsData(
|
|
108
|
+
client: QueryClient,
|
|
109
|
+
queryKeyBase: [
|
|
110
|
+
suiteId: string,
|
|
111
|
+
parameters: {
|
|
112
|
+
suiteVersion?: number | undefined;
|
|
113
|
+
perGroup?: number | undefined;
|
|
114
|
+
model?: string | undefined;
|
|
115
|
+
cursor?: string | undefined;
|
|
116
|
+
xOnBehalfOf?: string | undefined;
|
|
117
|
+
},
|
|
118
|
+
],
|
|
119
|
+
data: LlmEvalsListSuiteLeaderboardRunsQueryData,
|
|
120
|
+
): LlmEvalsListSuiteLeaderboardRunsQueryData | undefined {
|
|
121
|
+
const key = queryKeyLlmEvalsListSuiteLeaderboardRuns(...queryKeyBase);
|
|
122
|
+
|
|
123
|
+
return client.setQueryData<LlmEvalsListSuiteLeaderboardRunsQueryData>(
|
|
124
|
+
key,
|
|
125
|
+
data,
|
|
126
|
+
);
|
|
127
|
+
}
|
|
128
|
+
|
|
129
|
+
export function invalidateLlmEvalsListSuiteLeaderboardRuns(
|
|
130
|
+
client: QueryClient,
|
|
131
|
+
queryKeyBase: TupleToPrefixes<
|
|
132
|
+
[
|
|
133
|
+
suiteId: string,
|
|
134
|
+
parameters: {
|
|
135
|
+
suiteVersion?: number | undefined;
|
|
136
|
+
perGroup?: number | undefined;
|
|
137
|
+
model?: string | undefined;
|
|
138
|
+
cursor?: string | undefined;
|
|
139
|
+
xOnBehalfOf?: string | undefined;
|
|
140
|
+
},
|
|
141
|
+
]
|
|
142
|
+
>,
|
|
143
|
+
filters?: Omit<InvalidateQueryFilters, "queryKey" | "predicate" | "exact">,
|
|
144
|
+
): Promise<void> {
|
|
145
|
+
return client.invalidateQueries({
|
|
146
|
+
...filters,
|
|
147
|
+
queryKey: [
|
|
148
|
+
"@meetkai/mka1",
|
|
149
|
+
"evals",
|
|
150
|
+
"listSuiteLeaderboardRuns",
|
|
151
|
+
...queryKeyBase,
|
|
152
|
+
],
|
|
153
|
+
});
|
|
154
|
+
}
|
|
155
|
+
|
|
156
|
+
export function invalidateAllLlmEvalsListSuiteLeaderboardRuns(
|
|
157
|
+
client: QueryClient,
|
|
158
|
+
filters?: Omit<InvalidateQueryFilters, "queryKey" | "predicate" | "exact">,
|
|
159
|
+
): Promise<void> {
|
|
160
|
+
return client.invalidateQueries({
|
|
161
|
+
...filters,
|
|
162
|
+
queryKey: ["@meetkai/mka1", "evals", "listSuiteLeaderboardRuns"],
|
|
163
|
+
});
|
|
164
|
+
}
|
package/src/sdk/evals.ts
CHANGED
|
@@ -21,6 +21,7 @@ import { llmEvalsListRuns } from "../funcs/llmEvalsListRuns.js";
|
|
|
21
21
|
import { llmEvalsListSamples } from "../funcs/llmEvalsListSamples.js";
|
|
22
22
|
import { llmEvalsListScheduleRuns } from "../funcs/llmEvalsListScheduleRuns.js";
|
|
23
23
|
import { llmEvalsListSchedules } from "../funcs/llmEvalsListSchedules.js";
|
|
24
|
+
import { llmEvalsListSuiteLeaderboardRuns } from "../funcs/llmEvalsListSuiteLeaderboardRuns.js";
|
|
24
25
|
import { llmEvalsListSuites } from "../funcs/llmEvalsListSuites.js";
|
|
25
26
|
import { llmEvalsListSuiteVersions } from "../funcs/llmEvalsListSuiteVersions.js";
|
|
26
27
|
import { llmEvalsRerunFailedSamples } from "../funcs/llmEvalsRerunFailedSamples.js";
|
|
@@ -152,6 +153,23 @@ export class Evals extends ClientSDK {
|
|
|
152
153
|
));
|
|
153
154
|
}
|
|
154
155
|
|
|
156
|
+
/**
|
|
157
|
+
* List leaderboard runs for an eval suite
|
|
158
|
+
*
|
|
159
|
+
* @remarks
|
|
160
|
+
* Returns each ranking group's most recent completed runs for a suite in one request, with the group assignments in `groups`. A group is (model, targeted task) for task_ids-restricted runs and (model) for unrestricted runs (task_id null). Build boards from `groups`, not from run.models/run.task_ids — a returned run may name models or tasks whose groups it did not rank in. `truncated: true` means a server ceiling trimmed the aggregate; whole runs are kept in (best rank, first model, first task, id) order, so every group's newest runs survive before any group's fallbacks and no group is dropped for being old. Resume a truncated board by passing `next_cursor` back as `cursor` and unioning the responses. See the evals docs for grouping rationale and cost characteristics.
|
|
161
|
+
*/
|
|
162
|
+
async listSuiteLeaderboardRuns(
|
|
163
|
+
request: operations.ListEvalSuiteLeaderboardRunsRequest,
|
|
164
|
+
options?: RequestOptions,
|
|
165
|
+
): Promise<operations.ListEvalSuiteLeaderboardRunsResponseBody> {
|
|
166
|
+
return unwrapAsync(llmEvalsListSuiteLeaderboardRuns(
|
|
167
|
+
this,
|
|
168
|
+
request,
|
|
169
|
+
options,
|
|
170
|
+
));
|
|
171
|
+
}
|
|
172
|
+
|
|
155
173
|
/**
|
|
156
174
|
* Create an eval run
|
|
157
175
|
*
|