@atlanai/sdk 0.1.1 → 0.2.1
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/README.md +32 -0
- package/dist/client.js +3 -1
- package/dist/evals.d.ts +46 -0
- package/dist/evals.js +230 -0
- package/dist/index.d.ts +3 -0
- package/dist/index.js +8 -1
- package/dist/manifest.json +299 -3
- package/dist/raw/eval/apis/DatasetsApi.d.ts +304 -0
- package/dist/raw/eval/apis/DatasetsApi.js +706 -0
- package/dist/raw/eval/apis/ExperimentsApi.d.ts +371 -0
- package/dist/raw/eval/apis/ExperimentsApi.js +869 -0
- package/dist/raw/eval/apis/ScorersApi.d.ts +129 -0
- package/dist/raw/eval/apis/ScorersApi.js +308 -0
- package/dist/raw/eval/apis/index.d.ts +3 -0
- package/dist/raw/eval/apis/index.js +21 -0
- package/dist/raw/eval/index.d.ts +3 -0
- package/dist/raw/eval/index.js +21 -0
- package/dist/raw/eval/models/AccessView.d.ts +57 -0
- package/dist/raw/eval/models/AccessView.js +64 -0
- package/dist/raw/eval/models/ArtifactConflictProblem.d.ts +69 -0
- package/dist/raw/eval/models/ArtifactConflictProblem.js +66 -0
- package/dist/raw/eval/models/CostView.d.ts +50 -0
- package/dist/raw/eval/models/CostView.js +60 -0
- package/dist/raw/eval/models/CursorPage.d.ts +38 -0
- package/dist/raw/eval/models/CursorPage.js +52 -0
- package/dist/raw/eval/models/EvalArtifactEnvelope.d.ts +144 -0
- package/dist/raw/eval/models/EvalArtifactEnvelope.js +84 -0
- package/dist/raw/eval/models/EvalArtifactSearchRequest.d.ts +71 -0
- package/dist/raw/eval/models/EvalArtifactSearchRequest.js +60 -0
- package/dist/raw/eval/models/EvalBulkDatasetRecordResponse.d.ts +33 -0
- package/dist/raw/eval/models/EvalBulkDatasetRecordResponse.js +51 -0
- package/dist/raw/eval/models/EvalBulkDatasetRecordResult.d.ts +52 -0
- package/dist/raw/eval/models/EvalBulkDatasetRecordResult.js +60 -0
- package/dist/raw/eval/models/EvalBulkExperimentResultResponse.d.ts +33 -0
- package/dist/raw/eval/models/EvalBulkExperimentResultResponse.js +51 -0
- package/dist/raw/eval/models/EvalBulkExperimentResultSlot.d.ts +53 -0
- package/dist/raw/eval/models/EvalBulkExperimentResultSlot.js +60 -0
- package/dist/raw/eval/models/EvalCreateDataset400Response.d.ts +65 -0
- package/dist/raw/eval/models/EvalCreateDataset400Response.js +75 -0
- package/dist/raw/eval/models/EvalCreateDataset409Response.d.ts +63 -0
- package/dist/raw/eval/models/EvalCreateDataset409Response.js +75 -0
- package/dist/raw/eval/models/EvalCreateDataset413Response.d.ts +64 -0
- package/dist/raw/eval/models/EvalCreateDataset413Response.js +74 -0
- package/dist/raw/eval/models/EvalCreateDataset415Response.d.ts +64 -0
- package/dist/raw/eval/models/EvalCreateDataset415Response.js +74 -0
- package/dist/raw/eval/models/EvalCreateDataset422Response.d.ts +63 -0
- package/dist/raw/eval/models/EvalCreateDataset422Response.js +75 -0
- package/dist/raw/eval/models/EvalDatasetArtifactView.d.ts +277 -0
- package/dist/raw/eval/models/EvalDatasetArtifactView.js +146 -0
- package/dist/raw/eval/models/EvalDatasetCreate.d.ts +150 -0
- package/dist/raw/eval/models/EvalDatasetCreate.js +86 -0
- package/dist/raw/eval/models/EvalDatasetMeta.d.ts +46 -0
- package/dist/raw/eval/models/EvalDatasetMeta.js +48 -0
- package/dist/raw/eval/models/EvalDatasetPatch.d.ts +52 -0
- package/dist/raw/eval/models/EvalDatasetPatch.js +54 -0
- package/dist/raw/eval/models/EvalDatasetRecordArtifactView.d.ts +330 -0
- package/dist/raw/eval/models/EvalDatasetRecordArtifactView.js +161 -0
- package/dist/raw/eval/models/EvalDatasetRecordBulkCreate.d.ts +33 -0
- package/dist/raw/eval/models/EvalDatasetRecordBulkCreate.js +51 -0
- package/dist/raw/eval/models/EvalDatasetRecordCreate.d.ts +195 -0
- package/dist/raw/eval/models/EvalDatasetRecordCreate.js +101 -0
- package/dist/raw/eval/models/EvalDatasetRecordMeta.d.ts +96 -0
- package/dist/raw/eval/models/EvalDatasetRecordMeta.js +67 -0
- package/dist/raw/eval/models/EvalDatasetRecordPatch.d.ts +81 -0
- package/dist/raw/eval/models/EvalDatasetRecordPatch.js +62 -0
- package/dist/raw/eval/models/EvalExperimentArtifactView.d.ts +320 -0
- package/dist/raw/eval/models/EvalExperimentArtifactView.js +160 -0
- package/dist/raw/eval/models/EvalExperimentCreate.d.ts +193 -0
- package/dist/raw/eval/models/EvalExperimentCreate.js +100 -0
- package/dist/raw/eval/models/EvalExperimentMeta.d.ts +91 -0
- package/dist/raw/eval/models/EvalExperimentMeta.js +62 -0
- package/dist/raw/eval/models/EvalExperimentPatch.d.ts +63 -0
- package/dist/raw/eval/models/EvalExperimentPatch.js +57 -0
- package/dist/raw/eval/models/EvalExperimentResultArtifactView.d.ts +330 -0
- package/dist/raw/eval/models/EvalExperimentResultArtifactView.js +162 -0
- package/dist/raw/eval/models/EvalExperimentResultBulkCreate.d.ts +33 -0
- package/dist/raw/eval/models/EvalExperimentResultBulkCreate.js +51 -0
- package/dist/raw/eval/models/EvalExperimentResultCreate.d.ts +197 -0
- package/dist/raw/eval/models/EvalExperimentResultCreate.js +100 -0
- package/dist/raw/eval/models/EvalExperimentResultMeta.d.ts +102 -0
- package/dist/raw/eval/models/EvalExperimentResultMeta.js +66 -0
- package/dist/raw/eval/models/EvalExperimentStatus.d.ts +31 -0
- package/dist/raw/eval/models/EvalExperimentStatus.js +59 -0
- package/dist/raw/eval/models/EvalGetDataset404Response.d.ts +63 -0
- package/dist/raw/eval/models/EvalGetDataset404Response.js +75 -0
- package/dist/raw/eval/models/EvalGetExperimentTrace400Response.d.ts +63 -0
- package/dist/raw/eval/models/EvalGetExperimentTrace400Response.js +75 -0
- package/dist/raw/eval/models/EvalListDatasets400Response.d.ts +63 -0
- package/dist/raw/eval/models/EvalListDatasets400Response.js +75 -0
- package/dist/raw/eval/models/EvalListDatasets401Response.d.ts +79 -0
- package/dist/raw/eval/models/EvalListDatasets401Response.js +89 -0
- package/dist/raw/eval/models/EvalListDatasets403Response.d.ts +64 -0
- package/dist/raw/eval/models/EvalListDatasets403Response.js +74 -0
- package/dist/raw/eval/models/EvalListDatasets500Response.d.ts +63 -0
- package/dist/raw/eval/models/EvalListDatasets500Response.js +75 -0
- package/dist/raw/eval/models/EvalListDatasets503Response.d.ts +64 -0
- package/dist/raw/eval/models/EvalListDatasets503Response.js +74 -0
- package/dist/raw/eval/models/EvalListDatasets504Response.d.ts +63 -0
- package/dist/raw/eval/models/EvalListDatasets504Response.js +75 -0
- package/dist/raw/eval/models/EvalPageDatasetArtifactView.d.ts +44 -0
- package/dist/raw/eval/models/EvalPageDatasetArtifactView.js +56 -0
- package/dist/raw/eval/models/EvalPageDatasetRecordArtifactView.d.ts +44 -0
- package/dist/raw/eval/models/EvalPageDatasetRecordArtifactView.js +56 -0
- package/dist/raw/eval/models/EvalPageExperimentArtifactView.d.ts +44 -0
- package/dist/raw/eval/models/EvalPageExperimentArtifactView.js +56 -0
- package/dist/raw/eval/models/EvalPageExperimentResultArtifactView.d.ts +44 -0
- package/dist/raw/eval/models/EvalPageExperimentResultArtifactView.js +56 -0
- package/dist/raw/eval/models/EvalPageScorerArtifactView.d.ts +44 -0
- package/dist/raw/eval/models/EvalPageScorerArtifactView.js +56 -0
- package/dist/raw/eval/models/EvalPatchDataset412Response.d.ts +63 -0
- package/dist/raw/eval/models/EvalPatchDataset412Response.js +75 -0
- package/dist/raw/eval/models/EvalRecordSource.d.ts +27 -0
- package/dist/raw/eval/models/EvalRecordSource.js +55 -0
- package/dist/raw/eval/models/EvalScorerArtifactView.d.ts +301 -0
- package/dist/raw/eval/models/EvalScorerArtifactView.js +154 -0
- package/dist/raw/eval/models/EvalScorerCreate.d.ts +172 -0
- package/dist/raw/eval/models/EvalScorerCreate.js +98 -0
- package/dist/raw/eval/models/EvalScorerKind.d.ts +32 -0
- package/dist/raw/eval/models/EvalScorerKind.js +60 -0
- package/dist/raw/eval/models/EvalScorerMeta.d.ts +67 -0
- package/dist/raw/eval/models/EvalScorerMeta.js +60 -0
- package/dist/raw/eval/models/EvalScorerPatch.d.ts +75 -0
- package/dist/raw/eval/models/EvalScorerPatch.js +56 -0
- package/dist/raw/eval/models/EvalScorerScope.d.ts +32 -0
- package/dist/raw/eval/models/EvalScorerScope.js +60 -0
- package/dist/raw/eval/models/EvalSubjectKind.d.ts +33 -0
- package/dist/raw/eval/models/EvalSubjectKind.js +61 -0
- package/dist/raw/eval/models/GatewayArtifactBase.d.ts +250 -0
- package/dist/raw/eval/models/GatewayArtifactBase.js +139 -0
- package/dist/raw/eval/models/GatewayArtifactIdentityRevealView.d.ts +60 -0
- package/dist/raw/eval/models/GatewayArtifactIdentityRevealView.js +58 -0
- package/dist/raw/eval/models/GatewayPageMeta.d.ts +46 -0
- package/dist/raw/eval/models/GatewayPageMeta.js +58 -0
- package/dist/raw/eval/models/GatewaySourceEnvelope.d.ts +106 -0
- package/dist/raw/eval/models/GatewaySourceEnvelope.js +66 -0
- package/dist/raw/eval/models/GatewayTraceStatsBucket.d.ts +25 -0
- package/dist/raw/eval/models/GatewayTraceStatsBucket.js +53 -0
- package/dist/raw/eval/models/GatewayTraceStatsCompareMode.d.ts +25 -0
- package/dist/raw/eval/models/GatewayTraceStatsCompareMode.js +53 -0
- package/dist/raw/eval/models/GatewayTraceStatsComparison.d.ts +45 -0
- package/dist/raw/eval/models/GatewayTraceStatsComparison.js +59 -0
- package/dist/raw/eval/models/GatewayTraceStatsData.d.ts +24 -0
- package/dist/raw/eval/models/GatewayTraceStatsData.js +64 -0
- package/dist/raw/eval/models/GatewayTraceStatsDataOneOf.d.ts +46 -0
- package/dist/raw/eval/models/GatewayTraceStatsDataOneOf.js +66 -0
- package/dist/raw/eval/models/GatewayTraceStatsDataOneOf1.d.ts +53 -0
- package/dist/raw/eval/models/GatewayTraceStatsDataOneOf1.js +71 -0
- package/dist/raw/eval/models/GatewayTraceStatsDataOneOf2.d.ts +46 -0
- package/dist/raw/eval/models/GatewayTraceStatsDataOneOf2.js +66 -0
- package/dist/raw/eval/models/GatewayTraceStatsEnvelope.d.ts +50 -0
- package/dist/raw/eval/models/GatewayTraceStatsEnvelope.js +59 -0
- package/dist/raw/eval/models/GatewayTraceStatsFilter.d.ts +47 -0
- package/dist/raw/eval/models/GatewayTraceStatsFilter.js +59 -0
- package/dist/raw/eval/models/GatewayTraceStatsFilterOperator.d.ts +28 -0
- package/dist/raw/eval/models/GatewayTraceStatsFilterOperator.js +56 -0
- package/dist/raw/eval/models/GatewayTraceStatsFilterValue.d.ts +21 -0
- package/dist/raw/eval/models/GatewayTraceStatsFilterValue.js +85 -0
- package/dist/raw/eval/models/GatewayTraceStatsGroupBy.d.ts +35 -0
- package/dist/raw/eval/models/GatewayTraceStatsGroupBy.js +63 -0
- package/dist/raw/eval/models/GatewayTraceStatsMeasure.d.ts +39 -0
- package/dist/raw/eval/models/GatewayTraceStatsMeasure.js +67 -0
- package/dist/raw/eval/models/GatewayTraceStatsMeta.d.ts +49 -0
- package/dist/raw/eval/models/GatewayTraceStatsMeta.js +53 -0
- package/dist/raw/eval/models/GatewayTraceStatsOrder.d.ts +40 -0
- package/dist/raw/eval/models/GatewayTraceStatsOrder.js +56 -0
- package/dist/raw/eval/models/GatewayTraceStatsOrderBy.d.ts +25 -0
- package/dist/raw/eval/models/GatewayTraceStatsOrderBy.js +53 -0
- package/dist/raw/eval/models/GatewayTraceStatsOrderDirection.d.ts +25 -0
- package/dist/raw/eval/models/GatewayTraceStatsOrderDirection.js +53 -0
- package/dist/raw/eval/models/GatewayTraceStatsPanelQuery.d.ts +69 -0
- package/dist/raw/eval/models/GatewayTraceStatsPanelQuery.js +66 -0
- package/dist/raw/eval/models/GatewayTraceStatsRequest.d.ts +80 -0
- package/dist/raw/eval/models/GatewayTraceStatsRequest.js +72 -0
- package/dist/raw/eval/models/GatewayTraceStatsRequestType.d.ts +26 -0
- package/dist/raw/eval/models/GatewayTraceStatsRequestType.js +54 -0
- package/dist/raw/eval/models/GatewayTraceStatsScalarResult.d.ts +52 -0
- package/dist/raw/eval/models/GatewayTraceStatsScalarResult.js +59 -0
- package/dist/raw/eval/models/GatewayTraceStatsSeries.d.ts +52 -0
- package/dist/raw/eval/models/GatewayTraceStatsSeries.js +62 -0
- package/dist/raw/eval/models/GatewayTraceStatsSeriesPoint.d.ts +38 -0
- package/dist/raw/eval/models/GatewayTraceStatsSeriesPoint.js +52 -0
- package/dist/raw/eval/models/GatewayTraceStatsTableColumn.d.ts +45 -0
- package/dist/raw/eval/models/GatewayTraceStatsTableColumn.js +57 -0
- package/dist/raw/eval/models/GatewayTraceStatsTableColumnType.d.ts +25 -0
- package/dist/raw/eval/models/GatewayTraceStatsTableColumnType.js +53 -0
- package/dist/raw/eval/models/GatewayTraceStatsTableRow.d.ts +38 -0
- package/dist/raw/eval/models/GatewayTraceStatsTableRow.js +54 -0
- package/dist/raw/eval/models/GatewayTraceStatsWindow.d.ts +38 -0
- package/dist/raw/eval/models/GatewayTraceStatsWindow.js +54 -0
- package/dist/raw/eval/models/ProblemDetails.d.ts +76 -0
- package/dist/raw/eval/models/ProblemDetails.js +64 -0
- package/dist/raw/eval/models/RegistryEdgeTarget.d.ts +38 -0
- package/dist/raw/eval/models/RegistryEdgeTarget.js +54 -0
- package/dist/raw/eval/models/RegistryRelationshipEdge.d.ts +96 -0
- package/dist/raw/eval/models/RegistryRelationshipEdge.js +77 -0
- package/dist/raw/eval/models/RegistryRelationshipsView.d.ts +45 -0
- package/dist/raw/eval/models/RegistryRelationshipsView.js +59 -0
- package/dist/raw/eval/models/SpanListEnvelope.d.ts +40 -0
- package/dist/raw/eval/models/SpanListEnvelope.js +56 -0
- package/dist/raw/eval/models/SpanViewDto.d.ts +192 -0
- package/dist/raw/eval/models/SpanViewDto.js +117 -0
- package/dist/raw/eval/models/TraceDetailView.d.ts +177 -0
- package/dist/raw/eval/models/TraceDetailView.js +108 -0
- package/dist/raw/eval/models/TraceLinks.d.ts +45 -0
- package/dist/raw/eval/models/TraceLinks.js +58 -0
- package/dist/raw/eval/models/TraceListEnvelope.d.ts +47 -0
- package/dist/raw/eval/models/TraceListEnvelope.js +61 -0
- package/dist/raw/eval/models/TraceParentView.d.ts +68 -0
- package/dist/raw/eval/models/TraceParentView.js +64 -0
- package/dist/raw/eval/models/TraceStatus.d.ts +26 -0
- package/dist/raw/eval/models/TraceStatus.js +54 -0
- package/dist/raw/eval/models/TraceSummaryStats.d.ts +62 -0
- package/dist/raw/eval/models/TraceSummaryStats.js +62 -0
- package/dist/raw/eval/models/TraceSummaryView.d.ts +150 -0
- package/dist/raw/eval/models/TraceSummaryView.js +96 -0
- package/dist/raw/eval/models/UsageView.d.ts +56 -0
- package/dist/raw/eval/models/UsageView.js +66 -0
- package/dist/raw/eval/models/index.d.ts +100 -0
- package/dist/raw/eval/models/index.js +118 -0
- package/dist/raw/eval/runtime.d.ts +185 -0
- package/dist/raw/eval/runtime.js +369 -0
- package/dist/resources.json +307 -0
- package/dist/tracing/client.js +6 -4
- package/dist/tracing/propagation.d.ts +1 -0
- package/dist/tracing/propagation.js +7 -0
- package/dist/tracing/semconv.d.ts +8 -1
- package/dist/tracing/semconv.js +27 -13
- package/dist/tracing/spans.d.ts +8 -4
- package/dist/tracing/spans.js +28 -13
- package/dist/tracing/version.d.ts +1 -1
- package/dist/tracing/version.js +1 -1
- package/package.json +1 -1
|
@@ -0,0 +1,371 @@
|
|
|
1
|
+
/**
|
|
2
|
+
* Evaluation catalog
|
|
3
|
+
* The evaluation loop as registry artifacts: curated `dataset`s of examples pinned from production sessions and traces, `experiment` run snapshots with create-only per-case `experiment_result`s, and versioned `scorer` definitions. A verdict is a score span in the run\'s trace; `POST /experiments/{id}/summarize` rolls a run\'s score spans into its durable `summary`. The gateway executes and scores nothing — external harnesses, CI, and judges run the evals, emit score spans, and upload results here.
|
|
4
|
+
*
|
|
5
|
+
* The version of the OpenAPI document: 0.1.0
|
|
6
|
+
*
|
|
7
|
+
*
|
|
8
|
+
* NOTE: This class is auto generated by OpenAPI Generator (https://openapi-generator.tech).
|
|
9
|
+
* https://openapi-generator.tech
|
|
10
|
+
* Do not edit the class manually.
|
|
11
|
+
*/
|
|
12
|
+
import * as runtime from '../runtime';
|
|
13
|
+
import { type EvalArtifactSearchRequest } from '../models/EvalArtifactSearchRequest';
|
|
14
|
+
import { type EvalBulkExperimentResultResponse } from '../models/EvalBulkExperimentResultResponse';
|
|
15
|
+
import { type EvalExperimentArtifactView } from '../models/EvalExperimentArtifactView';
|
|
16
|
+
import { type EvalExperimentCreate } from '../models/EvalExperimentCreate';
|
|
17
|
+
import { type EvalExperimentPatch } from '../models/EvalExperimentPatch';
|
|
18
|
+
import { type EvalExperimentResultArtifactView } from '../models/EvalExperimentResultArtifactView';
|
|
19
|
+
import { type EvalExperimentResultBulkCreate } from '../models/EvalExperimentResultBulkCreate';
|
|
20
|
+
import { type EvalExperimentResultCreate } from '../models/EvalExperimentResultCreate';
|
|
21
|
+
import { type EvalExperimentStatus } from '../models/EvalExperimentStatus';
|
|
22
|
+
import { type EvalPageExperimentArtifactView } from '../models/EvalPageExperimentArtifactView';
|
|
23
|
+
import { type EvalPageExperimentResultArtifactView } from '../models/EvalPageExperimentResultArtifactView';
|
|
24
|
+
import { type EvalSubjectKind } from '../models/EvalSubjectKind';
|
|
25
|
+
import { type GatewayTraceStatsEnvelope } from '../models/GatewayTraceStatsEnvelope';
|
|
26
|
+
import { type GatewayTraceStatsRequest } from '../models/GatewayTraceStatsRequest';
|
|
27
|
+
import { type SpanListEnvelope } from '../models/SpanListEnvelope';
|
|
28
|
+
import { type TraceDetailView } from '../models/TraceDetailView';
|
|
29
|
+
import { type TraceListEnvelope } from '../models/TraceListEnvelope';
|
|
30
|
+
export interface EvalArchiveExperimentRequest {
|
|
31
|
+
experimentId: string;
|
|
32
|
+
}
|
|
33
|
+
export interface EvalCreateExperimentRequest {
|
|
34
|
+
evalExperimentCreate: EvalExperimentCreate;
|
|
35
|
+
contentEncoding?: EvalCreateExperimentContentEncodingEnum;
|
|
36
|
+
}
|
|
37
|
+
export interface EvalCreateExperimentResultRequest {
|
|
38
|
+
experimentId: string;
|
|
39
|
+
evalExperimentResultCreate: EvalExperimentResultCreate;
|
|
40
|
+
contentEncoding?: EvalCreateExperimentResultContentEncodingEnum;
|
|
41
|
+
}
|
|
42
|
+
export interface EvalCreateExperimentResultsBulkRequest {
|
|
43
|
+
experimentId: string;
|
|
44
|
+
evalExperimentResultBulkCreate: EvalExperimentResultBulkCreate;
|
|
45
|
+
contentEncoding?: EvalCreateExperimentResultsBulkContentEncodingEnum;
|
|
46
|
+
}
|
|
47
|
+
export interface EvalGetExperimentRequest {
|
|
48
|
+
experimentId: string;
|
|
49
|
+
}
|
|
50
|
+
export interface EvalGetExperimentResultRequest {
|
|
51
|
+
experimentId: string;
|
|
52
|
+
resultId: string;
|
|
53
|
+
}
|
|
54
|
+
export interface EvalGetExperimentTraceRequest {
|
|
55
|
+
experimentId: string;
|
|
56
|
+
traceId: string;
|
|
57
|
+
}
|
|
58
|
+
export interface EvalListExperimentResultsRequest {
|
|
59
|
+
experimentId: string;
|
|
60
|
+
limit?: number;
|
|
61
|
+
offset?: number;
|
|
62
|
+
datasetRecordId?: string;
|
|
63
|
+
sessionId?: string;
|
|
64
|
+
sort?: string;
|
|
65
|
+
}
|
|
66
|
+
export interface EvalListExperimentTraceSpansRequest {
|
|
67
|
+
experimentId: string;
|
|
68
|
+
traceId: string;
|
|
69
|
+
limit?: number;
|
|
70
|
+
cursor?: string;
|
|
71
|
+
fields?: string;
|
|
72
|
+
}
|
|
73
|
+
export interface EvalListExperimentTracesRequest {
|
|
74
|
+
experimentId: string;
|
|
75
|
+
startTimeUnixSeconds?: number;
|
|
76
|
+
endTimeUnixSeconds?: number;
|
|
77
|
+
limit?: number;
|
|
78
|
+
cursor?: string;
|
|
79
|
+
sort?: string;
|
|
80
|
+
}
|
|
81
|
+
export interface EvalListExperimentsRequest {
|
|
82
|
+
limit?: number;
|
|
83
|
+
offset?: number;
|
|
84
|
+
datasetId?: string;
|
|
85
|
+
subjectKind?: EvalSubjectKind;
|
|
86
|
+
subjectId?: string;
|
|
87
|
+
experimentStatus?: EvalExperimentStatus;
|
|
88
|
+
baselineExperimentId?: string;
|
|
89
|
+
config?: string;
|
|
90
|
+
sort?: string;
|
|
91
|
+
}
|
|
92
|
+
export interface EvalPatchExperimentRequest {
|
|
93
|
+
experimentId: string;
|
|
94
|
+
evalExperimentPatch: EvalExperimentPatch;
|
|
95
|
+
contentEncoding?: EvalPatchExperimentContentEncodingEnum;
|
|
96
|
+
}
|
|
97
|
+
export interface EvalQueryExperimentTraceStatsRequest {
|
|
98
|
+
experimentId: string;
|
|
99
|
+
gatewayTraceStatsRequest: GatewayTraceStatsRequest;
|
|
100
|
+
contentEncoding?: EvalQueryExperimentTraceStatsContentEncodingEnum;
|
|
101
|
+
}
|
|
102
|
+
export interface EvalSearchExperimentsRequest {
|
|
103
|
+
evalArtifactSearchRequest: EvalArtifactSearchRequest;
|
|
104
|
+
contentEncoding?: EvalSearchExperimentsContentEncodingEnum;
|
|
105
|
+
}
|
|
106
|
+
export interface EvalSummarizeExperimentRequest {
|
|
107
|
+
experimentId: string;
|
|
108
|
+
}
|
|
109
|
+
/**
|
|
110
|
+
*
|
|
111
|
+
*/
|
|
112
|
+
export declare class ExperimentsApi extends runtime.BaseAPI {
|
|
113
|
+
/**
|
|
114
|
+
* Creates request options for evalArchiveExperiment without sending the request
|
|
115
|
+
*/
|
|
116
|
+
evalArchiveExperimentRequestOpts(requestParameters: EvalArchiveExperimentRequest): Promise<runtime.RequestOpts>;
|
|
117
|
+
/**
|
|
118
|
+
* Soft-delete the experiment and cascade its results. Housekeeping for runs that no longer matter; a completed experiment you still cite should stay.
|
|
119
|
+
* Archive an experiment
|
|
120
|
+
*/
|
|
121
|
+
evalArchiveExperimentRaw(requestParameters: EvalArchiveExperimentRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<runtime.ApiResponse<EvalExperimentArtifactView>>;
|
|
122
|
+
/**
|
|
123
|
+
* Soft-delete the experiment and cascade its results. Housekeeping for runs that no longer matter; a completed experiment you still cite should stay.
|
|
124
|
+
* Archive an experiment
|
|
125
|
+
*/
|
|
126
|
+
evalArchiveExperiment(requestParameters: EvalArchiveExperimentRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<EvalExperimentArtifactView>;
|
|
127
|
+
/**
|
|
128
|
+
* Creates request options for evalCreateExperiment without sending the request
|
|
129
|
+
*/
|
|
130
|
+
evalCreateExperimentRequestOpts(requestParameters: EvalCreateExperimentRequest): Promise<runtime.RequestOpts>;
|
|
131
|
+
/**
|
|
132
|
+
* Record the start of an evaluation run: the subject under test (an agent, harness, or skill), the dataset, the configuration, and optionally the baseline it is compared against. The gateway does not execute anything — your runner or CI executes the cases and uploads results here. Created `running` by default; upload results, then finalize with one PATCH to `completed` carrying the score summary.
|
|
133
|
+
* Create an experiment
|
|
134
|
+
*/
|
|
135
|
+
evalCreateExperimentRaw(requestParameters: EvalCreateExperimentRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<runtime.ApiResponse<EvalExperimentArtifactView>>;
|
|
136
|
+
/**
|
|
137
|
+
* Record the start of an evaluation run: the subject under test (an agent, harness, or skill), the dataset, the configuration, and optionally the baseline it is compared against. The gateway does not execute anything — your runner or CI executes the cases and uploads results here. Created `running` by default; upload results, then finalize with one PATCH to `completed` carrying the score summary.
|
|
138
|
+
* Create an experiment
|
|
139
|
+
*/
|
|
140
|
+
evalCreateExperiment(requestParameters: EvalCreateExperimentRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<EvalExperimentArtifactView>;
|
|
141
|
+
/**
|
|
142
|
+
* Creates request options for evalCreateExperimentResult without sending the request
|
|
143
|
+
*/
|
|
144
|
+
evalCreateExperimentResultRequestOpts(requestParameters: EvalCreateExperimentResultRequest): Promise<runtime.RequestOpts>;
|
|
145
|
+
/**
|
|
146
|
+
* Append one case\'s result to a running experiment. The parent comes from the path, so `experiment_id` is not a body field. **Create-only**: a result is reported, not edited, and a completed or failed experiment accepts no further results — that is what makes a finished experiment an immutable snapshot. `input`/`expected` are snapshot copies taken at run time, so later dataset curation cannot rewrite what this case actually ran.
|
|
147
|
+
* Report one evaluated case
|
|
148
|
+
*/
|
|
149
|
+
evalCreateExperimentResultRaw(requestParameters: EvalCreateExperimentResultRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<runtime.ApiResponse<EvalExperimentResultArtifactView>>;
|
|
150
|
+
/**
|
|
151
|
+
* Append one case\'s result to a running experiment. The parent comes from the path, so `experiment_id` is not a body field. **Create-only**: a result is reported, not edited, and a completed or failed experiment accepts no further results — that is what makes a finished experiment an immutable snapshot. `input`/`expected` are snapshot copies taken at run time, so later dataset curation cannot rewrite what this case actually ran.
|
|
152
|
+
* Report one evaluated case
|
|
153
|
+
*/
|
|
154
|
+
evalCreateExperimentResult(requestParameters: EvalCreateExperimentResultRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<EvalExperimentResultArtifactView>;
|
|
155
|
+
/**
|
|
156
|
+
* Creates request options for evalCreateExperimentResultsBulk without sending the request
|
|
157
|
+
*/
|
|
158
|
+
evalCreateExperimentResultsBulkRequestOpts(requestParameters: EvalCreateExperimentResultsBulkRequest): Promise<runtime.RequestOpts>;
|
|
159
|
+
/**
|
|
160
|
+
* Create up to 100 results in one call — how a runner reports as cases finish. **207 Multi-Status**: one index-aligned slot per submitted item, so a single rejected case does not fail the batch.
|
|
161
|
+
* Report many evaluated cases
|
|
162
|
+
*/
|
|
163
|
+
evalCreateExperimentResultsBulkRaw(requestParameters: EvalCreateExperimentResultsBulkRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<runtime.ApiResponse<EvalBulkExperimentResultResponse>>;
|
|
164
|
+
/**
|
|
165
|
+
* Create up to 100 results in one call — how a runner reports as cases finish. **207 Multi-Status**: one index-aligned slot per submitted item, so a single rejected case does not fail the batch.
|
|
166
|
+
* Report many evaluated cases
|
|
167
|
+
*/
|
|
168
|
+
evalCreateExperimentResultsBulk(requestParameters: EvalCreateExperimentResultsBulkRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<EvalBulkExperimentResultResponse>;
|
|
169
|
+
/**
|
|
170
|
+
* Creates request options for evalGetExperiment without sending the request
|
|
171
|
+
*/
|
|
172
|
+
evalGetExperimentRequestOpts(requestParameters: EvalGetExperimentRequest): Promise<runtime.RequestOpts>;
|
|
173
|
+
/**
|
|
174
|
+
* Read one experiment.
|
|
175
|
+
* Get an experiment
|
|
176
|
+
*/
|
|
177
|
+
evalGetExperimentRaw(requestParameters: EvalGetExperimentRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<runtime.ApiResponse<EvalExperimentArtifactView>>;
|
|
178
|
+
/**
|
|
179
|
+
* Read one experiment.
|
|
180
|
+
* Get an experiment
|
|
181
|
+
*/
|
|
182
|
+
evalGetExperiment(requestParameters: EvalGetExperimentRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<EvalExperimentArtifactView>;
|
|
183
|
+
/**
|
|
184
|
+
* Creates request options for evalGetExperimentResult without sending the request
|
|
185
|
+
*/
|
|
186
|
+
evalGetExperimentResultRequestOpts(requestParameters: EvalGetExperimentResultRequest): Promise<runtime.RequestOpts>;
|
|
187
|
+
/**
|
|
188
|
+
* Read one evaluated case with its full typed metadata — the input/expected snapshot, the output, the scores, and the session/trace join keys. `experiment_id` addresses the result within its experiment; the result\'s own handle is what resolves it, and the path\'s experiment is **not** currently checked against the result\'s own — see the open item in eval.md.
|
|
189
|
+
* Get one result
|
|
190
|
+
*/
|
|
191
|
+
evalGetExperimentResultRaw(requestParameters: EvalGetExperimentResultRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<runtime.ApiResponse<EvalExperimentResultArtifactView>>;
|
|
192
|
+
/**
|
|
193
|
+
* Read one evaluated case with its full typed metadata — the input/expected snapshot, the output, the scores, and the session/trace join keys. `experiment_id` addresses the result within its experiment; the result\'s own handle is what resolves it, and the path\'s experiment is **not** currently checked against the result\'s own — see the open item in eval.md.
|
|
194
|
+
* Get one result
|
|
195
|
+
*/
|
|
196
|
+
evalGetExperimentResult(requestParameters: EvalGetExperimentResultRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<EvalExperimentResultArtifactView>;
|
|
197
|
+
/**
|
|
198
|
+
* Creates request options for evalGetExperimentTrace without sending the request
|
|
199
|
+
*/
|
|
200
|
+
evalGetExperimentTraceRequestOpts(requestParameters: EvalGetExperimentTraceRequest): Promise<runtime.RequestOpts>;
|
|
201
|
+
/**
|
|
202
|
+
* Use this operation to read one of an experiment\'s traces.
|
|
203
|
+
* Read one of an experiment\'s traces
|
|
204
|
+
*/
|
|
205
|
+
evalGetExperimentTraceRaw(requestParameters: EvalGetExperimentTraceRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<runtime.ApiResponse<TraceDetailView>>;
|
|
206
|
+
/**
|
|
207
|
+
* Use this operation to read one of an experiment\'s traces.
|
|
208
|
+
* Read one of an experiment\'s traces
|
|
209
|
+
*/
|
|
210
|
+
evalGetExperimentTrace(requestParameters: EvalGetExperimentTraceRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<TraceDetailView>;
|
|
211
|
+
/**
|
|
212
|
+
* Creates request options for evalListExperimentResults without sending the request
|
|
213
|
+
*/
|
|
214
|
+
evalListExperimentResultsRequestOpts(requestParameters: EvalListExperimentResultsRequest): Promise<runtime.RequestOpts>;
|
|
215
|
+
/**
|
|
216
|
+
* Page the experiment\'s evaluated cases, each with its typed metadata. Filter by `dataset_record_id` to join one case across two experiments over the same dataset.
|
|
217
|
+
* List an experiment\'s results
|
|
218
|
+
*/
|
|
219
|
+
evalListExperimentResultsRaw(requestParameters: EvalListExperimentResultsRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<runtime.ApiResponse<EvalPageExperimentResultArtifactView>>;
|
|
220
|
+
/**
|
|
221
|
+
* Page the experiment\'s evaluated cases, each with its typed metadata. Filter by `dataset_record_id` to join one case across two experiments over the same dataset.
|
|
222
|
+
* List an experiment\'s results
|
|
223
|
+
*/
|
|
224
|
+
evalListExperimentResults(requestParameters: EvalListExperimentResultsRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<EvalPageExperimentResultArtifactView>;
|
|
225
|
+
/**
|
|
226
|
+
* Creates request options for evalListExperimentTraceSpans without sending the request
|
|
227
|
+
*/
|
|
228
|
+
evalListExperimentTraceSpansRequestOpts(requestParameters: EvalListExperimentTraceSpansRequest): Promise<runtime.RequestOpts>;
|
|
229
|
+
/**
|
|
230
|
+
* Use this operation to list spans in one of an experiment\'s traces.
|
|
231
|
+
* List spans in one of an experiment\'s traces
|
|
232
|
+
*/
|
|
233
|
+
evalListExperimentTraceSpansRaw(requestParameters: EvalListExperimentTraceSpansRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<runtime.ApiResponse<SpanListEnvelope>>;
|
|
234
|
+
/**
|
|
235
|
+
* Use this operation to list spans in one of an experiment\'s traces.
|
|
236
|
+
* List spans in one of an experiment\'s traces
|
|
237
|
+
*/
|
|
238
|
+
evalListExperimentTraceSpans(requestParameters: EvalListExperimentTraceSpansRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<SpanListEnvelope>;
|
|
239
|
+
/**
|
|
240
|
+
* Creates request options for evalListExperimentTraces without sending the request
|
|
241
|
+
*/
|
|
242
|
+
evalListExperimentTracesRequestOpts(requestParameters: EvalListExperimentTracesRequest): Promise<runtime.RequestOpts>;
|
|
243
|
+
/**
|
|
244
|
+
* Page the OTel traces stamped with this experiment\'s id — every span of a bench case carries `atlan.eval.experiment_id` via SDK propagation, so a run\'s traces are findable here before any result uploads. Visible in full to every caller who can read the experiment.
|
|
245
|
+
* List an experiment\'s traces
|
|
246
|
+
*/
|
|
247
|
+
evalListExperimentTracesRaw(requestParameters: EvalListExperimentTracesRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<runtime.ApiResponse<TraceListEnvelope>>;
|
|
248
|
+
/**
|
|
249
|
+
* Page the OTel traces stamped with this experiment\'s id — every span of a bench case carries `atlan.eval.experiment_id` via SDK propagation, so a run\'s traces are findable here before any result uploads. Visible in full to every caller who can read the experiment.
|
|
250
|
+
* List an experiment\'s traces
|
|
251
|
+
*/
|
|
252
|
+
evalListExperimentTraces(requestParameters: EvalListExperimentTracesRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<TraceListEnvelope>;
|
|
253
|
+
/**
|
|
254
|
+
* Creates request options for evalListExperiments without sending the request
|
|
255
|
+
*/
|
|
256
|
+
evalListExperimentsRequestOpts(requestParameters: EvalListExperimentsRequest): Promise<runtime.RequestOpts>;
|
|
257
|
+
/**
|
|
258
|
+
* Page the account\'s experiments. Filter by subject pair for one agent\'s, harness\'s, or skill\'s runs; by `dataset_id` for every run over a golden set; by `baseline_experiment_id` for everything compared against one run; or by `config` for the arms of a sweep that share a dimension — `?config=model:claude-sonnet-5,engine:duckdb` answers \"every run of this model on this engine\", which is the slice a multi-arm sweep is actually compared along.
|
|
259
|
+
* List experiments
|
|
260
|
+
*/
|
|
261
|
+
evalListExperimentsRaw(requestParameters: EvalListExperimentsRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<runtime.ApiResponse<EvalPageExperimentArtifactView>>;
|
|
262
|
+
/**
|
|
263
|
+
* Page the account\'s experiments. Filter by subject pair for one agent\'s, harness\'s, or skill\'s runs; by `dataset_id` for every run over a golden set; by `baseline_experiment_id` for everything compared against one run; or by `config` for the arms of a sweep that share a dimension — `?config=model:claude-sonnet-5,engine:duckdb` answers \"every run of this model on this engine\", which is the slice a multi-arm sweep is actually compared along.
|
|
264
|
+
* List experiments
|
|
265
|
+
*/
|
|
266
|
+
evalListExperiments(requestParameters?: EvalListExperimentsRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<EvalPageExperimentArtifactView>;
|
|
267
|
+
/**
|
|
268
|
+
* Creates request options for evalPatchExperiment without sending the request
|
|
269
|
+
*/
|
|
270
|
+
evalPatchExperimentRequestOpts(requestParameters: EvalPatchExperimentRequest): Promise<runtime.RequestOpts>;
|
|
271
|
+
/**
|
|
272
|
+
* The finalize write: move `experiment_status` to `completed` or `failed` and record the score `summary`. The run-defining fields — dataset, subject, config, baseline — are not patchable; they describe a run that already happened. A terminal experiment is frozen entirely.
|
|
273
|
+
* Finalize or annotate an experiment
|
|
274
|
+
*/
|
|
275
|
+
evalPatchExperimentRaw(requestParameters: EvalPatchExperimentRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<runtime.ApiResponse<EvalExperimentArtifactView>>;
|
|
276
|
+
/**
|
|
277
|
+
* The finalize write: move `experiment_status` to `completed` or `failed` and record the score `summary`. The run-defining fields — dataset, subject, config, baseline — are not patchable; they describe a run that already happened. A terminal experiment is frozen entirely.
|
|
278
|
+
* Finalize or annotate an experiment
|
|
279
|
+
*/
|
|
280
|
+
evalPatchExperiment(requestParameters: EvalPatchExperimentRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<EvalExperimentArtifactView>;
|
|
281
|
+
/**
|
|
282
|
+
* Creates request options for evalQueryExperimentTraceStats without sending the request
|
|
283
|
+
*/
|
|
284
|
+
evalQueryExperimentTraceStatsRequestOpts(requestParameters: EvalQueryExperimentTraceStatsRequest): Promise<runtime.RequestOpts>;
|
|
285
|
+
/**
|
|
286
|
+
* Use this operation to query statistics over an experiment\'s traces.
|
|
287
|
+
* Query statistics over an experiment\'s traces
|
|
288
|
+
*/
|
|
289
|
+
evalQueryExperimentTraceStatsRaw(requestParameters: EvalQueryExperimentTraceStatsRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<runtime.ApiResponse<GatewayTraceStatsEnvelope>>;
|
|
290
|
+
/**
|
|
291
|
+
* Use this operation to query statistics over an experiment\'s traces.
|
|
292
|
+
* Query statistics over an experiment\'s traces
|
|
293
|
+
*/
|
|
294
|
+
evalQueryExperimentTraceStats(requestParameters: EvalQueryExperimentTraceStatsRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<GatewayTraceStatsEnvelope>;
|
|
295
|
+
/**
|
|
296
|
+
* Creates request options for evalSearchExperiments without sending the request
|
|
297
|
+
*/
|
|
298
|
+
evalSearchExperimentsRequestOpts(requestParameters: EvalSearchExperimentsRequest): Promise<runtime.RequestOpts>;
|
|
299
|
+
/**
|
|
300
|
+
* Full-text discovery over experiment names and descriptions. Results are summary-only and carry no `metadata`.
|
|
301
|
+
* Search experiments
|
|
302
|
+
*/
|
|
303
|
+
evalSearchExperimentsRaw(requestParameters: EvalSearchExperimentsRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<runtime.ApiResponse<EvalPageExperimentArtifactView>>;
|
|
304
|
+
/**
|
|
305
|
+
* Full-text discovery over experiment names and descriptions. Results are summary-only and carry no `metadata`.
|
|
306
|
+
* Search experiments
|
|
307
|
+
*/
|
|
308
|
+
evalSearchExperiments(requestParameters: EvalSearchExperimentsRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<EvalPageExperimentArtifactView>;
|
|
309
|
+
/**
|
|
310
|
+
* Creates request options for evalSummarizeExperiment without sending the request
|
|
311
|
+
*/
|
|
312
|
+
evalSummarizeExperimentRequestOpts(requestParameters: EvalSummarizeExperimentRequest): Promise<runtime.RequestOpts>;
|
|
313
|
+
/**
|
|
314
|
+
* Use this operation to roll the run\'s score spans up into `summary`.
|
|
315
|
+
* Roll the run\'s score spans up into `summary`
|
|
316
|
+
*/
|
|
317
|
+
evalSummarizeExperimentRaw(requestParameters: EvalSummarizeExperimentRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<runtime.ApiResponse<EvalExperimentArtifactView>>;
|
|
318
|
+
/**
|
|
319
|
+
* Use this operation to roll the run\'s score spans up into `summary`.
|
|
320
|
+
* Roll the run\'s score spans up into `summary`
|
|
321
|
+
*/
|
|
322
|
+
evalSummarizeExperiment(requestParameters: EvalSummarizeExperimentRequest, initOverrides?: RequestInit | runtime.InitOverrideFunction): Promise<EvalExperimentArtifactView>;
|
|
323
|
+
}
|
|
324
|
+
/**
|
|
325
|
+
* @export
|
|
326
|
+
* @enum {string}
|
|
327
|
+
*/
|
|
328
|
+
export declare enum EvalCreateExperimentContentEncodingEnum {
|
|
329
|
+
Base64 = "base64",
|
|
330
|
+
GzipBase64 = "gzip, base64"
|
|
331
|
+
}
|
|
332
|
+
/**
|
|
333
|
+
* @export
|
|
334
|
+
* @enum {string}
|
|
335
|
+
*/
|
|
336
|
+
export declare enum EvalCreateExperimentResultContentEncodingEnum {
|
|
337
|
+
Base64 = "base64",
|
|
338
|
+
GzipBase64 = "gzip, base64"
|
|
339
|
+
}
|
|
340
|
+
/**
|
|
341
|
+
* @export
|
|
342
|
+
* @enum {string}
|
|
343
|
+
*/
|
|
344
|
+
export declare enum EvalCreateExperimentResultsBulkContentEncodingEnum {
|
|
345
|
+
Base64 = "base64",
|
|
346
|
+
GzipBase64 = "gzip, base64"
|
|
347
|
+
}
|
|
348
|
+
/**
|
|
349
|
+
* @export
|
|
350
|
+
* @enum {string}
|
|
351
|
+
*/
|
|
352
|
+
export declare enum EvalPatchExperimentContentEncodingEnum {
|
|
353
|
+
Base64 = "base64",
|
|
354
|
+
GzipBase64 = "gzip, base64"
|
|
355
|
+
}
|
|
356
|
+
/**
|
|
357
|
+
* @export
|
|
358
|
+
* @enum {string}
|
|
359
|
+
*/
|
|
360
|
+
export declare enum EvalQueryExperimentTraceStatsContentEncodingEnum {
|
|
361
|
+
Base64 = "base64",
|
|
362
|
+
GzipBase64 = "gzip, base64"
|
|
363
|
+
}
|
|
364
|
+
/**
|
|
365
|
+
* @export
|
|
366
|
+
* @enum {string}
|
|
367
|
+
*/
|
|
368
|
+
export declare enum EvalSearchExperimentsContentEncodingEnum {
|
|
369
|
+
Base64 = "base64",
|
|
370
|
+
GzipBase64 = "gzip, base64"
|
|
371
|
+
}
|