@ora-ai/cli 0.1.0 → 0.2.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
@@ -16,6 +16,557 @@ export type AddonsListResponse = {
16
16
  "harnesses": Array<string>;
17
17
  }>;
18
18
  };
19
+ export type BenchmarksListResponse = {
20
+ "benchmarks": Array<{
21
+ "id": string;
22
+ "organizationId": string;
23
+ "createdBy": string | null;
24
+ "name": string;
25
+ "slug": string;
26
+ "description": string | null;
27
+ "skillRef": string | null;
28
+ "skillSlug": string | null;
29
+ "skillName": string | null;
30
+ "skillPromise": string;
31
+ "subjectKind": "skill" | "tools" | "addon" | "custom";
32
+ "subjectName": string | null;
33
+ "subjectLabel": string;
34
+ "armConfig": {
35
+ "baseline"?: {
36
+ "tools"?: "default" | "none" | {
37
+ "tools": Array<string>;
38
+ };
39
+ "addons"?: Record<string, unknown>;
40
+ };
41
+ "treatment"?: {
42
+ "tools"?: "default" | "none" | {
43
+ "tools": Array<string>;
44
+ };
45
+ "addons"?: Record<string, unknown>;
46
+ };
47
+ };
48
+ "comparisonMode": "ab_vs_none" | "ab_custom" | "single";
49
+ "baselineLabel": string | null;
50
+ "treatmentLabel": string | null;
51
+ "promiseMetrics": Array<{
52
+ "metric": "total_tokens" | "output_tokens" | "cost_usd" | "duration_ms" | "num_turns" | "success_rate";
53
+ "direction": "down" | "up";
54
+ "label": string;
55
+ }>;
56
+ "matrix": Array<{
57
+ "harness": string;
58
+ "model": string;
59
+ "provider"?: string;
60
+ }>;
61
+ "taskCount": number;
62
+ "status": string;
63
+ "error": string | null;
64
+ "visibility": "private" | "public";
65
+ "publishedAt": string | null;
66
+ "verdict": unknown;
67
+ "createdAt": string;
68
+ "updatedAt": string;
69
+ }>;
70
+ };
71
+ export type BenchmarksCreateRequest = {
72
+ "name": string;
73
+ "description"?: string;
74
+ "subjectKind"?: "skill" | "tools" | "addon" | "custom";
75
+ "skillRef"?: string;
76
+ "subjectName"?: string;
77
+ "armConfig"?: {
78
+ "baseline"?: {
79
+ "tools"?: "default" | "none" | {
80
+ "tools": Array<string>;
81
+ };
82
+ "addons"?: Record<string, unknown>;
83
+ };
84
+ "treatment"?: {
85
+ "tools"?: "default" | "none" | {
86
+ "tools": Array<string>;
87
+ };
88
+ "addons"?: Record<string, unknown>;
89
+ };
90
+ };
91
+ "comparisonMode"?: "ab_vs_none" | "ab_custom" | "single";
92
+ "baselineLabel"?: string;
93
+ "treatmentLabel"?: string;
94
+ "taskCount"?: number;
95
+ "matrix": Array<{
96
+ "harness": string;
97
+ "model": string;
98
+ "provider"?: string;
99
+ }>;
100
+ "promise"?: string;
101
+ };
102
+ export type BenchmarksCreateResponse = {
103
+ "benchmark": {
104
+ "id": string;
105
+ "organizationId": string;
106
+ "createdBy": string | null;
107
+ "name": string;
108
+ "slug": string;
109
+ "description": string | null;
110
+ "skillRef": string | null;
111
+ "skillSlug": string | null;
112
+ "skillName": string | null;
113
+ "skillPromise": string;
114
+ "subjectKind": "skill" | "tools" | "addon" | "custom";
115
+ "subjectName": string | null;
116
+ "subjectLabel": string;
117
+ "armConfig": {
118
+ "baseline"?: {
119
+ "tools"?: "default" | "none" | {
120
+ "tools": Array<string>;
121
+ };
122
+ "addons"?: Record<string, unknown>;
123
+ };
124
+ "treatment"?: {
125
+ "tools"?: "default" | "none" | {
126
+ "tools": Array<string>;
127
+ };
128
+ "addons"?: Record<string, unknown>;
129
+ };
130
+ };
131
+ "comparisonMode": "ab_vs_none" | "ab_custom" | "single";
132
+ "baselineLabel": string | null;
133
+ "treatmentLabel": string | null;
134
+ "promiseMetrics": Array<{
135
+ "metric": "total_tokens" | "output_tokens" | "cost_usd" | "duration_ms" | "num_turns" | "success_rate";
136
+ "direction": "down" | "up";
137
+ "label": string;
138
+ }>;
139
+ "matrix": Array<{
140
+ "harness": string;
141
+ "model": string;
142
+ "provider"?: string;
143
+ }>;
144
+ "taskCount": number;
145
+ "status": string;
146
+ "error": string | null;
147
+ "visibility": "private" | "public";
148
+ "publishedAt": string | null;
149
+ "verdict": unknown;
150
+ "createdAt": string;
151
+ "updatedAt": string;
152
+ };
153
+ "streamUrl": string;
154
+ };
155
+ export type BenchmarksGetResponse = {
156
+ "benchmark": {
157
+ "id": string;
158
+ "organizationId": string;
159
+ "createdBy": string | null;
160
+ "name": string;
161
+ "slug": string;
162
+ "description": string | null;
163
+ "skillRef": string | null;
164
+ "skillSlug": string | null;
165
+ "skillName": string | null;
166
+ "skillPromise": string;
167
+ "subjectKind": "skill" | "tools" | "addon" | "custom";
168
+ "subjectName": string | null;
169
+ "subjectLabel": string;
170
+ "armConfig": {
171
+ "baseline"?: {
172
+ "tools"?: "default" | "none" | {
173
+ "tools": Array<string>;
174
+ };
175
+ "addons"?: Record<string, unknown>;
176
+ };
177
+ "treatment"?: {
178
+ "tools"?: "default" | "none" | {
179
+ "tools": Array<string>;
180
+ };
181
+ "addons"?: Record<string, unknown>;
182
+ };
183
+ };
184
+ "comparisonMode": "ab_vs_none" | "ab_custom" | "single";
185
+ "baselineLabel": string | null;
186
+ "treatmentLabel": string | null;
187
+ "promiseMetrics": Array<{
188
+ "metric": "total_tokens" | "output_tokens" | "cost_usd" | "duration_ms" | "num_turns" | "success_rate";
189
+ "direction": "down" | "up";
190
+ "label": string;
191
+ }>;
192
+ "matrix": Array<{
193
+ "harness": string;
194
+ "model": string;
195
+ "provider"?: string;
196
+ }>;
197
+ "taskCount": number;
198
+ "status": string;
199
+ "error": string | null;
200
+ "visibility": "private" | "public";
201
+ "publishedAt": string | null;
202
+ "verdict": unknown;
203
+ "createdAt": string;
204
+ "updatedAt": string;
205
+ };
206
+ "tasks": Array<{
207
+ "id": string;
208
+ "benchmarkId": string;
209
+ "position": number;
210
+ "prompt": string;
211
+ "rationale": string | null;
212
+ "category": string | null;
213
+ "requiresWeb": boolean;
214
+ "rubric": Array<string>;
215
+ }>;
216
+ "runs": Array<{
217
+ "runId": string;
218
+ "taskId": string;
219
+ "arm": "baseline" | "skill";
220
+ "harness": string;
221
+ "model": string;
222
+ "provider": string | null;
223
+ "status": string;
224
+ "outcome": string | null;
225
+ "outcomeReason": string | null;
226
+ "totalTokens": number | null;
227
+ "inputTokens": number | null;
228
+ "outputTokens": number | null;
229
+ "cacheReadTokens": number | null;
230
+ "cacheCreationTokens": number | null;
231
+ "costUsd": number | null;
232
+ "numTurns": number | null;
233
+ "durationMs": number | null;
234
+ "intentSatisfied": boolean | null;
235
+ "frictionCount": number | null;
236
+ "insightSummary": string | null;
237
+ "qualityScore": number | null;
238
+ "rubricResults": Array<{
239
+ "criterion": string;
240
+ "passed": boolean;
241
+ "note"?: string;
242
+ "votes"?: {
243
+ "passed": number;
244
+ "judges": number;
245
+ };
246
+ }> | null;
247
+ "gradedAt": string | null;
248
+ "judgeModel": string | null;
249
+ "pairVerdict": "skill" | "baseline" | "tie" | null;
250
+ "pairGradedAt": string | null;
251
+ "runCreatedAt": string | null;
252
+ "startedAt": string | null;
253
+ "finishedAt": string | null;
254
+ }>;
255
+ "aggregate": {
256
+ "summary": {
257
+ "verdict": "delivered" | "partial" | "not_delivered" | "inconclusive" | "measured";
258
+ "headline": Array<unknown>;
259
+ "successRate": {
260
+ "baseline": number | null;
261
+ "skill": number | null;
262
+ };
263
+ "pairwise": {
264
+ "pairs": number;
265
+ "skillWins": number;
266
+ "baselineWins": number;
267
+ "ties": number;
268
+ "winRate": number | null;
269
+ };
270
+ "leaderboard"?: Array<unknown>;
271
+ "totals": {
272
+ "cells": number;
273
+ "runs": number;
274
+ "completed": number;
275
+ "failed": number;
276
+ "costUsd": number;
277
+ "tokens": number;
278
+ };
279
+ };
280
+ "perCell": Array<unknown>;
281
+ "perHarness": Array<unknown>;
282
+ "perModel": Array<unknown>;
283
+ "perTask": Array<unknown>;
284
+ "webSplit": unknown;
285
+ };
286
+ };
287
+ export type BenchmarksDeleteResponse = unknown;
288
+ export type BenchmarksGenerateResponse = {
289
+ "benchmark": {
290
+ "id": string;
291
+ "organizationId": string;
292
+ "createdBy": string | null;
293
+ "name": string;
294
+ "slug": string;
295
+ "description": string | null;
296
+ "skillRef": string | null;
297
+ "skillSlug": string | null;
298
+ "skillName": string | null;
299
+ "skillPromise": string;
300
+ "subjectKind": "skill" | "tools" | "addon" | "custom";
301
+ "subjectName": string | null;
302
+ "subjectLabel": string;
303
+ "armConfig": {
304
+ "baseline"?: {
305
+ "tools"?: "default" | "none" | {
306
+ "tools": Array<string>;
307
+ };
308
+ "addons"?: Record<string, unknown>;
309
+ };
310
+ "treatment"?: {
311
+ "tools"?: "default" | "none" | {
312
+ "tools": Array<string>;
313
+ };
314
+ "addons"?: Record<string, unknown>;
315
+ };
316
+ };
317
+ "comparisonMode": "ab_vs_none" | "ab_custom" | "single";
318
+ "baselineLabel": string | null;
319
+ "treatmentLabel": string | null;
320
+ "promiseMetrics": Array<{
321
+ "metric": "total_tokens" | "output_tokens" | "cost_usd" | "duration_ms" | "num_turns" | "success_rate";
322
+ "direction": "down" | "up";
323
+ "label": string;
324
+ }>;
325
+ "matrix": Array<{
326
+ "harness": string;
327
+ "model": string;
328
+ "provider"?: string;
329
+ }>;
330
+ "taskCount": number;
331
+ "status": string;
332
+ "error": string | null;
333
+ "visibility": "private" | "public";
334
+ "publishedAt": string | null;
335
+ "verdict": unknown;
336
+ "createdAt": string;
337
+ "updatedAt": string;
338
+ };
339
+ "streamUrl": string;
340
+ };
341
+ export type BenchmarksLaunchResponse = {
342
+ "benchmark": {
343
+ "id": string;
344
+ "organizationId": string;
345
+ "createdBy": string | null;
346
+ "name": string;
347
+ "slug": string;
348
+ "description": string | null;
349
+ "skillRef": string | null;
350
+ "skillSlug": string | null;
351
+ "skillName": string | null;
352
+ "skillPromise": string;
353
+ "subjectKind": "skill" | "tools" | "addon" | "custom";
354
+ "subjectName": string | null;
355
+ "subjectLabel": string;
356
+ "armConfig": {
357
+ "baseline"?: {
358
+ "tools"?: "default" | "none" | {
359
+ "tools": Array<string>;
360
+ };
361
+ "addons"?: Record<string, unknown>;
362
+ };
363
+ "treatment"?: {
364
+ "tools"?: "default" | "none" | {
365
+ "tools": Array<string>;
366
+ };
367
+ "addons"?: Record<string, unknown>;
368
+ };
369
+ };
370
+ "comparisonMode": "ab_vs_none" | "ab_custom" | "single";
371
+ "baselineLabel": string | null;
372
+ "treatmentLabel": string | null;
373
+ "promiseMetrics": Array<{
374
+ "metric": "total_tokens" | "output_tokens" | "cost_usd" | "duration_ms" | "num_turns" | "success_rate";
375
+ "direction": "down" | "up";
376
+ "label": string;
377
+ }>;
378
+ "matrix": Array<{
379
+ "harness": string;
380
+ "model": string;
381
+ "provider"?: string;
382
+ }>;
383
+ "taskCount": number;
384
+ "status": string;
385
+ "error": string | null;
386
+ "visibility": "private" | "public";
387
+ "publishedAt": string | null;
388
+ "verdict": unknown;
389
+ "createdAt": string;
390
+ "updatedAt": string;
391
+ };
392
+ "streamUrl": string;
393
+ };
394
+ export type BenchmarksPublishRequest = {
395
+ "slug"?: string;
396
+ };
397
+ export type BenchmarksPublishResponse = {
398
+ "benchmark": {
399
+ "id": string;
400
+ "organizationId": string;
401
+ "createdBy": string | null;
402
+ "name": string;
403
+ "slug": string;
404
+ "description": string | null;
405
+ "skillRef": string | null;
406
+ "skillSlug": string | null;
407
+ "skillName": string | null;
408
+ "skillPromise": string;
409
+ "subjectKind": "skill" | "tools" | "addon" | "custom";
410
+ "subjectName": string | null;
411
+ "subjectLabel": string;
412
+ "armConfig": {
413
+ "baseline"?: {
414
+ "tools"?: "default" | "none" | {
415
+ "tools": Array<string>;
416
+ };
417
+ "addons"?: Record<string, unknown>;
418
+ };
419
+ "treatment"?: {
420
+ "tools"?: "default" | "none" | {
421
+ "tools": Array<string>;
422
+ };
423
+ "addons"?: Record<string, unknown>;
424
+ };
425
+ };
426
+ "comparisonMode": "ab_vs_none" | "ab_custom" | "single";
427
+ "baselineLabel": string | null;
428
+ "treatmentLabel": string | null;
429
+ "promiseMetrics": Array<{
430
+ "metric": "total_tokens" | "output_tokens" | "cost_usd" | "duration_ms" | "num_turns" | "success_rate";
431
+ "direction": "down" | "up";
432
+ "label": string;
433
+ }>;
434
+ "matrix": Array<{
435
+ "harness": string;
436
+ "model": string;
437
+ "provider"?: string;
438
+ }>;
439
+ "taskCount": number;
440
+ "status": string;
441
+ "error": string | null;
442
+ "visibility": "private" | "public";
443
+ "publishedAt": string | null;
444
+ "verdict": unknown;
445
+ "createdAt": string;
446
+ "updatedAt": string;
447
+ };
448
+ };
449
+ export type BenchmarksRegradeResponse = {
450
+ "benchmark": {
451
+ "id": string;
452
+ "organizationId": string;
453
+ "createdBy": string | null;
454
+ "name": string;
455
+ "slug": string;
456
+ "description": string | null;
457
+ "skillRef": string | null;
458
+ "skillSlug": string | null;
459
+ "skillName": string | null;
460
+ "skillPromise": string;
461
+ "subjectKind": "skill" | "tools" | "addon" | "custom";
462
+ "subjectName": string | null;
463
+ "subjectLabel": string;
464
+ "armConfig": {
465
+ "baseline"?: {
466
+ "tools"?: "default" | "none" | {
467
+ "tools": Array<string>;
468
+ };
469
+ "addons"?: Record<string, unknown>;
470
+ };
471
+ "treatment"?: {
472
+ "tools"?: "default" | "none" | {
473
+ "tools": Array<string>;
474
+ };
475
+ "addons"?: Record<string, unknown>;
476
+ };
477
+ };
478
+ "comparisonMode": "ab_vs_none" | "ab_custom" | "single";
479
+ "baselineLabel": string | null;
480
+ "treatmentLabel": string | null;
481
+ "promiseMetrics": Array<{
482
+ "metric": "total_tokens" | "output_tokens" | "cost_usd" | "duration_ms" | "num_turns" | "success_rate";
483
+ "direction": "down" | "up";
484
+ "label": string;
485
+ }>;
486
+ "matrix": Array<{
487
+ "harness": string;
488
+ "model": string;
489
+ "provider"?: string;
490
+ }>;
491
+ "taskCount": number;
492
+ "status": string;
493
+ "error": string | null;
494
+ "visibility": "private" | "public";
495
+ "publishedAt": string | null;
496
+ "verdict": unknown;
497
+ "createdAt": string;
498
+ "updatedAt": string;
499
+ };
500
+ "streamUrl": string;
501
+ };
502
+ export type BenchmarksStreamResponse = unknown;
503
+ export type BenchmarksUpdateTaskRequest = {
504
+ "prompt": string;
505
+ };
506
+ export type BenchmarksUpdateTaskResponse = {
507
+ "task": {
508
+ "id": string;
509
+ "benchmarkId": string;
510
+ "position": number;
511
+ "prompt": string;
512
+ "rationale": string | null;
513
+ "category": string | null;
514
+ "requiresWeb": boolean;
515
+ "rubric": Array<string>;
516
+ };
517
+ };
518
+ export type BenchmarksUnpublishResponse = {
519
+ "benchmark": {
520
+ "id": string;
521
+ "organizationId": string;
522
+ "createdBy": string | null;
523
+ "name": string;
524
+ "slug": string;
525
+ "description": string | null;
526
+ "skillRef": string | null;
527
+ "skillSlug": string | null;
528
+ "skillName": string | null;
529
+ "skillPromise": string;
530
+ "subjectKind": "skill" | "tools" | "addon" | "custom";
531
+ "subjectName": string | null;
532
+ "subjectLabel": string;
533
+ "armConfig": {
534
+ "baseline"?: {
535
+ "tools"?: "default" | "none" | {
536
+ "tools": Array<string>;
537
+ };
538
+ "addons"?: Record<string, unknown>;
539
+ };
540
+ "treatment"?: {
541
+ "tools"?: "default" | "none" | {
542
+ "tools": Array<string>;
543
+ };
544
+ "addons"?: Record<string, unknown>;
545
+ };
546
+ };
547
+ "comparisonMode": "ab_vs_none" | "ab_custom" | "single";
548
+ "baselineLabel": string | null;
549
+ "treatmentLabel": string | null;
550
+ "promiseMetrics": Array<{
551
+ "metric": "total_tokens" | "output_tokens" | "cost_usd" | "duration_ms" | "num_turns" | "success_rate";
552
+ "direction": "down" | "up";
553
+ "label": string;
554
+ }>;
555
+ "matrix": Array<{
556
+ "harness": string;
557
+ "model": string;
558
+ "provider"?: string;
559
+ }>;
560
+ "taskCount": number;
561
+ "status": string;
562
+ "error": string | null;
563
+ "visibility": "private" | "public";
564
+ "publishedAt": string | null;
565
+ "verdict": unknown;
566
+ "createdAt": string;
567
+ "updatedAt": string;
568
+ };
569
+ };
19
570
  export type ExperimentRunsListResponse = {
20
571
  "results": Array<{
21
572
  "id": string;
@@ -101,6 +652,31 @@ export type ExperimentRunsInsightResponse = unknown;
101
652
  export type ExperimentRunsRawTraceResponse = unknown;
102
653
  export type ExperimentRunsStreamResponse = unknown;
103
654
  export type ExperimentRunsTrajectoryResponse = unknown;
655
+ export type ExperimentSecretsListResponse = {
656
+ "secrets": Array<{
657
+ "id": string;
658
+ "organizationId": string;
659
+ "name": string;
660
+ "createdBy": string | null;
661
+ "createdAt": string;
662
+ "updatedAt": string;
663
+ }>;
664
+ };
665
+ export type ExperimentSecretsCreateRequest = {
666
+ "name": string;
667
+ "value": string;
668
+ };
669
+ export type ExperimentSecretsCreateResponse = {
670
+ "secret": {
671
+ "id": string;
672
+ "organizationId": string;
673
+ "name": string;
674
+ "createdBy": string | null;
675
+ "createdAt": string;
676
+ "updatedAt": string;
677
+ };
678
+ };
679
+ export type ExperimentSecretsDeleteResponse = unknown;
104
680
  export type SessionsListResponse = {
105
681
  "sessions": Array<{
106
682
  "id": string;