@ora-ai/cli 0.1.0 → 0.2.1

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
@@ -16,6 +16,584 @@ export type AddonsListResponse = {
16
16
  "harnesses": Array<string>;
17
17
  }>;
18
18
  };
19
+ export type BenchmarksListResponse = {
20
+ "benchmarks": Array<{
21
+ "id": string;
22
+ "plannedRunCount": number;
23
+ "organizationId": string;
24
+ "createdBy": string | null;
25
+ "name": string;
26
+ "slug": string;
27
+ "description": string | null;
28
+ "skillRef": string | null;
29
+ "skillSlug": string | null;
30
+ "skillName": string | null;
31
+ "skillPromise": string;
32
+ "subjectKind": "skill" | "tools" | "addon" | "custom";
33
+ "subjectName": string | null;
34
+ "subjectLabel": string;
35
+ "armConfig": {
36
+ "baseline"?: {
37
+ "tools"?: "default" | "none" | {
38
+ "tools": Array<string>;
39
+ };
40
+ "addons"?: Record<string, unknown>;
41
+ };
42
+ "treatment"?: {
43
+ "tools"?: "default" | "none" | {
44
+ "tools": Array<string>;
45
+ };
46
+ "addons"?: Record<string, unknown>;
47
+ };
48
+ };
49
+ "comparisonMode": "ab_vs_none" | "ab_custom" | "single";
50
+ "baselineLabel": string | null;
51
+ "treatmentLabel": string | null;
52
+ "promiseMetrics": Array<{
53
+ "metric": "total_tokens" | "output_tokens" | "cost_usd" | "duration_ms" | "num_turns" | "success_rate";
54
+ "direction": "down" | "up";
55
+ "label": string;
56
+ }>;
57
+ "matrix": Array<{
58
+ "harness": string;
59
+ "model": string;
60
+ "provider"?: string;
61
+ }>;
62
+ "taskCount": number;
63
+ "status": string;
64
+ "error": string | null;
65
+ "visibility": "private" | "public";
66
+ "publishedAt": string | null;
67
+ "verdict": unknown;
68
+ "createdAt": string;
69
+ "updatedAt": string;
70
+ }>;
71
+ };
72
+ export type BenchmarksCreateRequest = {
73
+ "name": string;
74
+ "description"?: string;
75
+ "subjectKind"?: "skill" | "tools" | "addon" | "custom";
76
+ "skillRef"?: string;
77
+ "subjectName"?: string;
78
+ "armConfig"?: {
79
+ "baseline"?: {
80
+ "tools"?: "default" | "none" | {
81
+ "tools": Array<string>;
82
+ };
83
+ "addons"?: Record<string, unknown>;
84
+ };
85
+ "treatment"?: {
86
+ "tools"?: "default" | "none" | {
87
+ "tools": Array<string>;
88
+ };
89
+ "addons"?: Record<string, unknown>;
90
+ };
91
+ };
92
+ "comparisonMode"?: "ab_vs_none" | "ab_custom" | "single";
93
+ "baselineLabel"?: string;
94
+ "treatmentLabel"?: string;
95
+ "taskCount"?: number;
96
+ "matrix": Array<{
97
+ "harness": string;
98
+ "model": string;
99
+ "provider"?: string;
100
+ }>;
101
+ "promise"?: string;
102
+ };
103
+ export type BenchmarksCreateResponse = {
104
+ "benchmark": {
105
+ "id": string;
106
+ "plannedRunCount": number;
107
+ "organizationId": string;
108
+ "createdBy": string | null;
109
+ "name": string;
110
+ "slug": string;
111
+ "description": string | null;
112
+ "skillRef": string | null;
113
+ "skillSlug": string | null;
114
+ "skillName": string | null;
115
+ "skillPromise": string;
116
+ "subjectKind": "skill" | "tools" | "addon" | "custom";
117
+ "subjectName": string | null;
118
+ "subjectLabel": string;
119
+ "armConfig": {
120
+ "baseline"?: {
121
+ "tools"?: "default" | "none" | {
122
+ "tools": Array<string>;
123
+ };
124
+ "addons"?: Record<string, unknown>;
125
+ };
126
+ "treatment"?: {
127
+ "tools"?: "default" | "none" | {
128
+ "tools": Array<string>;
129
+ };
130
+ "addons"?: Record<string, unknown>;
131
+ };
132
+ };
133
+ "comparisonMode": "ab_vs_none" | "ab_custom" | "single";
134
+ "baselineLabel": string | null;
135
+ "treatmentLabel": string | null;
136
+ "promiseMetrics": Array<{
137
+ "metric": "total_tokens" | "output_tokens" | "cost_usd" | "duration_ms" | "num_turns" | "success_rate";
138
+ "direction": "down" | "up";
139
+ "label": string;
140
+ }>;
141
+ "matrix": Array<{
142
+ "harness": string;
143
+ "model": string;
144
+ "provider"?: string;
145
+ }>;
146
+ "taskCount": number;
147
+ "status": string;
148
+ "error": string | null;
149
+ "visibility": "private" | "public";
150
+ "publishedAt": string | null;
151
+ "verdict": unknown;
152
+ "createdAt": string;
153
+ "updatedAt": string;
154
+ };
155
+ "streamUrl": string;
156
+ };
157
+ export type BenchmarksGetResponse = {
158
+ "benchmark": {
159
+ "id": string;
160
+ "plannedRunCount": number;
161
+ "organizationId": string;
162
+ "createdBy": string | null;
163
+ "name": string;
164
+ "slug": string;
165
+ "description": string | null;
166
+ "skillRef": string | null;
167
+ "skillSlug": string | null;
168
+ "skillName": string | null;
169
+ "skillPromise": string;
170
+ "subjectKind": "skill" | "tools" | "addon" | "custom";
171
+ "subjectName": string | null;
172
+ "subjectLabel": string;
173
+ "armConfig": {
174
+ "baseline"?: {
175
+ "tools"?: "default" | "none" | {
176
+ "tools": Array<string>;
177
+ };
178
+ "addons"?: Record<string, unknown>;
179
+ };
180
+ "treatment"?: {
181
+ "tools"?: "default" | "none" | {
182
+ "tools": Array<string>;
183
+ };
184
+ "addons"?: Record<string, unknown>;
185
+ };
186
+ };
187
+ "comparisonMode": "ab_vs_none" | "ab_custom" | "single";
188
+ "baselineLabel": string | null;
189
+ "treatmentLabel": string | null;
190
+ "promiseMetrics": Array<{
191
+ "metric": "total_tokens" | "output_tokens" | "cost_usd" | "duration_ms" | "num_turns" | "success_rate";
192
+ "direction": "down" | "up";
193
+ "label": string;
194
+ }>;
195
+ "matrix": Array<{
196
+ "harness": string;
197
+ "model": string;
198
+ "provider"?: string;
199
+ }>;
200
+ "taskCount": number;
201
+ "status": string;
202
+ "error": string | null;
203
+ "visibility": "private" | "public";
204
+ "publishedAt": string | null;
205
+ "verdict": unknown;
206
+ "createdAt": string;
207
+ "updatedAt": string;
208
+ };
209
+ "tasks": Array<{
210
+ "id": string;
211
+ "benchmarkId": string;
212
+ "position": number;
213
+ "prompt": string;
214
+ "rationale": string | null;
215
+ "category": string | null;
216
+ "requiresWeb": boolean;
217
+ "rubric": Array<string>;
218
+ }>;
219
+ "runs": Array<{
220
+ "runId": string;
221
+ "taskId": string;
222
+ "arm": "baseline" | "skill";
223
+ "harness": string;
224
+ "model": string;
225
+ "provider": string | null;
226
+ "status": string;
227
+ "outcome": string | null;
228
+ "outcomeReason": string | null;
229
+ "totalTokens": number | null;
230
+ "inputTokens": number | null;
231
+ "outputTokens": number | null;
232
+ "cacheReadTokens": number | null;
233
+ "cacheCreationTokens": number | null;
234
+ "costUsd": number | null;
235
+ "numTurns": number | null;
236
+ "durationMs": number | null;
237
+ "intentSatisfied": boolean | null;
238
+ "frictionCount": number | null;
239
+ "insightSummary": string | null;
240
+ "qualityScore": number | null;
241
+ "rubricResults": Array<{
242
+ "criterion": string;
243
+ "passed": boolean;
244
+ "note"?: string;
245
+ "votes"?: {
246
+ "passed": number;
247
+ "judges": number;
248
+ };
249
+ }> | null;
250
+ "gradedAt": string | null;
251
+ "judgeModel": string | null;
252
+ "pairVerdict": "skill" | "baseline" | "tie" | null;
253
+ "pairGradedAt": string | null;
254
+ "runCreatedAt": string | null;
255
+ "startedAt": string | null;
256
+ "finishedAt": string | null;
257
+ }>;
258
+ "aggregate": {
259
+ "summary": {
260
+ "verdict": "delivered" | "partial" | "not_delivered" | "inconclusive" | "measured";
261
+ "headline": Array<unknown>;
262
+ "successRate": {
263
+ "baseline": number | null;
264
+ "skill": number | null;
265
+ };
266
+ "pairwise": {
267
+ "pairs": number;
268
+ "skillWins": number;
269
+ "baselineWins": number;
270
+ "ties": number;
271
+ "winRate": number | null;
272
+ };
273
+ "leaderboard"?: Array<unknown>;
274
+ "totals": {
275
+ "cells": number;
276
+ "runs": number;
277
+ "completed": number;
278
+ "failed": number;
279
+ "costUsd": number;
280
+ "tokens": number;
281
+ };
282
+ };
283
+ "perCell": Array<unknown>;
284
+ "perHarness": Array<unknown>;
285
+ "perModel": Array<unknown>;
286
+ "perTask": Array<unknown>;
287
+ "webSplit": unknown;
288
+ };
289
+ };
290
+ export type BenchmarksDeleteResponse = unknown;
291
+ export type BenchmarksGenerateResponse = {
292
+ "benchmark": {
293
+ "id": string;
294
+ "plannedRunCount": number;
295
+ "organizationId": string;
296
+ "createdBy": string | null;
297
+ "name": string;
298
+ "slug": string;
299
+ "description": string | null;
300
+ "skillRef": string | null;
301
+ "skillSlug": string | null;
302
+ "skillName": string | null;
303
+ "skillPromise": string;
304
+ "subjectKind": "skill" | "tools" | "addon" | "custom";
305
+ "subjectName": string | null;
306
+ "subjectLabel": string;
307
+ "armConfig": {
308
+ "baseline"?: {
309
+ "tools"?: "default" | "none" | {
310
+ "tools": Array<string>;
311
+ };
312
+ "addons"?: Record<string, unknown>;
313
+ };
314
+ "treatment"?: {
315
+ "tools"?: "default" | "none" | {
316
+ "tools": Array<string>;
317
+ };
318
+ "addons"?: Record<string, unknown>;
319
+ };
320
+ };
321
+ "comparisonMode": "ab_vs_none" | "ab_custom" | "single";
322
+ "baselineLabel": string | null;
323
+ "treatmentLabel": string | null;
324
+ "promiseMetrics": Array<{
325
+ "metric": "total_tokens" | "output_tokens" | "cost_usd" | "duration_ms" | "num_turns" | "success_rate";
326
+ "direction": "down" | "up";
327
+ "label": string;
328
+ }>;
329
+ "matrix": Array<{
330
+ "harness": string;
331
+ "model": string;
332
+ "provider"?: string;
333
+ }>;
334
+ "taskCount": number;
335
+ "status": string;
336
+ "error": string | null;
337
+ "visibility": "private" | "public";
338
+ "publishedAt": string | null;
339
+ "verdict": unknown;
340
+ "createdAt": string;
341
+ "updatedAt": string;
342
+ };
343
+ "streamUrl": string;
344
+ };
345
+ export type BenchmarksLaunchResponse = {
346
+ "benchmark": {
347
+ "id": string;
348
+ "plannedRunCount": number;
349
+ "organizationId": string;
350
+ "createdBy": string | null;
351
+ "name": string;
352
+ "slug": string;
353
+ "description": string | null;
354
+ "skillRef": string | null;
355
+ "skillSlug": string | null;
356
+ "skillName": string | null;
357
+ "skillPromise": string;
358
+ "subjectKind": "skill" | "tools" | "addon" | "custom";
359
+ "subjectName": string | null;
360
+ "subjectLabel": string;
361
+ "armConfig": {
362
+ "baseline"?: {
363
+ "tools"?: "default" | "none" | {
364
+ "tools": Array<string>;
365
+ };
366
+ "addons"?: Record<string, unknown>;
367
+ };
368
+ "treatment"?: {
369
+ "tools"?: "default" | "none" | {
370
+ "tools": Array<string>;
371
+ };
372
+ "addons"?: Record<string, unknown>;
373
+ };
374
+ };
375
+ "comparisonMode": "ab_vs_none" | "ab_custom" | "single";
376
+ "baselineLabel": string | null;
377
+ "treatmentLabel": string | null;
378
+ "promiseMetrics": Array<{
379
+ "metric": "total_tokens" | "output_tokens" | "cost_usd" | "duration_ms" | "num_turns" | "success_rate";
380
+ "direction": "down" | "up";
381
+ "label": string;
382
+ }>;
383
+ "matrix": Array<{
384
+ "harness": string;
385
+ "model": string;
386
+ "provider"?: string;
387
+ }>;
388
+ "taskCount": number;
389
+ "status": string;
390
+ "error": string | null;
391
+ "visibility": "private" | "public";
392
+ "publishedAt": string | null;
393
+ "verdict": unknown;
394
+ "createdAt": string;
395
+ "updatedAt": string;
396
+ };
397
+ "streamUrl": string;
398
+ };
399
+ export type BenchmarksPublishRequest = {
400
+ "slug"?: string;
401
+ };
402
+ export type BenchmarksPublishResponse = {
403
+ "benchmark": {
404
+ "id": string;
405
+ "plannedRunCount": number;
406
+ "organizationId": string;
407
+ "createdBy": string | null;
408
+ "name": string;
409
+ "slug": string;
410
+ "description": string | null;
411
+ "skillRef": string | null;
412
+ "skillSlug": string | null;
413
+ "skillName": string | null;
414
+ "skillPromise": string;
415
+ "subjectKind": "skill" | "tools" | "addon" | "custom";
416
+ "subjectName": string | null;
417
+ "subjectLabel": string;
418
+ "armConfig": {
419
+ "baseline"?: {
420
+ "tools"?: "default" | "none" | {
421
+ "tools": Array<string>;
422
+ };
423
+ "addons"?: Record<string, unknown>;
424
+ };
425
+ "treatment"?: {
426
+ "tools"?: "default" | "none" | {
427
+ "tools": Array<string>;
428
+ };
429
+ "addons"?: Record<string, unknown>;
430
+ };
431
+ };
432
+ "comparisonMode": "ab_vs_none" | "ab_custom" | "single";
433
+ "baselineLabel": string | null;
434
+ "treatmentLabel": string | null;
435
+ "promiseMetrics": Array<{
436
+ "metric": "total_tokens" | "output_tokens" | "cost_usd" | "duration_ms" | "num_turns" | "success_rate";
437
+ "direction": "down" | "up";
438
+ "label": string;
439
+ }>;
440
+ "matrix": Array<{
441
+ "harness": string;
442
+ "model": string;
443
+ "provider"?: string;
444
+ }>;
445
+ "taskCount": number;
446
+ "status": string;
447
+ "error": string | null;
448
+ "visibility": "private" | "public";
449
+ "publishedAt": string | null;
450
+ "verdict": unknown;
451
+ "createdAt": string;
452
+ "updatedAt": string;
453
+ };
454
+ };
455
+ export type BenchmarksRegradeResponse = {
456
+ "benchmark": {
457
+ "id": string;
458
+ "plannedRunCount": number;
459
+ "organizationId": string;
460
+ "createdBy": string | null;
461
+ "name": string;
462
+ "slug": string;
463
+ "description": string | null;
464
+ "skillRef": string | null;
465
+ "skillSlug": string | null;
466
+ "skillName": string | null;
467
+ "skillPromise": string;
468
+ "subjectKind": "skill" | "tools" | "addon" | "custom";
469
+ "subjectName": string | null;
470
+ "subjectLabel": string;
471
+ "armConfig": {
472
+ "baseline"?: {
473
+ "tools"?: "default" | "none" | {
474
+ "tools": Array<string>;
475
+ };
476
+ "addons"?: Record<string, unknown>;
477
+ };
478
+ "treatment"?: {
479
+ "tools"?: "default" | "none" | {
480
+ "tools": Array<string>;
481
+ };
482
+ "addons"?: Record<string, unknown>;
483
+ };
484
+ };
485
+ "comparisonMode": "ab_vs_none" | "ab_custom" | "single";
486
+ "baselineLabel": string | null;
487
+ "treatmentLabel": string | null;
488
+ "promiseMetrics": Array<{
489
+ "metric": "total_tokens" | "output_tokens" | "cost_usd" | "duration_ms" | "num_turns" | "success_rate";
490
+ "direction": "down" | "up";
491
+ "label": string;
492
+ }>;
493
+ "matrix": Array<{
494
+ "harness": string;
495
+ "model": string;
496
+ "provider"?: string;
497
+ }>;
498
+ "taskCount": number;
499
+ "status": string;
500
+ "error": string | null;
501
+ "visibility": "private" | "public";
502
+ "publishedAt": string | null;
503
+ "verdict": unknown;
504
+ "createdAt": string;
505
+ "updatedAt": string;
506
+ };
507
+ "streamUrl": string;
508
+ };
509
+ export type BenchmarksStreamResponse = unknown;
510
+ export type BenchmarksUpdateTaskRequest = {
511
+ "prompt": string;
512
+ };
513
+ export type BenchmarksUpdateTaskResponse = {
514
+ "task": {
515
+ "id": string;
516
+ "benchmarkId": string;
517
+ "position": number;
518
+ "prompt": string;
519
+ "rationale": string | null;
520
+ "category": string | null;
521
+ "requiresWeb": boolean;
522
+ "rubric": Array<string>;
523
+ };
524
+ };
525
+ export type BenchmarksUnpublishResponse = {
526
+ "benchmark": {
527
+ "id": string;
528
+ "plannedRunCount": number;
529
+ "organizationId": string;
530
+ "createdBy": string | null;
531
+ "name": string;
532
+ "slug": string;
533
+ "description": string | null;
534
+ "skillRef": string | null;
535
+ "skillSlug": string | null;
536
+ "skillName": string | null;
537
+ "skillPromise": string;
538
+ "subjectKind": "skill" | "tools" | "addon" | "custom";
539
+ "subjectName": string | null;
540
+ "subjectLabel": string;
541
+ "armConfig": {
542
+ "baseline"?: {
543
+ "tools"?: "default" | "none" | {
544
+ "tools": Array<string>;
545
+ };
546
+ "addons"?: Record<string, unknown>;
547
+ };
548
+ "treatment"?: {
549
+ "tools"?: "default" | "none" | {
550
+ "tools": Array<string>;
551
+ };
552
+ "addons"?: Record<string, unknown>;
553
+ };
554
+ };
555
+ "comparisonMode": "ab_vs_none" | "ab_custom" | "single";
556
+ "baselineLabel": string | null;
557
+ "treatmentLabel": string | null;
558
+ "promiseMetrics": Array<{
559
+ "metric": "total_tokens" | "output_tokens" | "cost_usd" | "duration_ms" | "num_turns" | "success_rate";
560
+ "direction": "down" | "up";
561
+ "label": string;
562
+ }>;
563
+ "matrix": Array<{
564
+ "harness": string;
565
+ "model": string;
566
+ "provider"?: string;
567
+ }>;
568
+ "taskCount": number;
569
+ "status": string;
570
+ "error": string | null;
571
+ "visibility": "private" | "public";
572
+ "publishedAt": string | null;
573
+ "verdict": unknown;
574
+ "createdAt": string;
575
+ "updatedAt": string;
576
+ };
577
+ };
578
+ export type ExperimentCatalogResponse = {
579
+ "harnesses": Array<{
580
+ "id": string;
581
+ "name": string;
582
+ "maker": string;
583
+ "offerable": boolean;
584
+ "reason": string | null;
585
+ "modes": Array<"task" | "session">;
586
+ "defaultProvider": string | null;
587
+ "providers": Array<{
588
+ "id": string;
589
+ "models": Array<{
590
+ "id": string;
591
+ "name": string;
592
+ }>;
593
+ "defaultModel": string | null;
594
+ }>;
595
+ }>;
596
+ };
19
597
  export type ExperimentRunsListResponse = {
20
598
  "results": Array<{
21
599
  "id": string;
@@ -101,6 +679,31 @@ export type ExperimentRunsInsightResponse = unknown;
101
679
  export type ExperimentRunsRawTraceResponse = unknown;
102
680
  export type ExperimentRunsStreamResponse = unknown;
103
681
  export type ExperimentRunsTrajectoryResponse = unknown;
682
+ export type ExperimentSecretsListResponse = {
683
+ "secrets": Array<{
684
+ "id": string;
685
+ "organizationId": string;
686
+ "name": string;
687
+ "createdBy": string | null;
688
+ "createdAt": string;
689
+ "updatedAt": string;
690
+ }>;
691
+ };
692
+ export type ExperimentSecretsCreateRequest = {
693
+ "name": string;
694
+ "value": string;
695
+ };
696
+ export type ExperimentSecretsCreateResponse = {
697
+ "secret": {
698
+ "id": string;
699
+ "organizationId": string;
700
+ "name": string;
701
+ "createdBy": string | null;
702
+ "createdAt": string;
703
+ "updatedAt": string;
704
+ };
705
+ };
706
+ export type ExperimentSecretsDeleteResponse = unknown;
104
707
  export type SessionsListResponse = {
105
708
  "sessions": Array<{
106
709
  "id": string;