@tangle-network/agent-bench 0.11.3 → 0.13.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (170) hide show
  1. package/CHANGELOG.md +22 -0
  2. package/HARNESS.md +6 -2
  3. package/README.md +1 -4
  4. package/package.json +5 -5
  5. package/scripts/run-package-tests.mjs +2 -2
  6. package/src/quant-arena/README.md +0 -144
  7. package/src/quant-arena/backtest.test.mts +0 -135
  8. package/src/quant-arena/backtest.ts +0 -218
  9. package/src/quant-arena/data.test.mts +0 -44
  10. package/src/quant-arena/data.ts +0 -141
  11. package/src/quant-arena/driver.test.mts +0 -253
  12. package/src/quant-arena/driver.ts +0 -219
  13. package/src/quant-arena/fixtures/data/PROVENANCE.md +0 -26
  14. package/src/quant-arena/fixtures/data/holdout/IDX.csv +0 -523
  15. package/src/quant-arena/fixtures/data/holdout/S01.csv +0 -523
  16. package/src/quant-arena/fixtures/data/holdout/S02.csv +0 -523
  17. package/src/quant-arena/fixtures/data/holdout/S03.csv +0 -523
  18. package/src/quant-arena/fixtures/data/holdout/S04.csv +0 -523
  19. package/src/quant-arena/fixtures/data/holdout/S05.csv +0 -523
  20. package/src/quant-arena/fixtures/data/holdout/S06.csv +0 -523
  21. package/src/quant-arena/fixtures/data/holdout/S07.csv +0 -523
  22. package/src/quant-arena/fixtures/data/holdout/S08.csv +0 -523
  23. package/src/quant-arena/fixtures/data/holdout/S09.csv +0 -523
  24. package/src/quant-arena/fixtures/data/holdout/S10.csv +0 -523
  25. package/src/quant-arena/fixtures/data/insample/IDX.csv +0 -2087
  26. package/src/quant-arena/fixtures/data/insample/S01.csv +0 -2087
  27. package/src/quant-arena/fixtures/data/insample/S02.csv +0 -2087
  28. package/src/quant-arena/fixtures/data/insample/S03.csv +0 -2087
  29. package/src/quant-arena/fixtures/data/insample/S04.csv +0 -2087
  30. package/src/quant-arena/fixtures/data/insample/S05.csv +0 -2087
  31. package/src/quant-arena/fixtures/data/insample/S06.csv +0 -2087
  32. package/src/quant-arena/fixtures/data/insample/S07.csv +0 -2087
  33. package/src/quant-arena/fixtures/data/insample/S08.csv +0 -2087
  34. package/src/quant-arena/fixtures/data/insample/S09.csv +0 -2087
  35. package/src/quant-arena/fixtures/data/insample/S10.csv +0 -2087
  36. package/src/quant-arena/fixtures/demo-campaign/cost-ledger.jsonl +0 -16
  37. package/src/quant-arena/fixtures/demo-campaign/notebook.jsonl +0 -5
  38. package/src/quant-arena/fixtures/demo-campaign/rollout-manifest.json +0 -171
  39. package/src/quant-arena/fixtures/demo-campaign/strategies/cand-001-default-author/strategy.ts +0 -119
  40. package/src/quant-arena/fixtures/demo-campaign/strategies/cand-002-default-author/strategy.ts +0 -119
  41. package/src/quant-arena/fixtures/demo-campaign/strategies/cand-003-quant-researcher/strategy.ts +0 -105
  42. package/src/quant-arena/fixtures/demo-campaign/strategies/cand-004-quant-researcher/strategy.ts +0 -102
  43. package/src/quant-arena/fixtures/demo-campaign-v2/cost-ledger.jsonl +0 -4
  44. package/src/quant-arena/fixtures/demo-campaign-v2/notebook.jsonl +0 -2
  45. package/src/quant-arena/fixtures/demo-campaign-v2/rollout-manifest.json +0 -84
  46. package/src/quant-arena/fixtures/demo-campaign-v2/strategies/cand-001-quant-researcher/strategy.ts +0 -117
  47. package/src/quant-arena/holdout-certify.mts +0 -206
  48. package/src/quant-arena/holdout-certify.test.mts +0 -82
  49. package/src/quant-arena/leak-audit.test.mts +0 -79
  50. package/src/quant-arena/leak-audit.ts +0 -95
  51. package/src/quant-arena/make-fixtures.mts +0 -161
  52. package/src/quant-arena/multiplicity.test.mts +0 -68
  53. package/src/quant-arena/multiplicity.ts +0 -87
  54. package/src/quant-arena/nautilus-certify.ts +0 -31
  55. package/src/quant-arena/oms.ts +0 -90
  56. package/src/quant-arena/profiles/quant-researcher.profile.json +0 -12
  57. package/src/quant-arena/python/pyproject.toml +0 -8
  58. package/src/quant-arena/python/uv.lock +0 -1297
  59. package/src/quant-arena/python/vbt-worker.py +0 -192
  60. package/src/quant-arena/quant-loop.mts +0 -840
  61. package/src/quant-arena/quant-loop.test.mts +0 -75
  62. package/src/quant-arena/strategies/buy-hold-index/strategy.ts +0 -11
  63. package/src/quant-arena/strategies/equal-weight/strategy.ts +0 -20
  64. package/src/quant-arena/strategies/sma-crossover/strategy.ts +0 -42
  65. package/src/quant-arena/types.ts +0 -133
  66. package/src/quant-arena/vbt-client.ts +0 -321
  67. package/src/quant-arena/vbt-parity.test.mts +0 -183
  68. package/src/quant-arena/windows.test.mts +0 -45
  69. package/src/quant-arena/windows.ts +0 -54
  70. package/src/rollout-ledger/backfill-swe-arena.mts +0 -610
  71. package/src/rollout-ledger/backfill-swe-arena.test.mts +0 -347
  72. package/src/rollout-ledger/settle-capture.mts +0 -448
  73. package/src/rollout-ledger/settle-capture.test.mts +0 -270
  74. package/src/swe-arena/activation.mts +0 -225
  75. package/src/swe-arena/activation.test.mts +0 -300
  76. package/src/swe-arena/analyze.ts +0 -211
  77. package/src/swe-arena/arms.ts +0 -862
  78. package/src/swe-arena/bootstrap-meta.mts +0 -188
  79. package/src/swe-arena/bootstrap-meta.test.mts +0 -51
  80. package/src/swe-arena/briefing.mts +0 -217
  81. package/src/swe-arena/briefing.test.mts +0 -179
  82. package/src/swe-arena/calibrate.ts +0 -217
  83. package/src/swe-arena/capabilities.mts +0 -76
  84. package/src/swe-arena/capabilities.test.mts +0 -57
  85. package/src/swe-arena/capacity.ts +0 -198
  86. package/src/swe-arena/cell-evidence.mts +0 -437
  87. package/src/swe-arena/cell-evidence.test.mts +0 -248
  88. package/src/swe-arena/diagnosis-ensemble.test.mts +0 -210
  89. package/src/swe-arena/diagnosis-ensemble.ts +0 -523
  90. package/src/swe-arena/execution.test.mts +0 -1171
  91. package/src/swe-arena/factory-command-container.ts +0 -284
  92. package/src/swe-arena/factory-judge-child.mts +0 -228
  93. package/src/swe-arena/factory.test.mts +0 -645
  94. package/src/swe-arena/fixtures/analyze.py +0 -80
  95. package/src/swe-arena/fixtures/excludes.txt +0 -8
  96. package/src/swe-arena/fixtures/factory/agent-eval-309/calibration.md +0 -51
  97. package/src/swe-arena/fixtures/factory/agent-eval-309/manifest.json +0 -29
  98. package/src/swe-arena/fixtures/factory/agent-eval-309/spec.md +0 -64
  99. package/src/swe-arena/fixtures/factory/agent-runtime-232/calibration.md +0 -48
  100. package/src/swe-arena/fixtures/factory/agent-runtime-232/manifest.json +0 -29
  101. package/src/swe-arena/fixtures/factory/agent-runtime-232/spec.md +0 -48
  102. package/src/swe-arena/fixtures/factory/loops-28/calibration.md +0 -47
  103. package/src/swe-arena/fixtures/factory/loops-28/manifest.json +0 -30
  104. package/src/swe-arena/fixtures/factory/loops-28/spec.md +0 -50
  105. package/src/swe-arena/fixtures/gen1-salvage/README.md +0 -45
  106. package/src/swe-arena/fixtures/gen1-salvage/cand0-e6d7361.diff +0 -116
  107. package/src/swe-arena/fixtures/gen1-salvage/cand1-76a8590.diff +0 -293
  108. package/src/swe-arena/fixtures/holdout-preregister.log +0 -12
  109. package/src/swe-arena/fixtures/holdout.json +0 -44
  110. package/src/swe-arena/fixtures/instances.json +0 -146
  111. package/src/swe-arena/fixtures/ledger.jsonl +0 -12
  112. package/src/swe-arena/fixtures/patches/pallets__flask-5014.solo.patch +0 -36
  113. package/src/swe-arena/fixtures/patches/pydata__xarray-4687.sup.patch +0 -33
  114. package/src/swe-arena/fixtures/rejudge.jsonl +0 -15
  115. package/src/swe-arena/fixtures/rematch.jsonl +0 -3
  116. package/src/swe-arena/fixtures/rematch2.jsonl +0 -3
  117. package/src/swe-arena/fixtures/rematch3.jsonl +0 -3
  118. package/src/swe-arena/fixtures/run-report/README.md +0 -43
  119. package/src/swe-arena/fixtures/run-report/factory-agent-eval-309-FSUP0.json +0 -173
  120. package/src/swe-arena/fixtures/run-report/factory-agent-eval-309-FSUP0.md +0 -100
  121. package/src/swe-arena/fixtures/run-report/gen3-rollup.json +0 -551
  122. package/src/swe-arena/fixtures/run-report/gen3-rollup.md +0 -64
  123. package/src/swe-arena/fixtures/sup-journal-true.json +0 -19
  124. package/src/swe-arena/fixtures/verify/astropy__astropy-13033.sh +0 -48
  125. package/src/swe-arena/fixtures/verify/django__django-11532.sh +0 -50
  126. package/src/swe-arena/fixtures/verify/matplotlib__matplotlib-20826.sh +0 -76
  127. package/src/swe-arena/fixtures/verify/pydata__xarray-4687.sh +0 -44
  128. package/src/swe-arena/fixtures/verify/pytest-dev__pytest-6197.sh +0 -32
  129. package/src/swe-arena/fixtures/verify/sphinx-doc__sphinx-9658.sh +0 -51
  130. package/src/swe-arena/fixtures/worker-tokens.json +0 -42
  131. package/src/swe-arena/fixtures.ts +0 -237
  132. package/src/swe-arena/gepa-seat.mts +0 -886
  133. package/src/swe-arena/gepa-seat.test.mts +0 -1136
  134. package/src/swe-arena/holdout-certify.mts +0 -408
  135. package/src/swe-arena/holdout-certify.test.mts +0 -160
  136. package/src/swe-arena/implementation-ref.test.mts +0 -64
  137. package/src/swe-arena/implementation-ref.ts +0 -62
  138. package/src/swe-arena/judge-child.mts +0 -37
  139. package/src/swe-arena/ledger-orphans.mts +0 -77
  140. package/src/swe-arena/ledger-orphans.test.mts +0 -149
  141. package/src/swe-arena/manifest.mts +0 -293
  142. package/src/swe-arena/manifest.test.mts +0 -169
  143. package/src/swe-arena/materialize.ts +0 -142
  144. package/src/swe-arena/outer-loop.mts +0 -2854
  145. package/src/swe-arena/outer-loop.test.mts +0 -714
  146. package/src/swe-arena/parity.test.mts +0 -87
  147. package/src/swe-arena/premeasured-from-cells.mts +0 -296
  148. package/src/swe-arena/premeasured-from-cells.test.mts +0 -201
  149. package/src/swe-arena/proc.test.mts +0 -172
  150. package/src/swe-arena/proc.ts +0 -260
  151. package/src/swe-arena/profiles/deepseek-author.profile.json +0 -12
  152. package/src/swe-arena/profiles/default-author.profile.json +0 -12
  153. package/src/swe-arena/proposer-fanout.mts +0 -736
  154. package/src/swe-arena/proposer-fanout.test.mts +0 -660
  155. package/src/swe-arena/proposer-provenance.mts +0 -176
  156. package/src/swe-arena/proposer-provenance.test.mts +0 -106
  157. package/src/swe-arena/reconcile.ts +0 -0
  158. package/src/swe-arena/replay.mts +0 -183
  159. package/src/swe-arena/replay.test.mts +0 -300
  160. package/src/swe-arena/run-experiment.mts +0 -729
  161. package/src/swe-arena/run-report.mts +0 -75
  162. package/src/swe-arena/run-supervisor.mjs +0 -297
  163. package/src/swe-arena/run-supervisor.test.mts +0 -539
  164. package/src/swe-arena/score-split.mts +0 -140
  165. package/src/swe-arena/score-split.test.mts +0 -123
  166. package/src/swe-arena/scratch-worktree-serialization.test.mts +0 -72
  167. package/src/swe-arena/scratch-worktree.test.mts +0 -56
  168. package/src/swe-arena/scratch-worktree.ts +0 -64
  169. package/src/swe-arena/serialized-judge.ts +0 -414
  170. package/src/swe-arena/types.ts +0 -218
@@ -1,210 +0,0 @@
1
- /**
2
- * Unit tests for the diagnosis ensemble: strict-JSON parsing of blind-analyst
3
- * output, and the fusion contract (union + agreement rank; minority findings
4
- * survive marked as competing hypotheses). Pure — no router, no tokens.
5
- */
6
-
7
- import { randomUUID } from 'node:crypto'
8
- import { existsSync } from 'node:fs'
9
- import { tmpdir } from 'node:os'
10
- import { join } from 'node:path'
11
- import { describe, expect, it } from 'vitest'
12
- import {
13
- classSimilarity,
14
- classTokens,
15
- defaultAnalysts,
16
- fuseFindings,
17
- fusedToAnalystFindings,
18
- parseAnalystFindings,
19
- runDiagnosisEnsemble,
20
- surfacesPlacementRegex,
21
- type AnalystRawFinding,
22
- type AnalystReport,
23
- } from './diagnosis-ensemble.ts'
24
-
25
- const finding = (overrides: Partial<AnalystRawFinding>): AnalystRawFinding => ({
26
- failure_class: 'fix placement mismatch',
27
- evidence_quote: 'idna_encode helper added to django/core/mail/message.py',
28
- proposed_direction: 'place the helper where the maintainer tests expect it',
29
- confidence: 0.8,
30
- ...overrides,
31
- })
32
-
33
- const report = (analystId: string, findings: AnalystRawFinding[], ok = true): AnalystReport => ({
34
- analystId,
35
- model: 'glm-5.2',
36
- ok,
37
- findings,
38
- })
39
-
40
- describe('parseAnalystFindings', () => {
41
- it('parses a strict-JSON findings object', () => {
42
- const out = parseAnalystFindings(
43
- JSON.stringify({ findings: [{ failure_class: 'x', evidence_quote: 'q', proposed_direction: 'd', confidence: 0.9 }] }),
44
- )
45
- expect(out).toHaveLength(1)
46
- expect(out[0]!.failure_class).toBe('x')
47
- expect(out[0]!.confidence).toBe(0.9)
48
- })
49
-
50
- it('tolerates markdown fences and surrounding prose', () => {
51
- const text = 'Here is my analysis:\n```json\n{"findings":[{"failure_class":"sandbox env","confidence":1.5}]}\n```\nHope that helps!'
52
- const out = parseAnalystFindings(text)
53
- expect(out).toHaveLength(1)
54
- expect(out[0]!.failure_class).toBe('sandbox env')
55
- // Confidence is clamped to [0,1]; missing quote/direction default to ''.
56
- expect(out[0]!.confidence).toBe(1)
57
- expect(out[0]!.evidence_quote).toBe('')
58
- })
59
-
60
- it('handles braces inside JSON strings', () => {
61
- const out = parseAnalystFindings('{"findings":[{"failure_class":"a","evidence_quote":"code { nested } and \\"quoted\\"","confidence":0.5}]} trailing', )
62
- expect(out[0]!.evidence_quote).toContain('nested')
63
- })
64
-
65
- it('defaults a missing confidence to 0.5', () => {
66
- const out = parseAnalystFindings('{"findings":[{"failure_class":"c"}]}')
67
- expect(out[0]!.confidence).toBe(0.5)
68
- })
69
-
70
- it('throws on no JSON, empty findings, and missing failure_class', () => {
71
- expect(() => parseAnalystFindings('no json here')).toThrow(/no JSON object/)
72
- expect(() => parseAnalystFindings('{"findings":[]}')).toThrow(/no findings array/)
73
- expect(() => parseAnalystFindings('{"findings":[{"evidence_quote":"q"}]}')).toThrow(/failure_class/)
74
- expect(() => parseAnalystFindings('{"findings": [ {"failure_class": "x"')).toThrow(/never closes/)
75
- })
76
- })
77
-
78
- describe('classTokens / classSimilarity', () => {
79
- it('normalizes case, punctuation, and stopwords', () => {
80
- expect(classTokens('The Fix-Placement of mismatch')).toEqual(['fix', 'mismatch', 'placement'])
81
- })
82
- it('scores identical classes 1 and disjoint classes 0', () => {
83
- expect(classSimilarity('fix placement', 'placement fix')).toBe(1)
84
- expect(classSimilarity('sandbox environment', 'judge flake')).toBe(0)
85
- })
86
- })
87
-
88
- describe('fuseFindings', () => {
89
- it('merges same-class findings across analysts and ranks by agreement', () => {
90
- const fused = fuseFindings([
91
- report('a#1', [finding({ failure_class: 'fix placement mismatch' })]),
92
- report('a#2', [
93
- finding({ failure_class: 'placement mismatch of fix', confidence: 0.6 }),
94
- finding({ failure_class: 'budget starvation', evidence_quote: 'spentTokens=60000', confidence: 0.9 }),
95
- ]),
96
- report('a#3', [finding({ failure_class: 'wrong fix placement', confidence: 0.7 })]),
97
- ])
98
- expect(fused[0]!.failure_class).toBe('fix placement mismatch')
99
- expect(fused[0]!.agreement).toBe(3)
100
- expect(fused[0]!.analysts.sort()).toEqual(['a#1', 'a#2', 'a#3'])
101
- expect(fused[0]!.competingHypothesis).toBe(false)
102
- // Union: the minority finding SURVIVES, flagged as a competing hypothesis.
103
- const minority = fused.find((f) => f.failure_class === 'budget starvation')
104
- expect(minority).toBeDefined()
105
- expect(minority!.agreement).toBe(1)
106
- expect(minority!.competingHypothesis).toBe(true)
107
- expect(minority!.evidence[0]).toEqual({ analyst: 'a#2', quote: 'spentTokens=60000' })
108
- })
109
-
110
- it('does not flag a single-analyst run as competing hypothesis', () => {
111
- const fused = fuseFindings([report('solo#1', [finding({})])])
112
- expect(fused[0]!.competingHypothesis).toBe(false)
113
- })
114
-
115
- it('excludes failed analysts from fusion and from the competing denominator', () => {
116
- const fused = fuseFindings([
117
- report('a#1', [finding({})]),
118
- report('a#2', [], false), // failed analyst — no findings admitted
119
- ])
120
- expect(fused).toHaveLength(1)
121
- expect(fused[0]!.agreement).toBe(1)
122
- expect(fused[0]!.competingHypothesis).toBe(false)
123
- })
124
-
125
- it('ranks equal-agreement clusters by mean confidence', () => {
126
- const fused = fuseFindings([
127
- report('a#1', [
128
- finding({ failure_class: 'sandbox import failure', confidence: 0.2 }),
129
- finding({ failure_class: 'judge verdict flake', confidence: 0.95 }),
130
- ]),
131
- ])
132
- expect(fused.map((f) => f.failure_class)).toEqual(['judge verdict flake', 'sandbox import failure'])
133
- })
134
-
135
- it('merges labels that share half their tokens (threshold 0.5)', () => {
136
- const fused = fuseFindings([
137
- report('a#1', [
138
- finding({ failure_class: 'low conf class', confidence: 0.2 }),
139
- finding({ failure_class: 'high conf class', confidence: 0.95 }),
140
- ]),
141
- ])
142
- // 'conf' + 'class' overlap 2 of 4 distinct tokens ⇒ similarity 0.5 ⇒ one cluster.
143
- expect(fused).toHaveLength(1)
144
- })
145
-
146
- it('deduplicates one analyst repeating a class (agreement counts analysts, not findings)', () => {
147
- const fused = fuseFindings([
148
- report('a#1', [finding({}), finding({ confidence: 0.4 })]),
149
- report('a#2', [finding({})]),
150
- ])
151
- expect(fused).toHaveLength(1)
152
- expect(fused[0]!.agreement).toBe(2)
153
- expect(fused[0]!.evidence).toHaveLength(3)
154
- })
155
- })
156
-
157
- describe('fusedToAnalystFindings', () => {
158
- it('emits substrate AnalystFindings with agreement-scaled severity and artifact refs', () => {
159
- const fused = fuseFindings([
160
- report('a#1', [finding({})]),
161
- report('a#2', [finding({}), finding({ failure_class: 'judge flake', confidence: 0.3 })]),
162
- ])
163
- const out = fusedToAnalystFindings(fused, { dirs: ['/runs/x/SUP4'], totalAnalysts: 2 })
164
- expect(out).toHaveLength(2)
165
- const majority = out[0]!
166
- expect(majority.schema_version).toBe('1.0.0')
167
- expect(majority.finding_id.length).toBeGreaterThan(0)
168
- expect(majority.analyst_id).toBe('diagnosis-ensemble')
169
- expect(majority.severity).toBe('high')
170
- expect(majority.area).toBe('failure-diagnosis')
171
- expect(majority.claim).toContain('(2/2 analysts)')
172
- expect(majority.claim).toContain('fix placement mismatch')
173
- expect(majority.evidence_refs[0]).toEqual({ kind: 'artifact', uri: '/runs/x/SUP4' })
174
- const minority = out[1]!
175
- expect(minority.severity).toBe('medium')
176
- expect(minority.claim).toContain('[competing hypothesis]')
177
- })
178
- })
179
-
180
- describe('defaultAnalysts / placement regex', () => {
181
- it('builds N same-model specs with distinct ids', () => {
182
- const specs = defaultAnalysts(3, 'glm-5.2')
183
- expect(specs.map((s) => s.id)).toEqual(['glm-5.2#1', 'glm-5.2#2', 'glm-5.2#3'])
184
- })
185
- it('placement regex catches placement phrasings and misses unrelated classes', () => {
186
- const re = surfacesPlacementRegex()
187
- expect(re.test('fix placement mismatch')).toBe(true)
188
- expect(re.test('the helper belongs in django/utils/encoding.py')).toBe(true)
189
- expect(re.test('worker put the fix in the wrong file')).toBe(true)
190
- expect(surfacesPlacementRegex().test('router 503 storm during brain call')).toBe(false)
191
- })
192
- })
193
-
194
- describe('diagnosis cancellation', () => {
195
- it('does no artifact or analyst work when the parent is already cancelled', async () => {
196
- const scratchDir = join(tmpdir(), `diagnosis-preabort-${randomUUID()}`)
197
- const controller = new AbortController()
198
- const reason = new Error('stop before analyst spend')
199
- controller.abort(reason)
200
-
201
- await expect(runDiagnosisEnsemble({
202
- analysts: [{ id: 'a', model: 'm' }],
203
- runs: [{ iid: 'i', arm: 'sup', dir: scratchDir }],
204
- secrets: { secretsDir: scratchDir, envFiles: [] },
205
- scratchDir,
206
- signal: controller.signal,
207
- })).rejects.toBe(reason)
208
- expect(existsSync(scratchDir)).toBe(false)
209
- })
210
- })