@tangle-network/agent-bench 0.11.2 → 0.13.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (174) hide show
  1. package/CHANGELOG.md +28 -0
  2. package/HARNESS.md +6 -2
  3. package/README.md +1 -4
  4. package/dist/benchmarks/swe-bench.js +4 -9
  5. package/dist/benchmarks/swe-bench.js.map +1 -1
  6. package/package.json +5 -5
  7. package/scripts/run-package-tests.mjs +2 -2
  8. package/src/benchmarks/swe-bench.test.mts +49 -0
  9. package/src/benchmarks/swe-bench.ts +4 -9
  10. package/src/quant-arena/README.md +0 -144
  11. package/src/quant-arena/backtest.test.mts +0 -135
  12. package/src/quant-arena/backtest.ts +0 -218
  13. package/src/quant-arena/data.test.mts +0 -44
  14. package/src/quant-arena/data.ts +0 -141
  15. package/src/quant-arena/driver.test.mts +0 -253
  16. package/src/quant-arena/driver.ts +0 -219
  17. package/src/quant-arena/fixtures/data/PROVENANCE.md +0 -26
  18. package/src/quant-arena/fixtures/data/holdout/IDX.csv +0 -523
  19. package/src/quant-arena/fixtures/data/holdout/S01.csv +0 -523
  20. package/src/quant-arena/fixtures/data/holdout/S02.csv +0 -523
  21. package/src/quant-arena/fixtures/data/holdout/S03.csv +0 -523
  22. package/src/quant-arena/fixtures/data/holdout/S04.csv +0 -523
  23. package/src/quant-arena/fixtures/data/holdout/S05.csv +0 -523
  24. package/src/quant-arena/fixtures/data/holdout/S06.csv +0 -523
  25. package/src/quant-arena/fixtures/data/holdout/S07.csv +0 -523
  26. package/src/quant-arena/fixtures/data/holdout/S08.csv +0 -523
  27. package/src/quant-arena/fixtures/data/holdout/S09.csv +0 -523
  28. package/src/quant-arena/fixtures/data/holdout/S10.csv +0 -523
  29. package/src/quant-arena/fixtures/data/insample/IDX.csv +0 -2087
  30. package/src/quant-arena/fixtures/data/insample/S01.csv +0 -2087
  31. package/src/quant-arena/fixtures/data/insample/S02.csv +0 -2087
  32. package/src/quant-arena/fixtures/data/insample/S03.csv +0 -2087
  33. package/src/quant-arena/fixtures/data/insample/S04.csv +0 -2087
  34. package/src/quant-arena/fixtures/data/insample/S05.csv +0 -2087
  35. package/src/quant-arena/fixtures/data/insample/S06.csv +0 -2087
  36. package/src/quant-arena/fixtures/data/insample/S07.csv +0 -2087
  37. package/src/quant-arena/fixtures/data/insample/S08.csv +0 -2087
  38. package/src/quant-arena/fixtures/data/insample/S09.csv +0 -2087
  39. package/src/quant-arena/fixtures/data/insample/S10.csv +0 -2087
  40. package/src/quant-arena/fixtures/demo-campaign/cost-ledger.jsonl +0 -16
  41. package/src/quant-arena/fixtures/demo-campaign/notebook.jsonl +0 -5
  42. package/src/quant-arena/fixtures/demo-campaign/rollout-manifest.json +0 -171
  43. package/src/quant-arena/fixtures/demo-campaign/strategies/cand-001-default-author/strategy.ts +0 -119
  44. package/src/quant-arena/fixtures/demo-campaign/strategies/cand-002-default-author/strategy.ts +0 -119
  45. package/src/quant-arena/fixtures/demo-campaign/strategies/cand-003-quant-researcher/strategy.ts +0 -105
  46. package/src/quant-arena/fixtures/demo-campaign/strategies/cand-004-quant-researcher/strategy.ts +0 -102
  47. package/src/quant-arena/fixtures/demo-campaign-v2/cost-ledger.jsonl +0 -4
  48. package/src/quant-arena/fixtures/demo-campaign-v2/notebook.jsonl +0 -2
  49. package/src/quant-arena/fixtures/demo-campaign-v2/rollout-manifest.json +0 -84
  50. package/src/quant-arena/fixtures/demo-campaign-v2/strategies/cand-001-quant-researcher/strategy.ts +0 -117
  51. package/src/quant-arena/holdout-certify.mts +0 -206
  52. package/src/quant-arena/holdout-certify.test.mts +0 -82
  53. package/src/quant-arena/leak-audit.test.mts +0 -79
  54. package/src/quant-arena/leak-audit.ts +0 -95
  55. package/src/quant-arena/make-fixtures.mts +0 -161
  56. package/src/quant-arena/multiplicity.test.mts +0 -68
  57. package/src/quant-arena/multiplicity.ts +0 -87
  58. package/src/quant-arena/nautilus-certify.ts +0 -31
  59. package/src/quant-arena/oms.ts +0 -90
  60. package/src/quant-arena/profiles/quant-researcher.profile.json +0 -12
  61. package/src/quant-arena/python/pyproject.toml +0 -8
  62. package/src/quant-arena/python/uv.lock +0 -1297
  63. package/src/quant-arena/python/vbt-worker.py +0 -192
  64. package/src/quant-arena/quant-loop.mts +0 -840
  65. package/src/quant-arena/quant-loop.test.mts +0 -75
  66. package/src/quant-arena/strategies/buy-hold-index/strategy.ts +0 -11
  67. package/src/quant-arena/strategies/equal-weight/strategy.ts +0 -20
  68. package/src/quant-arena/strategies/sma-crossover/strategy.ts +0 -42
  69. package/src/quant-arena/types.ts +0 -133
  70. package/src/quant-arena/vbt-client.ts +0 -321
  71. package/src/quant-arena/vbt-parity.test.mts +0 -183
  72. package/src/quant-arena/windows.test.mts +0 -45
  73. package/src/quant-arena/windows.ts +0 -54
  74. package/src/rollout-ledger/backfill-swe-arena.mts +0 -610
  75. package/src/rollout-ledger/backfill-swe-arena.test.mts +0 -347
  76. package/src/rollout-ledger/settle-capture.mts +0 -448
  77. package/src/rollout-ledger/settle-capture.test.mts +0 -270
  78. package/src/swe-arena/activation.mts +0 -225
  79. package/src/swe-arena/activation.test.mts +0 -300
  80. package/src/swe-arena/analyze.ts +0 -211
  81. package/src/swe-arena/arms.ts +0 -862
  82. package/src/swe-arena/bootstrap-meta.mts +0 -188
  83. package/src/swe-arena/bootstrap-meta.test.mts +0 -51
  84. package/src/swe-arena/briefing.mts +0 -217
  85. package/src/swe-arena/briefing.test.mts +0 -179
  86. package/src/swe-arena/calibrate.ts +0 -217
  87. package/src/swe-arena/capabilities.mts +0 -76
  88. package/src/swe-arena/capabilities.test.mts +0 -57
  89. package/src/swe-arena/capacity.ts +0 -198
  90. package/src/swe-arena/cell-evidence.mts +0 -437
  91. package/src/swe-arena/cell-evidence.test.mts +0 -248
  92. package/src/swe-arena/diagnosis-ensemble.test.mts +0 -210
  93. package/src/swe-arena/diagnosis-ensemble.ts +0 -523
  94. package/src/swe-arena/execution.test.mts +0 -1171
  95. package/src/swe-arena/factory-command-container.ts +0 -284
  96. package/src/swe-arena/factory-judge-child.mts +0 -228
  97. package/src/swe-arena/factory.test.mts +0 -645
  98. package/src/swe-arena/fixtures/analyze.py +0 -80
  99. package/src/swe-arena/fixtures/excludes.txt +0 -8
  100. package/src/swe-arena/fixtures/factory/agent-eval-309/calibration.md +0 -51
  101. package/src/swe-arena/fixtures/factory/agent-eval-309/manifest.json +0 -29
  102. package/src/swe-arena/fixtures/factory/agent-eval-309/spec.md +0 -64
  103. package/src/swe-arena/fixtures/factory/agent-runtime-232/calibration.md +0 -48
  104. package/src/swe-arena/fixtures/factory/agent-runtime-232/manifest.json +0 -29
  105. package/src/swe-arena/fixtures/factory/agent-runtime-232/spec.md +0 -48
  106. package/src/swe-arena/fixtures/factory/loops-28/calibration.md +0 -47
  107. package/src/swe-arena/fixtures/factory/loops-28/manifest.json +0 -30
  108. package/src/swe-arena/fixtures/factory/loops-28/spec.md +0 -50
  109. package/src/swe-arena/fixtures/gen1-salvage/README.md +0 -45
  110. package/src/swe-arena/fixtures/gen1-salvage/cand0-e6d7361.diff +0 -116
  111. package/src/swe-arena/fixtures/gen1-salvage/cand1-76a8590.diff +0 -293
  112. package/src/swe-arena/fixtures/holdout-preregister.log +0 -12
  113. package/src/swe-arena/fixtures/holdout.json +0 -44
  114. package/src/swe-arena/fixtures/instances.json +0 -146
  115. package/src/swe-arena/fixtures/ledger.jsonl +0 -12
  116. package/src/swe-arena/fixtures/patches/pallets__flask-5014.solo.patch +0 -36
  117. package/src/swe-arena/fixtures/patches/pydata__xarray-4687.sup.patch +0 -33
  118. package/src/swe-arena/fixtures/rejudge.jsonl +0 -15
  119. package/src/swe-arena/fixtures/rematch.jsonl +0 -3
  120. package/src/swe-arena/fixtures/rematch2.jsonl +0 -3
  121. package/src/swe-arena/fixtures/rematch3.jsonl +0 -3
  122. package/src/swe-arena/fixtures/run-report/README.md +0 -43
  123. package/src/swe-arena/fixtures/run-report/factory-agent-eval-309-FSUP0.json +0 -173
  124. package/src/swe-arena/fixtures/run-report/factory-agent-eval-309-FSUP0.md +0 -100
  125. package/src/swe-arena/fixtures/run-report/gen3-rollup.json +0 -551
  126. package/src/swe-arena/fixtures/run-report/gen3-rollup.md +0 -64
  127. package/src/swe-arena/fixtures/sup-journal-true.json +0 -19
  128. package/src/swe-arena/fixtures/verify/astropy__astropy-13033.sh +0 -48
  129. package/src/swe-arena/fixtures/verify/django__django-11532.sh +0 -50
  130. package/src/swe-arena/fixtures/verify/matplotlib__matplotlib-20826.sh +0 -76
  131. package/src/swe-arena/fixtures/verify/pydata__xarray-4687.sh +0 -44
  132. package/src/swe-arena/fixtures/verify/pytest-dev__pytest-6197.sh +0 -32
  133. package/src/swe-arena/fixtures/verify/sphinx-doc__sphinx-9658.sh +0 -51
  134. package/src/swe-arena/fixtures/worker-tokens.json +0 -42
  135. package/src/swe-arena/fixtures.ts +0 -237
  136. package/src/swe-arena/gepa-seat.mts +0 -886
  137. package/src/swe-arena/gepa-seat.test.mts +0 -1136
  138. package/src/swe-arena/holdout-certify.mts +0 -408
  139. package/src/swe-arena/holdout-certify.test.mts +0 -160
  140. package/src/swe-arena/implementation-ref.test.mts +0 -64
  141. package/src/swe-arena/implementation-ref.ts +0 -62
  142. package/src/swe-arena/judge-child.mts +0 -37
  143. package/src/swe-arena/ledger-orphans.mts +0 -77
  144. package/src/swe-arena/ledger-orphans.test.mts +0 -149
  145. package/src/swe-arena/manifest.mts +0 -293
  146. package/src/swe-arena/manifest.test.mts +0 -169
  147. package/src/swe-arena/materialize.ts +0 -142
  148. package/src/swe-arena/outer-loop.mts +0 -2854
  149. package/src/swe-arena/outer-loop.test.mts +0 -714
  150. package/src/swe-arena/parity.test.mts +0 -87
  151. package/src/swe-arena/premeasured-from-cells.mts +0 -296
  152. package/src/swe-arena/premeasured-from-cells.test.mts +0 -201
  153. package/src/swe-arena/proc.test.mts +0 -172
  154. package/src/swe-arena/proc.ts +0 -260
  155. package/src/swe-arena/profiles/deepseek-author.profile.json +0 -12
  156. package/src/swe-arena/profiles/default-author.profile.json +0 -12
  157. package/src/swe-arena/proposer-fanout.mts +0 -736
  158. package/src/swe-arena/proposer-fanout.test.mts +0 -660
  159. package/src/swe-arena/proposer-provenance.mts +0 -176
  160. package/src/swe-arena/proposer-provenance.test.mts +0 -106
  161. package/src/swe-arena/reconcile.ts +0 -0
  162. package/src/swe-arena/replay.mts +0 -183
  163. package/src/swe-arena/replay.test.mts +0 -300
  164. package/src/swe-arena/run-experiment.mts +0 -729
  165. package/src/swe-arena/run-report.mts +0 -75
  166. package/src/swe-arena/run-supervisor.mjs +0 -297
  167. package/src/swe-arena/run-supervisor.test.mts +0 -539
  168. package/src/swe-arena/score-split.mts +0 -140
  169. package/src/swe-arena/score-split.test.mts +0 -123
  170. package/src/swe-arena/scratch-worktree-serialization.test.mts +0 -72
  171. package/src/swe-arena/scratch-worktree.test.mts +0 -56
  172. package/src/swe-arena/scratch-worktree.ts +0 -64
  173. package/src/swe-arena/serialized-judge.ts +0 -414
  174. package/src/swe-arena/types.ts +0 -218
@@ -1,210 +0,0 @@
1
- /**
2
- * Unit tests for the diagnosis ensemble: strict-JSON parsing of blind-analyst
3
- * output, and the fusion contract (union + agreement rank; minority findings
4
- * survive marked as competing hypotheses). Pure — no router, no tokens.
5
- */
6
-
7
- import { randomUUID } from 'node:crypto'
8
- import { existsSync } from 'node:fs'
9
- import { tmpdir } from 'node:os'
10
- import { join } from 'node:path'
11
- import { describe, expect, it } from 'vitest'
12
- import {
13
- classSimilarity,
14
- classTokens,
15
- defaultAnalysts,
16
- fuseFindings,
17
- fusedToAnalystFindings,
18
- parseAnalystFindings,
19
- runDiagnosisEnsemble,
20
- surfacesPlacementRegex,
21
- type AnalystRawFinding,
22
- type AnalystReport,
23
- } from './diagnosis-ensemble.ts'
24
-
25
- const finding = (overrides: Partial<AnalystRawFinding>): AnalystRawFinding => ({
26
- failure_class: 'fix placement mismatch',
27
- evidence_quote: 'idna_encode helper added to django/core/mail/message.py',
28
- proposed_direction: 'place the helper where the maintainer tests expect it',
29
- confidence: 0.8,
30
- ...overrides,
31
- })
32
-
33
- const report = (analystId: string, findings: AnalystRawFinding[], ok = true): AnalystReport => ({
34
- analystId,
35
- model: 'glm-5.2',
36
- ok,
37
- findings,
38
- })
39
-
40
- describe('parseAnalystFindings', () => {
41
- it('parses a strict-JSON findings object', () => {
42
- const out = parseAnalystFindings(
43
- JSON.stringify({ findings: [{ failure_class: 'x', evidence_quote: 'q', proposed_direction: 'd', confidence: 0.9 }] }),
44
- )
45
- expect(out).toHaveLength(1)
46
- expect(out[0]!.failure_class).toBe('x')
47
- expect(out[0]!.confidence).toBe(0.9)
48
- })
49
-
50
- it('tolerates markdown fences and surrounding prose', () => {
51
- const text = 'Here is my analysis:\n```json\n{"findings":[{"failure_class":"sandbox env","confidence":1.5}]}\n```\nHope that helps!'
52
- const out = parseAnalystFindings(text)
53
- expect(out).toHaveLength(1)
54
- expect(out[0]!.failure_class).toBe('sandbox env')
55
- // Confidence is clamped to [0,1]; missing quote/direction default to ''.
56
- expect(out[0]!.confidence).toBe(1)
57
- expect(out[0]!.evidence_quote).toBe('')
58
- })
59
-
60
- it('handles braces inside JSON strings', () => {
61
- const out = parseAnalystFindings('{"findings":[{"failure_class":"a","evidence_quote":"code { nested } and \\"quoted\\"","confidence":0.5}]} trailing', )
62
- expect(out[0]!.evidence_quote).toContain('nested')
63
- })
64
-
65
- it('defaults a missing confidence to 0.5', () => {
66
- const out = parseAnalystFindings('{"findings":[{"failure_class":"c"}]}')
67
- expect(out[0]!.confidence).toBe(0.5)
68
- })
69
-
70
- it('throws on no JSON, empty findings, and missing failure_class', () => {
71
- expect(() => parseAnalystFindings('no json here')).toThrow(/no JSON object/)
72
- expect(() => parseAnalystFindings('{"findings":[]}')).toThrow(/no findings array/)
73
- expect(() => parseAnalystFindings('{"findings":[{"evidence_quote":"q"}]}')).toThrow(/failure_class/)
74
- expect(() => parseAnalystFindings('{"findings": [ {"failure_class": "x"')).toThrow(/never closes/)
75
- })
76
- })
77
-
78
- describe('classTokens / classSimilarity', () => {
79
- it('normalizes case, punctuation, and stopwords', () => {
80
- expect(classTokens('The Fix-Placement of mismatch')).toEqual(['fix', 'mismatch', 'placement'])
81
- })
82
- it('scores identical classes 1 and disjoint classes 0', () => {
83
- expect(classSimilarity('fix placement', 'placement fix')).toBe(1)
84
- expect(classSimilarity('sandbox environment', 'judge flake')).toBe(0)
85
- })
86
- })
87
-
88
- describe('fuseFindings', () => {
89
- it('merges same-class findings across analysts and ranks by agreement', () => {
90
- const fused = fuseFindings([
91
- report('a#1', [finding({ failure_class: 'fix placement mismatch' })]),
92
- report('a#2', [
93
- finding({ failure_class: 'placement mismatch of fix', confidence: 0.6 }),
94
- finding({ failure_class: 'budget starvation', evidence_quote: 'spentTokens=60000', confidence: 0.9 }),
95
- ]),
96
- report('a#3', [finding({ failure_class: 'wrong fix placement', confidence: 0.7 })]),
97
- ])
98
- expect(fused[0]!.failure_class).toBe('fix placement mismatch')
99
- expect(fused[0]!.agreement).toBe(3)
100
- expect(fused[0]!.analysts.sort()).toEqual(['a#1', 'a#2', 'a#3'])
101
- expect(fused[0]!.competingHypothesis).toBe(false)
102
- // Union: the minority finding SURVIVES, flagged as a competing hypothesis.
103
- const minority = fused.find((f) => f.failure_class === 'budget starvation')
104
- expect(minority).toBeDefined()
105
- expect(minority!.agreement).toBe(1)
106
- expect(minority!.competingHypothesis).toBe(true)
107
- expect(minority!.evidence[0]).toEqual({ analyst: 'a#2', quote: 'spentTokens=60000' })
108
- })
109
-
110
- it('does not flag a single-analyst run as competing hypothesis', () => {
111
- const fused = fuseFindings([report('solo#1', [finding({})])])
112
- expect(fused[0]!.competingHypothesis).toBe(false)
113
- })
114
-
115
- it('excludes failed analysts from fusion and from the competing denominator', () => {
116
- const fused = fuseFindings([
117
- report('a#1', [finding({})]),
118
- report('a#2', [], false), // failed analyst — no findings admitted
119
- ])
120
- expect(fused).toHaveLength(1)
121
- expect(fused[0]!.agreement).toBe(1)
122
- expect(fused[0]!.competingHypothesis).toBe(false)
123
- })
124
-
125
- it('ranks equal-agreement clusters by mean confidence', () => {
126
- const fused = fuseFindings([
127
- report('a#1', [
128
- finding({ failure_class: 'sandbox import failure', confidence: 0.2 }),
129
- finding({ failure_class: 'judge verdict flake', confidence: 0.95 }),
130
- ]),
131
- ])
132
- expect(fused.map((f) => f.failure_class)).toEqual(['judge verdict flake', 'sandbox import failure'])
133
- })
134
-
135
- it('merges labels that share half their tokens (threshold 0.5)', () => {
136
- const fused = fuseFindings([
137
- report('a#1', [
138
- finding({ failure_class: 'low conf class', confidence: 0.2 }),
139
- finding({ failure_class: 'high conf class', confidence: 0.95 }),
140
- ]),
141
- ])
142
- // 'conf' + 'class' overlap 2 of 4 distinct tokens ⇒ similarity 0.5 ⇒ one cluster.
143
- expect(fused).toHaveLength(1)
144
- })
145
-
146
- it('deduplicates one analyst repeating a class (agreement counts analysts, not findings)', () => {
147
- const fused = fuseFindings([
148
- report('a#1', [finding({}), finding({ confidence: 0.4 })]),
149
- report('a#2', [finding({})]),
150
- ])
151
- expect(fused).toHaveLength(1)
152
- expect(fused[0]!.agreement).toBe(2)
153
- expect(fused[0]!.evidence).toHaveLength(3)
154
- })
155
- })
156
-
157
- describe('fusedToAnalystFindings', () => {
158
- it('emits substrate AnalystFindings with agreement-scaled severity and artifact refs', () => {
159
- const fused = fuseFindings([
160
- report('a#1', [finding({})]),
161
- report('a#2', [finding({}), finding({ failure_class: 'judge flake', confidence: 0.3 })]),
162
- ])
163
- const out = fusedToAnalystFindings(fused, { dirs: ['/runs/x/SUP4'], totalAnalysts: 2 })
164
- expect(out).toHaveLength(2)
165
- const majority = out[0]!
166
- expect(majority.schema_version).toBe('1.0.0')
167
- expect(majority.finding_id.length).toBeGreaterThan(0)
168
- expect(majority.analyst_id).toBe('diagnosis-ensemble')
169
- expect(majority.severity).toBe('high')
170
- expect(majority.area).toBe('failure-diagnosis')
171
- expect(majority.claim).toContain('(2/2 analysts)')
172
- expect(majority.claim).toContain('fix placement mismatch')
173
- expect(majority.evidence_refs[0]).toEqual({ kind: 'artifact', uri: '/runs/x/SUP4' })
174
- const minority = out[1]!
175
- expect(minority.severity).toBe('medium')
176
- expect(minority.claim).toContain('[competing hypothesis]')
177
- })
178
- })
179
-
180
- describe('defaultAnalysts / placement regex', () => {
181
- it('builds N same-model specs with distinct ids', () => {
182
- const specs = defaultAnalysts(3, 'glm-5.2')
183
- expect(specs.map((s) => s.id)).toEqual(['glm-5.2#1', 'glm-5.2#2', 'glm-5.2#3'])
184
- })
185
- it('placement regex catches placement phrasings and misses unrelated classes', () => {
186
- const re = surfacesPlacementRegex()
187
- expect(re.test('fix placement mismatch')).toBe(true)
188
- expect(re.test('the helper belongs in django/utils/encoding.py')).toBe(true)
189
- expect(re.test('worker put the fix in the wrong file')).toBe(true)
190
- expect(surfacesPlacementRegex().test('router 503 storm during brain call')).toBe(false)
191
- })
192
- })
193
-
194
- describe('diagnosis cancellation', () => {
195
- it('does no artifact or analyst work when the parent is already cancelled', async () => {
196
- const scratchDir = join(tmpdir(), `diagnosis-preabort-${randomUUID()}`)
197
- const controller = new AbortController()
198
- const reason = new Error('stop before analyst spend')
199
- controller.abort(reason)
200
-
201
- await expect(runDiagnosisEnsemble({
202
- analysts: [{ id: 'a', model: 'm' }],
203
- runs: [{ iid: 'i', arm: 'sup', dir: scratchDir }],
204
- secrets: { secretsDir: scratchDir, envFiles: [] },
205
- scratchDir,
206
- signal: controller.signal,
207
- })).rejects.toBe(reason)
208
- expect(existsSync(scratchDir)).toBe(false)
209
- })
210
- })