@thincoder/core 0.9.1
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/abort-provenance.mjs +116 -0
- package/advisor/citations.mjs +139 -0
- package/advisor/compaction.mjs +174 -0
- package/advisor/convergence.mjs +80 -0
- package/advisor/history.mjs +77 -0
- package/advisor/loop.mjs +288 -0
- package/advisor/messages.mjs +299 -0
- package/advisor/notice.mjs +141 -0
- package/advisor/project-context.mjs +197 -0
- package/advisor/repos.mjs +150 -0
- package/advisor/run.mjs +190 -0
- package/advisor/truncate.mjs +57 -0
- package/advisor.mjs +281 -0
- package/agent/child-marks.mjs +24 -0
- package/agent/completion.mjs +145 -0
- package/agent/dispatch.mjs +493 -0
- package/agent/family-tools.mjs +174 -0
- package/agent/helpers.mjs +412 -0
- package/agent/post-turn.mjs +70 -0
- package/agent/record-results.mjs +174 -0
- package/agent/relay-prefix.mjs +39 -0
- package/agent/run-stages.mjs +244 -0
- package/agent/setup-reminders.mjs +199 -0
- package/agent/setup.mjs +234 -0
- package/agent/spawn-child.mjs +258 -0
- package/agent/suspension.mjs +240 -0
- package/agent/write-gate.mjs +87 -0
- package/agent-tools/advisor-async.mjs +481 -0
- package/agent-tools/advisor-settle.mjs +240 -0
- package/agent-tools/advisor.mjs +280 -0
- package/agent-tools/async-discard.mjs +143 -0
- package/agent-tools/async-settle.mjs +299 -0
- package/agent-tools/batch-segment.mjs +265 -0
- package/agent-tools/child-permission.mjs +45 -0
- package/agent-tools/consult.mjs +471 -0
- package/agent-tools/design-token.mjs +117 -0
- package/agent-tools/digest-budget.mjs +76 -0
- package/agent-tools/eng.mjs +102 -0
- package/agent-tools/escalate-async.mjs +302 -0
- package/agent-tools/goal.mjs +119 -0
- package/agent-tools/panel-blocks.mjs +24 -0
- package/agent-tools/parent-channel.mjs +231 -0
- package/agent-tools/plan.mjs +86 -0
- package/agent-tools/read-history.mjs +309 -0
- package/agent-tools/recent-changes.mjs +24 -0
- package/agent-tools/review-facts.mjs +31 -0
- package/agent-tools/settings.mjs +268 -0
- package/agent-tools/skill.mjs +63 -0
- package/agent-tools/spawn-gates.mjs +109 -0
- package/agent-tools/subagent-actions.mjs +496 -0
- package/agent-tools/subagent-async.mjs +456 -0
- package/agent-tools/subagent-panel.mjs +160 -0
- package/agent-tools/subagent-run.mjs +208 -0
- package/agent-tools/subagent-scheduler.mjs +446 -0
- package/agent-tools/subagent-spawn.mjs +478 -0
- package/agent-tools/subagent.mjs +419 -0
- package/agent-tools/task.mjs +87 -0
- package/agent-tools/timer.mjs +46 -0
- package/agent-tools/verify.mjs +295 -0
- package/agent-tools.mjs +23 -0
- package/agent.mjs +430 -0
- package/auto-think.mjs +115 -0
- package/compress-form.mjs +24 -0
- package/config-io.mjs +277 -0
- package/config-migrate.mjs +178 -0
- package/config-presets.mjs +49 -0
- package/config.mjs +419 -0
- package/context.mjs +495 -0
- package/conventions.mjs +223 -0
- package/embedding.mjs +120 -0
- package/escape.mjs +152 -0
- package/expand-home.mjs +16 -0
- package/explore-distill.mjs +152 -0
- package/generate-title.mjs +123 -0
- package/git/checkpoint.mjs +448 -0
- package/git/gitmem.mjs +100 -0
- package/history-window.mjs +179 -0
- package/hooks.mjs +108 -0
- package/i18n.mjs +106 -0
- package/index-bin.mjs +48 -0
- package/index-discover.mjs +176 -0
- package/ledger-cmd.mjs +209 -0
- package/ledger-db.mjs +86 -0
- package/ledger-surface.mjs +76 -0
- package/ledger.mjs +202 -0
- package/log.mjs +195 -0
- package/manifest.mjs +338 -0
- package/markdown.mjs +106 -0
- package/mcp/helpers.mjs +51 -0
- package/mcp/transport-http.mjs +248 -0
- package/mcp/transport-stdio.mjs +140 -0
- package/mcp/transport-ws.mjs +122 -0
- package/mcp.mjs +295 -0
- package/memory/code-index.mjs +219 -0
- package/memory/code-sync.mjs +427 -0
- package/memory/core.mjs +318 -0
- package/memory/delete.mjs +242 -0
- package/memory/docs.mjs +431 -0
- package/memory/file-walk.mjs +109 -0
- package/memory/origin.mjs +24 -0
- package/memory/scan.mjs +177 -0
- package/memory/schema.mjs +460 -0
- package/memory.mjs +21 -0
- package/model-ref.mjs +66 -0
- package/model-specs.mjs +277 -0
- package/package.json +32 -0
- package/peer-domains.mjs +265 -0
- package/peer-instances.mjs +178 -0
- package/permission.mjs +79 -0
- package/process-probe.mjs +315 -0
- package/prompt-files.mjs +113 -0
- package/prompt-overlays.mjs +78 -0
- package/prompts/advisor-design.md +43 -0
- package/prompts/advisor-round1.md +41 -0
- package/prompts/advisor-round2.md +46 -0
- package/prompts/advisor-round3.md +42 -0
- package/prompts/common.md +158 -0
- package/prompts/consult-base.md +19 -0
- package/prompts/discipline-engineering.md +123 -0
- package/prompts/discipline-normal.md +206 -0
- package/prompts/persona-coder.md +21 -0
- package/prompts/persona-eng-coder.md +41 -0
- package/prompts/persona-eng-designer.md +80 -0
- package/prompts/persona-engineering.md +160 -0
- package/prompts/persona-explore.md +15 -0
- package/prompts/persona-normal.md +35 -0
- package/prompts/persona-plan.md +27 -0
- package/provider/anthropic.mjs +225 -0
- package/provider/core.mjs +491 -0
- package/provider/errors.mjs +101 -0
- package/provider/google.mjs +257 -0
- package/provider/index.mjs +7 -0
- package/provider/list-models.mjs +163 -0
- package/provider/normalize.mjs +81 -0
- package/provider/rate.mjs +168 -0
- package/provider/responses.mjs +495 -0
- package/provider/retry.mjs +88 -0
- package/provider/sse.mjs +264 -0
- package/provider/wait-status.mjs +59 -0
- package/proxy.mjs +274 -0
- package/rules.mjs +53 -0
- package/session-gc.mjs +248 -0
- package/session-guard.mjs +59 -0
- package/session-lifecycle.mjs +305 -0
- package/session-migrate.mjs +48 -0
- package/session-rename.mjs +38 -0
- package/session-segments.mjs +99 -0
- package/session-slot-write.mjs +168 -0
- package/session-slots-manifest.mjs +264 -0
- package/session-slots.mjs +298 -0
- package/session-store.mjs +441 -0
- package/session.mjs +244 -0
- package/skills.mjs +234 -0
- package/text-budget.mjs +79 -0
- package/token-ttl.mjs +285 -0
- package/tool-docs/apply_patch.md +15 -0
- package/tool-docs/bash.md +38 -0
- package/tool-docs/delete.md +13 -0
- package/tool-docs/edit.md +30 -0
- package/tool-docs/execute.md +21 -0
- package/tool-docs/fetch.md +12 -0
- package/tool-docs/file_ops.md +17 -0
- package/tool-docs/get_current_time.md +8 -0
- package/tool-docs/git.md +54 -0
- package/tool-docs/glob.md +11 -0
- package/tool-docs/grep.md +19 -0
- package/tool-docs/hashline_edit.md +14 -0
- package/tool-docs/insert_after.md +15 -0
- package/tool-docs/lint.md +10 -0
- package/tool-docs/ls.md +12 -0
- package/tool-docs/lsp.md +10 -0
- package/tool-docs/process.md +10 -0
- package/tool-docs/question.md +16 -0
- package/tool-docs/read.md +20 -0
- package/tool-docs/read_image.md +8 -0
- package/tool-docs/tree.md +14 -0
- package/tool-docs/wait_for.md +22 -0
- package/tool-docs/websearch.md +16 -0
- package/tool-docs/write.md +11 -0
- package/tools/bash.mjs +276 -0
- package/tools/edit-batch.mjs +204 -0
- package/tools/edit-diff.mjs +388 -0
- package/tools/exec-run.mjs +43 -0
- package/tools/execute.mjs +243 -0
- package/tools/file.mjs +464 -0
- package/tools/git-checkpoint.mjs +143 -0
- package/tools/git-ext.mjs +173 -0
- package/tools/git.mjs +415 -0
- package/tools/glob-dialect.mjs +130 -0
- package/tools/index.mjs +76 -0
- package/tools/linter.mjs +120 -0
- package/tools/lsp.mjs +335 -0
- package/tools/ops.mjs +293 -0
- package/tools/patch.mjs +290 -0
- package/tools/question.mjs +26 -0
- package/tools/repomap.mjs +314 -0
- package/tools/search.mjs +248 -0
- package/tools/shared.mjs +467 -0
- package/tools/tree.mjs +81 -0
- package/tools/web.mjs +224 -0
- package/tools/write-path.mjs +191 -0
- package/traces/trace-store.mjs +303 -0
- package/undo-stack.mjs +47 -0
|
@@ -0,0 +1,427 @@
|
|
|
1
|
+
/**
|
|
2
|
+
* memory/code-sync.mjs — code index sync, retrieval, incremental update
|
|
3
|
+
*/
|
|
4
|
+
import { readFile, stat } from "node:fs/promises"
|
|
5
|
+
import { join, relative } from "node:path"
|
|
6
|
+
import { embed, cosine, toBlob, fromBlob } from "../embedding.mjs"
|
|
7
|
+
import { scanVectors, createTopK } from "./scan.mjs"
|
|
8
|
+
import { normalizeOrigin } from "./origin.mjs"
|
|
9
|
+
import { CODE_EXTS, DOC_EXTS, MAX_CODE_FILE_BYTES, MAX_DOC_FILE_BYTES } from "./schema.mjs"
|
|
10
|
+
import { buildFtsQuery, ensureEmbeddings, EMBED_TEXT_MAX_LEN } from "./core.mjs"
|
|
11
|
+
import { detectLanguage, _upsertCodeFile, _upsertDocFile, yieldTick } from "./code-index.mjs"
|
|
12
|
+
import { walkProjectFiles, isSkippedRelPath, extensionOf, createUnlistedTally, MAX_WALK_FILES } from "./file-walk.mjs"
|
|
13
|
+
import { loadConventions } from "../conventions.mjs"
|
|
14
|
+
import { logEvent } from "../log.mjs"
|
|
15
|
+
import { safeSliceUTF16 } from "../text-budget.mjs"
|
|
16
|
+
|
|
17
|
+
const DIFF_FULL_SYNC_THRESHOLD = 200
|
|
18
|
+
const CODE_EMBED_BATCH = 64
|
|
19
|
+
|
|
20
|
+
/**
|
|
21
|
+
* Index extension sets = built-in tables ∪ project declaration
|
|
22
|
+
* (`.thincoder/conventions.json` → index.codeExtensions / index.docExtensions;
|
|
23
|
+
* PORTABILITY PO-9/§3.7 — a project may declare extensions this product does not
|
|
24
|
+
* ship a default for). Declaration only ADDS (union), never removes.
|
|
25
|
+
*/
|
|
26
|
+
export function indexExtensions(dir) {
|
|
27
|
+
const conv = loadConventions(dir)
|
|
28
|
+
return {
|
|
29
|
+
code: new Set([...CODE_EXTS, ...conv.index.codeExtensions]),
|
|
30
|
+
doc: new Set([...DOC_EXTS, ...conv.index.docExtensions]),
|
|
31
|
+
}
|
|
32
|
+
}
|
|
33
|
+
|
|
34
|
+
/**
|
|
35
|
+
* git-driven incremental indexing: use git diff to find files changed since
|
|
36
|
+
* the last index, and only rebuild FTS5 chunks for those files (vectors are untouched).
|
|
37
|
+
* An order of magnitude faster than full mtime scanning.
|
|
38
|
+
* Returns { updated, removed, skipped } or null (git unavailable).
|
|
39
|
+
*/
|
|
40
|
+
export async function gitSync(memory, dir, { onProgress } = {}) {
|
|
41
|
+
const origin = normalizeOrigin(dir) // §6.11 写缝归一(git / 文件 I/O 用原样 dir;库面 origin 一律归一值)
|
|
42
|
+
const { execFile: _execFile } = await import("node:child_process")
|
|
43
|
+
const { code: codeExts, doc: docExts } = indexExtensions(dir)
|
|
44
|
+
const gitRun = (args) => new Promise((resolve, reject) => {
|
|
45
|
+
_execFile("git", args, { cwd: dir, encoding: "utf8", timeout: 10000, windowsHide: true }, (err, stdout) => {
|
|
46
|
+
if (err) reject(err); else resolve(stdout)
|
|
47
|
+
})
|
|
48
|
+
})
|
|
49
|
+
const mergeDiff = (text) => text.trim().split("\n").filter(Boolean)
|
|
50
|
+
|
|
51
|
+
let head
|
|
52
|
+
try { head = (await gitRun(["rev-parse", "HEAD"])).trim() } catch { return null }
|
|
53
|
+
|
|
54
|
+
const stored = memory.db.prepare(`SELECT value FROM meta WHERE key = 'last_indexed_commit'`).get()?.value
|
|
55
|
+
if (!stored) return null
|
|
56
|
+
|
|
57
|
+
let diffOut
|
|
58
|
+
try {
|
|
59
|
+
const committed = mergeDiff(await gitRun(["diff", "--name-only", "--diff-filter=ACMRTD", stored, "HEAD"]))
|
|
60
|
+
const dirty = mergeDiff(await gitRun(["diff", "--name-only", "--diff-filter=ACMRTD"]))
|
|
61
|
+
const lines = [...new Set([...committed, ...dirty])]
|
|
62
|
+
diffOut = lines
|
|
63
|
+
} catch {
|
|
64
|
+
return null
|
|
65
|
+
}
|
|
66
|
+
|
|
67
|
+
if (diffOut.length > DIFF_FULL_SYNC_THRESHOLD) {
|
|
68
|
+
// diff too large, incremental is useless — fall back to full sync and update anchor
|
|
69
|
+
await codeSync(memory, dir, { onProgress })
|
|
70
|
+
const { docSync } = await import("./docs.mjs")
|
|
71
|
+
await docSync(memory, dir, { onProgress })
|
|
72
|
+
return { updated: -1, removed: 0, skipped: 0, failed: 0, errors: [], fallback: true }
|
|
73
|
+
}
|
|
74
|
+
|
|
75
|
+
let updated = 0, removed = 0, skipped = 0, failed = 0
|
|
76
|
+
const errors = []
|
|
77
|
+
for (let i = 0; i < diffOut.length; i++) {
|
|
78
|
+
const rel = diffOut[i].replaceAll("\\", "/")
|
|
79
|
+
const abs = join(dir, rel)
|
|
80
|
+
const ext = extensionOf(rel)
|
|
81
|
+
|
|
82
|
+
if (isSkippedRelPath(rel)) continue
|
|
83
|
+
|
|
84
|
+
if (!codeExts.has(ext) && !docExts.has(ext)) { skipped++; continue }
|
|
85
|
+
|
|
86
|
+
try {
|
|
87
|
+
const text = await readFile(abs, "utf8")
|
|
88
|
+
const lines = text.split("\n")
|
|
89
|
+
if (codeExts.has(ext)) {
|
|
90
|
+
const lang = detectLanguage(abs)
|
|
91
|
+
let mtimeMs = 0
|
|
92
|
+
try { mtimeMs = Math.floor((await stat(abs)).mtimeMs) } catch { /* new file */ }
|
|
93
|
+
_upsertCodeFile(memory, origin, rel, lines, lang, mtimeMs)
|
|
94
|
+
} else {
|
|
95
|
+
let mtimeMs = 0
|
|
96
|
+
try { mtimeMs = Math.floor((await stat(abs)).mtimeMs) } catch { /* new file */ }
|
|
97
|
+
_upsertDocFile(memory, origin, rel, lines, mtimeMs)
|
|
98
|
+
}
|
|
99
|
+
updated++
|
|
100
|
+
} catch (e) {
|
|
101
|
+
const isDeleted = e.code === "ENOENT"
|
|
102
|
+
if (isDeleted) {
|
|
103
|
+
if (codeExts.has(ext)) memory.db.prepare(`DELETE FROM code_chunks WHERE origin = ? AND path = ?`).run(origin, rel)
|
|
104
|
+
else memory.db.prepare(`DELETE FROM doc_chunks WHERE origin = ? AND path = ?`).run(origin, rel)
|
|
105
|
+
removed++
|
|
106
|
+
} else {
|
|
107
|
+
failed++
|
|
108
|
+
if (errors.length < 5) errors.push(`${rel}: ${e.message}`)
|
|
109
|
+
}
|
|
110
|
+
}
|
|
111
|
+
await yieldTick()
|
|
112
|
+
if (onProgress && i % 5 === 0) {
|
|
113
|
+
onProgress({ phase: "index", current: i + 1, total: diffOut.length, updated, removed, skipped })
|
|
114
|
+
}
|
|
115
|
+
}
|
|
116
|
+
|
|
117
|
+
if (failed === 0) {
|
|
118
|
+
memory.db.prepare(`INSERT INTO meta (key, value) VALUES ('last_indexed_commit', ?)
|
|
119
|
+
ON CONFLICT (key) DO UPDATE SET value = excluded.value`).run(head)
|
|
120
|
+
}
|
|
121
|
+
|
|
122
|
+
onProgress?.({ phase: "done", total: diffOut.length, updated, removed, skipped, failed })
|
|
123
|
+
return { updated, removed, skipped, failed, errors }
|
|
124
|
+
}
|
|
125
|
+
|
|
126
|
+
/**
|
|
127
|
+
* List project files matching the given extensions.
|
|
128
|
+
* Preferred source = git (`git ls-files --cached --others --exclude-standard`:
|
|
129
|
+
* tracked + untracked-not-ignored, .gitignore respected). Projects WITHOUT git
|
|
130
|
+
* fall back to a filesystem walk (PORTABILITY FR15/P8) — before, the index was
|
|
131
|
+
* silently empty there. The walk cannot honour .gitignore (no git → no such
|
|
132
|
+
* concept) and skips the shared SKIP_DIRS/dot-directory set instead.
|
|
133
|
+
* Returns { entries, unlisted }: `entries` = { abs, rel } pairs (rel relative to
|
|
134
|
+
* dir); `unlisted` = files whose extension is in NO index list (count + sample),
|
|
135
|
+
* the visible signal behind "my .xyz files are not searchable" (PORTABILITY PO-9).
|
|
136
|
+
* `truncated` = the non-git walk hit its file cap (capped trees are logged, never
|
|
137
|
+
* silently indexed-partial). opts.maxFiles = the walk cap (test seam).
|
|
138
|
+
*/
|
|
139
|
+
export async function listProjectFiles(dir, exts, { maxFiles } = {}) {
|
|
140
|
+
const { execFile: _execFile } = await import("node:child_process")
|
|
141
|
+
const { join: joinPath } = await import("node:path")
|
|
142
|
+
const { code, doc } = indexExtensions(dir)
|
|
143
|
+
const tally = createUnlistedTally(new Set([...code, ...doc]))
|
|
144
|
+
|
|
145
|
+
const files = []
|
|
146
|
+
const finish = (truncated = false) => ({ entries: files, unlisted: tally.result(), truncated })
|
|
147
|
+
|
|
148
|
+
// Git listing when available; a non-git project falls through to the walk.
|
|
149
|
+
let gitTop
|
|
150
|
+
try {
|
|
151
|
+
gitTop = (await new Promise((resolve, reject) => {
|
|
152
|
+
_execFile("git", ["rev-parse", "--show-toplevel"], { cwd: dir, encoding: "utf8", timeout: 5000, windowsHide: true },
|
|
153
|
+
(err, stdout) => { if (err) reject(err); else resolve(stdout.trim()) })
|
|
154
|
+
})).replace(/\\/g, "/")
|
|
155
|
+
} catch {
|
|
156
|
+
// Not a git repo → filesystem walk (FR15: the index must still be usable).
|
|
157
|
+
const walked = await walkProjectFiles(dir, exts, { knownExts: new Set([...code, ...doc]), ...(maxFiles !== undefined ? { maxFiles } : {}) })
|
|
158
|
+
files.push(...walked.files)
|
|
159
|
+
// The walk's cap must stay visible end-to-end (file-walk.mjs: "never silently
|
|
160
|
+
// dropped") — a capped listing says so in the log, not only in a discarded flag.
|
|
161
|
+
if (walked.truncated) {
|
|
162
|
+
logEvent("index:truncated", { dir, files: walked.files.length, maxFiles: maxFiles ?? MAX_WALK_FILES })
|
|
163
|
+
}
|
|
164
|
+
return { entries: files, unlisted: walked.unlisted, truncated: walked.truncated }
|
|
165
|
+
}
|
|
166
|
+
|
|
167
|
+
try {
|
|
168
|
+
const raw = await new Promise((resolve, reject) => {
|
|
169
|
+
_execFile("git", ["ls-files", "--cached", "--others", "--exclude-standard"],
|
|
170
|
+
{ cwd: dir, encoding: "utf8", timeout: 15000, windowsHide: true, maxBuffer: 10 * 1024 * 1024 },
|
|
171
|
+
(err, stdout) => { if (err) reject(err); else resolve(stdout) })
|
|
172
|
+
})
|
|
173
|
+
for (const line of raw.trim().split("\n")) {
|
|
174
|
+
const p = line.trim()
|
|
175
|
+
if (!p) continue
|
|
176
|
+
const rel = p.replace(/\\/g, "/")
|
|
177
|
+
if (isSkippedRelPath(rel)) continue
|
|
178
|
+
const ext = extensionOf(rel)
|
|
179
|
+
if (!ext || !exts.has(ext)) { tally.note(rel); continue }
|
|
180
|
+
files.push({ abs: joinPath(dir, rel), rel })
|
|
181
|
+
}
|
|
182
|
+
} catch { /* ls-files failed */ }
|
|
183
|
+
|
|
184
|
+
return finish()
|
|
185
|
+
}
|
|
186
|
+
|
|
187
|
+
|
|
188
|
+
/**
|
|
189
|
+
* Sync code index: scan all source files under dir → chunk → upsert into code_chunks.
|
|
190
|
+
* Incremental by mtime — only rebuilds chunks for files that have changed.
|
|
191
|
+
*/
|
|
192
|
+
export async function codeSync(memory, dir, { onProgress } = {}) {
|
|
193
|
+
const origin = normalizeOrigin(dir) // §6.11 写缝归一(遍历/git I/O 用原样 dir;库面 origin 一律归一值)
|
|
194
|
+
const { code: exts } = indexExtensions(dir)
|
|
195
|
+
const { entries, unlisted } = await listProjectFiles(dir, exts)
|
|
196
|
+
const files = [] // { abs, rel, mtimeMs }
|
|
197
|
+
let overSizeSkipped = 0
|
|
198
|
+
for (const { abs, rel } of entries) {
|
|
199
|
+
let st
|
|
200
|
+
try { st = await stat(abs) } catch { continue }
|
|
201
|
+
if (st.size > MAX_CODE_FILE_BYTES) { overSizeSkipped++; continue }
|
|
202
|
+
files.push({ abs, rel, mtimeMs: Math.floor(st.mtimeMs) })
|
|
203
|
+
}
|
|
204
|
+
|
|
205
|
+
const indexed = new Map(
|
|
206
|
+
memory.db.prepare(`SELECT path, mtime_ms FROM code_chunks WHERE origin = ?`).all(origin).map((r) => [r.path, r.mtime_ms])
|
|
207
|
+
)
|
|
208
|
+
const seen = new Set()
|
|
209
|
+
|
|
210
|
+
onProgress?.({ phase: "scan", total: files.length, overSizeSkipped })
|
|
211
|
+
|
|
212
|
+
let updated = 0, removed = 0, skipped = 0, failed = 0
|
|
213
|
+
const errors = []
|
|
214
|
+
for (let i = 0; i < files.length; i++) {
|
|
215
|
+
const { abs, rel, mtimeMs } = files[i]
|
|
216
|
+
seen.add(rel)
|
|
217
|
+
|
|
218
|
+
if (indexed.get(rel) === mtimeMs) {
|
|
219
|
+
skipped++
|
|
220
|
+
continue
|
|
221
|
+
}
|
|
222
|
+
|
|
223
|
+
try {
|
|
224
|
+
const text = await readFile(abs, "utf8")
|
|
225
|
+
const lines = text.split("\n")
|
|
226
|
+
const lang = detectLanguage(abs)
|
|
227
|
+
_upsertCodeFile(memory, origin, rel, lines, lang, mtimeMs)
|
|
228
|
+
updated++
|
|
229
|
+
} catch (e) {
|
|
230
|
+
failed++
|
|
231
|
+
if (errors.length < 5) errors.push(`${rel}: ${e.message}`)
|
|
232
|
+
}
|
|
233
|
+
await yieldTick()
|
|
234
|
+
|
|
235
|
+
if (onProgress && i % 10 === 0) {
|
|
236
|
+
onProgress({ phase: "index", current: i + 1, total: files.length, updated, removed, skipped, failed })
|
|
237
|
+
}
|
|
238
|
+
}
|
|
239
|
+
|
|
240
|
+
for (const stale of indexed.keys()) {
|
|
241
|
+
if (!seen.has(stale)) {
|
|
242
|
+
memory.db.prepare(`DELETE FROM code_chunks WHERE origin = ? AND path = ?`).run(origin, stale)
|
|
243
|
+
removed++
|
|
244
|
+
}
|
|
245
|
+
}
|
|
246
|
+
|
|
247
|
+
onProgress?.({ phase: "done", total: files.length, updated, removed, skipped, failed, overSizeSkipped })
|
|
248
|
+
markIndexedCommit(memory, dir)
|
|
249
|
+
if (unlisted.count > 0) {
|
|
250
|
+
logEvent("index:unlisted", { dir, kind: "code", count: unlisted.count, exts: unlisted.exts.map((e) => e.ext) })
|
|
251
|
+
}
|
|
252
|
+
return { updated, removed, skipped, failed, errors, total: files.length, overSizeSkipped, unlistedExts: unlisted }
|
|
253
|
+
}
|
|
254
|
+
|
|
255
|
+
/** Record current HEAD as the index anchor (gitSync incremental diff baseline); silently skip non-git repos */
|
|
256
|
+
export async function markIndexedCommit(memory, dir) {
|
|
257
|
+
try {
|
|
258
|
+
const { execFile } = await import("node:child_process")
|
|
259
|
+
const head = await new Promise((resolve, reject) => {
|
|
260
|
+
execFile("git", ["rev-parse", "HEAD"], { cwd: dir, encoding: "utf8", timeout: 5000, windowsHide: true }, (err, stdout) => {
|
|
261
|
+
if (err) reject(err); else resolve(stdout)
|
|
262
|
+
})
|
|
263
|
+
})
|
|
264
|
+
memory.db.prepare(`INSERT INTO meta (key, value) VALUES ('last_indexed_commit', ?)
|
|
265
|
+
ON CONFLICT (key) DO UPDATE SET value = excluded.value`).run(head.trim())
|
|
266
|
+
} catch { /* not a git repo or git unavailable, skip */ }
|
|
267
|
+
}
|
|
268
|
+
|
|
269
|
+
/**
|
|
270
|
+
* Code search: FTS5(BM25) + optional vector cosine, RRF merged.
|
|
271
|
+
* Falls back to pure FTS when no embedder; falls back to pure vector when ftsQuery is empty and embedder is present.
|
|
272
|
+
*/
|
|
273
|
+
export async function codeSearch(memory, query, { limit = 5 } = {}) {
|
|
274
|
+
const ftsQuery = buildFtsQuery(query)
|
|
275
|
+
if (!ftsQuery && !memory.embedder) return []
|
|
276
|
+
|
|
277
|
+
// §6.11 读缝归一(单点取名——函数体内一律用归一值)
|
|
278
|
+
const codeOrigin = normalizeOrigin(memory.codeOrigin)
|
|
279
|
+
const ftsOriginFilter = codeOrigin ? `AND c.origin = ?` : ""
|
|
280
|
+
const vecOriginFilter = codeOrigin ? `AND origin = ?` : ""
|
|
281
|
+
const originParams = codeOrigin ? [codeOrigin] : []
|
|
282
|
+
|
|
283
|
+
const ftsList = ftsQuery ? memory.db.prepare(`
|
|
284
|
+
SELECT c.rowid, c.path, c.language, c.symbol_name, c.content, c.line_start, c.line_end, bm25(code_chunks_fts) AS rank
|
|
285
|
+
FROM code_chunks_fts JOIN code_chunks c ON c.rowid = code_chunks_fts.rowid
|
|
286
|
+
WHERE code_chunks_fts MATCH ? ${ftsOriginFilter}
|
|
287
|
+
ORDER BY rank LIMIT ?
|
|
288
|
+
`).all(ftsQuery, ...originParams, Math.max(limit * 4, 20)) : []
|
|
289
|
+
|
|
290
|
+
if (!memory.embedder) return ftsList.slice(0, limit)
|
|
291
|
+
|
|
292
|
+
try { await ensureEmbeddings(memory) } catch (e) {
|
|
293
|
+
console.error(`[code] embedding ensure failed, falling back to FTS-only: ${e.message}`)
|
|
294
|
+
return ftsList.slice(0, limit)
|
|
295
|
+
}
|
|
296
|
+
let qvec
|
|
297
|
+
try { [qvec] = await embed(memory.embedder, [query]) } catch (e) {
|
|
298
|
+
console.error(`[code] query embedding failed, falling back to FTS-only: ${e.message}`)
|
|
299
|
+
return ftsList.slice(0, limit)
|
|
300
|
+
}
|
|
301
|
+
// TUI-OOM-ROOTCAUSE(MEMORY.md §10.3):分块扫描 + 有界 top-K(原全表 .all()——峰值 = 块 + K)
|
|
302
|
+
// TUI 假死批(§6.10 修法 A1/A2):游标 = PK 去等值过滤前缀列(有 origin 过滤 ⇒ 2 元组;
|
|
303
|
+
// 无过滤 ⇒ 全 PK);scanVectors = async(让出)。SELECT 须携键列(游标值源)。
|
|
304
|
+
const cursorKey = codeOrigin ? ["path", "line_start"] : ["origin", "path", "line_start"]
|
|
305
|
+
const keyCols = cursorKey.join(", ")
|
|
306
|
+
const top = createTopK(Math.max(limit * 4, 20))
|
|
307
|
+
await scanVectors(memory.db, `SELECT rowid, ${keyCols}, embedding FROM code_chunks WHERE embedding IS NOT NULL ${vecOriginFilter}`, originParams, {
|
|
308
|
+
cursorKey,
|
|
309
|
+
onRow: (r) => top.push({ id: r.rowid, rowid: r.rowid, score: cosine(qvec, fromBlob(r.embedding)) }),
|
|
310
|
+
})
|
|
311
|
+
const vecList = top.list().map((c) => ({ rowid: c.id, score: c.score }))
|
|
312
|
+
|
|
313
|
+
const K = 60
|
|
314
|
+
const scores = new Map()
|
|
315
|
+
ftsList.forEach((r, i) => scores.set(r.rowid, (scores.get(r.rowid) ?? 0) + 1 / (K + i + 1)))
|
|
316
|
+
vecList.forEach((r, i) => scores.set(r.rowid, (scores.get(r.rowid) ?? 0) + 1 / (K + i + 1)))
|
|
317
|
+
|
|
318
|
+
const fetchChunk = memory.db.prepare(`
|
|
319
|
+
SELECT path, language, symbol_name, content, line_start, line_end FROM code_chunks WHERE rowid = ?
|
|
320
|
+
`)
|
|
321
|
+
const sorted = [...scores.entries()]
|
|
322
|
+
.sort((a, b) => b[1] - a[1])
|
|
323
|
+
.slice(0, limit)
|
|
324
|
+
return sorted
|
|
325
|
+
.map(([rowid, score]) => {
|
|
326
|
+
const chunk = fetchChunk.get(rowid)
|
|
327
|
+
if (!chunk) return null
|
|
328
|
+
chunk._score = Math.round(score * 100) / 100
|
|
329
|
+
return chunk
|
|
330
|
+
})
|
|
331
|
+
.filter(Boolean)
|
|
332
|
+
}
|
|
333
|
+
|
|
334
|
+
/** Lazily backfill missing vectors for code_chunks. Guarded against concurrent calls. */
|
|
335
|
+
let _codeEmbedLock = null
|
|
336
|
+
export function ensureCodeEmbeddings(memory) {
|
|
337
|
+
if (_codeEmbedLock) return _codeEmbedLock
|
|
338
|
+
_codeEmbedLock = _runEnsureCodeEmbeddings(memory).finally(() => { _codeEmbedLock = null })
|
|
339
|
+
return _codeEmbedLock
|
|
340
|
+
}
|
|
341
|
+
|
|
342
|
+
async function _runEnsureCodeEmbeddings(memory) {
|
|
343
|
+
if (!memory.embedder) return
|
|
344
|
+
const modelKey = memory.embedder.model
|
|
345
|
+
const stored = memory.db.prepare(`SELECT value FROM meta WHERE key = 'code_embedding_model'`).get()?.value
|
|
346
|
+
if (stored !== modelKey) {
|
|
347
|
+
memory.db.prepare(`UPDATE code_chunks SET embedding = NULL`).run()
|
|
348
|
+
memory.db.prepare(`INSERT INTO meta (key, value) VALUES ('code_embedding_model', ?)
|
|
349
|
+
ON CONFLICT (key) DO UPDATE SET value = excluded.value`).run(modelKey)
|
|
350
|
+
}
|
|
351
|
+
|
|
352
|
+
const pending = memory.db.prepare(`SELECT rowid, path, symbol_name, content FROM code_chunks WHERE embedding IS NULL LIMIT ${CODE_EMBED_BATCH}`).all()
|
|
353
|
+
if (pending.length === 0) return
|
|
354
|
+
|
|
355
|
+
const texts = pending.map((r) => `${r.path}${r.symbol_name ? " :: " + r.symbol_name : ""}\n${safeSliceUTF16(r.content, EMBED_TEXT_MAX_LEN)}`)
|
|
356
|
+
const vecs = await embed(memory.embedder, texts)
|
|
357
|
+
|
|
358
|
+
const update = memory.db.prepare(`UPDATE code_chunks SET embedding = ? WHERE rowid = ?`)
|
|
359
|
+
pending.forEach((r, i) => update.run(toBlob(vecs[i]), r.rowid))
|
|
360
|
+
}
|
|
361
|
+
|
|
362
|
+
/** Generate the code_search tool (read-only). */
|
|
363
|
+
export function codeSearchTool(memory) {
|
|
364
|
+
return {
|
|
365
|
+
name: "code_search",
|
|
366
|
+
description:
|
|
367
|
+
"Search the project's source code for relevant code. Use this to find functions, classes, or code patterns across the codebase. Supports natural language queries and code snippets. Returns matching code chunks with file paths and line numbers. Prefer doc_search for the intended design (design docs, conventions); code_search for the implementation as written. " +
|
|
368
|
+
"For what was said in a session (conversation/chat history), use read_history.",
|
|
369
|
+
parameters: {
|
|
370
|
+
type: "object",
|
|
371
|
+
properties: {
|
|
372
|
+
query: { type: "string", description: "Natural language or code snippet to search for" },
|
|
373
|
+
limit: { type: "number", description: "Max results (default 5)" },
|
|
374
|
+
},
|
|
375
|
+
required: ["query"],
|
|
376
|
+
},
|
|
377
|
+
readonly: true,
|
|
378
|
+
async execute(args) {
|
|
379
|
+
const results = await codeSearch(memory, args.query, { limit: args.limit ?? 5 })
|
|
380
|
+
if (results.length === 0) return "(no matching code)"
|
|
381
|
+
return results.map((r) =>
|
|
382
|
+
`${r.path}${r.symbol_name ? ` :: ${r.symbol_name}` : ""} (L${r.line_start}-L${r.line_end}, relevance ${r._score?.toFixed(2) ?? "?"}):\n${r.content.slice(0, 2000)}`
|
|
383
|
+
).join("\n\n---\n\n")
|
|
384
|
+
},
|
|
385
|
+
}
|
|
386
|
+
}
|
|
387
|
+
|
|
388
|
+
/**
|
|
389
|
+
* Single-file incremental reindex: called after write/edit/delete, only rebuilds this one path.
|
|
390
|
+
*/
|
|
391
|
+
export async function reindexFile(memory, cwd, absPath) {
|
|
392
|
+
const origin = normalizeOrigin(cwd) // §6.11 写缝归一(文件 I/O 用原样 cwd;库面 origin 一律归一值)
|
|
393
|
+
const ext = extensionOf(absPath)
|
|
394
|
+
const rel = relative(cwd, absPath).replaceAll("\\", "/")
|
|
395
|
+
if (rel === ".." || rel.startsWith("../")) return
|
|
396
|
+
if (isSkippedRelPath(rel)) return
|
|
397
|
+
// Declared extensions count for the single-file path too (union with built-ins).
|
|
398
|
+
const { code: codeExts, doc: docExts } = indexExtensions(cwd)
|
|
399
|
+
|
|
400
|
+
// skip oversized files (minified bundles, test fixtures, generated code)
|
|
401
|
+
const maxBytes = codeExts.has(ext) ? MAX_CODE_FILE_BYTES : docExts.has(ext) ? MAX_DOC_FILE_BYTES : 0
|
|
402
|
+
if (maxBytes > 0) {
|
|
403
|
+
try { const st = await stat(absPath); if (st.size > maxBytes) return } catch { /* can't stat, proceed */ }
|
|
404
|
+
}
|
|
405
|
+
|
|
406
|
+
let text
|
|
407
|
+
try { text = await readFile(absPath, "utf8") } catch {
|
|
408
|
+
if (codeExts.has(ext)) memory.db.prepare(`DELETE FROM code_chunks WHERE origin = ? AND path = ?`).run(origin, rel)
|
|
409
|
+
else if (docExts.has(ext)) memory.db.prepare(`DELETE FROM doc_chunks WHERE origin = ? AND path = ?`).run(origin, rel)
|
|
410
|
+
return
|
|
411
|
+
}
|
|
412
|
+
const lines = text.split("\n")
|
|
413
|
+
|
|
414
|
+
if (codeExts.has(ext)) {
|
|
415
|
+
const lang = detectLanguage(absPath)
|
|
416
|
+
let mtimeMs = 0
|
|
417
|
+
try { mtimeMs = Math.floor((await stat(absPath)).mtimeMs) } catch { /* new file */ }
|
|
418
|
+
_upsertCodeFile(memory, origin, rel, lines, lang, mtimeMs)
|
|
419
|
+
} else if (docExts.has(ext)) {
|
|
420
|
+
let mtimeMs = 0
|
|
421
|
+
try { mtimeMs = Math.floor((await stat(absPath)).mtimeMs) } catch { /* new file */ }
|
|
422
|
+
_upsertDocFile(memory, origin, rel, lines, mtimeMs)
|
|
423
|
+
}
|
|
424
|
+
if (memory.embedder) {
|
|
425
|
+
try { await ensureEmbeddings(memory) } catch { /* embedding failure is non-blocking */ }
|
|
426
|
+
}
|
|
427
|
+
}
|