claude-session-continuity-mcp 1.16.0 → 1.16.1

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
@@ -6,6 +6,7 @@ import * as fs from 'fs';
6
6
  import * as path from 'path';
7
7
  import Database from 'better-sqlite3';
8
8
  import { logHookError, emitContext } from '../utils/logger.js';
9
+ import { tokenizeQuery } from '../utils/tokenize.js';
9
10
  function detectWorkspaceRoot(cwd) {
10
11
  let current = cwd;
11
12
  const root = path.parse(current).root;
@@ -72,87 +73,14 @@ function extractPastKeywords(prompt) {
72
73
  return null;
73
74
  }
74
75
  /**
75
- * Korean + English 일반 stopword
76
- * (Proactive trigger matching용 사용자 발상 "전부 기록하되 트리거 매칭" 구현)
77
- */
78
- const STOPWORDS = new Set([
79
- // 한국어 빈출 (조사/대명사/일반 동사/부사)
80
- '있다', '없다', '하다', '되다', '이다', '아니다', '같다', '보다', '주다', '받다', '쓰다', '놓다',
81
- '하는', '있는', '없는', '되는', '이런', '저런', '그런', '이게', '저게', '그게', '이것', '저것', '그것',
82
- '내가', '네가', '우리', '저희', '당신', '자기', '지금', '이제', '오늘', '어제', '내일', '다음', '이전',
83
- '하나', '둘', '셋', '정말', '진짜', '아주', '너무', '매우', '조금', '약간', '대충', '그냥', '일단',
84
- '그리고', '하지만', '그래서', '그래도', '근데', '그런데', '또는', '또한', '이런데', '그런데',
85
- '진행', '확인', '시작', '완료', '종료', '해줘', '해주세요', '부탁', '알려', '알려줘',
86
- // 흔한 작업 동사·부사 (P1, 2026-07-08: 작은 코퍼스에서 df가 낮아 IDF를 통과해
87
- // 오탐을 유발했음. "저장/기억/다시" 등이 GCP·영상 메모리를 엉뚱하게 소환)
88
- '저장', '기억', '삭제', '수정', '검색', '등록', '변경', '추가', '제거', '생성', '실행', '설정',
89
- '전체', '다시', '이렇게', '그렇게', '저렇게', '계속', '먼저', '바로', '같이', '제대로', '하나하나',
90
- // 범용 명사 (LIKE 검색 시 아무 메모리나 잡는 오탐원 — 2026-07-08 C3)
91
- '이름', '정보', '내용', '관련', '부분', '상태', '방법', '문제', '경우', '생각', '이야기', '얘기',
92
- '어떻게', '무엇', '뭐가', '왜', '어디', '언제', '어느', '어떤', '어떻', '얼마',
93
- // 한국어 2글자 빈출 (v1.14.3에서 한국어 길이 임계값 2로 낮춤에 따라 추가)
94
- '이거', '그거', '저거', '한번', '두번', '코드', '작업', '뭐했지', '뭐였지', '봐줘', '한거지', '했지',
95
- // 영어 빈출 추가 — Next.js 같은 동음이의 발생하는 토큰
96
- 'next', 'last', 'first', 'prev', 'previous', 'check', 'test', 'run', 'live', 'ready', 'verify', 'verification',
97
- 'session', 'task', 'item', 'case', 'file', 'line', 'data', 'code', 'word', 'time', 'step', 'part', 'side',
98
- // 영어 작업 동사 (P1 audit-7, 2026-07-08: 한국어 저장/기억/검색과 대칭. 이들이
99
- // df 낮아 IDF 통과 시 오탐 유발. inCorpus 게이트가 사후 방어하나 명시 차단이 견고)
100
- 'save', 'store', 'remember', 'search', 'find', 'delete', 'remove', 'update', 'create', 'add',
101
- 'change', 'edit', 'fix', 'make', 'show', 'list', 'get', 'set', 'build', 'lint', 'deploy',
102
- 'whole', 'thing', 'again', 'entire', 'stuff', 'something', 'anything', 'everything',
103
- // 영어 빈출 stopwords
104
- 'the', 'a', 'an', 'is', 'are', 'was', 'were', 'be', 'been', 'being', 'have', 'has', 'had',
105
- 'do', 'does', 'did', 'will', 'would', 'should', 'could', 'can', 'may', 'might', 'must',
106
- 'this', 'that', 'these', 'those', 'it', 'its', 'they', 'them', 'their', 'we', 'our',
107
- 'you', 'your', 'i', 'my', 'me', 'what', 'when', 'where', 'why', 'how', 'which', 'who',
108
- 'and', 'or', 'but', 'if', 'then', 'else', 'also', 'so', 'as', 'at', 'by', 'for', 'from', 'in', 'of', 'on', 'to', 'with',
109
- 'just', 'only', 'very', 'really', 'also', 'too', 'still', 'here', 'there', 'now', 'then',
110
- ]);
111
- /**
112
- * Prompt에서 의미 있는 한국어/영어 키워드 추출
113
- * (P0+ 2026-05-22: 사용자 "트리거 매칭" 발상 구현)
114
- *
115
- * @returns 키워드 배열 (3자 이상, stopword 제외, 중복 제거, 최대 5개)
76
+ * Prompt에서 의미 있는 한국어/영어 키워드 추출 (트리거용, 최대 5개)
77
+ * 토큰화 로직은 utils/tokenize.ts로 공용화됨 (memory_search와 공유, 2026-07-09).
78
+ * 트리거는 프롬프트 길이 5 미만이면 스킵.
116
79
  */
117
80
  function extractTriggerKeywords(prompt) {
118
81
  if (!prompt || prompt.length < 5)
119
82
  return [];
120
- // 1. 따옴표/괄호/마크다운/슬래시 명령 제거
121
- const cleaned = prompt
122
- .replace(/```[\s\S]*?```/g, ' ') // 코드 블록
123
- .replace(/`[^`]+`/g, ' ') // 인라인 코드
124
- .replace(/^\/[a-z-]+\s*/i, '') // 슬래시 명령 prefix
125
- .replace(/[*_~`"'()[\]{}<>]/g, ' '); // 특수문자
126
- // 2. 토큰화 (한글/영문 단어만)
127
- // v1.14.3: 한국어 길이 임계값 2, 영어는 3 (한국어는 2글자 단어 많음 — 서버/주소/명령)
128
- const tokens = cleaned
129
- .split(/[\s,.!?;:/\\|]+/)
130
- .map(t => t.trim().toLowerCase())
131
- .filter(t => /^[a-z0-9가-힣]+$/i.test(t)) // 영숫자+한글만
132
- // P1 (2026-07-08): 흔한 한국어 동사 어미만 벗겨 stopword 체크가 먹게 함.
133
- // "저장해줘"→"저장"이 안 되면 STOPWORDS(저장)를 우회해 오탐.
134
- // ⚠️ 단일 글자 조사(로/를/이/가 등)는 절삭 금지 — "경로→경","추가→추"처럼
135
- // 진짜 2글자 명사를 훼손함(실측 확인). 명확한 다글자 동사 어미만.
136
- .map(t => t.replace(/(해줘|해주세요|해주라|했어|했지|하는|하고|해서|합니다|드려|드릴게)$/, ''))
137
- .filter(t => t.length > 0)
138
- .filter(t => {
139
- // 한국어 단일 음절은 거의 무의미, 2글자 이상 허용
140
- const hasHangul = /[가-힣]/.test(t);
141
- return hasHangul ? t.length >= 2 : t.length >= 3;
142
- })
143
- .filter(t => !STOPWORDS.has(t))
144
- .filter(t => !/^\d+$/.test(t)); // 숫자만은 제외
145
- // 3. 중복 제거 (등장 순서 유지)
146
- const seen = new Set();
147
- const unique = [];
148
- for (const t of tokens) {
149
- if (!seen.has(t)) {
150
- seen.add(t);
151
- unique.push(t);
152
- }
153
- }
154
- // 4. 최대 5개
155
- return unique.slice(0, 5);
83
+ return tokenizeQuery(prompt, 5);
156
84
  }
157
85
  /**
158
86
  * IDF 필터: 너무 흔한 토큰 제거
package/dist/index.js CHANGED
@@ -22,6 +22,7 @@ import { mkdirSync, existsSync } from 'fs';
22
22
  import * as path from 'path';
23
23
  import { execSync } from 'child_process';
24
24
  import Database from 'better-sqlite3';
25
+ import { tokenizeQuery, buildFtsQuery } from './utils/tokenize.js';
25
26
  // @xenova/transformers - 동적 import (sharp 의존성 문제 방지)
26
27
  let transformersModule = null;
27
28
  async function loadTransformers() {
@@ -1265,7 +1266,12 @@ async function handleTool(name, args) {
1265
1266
  }
1266
1267
  else {
1267
1268
  // 키워드 검색 (LIKE 기반, 단어별 OR)
1268
- const words = query.split(/\s+/).filter(w => w.length > 0);
1269
+ // 2026-07-09 audit-7 방안A: 공용 토큰화(stopword 제거) 흔한 단어가 아무
1270
+ // solution이나 잡는 오탐 감소. 의미 토큰이 없으면 raw split 폴백.
1271
+ const solTokens = tokenizeQuery(query);
1272
+ const words = solTokens.length > 0
1273
+ ? solTokens
1274
+ : query.split(/\s+/).filter(w => w.length > 0);
1269
1275
  const wordConditions = words.map(() => '(error_signature LIKE ? OR error_message LIKE ? OR solution LIKE ? OR keywords LIKE ?)').join(' OR ');
1270
1276
  const wordParams = [];
1271
1277
  words.forEach(w => {
@@ -1502,13 +1508,16 @@ async function handleTool(name, args) {
1502
1508
  else {
1503
1509
  // FTS5 + bm25() 랭킹 우선, 결과 없으면 LIKE 폴백
1504
1510
  // (P1-2, 2026-05-22: 7-agent 검증 후 적용)
1505
- const words = query.split(/\s+/).filter(w => w.length > 0);
1511
+ // 2026-07-09 audit-7 방안A: 공용 토큰화로 자동주입과 같은 한국어/다구 품질.
1512
+ // 의미 토큰이 없으면 raw split 폴백(recall 보존).
1513
+ const semanticTokens = tokenizeQuery(query);
1514
+ const words = semanticTokens.length > 0
1515
+ ? semanticTokens
1516
+ : query.split(/\s+/).filter(w => w.length > 0);
1506
1517
  // 1차: FTS5 MATCH + bm25() 점수
1507
1518
  let ftsResults = [];
1508
1519
  try {
1509
- const ftsQuery = words.length > 0
1510
- ? words.map(w => `"${w.replace(/"/g, '""')}"`).join(' OR ')
1511
- : query;
1520
+ const ftsQuery = buildFtsQuery(words, true) ?? query; // expandEnglish: 영어 복수/시제 recall
1512
1521
  let ftsSql = `
1513
1522
  SELECT m.*, bm25(memories_fts) AS bm25_score
1514
1523
  FROM memories_fts fts
@@ -4,6 +4,7 @@ import { db } from '../db/database.js';
4
4
  import { generateEmbedding, embeddingToBuffer, bufferToEmbedding, cosineSimilarity } from '../utils/embedding.js';
5
5
  import { logger } from '../utils/logger.js';
6
6
  import { MemoryStoreSchema, MemorySearchSchema, MemoryGetSchema, MemoryDeleteSchema } from '../schemas.js';
7
+ import { tokenizeQuery, buildFtsQuery } from '../utils/tokenize.js';
7
8
  // ===== Temporal Decay =====
8
9
  const DECAY_RATES = {
9
10
  decision: 0.001, // 반감기 ~693일
@@ -228,7 +229,11 @@ export async function handleMemorySearch(args) {
228
229
  }, args);
229
230
  }
230
231
  async function performFTSSearch(query, type, project, limit = 10, minImportance = 1, detail = false) {
231
- const ftsQuery = query.split(/\s+/).filter(w => w.length > 1).join(' OR ');
232
+ // 공용 토큰화(어미 절삭+STOPWORDS+길이 필터)로 자동주입과 같은 검색 품질.
233
+ // 의미 토큰이 하나도 안 남으면(전부 stopword) raw split으로 폴백 — recall 보존.
234
+ const tokens = tokenizeQuery(query);
235
+ const ftsQuery = buildFtsQuery(tokens, true) // expandEnglish: 복수/시제 변형 OR (영어권 recall)
236
+ ?? query.split(/\s+/).filter(w => w.length > 1).join(' OR ');
232
237
  let sql = `
233
238
  SELECT m.id, m.content, m.memory_type, m.tags, m.project, m.importance, m.created_at, m.access_count
234
239
  FROM memories_fts fts
@@ -0,0 +1,26 @@
1
+ /**
2
+ * Korean + English 일반 stopword
3
+ * (자동주입 트리거 매칭 + 명시 검색 공용)
4
+ */
5
+ export declare const STOPWORDS: Set<string>;
6
+ /**
7
+ * 쿼리/프롬프트에서 의미 있는 한국어/영어 키워드 추출.
8
+ *
9
+ * - 한국어 동사 어미 절삭("저장해줘"→"저장"), 단일 조사(로/를/이/가)는 명사 훼손 방지로 보존
10
+ * - 한국어 2글자 이상, 영어 3글자 이상
11
+ * - STOPWORDS 및 숫자-only 제외
12
+ * - 중복 제거(등장 순서 유지)
13
+ *
14
+ * @param text 원본 문자열
15
+ * @param maxTokens 상한 (자동주입 트리거는 5, 명시 검색은 무제한 = Infinity)
16
+ * @returns 키워드 배열
17
+ */
18
+ export declare function tokenizeQuery(text: string, maxTokens?: number): string[];
19
+ /**
20
+ * 토큰들을 FTS5 MATCH 쿼리로 조립("token1" OR "token2" ...). 토큰이 없으면 null.
21
+ * memory_search 계열이 raw split 대신 이걸 쓰면 자동주입과 같은 품질을 얻는다.
22
+ *
23
+ * @param expandEnglish 영어 복수/시제 변형도 OR에 포함(명시 검색 recall↑). 자동주입
24
+ * 트리거는 오탐 억제가 중요하니 기본 false, memory_search는 true 권장.
25
+ */
26
+ export declare function buildFtsQuery(tokens: string[], expandEnglish?: boolean): string | null;
@@ -0,0 +1,128 @@
1
+ // 공용 쿼리 토큰화 (2026-07-09, audit-7 방안 A)
2
+ // 배경: 자동주입 hook(user-prompt-submit)은 어미 절삭 + STOPWORDS + 길이 필터로
3
+ // 한국어/다구 검색 품질을 확보하는데, 명시 검색(memory_search)은 raw split(/\s+/)만
4
+ // 써서 품질이 낮았다(audit-7 Stage2 실측 CONFIRMED). 이 토큰화를 공용화해 양쪽이 공유한다.
5
+ /**
6
+ * Korean + English 일반 stopword
7
+ * (자동주입 트리거 매칭 + 명시 검색 공용)
8
+ */
9
+ export const STOPWORDS = new Set([
10
+ // 한국어 빈출 (조사/대명사/일반 동사/부사)
11
+ '있다', '없다', '하다', '되다', '이다', '아니다', '같다', '보다', '주다', '받다', '쓰다', '놓다',
12
+ '하는', '있는', '없는', '되는', '이런', '저런', '그런', '이게', '저게', '그게', '이것', '저것', '그것',
13
+ '내가', '네가', '우리', '저희', '당신', '자기', '지금', '이제', '오늘', '어제', '내일', '다음', '이전',
14
+ '하나', '둘', '셋', '정말', '진짜', '아주', '너무', '매우', '조금', '약간', '대충', '그냥', '일단',
15
+ '그리고', '하지만', '그래서', '그래도', '근데', '그런데', '또는', '또한', '이런데', '그런데',
16
+ '진행', '확인', '시작', '완료', '종료', '해줘', '해주세요', '부탁', '알려', '알려줘',
17
+ // 흔한 작업 동사·부사
18
+ '저장', '기억', '삭제', '수정', '검색', '등록', '변경', '추가', '제거', '생성', '실행', '설정',
19
+ '전체', '다시', '이렇게', '그렇게', '저렇게', '계속', '먼저', '바로', '같이', '제대로', '하나하나',
20
+ // 범용 명사
21
+ '이름', '정보', '내용', '관련', '부분', '상태', '방법', '문제', '경우', '생각', '이야기', '얘기',
22
+ '어떻게', '무엇', '뭐가', '왜', '어디', '언제', '어느', '어떤', '어떻', '얼마',
23
+ // 한국어 2글자 빈출
24
+ '이거', '그거', '저거', '한번', '두번', '코드', '작업', '뭐했지', '뭐였지', '봐줘', '한거지', '했지',
25
+ // 영어 빈출 추가 — Next.js 같은 동음이의 발생하는 토큰
26
+ 'next', 'last', 'first', 'prev', 'previous', 'check', 'test', 'run', 'live', 'ready', 'verify', 'verification',
27
+ 'session', 'task', 'item', 'case', 'file', 'line', 'data', 'code', 'word', 'time', 'step', 'part', 'side',
28
+ // 영어 작업 동사
29
+ 'save', 'store', 'remember', 'search', 'find', 'delete', 'remove', 'update', 'create', 'add',
30
+ 'change', 'edit', 'fix', 'make', 'show', 'list', 'get', 'set', 'build', 'lint', 'deploy',
31
+ 'whole', 'thing', 'again', 'entire', 'stuff', 'something', 'anything', 'everything',
32
+ // 영어 빈출 stopwords
33
+ 'the', 'a', 'an', 'is', 'are', 'was', 'were', 'be', 'been', 'being', 'have', 'has', 'had',
34
+ 'do', 'does', 'did', 'will', 'would', 'should', 'could', 'can', 'may', 'might', 'must',
35
+ 'this', 'that', 'these', 'those', 'it', 'its', 'they', 'them', 'their', 'we', 'our',
36
+ 'you', 'your', 'i', 'my', 'me', 'what', 'when', 'where', 'why', 'how', 'which', 'who',
37
+ 'and', 'or', 'but', 'if', 'then', 'else', 'also', 'so', 'as', 'at', 'by', 'for', 'from', 'in', 'of', 'on', 'to', 'with',
38
+ 'just', 'only', 'very', 'really', 'also', 'too', 'still', 'here', 'there', 'now', 'then',
39
+ ]);
40
+ /**
41
+ * 쿼리/프롬프트에서 의미 있는 한국어/영어 키워드 추출.
42
+ *
43
+ * - 한국어 동사 어미 절삭("저장해줘"→"저장"), 단일 조사(로/를/이/가)는 명사 훼손 방지로 보존
44
+ * - 한국어 2글자 이상, 영어 3글자 이상
45
+ * - STOPWORDS 및 숫자-only 제외
46
+ * - 중복 제거(등장 순서 유지)
47
+ *
48
+ * @param text 원본 문자열
49
+ * @param maxTokens 상한 (자동주입 트리거는 5, 명시 검색은 무제한 = Infinity)
50
+ * @returns 키워드 배열
51
+ */
52
+ export function tokenizeQuery(text, maxTokens = Infinity) {
53
+ if (!text || text.length < 2)
54
+ return [];
55
+ const cleaned = text
56
+ .replace(/```[\s\S]*?```/g, ' ') // 코드 블록
57
+ .replace(/`[^`]+`/g, ' ') // 인라인 코드
58
+ .replace(/^\/[a-z-]+\s*/i, '') // 슬래시 명령 prefix
59
+ .replace(/[*_~`"'()[\]{}<>]/g, ' '); // 특수문자
60
+ const tokens = cleaned
61
+ .split(/[\s,.!?;:/\\|]+/)
62
+ .map(t => t.trim().toLowerCase())
63
+ .filter(t => /^[a-z0-9가-힣]+$/i.test(t))
64
+ .map(t => t.replace(/(해줘|해주세요|해주라|했어|했지|하는|하고|해서|합니다|드려|드릴게)$/, ''))
65
+ .filter(t => t.length > 0)
66
+ .filter(t => {
67
+ const hasHangul = /[가-힣]/.test(t);
68
+ return hasHangul ? t.length >= 2 : t.length >= 3;
69
+ })
70
+ .filter(t => !STOPWORDS.has(t))
71
+ .filter(t => !/^\d+$/.test(t));
72
+ const seen = new Set();
73
+ const unique = [];
74
+ for (const t of tokens) {
75
+ if (!seen.has(t)) {
76
+ seen.add(t);
77
+ unique.push(t);
78
+ }
79
+ }
80
+ return maxTokens === Infinity ? unique : unique.slice(0, maxTokens);
81
+ }
82
+ /**
83
+ * 영어 토큰의 경량 어간 변형 생성 (2026-07-09, 영어권 유저 고려).
84
+ * FTS5는 정확 일치라 "servers"로 검색하면 "server"로 저장된 메모리를 놓친다.
85
+ * Porter 같은 무거운 stemmer 대신, 흔한 어미(복수 s/es, 과거 ed, 진행 ing)만
86
+ * 벗겨 원형 후보를 만든다. 원형과 변형을 FTS5 OR에 함께 넣어 recall을 높인다.
87
+ *
88
+ * 보수적 규칙 (과절삭 방지):
89
+ * - 5글자 미만은 건드리지 않음(bus/class 훼손 방지)
90
+ * - 한글 포함 토큰은 그대로(영어 규칙 미적용)
91
+ *
92
+ * @returns 원형 후보 (없으면 빈 배열). 호출부에서 원 토큰과 합쳐 dedupe.
93
+ */
94
+ function englishVariants(token) {
95
+ if (/[가-힣]/.test(token) || token.length < 5)
96
+ return [];
97
+ const out = [];
98
+ if (token.endsWith('ies') && token.length > 4)
99
+ out.push(token.slice(0, -3) + 'y'); // libraries→library
100
+ else if (token.endsWith('es') && token.length > 4)
101
+ out.push(token.slice(0, -2)); // boxes→box
102
+ if (token.endsWith('s') && !token.endsWith('ss') && !token.endsWith('us'))
103
+ out.push(token.slice(0, -1)); // servers→server
104
+ if (token.endsWith('ing') && token.length > 5)
105
+ out.push(token.slice(0, -3)); // deploying→deploy
106
+ if (token.endsWith('ed') && token.length > 4)
107
+ out.push(token.slice(0, -2)); // saved→sav (불완전하나 FTS OR라 무해)
108
+ return out;
109
+ }
110
+ /**
111
+ * 토큰들을 FTS5 MATCH 쿼리로 조립("token1" OR "token2" ...). 토큰이 없으면 null.
112
+ * memory_search 계열이 raw split 대신 이걸 쓰면 자동주입과 같은 품질을 얻는다.
113
+ *
114
+ * @param expandEnglish 영어 복수/시제 변형도 OR에 포함(명시 검색 recall↑). 자동주입
115
+ * 트리거는 오탐 억제가 중요하니 기본 false, memory_search는 true 권장.
116
+ */
117
+ export function buildFtsQuery(tokens, expandEnglish = false) {
118
+ if (tokens.length === 0)
119
+ return null;
120
+ const terms = new Set();
121
+ for (const t of tokens) {
122
+ terms.add(t);
123
+ if (expandEnglish)
124
+ for (const v of englishVariants(t))
125
+ terms.add(v);
126
+ }
127
+ return [...terms].map(t => `"${t.replace(/"/g, '""')}"`).join(' OR ');
128
+ }
package/package.json CHANGED
@@ -1,6 +1,6 @@
1
1
  {
2
2
  "name": "claude-session-continuity-mcp",
3
- "version": "1.16.0",
3
+ "version": "1.16.1",
4
4
  "description": "Session Continuity for Claude Code - Never re-explain your project again",
5
5
  "type": "module",
6
6
  "main": "dist/index.js",