@warlock.js/core 4.5.0 → 4.6.1

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (203) hide show
  1. package/CHANGELOG.md +33 -0
  2. package/esm/ai/src/agent/agent.mjs +126 -7
  3. package/esm/ai/src/agent/agent.mjs.map +1 -1
  4. package/esm/ai/src/agent/signature.mjs +57 -0
  5. package/esm/ai/src/agent/signature.mjs.map +1 -0
  6. package/esm/ai/src/agent/snapshot.mjs +101 -0
  7. package/esm/ai/src/agent/snapshot.mjs.map +1 -0
  8. package/esm/ai/src/ai.mjs +37 -1
  9. package/esm/ai/src/ai.mjs.map +1 -1
  10. package/esm/ai/src/errors/agent-drift-error.mjs +31 -0
  11. package/esm/ai/src/errors/agent-drift-error.mjs.map +1 -0
  12. package/esm/ai/src/errors/index.mjs +2 -0
  13. package/esm/ai/src/errors/planner-drift-error.mjs +33 -0
  14. package/esm/ai/src/errors/planner-drift-error.mjs.map +1 -0
  15. package/esm/ai/src/image/image-cost.mjs +55 -0
  16. package/esm/ai/src/image/image-cost.mjs.map +1 -0
  17. package/esm/ai/src/image/image.mjs +112 -0
  18. package/esm/ai/src/image/image.mjs.map +1 -0
  19. package/esm/ai/src/image/index.mjs +4 -0
  20. package/esm/ai/src/index.mjs +20 -0
  21. package/esm/ai/src/planner/planner-run.mjs +161 -6
  22. package/esm/ai/src/planner/planner-run.mjs.map +1 -1
  23. package/esm/ai/src/planner/planner.mjs +25 -1
  24. package/esm/ai/src/planner/planner.mjs.map +1 -1
  25. package/esm/ai/src/planner/snapshot.mjs +95 -0
  26. package/esm/ai/src/planner/snapshot.mjs.map +1 -0
  27. package/esm/ai/src/rag/hybrid/bm25.mjs +51 -0
  28. package/esm/ai/src/rag/hybrid/bm25.mjs.map +1 -0
  29. package/esm/ai/src/rag/hybrid/hybrid-rank.mjs +29 -0
  30. package/esm/ai/src/rag/hybrid/hybrid-rank.mjs.map +1 -0
  31. package/esm/ai/src/rag/hybrid/rrf.mjs +30 -0
  32. package/esm/ai/src/rag/hybrid/rrf.mjs.map +1 -0
  33. package/esm/ai/src/rag/index.mjs +11 -0
  34. package/esm/ai/src/rag/loaders/errors.mjs +25 -0
  35. package/esm/ai/src/rag/loaders/errors.mjs.map +1 -0
  36. package/esm/ai/src/rag/loaders/index.mjs +7 -0
  37. package/esm/ai/src/rag/loaders/load-html.mjs +138 -0
  38. package/esm/ai/src/rag/loaders/load-html.mjs.map +1 -0
  39. package/esm/ai/src/rag/loaders/load-pdf.mjs +150 -0
  40. package/esm/ai/src/rag/loaders/load-pdf.mjs.map +1 -0
  41. package/esm/ai/src/rag/loaders/load-text.mjs +60 -0
  42. package/esm/ai/src/rag/loaders/load-text.mjs.map +1 -0
  43. package/esm/ai/src/rag/loaders/load-web.mjs +89 -0
  44. package/esm/ai/src/rag/loaders/load-web.mjs.map +1 -0
  45. package/esm/ai/src/rag/store/pg-vector-store.mjs +328 -0
  46. package/esm/ai/src/rag/store/pg-vector-store.mjs.map +1 -0
  47. package/esm/ai/src/rag/transforms/multi-query.mjs +41 -0
  48. package/esm/ai/src/rag/transforms/multi-query.mjs.map +1 -0
  49. package/esm/ai/src/speech/index.mjs +3 -0
  50. package/esm/ai/src/speech/speech.mjs +122 -0
  51. package/esm/ai/src/speech/speech.mjs.map +1 -0
  52. package/esm/ai/src/supervisor/entries.mjs +2 -2
  53. package/esm/ai/src/supervisor/entries.mjs.map +1 -1
  54. package/esm/ai/src/transcribe/audio-input.mjs +84 -0
  55. package/esm/ai/src/transcribe/audio-input.mjs.map +1 -0
  56. package/esm/ai/src/transcribe/index.mjs +4 -0
  57. package/esm/ai/src/transcribe/transcribe.mjs +127 -0
  58. package/esm/ai/src/transcribe/transcribe.mjs.map +1 -0
  59. package/esm/ai-openai/src/image.mjs +5 -0
  60. package/esm/ai-openai/src/index.mjs +3 -0
  61. package/esm/ai-openai/src/sdk.mjs +3 -0
  62. package/esm/ai-openai/src/speech.mjs +5 -0
  63. package/esm/ai-openai/src/transcription.mjs +6 -0
  64. package/esm/ai-openai/src/utils/index.mjs +1 -0
  65. package/esm/ai-openai/src/utils/to-openai-messages.mjs +3 -0
  66. package/esm/bootstrap.d.mts.map +1 -1
  67. package/esm/bootstrap.mjs +3 -1
  68. package/esm/bootstrap.mjs.map +1 -1
  69. package/esm/cli/commands/doctor/checks/config.check.mjs +42 -0
  70. package/esm/cli/commands/doctor/checks/config.check.mjs.map +1 -0
  71. package/esm/cli/commands/doctor/checks/connectors.check.mjs +28 -0
  72. package/esm/cli/commands/doctor/checks/connectors.check.mjs.map +1 -0
  73. package/esm/cli/commands/doctor/checks/health.check.mjs +35 -0
  74. package/esm/cli/commands/doctor/checks/health.check.mjs.map +1 -0
  75. package/esm/cli/commands/doctor/checks/index.mjs +25 -0
  76. package/esm/cli/commands/doctor/checks/index.mjs.map +1 -0
  77. package/esm/cli/commands/doctor/checks/optional-peers.check.mjs +90 -0
  78. package/esm/cli/commands/doctor/checks/optional-peers.check.mjs.map +1 -0
  79. package/esm/cli/commands/doctor/checks/release-hygiene.check.mjs +69 -0
  80. package/esm/cli/commands/doctor/checks/release-hygiene.check.mjs.map +1 -0
  81. package/esm/cli/commands/doctor/checks/routes.check.mjs +30 -0
  82. package/esm/cli/commands/doctor/checks/routes.check.mjs.map +1 -0
  83. package/esm/cli/commands/doctor/doctor-command.action.mjs +28 -0
  84. package/esm/cli/commands/doctor/doctor-command.action.mjs.map +1 -0
  85. package/esm/cli/commands/doctor/format-report.mjs +44 -0
  86. package/esm/cli/commands/doctor/format-report.mjs.map +1 -0
  87. package/esm/cli/commands/doctor/run-checks.mjs +50 -0
  88. package/esm/cli/commands/doctor/run-checks.mjs.map +1 -0
  89. package/esm/cli/commands/doctor.command.mjs +29 -0
  90. package/esm/cli/commands/doctor.command.mjs.map +1 -0
  91. package/esm/cli/commands/generate/templates/stubs.mjs +6 -8
  92. package/esm/cli/commands/generate/templates/stubs.mjs.map +1 -1
  93. package/esm/cli/commands/routes/format-routes-table.mjs +129 -0
  94. package/esm/cli/commands/routes/format-routes-table.mjs.map +1 -0
  95. package/esm/cli/commands/routes/route-row.mjs +92 -0
  96. package/esm/cli/commands/routes/route-row.mjs.map +1 -0
  97. package/esm/cli/commands/routes/routes-command.action.mjs +43 -0
  98. package/esm/cli/commands/routes/routes-command.action.mjs.map +1 -0
  99. package/esm/cli/commands/routes.command.mjs +51 -0
  100. package/esm/cli/commands/routes.command.mjs.map +1 -0
  101. package/esm/cli/commands/seed.command.mjs +5 -0
  102. package/esm/cli/commands/seed.command.mjs.map +1 -1
  103. package/esm/cli/framework-cli-commands.mjs +4 -0
  104. package/esm/cli/framework-cli-commands.mjs.map +1 -1
  105. package/esm/config/config-getter.mjs +5 -5
  106. package/esm/config/config-getter.mjs.map +1 -1
  107. package/esm/config/config-loader.mjs +2 -2
  108. package/esm/config/config-loader.mjs.map +1 -1
  109. package/esm/connectors/access-connector.mjs +2 -2
  110. package/esm/connectors/access-connector.mjs.map +1 -1
  111. package/esm/connectors/ai-connector.mjs +2 -2
  112. package/esm/connectors/ai-connector.mjs.map +1 -1
  113. package/esm/connectors/cache-connector.mjs +2 -2
  114. package/esm/connectors/cache-connector.mjs.map +1 -1
  115. package/esm/connectors/database-connector.mjs +2 -2
  116. package/esm/connectors/database-connector.mjs.map +1 -1
  117. package/esm/connectors/herald-connector.mjs +2 -2
  118. package/esm/connectors/herald-connector.mjs.map +1 -1
  119. package/esm/connectors/http-connector.d.mts.map +1 -1
  120. package/esm/connectors/http-connector.mjs +9 -7
  121. package/esm/connectors/http-connector.mjs.map +1 -1
  122. package/esm/connectors/logger-connector.mjs +2 -2
  123. package/esm/connectors/logger-connector.mjs.map +1 -1
  124. package/esm/connectors/mail-connector.mjs +2 -2
  125. package/esm/connectors/mail-connector.mjs.map +1 -1
  126. package/esm/connectors/notifications-connector.mjs +2 -2
  127. package/esm/connectors/notifications-connector.mjs.map +1 -1
  128. package/esm/connectors/socket-connector.mjs +3 -3
  129. package/esm/connectors/socket-connector.mjs.map +1 -1
  130. package/esm/database/index.d.mts +2 -1
  131. package/esm/database/index.mjs +1 -0
  132. package/esm/database/seed-command-action.mjs +44 -4
  133. package/esm/database/seed-command-action.mjs.map +1 -1
  134. package/esm/database/seeds/seed-records-table-migration.mjs +36 -0
  135. package/esm/database/seeds/seed-records-table-migration.mjs.map +1 -0
  136. package/esm/database/seeds/seeder.d.mts +22 -5
  137. package/esm/database/seeds/seeder.d.mts.map +1 -1
  138. package/esm/database/seeds/seeder.errors.d.mts +22 -0
  139. package/esm/database/seeds/seeder.errors.d.mts.map +1 -0
  140. package/esm/database/seeds/seeder.errors.mjs +29 -0
  141. package/esm/database/seeds/seeder.errors.mjs.map +1 -0
  142. package/esm/database/seeds/seeder.mjs.map +1 -1
  143. package/esm/database/seeds/seeders.manager.mjs +90 -11
  144. package/esm/database/seeds/seeders.manager.mjs.map +1 -1
  145. package/esm/database/seeds/types.d.mts +117 -1
  146. package/esm/database/seeds/types.d.mts.map +1 -1
  147. package/esm/database/seeds/utils.mjs +6 -1
  148. package/esm/database/seeds/utils.mjs.map +1 -1
  149. package/esm/dev-server/module-loader.d.mts +12 -0
  150. package/esm/dev-server/module-loader.d.mts.map +1 -1
  151. package/esm/dev-server/module-loader.mjs +30 -2
  152. package/esm/dev-server/module-loader.mjs.map +1 -1
  153. package/esm/http/config.mjs +2 -2
  154. package/esm/http/config.mjs.map +1 -1
  155. package/esm/http/createHttpApplication.mjs +2 -2
  156. package/esm/http/createHttpApplication.mjs.map +1 -1
  157. package/esm/http/health.d.mts +14 -0
  158. package/esm/http/health.d.mts.map +1 -1
  159. package/esm/http/health.mjs +16 -0
  160. package/esm/http/health.mjs.map +1 -1
  161. package/esm/http/middleware/idempotency.middleware.mjs +5 -5
  162. package/esm/http/middleware/idempotency.middleware.mjs.map +1 -1
  163. package/esm/http/middleware/inject-request-context.mjs +2 -2
  164. package/esm/http/middleware/inject-request-context.mjs.map +1 -1
  165. package/esm/http/middleware/maintenance.middleware.mjs +4 -4
  166. package/esm/http/middleware/maintenance.middleware.mjs.map +1 -1
  167. package/esm/http/plugins.mjs +9 -9
  168. package/esm/http/plugins.mjs.map +1 -1
  169. package/esm/http/response.mjs +5 -5
  170. package/esm/http/response.mjs.map +1 -1
  171. package/esm/http/server.mjs +4 -4
  172. package/esm/http/server.mjs.map +1 -1
  173. package/esm/index.d.mts +4 -3
  174. package/esm/index.mjs +2 -1
  175. package/esm/repositories/adapters/cascade/cascade-query-builder.d.mts +28 -1
  176. package/esm/repositories/adapters/cascade/cascade-query-builder.d.mts.map +1 -1
  177. package/esm/repositories/adapters/cascade/cascade-query-builder.mjs +39 -0
  178. package/esm/repositories/adapters/cascade/cascade-query-builder.mjs.map +1 -1
  179. package/esm/repositories/contracts/index.d.mts +1 -1
  180. package/esm/repositories/contracts/query-builder.contract.d.mts +87 -1
  181. package/esm/repositories/contracts/query-builder.contract.d.mts.map +1 -1
  182. package/esm/repositories/index.d.mts +1 -1
  183. package/esm/repositories/repository.manager.d.mts +99 -1
  184. package/esm/repositories/repository.manager.d.mts.map +1 -1
  185. package/esm/repositories/repository.manager.mjs +128 -0
  186. package/esm/repositories/repository.manager.mjs.map +1 -1
  187. package/esm/router/router.d.mts +9 -0
  188. package/esm/router/router.d.mts.map +1 -1
  189. package/esm/router/router.mjs +21 -1
  190. package/esm/router/router.mjs.map +1 -1
  191. package/esm/utils/paths.mjs +2 -2
  192. package/esm/utils/paths.mjs.map +1 -1
  193. package/esm/validation/validateAll.mjs +2 -2
  194. package/esm/validation/validateAll.mjs.map +1 -1
  195. package/llms-full.txt +427 -45
  196. package/llms.txt +4 -2
  197. package/package.json +9 -9
  198. package/skills/README.md +65 -0
  199. package/skills/health-checks/SKILL.md +13 -0
  200. package/skills/use-repository/SKILL.md +38 -1
  201. package/skills/warlock-doctor/SKILL.md +135 -0
  202. package/skills/warlock-routes/SKILL.md +91 -0
  203. package/skills/write-seeder/SKILL.md +143 -45
@@ -0,0 +1,95 @@
1
+ import { PlannerFailedError } from "../errors/planner-failed-error.mjs";
2
+ import { PlannerDriftError } from "../errors/planner-drift-error.mjs";
3
+ import "../errors/index.mjs";
4
+ import { resolveDefaultSnapshotStore } from "../config.mjs";
5
+
6
+ //#region ../@warlock.js/ai/src/planner/snapshot.ts
7
+ /**
8
+ * Resolve the effective {@link SnapshotStore}: the planner's own
9
+ * `durable.store` wins; absent that, fall back to the global default set
10
+ * via `ai.config({ defaultSnapshotStore })`.
11
+ *
12
+ * The global default is typed for the supervisor snapshot shape, but
13
+ * every store impl keys purely by `runId` and round-trips whatever
14
+ * envelope it is handed — so it serves a `PlannerSnapshot` just as well.
15
+ * The cast re-tags the shape at this single boundary (Option B); the
16
+ * planner only ever hands it a `PlannerSnapshot`.
17
+ */
18
+ function resolveSnapshotStore(durable) {
19
+ return durable?.store ?? resolveDefaultSnapshotStore();
20
+ }
21
+ /**
22
+ * Write the current run state to the resolved snapshot store. No-op
23
+ * (returns `{ ok: true }`) when neither `durable.store` nor the global
24
+ * `defaultSnapshotStore` is configured — the common non-durable path.
25
+ * Failures are returned as `{ ok: false }` rather than thrown so the
26
+ * engine can surface them via logs without aborting the run.
27
+ */
28
+ async function persistPlannerSnapshot(params) {
29
+ const store = resolveSnapshotStore(params.durable);
30
+ if (!store) return { ok: true };
31
+ const snapshot = {
32
+ runId: params.runId,
33
+ plannerName: params.plannerName,
34
+ signature: params.signature,
35
+ version: params.version,
36
+ goal: params.goal,
37
+ plan: params.plan,
38
+ executedSteps: params.executedSteps,
39
+ usage: params.usage,
40
+ children: params.children,
41
+ replanCount: params.replanCount,
42
+ status: params.status,
43
+ startedAt: params.startedAt,
44
+ savedAt: (/* @__PURE__ */ new Date()).toISOString()
45
+ };
46
+ try {
47
+ await store.save(snapshot);
48
+ return { ok: true };
49
+ } catch (error) {
50
+ return {
51
+ ok: false,
52
+ error
53
+ };
54
+ }
55
+ }
56
+ /**
57
+ * Delete a persisted snapshot — used after a successful run when
58
+ * `durable.deleteOnComplete` is set. Never throws. No-op (ok) when no
59
+ * store is configured.
60
+ */
61
+ async function deletePlannerSnapshot(params) {
62
+ const store = resolveSnapshotStore(params.durable);
63
+ if (!store) return { ok: true };
64
+ try {
65
+ await store.delete(params.runId);
66
+ return { ok: true };
67
+ } catch (error) {
68
+ return {
69
+ ok: false,
70
+ error
71
+ };
72
+ }
73
+ }
74
+ /**
75
+ * Load a persisted snapshot for `resume()` and run the drift check.
76
+ * Throws `PlannerFailedError` when no store is configured or when the run
77
+ * is missing; throws `PlannerDriftError` when the stored signature
78
+ * doesn't match the current definition (unless `force` is set).
79
+ */
80
+ async function loadPlannerSnapshotForResume(params) {
81
+ const store = resolveSnapshotStore(params.durable);
82
+ if (!store) throw new PlannerFailedError(`ai.planner("${params.plannerName}"): no durable store configured — set \`durable: { store }\` on the config or call \`ai.config({ defaultSnapshotStore })\` at boot before calling resume()`, { context: { runId: params.runId } });
83
+ const snapshot = await store.load(params.runId) ?? null;
84
+ if (!snapshot) throw new PlannerFailedError(`ai.planner("${params.plannerName}"): no snapshot for runId "${params.runId}"`, { context: { runId: params.runId } });
85
+ if (!params.options?.force && snapshot.signature !== params.signature) throw new PlannerDriftError(`ai.planner("${params.plannerName}") signature drift on resume`, {
86
+ savedSignature: snapshot.signature,
87
+ currentSignature: params.signature,
88
+ runId: params.runId
89
+ });
90
+ return snapshot;
91
+ }
92
+
93
+ //#endregion
94
+ export { deletePlannerSnapshot, loadPlannerSnapshotForResume, persistPlannerSnapshot };
95
+ //# sourceMappingURL=snapshot.mjs.map
@@ -0,0 +1 @@
1
+ {"version":3,"file":"snapshot.mjs","names":[],"sources":["../../../../../../../../../@warlock.js/ai/src/planner/snapshot.ts"],"sourcesContent":["import { resolveDefaultSnapshotStore } from \"../config\";\nimport type { SnapshotStore } from \"../contracts/orchestrator/snapshot-store.contract\";\nimport type { PlannerResumeOptions } from \"../contracts/planner/planner-execute-options.type\";\nimport type { PlannerPlan } from \"../contracts/planner/planner-plan.type\";\nimport type { PlannerStepSnapshot } from \"../contracts/planner/planner-result.type\";\nimport type {\n PlannerSnapshot,\n PlannerSnapshotStatus,\n} from \"../contracts/planner/planner-snapshot.type\";\nimport type { BaseReport } from \"../contracts/result/base-report.type\";\nimport type { Usage } from \"../contracts/result/usage.type\";\nimport { PlannerDriftError, PlannerFailedError } from \"../errors\";\n\n/**\n * The planner's `durable` config, narrowed to the fields the snapshot\n * helpers read.\n */\nexport type PlannerDurableConfig = {\n store?: SnapshotStore<PlannerSnapshot>;\n deleteOnComplete?: boolean;\n};\n\n/**\n * Resolve the effective {@link SnapshotStore}: the planner's own\n * `durable.store` wins; absent that, fall back to the global default set\n * via `ai.config({ defaultSnapshotStore })`.\n *\n * The global default is typed for the supervisor snapshot shape, but\n * every store impl keys purely by `runId` and round-trips whatever\n * envelope it is handed — so it serves a `PlannerSnapshot` just as well.\n * The cast re-tags the shape at this single boundary (Option B); the\n * planner only ever hands it a `PlannerSnapshot`.\n */\nfunction resolveSnapshotStore(\n durable: PlannerDurableConfig | undefined,\n): SnapshotStore<PlannerSnapshot> | undefined {\n return (\n durable?.store ??\n (resolveDefaultSnapshotStore() as SnapshotStore<PlannerSnapshot> | undefined)\n );\n}\n\nexport type PersistPlannerParams = {\n durable: PlannerDurableConfig | undefined;\n runId: string;\n plannerName: string;\n signature: string;\n version?: string;\n goal: string;\n plan: PlannerPlan;\n executedSteps: PlannerStepSnapshot[];\n usage: Usage;\n children: BaseReport[];\n replanCount: number;\n status: PlannerSnapshotStatus;\n startedAt: string;\n};\n\nexport type PersistOutcome = { ok: true } | { ok: false; error: unknown };\n\n/**\n * Write the current run state to the resolved snapshot store. No-op\n * (returns `{ ok: true }`) when neither `durable.store` nor the global\n * `defaultSnapshotStore` is configured — the common non-durable path.\n * Failures are returned as `{ ok: false }` rather than thrown so the\n * engine can surface them via logs without aborting the run.\n */\nexport async function persistPlannerSnapshot(\n params: PersistPlannerParams,\n): Promise<PersistOutcome> {\n const store = resolveSnapshotStore(params.durable);\n\n if (!store) {\n return { ok: true };\n }\n\n const snapshot: PlannerSnapshot = {\n runId: params.runId,\n plannerName: params.plannerName,\n signature: params.signature,\n version: params.version,\n goal: params.goal,\n plan: params.plan,\n executedSteps: params.executedSteps,\n usage: params.usage,\n children: params.children,\n replanCount: params.replanCount,\n status: params.status,\n startedAt: params.startedAt,\n savedAt: new Date().toISOString(),\n };\n\n try {\n await store.save(snapshot);\n\n return { ok: true };\n } catch (error) {\n return { ok: false, error };\n }\n}\n\n/**\n * Delete a persisted snapshot — used after a successful run when\n * `durable.deleteOnComplete` is set. Never throws. No-op (ok) when no\n * store is configured.\n */\nexport async function deletePlannerSnapshot(params: {\n durable: PlannerDurableConfig | undefined;\n runId: string;\n}): Promise<PersistOutcome> {\n const store = resolveSnapshotStore(params.durable);\n\n if (!store) {\n return { ok: true };\n }\n\n try {\n await store.delete(params.runId);\n\n return { ok: true };\n } catch (error) {\n return { ok: false, error };\n }\n}\n\n/**\n * Load a persisted snapshot for `resume()` and run the drift check.\n * Throws `PlannerFailedError` when no store is configured or when the run\n * is missing; throws `PlannerDriftError` when the stored signature\n * doesn't match the current definition (unless `force` is set).\n */\nexport async function loadPlannerSnapshotForResume(params: {\n durable: PlannerDurableConfig | undefined;\n plannerName: string;\n signature: string;\n runId: string;\n options?: PlannerResumeOptions<unknown>;\n}): Promise<PlannerSnapshot> {\n const store = resolveSnapshotStore(params.durable);\n\n if (!store) {\n throw new PlannerFailedError(\n `ai.planner(\"${params.plannerName}\"): no durable store configured — set \\`durable: { store }\\` on the config or call \\`ai.config({ defaultSnapshotStore })\\` at boot before calling resume()`,\n { context: { runId: params.runId } },\n );\n }\n\n const snapshot = (await store.load(params.runId)) ?? null;\n\n if (!snapshot) {\n throw new PlannerFailedError(\n `ai.planner(\"${params.plannerName}\"): no snapshot for runId \"${params.runId}\"`,\n { context: { runId: params.runId } },\n );\n }\n\n if (!params.options?.force && snapshot.signature !== params.signature) {\n throw new PlannerDriftError(\n `ai.planner(\"${params.plannerName}\") signature drift on resume`,\n {\n savedSignature: snapshot.signature,\n currentSignature: params.signature,\n runId: params.runId,\n },\n );\n }\n\n return snapshot;\n}\n"],"mappings":";;;;;;;;;;;;;;;;;AAiCA,SAAS,qBACP,SAC4C;CAC5C,OACE,SAAS,SACR,4BAA4B;AAEjC;;;;;;;;AA2BA,eAAsB,uBACpB,QACyB;CACzB,MAAM,QAAQ,qBAAqB,OAAO,OAAO;CAEjD,IAAI,CAAC,OACH,OAAO,EAAE,IAAI,KAAK;CAGpB,MAAM,WAA4B;EAChC,OAAO,OAAO;EACd,aAAa,OAAO;EACpB,WAAW,OAAO;EAClB,SAAS,OAAO;EAChB,MAAM,OAAO;EACb,MAAM,OAAO;EACb,eAAe,OAAO;EACtB,OAAO,OAAO;EACd,UAAU,OAAO;EACjB,aAAa,OAAO;EACpB,QAAQ,OAAO;EACf,WAAW,OAAO;EAClB,0BAAS,IAAI,KAAK,EAAC,CAAC,YAAY;CAClC;CAEA,IAAI;EACF,MAAM,MAAM,KAAK,QAAQ;EAEzB,OAAO,EAAE,IAAI,KAAK;CACpB,SAAS,OAAO;EACd,OAAO;GAAE,IAAI;GAAO;EAAM;CAC5B;AACF;;;;;;AAOA,eAAsB,sBAAsB,QAGhB;CAC1B,MAAM,QAAQ,qBAAqB,OAAO,OAAO;CAEjD,IAAI,CAAC,OACH,OAAO,EAAE,IAAI,KAAK;CAGpB,IAAI;EACF,MAAM,MAAM,OAAO,OAAO,KAAK;EAE/B,OAAO,EAAE,IAAI,KAAK;CACpB,SAAS,OAAO;EACd,OAAO;GAAE,IAAI;GAAO;EAAM;CAC5B;AACF;;;;;;;AAQA,eAAsB,6BAA6B,QAMtB;CAC3B,MAAM,QAAQ,qBAAqB,OAAO,OAAO;CAEjD,IAAI,CAAC,OACH,MAAM,IAAI,mBACR,eAAe,OAAO,YAAY,6JAClC,EAAE,SAAS,EAAE,OAAO,OAAO,MAAM,EAAE,CACrC;CAGF,MAAM,WAAY,MAAM,MAAM,KAAK,OAAO,KAAK,KAAM;CAErD,IAAI,CAAC,UACH,MAAM,IAAI,mBACR,eAAe,OAAO,YAAY,6BAA6B,OAAO,MAAM,IAC5E,EAAE,SAAS,EAAE,OAAO,OAAO,MAAM,EAAE,CACrC;CAGF,IAAI,CAAC,OAAO,SAAS,SAAS,SAAS,cAAc,OAAO,WAC1D,MAAM,IAAI,kBACR,eAAe,OAAO,YAAY,+BAClC;EACE,gBAAgB,SAAS;EACzB,kBAAkB,OAAO;EACzB,OAAO,OAAO;CAChB,CACF;CAGF,OAAO;AACT"}
@@ -0,0 +1,51 @@
1
+ //#region ../@warlock.js/ai/src/rag/hybrid/bm25.ts
2
+ const BM25_K1 = 1.5;
3
+ const BM25_B = .75;
4
+ /** Lowercase + split on non-word characters; drop empties. */
5
+ function tokenize(text) {
6
+ return text.toLowerCase().split(/[^a-z0-9]+/i).filter(Boolean);
7
+ }
8
+ /**
9
+ * Rank `docs` against `query` with BM25 (A4) — the lexical half of hybrid
10
+ * retrieval. Scores keyword overlap with TF saturation (`k1`) and length
11
+ * normalization (`b`) over the candidate set, so an exact-term match
12
+ * surfaces even when dense embeddings miss it. Returns docs sorted by
13
+ * score (highest first); zero-score docs are dropped.
14
+ *
15
+ * Operates over the supplied candidate set (typically the dense retriever's
16
+ * over-fetch), so it needs no global corpus index — ideal for fusing with
17
+ * a vector ranking via {@link reciprocalRankFusion}.
18
+ */
19
+ function bm25Rank(query, docs) {
20
+ const queryTerms = [...new Set(tokenize(query))];
21
+ if (queryTerms.length === 0 || docs.length === 0) return [];
22
+ const tokenized = docs.map((doc) => ({
23
+ id: doc.id,
24
+ terms: tokenize(doc.text)
25
+ }));
26
+ const avgLen = tokenized.reduce((sum, d) => sum + d.terms.length, 0) / tokenized.length || 1;
27
+ const df = /* @__PURE__ */ new Map();
28
+ for (const term of queryTerms) df.set(term, tokenized.filter((d) => d.terms.includes(term)).length);
29
+ const n = tokenized.length;
30
+ return tokenized.map((doc) => {
31
+ const len = doc.terms.length || 1;
32
+ let score = 0;
33
+ for (const term of queryTerms) {
34
+ const tf = doc.terms.filter((t) => t === term).length;
35
+ if (tf === 0) continue;
36
+ const docFreq = df.get(term) ?? 0;
37
+ const idf = Math.log(1 + (n - docFreq + .5) / (docFreq + .5));
38
+ const numerator = tf * 2.5;
39
+ const denominator = tf + BM25_K1 * (1 - BM25_B + BM25_B * (len / avgLen));
40
+ score += idf * (numerator / denominator);
41
+ }
42
+ return {
43
+ id: doc.id,
44
+ score
45
+ };
46
+ }).filter((item) => item.score > 0).sort((a, b) => b.score - a.score);
47
+ }
48
+
49
+ //#endregion
50
+ export { bm25Rank };
51
+ //# sourceMappingURL=bm25.mjs.map
@@ -0,0 +1 @@
1
+ {"version":3,"file":"bm25.mjs","names":[],"sources":["../../../../../../../../../../@warlock.js/ai/src/rag/hybrid/bm25.ts"],"sourcesContent":["import type { RankedItem } from \"./rrf\";\n\n/** A document to score lexically. */\nexport type LexicalDoc = { id: string; text: string };\n\nconst BM25_K1 = 1.5;\nconst BM25_B = 0.75;\n\n/** Lowercase + split on non-word characters; drop empties. */\nfunction tokenize(text: string): string[] {\n return text\n .toLowerCase()\n .split(/[^a-z0-9]+/i)\n .filter(Boolean);\n}\n\n/**\n * Rank `docs` against `query` with BM25 (A4) — the lexical half of hybrid\n * retrieval. Scores keyword overlap with TF saturation (`k1`) and length\n * normalization (`b`) over the candidate set, so an exact-term match\n * surfaces even when dense embeddings miss it. Returns docs sorted by\n * score (highest first); zero-score docs are dropped.\n *\n * Operates over the supplied candidate set (typically the dense retriever's\n * over-fetch), so it needs no global corpus index — ideal for fusing with\n * a vector ranking via {@link reciprocalRankFusion}.\n */\nexport function bm25Rank(query: string, docs: ReadonlyArray<LexicalDoc>): RankedItem[] {\n const queryTerms = [...new Set(tokenize(query))];\n if (queryTerms.length === 0 || docs.length === 0) return [];\n\n const tokenized = docs.map(doc => ({ id: doc.id, terms: tokenize(doc.text) }));\n const avgLen =\n tokenized.reduce((sum, d) => sum + d.terms.length, 0) / tokenized.length || 1;\n\n // Document frequency per query term, across the candidate set.\n const df = new Map<string, number>();\n for (const term of queryTerms) {\n df.set(\n term,\n tokenized.filter(d => d.terms.includes(term)).length,\n );\n }\n\n const n = tokenized.length;\n\n const scored = tokenized.map(doc => {\n const len = doc.terms.length || 1;\n let score = 0;\n\n for (const term of queryTerms) {\n const tf = doc.terms.filter(t => t === term).length;\n if (tf === 0) continue;\n\n const docFreq = df.get(term) ?? 0;\n // BM25 idf (with the +1 to keep it non-negative).\n const idf = Math.log(1 + (n - docFreq + 0.5) / (docFreq + 0.5));\n const numerator = tf * (BM25_K1 + 1);\n const denominator = tf + BM25_K1 * (1 - BM25_B + BM25_B * (len / avgLen));\n score += idf * (numerator / denominator);\n }\n\n return { id: doc.id, score };\n });\n\n return scored.filter(item => item.score > 0).sort((a, b) => b.score - a.score);\n}\n"],"mappings":";AAKA,MAAM,UAAU;AAChB,MAAM,SAAS;;AAGf,SAAS,SAAS,MAAwB;CACxC,OAAO,KACJ,YAAY,CAAC,CACb,MAAM,aAAa,CAAC,CACpB,OAAO,OAAO;AACnB;;;;;;;;;;;;AAaA,SAAgB,SAAS,OAAe,MAA+C;CACrF,MAAM,aAAa,CAAC,GAAG,IAAI,IAAI,SAAS,KAAK,CAAC,CAAC;CAC/C,IAAI,WAAW,WAAW,KAAK,KAAK,WAAW,GAAG,OAAO,CAAC;CAE1D,MAAM,YAAY,KAAK,KAAI,SAAQ;EAAE,IAAI,IAAI;EAAI,OAAO,SAAS,IAAI,IAAI;CAAE,EAAE;CAC7E,MAAM,SACJ,UAAU,QAAQ,KAAK,MAAM,MAAM,EAAE,MAAM,QAAQ,CAAC,IAAI,UAAU,UAAU;CAG9E,MAAM,qBAAK,IAAI,IAAoB;CACnC,KAAK,MAAM,QAAQ,YACjB,GAAG,IACD,MACA,UAAU,QAAO,MAAK,EAAE,MAAM,SAAS,IAAI,CAAC,CAAC,CAAC,MAChD;CAGF,MAAM,IAAI,UAAU;CAqBpB,OAnBe,UAAU,KAAI,QAAO;EAClC,MAAM,MAAM,IAAI,MAAM,UAAU;EAChC,IAAI,QAAQ;EAEZ,KAAK,MAAM,QAAQ,YAAY;GAC7B,MAAM,KAAK,IAAI,MAAM,QAAO,MAAK,MAAM,IAAI,CAAC,CAAC;GAC7C,IAAI,OAAO,GAAG;GAEd,MAAM,UAAU,GAAG,IAAI,IAAI,KAAK;GAEhC,MAAM,MAAM,KAAK,IAAI,KAAK,IAAI,UAAU,OAAQ,UAAU,GAAI;GAC9D,MAAM,YAAY,KAAM;GACxB,MAAM,cAAc,KAAK,WAAW,IAAI,SAAS,UAAU,MAAM;GACjE,SAAS,OAAO,YAAY;EAC9B;EAEA,OAAO;GAAE,IAAI,IAAI;GAAI;EAAM;CAC7B,CAEY,CAAC,CAAC,QAAO,SAAQ,KAAK,QAAQ,CAAC,CAAC,CAAC,MAAM,GAAG,MAAM,EAAE,QAAQ,EAAE,KAAK;AAC/E"}
@@ -0,0 +1,29 @@
1
+ import { reciprocalRankFusion } from "./rrf.mjs";
2
+ import { bm25Rank } from "./bm25.mjs";
3
+
4
+ //#region ../@warlock.js/ai/src/rag/hybrid/hybrid-rank.ts
5
+ /**
6
+ * Hybrid rank (A4) — fuse a dense (vector) ranking with a BM25 lexical
7
+ * ranking over the same candidate set via Reciprocal Rank Fusion. Dense
8
+ * retrieval captures semantic similarity; BM25 captures exact-term
9
+ * matches dense embeddings miss (names, ids, rare tokens). Fusing both
10
+ * beats either alone for keyword-heavy queries.
11
+ *
12
+ * `dense` is the vector retriever's result in rank order; `candidates`
13
+ * supplies the text for the lexical pass (typically the same over-fetched
14
+ * set). Returns the fused ranking, highest score first.
15
+ *
16
+ * @example
17
+ * const fused = hybridRank({
18
+ * query: "invoice 8842 refund",
19
+ * dense: vectorHits, // [{ id }, ...] in similarity order
20
+ * candidates: vectorHits.map(h => ({ id: h.id, text: h.text })),
21
+ * });
22
+ */
23
+ function hybridRank(params) {
24
+ return reciprocalRankFusion([params.dense.map((d) => d.id), bm25Rank(params.query, params.candidates).map((r) => r.id)], params.k);
25
+ }
26
+
27
+ //#endregion
28
+ export { hybridRank };
29
+ //# sourceMappingURL=hybrid-rank.mjs.map
@@ -0,0 +1 @@
1
+ {"version":3,"file":"hybrid-rank.mjs","names":[],"sources":["../../../../../../../../../../@warlock.js/ai/src/rag/hybrid/hybrid-rank.ts"],"sourcesContent":["import { bm25Rank, type LexicalDoc } from \"./bm25\";\nimport { reciprocalRankFusion, type RankedItem } from \"./rrf\";\n\n/**\n * Hybrid rank (A4) — fuse a dense (vector) ranking with a BM25 lexical\n * ranking over the same candidate set via Reciprocal Rank Fusion. Dense\n * retrieval captures semantic similarity; BM25 captures exact-term\n * matches dense embeddings miss (names, ids, rare tokens). Fusing both\n * beats either alone for keyword-heavy queries.\n *\n * `dense` is the vector retriever's result in rank order; `candidates`\n * supplies the text for the lexical pass (typically the same over-fetched\n * set). Returns the fused ranking, highest score first.\n *\n * @example\n * const fused = hybridRank({\n * query: \"invoice 8842 refund\",\n * dense: vectorHits, // [{ id }, ...] in similarity order\n * candidates: vectorHits.map(h => ({ id: h.id, text: h.text })),\n * });\n */\nexport function hybridRank(params: {\n query: string;\n dense: ReadonlyArray<{ id: string }>;\n candidates: ReadonlyArray<LexicalDoc>;\n k?: number;\n}): RankedItem[] {\n const denseIds = params.dense.map(d => d.id);\n const lexicalIds = bm25Rank(params.query, params.candidates).map(r => r.id);\n\n return reciprocalRankFusion([denseIds, lexicalIds], params.k);\n}\n"],"mappings":";;;;;;;;;;;;;;;;;;;;;;AAqBA,SAAgB,WAAW,QAKV;CAIf,OAAO,qBAAqB,CAHX,OAAO,MAAM,KAAI,MAAK,EAAE,EAGL,GAFjB,SAAS,OAAO,OAAO,OAAO,UAAU,CAAC,CAAC,KAAI,MAAK,EAAE,EAExB,CAAC,GAAG,OAAO,CAAC;AAC9D"}
@@ -0,0 +1,30 @@
1
+ //#region ../@warlock.js/ai/src/rag/hybrid/rrf.ts
2
+ /**
3
+ * Reciprocal Rank Fusion (A4) — combine several independently-ranked
4
+ * lists of ids into one consensus ranking. Each list contributes
5
+ * `1 / (k + rank)` to an id's score (rank is 0-based within that list), so
6
+ * an id near the top of multiple lists rises even if no single list ranks
7
+ * it first. The classic fusion for hybrid (dense + lexical) retrieval
8
+ * because it needs no score calibration between the lists.
9
+ *
10
+ * `k` (default 60, the standard) dampens the contribution of lower ranks.
11
+ * Returns ids sorted by fused score, highest first.
12
+ *
13
+ * @example
14
+ * reciprocalRankFusion([["a", "b", "c"], ["b", "a"]]);
15
+ * // → [{ id: "b", ... }, { id: "a", ... }, { id: "c", ... }]
16
+ */
17
+ function reciprocalRankFusion(rankedLists, k = 60) {
18
+ const scores = /* @__PURE__ */ new Map();
19
+ for (const list of rankedLists) list.forEach((id, rank) => {
20
+ scores.set(id, (scores.get(id) ?? 0) + 1 / (k + rank));
21
+ });
22
+ return [...scores.entries()].map(([id, score]) => ({
23
+ id,
24
+ score
25
+ })).sort((a, b) => b.score - a.score);
26
+ }
27
+
28
+ //#endregion
29
+ export { reciprocalRankFusion };
30
+ //# sourceMappingURL=rrf.mjs.map
@@ -0,0 +1 @@
1
+ {"version":3,"file":"rrf.mjs","names":[],"sources":["../../../../../../../../../../@warlock.js/ai/src/rag/hybrid/rrf.ts"],"sourcesContent":["/** One item's id paired with a fused relevance score. */\nexport type RankedItem = { id: string; score: number };\n\n/**\n * Reciprocal Rank Fusion (A4) — combine several independently-ranked\n * lists of ids into one consensus ranking. Each list contributes\n * `1 / (k + rank)` to an id's score (rank is 0-based within that list), so\n * an id near the top of multiple lists rises even if no single list ranks\n * it first. The classic fusion for hybrid (dense + lexical) retrieval\n * because it needs no score calibration between the lists.\n *\n * `k` (default 60, the standard) dampens the contribution of lower ranks.\n * Returns ids sorted by fused score, highest first.\n *\n * @example\n * reciprocalRankFusion([[\"a\", \"b\", \"c\"], [\"b\", \"a\"]]);\n * // → [{ id: \"b\", ... }, { id: \"a\", ... }, { id: \"c\", ... }]\n */\nexport function reciprocalRankFusion(\n rankedLists: ReadonlyArray<ReadonlyArray<string>>,\n k = 60,\n): RankedItem[] {\n const scores = new Map<string, number>();\n\n for (const list of rankedLists) {\n list.forEach((id, rank) => {\n scores.set(id, (scores.get(id) ?? 0) + 1 / (k + rank));\n });\n }\n\n return [...scores.entries()]\n .map(([id, score]) => ({ id, score }))\n .sort((a, b) => b.score - a.score);\n}\n"],"mappings":";;;;;;;;;;;;;;;;AAkBA,SAAgB,qBACd,aACA,IAAI,IACU;CACd,MAAM,yBAAS,IAAI,IAAoB;CAEvC,KAAK,MAAM,QAAQ,aACjB,KAAK,SAAS,IAAI,SAAS;EACzB,OAAO,IAAI,KAAK,OAAO,IAAI,EAAE,KAAK,KAAK,KAAK,IAAI,KAAK;CACvD,CAAC;CAGH,OAAO,CAAC,GAAG,OAAO,QAAQ,CAAC,CAAC,CACzB,KAAK,CAAC,IAAI,YAAY;EAAE;EAAI;CAAM,EAAE,CAAC,CACrC,MAAM,GAAG,MAAM,EAAE,QAAQ,EAAE,KAAK;AACrC"}
@@ -1,7 +1,18 @@
1
1
  import { chunk } from "./chunk/chunk.mjs";
2
2
  import { cacheVectorStore } from "./store/cache-vector-store.mjs";
3
3
  import { rag } from "./rag.mjs";
4
+ import { pgVectorStore, vectorLiteral } from "./store/pg-vector-store.mjs";
5
+ import { loadText } from "./loaders/load-text.mjs";
6
+ import { loadHtml } from "./loaders/load-html.mjs";
7
+ import { loadWeb } from "./loaders/load-web.mjs";
8
+ import { PDF_PARSE_INSTALL_INSTRUCTIONS } from "./loaders/errors.mjs";
9
+ import { loadPdf } from "./loaders/load-pdf.mjs";
10
+ import "./loaders/index.mjs";
4
11
  import { keywordReranker } from "./rerank/keyword-reranker.mjs";
5
12
  import { llmReranker } from "./rerank/llm-reranker.mjs";
13
+ import { reciprocalRankFusion } from "./hybrid/rrf.mjs";
14
+ import { bm25Rank } from "./hybrid/bm25.mjs";
15
+ import { hybridRank } from "./hybrid/hybrid-rank.mjs";
16
+ import { multiQuery } from "./transforms/multi-query.mjs";
6
17
 
7
18
  export { };
@@ -0,0 +1,25 @@
1
+ //#region ../@warlock.js/ai/src/rag/loaders/errors.ts
2
+ /**
3
+ * Loader error surface. The only loader-specific failure is a missing
4
+ * OPTIONAL peer (`pdf-parse`), which — like the moderation detector's
5
+ * missing `openai` peer — is an *infrastructure* fault, not a content
6
+ * problem, so {@link loadPdf} throws a plain `Error` carrying the curated
7
+ * {@link PDF_PARSE_INSTALL_INSTRUCTIONS} rather than an `AIError`. Mirrors
8
+ * the guard's `OPENAI_INSTALL_INSTRUCTIONS` / ai-panoptic's
9
+ * `LANGFUSE_INSTALL_INSTRUCTIONS`.
10
+ */
11
+ /**
12
+ * Curated install string thrown by {@link loadPdf} on first call when the
13
+ * `pdf-parse` peer is absent. Surfaced instead of a raw
14
+ * module-resolution stack trace.
15
+ */
16
+ const PDF_PARSE_INSTALL_INSTRUCTIONS = `
17
+ The @warlock.js/ai PDF loader requires the optional "pdf-parse" peer.
18
+ Install it with:
19
+
20
+ npm install pdf-parse
21
+ `.trim();
22
+
23
+ //#endregion
24
+ export { PDF_PARSE_INSTALL_INSTRUCTIONS };
25
+ //# sourceMappingURL=errors.mjs.map
@@ -0,0 +1 @@
1
+ {"version":3,"file":"errors.mjs","names":[],"sources":["../../../../../../../../../../@warlock.js/ai/src/rag/loaders/errors.ts"],"sourcesContent":["/**\n * Loader error surface. The only loader-specific failure is a missing\n * OPTIONAL peer (`pdf-parse`), which — like the moderation detector's\n * missing `openai` peer — is an *infrastructure* fault, not a content\n * problem, so {@link loadPdf} throws a plain `Error` carrying the curated\n * {@link PDF_PARSE_INSTALL_INSTRUCTIONS} rather than an `AIError`. Mirrors\n * the guard's `OPENAI_INSTALL_INSTRUCTIONS` / ai-panoptic's\n * `LANGFUSE_INSTALL_INSTRUCTIONS`.\n */\n\n/**\n * Curated install string thrown by {@link loadPdf} on first call when the\n * `pdf-parse` peer is absent. Surfaced instead of a raw\n * module-resolution stack trace.\n */\nexport const PDF_PARSE_INSTALL_INSTRUCTIONS = `\nThe @warlock.js/ai PDF loader requires the optional \"pdf-parse\" peer.\nInstall it with:\n\n npm install pdf-parse\n`.trim();\n"],"mappings":";;;;;;;;;;;;;;;AAeA,MAAa,iCAAiC;;;;;EAK5C,KAAK"}
@@ -0,0 +1,7 @@
1
+ import { loadText } from "./load-text.mjs";
2
+ import { loadHtml } from "./load-html.mjs";
3
+ import { loadWeb } from "./load-web.mjs";
4
+ import { PDF_PARSE_INSTALL_INSTRUCTIONS } from "./errors.mjs";
5
+ import { loadPdf } from "./load-pdf.mjs";
6
+
7
+ export { };
@@ -0,0 +1,138 @@
1
+ //#region ../@warlock.js/ai/src/rag/loaders/load-html.ts
2
+ /** Default `id` when the caller supplies none. */
3
+ const DEFAULT_ID = "document";
4
+ /**
5
+ * Elements whose *content* is not human-readable text and must be removed
6
+ * wholesale (open tag → close tag → everything in between) before tags are
7
+ * stripped. `script` / `style` would otherwise leak code into the chunked
8
+ * text; `noscript` / `template` / `head` / `svg` are non-prose noise.
9
+ */
10
+ const STRIPPED_ELEMENTS = [
11
+ "script",
12
+ "style",
13
+ "noscript",
14
+ "template",
15
+ "head",
16
+ "svg"
17
+ ];
18
+ /**
19
+ * Block-level tags that imply a line break in the readable text. Replacing
20
+ * them with `\n` BEFORE the generic tag strip keeps paragraph / list / table
21
+ * structure (so the recursive splitter still sees `\n\n` boundaries) instead
22
+ * of collapsing the whole page onto one line.
23
+ */
24
+ const BLOCK_TAGS = /<\/?(?:p|div|section|article|header|footer|main|aside|nav|h[1-6]|ul|ol|li|table|tr|td|th|thead|tbody|blockquote|pre|hr|br)\b[^>]*>/gi;
25
+ /** Named HTML entities common in prose. Numeric entities are decoded generically. */
26
+ const NAMED_ENTITIES = {
27
+ amp: "&",
28
+ lt: "<",
29
+ gt: ">",
30
+ quot: "\"",
31
+ apos: "'",
32
+ nbsp: " ",
33
+ copy: "©",
34
+ reg: "®",
35
+ trade: "™",
36
+ hellip: "…",
37
+ mdash: "—",
38
+ ndash: "–",
39
+ lsquo: "‘",
40
+ rsquo: "’",
41
+ ldquo: "“",
42
+ rdquo: "”",
43
+ laquo: "«",
44
+ raquo: "»",
45
+ middot: "·",
46
+ bull: "•"
47
+ };
48
+ /**
49
+ * Decode the HTML entities that survive tag stripping: named (`&amp;`),
50
+ * decimal (`&#169;`), and hex (`&#xA9;`). Unknown named entities are left
51
+ * verbatim rather than dropped, so unusual markup never silently loses text.
52
+ */
53
+ function decodeEntities(text) {
54
+ return text.replace(/&(#x?[0-9a-f]+|[a-z][a-z0-9]*);/gi, (match, body) => {
55
+ if (body[0] === "#") {
56
+ const codePoint = body[1] === "x" || body[1] === "X" ? Number.parseInt(body.slice(2), 16) : Number.parseInt(body.slice(1), 10);
57
+ if (Number.isNaN(codePoint) || codePoint < 0 || codePoint > 1114111) return match;
58
+ try {
59
+ return String.fromCodePoint(codePoint);
60
+ } catch {
61
+ return match;
62
+ }
63
+ }
64
+ return NAMED_ENTITIES[body.toLowerCase()] ?? match;
65
+ });
66
+ }
67
+ /**
68
+ * Pull the `<title>` text out of the document, decoded and trimmed, or
69
+ * `undefined` when there is none. Read BEFORE `<head>` is stripped.
70
+ */
71
+ function extractTitle(html) {
72
+ const match = /<title[^>]*>([\s\S]*?)<\/title>/i.exec(html);
73
+ if (!match) return;
74
+ const title = decodeEntities(match[1]).replace(/\s+/g, " ").trim();
75
+ return title.length > 0 ? title : void 0;
76
+ }
77
+ /**
78
+ * Strip HTML markup down to readable plain text — a lightweight,
79
+ * dependency-free pass (no DOM parser): drop comments and non-prose elements
80
+ * (`script` / `style` / `head` / `svg` / …) content-and-all, convert block
81
+ * tags to line breaks to preserve paragraph structure, remove every
82
+ * remaining tag, decode entities, then collapse runs of whitespace while
83
+ * keeping blank-line paragraph separators.
84
+ */
85
+ function htmlToText(html) {
86
+ let text = html;
87
+ text = text.replace(/<!--[\s\S]*?-->/g, " ");
88
+ for (const tag of STRIPPED_ELEMENTS) {
89
+ const element = new RegExp(`<${tag}\\b[^>]*>[\\s\\S]*?<\\/${tag}>`, "gi");
90
+ text = text.replace(element, " ");
91
+ text = text.replace(new RegExp(`<\\/?${tag}\\b[^>]*>`, "gi"), " ");
92
+ }
93
+ text = text.replace(BLOCK_TAGS, "\n");
94
+ text = text.replace(/<[^>]+>/g, "");
95
+ text = decodeEntities(text);
96
+ text = text.replace(/[^\S\n]+/g, " ").replace(/[ \t]*\n[ \t]*/g, "\n").replace(/\n{3,}/g, "\n\n").trim();
97
+ return text;
98
+ }
99
+ /**
100
+ * Load an HTML string into a single {@link RagDocument} of readable text.
101
+ * Scripts, styles, and other non-prose elements are dropped content-and-all,
102
+ * block tags become line breaks (so paragraph structure survives for the
103
+ * splitter), remaining tags are stripped, and HTML entities are decoded — a
104
+ * lightweight regex pass, no heavy DOM dependency.
105
+ *
106
+ * The document's `metadata.title` is set from the page's `<title>` (unless
107
+ * the caller overrode it), and `metadata.loader` is `"html"`. The output is
108
+ * the exact shape `index()` consumes.
109
+ *
110
+ * @example
111
+ * const kb = ai.rag({ embedder, store });
112
+ * await kb.index(loadHtml(rawHtmlString, { id: "landing-page" }));
113
+ *
114
+ * @param html - The raw HTML markup.
115
+ * @param options - Shared `id` / `metadata` / `tags` ({@link LoadHtmlOptions}).
116
+ * @returns A {@link RagLoaderResult} (one document) ready for `rag.index()`.
117
+ */
118
+ function loadHtml(html, options = {}) {
119
+ const id = options.id ?? DEFAULT_ID;
120
+ const title = extractTitle(html);
121
+ const text = htmlToText(html);
122
+ if (text.length === 0) return [];
123
+ return [{
124
+ id,
125
+ text,
126
+ metadata: {
127
+ source: id,
128
+ loader: "html",
129
+ ...title !== void 0 ? { title } : {},
130
+ ...options.metadata
131
+ },
132
+ tags: options.tags
133
+ }];
134
+ }
135
+
136
+ //#endregion
137
+ export { extractTitle, htmlToText, loadHtml };
138
+ //# sourceMappingURL=load-html.mjs.map
@@ -0,0 +1 @@
1
+ {"version":3,"file":"load-html.mjs","names":[],"sources":["../../../../../../../../../../@warlock.js/ai/src/rag/loaders/load-html.ts"],"sourcesContent":["import type { RagDocument } from \"../contracts/rag-document.type\";\nimport type { LoadHtmlOptions, RagLoaderResult } from \"./loader.type\";\n\n/** Default `id` when the caller supplies none. */\nconst DEFAULT_ID = \"document\";\n\n/**\n * Elements whose *content* is not human-readable text and must be removed\n * wholesale (open tag → close tag → everything in between) before tags are\n * stripped. `script` / `style` would otherwise leak code into the chunked\n * text; `noscript` / `template` / `head` / `svg` are non-prose noise.\n */\nconst STRIPPED_ELEMENTS = [\n \"script\",\n \"style\",\n \"noscript\",\n \"template\",\n \"head\",\n \"svg\",\n];\n\n/**\n * Block-level tags that imply a line break in the readable text. Replacing\n * them with `\\n` BEFORE the generic tag strip keeps paragraph / list / table\n * structure (so the recursive splitter still sees `\\n\\n` boundaries) instead\n * of collapsing the whole page onto one line.\n */\nconst BLOCK_TAGS =\n /<\\/?(?:p|div|section|article|header|footer|main|aside|nav|h[1-6]|ul|ol|li|table|tr|td|th|thead|tbody|blockquote|pre|hr|br)\\b[^>]*>/gi;\n\n/** Named HTML entities common in prose. Numeric entities are decoded generically. */\nconst NAMED_ENTITIES: Record<string, string> = {\n amp: \"&\",\n lt: \"<\",\n gt: \">\",\n quot: '\"',\n apos: \"'\",\n nbsp: \" \",\n copy: \"©\",\n reg: \"®\",\n trade: \"™\",\n hellip: \"…\",\n mdash: \"—\",\n ndash: \"–\",\n lsquo: \"‘\",\n rsquo: \"’\",\n ldquo: \"“\",\n rdquo: \"”\",\n laquo: \"«\",\n raquo: \"»\",\n middot: \"·\",\n bull: \"•\",\n};\n\n/**\n * Decode the HTML entities that survive tag stripping: named (`&amp;`),\n * decimal (`&#169;`), and hex (`&#xA9;`). Unknown named entities are left\n * verbatim rather than dropped, so unusual markup never silently loses text.\n */\nfunction decodeEntities(text: string): string {\n return text.replace(/&(#x?[0-9a-f]+|[a-z][a-z0-9]*);/gi, (match, body: string) => {\n if (body[0] === \"#\") {\n const codePoint =\n body[1] === \"x\" || body[1] === \"X\"\n ? Number.parseInt(body.slice(2), 16)\n : Number.parseInt(body.slice(1), 10);\n\n if (Number.isNaN(codePoint) || codePoint < 0 || codePoint > 0x10ffff) {\n return match;\n }\n\n try {\n return String.fromCodePoint(codePoint);\n } catch {\n return match;\n }\n }\n\n const named = NAMED_ENTITIES[body.toLowerCase()];\n\n return named ?? match;\n });\n}\n\n/**\n * Pull the `<title>` text out of the document, decoded and trimmed, or\n * `undefined` when there is none. Read BEFORE `<head>` is stripped.\n */\nfunction extractTitle(html: string): string | undefined {\n const match = /<title[^>]*>([\\s\\S]*?)<\\/title>/i.exec(html);\n\n if (!match) {\n return undefined;\n }\n\n const title = decodeEntities(match[1]).replace(/\\s+/g, \" \").trim();\n\n return title.length > 0 ? title : undefined;\n}\n\n/**\n * Strip HTML markup down to readable plain text — a lightweight,\n * dependency-free pass (no DOM parser): drop comments and non-prose elements\n * (`script` / `style` / `head` / `svg` / …) content-and-all, convert block\n * tags to line breaks to preserve paragraph structure, remove every\n * remaining tag, decode entities, then collapse runs of whitespace while\n * keeping blank-line paragraph separators.\n */\nfunction htmlToText(html: string): string {\n let text = html;\n\n // 1. Comments first — a commented-out `<script>` must not survive.\n text = text.replace(/<!--[\\s\\S]*?-->/g, \" \");\n\n // 2. Non-prose elements, content and all.\n for (const tag of STRIPPED_ELEMENTS) {\n const element = new RegExp(`<${tag}\\\\b[^>]*>[\\\\s\\\\S]*?<\\\\/${tag}>`, \"gi\");\n text = text.replace(element, \" \");\n // Defensively drop a self-closing / unterminated open tag too.\n text = text.replace(new RegExp(`<\\\\/?${tag}\\\\b[^>]*>`, \"gi\"), \" \");\n }\n\n // 3. Block tags → newlines, so paragraph / list structure survives.\n text = text.replace(BLOCK_TAGS, \"\\n\");\n\n // 4. Every remaining tag → gone.\n text = text.replace(/<[^>]+>/g, \"\");\n\n // 5. Entities → characters.\n text = decodeEntities(text);\n\n // 6. Normalize whitespace: trim each line, drop blank runs to a single\n // blank line (a paragraph separator the recursive splitter honors).\n text = text\n .replace(/[^\\S\\n]+/g, \" \")\n .replace(/[ \\t]*\\n[ \\t]*/g, \"\\n\")\n .replace(/\\n{3,}/g, \"\\n\\n\")\n .trim();\n\n return text;\n}\n\n/**\n * Load an HTML string into a single {@link RagDocument} of readable text.\n * Scripts, styles, and other non-prose elements are dropped content-and-all,\n * block tags become line breaks (so paragraph structure survives for the\n * splitter), remaining tags are stripped, and HTML entities are decoded — a\n * lightweight regex pass, no heavy DOM dependency.\n *\n * The document's `metadata.title` is set from the page's `<title>` (unless\n * the caller overrode it), and `metadata.loader` is `\"html\"`. The output is\n * the exact shape `index()` consumes.\n *\n * @example\n * const kb = ai.rag({ embedder, store });\n * await kb.index(loadHtml(rawHtmlString, { id: \"landing-page\" }));\n *\n * @param html - The raw HTML markup.\n * @param options - Shared `id` / `metadata` / `tags` ({@link LoadHtmlOptions}).\n * @returns A {@link RagLoaderResult} (one document) ready for `rag.index()`.\n */\nexport function loadHtml(\n html: string,\n options: LoadHtmlOptions = {},\n): RagLoaderResult {\n const id = options.id ?? DEFAULT_ID;\n const title = extractTitle(html);\n const text = htmlToText(html);\n\n // An all-markup / empty page strips to nothing; emit no document so\n // index() never receives a no-op record (matches loadText's behavior).\n if (text.length === 0) {\n return [];\n }\n\n // Derived keys (source, loader, title) sit UNDER the caller's metadata so\n // an explicit override always wins.\n const doc: RagDocument = {\n id,\n text,\n metadata: {\n source: id,\n loader: \"html\",\n ...(title !== undefined ? { title } : {}),\n ...options.metadata,\n },\n tags: options.tags,\n };\n\n return [doc];\n}\n\n/** Internal — exported for the web loader so it shares the exact strip pass. */\nexport { htmlToText, extractTitle };\n"],"mappings":";;AAIA,MAAM,aAAa;;;;;;;AAQnB,MAAM,oBAAoB;CACxB;CACA;CACA;CACA;CACA;CACA;AACF;;;;;;;AAQA,MAAM,aACJ;;AAGF,MAAM,iBAAyC;CAC7C,KAAK;CACL,IAAI;CACJ,IAAI;CACJ,MAAM;CACN,MAAM;CACN,MAAM;CACN,MAAM;CACN,KAAK;CACL,OAAO;CACP,QAAQ;CACR,OAAO;CACP,OAAO;CACP,OAAO;CACP,OAAO;CACP,OAAO;CACP,OAAO;CACP,OAAO;CACP,OAAO;CACP,QAAQ;CACR,MAAM;AACR;;;;;;AAOA,SAAS,eAAe,MAAsB;CAC5C,OAAO,KAAK,QAAQ,sCAAsC,OAAO,SAAiB;EAChF,IAAI,KAAK,OAAO,KAAK;GACnB,MAAM,YACJ,KAAK,OAAO,OAAO,KAAK,OAAO,MAC3B,OAAO,SAAS,KAAK,MAAM,CAAC,GAAG,EAAE,IACjC,OAAO,SAAS,KAAK,MAAM,CAAC,GAAG,EAAE;GAEvC,IAAI,OAAO,MAAM,SAAS,KAAK,YAAY,KAAK,YAAY,SAC1D,OAAO;GAGT,IAAI;IACF,OAAO,OAAO,cAAc,SAAS;GACvC,QAAQ;IACN,OAAO;GACT;EACF;EAIA,OAFc,eAAe,KAAK,YAAY,MAE9B;CAClB,CAAC;AACH;;;;;AAMA,SAAS,aAAa,MAAkC;CACtD,MAAM,QAAQ,mCAAmC,KAAK,IAAI;CAE1D,IAAI,CAAC,OACH;CAGF,MAAM,QAAQ,eAAe,MAAM,EAAE,CAAC,CAAC,QAAQ,QAAQ,GAAG,CAAC,CAAC,KAAK;CAEjE,OAAO,MAAM,SAAS,IAAI,QAAQ;AACpC;;;;;;;;;AAUA,SAAS,WAAW,MAAsB;CACxC,IAAI,OAAO;CAGX,OAAO,KAAK,QAAQ,oBAAoB,GAAG;CAG3C,KAAK,MAAM,OAAO,mBAAmB;EACnC,MAAM,UAAU,IAAI,OAAO,IAAI,IAAI,yBAAyB,IAAI,IAAI,IAAI;EACxE,OAAO,KAAK,QAAQ,SAAS,GAAG;EAEhC,OAAO,KAAK,QAAQ,IAAI,OAAO,QAAQ,IAAI,YAAY,IAAI,GAAG,GAAG;CACnE;CAGA,OAAO,KAAK,QAAQ,YAAY,IAAI;CAGpC,OAAO,KAAK,QAAQ,YAAY,EAAE;CAGlC,OAAO,eAAe,IAAI;CAI1B,OAAO,KACJ,QAAQ,aAAa,GAAG,CAAC,CACzB,QAAQ,mBAAmB,IAAI,CAAC,CAChC,QAAQ,WAAW,MAAM,CAAC,CAC1B,KAAK;CAER,OAAO;AACT;;;;;;;;;;;;;;;;;;;;AAqBA,SAAgB,SACd,MACA,UAA2B,CAAC,GACX;CACjB,MAAM,KAAK,QAAQ,MAAM;CACzB,MAAM,QAAQ,aAAa,IAAI;CAC/B,MAAM,OAAO,WAAW,IAAI;CAI5B,IAAI,KAAK,WAAW,GAClB,OAAO,CAAC;CAiBV,OAAO,CAAC;EAXN;EACA;EACA,UAAU;GACR,QAAQ;GACR,QAAQ;GACR,GAAI,UAAU,SAAY,EAAE,MAAM,IAAI,CAAC;GACvC,GAAG,QAAQ;EACb;EACA,MAAM,QAAQ;CAGN,CAAC;AACb"}
@@ -0,0 +1,150 @@
1
+ import { PDF_PARSE_INSTALL_INSTRUCTIONS } from "./errors.mjs";
2
+
3
+ //#region ../@warlock.js/ai/src/rag/loaders/load-pdf.ts
4
+ /** Default `id` when the caller supplies none. */
5
+ const DEFAULT_ID = "document";
6
+ let pdfParse;
7
+ let isModuleExists;
8
+ let loadingPromise;
9
+ /**
10
+ * Settle the lazy import of `pdf-parse` once, concurrency-safe. A bare
11
+ * `catch` flips the flag to `false`; the curated
12
+ * {@link PDF_PARSE_INSTALL_INSTRUCTIONS} surfaces at first
13
+ * {@link loadPdf} call, never a raw module-resolution stack trace. Mirrors
14
+ * the guard moderation detector's `loadOpenAi`.
15
+ */
16
+ function loadPdfParse() {
17
+ if (isModuleExists !== void 0) return Promise.resolve();
18
+ if (loadingPromise) return loadingPromise;
19
+ loadingPromise = (async () => {
20
+ try {
21
+ const mod = await import("pdf-parse");
22
+ pdfParse = mod.default ?? mod;
23
+ isModuleExists = typeof pdfParse === "function";
24
+ } catch {
25
+ isModuleExists = false;
26
+ }
27
+ })();
28
+ return loadingPromise;
29
+ }
30
+ /**
31
+ * Coerce a {@link RagDocument}-compatible binary input into a `Buffer` for
32
+ * `pdf-parse`. Accepts a Node `Buffer`, an `ArrayBuffer`, or a typed array
33
+ * (`Uint8Array`) — the shapes a file read / fetch body hands back.
34
+ */
35
+ function toBuffer(input) {
36
+ if (Buffer.isBuffer(input)) return input;
37
+ if (input instanceof ArrayBuffer) return Buffer.from(input);
38
+ return Buffer.from(input.buffer, input.byteOffset, input.byteLength);
39
+ }
40
+ /**
41
+ * Load a PDF's bytes into {@link RagDocument}(s) via the OPTIONAL `pdf-parse`
42
+ * peer. The peer is resolved lazily on the FIRST call (not at import) so
43
+ * importing `@warlock.js/ai` never forces it to be installed; when it is
44
+ * absent the curated {@link PDF_PARSE_INSTALL_INSTRUCTIONS} is thrown as a
45
+ * plain `Error` (a missing optional peer is an infrastructure fault, not a
46
+ * content problem).
47
+ *
48
+ * By default the whole PDF becomes a single document carrying
49
+ * `metadata.pageCount`. With `perPage: true`, each page becomes its own
50
+ * document (`id` suffixed `#p<n>`, `metadata.page` set) so citations stay
51
+ * page-precise. Document `metadata.title` comes from the PDF info
52
+ * dictionary's `Title` (unless overridden), and `metadata.loader` is
53
+ * `"pdf"`. The output is the exact shape `index()` consumes.
54
+ *
55
+ * @example
56
+ * import { readFile } from "node:fs/promises";
57
+ * const kb = ai.rag({ embedder, store });
58
+ * await kb.index(await loadPdf(await readFile("guide.pdf"), { id: "guide" }));
59
+ *
60
+ * @example
61
+ * // One document per page for page-precise citations:
62
+ * await kb.index(await loadPdf(bytes, { id: "manual", perPage: true }));
63
+ *
64
+ * @param input - The PDF bytes (`Buffer`, `ArrayBuffer`, or `Uint8Array`).
65
+ * @param options - `perPage` plus shared `id` / `metadata` / `tags`
66
+ * ({@link LoadPdfOptions}).
67
+ * @returns A {@link RagLoaderResult} ready for `rag.index()`.
68
+ * @throws {Error} carrying {@link PDF_PARSE_INSTALL_INSTRUCTIONS} when the
69
+ * `pdf-parse` peer is not installed.
70
+ */
71
+ async function loadPdf(input, options = {}) {
72
+ await loadPdfParse();
73
+ if (!isModuleExists || !pdfParse) throw new Error(PDF_PARSE_INSTALL_INSTRUCTIONS);
74
+ const id = options.id ?? DEFAULT_ID;
75
+ if (options.perPage ?? false) return loadPerPage(input, id, options);
76
+ const parsed = await pdfParse(toBuffer(input));
77
+ const text = parsed.text.trim();
78
+ const title = parsed.info?.Title?.trim();
79
+ if (text.length === 0) return [];
80
+ return [{
81
+ id,
82
+ text,
83
+ metadata: {
84
+ source: id,
85
+ loader: "pdf",
86
+ pageCount: parsed.numpages,
87
+ ...title ? { title } : {},
88
+ ...options.metadata
89
+ },
90
+ tags: options.tags
91
+ }];
92
+ }
93
+ /**
94
+ * Per-page variant: render each page separately via `pdf-parse`'s
95
+ * `pagerender` hook, accumulating one document per non-empty page. Each
96
+ * carries `metadata.page` (1-based) and `metadata.pageCount`, and its id is
97
+ * the base id suffixed `#p<n>` so every page-document is distinctly
98
+ * identified for citation.
99
+ *
100
+ * `pdf-parse` calls `pagerender` once per page in document order and
101
+ * `await`s the returned string, so capturing each page's joined text content
102
+ * here gives reliable page boundaries the concatenated `text` lacks.
103
+ */
104
+ async function loadPerPage(input, id, options) {
105
+ const pages = [];
106
+ const parsed = await pdfParse(toBuffer(input), { pagerender: async (page) => {
107
+ const rendered = await renderPage(page);
108
+ pages.push(rendered);
109
+ return rendered;
110
+ } });
111
+ const title = parsed.info?.Title?.trim();
112
+ const docs = [];
113
+ pages.forEach((pageText, index) => {
114
+ const text = pageText.trim();
115
+ if (text.length === 0) return;
116
+ const pageNumber = index + 1;
117
+ docs.push({
118
+ id: `${id}#p${pageNumber}`,
119
+ text,
120
+ metadata: {
121
+ source: id,
122
+ loader: "pdf",
123
+ page: pageNumber,
124
+ pageCount: parsed.numpages,
125
+ ...title ? { title } : {},
126
+ ...options.metadata
127
+ },
128
+ tags: options.tags
129
+ });
130
+ });
131
+ return docs;
132
+ }
133
+ /**
134
+ * Join a single page's text-layer items in reading order, inserting a space
135
+ * between items so adjacent words do not run together. Mirrors the essence
136
+ * of `pdf-parse`'s default renderer without depending on its internals, so
137
+ * the per-page hook stays stable across `pdf-parse` versions. A page with no
138
+ * text layer (scanned image) renders to an empty string and is dropped.
139
+ */
140
+ async function renderPage(page) {
141
+ if (typeof page?.getTextContent !== "function") return "";
142
+ return (await page.getTextContent({
143
+ normalizeWhitespace: true,
144
+ disableCombineTextItems: false
145
+ })).items.map((item) => item.str).join(" ").replace(/\s+/g, " ").trim();
146
+ }
147
+
148
+ //#endregion
149
+ export { loadPdf };
150
+ //# sourceMappingURL=load-pdf.mjs.map
@@ -0,0 +1 @@
1
+ {"version":3,"file":"load-pdf.mjs","names":[],"sources":["../../../../../../../../../../@warlock.js/ai/src/rag/loaders/load-pdf.ts"],"sourcesContent":["import type { RagDocument } from \"../contracts/rag-document.type\";\nimport { PDF_PARSE_INSTALL_INSTRUCTIONS } from \"./errors\";\nimport type { LoadPdfOptions, RagLoaderResult } from \"./loader.type\";\n\n/** Default `id` when the caller supplies none. */\nconst DEFAULT_ID = \"document\";\n\n/**\n * The slice of `pdf-parse`'s result we consume. The peer returns more\n * (`info`, `metadata`, `version`); we only need the extracted `text` and\n * page count, so we type just those to keep the dependency at arm's length.\n */\ntype PdfParseResult = {\n /** Concatenated text of every page. */\n text: string;\n /** Number of pages in the document. */\n numpages: number;\n /** Document info dictionary — `Title` lifted into metadata when present. */\n info?: { Title?: string } & Record<string, unknown>;\n};\n\n/** The `pdf-parse` module's callable default export. */\ntype PdfParseFn = (\n data: Buffer | Uint8Array,\n options?: {\n /**\n * Per-page renderer `pdf-parse` calls once per page in document order and\n * `await`s — may return the page text synchronously or as a promise.\n */\n pagerender?: (page: unknown) => string | Promise<string>;\n },\n) => Promise<PdfParseResult>;\n\n// ============================================================\n// Lazily-loaded pdf-parse (OPTIONAL peer)\n// ============================================================\n\nlet pdfParse: PdfParseFn | undefined;\nlet isModuleExists: boolean | undefined;\nlet loadingPromise: Promise<void> | undefined;\n\n/**\n * Settle the lazy import of `pdf-parse` once, concurrency-safe. A bare\n * `catch` flips the flag to `false`; the curated\n * {@link PDF_PARSE_INSTALL_INSTRUCTIONS} surfaces at first\n * {@link loadPdf} call, never a raw module-resolution stack trace. Mirrors\n * the guard moderation detector's `loadOpenAi`.\n */\nfunction loadPdfParse(): Promise<void> {\n if (isModuleExists !== undefined) {\n return Promise.resolve();\n }\n\n if (loadingPromise) {\n return loadingPromise;\n }\n\n loadingPromise = (async () => {\n try {\n // Literal specifier so `vi.mock(\"pdf-parse\")` can intercept it in tests.\n // Typed via the ambient `pdf-parse` shim in this directory, so the bare\n // import resolves even though the OPTIONAL peer is not a dependency.\n const mod = (await import(\"pdf-parse\")) as {\n default?: PdfParseFn;\n } & Partial<PdfParseFn>;\n // pdf-parse ships CommonJS — the callable is `module.exports`, surfaced\n // as `default` under ESM interop. Fall back to the namespace itself for\n // bundlers that hoist the callable to the top level.\n pdfParse = mod.default ?? (mod as unknown as PdfParseFn);\n isModuleExists = typeof pdfParse === \"function\";\n } catch {\n isModuleExists = false;\n }\n })();\n\n return loadingPromise;\n}\n\n/**\n * Coerce a {@link RagDocument}-compatible binary input into a `Buffer` for\n * `pdf-parse`. Accepts a Node `Buffer`, an `ArrayBuffer`, or a typed array\n * (`Uint8Array`) — the shapes a file read / fetch body hands back.\n */\nfunction toBuffer(input: Buffer | ArrayBuffer | Uint8Array): Buffer {\n if (Buffer.isBuffer(input)) {\n return input;\n }\n\n if (input instanceof ArrayBuffer) {\n return Buffer.from(input);\n }\n\n return Buffer.from(input.buffer, input.byteOffset, input.byteLength);\n}\n\n/**\n * Load a PDF's bytes into {@link RagDocument}(s) via the OPTIONAL `pdf-parse`\n * peer. The peer is resolved lazily on the FIRST call (not at import) so\n * importing `@warlock.js/ai` never forces it to be installed; when it is\n * absent the curated {@link PDF_PARSE_INSTALL_INSTRUCTIONS} is thrown as a\n * plain `Error` (a missing optional peer is an infrastructure fault, not a\n * content problem).\n *\n * By default the whole PDF becomes a single document carrying\n * `metadata.pageCount`. With `perPage: true`, each page becomes its own\n * document (`id` suffixed `#p<n>`, `metadata.page` set) so citations stay\n * page-precise. Document `metadata.title` comes from the PDF info\n * dictionary's `Title` (unless overridden), and `metadata.loader` is\n * `\"pdf\"`. The output is the exact shape `index()` consumes.\n *\n * @example\n * import { readFile } from \"node:fs/promises\";\n * const kb = ai.rag({ embedder, store });\n * await kb.index(await loadPdf(await readFile(\"guide.pdf\"), { id: \"guide\" }));\n *\n * @example\n * // One document per page for page-precise citations:\n * await kb.index(await loadPdf(bytes, { id: \"manual\", perPage: true }));\n *\n * @param input - The PDF bytes (`Buffer`, `ArrayBuffer`, or `Uint8Array`).\n * @param options - `perPage` plus shared `id` / `metadata` / `tags`\n * ({@link LoadPdfOptions}).\n * @returns A {@link RagLoaderResult} ready for `rag.index()`.\n * @throws {Error} carrying {@link PDF_PARSE_INSTALL_INSTRUCTIONS} when the\n * `pdf-parse` peer is not installed.\n */\nexport async function loadPdf(\n input: Buffer | ArrayBuffer | Uint8Array,\n options: LoadPdfOptions = {},\n): Promise<RagLoaderResult> {\n await loadPdfParse();\n\n if (!isModuleExists || !pdfParse) {\n throw new Error(PDF_PARSE_INSTALL_INSTRUCTIONS);\n }\n\n const id = options.id ?? DEFAULT_ID;\n const perPage = options.perPage ?? false;\n\n if (perPage) {\n return loadPerPage(input, id, options);\n }\n\n const parsed = await pdfParse(toBuffer(input));\n const text = parsed.text.trim();\n const title = parsed.info?.Title?.trim();\n\n // An image-only / empty PDF extracts no text — emit nothing so index()\n // never receives a no-op record.\n if (text.length === 0) {\n return [];\n }\n\n const doc: RagDocument = {\n id,\n text,\n metadata: {\n source: id,\n loader: \"pdf\",\n pageCount: parsed.numpages,\n ...(title ? { title } : {}),\n ...options.metadata,\n },\n tags: options.tags,\n };\n\n return [doc];\n}\n\n/** One page of a parsed PDF — the text-layer item list `pagerender` sees. */\ntype PdfPage = {\n getTextContent: (\n options?: unknown,\n ) => Promise<{ items: { str: string }[] }>;\n};\n\n/**\n * Per-page variant: render each page separately via `pdf-parse`'s\n * `pagerender` hook, accumulating one document per non-empty page. Each\n * carries `metadata.page` (1-based) and `metadata.pageCount`, and its id is\n * the base id suffixed `#p<n>` so every page-document is distinctly\n * identified for citation.\n *\n * `pdf-parse` calls `pagerender` once per page in document order and\n * `await`s the returned string, so capturing each page's joined text content\n * here gives reliable page boundaries the concatenated `text` lacks.\n */\nasync function loadPerPage(\n input: Buffer | ArrayBuffer | Uint8Array,\n id: string,\n options: LoadPdfOptions,\n): Promise<RagDocument[]> {\n const pages: string[] = [];\n\n const parsed = await pdfParse!(toBuffer(input), {\n pagerender: async (page: unknown): Promise<string> => {\n const rendered = await renderPage(page as PdfPage);\n pages.push(rendered);\n return rendered;\n },\n });\n\n const title = parsed.info?.Title?.trim();\n const docs: RagDocument[] = [];\n\n pages.forEach((pageText, index) => {\n const text = pageText.trim();\n\n if (text.length === 0) {\n return;\n }\n\n const pageNumber = index + 1;\n\n docs.push({\n id: `${id}#p${pageNumber}`,\n text,\n metadata: {\n source: id,\n loader: \"pdf\",\n page: pageNumber,\n pageCount: parsed.numpages,\n ...(title ? { title } : {}),\n ...options.metadata,\n },\n tags: options.tags,\n });\n });\n\n return docs;\n}\n\n/**\n * Join a single page's text-layer items in reading order, inserting a space\n * between items so adjacent words do not run together. Mirrors the essence\n * of `pdf-parse`'s default renderer without depending on its internals, so\n * the per-page hook stays stable across `pdf-parse` versions. A page with no\n * text layer (scanned image) renders to an empty string and is dropped.\n */\nasync function renderPage(page: PdfPage): Promise<string> {\n if (typeof page?.getTextContent !== \"function\") {\n return \"\";\n }\n\n const content = await page.getTextContent({\n normalizeWhitespace: true,\n disableCombineTextItems: false,\n });\n\n return content.items\n .map((item) => item.str)\n .join(\" \")\n .replace(/\\s+/g, \" \")\n .trim();\n}\n"],"mappings":";;;;AAKA,MAAM,aAAa;AAgCnB,IAAI;AACJ,IAAI;AACJ,IAAI;;;;;;;;AASJ,SAAS,eAA8B;CACrC,IAAI,mBAAmB,QACrB,OAAO,QAAQ,QAAQ;CAGzB,IAAI,gBACF,OAAO;CAGT,kBAAkB,YAAY;EAC5B,IAAI;GAIF,MAAM,MAAO,MAAM,OAAO;GAM1B,WAAW,IAAI,WAAY;GAC3B,iBAAiB,OAAO,aAAa;EACvC,QAAQ;GACN,iBAAiB;EACnB;CACF,EAAC,CAAE;CAEH,OAAO;AACT;;;;;;AAOA,SAAS,SAAS,OAAkD;CAClE,IAAI,OAAO,SAAS,KAAK,GACvB,OAAO;CAGT,IAAI,iBAAiB,aACnB,OAAO,OAAO,KAAK,KAAK;CAG1B,OAAO,OAAO,KAAK,MAAM,QAAQ,MAAM,YAAY,MAAM,UAAU;AACrE;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;;AAiCA,eAAsB,QACpB,OACA,UAA0B,CAAC,GACD;CAC1B,MAAM,aAAa;CAEnB,IAAI,CAAC,kBAAkB,CAAC,UACtB,MAAM,IAAI,MAAM,8BAA8B;CAGhD,MAAM,KAAK,QAAQ,MAAM;CAGzB,IAFgB,QAAQ,WAAW,OAGjC,OAAO,YAAY,OAAO,IAAI,OAAO;CAGvC,MAAM,SAAS,MAAM,SAAS,SAAS,KAAK,CAAC;CAC7C,MAAM,OAAO,OAAO,KAAK,KAAK;CAC9B,MAAM,QAAQ,OAAO,MAAM,OAAO,KAAK;CAIvC,IAAI,KAAK,WAAW,GAClB,OAAO,CAAC;CAgBV,OAAO,CAAC;EAZN;EACA;EACA,UAAU;GACR,QAAQ;GACR,QAAQ;GACR,WAAW,OAAO;GAClB,GAAI,QAAQ,EAAE,MAAM,IAAI,CAAC;GACzB,GAAG,QAAQ;EACb;EACA,MAAM,QAAQ;CAGN,CAAC;AACb;;;;;;;;;;;;AAoBA,eAAe,YACb,OACA,IACA,SACwB;CACxB,MAAM,QAAkB,CAAC;CAEzB,MAAM,SAAS,MAAM,SAAU,SAAS,KAAK,GAAG,EAC9C,YAAY,OAAO,SAAmC;EACpD,MAAM,WAAW,MAAM,WAAW,IAAe;EACjD,MAAM,KAAK,QAAQ;EACnB,OAAO;CACT,EACF,CAAC;CAED,MAAM,QAAQ,OAAO,MAAM,OAAO,KAAK;CACvC,MAAM,OAAsB,CAAC;CAE7B,MAAM,SAAS,UAAU,UAAU;EACjC,MAAM,OAAO,SAAS,KAAK;EAE3B,IAAI,KAAK,WAAW,GAClB;EAGF,MAAM,aAAa,QAAQ;EAE3B,KAAK,KAAK;GACR,IAAI,GAAG,GAAG,IAAI;GACd;GACA,UAAU;IACR,QAAQ;IACR,QAAQ;IACR,MAAM;IACN,WAAW,OAAO;IAClB,GAAI,QAAQ,EAAE,MAAM,IAAI,CAAC;IACzB,GAAG,QAAQ;GACb;GACA,MAAM,QAAQ;EAChB,CAAC;CACH,CAAC;CAED,OAAO;AACT;;;;;;;;AASA,eAAe,WAAW,MAAgC;CACxD,IAAI,OAAO,MAAM,mBAAmB,YAClC,OAAO;CAQT,QAAO,MALe,KAAK,eAAe;EACxC,qBAAqB;EACrB,yBAAyB;CAC3B,CAAC,EAEa,CAAC,MACZ,KAAK,SAAS,KAAK,GAAG,CAAC,CACvB,KAAK,GAAG,CAAC,CACT,QAAQ,QAAQ,GAAG,CAAC,CACpB,KAAK;AACV"}