llama-cpp-pro 0.2.2

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (310) hide show
  1. package/CHANGELOG.md +295 -0
  2. package/LICENSE +21 -0
  3. package/LlamaCpp.podspec +33 -0
  4. package/LlamaCppCapacitor.podspec +33 -0
  5. package/Package.swift +29 -0
  6. package/README.md +93 -0
  7. package/android/build.gradle +88 -0
  8. package/android/src/main/AndroidManifest.xml +4 -0
  9. package/android/src/main/CMakeLists-arm64.txt +138 -0
  10. package/android/src/main/CMakeLists-x86_64.txt +141 -0
  11. package/android/src/main/CMakeLists.txt +138 -0
  12. package/android/src/main/java/ai/annadata/plugin/capacitor/LlamaCpp.java +1340 -0
  13. package/android/src/main/java/ai/annadata/plugin/capacitor/LlamaCppPlugin.java +814 -0
  14. package/android/src/main/java/ai/annadata/plugin/capacitor/ModelAdmissionController.java +214 -0
  15. package/android/src/main/jni-chat-session.cpp +261 -0
  16. package/android/src/main/jni-lora.cpp +197 -0
  17. package/android/src/main/jni-multimodal.cpp +167 -0
  18. package/android/src/main/jni-tts.cpp +290 -0
  19. package/android/src/main/jni-utils.h +148 -0
  20. package/android/src/main/jni.cpp +1808 -0
  21. package/android/src/main/jniLibs/arm64-v8a/libllama-cpp-arm64.so +0 -0
  22. package/android/src/main/res/.gitkeep +0 -0
  23. package/build-native.sh +280 -0
  24. package/cmake/desktop-metal-embed.cmake +30 -0
  25. package/cmake/desktop-sources.cmake +100 -0
  26. package/cmake/ggml-backends.cmake +44 -0
  27. package/cpp/LICENSE +21 -0
  28. package/cpp/README.md +15 -0
  29. package/cpp/anyascii.c +22223 -0
  30. package/cpp/anyascii.h +42 -0
  31. package/cpp/cap-completion.cpp +942 -0
  32. package/cpp/cap-completion.h +127 -0
  33. package/cpp/cap-embedding.cpp +193 -0
  34. package/cpp/cap-embedding.h +35 -0
  35. package/cpp/cap-ios-bridge.cpp +1810 -0
  36. package/cpp/cap-ios-bridge.h +61 -0
  37. package/cpp/cap-llama.cpp +412 -0
  38. package/cpp/cap-llama.h +161 -0
  39. package/cpp/cap-mtmd.hpp +602 -0
  40. package/cpp/cap-native-server.cpp +1095 -0
  41. package/cpp/cap-native-server.h +40 -0
  42. package/cpp/cap-tts.cpp +591 -0
  43. package/cpp/cap-tts.h +59 -0
  44. package/cpp/cap-wasm-fs.cpp +156 -0
  45. package/cpp/cap-wasm-jspi.cpp +19 -0
  46. package/cpp/cap-wasm-jspi.h +30 -0
  47. package/cpp/cap-wasm-vfs.cpp +22 -0
  48. package/cpp/chat-parser.cpp +393 -0
  49. package/cpp/chat-parser.h +120 -0
  50. package/cpp/chat.cpp +2315 -0
  51. package/cpp/chat.h +221 -0
  52. package/cpp/common.cpp +1664 -0
  53. package/cpp/common.h +744 -0
  54. package/cpp/ggml-alloc.c +1028 -0
  55. package/cpp/ggml-alloc.h +76 -0
  56. package/cpp/ggml-backend-impl.h +255 -0
  57. package/cpp/ggml-backend-reg.cpp +600 -0
  58. package/cpp/ggml-backend.cpp +2121 -0
  59. package/cpp/ggml-backend.h +354 -0
  60. package/cpp/ggml-common.h +1878 -0
  61. package/cpp/ggml-cpp.h +39 -0
  62. package/cpp/ggml-cpu/amx/amx.cpp +221 -0
  63. package/cpp/ggml-cpu/amx/amx.h +8 -0
  64. package/cpp/ggml-cpu/amx/common.h +91 -0
  65. package/cpp/ggml-cpu/amx/mmq.cpp +2512 -0
  66. package/cpp/ggml-cpu/amx/mmq.h +10 -0
  67. package/cpp/ggml-cpu/arch/arm/cpu-feats.cpp +94 -0
  68. package/cpp/ggml-cpu/arch/arm/quants.c +3650 -0
  69. package/cpp/ggml-cpu/arch/arm/repack.cpp +1891 -0
  70. package/cpp/ggml-cpu/arch/x86/cpu-feats.cpp +327 -0
  71. package/cpp/ggml-cpu/arch/x86/quants.c +3820 -0
  72. package/cpp/ggml-cpu/arch/x86/repack.cpp +6307 -0
  73. package/cpp/ggml-cpu/arch-fallback.h +215 -0
  74. package/cpp/ggml-cpu/binary-ops.cpp +158 -0
  75. package/cpp/ggml-cpu/binary-ops.h +16 -0
  76. package/cpp/ggml-cpu/common.h +73 -0
  77. package/cpp/ggml-cpu/ggml-cpu-impl.h +559 -0
  78. package/cpp/ggml-cpu/ggml-cpu.c +3578 -0
  79. package/cpp/ggml-cpu/ggml-cpu.cpp +672 -0
  80. package/cpp/ggml-cpu/ops.cpp +10587 -0
  81. package/cpp/ggml-cpu/ops.h +114 -0
  82. package/cpp/ggml-cpu/quants.c +1193 -0
  83. package/cpp/ggml-cpu/quants.h +97 -0
  84. package/cpp/ggml-cpu/repack.cpp +1982 -0
  85. package/cpp/ggml-cpu/repack.h +120 -0
  86. package/cpp/ggml-cpu/simd-mappings.h +1184 -0
  87. package/cpp/ggml-cpu/traits.cpp +36 -0
  88. package/cpp/ggml-cpu/traits.h +38 -0
  89. package/cpp/ggml-cpu/unary-ops.cpp +186 -0
  90. package/cpp/ggml-cpu/unary-ops.h +28 -0
  91. package/cpp/ggml-cpu/vec.cpp +348 -0
  92. package/cpp/ggml-cpu/vec.h +1121 -0
  93. package/cpp/ggml-cpu.h +145 -0
  94. package/cpp/ggml-impl.h +622 -0
  95. package/cpp/ggml-metal-impl.h +688 -0
  96. package/cpp/ggml-metal.h +66 -0
  97. package/cpp/ggml-metal.m +6833 -0
  98. package/cpp/ggml-metal.metal +10754 -0
  99. package/cpp/ggml-opt.cpp +1093 -0
  100. package/cpp/ggml-opt.h +256 -0
  101. package/cpp/ggml-quants.c +5324 -0
  102. package/cpp/ggml-quants.h +106 -0
  103. package/cpp/ggml-threading.cpp +12 -0
  104. package/cpp/ggml-threading.h +14 -0
  105. package/cpp/ggml.c +7108 -0
  106. package/cpp/ggml.h +2492 -0
  107. package/cpp/gguf.cpp +1358 -0
  108. package/cpp/gguf.h +202 -0
  109. package/cpp/json-partial.cpp +256 -0
  110. package/cpp/json-partial.h +38 -0
  111. package/cpp/json-schema-to-grammar.cpp +985 -0
  112. package/cpp/json-schema-to-grammar.h +21 -0
  113. package/cpp/llama-adapter.cpp +388 -0
  114. package/cpp/llama-adapter.h +76 -0
  115. package/cpp/llama-arch.cpp +2355 -0
  116. package/cpp/llama-arch.h +499 -0
  117. package/cpp/llama-batch.cpp +875 -0
  118. package/cpp/llama-batch.h +160 -0
  119. package/cpp/llama-chat.cpp +783 -0
  120. package/cpp/llama-chat.h +65 -0
  121. package/cpp/llama-context.cpp +2788 -0
  122. package/cpp/llama-context.h +306 -0
  123. package/cpp/llama-cparams.cpp +5 -0
  124. package/cpp/llama-cparams.h +41 -0
  125. package/cpp/llama-cpp.h +30 -0
  126. package/cpp/llama-grammar.cpp +1229 -0
  127. package/cpp/llama-grammar.h +173 -0
  128. package/cpp/llama-graph.cpp +1891 -0
  129. package/cpp/llama-graph.h +810 -0
  130. package/cpp/llama-hparams.cpp +180 -0
  131. package/cpp/llama-hparams.h +233 -0
  132. package/cpp/llama-impl.cpp +167 -0
  133. package/cpp/llama-impl.h +61 -0
  134. package/cpp/llama-io.cpp +15 -0
  135. package/cpp/llama-io.h +35 -0
  136. package/cpp/llama-kv-cache-iswa.cpp +318 -0
  137. package/cpp/llama-kv-cache-iswa.h +135 -0
  138. package/cpp/llama-kv-cache.cpp +2059 -0
  139. package/cpp/llama-kv-cache.h +374 -0
  140. package/cpp/llama-kv-cells.h +491 -0
  141. package/cpp/llama-memory-hybrid.cpp +258 -0
  142. package/cpp/llama-memory-hybrid.h +137 -0
  143. package/cpp/llama-memory-recurrent.cpp +1146 -0
  144. package/cpp/llama-memory-recurrent.h +179 -0
  145. package/cpp/llama-memory.cpp +59 -0
  146. package/cpp/llama-memory.h +119 -0
  147. package/cpp/llama-mmap.cpp +609 -0
  148. package/cpp/llama-mmap.h +68 -0
  149. package/cpp/llama-model-loader.cpp +1166 -0
  150. package/cpp/llama-model-loader.h +170 -0
  151. package/cpp/llama-model-saver.cpp +282 -0
  152. package/cpp/llama-model-saver.h +37 -0
  153. package/cpp/llama-model.cpp +19061 -0
  154. package/cpp/llama-model.h +491 -0
  155. package/cpp/llama-sampling.cpp +2575 -0
  156. package/cpp/llama-sampling.h +32 -0
  157. package/cpp/llama-vocab.cpp +3792 -0
  158. package/cpp/llama-vocab.h +176 -0
  159. package/cpp/llama.cpp +358 -0
  160. package/cpp/llama.h +1373 -0
  161. package/cpp/log.cpp +428 -0
  162. package/cpp/log.h +103 -0
  163. package/cpp/minja/chat-template.hpp +550 -0
  164. package/cpp/minja/minja.hpp +3009 -0
  165. package/cpp/nlohmann/json.hpp +25526 -0
  166. package/cpp/nlohmann/json_fwd.hpp +187 -0
  167. package/cpp/regex-partial.cpp +204 -0
  168. package/cpp/regex-partial.h +56 -0
  169. package/cpp/sampling.cpp +579 -0
  170. package/cpp/sampling.h +107 -0
  171. package/cpp/tools/mtmd/clip-impl.h +473 -0
  172. package/cpp/tools/mtmd/clip.cpp +4322 -0
  173. package/cpp/tools/mtmd/clip.h +106 -0
  174. package/cpp/tools/mtmd/miniaudio/miniaudio.h +93468 -0
  175. package/cpp/tools/mtmd/mtmd-audio.cpp +769 -0
  176. package/cpp/tools/mtmd/mtmd-audio.h +47 -0
  177. package/cpp/tools/mtmd/mtmd-helper.cpp +460 -0
  178. package/cpp/tools/mtmd/mtmd-helper.h +95 -0
  179. package/cpp/tools/mtmd/mtmd.cpp +1066 -0
  180. package/cpp/tools/mtmd/mtmd.h +302 -0
  181. package/cpp/tools/mtmd/stb/stb_image.h +7988 -0
  182. package/cpp/unicode-data.cpp +7034 -0
  183. package/cpp/unicode-data.h +20 -0
  184. package/cpp/unicode.cpp +1061 -0
  185. package/cpp/unicode.h +68 -0
  186. package/cpp/vendor/cpp-httplib/httplib.cpp +16509 -0
  187. package/cpp/vendor/cpp-httplib/httplib.h +3883 -0
  188. package/desktop/electron-builder.config.cjs +157 -0
  189. package/desktop/entitlements.mac.plist +12 -0
  190. package/desktop/package.json +11 -0
  191. package/desktop/resolve-package-root.cjs +88 -0
  192. package/desktop/src/main/backend-selector.cjs +148 -0
  193. package/desktop/src/main/gpu-probe.cjs +142 -0
  194. package/desktop/src/main/index.cjs +58 -0
  195. package/desktop/src/main/ipc-handlers.cjs +212 -0
  196. package/desktop/src/main/model-store.cjs +50 -0
  197. package/desktop/src/main/preload.cjs +39 -0
  198. package/desktop/src/main/sidecar-client.cjs +76 -0
  199. package/desktop/src/main/sidecar-manager.cjs +364 -0
  200. package/dist/docs.json +14357 -0
  201. package/dist/esm/definitions.d.ts +731 -0
  202. package/dist/esm/definitions.js +2 -0
  203. package/dist/esm/definitions.js.map +1 -0
  204. package/dist/esm/desktop.d.ts +37 -0
  205. package/dist/esm/desktop.js +133 -0
  206. package/dist/esm/desktop.js.map +1 -0
  207. package/dist/esm/index.d.ts +200 -0
  208. package/dist/esm/index.js +612 -0
  209. package/dist/esm/index.js.map +1 -0
  210. package/dist/esm/isomorphic/desktop.runtime.d.ts +37 -0
  211. package/dist/esm/isomorphic/desktop.runtime.js +36 -0
  212. package/dist/esm/isomorphic/desktop.runtime.js.map +1 -0
  213. package/dist/esm/isomorphic/errors.d.ts +6 -0
  214. package/dist/esm/isomorphic/errors.js +9 -0
  215. package/dist/esm/isomorphic/errors.js.map +1 -0
  216. package/dist/esm/isomorphic/model.admission.d.ts +17 -0
  217. package/dist/esm/isomorphic/model.admission.js +27 -0
  218. package/dist/esm/isomorphic/model.admission.js.map +1 -0
  219. package/dist/esm/isomorphic/model.scheduler.d.ts +31 -0
  220. package/dist/esm/isomorphic/model.scheduler.js +95 -0
  221. package/dist/esm/isomorphic/model.scheduler.js.map +1 -0
  222. package/dist/esm/isomorphic/provider.desktop.d.ts +40 -0
  223. package/dist/esm/isomorphic/provider.desktop.js +411 -0
  224. package/dist/esm/isomorphic/provider.desktop.js.map +1 -0
  225. package/dist/esm/isomorphic/provider.factory.d.ts +2 -0
  226. package/dist/esm/isomorphic/provider.factory.js +16 -0
  227. package/dist/esm/isomorphic/provider.factory.js.map +1 -0
  228. package/dist/esm/isomorphic/provider.interface.d.ts +76 -0
  229. package/dist/esm/isomorphic/provider.interface.js +2 -0
  230. package/dist/esm/isomorphic/provider.interface.js.map +1 -0
  231. package/dist/esm/isomorphic/provider.native.d.ts +18 -0
  232. package/dist/esm/isomorphic/provider.native.js +173 -0
  233. package/dist/esm/isomorphic/provider.native.js.map +1 -0
  234. package/dist/esm/isomorphic/provider.web.d.ts +88 -0
  235. package/dist/esm/isomorphic/provider.web.js +573 -0
  236. package/dist/esm/isomorphic/provider.web.js.map +1 -0
  237. package/dist/esm/isomorphic/sidecar-sse.d.ts +14 -0
  238. package/dist/esm/isomorphic/sidecar-sse.js +76 -0
  239. package/dist/esm/isomorphic/sidecar-sse.js.map +1 -0
  240. package/dist/esm/isomorphic/wasmMemoryCalibration.d.ts +26 -0
  241. package/dist/esm/isomorphic/wasmMemoryCalibration.js +60 -0
  242. package/dist/esm/isomorphic/wasmMemoryCalibration.js.map +1 -0
  243. package/dist/esm/isomorphic/wasmMemoryPolicy.d.ts +55 -0
  244. package/dist/esm/isomorphic/wasmMemoryPolicy.js +93 -0
  245. package/dist/esm/isomorphic/wasmMemoryPolicy.js.map +1 -0
  246. package/dist/esm/storage/manifest.d.ts +13 -0
  247. package/dist/esm/storage/manifest.js +87 -0
  248. package/dist/esm/storage/manifest.js.map +1 -0
  249. package/dist/esm/storage/opfs.store.d.ts +31 -0
  250. package/dist/esm/storage/opfs.store.js +241 -0
  251. package/dist/esm/storage/opfs.store.js.map +1 -0
  252. package/dist/esm/web.d.ts +206 -0
  253. package/dist/esm/web.js +521 -0
  254. package/dist/esm/web.js.map +1 -0
  255. package/dist/esm/workers/async-file.d.ts +13 -0
  256. package/dist/esm/workers/async-file.js +12 -0
  257. package/dist/esm/workers/async-file.js.map +1 -0
  258. package/dist/esm/workers/heapfs.d.ts +55 -0
  259. package/dist/esm/workers/heapfs.js +115 -0
  260. package/dist/esm/workers/heapfs.js.map +1 -0
  261. package/dist/esm/workers/wasm.engine.d.ts +86 -0
  262. package/dist/esm/workers/wasm.engine.js +504 -0
  263. package/dist/esm/workers/wasm.engine.js.map +1 -0
  264. package/dist/esm/workers/worker.protocol.d.ts +160 -0
  265. package/dist/esm/workers/worker.protocol.js +2 -0
  266. package/dist/esm/workers/worker.protocol.js.map +1 -0
  267. package/dist/plugin.cjs +3179 -0
  268. package/dist/plugin.cjs.map +1 -0
  269. package/dist/plugin.js +3181 -0
  270. package/dist/plugin.js.map +1 -0
  271. package/dist/wasm/llama_engine.d.ts +74 -0
  272. package/dist/wasm/llama_engine.js +1829 -0
  273. package/dist/wasm/llama_engine.wasm +0 -0
  274. package/dist/wasm/llama_engine_emscripten.mjs +2 -0
  275. package/dist/wasm/package.json +16 -0
  276. package/dist/workers/llm.worker.js +1226 -0
  277. package/dist/workers/llm.worker.js.map +7 -0
  278. package/extraResources/llama-wasm/llama_engine.d.ts +74 -0
  279. package/extraResources/llama-wasm/llama_engine.js +1829 -0
  280. package/extraResources/llama-wasm/llama_engine.wasm +0 -0
  281. package/extraResources/llama-wasm/llama_engine_emscripten.mjs +2 -0
  282. package/extraResources/llama-wasm/package.json +16 -0
  283. package/extraResources/sidecar/README.md +11 -0
  284. package/extraResources/sidecar/darwin-arm64 +0 -0
  285. package/extraResources/sidecar/darwin-x64 +0 -0
  286. package/ios/CMakeLists-arm64.txt +161 -0
  287. package/ios/CMakeLists-x86_64.txt +188 -0
  288. package/ios/CMakeLists.txt +161 -0
  289. package/ios/Frameworks/llama-cpp.framework/Info.plist +28 -0
  290. package/ios/Frameworks/llama-cpp.framework/llama-cpp +0 -0
  291. package/ios/Sources/LlamaCppCapacitor/LlamaCpp.swift +1365 -0
  292. package/ios/Sources/LlamaCppCapacitor/LlamaCppPlugin.swift +694 -0
  293. package/ios/Sources/LlamaCppCapacitor/LlamaNativeBridge.swift +349 -0
  294. package/ios/Sources/LlamaCppCapacitor/ModelAdmissionController.swift +177 -0
  295. package/ios/embed-metal-shaders.sh +24 -0
  296. package/ios/metal-embed.cmake +29 -0
  297. package/package.json +281 -0
  298. package/scripts/build-js-preserve-wasm.cjs +53 -0
  299. package/scripts/build-sidecar-linux.sh +6 -0
  300. package/scripts/build-sidecar-win.bat +19 -0
  301. package/scripts/build-sidecar.sh +184 -0
  302. package/scripts/embed-llama-ios-app-framework.sh +63 -0
  303. package/scripts/ensure-desktop-sidecar-bundle.cjs +103 -0
  304. package/scripts/ensure-llama-ios-xcframework.sh +108 -0
  305. package/scripts/fix-esm-extensions.cjs +45 -0
  306. package/scripts/prepare-js-dist.cjs +28 -0
  307. package/scripts/stage-desktop-resources.cjs +116 -0
  308. package/sidecar/CMakeLists.txt +192 -0
  309. package/sidecar/cap-sidecar-main.cpp +68 -0
  310. package/types/llama-cpp-pro.d.ts +441 -0
@@ -0,0 +1,173 @@
1
+ import { Capacitor, registerPlugin } from '@capacitor/core';
2
+ import { LlmError } from './errors';
3
+ import { DefaultModelScheduler } from './model.scheduler';
4
+ const EVENT_ON_TOKEN = '@LlamaCpp_onToken';
5
+ const MAX_MODELS = 5;
6
+ /** Prefer the plugin instance registered by src/index.ts. */
7
+ const getPlugin = () => {
8
+ var _a, _b, _c, _d;
9
+ const caps = Capacitor;
10
+ return ((_d = (_b = (_a = caps.Plugins) === null || _a === void 0 ? void 0 : _a.LlamaCpp) !== null && _b !== void 0 ? _b : (_c = caps.getPlugin) === null || _c === void 0 ? void 0 : _c.call(caps, 'LlamaCpp')) !== null && _d !== void 0 ? _d : registerPlugin('LlamaCpp'));
11
+ };
12
+ export class NativeProvider {
13
+ constructor() {
14
+ this.platform = 'native';
15
+ this.contextByModel = new Map();
16
+ this.nextContextId = 1;
17
+ this.scheduler = new DefaultModelScheduler(MAX_MODELS);
18
+ }
19
+ async initialize(opts) {
20
+ await getPlugin().setContextLimit({ limit: MAX_MODELS });
21
+ await this.loadModel(opts);
22
+ }
23
+ async loadModel(opts) {
24
+ if (!opts.modelId) {
25
+ throw new LlmError('INVALID_REQUEST', 'modelId is required');
26
+ }
27
+ if (!opts.modelPath) {
28
+ throw new LlmError('INVALID_REQUEST', 'modelPath is required on native provider');
29
+ }
30
+ if (this.contextByModel.has(opts.modelId)) {
31
+ return;
32
+ }
33
+ const modelBytes = typeof opts.modelBytes === 'number' ? opts.modelBytes : 0;
34
+ const reserveBytes = typeof opts.reserveBytes === 'number' ? opts.reserveBytes : undefined;
35
+ const memory = await this.getMemorySnapshot();
36
+ if (typeof opts.availableMemoryBytes === 'number') {
37
+ memory.freeBytes = opts.availableMemoryBytes;
38
+ }
39
+ if (typeof opts.totalMemoryBytes === 'number') {
40
+ memory.totalBytes = opts.totalMemoryBytes;
41
+ }
42
+ this.scheduler.ensureCapacity(opts.modelId, modelBytes, memory, reserveBytes);
43
+ const contextId = this.nextContextId++;
44
+ await getPlugin().initContext({
45
+ contextId,
46
+ params: {
47
+ model: opts.modelPath,
48
+ n_ctx: opts.n_ctx,
49
+ n_threads: opts.n_threads,
50
+ embedding: opts.embedding,
51
+ },
52
+ });
53
+ this.contextByModel.set(opts.modelId, contextId);
54
+ this.scheduler.markLoaded(opts.modelId);
55
+ }
56
+ async unloadModel(modelId) {
57
+ const contextId = this.contextByModel.get(modelId);
58
+ if (contextId === undefined) {
59
+ return;
60
+ }
61
+ await getPlugin().releaseContext({ contextId });
62
+ this.contextByModel.delete(modelId);
63
+ this.scheduler.markUnloaded(modelId);
64
+ }
65
+ async generate(req) {
66
+ var _a, _b;
67
+ const contextId = this.contextByModel.get(req.modelId);
68
+ if (contextId === undefined) {
69
+ throw new LlmError('MODEL_NOT_LOADED', `Model '${req.modelId}' is not loaded`);
70
+ }
71
+ const prompt = (_a = req.prompt) !== null && _a !== void 0 ? _a : (_b = req.messages) === null || _b === void 0 ? void 0 : _b.map((m) => `${m.role}: ${m.content}`).join('\n');
72
+ if (!prompt) {
73
+ throw new LlmError('INVALID_REQUEST', 'prompt or messages is required');
74
+ }
75
+ const completion = await getPlugin().completion({
76
+ contextId,
77
+ params: {
78
+ prompt,
79
+ n_predict: req.max_tokens,
80
+ temperature: req.temperature,
81
+ emit_partial_completion: false,
82
+ },
83
+ });
84
+ return {
85
+ text: completion.content || completion.text || '',
86
+ tokens_predicted: completion.tokens_predicted || 0,
87
+ tokens_evaluated: completion.tokens_evaluated || 0,
88
+ finish_reason: completion.stopped_limit ? 'length' : 'stop',
89
+ };
90
+ }
91
+ async generateStream(req, onToken) {
92
+ var _a, _b, _c;
93
+ const contextId = this.contextByModel.get(req.modelId);
94
+ if (contextId === undefined) {
95
+ throw new LlmError('MODEL_NOT_LOADED', `Model '${req.modelId}' is not loaded`);
96
+ }
97
+ const prompt = (_a = req.prompt) !== null && _a !== void 0 ? _a : (_b = req.messages) === null || _b === void 0 ? void 0 : _b.map((m) => `${m.role}: ${m.content}`).join('\n');
98
+ if (!prompt) {
99
+ throw new LlmError('INVALID_REQUEST', 'prompt or messages is required');
100
+ }
101
+ let tokenIndex = 0;
102
+ const listener = await getPlugin().addListener(EVENT_ON_TOKEN, (evt) => {
103
+ var _a, _b;
104
+ if (evt.contextId !== contextId)
105
+ return;
106
+ const token = (_b = (_a = evt.tokenResult) === null || _a === void 0 ? void 0 : _a.token) !== null && _b !== void 0 ? _b : '';
107
+ if (!token)
108
+ return;
109
+ onToken({ modelId: req.modelId, token, index: tokenIndex++ });
110
+ });
111
+ try {
112
+ const completion = await getPlugin().completion({
113
+ contextId,
114
+ params: {
115
+ prompt,
116
+ n_predict: req.max_tokens,
117
+ temperature: req.temperature,
118
+ emit_partial_completion: true,
119
+ },
120
+ });
121
+ return {
122
+ text: completion.content || completion.text || '',
123
+ tokens_predicted: completion.tokens_predicted || 0,
124
+ tokens_evaluated: completion.tokens_evaluated || 0,
125
+ finish_reason: completion.stopped_limit ? 'length' : 'stop',
126
+ };
127
+ }
128
+ finally {
129
+ (_c = listener === null || listener === void 0 ? void 0 : listener.remove) === null || _c === void 0 ? void 0 : _c.call(listener);
130
+ }
131
+ }
132
+ async embed(req) {
133
+ const contextId = this.contextByModel.get(req.modelId);
134
+ if (contextId === undefined) {
135
+ throw new LlmError('MODEL_NOT_LOADED', `Model '${req.modelId}' is not loaded`);
136
+ }
137
+ const inputs = Array.isArray(req.input) ? req.input : [req.input];
138
+ const vectors = [];
139
+ for (const text of inputs) {
140
+ const res = await getPlugin().embedding({
141
+ contextId,
142
+ text,
143
+ params: {},
144
+ });
145
+ vectors.push(res.embedding || []);
146
+ }
147
+ return { vectors };
148
+ }
149
+ async getMemorySnapshot() {
150
+ var _a;
151
+ const memoryFromPerformance = (_a = globalThis === null || globalThis === void 0 ? void 0 : globalThis.performance) === null || _a === void 0 ? void 0 : _a.memory;
152
+ if (memoryFromPerformance) {
153
+ const totalBytes = Number(memoryFromPerformance.jsHeapSizeLimit);
154
+ const usedBytes = Number(memoryFromPerformance.usedJSHeapSize);
155
+ const freeBytes = Number(memoryFromPerformance.jsHeapSizeLimit - memoryFromPerformance.usedJSHeapSize);
156
+ const usedRatio = totalBytes > 0 ? usedBytes / totalBytes : 0;
157
+ const pressure = usedRatio >= 0.85 ? 'high' : usedRatio >= 0.7 ? 'medium' : 'low';
158
+ return { totalBytes, usedBytes, freeBytes, pressure };
159
+ }
160
+ return { pressure: 'unknown' };
161
+ }
162
+ async health() {
163
+ return {
164
+ ok: true,
165
+ details: {
166
+ loadedModels: this.contextByModel.size,
167
+ maxModels: MAX_MODELS,
168
+ schedulerLoadedModels: this.scheduler.listLoaded().length,
169
+ },
170
+ };
171
+ }
172
+ }
173
+ //# sourceMappingURL=provider.native.js.map
@@ -0,0 +1 @@
1
+ {"version":3,"file":"provider.native.js","sourceRoot":"","sources":["../../../src/isomorphic/provider.native.ts"],"names":[],"mappings":"AAAA,OAAO,EAAE,SAAS,EAAE,cAAc,EAAE,MAAM,iBAAiB,CAAC;AAY5D,OAAO,EAAE,QAAQ,EAAE,MAAM,UAAU,CAAC;AACpC,OAAO,EAAE,qBAAqB,EAAE,MAAM,mBAAmB,CAAC;AAE1D,MAAM,cAAc,GAAG,mBAAmB,CAAC;AAC3C,MAAM,UAAU,GAAG,CAAC,CAAC;AASrB,6DAA6D;AAC7D,MAAM,SAAS,GAAG,GAAmB,EAAE;;IACrC,MAAM,IAAI,GAAG,SAGZ,CAAC;IACF,OAAO,CACL,MAAA,MAAA,MAAA,IAAI,CAAC,OAAO,0CAAE,QAAQ,mCACtB,MAAA,IAAI,CAAC,SAAS,qDAAG,UAAU,CAAC,mCAC5B,cAAc,CAAiB,UAAU,CAAC,CAC3C,CAAC;AACJ,CAAC,CAAC;AAEF,MAAM,OAAO,cAAc;IAA3B;QACW,aAAQ,GAAG,QAAiB,CAAC;QAC9B,mBAAc,GAAG,IAAI,GAAG,EAAkB,CAAC;QAC3C,kBAAa,GAAG,CAAC,CAAC;QAClB,cAAS,GAAG,IAAI,qBAAqB,CAAC,UAAU,CAAC,CAAC;IAmK5D,CAAC;IAjKC,KAAK,CAAC,UAAU,CAAC,IAAuB;QACtC,MAAM,SAAS,EAAE,CAAC,eAAe,CAAC,EAAE,KAAK,EAAE,UAAU,EAAE,CAAC,CAAC;QACzD,MAAM,IAAI,CAAC,SAAS,CAAC,IAAI,CAAC,CAAC;IAC7B,CAAC;IAED,KAAK,CAAC,SAAS,CAAC,IAAuB;QACrC,IAAI,CAAC,IAAI,CAAC,OAAO,EAAE,CAAC;YAClB,MAAM,IAAI,QAAQ,CAAC,iBAAiB,EAAE,qBAAqB,CAAC,CAAC;QAC/D,CAAC;QACD,IAAI,CAAC,IAAI,CAAC,SAAS,EAAE,CAAC;YACpB,MAAM,IAAI,QAAQ,CAAC,iBAAiB,EAAE,0CAA0C,CAAC,CAAC;QACpF,CAAC;QACD,IAAI,IAAI,CAAC,cAAc,CAAC,GAAG,CAAC,IAAI,CAAC,OAAO,CAAC,EAAE,CAAC;YAC1C,OAAO;QACT,CAAC;QAED,MAAM,UAAU,GAAG,OAAO,IAAI,CAAC,UAAU,KAAK,QAAQ,CAAC,CAAC,CAAC,IAAI,CAAC,UAAU,CAAC,CAAC,CAAC,CAAC,CAAC;QAC7E,MAAM,YAAY,GAAG,OAAO,IAAI,CAAC,YAAY,KAAK,QAAQ,CAAC,CAAC,CAAC,IAAI,CAAC,YAAY,CAAC,CAAC,CAAC,SAAS,CAAC;QAC3F,MAAM,MAAM,GAAG,MAAM,IAAI,CAAC,iBAAiB,EAAE,CAAC;QAC9C,IAAI,OAAO,IAAI,CAAC,oBAAoB,KAAK,QAAQ,EAAE,CAAC;YAClD,MAAM,CAAC,SAAS,GAAG,IAAI,CAAC,oBAAoB,CAAC;QAC/C,CAAC;QACD,IAAI,OAAO,IAAI,CAAC,gBAAgB,KAAK,QAAQ,EAAE,CAAC;YAC9C,MAAM,CAAC,UAAU,GAAG,IAAI,CAAC,gBAAgB,CAAC;QAC5C,CAAC;QACD,IAAI,CAAC,SAAS,CAAC,cAAc,CAAC,IAAI,CAAC,OAAO,EAAE,UAAU,EAAE,MAAM,EAAE,YAAY,CAAC,CAAC;QAE9E,MAAM,SAAS,GAAG,IAAI,CAAC,aAAa,EAAE,CAAC;QACvC,MAAM,SAAS,EAAE,CAAC,WAAW,CAAC;YAC5B,SAAS;YACT,MAAM,EAAE;gBACN,KAAK,EAAE,IAAI,CAAC,SAAS;gBACrB,KAAK,EAAE,IAAI,CAAC,KAAK;gBACjB,SAAS,EAAE,IAAI,CAAC,SAAS;gBACzB,SAAS,EAAE,IAAI,CAAC,SAAS;aAC1B;SACF,CAAC,CAAC;QACH,IAAI,CAAC,cAAc,CAAC,GAAG,CAAC,IAAI,CAAC,OAAO,EAAE,SAAS,CAAC,CAAC;QACjD,IAAI,CAAC,SAAS,CAAC,UAAU,CAAC,IAAI,CAAC,OAAO,CAAC,CAAC;IAC1C,CAAC;IAED,KAAK,CAAC,WAAW,CAAC,OAAe;QAC/B,MAAM,SAAS,GAAG,IAAI,CAAC,cAAc,CAAC,GAAG,CAAC,OAAO,CAAC,CAAC;QACnD,IAAI,SAAS,KAAK,SAAS,EAAE,CAAC;YAC5B,OAAO;QACT,CAAC;QACD,MAAM,SAAS,EAAE,CAAC,cAAc,CAAC,EAAE,SAAS,EAAE,CAAC,CAAC;QAChD,IAAI,CAAC,cAAc,CAAC,MAAM,CAAC,OAAO,CAAC,CAAC;QACpC,IAAI,CAAC,SAAS,CAAC,YAAY,CAAC,OAAO,CAAC,CAAC;IACvC,CAAC;IAED,KAAK,CAAC,QAAQ,CAAC,GAAoB;;QACjC,MAAM,SAAS,GAAG,IAAI,CAAC,cAAc,CAAC,GAAG,CAAC,GAAG,CAAC,OAAO,CAAC,CAAC;QACvD,IAAI,SAAS,KAAK,SAAS,EAAE,CAAC;YAC5B,MAAM,IAAI,QAAQ,CAAC,kBAAkB,EAAE,UAAU,GAAG,CAAC,OAAO,iBAAiB,CAAC,CAAC;QACjF,CAAC;QACD,MAAM,MAAM,GAAG,MAAA,GAAG,CAAC,MAAM,mCAAI,MAAA,GAAG,CAAC,QAAQ,0CAAE,GAAG,CAAC,CAAC,CAAC,EAAE,EAAE,CAAC,GAAG,CAAC,CAAC,IAAI,KAAK,CAAC,CAAC,OAAO,EAAE,EAAE,IAAI,CAAC,IAAI,CAAC,CAAC;QAC5F,IAAI,CAAC,MAAM,EAAE,CAAC;YACZ,MAAM,IAAI,QAAQ,CAAC,iBAAiB,EAAE,gCAAgC,CAAC,CAAC;QAC1E,CAAC;QAED,MAAM,UAAU,GAAG,MAAM,SAAS,EAAE,CAAC,UAAU,CAAC;YAC9C,SAAS;YACT,MAAM,EAAE;gBACN,MAAM;gBACN,SAAS,EAAE,GAAG,CAAC,UAAU;gBACzB,WAAW,EAAE,GAAG,CAAC,WAAW;gBAC5B,uBAAuB,EAAE,KAAK;aAC/B;SACF,CAAC,CAAC;QAEH,OAAO;YACL,IAAI,EAAE,UAAU,CAAC,OAAO,IAAI,UAAU,CAAC,IAAI,IAAI,EAAE;YACjD,gBAAgB,EAAE,UAAU,CAAC,gBAAgB,IAAI,CAAC;YAClD,gBAAgB,EAAE,UAAU,CAAC,gBAAgB,IAAI,CAAC;YAClD,aAAa,EAAE,UAAU,CAAC,aAAa,CAAC,CAAC,CAAC,QAAQ,CAAC,CAAC,CAAC,MAAM;SAC5D,CAAC;IACJ,CAAC;IAED,KAAK,CAAC,cAAc,CAAC,GAAoB,EAAE,OAAoC;;QAC7E,MAAM,SAAS,GAAG,IAAI,CAAC,cAAc,CAAC,GAAG,CAAC,GAAG,CAAC,OAAO,CAAC,CAAC;QACvD,IAAI,SAAS,KAAK,SAAS,EAAE,CAAC;YAC5B,MAAM,IAAI,QAAQ,CAAC,kBAAkB,EAAE,UAAU,GAAG,CAAC,OAAO,iBAAiB,CAAC,CAAC;QACjF,CAAC;QACD,MAAM,MAAM,GAAG,MAAA,GAAG,CAAC,MAAM,mCAAI,MAAA,GAAG,CAAC,QAAQ,0CAAE,GAAG,CAAC,CAAC,CAAC,EAAE,EAAE,CAAC,GAAG,CAAC,CAAC,IAAI,KAAK,CAAC,CAAC,OAAO,EAAE,EAAE,IAAI,CAAC,IAAI,CAAC,CAAC;QAC5F,IAAI,CAAC,MAAM,EAAE,CAAC;YACZ,MAAM,IAAI,QAAQ,CAAC,iBAAiB,EAAE,gCAAgC,CAAC,CAAC;QAC1E,CAAC;QAED,IAAI,UAAU,GAAG,CAAC,CAAC;QACnB,MAAM,QAAQ,GAAG,MAAO,SAAS,EAAU,CAAC,WAAW,CAAC,cAAc,EAAE,CAAC,GAAqB,EAAE,EAAE;;YAChG,IAAI,GAAG,CAAC,SAAS,KAAK,SAAS;gBAAE,OAAO;YACxC,MAAM,KAAK,GAAG,MAAA,MAAA,GAAG,CAAC,WAAW,0CAAE,KAAK,mCAAI,EAAE,CAAC;YAC3C,IAAI,CAAC,KAAK;gBAAE,OAAO;YACnB,OAAO,CAAC,EAAE,OAAO,EAAE,GAAG,CAAC,OAAO,EAAE,KAAK,EAAE,KAAK,EAAE,UAAU,EAAE,EAAE,CAAC,CAAC;QAChE,CAAC,CAAC,CAAC;QAEH,IAAI,CAAC;YACH,MAAM,UAAU,GAAG,MAAM,SAAS,EAAE,CAAC,UAAU,CAAC;gBAC9C,SAAS;gBACT,MAAM,EAAE;oBACN,MAAM;oBACN,SAAS,EAAE,GAAG,CAAC,UAAU;oBACzB,WAAW,EAAE,GAAG,CAAC,WAAW;oBAC5B,uBAAuB,EAAE,IAAI;iBAC9B;aACF,CAAC,CAAC;YAEH,OAAO;gBACL,IAAI,EAAE,UAAU,CAAC,OAAO,IAAI,UAAU,CAAC,IAAI,IAAI,EAAE;gBACjD,gBAAgB,EAAE,UAAU,CAAC,gBAAgB,IAAI,CAAC;gBAClD,gBAAgB,EAAE,UAAU,CAAC,gBAAgB,IAAI,CAAC;gBAClD,aAAa,EAAE,UAAU,CAAC,aAAa,CAAC,CAAC,CAAC,QAAQ,CAAC,CAAC,CAAC,MAAM;aAC5D,CAAC;QACJ,CAAC;gBAAS,CAAC;YACT,MAAA,QAAQ,aAAR,QAAQ,uBAAR,QAAQ,CAAE,MAAM,wDAAI,CAAC;QACvB,CAAC;IACH,CAAC;IAED,KAAK,CAAC,KAAK,CAAC,GAAiB;QAC3B,MAAM,SAAS,GAAG,IAAI,CAAC,cAAc,CAAC,GAAG,CAAC,GAAG,CAAC,OAAO,CAAC,CAAC;QACvD,IAAI,SAAS,KAAK,SAAS,EAAE,CAAC;YAC5B,MAAM,IAAI,QAAQ,CAAC,kBAAkB,EAAE,UAAU,GAAG,CAAC,OAAO,iBAAiB,CAAC,CAAC;QACjF,CAAC;QAED,MAAM,MAAM,GAAG,KAAK,CAAC,OAAO,CAAC,GAAG,CAAC,KAAK,CAAC,CAAC,CAAC,CAAC,GAAG,CAAC,KAAK,CAAC,CAAC,CAAC,CAAC,GAAG,CAAC,KAAK,CAAC,CAAC;QAClE,MAAM,OAAO,GAAe,EAAE,CAAC;QAC/B,KAAK,MAAM,IAAI,IAAI,MAAM,EAAE,CAAC;YAC1B,MAAM,GAAG,GAAG,MAAM,SAAS,EAAE,CAAC,SAAS,CAAC;gBACtC,SAAS;gBACT,IAAI;gBACJ,MAAM,EAAE,EAAE;aACX,CAAC,CAAC;YACH,OAAO,CAAC,IAAI,CAAC,GAAG,CAAC,SAAS,IAAI,EAAE,CAAC,CAAC;QACpC,CAAC;QACD,OAAO,EAAE,OAAO,EAAE,CAAC;IACrB,CAAC;IAED,KAAK,CAAC,iBAAiB;;QACrB,MAAM,qBAAqB,GAAG,MAAC,UAAkB,aAAlB,UAAU,uBAAV,UAAU,CAAU,WAAW,0CAAE,MAAM,CAAC;QACvE,IAAI,qBAAqB,EAAE,CAAC;YAC1B,MAAM,UAAU,GAAG,MAAM,CAAC,qBAAqB,CAAC,eAAe,CAAC,CAAC;YACjE,MAAM,SAAS,GAAG,MAAM,CAAC,qBAAqB,CAAC,cAAc,CAAC,CAAC;YAC/D,MAAM,SAAS,GAAG,MAAM,CAAC,qBAAqB,CAAC,eAAe,GAAG,qBAAqB,CAAC,cAAc,CAAC,CAAC;YACvG,MAAM,SAAS,GAAG,UAAU,GAAG,CAAC,CAAC,CAAC,CAAC,SAAS,GAAG,UAAU,CAAC,CAAC,CAAC,CAAC,CAAC;YAC9D,MAAM,QAAQ,GAAG,SAAS,IAAI,IAAI,CAAC,CAAC,CAAC,MAAM,CAAC,CAAC,CAAC,SAAS,IAAI,GAAG,CAAC,CAAC,CAAC,QAAQ,CAAC,CAAC,CAAC,KAAK,CAAC;YAClF,OAAO,EAAE,UAAU,EAAE,SAAS,EAAE,SAAS,EAAE,QAAQ,EAAE,CAAC;QACxD,CAAC;QACD,OAAO,EAAE,QAAQ,EAAE,SAAS,EAAE,CAAC;IACjC,CAAC;IAED,KAAK,CAAC,MAAM;QACV,OAAO;YACL,EAAE,EAAE,IAAI;YACR,OAAO,EAAE;gBACP,YAAY,EAAE,IAAI,CAAC,cAAc,CAAC,IAAI;gBACtC,SAAS,EAAE,UAAU;gBACrB,qBAAqB,EAAE,IAAI,CAAC,SAAS,CAAC,UAAU,EAAE,CAAC,MAAM;aAC1D;SACF,CAAC;IACJ,CAAC;CACF","sourcesContent":["import { Capacitor, registerPlugin } from '@capacitor/core';\nimport type { LlamaCppPlugin } from '../definitions';\nimport type {\n EmbedRequest,\n EmbedResult,\n GenerateRequest,\n GenerateResult,\n InitializeOptions,\n LlmProvider,\n MemorySnapshot,\n TokenEvent,\n} from './provider.interface';\nimport { LlmError } from './errors';\nimport { DefaultModelScheduler } from './model.scheduler';\n\nconst EVENT_ON_TOKEN = '@LlamaCpp_onToken';\nconst MAX_MODELS = 5;\n\ntype TokenNativeEvent = {\n contextId: number;\n tokenResult: {\n token?: string;\n };\n};\n\n/** Prefer the plugin instance registered by src/index.ts. */\nconst getPlugin = (): LlamaCppPlugin => {\n const caps = Capacitor as unknown as {\n Plugins?: Record<string, LlamaCppPlugin>;\n getPlugin?: (name: string) => LlamaCppPlugin | undefined;\n };\n return (\n caps.Plugins?.LlamaCpp ??\n caps.getPlugin?.('LlamaCpp') ??\n registerPlugin<LlamaCppPlugin>('LlamaCpp')\n );\n};\n\nexport class NativeProvider implements LlmProvider {\n readonly platform = 'native' as const;\n private contextByModel = new Map<string, number>();\n private nextContextId = 1;\n private scheduler = new DefaultModelScheduler(MAX_MODELS);\n\n async initialize(opts: InitializeOptions): Promise<void> {\n await getPlugin().setContextLimit({ limit: MAX_MODELS });\n await this.loadModel(opts);\n }\n\n async loadModel(opts: InitializeOptions): Promise<void> {\n if (!opts.modelId) {\n throw new LlmError('INVALID_REQUEST', 'modelId is required');\n }\n if (!opts.modelPath) {\n throw new LlmError('INVALID_REQUEST', 'modelPath is required on native provider');\n }\n if (this.contextByModel.has(opts.modelId)) {\n return;\n }\n\n const modelBytes = typeof opts.modelBytes === 'number' ? opts.modelBytes : 0;\n const reserveBytes = typeof opts.reserveBytes === 'number' ? opts.reserveBytes : undefined;\n const memory = await this.getMemorySnapshot();\n if (typeof opts.availableMemoryBytes === 'number') {\n memory.freeBytes = opts.availableMemoryBytes;\n }\n if (typeof opts.totalMemoryBytes === 'number') {\n memory.totalBytes = opts.totalMemoryBytes;\n }\n this.scheduler.ensureCapacity(opts.modelId, modelBytes, memory, reserveBytes);\n\n const contextId = this.nextContextId++;\n await getPlugin().initContext({\n contextId,\n params: {\n model: opts.modelPath,\n n_ctx: opts.n_ctx,\n n_threads: opts.n_threads,\n embedding: opts.embedding,\n },\n });\n this.contextByModel.set(opts.modelId, contextId);\n this.scheduler.markLoaded(opts.modelId);\n }\n\n async unloadModel(modelId: string): Promise<void> {\n const contextId = this.contextByModel.get(modelId);\n if (contextId === undefined) {\n return;\n }\n await getPlugin().releaseContext({ contextId });\n this.contextByModel.delete(modelId);\n this.scheduler.markUnloaded(modelId);\n }\n\n async generate(req: GenerateRequest): Promise<GenerateResult> {\n const contextId = this.contextByModel.get(req.modelId);\n if (contextId === undefined) {\n throw new LlmError('MODEL_NOT_LOADED', `Model '${req.modelId}' is not loaded`);\n }\n const prompt = req.prompt ?? req.messages?.map((m) => `${m.role}: ${m.content}`).join('\\n');\n if (!prompt) {\n throw new LlmError('INVALID_REQUEST', 'prompt or messages is required');\n }\n\n const completion = await getPlugin().completion({\n contextId,\n params: {\n prompt,\n n_predict: req.max_tokens,\n temperature: req.temperature,\n emit_partial_completion: false,\n },\n });\n\n return {\n text: completion.content || completion.text || '',\n tokens_predicted: completion.tokens_predicted || 0,\n tokens_evaluated: completion.tokens_evaluated || 0,\n finish_reason: completion.stopped_limit ? 'length' : 'stop',\n };\n }\n\n async generateStream(req: GenerateRequest, onToken: (event: TokenEvent) => void): Promise<GenerateResult> {\n const contextId = this.contextByModel.get(req.modelId);\n if (contextId === undefined) {\n throw new LlmError('MODEL_NOT_LOADED', `Model '${req.modelId}' is not loaded`);\n }\n const prompt = req.prompt ?? req.messages?.map((m) => `${m.role}: ${m.content}`).join('\\n');\n if (!prompt) {\n throw new LlmError('INVALID_REQUEST', 'prompt or messages is required');\n }\n\n let tokenIndex = 0;\n const listener = await (getPlugin() as any).addListener(EVENT_ON_TOKEN, (evt: TokenNativeEvent) => {\n if (evt.contextId !== contextId) return;\n const token = evt.tokenResult?.token ?? '';\n if (!token) return;\n onToken({ modelId: req.modelId, token, index: tokenIndex++ });\n });\n\n try {\n const completion = await getPlugin().completion({\n contextId,\n params: {\n prompt,\n n_predict: req.max_tokens,\n temperature: req.temperature,\n emit_partial_completion: true,\n },\n });\n\n return {\n text: completion.content || completion.text || '',\n tokens_predicted: completion.tokens_predicted || 0,\n tokens_evaluated: completion.tokens_evaluated || 0,\n finish_reason: completion.stopped_limit ? 'length' : 'stop',\n };\n } finally {\n listener?.remove?.();\n }\n }\n\n async embed(req: EmbedRequest): Promise<EmbedResult> {\n const contextId = this.contextByModel.get(req.modelId);\n if (contextId === undefined) {\n throw new LlmError('MODEL_NOT_LOADED', `Model '${req.modelId}' is not loaded`);\n }\n\n const inputs = Array.isArray(req.input) ? req.input : [req.input];\n const vectors: number[][] = [];\n for (const text of inputs) {\n const res = await getPlugin().embedding({\n contextId,\n text,\n params: {},\n });\n vectors.push(res.embedding || []);\n }\n return { vectors };\n }\n\n async getMemorySnapshot(): Promise<MemorySnapshot> {\n const memoryFromPerformance = (globalThis as any)?.performance?.memory;\n if (memoryFromPerformance) {\n const totalBytes = Number(memoryFromPerformance.jsHeapSizeLimit);\n const usedBytes = Number(memoryFromPerformance.usedJSHeapSize);\n const freeBytes = Number(memoryFromPerformance.jsHeapSizeLimit - memoryFromPerformance.usedJSHeapSize);\n const usedRatio = totalBytes > 0 ? usedBytes / totalBytes : 0;\n const pressure = usedRatio >= 0.85 ? 'high' : usedRatio >= 0.7 ? 'medium' : 'low';\n return { totalBytes, usedBytes, freeBytes, pressure };\n }\n return { pressure: 'unknown' };\n }\n\n async health(): Promise<{ ok: boolean; details?: Record<string, unknown> }> {\n return {\n ok: true,\n details: {\n loadedModels: this.contextByModel.size,\n maxModels: MAX_MODELS,\n schedulerLoadedModels: this.scheduler.listLoaded().length,\n },\n };\n }\n}\n\n"]}
@@ -0,0 +1,88 @@
1
+ import type { EmbedRequest, EmbedResult, GenerateRequest, GenerateResult, InitializeOptions, LlmProvider, MemorySnapshot, PlatformKind, TokenEvent } from './provider.interface';
2
+ import type { DetokenizeResult, TokenizeResult } from '../workers/wasm.engine';
3
+ /** Verify that the browser supports everything the web WASM path needs. */
4
+ export declare function checkWasmCapabilities(): {
5
+ supported: boolean;
6
+ missing: string[];
7
+ };
8
+ /** Returns true only when COOP/COEP headers are set for WASM threads. */
9
+ export declare function checkCrossOriginIsolation(): boolean;
10
+ type WorkerFactory = () => Worker;
11
+ export declare class WebProvider implements LlmProvider {
12
+ private workerFactoryOverride?;
13
+ private static globalWorkerFactory?;
14
+ readonly platform: PlatformKind;
15
+ private loadedModelIds;
16
+ private worker;
17
+ private reqCounter;
18
+ private pending;
19
+ private scheduler;
20
+ constructor(workerFactoryOverride?: WorkerFactory | undefined);
21
+ static setWorkerFactory(factory?: WorkerFactory): void;
22
+ private resolveWorkerUrl;
23
+ private defaultWorkerFactory;
24
+ private ensureWorker;
25
+ private sendRequest;
26
+ initialize(opts: InitializeOptions): Promise<void>;
27
+ loadModel(opts: InitializeOptions): Promise<void>;
28
+ private readMeasuredFootprintFromWorker;
29
+ unloadModel(modelId: string): Promise<void>;
30
+ generate(req: GenerateRequest): Promise<GenerateResult>;
31
+ generateStream(req: GenerateRequest, onToken: (event: TokenEvent) => void): Promise<GenerateResult>;
32
+ embed(req: EmbedRequest): Promise<EmbedResult>;
33
+ getMemorySnapshot(): Promise<MemorySnapshot>;
34
+ /** Worker WASM linear memory + loaded-model registry (for scheduling UI). */
35
+ fetchWorkerMemory(): Promise<Record<string, unknown>>;
36
+ getWasmMemoryStatus(): Promise<Record<string, unknown>>;
37
+ tokenize(modelId: string, text: string): Promise<TokenizeResult>;
38
+ detokenize(modelId: string, tokens: number[]): Promise<DetokenizeResult>;
39
+ convertJsonSchemaToGrammar(schemaJson: string): Promise<string>;
40
+ private requireLoaded;
41
+ rerank(modelId: string, query: string, documents: string[]): Promise<Array<{
42
+ index: number;
43
+ score: number;
44
+ }>>;
45
+ bench(modelId: string, pp: number, tg: number, pl: number, nr: number): Promise<string>;
46
+ saveSession(modelId: string, filepath: string, tokenSize: number): Promise<number>;
47
+ loadSession(modelId: string, filepath: string): Promise<{
48
+ tokens_loaded: number;
49
+ prompt: string;
50
+ }>;
51
+ applyLoraAdapters(modelId: string, loraAdapters: Array<{
52
+ path: string;
53
+ scaled?: number;
54
+ }>): Promise<void>;
55
+ removeLoraAdapters(modelId: string): Promise<void>;
56
+ getLoadedLoraAdapters(modelId: string): Promise<Array<{
57
+ path: string;
58
+ scaled?: number;
59
+ }>>;
60
+ initMultimodal(modelId: string, path: string, useGpu?: boolean): Promise<boolean>;
61
+ isMultimodalEnabled(modelId: string): Promise<boolean>;
62
+ getMultimodalSupport(modelId: string): Promise<{
63
+ vision: boolean;
64
+ audio: boolean;
65
+ }>;
66
+ releaseMultimodal(modelId: string): Promise<void>;
67
+ initVocoder(modelId: string, path: string, nBatch?: number): Promise<boolean>;
68
+ isVocoderEnabled(modelId: string): Promise<boolean>;
69
+ releaseVocoder(modelId: string): Promise<void>;
70
+ getFormattedAudioCompletion(modelId: string, speaker: object | null, textToSpeak: string): Promise<{
71
+ prompt: string;
72
+ grammar?: string;
73
+ }>;
74
+ getAudioCompletionGuideTokens(modelId: string, textToSpeak: string): Promise<number[]>;
75
+ decodeAudioTokens(modelId: string, tokens: number[]): Promise<number[]>;
76
+ /**
77
+ * Terminate the worker mid-inference. WASM is single-threaded, so posting
78
+ * an abort message cannot be received while generate() is running. Worker
79
+ * termination is the only reliable interrupt. The model will need to be
80
+ * reloaded on the next generate() call.
81
+ */
82
+ stopGeneration(): void;
83
+ health(): Promise<{
84
+ ok: boolean;
85
+ details?: Record<string, unknown>;
86
+ }>;
87
+ }
88
+ export {};