llama-cpp-pro 0.2.2
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/CHANGELOG.md +295 -0
- package/LICENSE +21 -0
- package/LlamaCpp.podspec +33 -0
- package/LlamaCppCapacitor.podspec +33 -0
- package/Package.swift +29 -0
- package/README.md +93 -0
- package/android/build.gradle +88 -0
- package/android/src/main/AndroidManifest.xml +4 -0
- package/android/src/main/CMakeLists-arm64.txt +138 -0
- package/android/src/main/CMakeLists-x86_64.txt +141 -0
- package/android/src/main/CMakeLists.txt +138 -0
- package/android/src/main/java/ai/annadata/plugin/capacitor/LlamaCpp.java +1340 -0
- package/android/src/main/java/ai/annadata/plugin/capacitor/LlamaCppPlugin.java +814 -0
- package/android/src/main/java/ai/annadata/plugin/capacitor/ModelAdmissionController.java +214 -0
- package/android/src/main/jni-chat-session.cpp +261 -0
- package/android/src/main/jni-lora.cpp +197 -0
- package/android/src/main/jni-multimodal.cpp +167 -0
- package/android/src/main/jni-tts.cpp +290 -0
- package/android/src/main/jni-utils.h +148 -0
- package/android/src/main/jni.cpp +1808 -0
- package/android/src/main/jniLibs/arm64-v8a/libllama-cpp-arm64.so +0 -0
- package/android/src/main/res/.gitkeep +0 -0
- package/build-native.sh +280 -0
- package/cmake/desktop-metal-embed.cmake +30 -0
- package/cmake/desktop-sources.cmake +100 -0
- package/cmake/ggml-backends.cmake +44 -0
- package/cpp/LICENSE +21 -0
- package/cpp/README.md +15 -0
- package/cpp/anyascii.c +22223 -0
- package/cpp/anyascii.h +42 -0
- package/cpp/cap-completion.cpp +942 -0
- package/cpp/cap-completion.h +127 -0
- package/cpp/cap-embedding.cpp +193 -0
- package/cpp/cap-embedding.h +35 -0
- package/cpp/cap-ios-bridge.cpp +1810 -0
- package/cpp/cap-ios-bridge.h +61 -0
- package/cpp/cap-llama.cpp +412 -0
- package/cpp/cap-llama.h +161 -0
- package/cpp/cap-mtmd.hpp +602 -0
- package/cpp/cap-native-server.cpp +1095 -0
- package/cpp/cap-native-server.h +40 -0
- package/cpp/cap-tts.cpp +591 -0
- package/cpp/cap-tts.h +59 -0
- package/cpp/cap-wasm-fs.cpp +156 -0
- package/cpp/cap-wasm-jspi.cpp +19 -0
- package/cpp/cap-wasm-jspi.h +30 -0
- package/cpp/cap-wasm-vfs.cpp +22 -0
- package/cpp/chat-parser.cpp +393 -0
- package/cpp/chat-parser.h +120 -0
- package/cpp/chat.cpp +2315 -0
- package/cpp/chat.h +221 -0
- package/cpp/common.cpp +1664 -0
- package/cpp/common.h +744 -0
- package/cpp/ggml-alloc.c +1028 -0
- package/cpp/ggml-alloc.h +76 -0
- package/cpp/ggml-backend-impl.h +255 -0
- package/cpp/ggml-backend-reg.cpp +600 -0
- package/cpp/ggml-backend.cpp +2121 -0
- package/cpp/ggml-backend.h +354 -0
- package/cpp/ggml-common.h +1878 -0
- package/cpp/ggml-cpp.h +39 -0
- package/cpp/ggml-cpu/amx/amx.cpp +221 -0
- package/cpp/ggml-cpu/amx/amx.h +8 -0
- package/cpp/ggml-cpu/amx/common.h +91 -0
- package/cpp/ggml-cpu/amx/mmq.cpp +2512 -0
- package/cpp/ggml-cpu/amx/mmq.h +10 -0
- package/cpp/ggml-cpu/arch/arm/cpu-feats.cpp +94 -0
- package/cpp/ggml-cpu/arch/arm/quants.c +3650 -0
- package/cpp/ggml-cpu/arch/arm/repack.cpp +1891 -0
- package/cpp/ggml-cpu/arch/x86/cpu-feats.cpp +327 -0
- package/cpp/ggml-cpu/arch/x86/quants.c +3820 -0
- package/cpp/ggml-cpu/arch/x86/repack.cpp +6307 -0
- package/cpp/ggml-cpu/arch-fallback.h +215 -0
- package/cpp/ggml-cpu/binary-ops.cpp +158 -0
- package/cpp/ggml-cpu/binary-ops.h +16 -0
- package/cpp/ggml-cpu/common.h +73 -0
- package/cpp/ggml-cpu/ggml-cpu-impl.h +559 -0
- package/cpp/ggml-cpu/ggml-cpu.c +3578 -0
- package/cpp/ggml-cpu/ggml-cpu.cpp +672 -0
- package/cpp/ggml-cpu/ops.cpp +10587 -0
- package/cpp/ggml-cpu/ops.h +114 -0
- package/cpp/ggml-cpu/quants.c +1193 -0
- package/cpp/ggml-cpu/quants.h +97 -0
- package/cpp/ggml-cpu/repack.cpp +1982 -0
- package/cpp/ggml-cpu/repack.h +120 -0
- package/cpp/ggml-cpu/simd-mappings.h +1184 -0
- package/cpp/ggml-cpu/traits.cpp +36 -0
- package/cpp/ggml-cpu/traits.h +38 -0
- package/cpp/ggml-cpu/unary-ops.cpp +186 -0
- package/cpp/ggml-cpu/unary-ops.h +28 -0
- package/cpp/ggml-cpu/vec.cpp +348 -0
- package/cpp/ggml-cpu/vec.h +1121 -0
- package/cpp/ggml-cpu.h +145 -0
- package/cpp/ggml-impl.h +622 -0
- package/cpp/ggml-metal-impl.h +688 -0
- package/cpp/ggml-metal.h +66 -0
- package/cpp/ggml-metal.m +6833 -0
- package/cpp/ggml-metal.metal +10754 -0
- package/cpp/ggml-opt.cpp +1093 -0
- package/cpp/ggml-opt.h +256 -0
- package/cpp/ggml-quants.c +5324 -0
- package/cpp/ggml-quants.h +106 -0
- package/cpp/ggml-threading.cpp +12 -0
- package/cpp/ggml-threading.h +14 -0
- package/cpp/ggml.c +7108 -0
- package/cpp/ggml.h +2492 -0
- package/cpp/gguf.cpp +1358 -0
- package/cpp/gguf.h +202 -0
- package/cpp/json-partial.cpp +256 -0
- package/cpp/json-partial.h +38 -0
- package/cpp/json-schema-to-grammar.cpp +985 -0
- package/cpp/json-schema-to-grammar.h +21 -0
- package/cpp/llama-adapter.cpp +388 -0
- package/cpp/llama-adapter.h +76 -0
- package/cpp/llama-arch.cpp +2355 -0
- package/cpp/llama-arch.h +499 -0
- package/cpp/llama-batch.cpp +875 -0
- package/cpp/llama-batch.h +160 -0
- package/cpp/llama-chat.cpp +783 -0
- package/cpp/llama-chat.h +65 -0
- package/cpp/llama-context.cpp +2788 -0
- package/cpp/llama-context.h +306 -0
- package/cpp/llama-cparams.cpp +5 -0
- package/cpp/llama-cparams.h +41 -0
- package/cpp/llama-cpp.h +30 -0
- package/cpp/llama-grammar.cpp +1229 -0
- package/cpp/llama-grammar.h +173 -0
- package/cpp/llama-graph.cpp +1891 -0
- package/cpp/llama-graph.h +810 -0
- package/cpp/llama-hparams.cpp +180 -0
- package/cpp/llama-hparams.h +233 -0
- package/cpp/llama-impl.cpp +167 -0
- package/cpp/llama-impl.h +61 -0
- package/cpp/llama-io.cpp +15 -0
- package/cpp/llama-io.h +35 -0
- package/cpp/llama-kv-cache-iswa.cpp +318 -0
- package/cpp/llama-kv-cache-iswa.h +135 -0
- package/cpp/llama-kv-cache.cpp +2059 -0
- package/cpp/llama-kv-cache.h +374 -0
- package/cpp/llama-kv-cells.h +491 -0
- package/cpp/llama-memory-hybrid.cpp +258 -0
- package/cpp/llama-memory-hybrid.h +137 -0
- package/cpp/llama-memory-recurrent.cpp +1146 -0
- package/cpp/llama-memory-recurrent.h +179 -0
- package/cpp/llama-memory.cpp +59 -0
- package/cpp/llama-memory.h +119 -0
- package/cpp/llama-mmap.cpp +609 -0
- package/cpp/llama-mmap.h +68 -0
- package/cpp/llama-model-loader.cpp +1166 -0
- package/cpp/llama-model-loader.h +170 -0
- package/cpp/llama-model-saver.cpp +282 -0
- package/cpp/llama-model-saver.h +37 -0
- package/cpp/llama-model.cpp +19061 -0
- package/cpp/llama-model.h +491 -0
- package/cpp/llama-sampling.cpp +2575 -0
- package/cpp/llama-sampling.h +32 -0
- package/cpp/llama-vocab.cpp +3792 -0
- package/cpp/llama-vocab.h +176 -0
- package/cpp/llama.cpp +358 -0
- package/cpp/llama.h +1373 -0
- package/cpp/log.cpp +428 -0
- package/cpp/log.h +103 -0
- package/cpp/minja/chat-template.hpp +550 -0
- package/cpp/minja/minja.hpp +3009 -0
- package/cpp/nlohmann/json.hpp +25526 -0
- package/cpp/nlohmann/json_fwd.hpp +187 -0
- package/cpp/regex-partial.cpp +204 -0
- package/cpp/regex-partial.h +56 -0
- package/cpp/sampling.cpp +579 -0
- package/cpp/sampling.h +107 -0
- package/cpp/tools/mtmd/clip-impl.h +473 -0
- package/cpp/tools/mtmd/clip.cpp +4322 -0
- package/cpp/tools/mtmd/clip.h +106 -0
- package/cpp/tools/mtmd/miniaudio/miniaudio.h +93468 -0
- package/cpp/tools/mtmd/mtmd-audio.cpp +769 -0
- package/cpp/tools/mtmd/mtmd-audio.h +47 -0
- package/cpp/tools/mtmd/mtmd-helper.cpp +460 -0
- package/cpp/tools/mtmd/mtmd-helper.h +95 -0
- package/cpp/tools/mtmd/mtmd.cpp +1066 -0
- package/cpp/tools/mtmd/mtmd.h +302 -0
- package/cpp/tools/mtmd/stb/stb_image.h +7988 -0
- package/cpp/unicode-data.cpp +7034 -0
- package/cpp/unicode-data.h +20 -0
- package/cpp/unicode.cpp +1061 -0
- package/cpp/unicode.h +68 -0
- package/cpp/vendor/cpp-httplib/httplib.cpp +16509 -0
- package/cpp/vendor/cpp-httplib/httplib.h +3883 -0
- package/desktop/electron-builder.config.cjs +157 -0
- package/desktop/entitlements.mac.plist +12 -0
- package/desktop/package.json +11 -0
- package/desktop/resolve-package-root.cjs +88 -0
- package/desktop/src/main/backend-selector.cjs +148 -0
- package/desktop/src/main/gpu-probe.cjs +142 -0
- package/desktop/src/main/index.cjs +58 -0
- package/desktop/src/main/ipc-handlers.cjs +212 -0
- package/desktop/src/main/model-store.cjs +50 -0
- package/desktop/src/main/preload.cjs +39 -0
- package/desktop/src/main/sidecar-client.cjs +76 -0
- package/desktop/src/main/sidecar-manager.cjs +364 -0
- package/dist/docs.json +14357 -0
- package/dist/esm/definitions.d.ts +731 -0
- package/dist/esm/definitions.js +2 -0
- package/dist/esm/definitions.js.map +1 -0
- package/dist/esm/desktop.d.ts +37 -0
- package/dist/esm/desktop.js +133 -0
- package/dist/esm/desktop.js.map +1 -0
- package/dist/esm/index.d.ts +200 -0
- package/dist/esm/index.js +612 -0
- package/dist/esm/index.js.map +1 -0
- package/dist/esm/isomorphic/desktop.runtime.d.ts +37 -0
- package/dist/esm/isomorphic/desktop.runtime.js +36 -0
- package/dist/esm/isomorphic/desktop.runtime.js.map +1 -0
- package/dist/esm/isomorphic/errors.d.ts +6 -0
- package/dist/esm/isomorphic/errors.js +9 -0
- package/dist/esm/isomorphic/errors.js.map +1 -0
- package/dist/esm/isomorphic/model.admission.d.ts +17 -0
- package/dist/esm/isomorphic/model.admission.js +27 -0
- package/dist/esm/isomorphic/model.admission.js.map +1 -0
- package/dist/esm/isomorphic/model.scheduler.d.ts +31 -0
- package/dist/esm/isomorphic/model.scheduler.js +95 -0
- package/dist/esm/isomorphic/model.scheduler.js.map +1 -0
- package/dist/esm/isomorphic/provider.desktop.d.ts +40 -0
- package/dist/esm/isomorphic/provider.desktop.js +411 -0
- package/dist/esm/isomorphic/provider.desktop.js.map +1 -0
- package/dist/esm/isomorphic/provider.factory.d.ts +2 -0
- package/dist/esm/isomorphic/provider.factory.js +16 -0
- package/dist/esm/isomorphic/provider.factory.js.map +1 -0
- package/dist/esm/isomorphic/provider.interface.d.ts +76 -0
- package/dist/esm/isomorphic/provider.interface.js +2 -0
- package/dist/esm/isomorphic/provider.interface.js.map +1 -0
- package/dist/esm/isomorphic/provider.native.d.ts +18 -0
- package/dist/esm/isomorphic/provider.native.js +173 -0
- package/dist/esm/isomorphic/provider.native.js.map +1 -0
- package/dist/esm/isomorphic/provider.web.d.ts +88 -0
- package/dist/esm/isomorphic/provider.web.js +573 -0
- package/dist/esm/isomorphic/provider.web.js.map +1 -0
- package/dist/esm/isomorphic/sidecar-sse.d.ts +14 -0
- package/dist/esm/isomorphic/sidecar-sse.js +76 -0
- package/dist/esm/isomorphic/sidecar-sse.js.map +1 -0
- package/dist/esm/isomorphic/wasmMemoryCalibration.d.ts +26 -0
- package/dist/esm/isomorphic/wasmMemoryCalibration.js +60 -0
- package/dist/esm/isomorphic/wasmMemoryCalibration.js.map +1 -0
- package/dist/esm/isomorphic/wasmMemoryPolicy.d.ts +55 -0
- package/dist/esm/isomorphic/wasmMemoryPolicy.js +93 -0
- package/dist/esm/isomorphic/wasmMemoryPolicy.js.map +1 -0
- package/dist/esm/storage/manifest.d.ts +13 -0
- package/dist/esm/storage/manifest.js +87 -0
- package/dist/esm/storage/manifest.js.map +1 -0
- package/dist/esm/storage/opfs.store.d.ts +31 -0
- package/dist/esm/storage/opfs.store.js +241 -0
- package/dist/esm/storage/opfs.store.js.map +1 -0
- package/dist/esm/web.d.ts +206 -0
- package/dist/esm/web.js +521 -0
- package/dist/esm/web.js.map +1 -0
- package/dist/esm/workers/async-file.d.ts +13 -0
- package/dist/esm/workers/async-file.js +12 -0
- package/dist/esm/workers/async-file.js.map +1 -0
- package/dist/esm/workers/heapfs.d.ts +55 -0
- package/dist/esm/workers/heapfs.js +115 -0
- package/dist/esm/workers/heapfs.js.map +1 -0
- package/dist/esm/workers/wasm.engine.d.ts +86 -0
- package/dist/esm/workers/wasm.engine.js +504 -0
- package/dist/esm/workers/wasm.engine.js.map +1 -0
- package/dist/esm/workers/worker.protocol.d.ts +160 -0
- package/dist/esm/workers/worker.protocol.js +2 -0
- package/dist/esm/workers/worker.protocol.js.map +1 -0
- package/dist/plugin.cjs +3179 -0
- package/dist/plugin.cjs.map +1 -0
- package/dist/plugin.js +3181 -0
- package/dist/plugin.js.map +1 -0
- package/dist/wasm/llama_engine.d.ts +74 -0
- package/dist/wasm/llama_engine.js +1829 -0
- package/dist/wasm/llama_engine.wasm +0 -0
- package/dist/wasm/llama_engine_emscripten.mjs +2 -0
- package/dist/wasm/package.json +16 -0
- package/dist/workers/llm.worker.js +1226 -0
- package/dist/workers/llm.worker.js.map +7 -0
- package/extraResources/llama-wasm/llama_engine.d.ts +74 -0
- package/extraResources/llama-wasm/llama_engine.js +1829 -0
- package/extraResources/llama-wasm/llama_engine.wasm +0 -0
- package/extraResources/llama-wasm/llama_engine_emscripten.mjs +2 -0
- package/extraResources/llama-wasm/package.json +16 -0
- package/extraResources/sidecar/README.md +11 -0
- package/extraResources/sidecar/darwin-arm64 +0 -0
- package/extraResources/sidecar/darwin-x64 +0 -0
- package/ios/CMakeLists-arm64.txt +161 -0
- package/ios/CMakeLists-x86_64.txt +188 -0
- package/ios/CMakeLists.txt +161 -0
- package/ios/Frameworks/llama-cpp.framework/Info.plist +28 -0
- package/ios/Frameworks/llama-cpp.framework/llama-cpp +0 -0
- package/ios/Sources/LlamaCppCapacitor/LlamaCpp.swift +1365 -0
- package/ios/Sources/LlamaCppCapacitor/LlamaCppPlugin.swift +694 -0
- package/ios/Sources/LlamaCppCapacitor/LlamaNativeBridge.swift +349 -0
- package/ios/Sources/LlamaCppCapacitor/ModelAdmissionController.swift +177 -0
- package/ios/embed-metal-shaders.sh +24 -0
- package/ios/metal-embed.cmake +29 -0
- package/package.json +281 -0
- package/scripts/build-js-preserve-wasm.cjs +53 -0
- package/scripts/build-sidecar-linux.sh +6 -0
- package/scripts/build-sidecar-win.bat +19 -0
- package/scripts/build-sidecar.sh +184 -0
- package/scripts/embed-llama-ios-app-framework.sh +63 -0
- package/scripts/ensure-desktop-sidecar-bundle.cjs +103 -0
- package/scripts/ensure-llama-ios-xcframework.sh +108 -0
- package/scripts/fix-esm-extensions.cjs +45 -0
- package/scripts/prepare-js-dist.cjs +28 -0
- package/scripts/stage-desktop-resources.cjs +116 -0
- package/sidecar/CMakeLists.txt +192 -0
- package/sidecar/cap-sidecar-main.cpp +68 -0
- package/types/llama-cpp-pro.d.ts +441 -0
|
@@ -0,0 +1,173 @@
|
|
|
1
|
+
import { Capacitor, registerPlugin } from '@capacitor/core';
|
|
2
|
+
import { LlmError } from './errors';
|
|
3
|
+
import { DefaultModelScheduler } from './model.scheduler';
|
|
4
|
+
const EVENT_ON_TOKEN = '@LlamaCpp_onToken';
|
|
5
|
+
const MAX_MODELS = 5;
|
|
6
|
+
/** Prefer the plugin instance registered by src/index.ts. */
|
|
7
|
+
const getPlugin = () => {
|
|
8
|
+
var _a, _b, _c, _d;
|
|
9
|
+
const caps = Capacitor;
|
|
10
|
+
return ((_d = (_b = (_a = caps.Plugins) === null || _a === void 0 ? void 0 : _a.LlamaCpp) !== null && _b !== void 0 ? _b : (_c = caps.getPlugin) === null || _c === void 0 ? void 0 : _c.call(caps, 'LlamaCpp')) !== null && _d !== void 0 ? _d : registerPlugin('LlamaCpp'));
|
|
11
|
+
};
|
|
12
|
+
export class NativeProvider {
|
|
13
|
+
constructor() {
|
|
14
|
+
this.platform = 'native';
|
|
15
|
+
this.contextByModel = new Map();
|
|
16
|
+
this.nextContextId = 1;
|
|
17
|
+
this.scheduler = new DefaultModelScheduler(MAX_MODELS);
|
|
18
|
+
}
|
|
19
|
+
async initialize(opts) {
|
|
20
|
+
await getPlugin().setContextLimit({ limit: MAX_MODELS });
|
|
21
|
+
await this.loadModel(opts);
|
|
22
|
+
}
|
|
23
|
+
async loadModel(opts) {
|
|
24
|
+
if (!opts.modelId) {
|
|
25
|
+
throw new LlmError('INVALID_REQUEST', 'modelId is required');
|
|
26
|
+
}
|
|
27
|
+
if (!opts.modelPath) {
|
|
28
|
+
throw new LlmError('INVALID_REQUEST', 'modelPath is required on native provider');
|
|
29
|
+
}
|
|
30
|
+
if (this.contextByModel.has(opts.modelId)) {
|
|
31
|
+
return;
|
|
32
|
+
}
|
|
33
|
+
const modelBytes = typeof opts.modelBytes === 'number' ? opts.modelBytes : 0;
|
|
34
|
+
const reserveBytes = typeof opts.reserveBytes === 'number' ? opts.reserveBytes : undefined;
|
|
35
|
+
const memory = await this.getMemorySnapshot();
|
|
36
|
+
if (typeof opts.availableMemoryBytes === 'number') {
|
|
37
|
+
memory.freeBytes = opts.availableMemoryBytes;
|
|
38
|
+
}
|
|
39
|
+
if (typeof opts.totalMemoryBytes === 'number') {
|
|
40
|
+
memory.totalBytes = opts.totalMemoryBytes;
|
|
41
|
+
}
|
|
42
|
+
this.scheduler.ensureCapacity(opts.modelId, modelBytes, memory, reserveBytes);
|
|
43
|
+
const contextId = this.nextContextId++;
|
|
44
|
+
await getPlugin().initContext({
|
|
45
|
+
contextId,
|
|
46
|
+
params: {
|
|
47
|
+
model: opts.modelPath,
|
|
48
|
+
n_ctx: opts.n_ctx,
|
|
49
|
+
n_threads: opts.n_threads,
|
|
50
|
+
embedding: opts.embedding,
|
|
51
|
+
},
|
|
52
|
+
});
|
|
53
|
+
this.contextByModel.set(opts.modelId, contextId);
|
|
54
|
+
this.scheduler.markLoaded(opts.modelId);
|
|
55
|
+
}
|
|
56
|
+
async unloadModel(modelId) {
|
|
57
|
+
const contextId = this.contextByModel.get(modelId);
|
|
58
|
+
if (contextId === undefined) {
|
|
59
|
+
return;
|
|
60
|
+
}
|
|
61
|
+
await getPlugin().releaseContext({ contextId });
|
|
62
|
+
this.contextByModel.delete(modelId);
|
|
63
|
+
this.scheduler.markUnloaded(modelId);
|
|
64
|
+
}
|
|
65
|
+
async generate(req) {
|
|
66
|
+
var _a, _b;
|
|
67
|
+
const contextId = this.contextByModel.get(req.modelId);
|
|
68
|
+
if (contextId === undefined) {
|
|
69
|
+
throw new LlmError('MODEL_NOT_LOADED', `Model '${req.modelId}' is not loaded`);
|
|
70
|
+
}
|
|
71
|
+
const prompt = (_a = req.prompt) !== null && _a !== void 0 ? _a : (_b = req.messages) === null || _b === void 0 ? void 0 : _b.map((m) => `${m.role}: ${m.content}`).join('\n');
|
|
72
|
+
if (!prompt) {
|
|
73
|
+
throw new LlmError('INVALID_REQUEST', 'prompt or messages is required');
|
|
74
|
+
}
|
|
75
|
+
const completion = await getPlugin().completion({
|
|
76
|
+
contextId,
|
|
77
|
+
params: {
|
|
78
|
+
prompt,
|
|
79
|
+
n_predict: req.max_tokens,
|
|
80
|
+
temperature: req.temperature,
|
|
81
|
+
emit_partial_completion: false,
|
|
82
|
+
},
|
|
83
|
+
});
|
|
84
|
+
return {
|
|
85
|
+
text: completion.content || completion.text || '',
|
|
86
|
+
tokens_predicted: completion.tokens_predicted || 0,
|
|
87
|
+
tokens_evaluated: completion.tokens_evaluated || 0,
|
|
88
|
+
finish_reason: completion.stopped_limit ? 'length' : 'stop',
|
|
89
|
+
};
|
|
90
|
+
}
|
|
91
|
+
async generateStream(req, onToken) {
|
|
92
|
+
var _a, _b, _c;
|
|
93
|
+
const contextId = this.contextByModel.get(req.modelId);
|
|
94
|
+
if (contextId === undefined) {
|
|
95
|
+
throw new LlmError('MODEL_NOT_LOADED', `Model '${req.modelId}' is not loaded`);
|
|
96
|
+
}
|
|
97
|
+
const prompt = (_a = req.prompt) !== null && _a !== void 0 ? _a : (_b = req.messages) === null || _b === void 0 ? void 0 : _b.map((m) => `${m.role}: ${m.content}`).join('\n');
|
|
98
|
+
if (!prompt) {
|
|
99
|
+
throw new LlmError('INVALID_REQUEST', 'prompt or messages is required');
|
|
100
|
+
}
|
|
101
|
+
let tokenIndex = 0;
|
|
102
|
+
const listener = await getPlugin().addListener(EVENT_ON_TOKEN, (evt) => {
|
|
103
|
+
var _a, _b;
|
|
104
|
+
if (evt.contextId !== contextId)
|
|
105
|
+
return;
|
|
106
|
+
const token = (_b = (_a = evt.tokenResult) === null || _a === void 0 ? void 0 : _a.token) !== null && _b !== void 0 ? _b : '';
|
|
107
|
+
if (!token)
|
|
108
|
+
return;
|
|
109
|
+
onToken({ modelId: req.modelId, token, index: tokenIndex++ });
|
|
110
|
+
});
|
|
111
|
+
try {
|
|
112
|
+
const completion = await getPlugin().completion({
|
|
113
|
+
contextId,
|
|
114
|
+
params: {
|
|
115
|
+
prompt,
|
|
116
|
+
n_predict: req.max_tokens,
|
|
117
|
+
temperature: req.temperature,
|
|
118
|
+
emit_partial_completion: true,
|
|
119
|
+
},
|
|
120
|
+
});
|
|
121
|
+
return {
|
|
122
|
+
text: completion.content || completion.text || '',
|
|
123
|
+
tokens_predicted: completion.tokens_predicted || 0,
|
|
124
|
+
tokens_evaluated: completion.tokens_evaluated || 0,
|
|
125
|
+
finish_reason: completion.stopped_limit ? 'length' : 'stop',
|
|
126
|
+
};
|
|
127
|
+
}
|
|
128
|
+
finally {
|
|
129
|
+
(_c = listener === null || listener === void 0 ? void 0 : listener.remove) === null || _c === void 0 ? void 0 : _c.call(listener);
|
|
130
|
+
}
|
|
131
|
+
}
|
|
132
|
+
async embed(req) {
|
|
133
|
+
const contextId = this.contextByModel.get(req.modelId);
|
|
134
|
+
if (contextId === undefined) {
|
|
135
|
+
throw new LlmError('MODEL_NOT_LOADED', `Model '${req.modelId}' is not loaded`);
|
|
136
|
+
}
|
|
137
|
+
const inputs = Array.isArray(req.input) ? req.input : [req.input];
|
|
138
|
+
const vectors = [];
|
|
139
|
+
for (const text of inputs) {
|
|
140
|
+
const res = await getPlugin().embedding({
|
|
141
|
+
contextId,
|
|
142
|
+
text,
|
|
143
|
+
params: {},
|
|
144
|
+
});
|
|
145
|
+
vectors.push(res.embedding || []);
|
|
146
|
+
}
|
|
147
|
+
return { vectors };
|
|
148
|
+
}
|
|
149
|
+
async getMemorySnapshot() {
|
|
150
|
+
var _a;
|
|
151
|
+
const memoryFromPerformance = (_a = globalThis === null || globalThis === void 0 ? void 0 : globalThis.performance) === null || _a === void 0 ? void 0 : _a.memory;
|
|
152
|
+
if (memoryFromPerformance) {
|
|
153
|
+
const totalBytes = Number(memoryFromPerformance.jsHeapSizeLimit);
|
|
154
|
+
const usedBytes = Number(memoryFromPerformance.usedJSHeapSize);
|
|
155
|
+
const freeBytes = Number(memoryFromPerformance.jsHeapSizeLimit - memoryFromPerformance.usedJSHeapSize);
|
|
156
|
+
const usedRatio = totalBytes > 0 ? usedBytes / totalBytes : 0;
|
|
157
|
+
const pressure = usedRatio >= 0.85 ? 'high' : usedRatio >= 0.7 ? 'medium' : 'low';
|
|
158
|
+
return { totalBytes, usedBytes, freeBytes, pressure };
|
|
159
|
+
}
|
|
160
|
+
return { pressure: 'unknown' };
|
|
161
|
+
}
|
|
162
|
+
async health() {
|
|
163
|
+
return {
|
|
164
|
+
ok: true,
|
|
165
|
+
details: {
|
|
166
|
+
loadedModels: this.contextByModel.size,
|
|
167
|
+
maxModels: MAX_MODELS,
|
|
168
|
+
schedulerLoadedModels: this.scheduler.listLoaded().length,
|
|
169
|
+
},
|
|
170
|
+
};
|
|
171
|
+
}
|
|
172
|
+
}
|
|
173
|
+
//# sourceMappingURL=provider.native.js.map
|
|
@@ -0,0 +1 @@
|
|
|
1
|
+
{"version":3,"file":"provider.native.js","sourceRoot":"","sources":["../../../src/isomorphic/provider.native.ts"],"names":[],"mappings":"AAAA,OAAO,EAAE,SAAS,EAAE,cAAc,EAAE,MAAM,iBAAiB,CAAC;AAY5D,OAAO,EAAE,QAAQ,EAAE,MAAM,UAAU,CAAC;AACpC,OAAO,EAAE,qBAAqB,EAAE,MAAM,mBAAmB,CAAC;AAE1D,MAAM,cAAc,GAAG,mBAAmB,CAAC;AAC3C,MAAM,UAAU,GAAG,CAAC,CAAC;AASrB,6DAA6D;AAC7D,MAAM,SAAS,GAAG,GAAmB,EAAE;;IACrC,MAAM,IAAI,GAAG,SAGZ,CAAC;IACF,OAAO,CACL,MAAA,MAAA,MAAA,IAAI,CAAC,OAAO,0CAAE,QAAQ,mCACtB,MAAA,IAAI,CAAC,SAAS,qDAAG,UAAU,CAAC,mCAC5B,cAAc,CAAiB,UAAU,CAAC,CAC3C,CAAC;AACJ,CAAC,CAAC;AAEF,MAAM,OAAO,cAAc;IAA3B;QACW,aAAQ,GAAG,QAAiB,CAAC;QAC9B,mBAAc,GAAG,IAAI,GAAG,EAAkB,CAAC;QAC3C,kBAAa,GAAG,CAAC,CAAC;QAClB,cAAS,GAAG,IAAI,qBAAqB,CAAC,UAAU,CAAC,CAAC;IAmK5D,CAAC;IAjKC,KAAK,CAAC,UAAU,CAAC,IAAuB;QACtC,MAAM,SAAS,EAAE,CAAC,eAAe,CAAC,EAAE,KAAK,EAAE,UAAU,EAAE,CAAC,CAAC;QACzD,MAAM,IAAI,CAAC,SAAS,CAAC,IAAI,CAAC,CAAC;IAC7B,CAAC;IAED,KAAK,CAAC,SAAS,CAAC,IAAuB;QACrC,IAAI,CAAC,IAAI,CAAC,OAAO,EAAE,CAAC;YAClB,MAAM,IAAI,QAAQ,CAAC,iBAAiB,EAAE,qBAAqB,CAAC,CAAC;QAC/D,CAAC;QACD,IAAI,CAAC,IAAI,CAAC,SAAS,EAAE,CAAC;YACpB,MAAM,IAAI,QAAQ,CAAC,iBAAiB,EAAE,0CAA0C,CAAC,CAAC;QACpF,CAAC;QACD,IAAI,IAAI,CAAC,cAAc,CAAC,GAAG,CAAC,IAAI,CAAC,OAAO,CAAC,EAAE,CAAC;YAC1C,OAAO;QACT,CAAC;QAED,MAAM,UAAU,GAAG,OAAO,IAAI,CAAC,UAAU,KAAK,QAAQ,CAAC,CAAC,CAAC,IAAI,CAAC,UAAU,CAAC,CAAC,CAAC,CAAC,CAAC;QAC7E,MAAM,YAAY,GAAG,OAAO,IAAI,CAAC,YAAY,KAAK,QAAQ,CAAC,CAAC,CAAC,IAAI,CAAC,YAAY,CAAC,CAAC,CAAC,SAAS,CAAC;QAC3F,MAAM,MAAM,GAAG,MAAM,IAAI,CAAC,iBAAiB,EAAE,CAAC;QAC9C,IAAI,OAAO,IAAI,CAAC,oBAAoB,KAAK,QAAQ,EAAE,CAAC;YAClD,MAAM,CAAC,SAAS,GAAG,IAAI,CAAC,oBAAoB,CAAC;QAC/C,CAAC;QACD,IAAI,OAAO,IAAI,CAAC,gBAAgB,KAAK,QAAQ,EAAE,CAAC;YAC9C,MAAM,CAAC,UAAU,GAAG,IAAI,CAAC,gBAAgB,CAAC;QAC5C,CAAC;QACD,IAAI,CAAC,SAAS,CAAC,cAAc,CAAC,IAAI,CAAC,OAAO,EAAE,UAAU,EAAE,MAAM,EAAE,YAAY,CAAC,CAAC;QAE9E,MAAM,SAAS,GAAG,IAAI,CAAC,aAAa,EAAE,CAAC;QACvC,MAAM,SAAS,EAAE,CAAC,WAAW,CAAC;YAC5B,SAAS;YACT,MAAM,EAAE;gBACN,KAAK,EAAE,IAAI,CAAC,SAAS;gBACrB,KAAK,EAAE,IAAI,CAAC,KAAK;gBACjB,SAAS,EAAE,IAAI,CAAC,SAAS;gBACzB,SAAS,EAAE,IAAI,CAAC,SAAS;aAC1B;SACF,CAAC,CAAC;QACH,IAAI,CAAC,cAAc,CAAC,GAAG,CAAC,IAAI,CAAC,OAAO,EAAE,SAAS,CAAC,CAAC;QACjD,IAAI,CAAC,SAAS,CAAC,UAAU,CAAC,IAAI,CAAC,OAAO,CAAC,CAAC;IAC1C,CAAC;IAED,KAAK,CAAC,WAAW,CAAC,OAAe;QAC/B,MAAM,SAAS,GAAG,IAAI,CAAC,cAAc,CAAC,GAAG,CAAC,OAAO,CAAC,CAAC;QACnD,IAAI,SAAS,KAAK,SAAS,EAAE,CAAC;YAC5B,OAAO;QACT,CAAC;QACD,MAAM,SAAS,EAAE,CAAC,cAAc,CAAC,EAAE,SAAS,EAAE,CAAC,CAAC;QAChD,IAAI,CAAC,cAAc,CAAC,MAAM,CAAC,OAAO,CAAC,CAAC;QACpC,IAAI,CAAC,SAAS,CAAC,YAAY,CAAC,OAAO,CAAC,CAAC;IACvC,CAAC;IAED,KAAK,CAAC,QAAQ,CAAC,GAAoB;;QACjC,MAAM,SAAS,GAAG,IAAI,CAAC,cAAc,CAAC,GAAG,CAAC,GAAG,CAAC,OAAO,CAAC,CAAC;QACvD,IAAI,SAAS,KAAK,SAAS,EAAE,CAAC;YAC5B,MAAM,IAAI,QAAQ,CAAC,kBAAkB,EAAE,UAAU,GAAG,CAAC,OAAO,iBAAiB,CAAC,CAAC;QACjF,CAAC;QACD,MAAM,MAAM,GAAG,MAAA,GAAG,CAAC,MAAM,mCAAI,MAAA,GAAG,CAAC,QAAQ,0CAAE,GAAG,CAAC,CAAC,CAAC,EAAE,EAAE,CAAC,GAAG,CAAC,CAAC,IAAI,KAAK,CAAC,CAAC,OAAO,EAAE,EAAE,IAAI,CAAC,IAAI,CAAC,CAAC;QAC5F,IAAI,CAAC,MAAM,EAAE,CAAC;YACZ,MAAM,IAAI,QAAQ,CAAC,iBAAiB,EAAE,gCAAgC,CAAC,CAAC;QAC1E,CAAC;QAED,MAAM,UAAU,GAAG,MAAM,SAAS,EAAE,CAAC,UAAU,CAAC;YAC9C,SAAS;YACT,MAAM,EAAE;gBACN,MAAM;gBACN,SAAS,EAAE,GAAG,CAAC,UAAU;gBACzB,WAAW,EAAE,GAAG,CAAC,WAAW;gBAC5B,uBAAuB,EAAE,KAAK;aAC/B;SACF,CAAC,CAAC;QAEH,OAAO;YACL,IAAI,EAAE,UAAU,CAAC,OAAO,IAAI,UAAU,CAAC,IAAI,IAAI,EAAE;YACjD,gBAAgB,EAAE,UAAU,CAAC,gBAAgB,IAAI,CAAC;YAClD,gBAAgB,EAAE,UAAU,CAAC,gBAAgB,IAAI,CAAC;YAClD,aAAa,EAAE,UAAU,CAAC,aAAa,CAAC,CAAC,CAAC,QAAQ,CAAC,CAAC,CAAC,MAAM;SAC5D,CAAC;IACJ,CAAC;IAED,KAAK,CAAC,cAAc,CAAC,GAAoB,EAAE,OAAoC;;QAC7E,MAAM,SAAS,GAAG,IAAI,CAAC,cAAc,CAAC,GAAG,CAAC,GAAG,CAAC,OAAO,CAAC,CAAC;QACvD,IAAI,SAAS,KAAK,SAAS,EAAE,CAAC;YAC5B,MAAM,IAAI,QAAQ,CAAC,kBAAkB,EAAE,UAAU,GAAG,CAAC,OAAO,iBAAiB,CAAC,CAAC;QACjF,CAAC;QACD,MAAM,MAAM,GAAG,MAAA,GAAG,CAAC,MAAM,mCAAI,MAAA,GAAG,CAAC,QAAQ,0CAAE,GAAG,CAAC,CAAC,CAAC,EAAE,EAAE,CAAC,GAAG,CAAC,CAAC,IAAI,KAAK,CAAC,CAAC,OAAO,EAAE,EAAE,IAAI,CAAC,IAAI,CAAC,CAAC;QAC5F,IAAI,CAAC,MAAM,EAAE,CAAC;YACZ,MAAM,IAAI,QAAQ,CAAC,iBAAiB,EAAE,gCAAgC,CAAC,CAAC;QAC1E,CAAC;QAED,IAAI,UAAU,GAAG,CAAC,CAAC;QACnB,MAAM,QAAQ,GAAG,MAAO,SAAS,EAAU,CAAC,WAAW,CAAC,cAAc,EAAE,CAAC,GAAqB,EAAE,EAAE;;YAChG,IAAI,GAAG,CAAC,SAAS,KAAK,SAAS;gBAAE,OAAO;YACxC,MAAM,KAAK,GAAG,MAAA,MAAA,GAAG,CAAC,WAAW,0CAAE,KAAK,mCAAI,EAAE,CAAC;YAC3C,IAAI,CAAC,KAAK;gBAAE,OAAO;YACnB,OAAO,CAAC,EAAE,OAAO,EAAE,GAAG,CAAC,OAAO,EAAE,KAAK,EAAE,KAAK,EAAE,UAAU,EAAE,EAAE,CAAC,CAAC;QAChE,CAAC,CAAC,CAAC;QAEH,IAAI,CAAC;YACH,MAAM,UAAU,GAAG,MAAM,SAAS,EAAE,CAAC,UAAU,CAAC;gBAC9C,SAAS;gBACT,MAAM,EAAE;oBACN,MAAM;oBACN,SAAS,EAAE,GAAG,CAAC,UAAU;oBACzB,WAAW,EAAE,GAAG,CAAC,WAAW;oBAC5B,uBAAuB,EAAE,IAAI;iBAC9B;aACF,CAAC,CAAC;YAEH,OAAO;gBACL,IAAI,EAAE,UAAU,CAAC,OAAO,IAAI,UAAU,CAAC,IAAI,IAAI,EAAE;gBACjD,gBAAgB,EAAE,UAAU,CAAC,gBAAgB,IAAI,CAAC;gBAClD,gBAAgB,EAAE,UAAU,CAAC,gBAAgB,IAAI,CAAC;gBAClD,aAAa,EAAE,UAAU,CAAC,aAAa,CAAC,CAAC,CAAC,QAAQ,CAAC,CAAC,CAAC,MAAM;aAC5D,CAAC;QACJ,CAAC;gBAAS,CAAC;YACT,MAAA,QAAQ,aAAR,QAAQ,uBAAR,QAAQ,CAAE,MAAM,wDAAI,CAAC;QACvB,CAAC;IACH,CAAC;IAED,KAAK,CAAC,KAAK,CAAC,GAAiB;QAC3B,MAAM,SAAS,GAAG,IAAI,CAAC,cAAc,CAAC,GAAG,CAAC,GAAG,CAAC,OAAO,CAAC,CAAC;QACvD,IAAI,SAAS,KAAK,SAAS,EAAE,CAAC;YAC5B,MAAM,IAAI,QAAQ,CAAC,kBAAkB,EAAE,UAAU,GAAG,CAAC,OAAO,iBAAiB,CAAC,CAAC;QACjF,CAAC;QAED,MAAM,MAAM,GAAG,KAAK,CAAC,OAAO,CAAC,GAAG,CAAC,KAAK,CAAC,CAAC,CAAC,CAAC,GAAG,CAAC,KAAK,CAAC,CAAC,CAAC,CAAC,GAAG,CAAC,KAAK,CAAC,CAAC;QAClE,MAAM,OAAO,GAAe,EAAE,CAAC;QAC/B,KAAK,MAAM,IAAI,IAAI,MAAM,EAAE,CAAC;YAC1B,MAAM,GAAG,GAAG,MAAM,SAAS,EAAE,CAAC,SAAS,CAAC;gBACtC,SAAS;gBACT,IAAI;gBACJ,MAAM,EAAE,EAAE;aACX,CAAC,CAAC;YACH,OAAO,CAAC,IAAI,CAAC,GAAG,CAAC,SAAS,IAAI,EAAE,CAAC,CAAC;QACpC,CAAC;QACD,OAAO,EAAE,OAAO,EAAE,CAAC;IACrB,CAAC;IAED,KAAK,CAAC,iBAAiB;;QACrB,MAAM,qBAAqB,GAAG,MAAC,UAAkB,aAAlB,UAAU,uBAAV,UAAU,CAAU,WAAW,0CAAE,MAAM,CAAC;QACvE,IAAI,qBAAqB,EAAE,CAAC;YAC1B,MAAM,UAAU,GAAG,MAAM,CAAC,qBAAqB,CAAC,eAAe,CAAC,CAAC;YACjE,MAAM,SAAS,GAAG,MAAM,CAAC,qBAAqB,CAAC,cAAc,CAAC,CAAC;YAC/D,MAAM,SAAS,GAAG,MAAM,CAAC,qBAAqB,CAAC,eAAe,GAAG,qBAAqB,CAAC,cAAc,CAAC,CAAC;YACvG,MAAM,SAAS,GAAG,UAAU,GAAG,CAAC,CAAC,CAAC,CAAC,SAAS,GAAG,UAAU,CAAC,CAAC,CAAC,CAAC,CAAC;YAC9D,MAAM,QAAQ,GAAG,SAAS,IAAI,IAAI,CAAC,CAAC,CAAC,MAAM,CAAC,CAAC,CAAC,SAAS,IAAI,GAAG,CAAC,CAAC,CAAC,QAAQ,CAAC,CAAC,CAAC,KAAK,CAAC;YAClF,OAAO,EAAE,UAAU,EAAE,SAAS,EAAE,SAAS,EAAE,QAAQ,EAAE,CAAC;QACxD,CAAC;QACD,OAAO,EAAE,QAAQ,EAAE,SAAS,EAAE,CAAC;IACjC,CAAC;IAED,KAAK,CAAC,MAAM;QACV,OAAO;YACL,EAAE,EAAE,IAAI;YACR,OAAO,EAAE;gBACP,YAAY,EAAE,IAAI,CAAC,cAAc,CAAC,IAAI;gBACtC,SAAS,EAAE,UAAU;gBACrB,qBAAqB,EAAE,IAAI,CAAC,SAAS,CAAC,UAAU,EAAE,CAAC,MAAM;aAC1D;SACF,CAAC;IACJ,CAAC;CACF","sourcesContent":["import { Capacitor, registerPlugin } from '@capacitor/core';\nimport type { LlamaCppPlugin } from '../definitions';\nimport type {\n EmbedRequest,\n EmbedResult,\n GenerateRequest,\n GenerateResult,\n InitializeOptions,\n LlmProvider,\n MemorySnapshot,\n TokenEvent,\n} from './provider.interface';\nimport { LlmError } from './errors';\nimport { DefaultModelScheduler } from './model.scheduler';\n\nconst EVENT_ON_TOKEN = '@LlamaCpp_onToken';\nconst MAX_MODELS = 5;\n\ntype TokenNativeEvent = {\n contextId: number;\n tokenResult: {\n token?: string;\n };\n};\n\n/** Prefer the plugin instance registered by src/index.ts. */\nconst getPlugin = (): LlamaCppPlugin => {\n const caps = Capacitor as unknown as {\n Plugins?: Record<string, LlamaCppPlugin>;\n getPlugin?: (name: string) => LlamaCppPlugin | undefined;\n };\n return (\n caps.Plugins?.LlamaCpp ??\n caps.getPlugin?.('LlamaCpp') ??\n registerPlugin<LlamaCppPlugin>('LlamaCpp')\n );\n};\n\nexport class NativeProvider implements LlmProvider {\n readonly platform = 'native' as const;\n private contextByModel = new Map<string, number>();\n private nextContextId = 1;\n private scheduler = new DefaultModelScheduler(MAX_MODELS);\n\n async initialize(opts: InitializeOptions): Promise<void> {\n await getPlugin().setContextLimit({ limit: MAX_MODELS });\n await this.loadModel(opts);\n }\n\n async loadModel(opts: InitializeOptions): Promise<void> {\n if (!opts.modelId) {\n throw new LlmError('INVALID_REQUEST', 'modelId is required');\n }\n if (!opts.modelPath) {\n throw new LlmError('INVALID_REQUEST', 'modelPath is required on native provider');\n }\n if (this.contextByModel.has(opts.modelId)) {\n return;\n }\n\n const modelBytes = typeof opts.modelBytes === 'number' ? opts.modelBytes : 0;\n const reserveBytes = typeof opts.reserveBytes === 'number' ? opts.reserveBytes : undefined;\n const memory = await this.getMemorySnapshot();\n if (typeof opts.availableMemoryBytes === 'number') {\n memory.freeBytes = opts.availableMemoryBytes;\n }\n if (typeof opts.totalMemoryBytes === 'number') {\n memory.totalBytes = opts.totalMemoryBytes;\n }\n this.scheduler.ensureCapacity(opts.modelId, modelBytes, memory, reserveBytes);\n\n const contextId = this.nextContextId++;\n await getPlugin().initContext({\n contextId,\n params: {\n model: opts.modelPath,\n n_ctx: opts.n_ctx,\n n_threads: opts.n_threads,\n embedding: opts.embedding,\n },\n });\n this.contextByModel.set(opts.modelId, contextId);\n this.scheduler.markLoaded(opts.modelId);\n }\n\n async unloadModel(modelId: string): Promise<void> {\n const contextId = this.contextByModel.get(modelId);\n if (contextId === undefined) {\n return;\n }\n await getPlugin().releaseContext({ contextId });\n this.contextByModel.delete(modelId);\n this.scheduler.markUnloaded(modelId);\n }\n\n async generate(req: GenerateRequest): Promise<GenerateResult> {\n const contextId = this.contextByModel.get(req.modelId);\n if (contextId === undefined) {\n throw new LlmError('MODEL_NOT_LOADED', `Model '${req.modelId}' is not loaded`);\n }\n const prompt = req.prompt ?? req.messages?.map((m) => `${m.role}: ${m.content}`).join('\\n');\n if (!prompt) {\n throw new LlmError('INVALID_REQUEST', 'prompt or messages is required');\n }\n\n const completion = await getPlugin().completion({\n contextId,\n params: {\n prompt,\n n_predict: req.max_tokens,\n temperature: req.temperature,\n emit_partial_completion: false,\n },\n });\n\n return {\n text: completion.content || completion.text || '',\n tokens_predicted: completion.tokens_predicted || 0,\n tokens_evaluated: completion.tokens_evaluated || 0,\n finish_reason: completion.stopped_limit ? 'length' : 'stop',\n };\n }\n\n async generateStream(req: GenerateRequest, onToken: (event: TokenEvent) => void): Promise<GenerateResult> {\n const contextId = this.contextByModel.get(req.modelId);\n if (contextId === undefined) {\n throw new LlmError('MODEL_NOT_LOADED', `Model '${req.modelId}' is not loaded`);\n }\n const prompt = req.prompt ?? req.messages?.map((m) => `${m.role}: ${m.content}`).join('\\n');\n if (!prompt) {\n throw new LlmError('INVALID_REQUEST', 'prompt or messages is required');\n }\n\n let tokenIndex = 0;\n const listener = await (getPlugin() as any).addListener(EVENT_ON_TOKEN, (evt: TokenNativeEvent) => {\n if (evt.contextId !== contextId) return;\n const token = evt.tokenResult?.token ?? '';\n if (!token) return;\n onToken({ modelId: req.modelId, token, index: tokenIndex++ });\n });\n\n try {\n const completion = await getPlugin().completion({\n contextId,\n params: {\n prompt,\n n_predict: req.max_tokens,\n temperature: req.temperature,\n emit_partial_completion: true,\n },\n });\n\n return {\n text: completion.content || completion.text || '',\n tokens_predicted: completion.tokens_predicted || 0,\n tokens_evaluated: completion.tokens_evaluated || 0,\n finish_reason: completion.stopped_limit ? 'length' : 'stop',\n };\n } finally {\n listener?.remove?.();\n }\n }\n\n async embed(req: EmbedRequest): Promise<EmbedResult> {\n const contextId = this.contextByModel.get(req.modelId);\n if (contextId === undefined) {\n throw new LlmError('MODEL_NOT_LOADED', `Model '${req.modelId}' is not loaded`);\n }\n\n const inputs = Array.isArray(req.input) ? req.input : [req.input];\n const vectors: number[][] = [];\n for (const text of inputs) {\n const res = await getPlugin().embedding({\n contextId,\n text,\n params: {},\n });\n vectors.push(res.embedding || []);\n }\n return { vectors };\n }\n\n async getMemorySnapshot(): Promise<MemorySnapshot> {\n const memoryFromPerformance = (globalThis as any)?.performance?.memory;\n if (memoryFromPerformance) {\n const totalBytes = Number(memoryFromPerformance.jsHeapSizeLimit);\n const usedBytes = Number(memoryFromPerformance.usedJSHeapSize);\n const freeBytes = Number(memoryFromPerformance.jsHeapSizeLimit - memoryFromPerformance.usedJSHeapSize);\n const usedRatio = totalBytes > 0 ? usedBytes / totalBytes : 0;\n const pressure = usedRatio >= 0.85 ? 'high' : usedRatio >= 0.7 ? 'medium' : 'low';\n return { totalBytes, usedBytes, freeBytes, pressure };\n }\n return { pressure: 'unknown' };\n }\n\n async health(): Promise<{ ok: boolean; details?: Record<string, unknown> }> {\n return {\n ok: true,\n details: {\n loadedModels: this.contextByModel.size,\n maxModels: MAX_MODELS,\n schedulerLoadedModels: this.scheduler.listLoaded().length,\n },\n };\n }\n}\n\n"]}
|
|
@@ -0,0 +1,88 @@
|
|
|
1
|
+
import type { EmbedRequest, EmbedResult, GenerateRequest, GenerateResult, InitializeOptions, LlmProvider, MemorySnapshot, PlatformKind, TokenEvent } from './provider.interface';
|
|
2
|
+
import type { DetokenizeResult, TokenizeResult } from '../workers/wasm.engine';
|
|
3
|
+
/** Verify that the browser supports everything the web WASM path needs. */
|
|
4
|
+
export declare function checkWasmCapabilities(): {
|
|
5
|
+
supported: boolean;
|
|
6
|
+
missing: string[];
|
|
7
|
+
};
|
|
8
|
+
/** Returns true only when COOP/COEP headers are set for WASM threads. */
|
|
9
|
+
export declare function checkCrossOriginIsolation(): boolean;
|
|
10
|
+
type WorkerFactory = () => Worker;
|
|
11
|
+
export declare class WebProvider implements LlmProvider {
|
|
12
|
+
private workerFactoryOverride?;
|
|
13
|
+
private static globalWorkerFactory?;
|
|
14
|
+
readonly platform: PlatformKind;
|
|
15
|
+
private loadedModelIds;
|
|
16
|
+
private worker;
|
|
17
|
+
private reqCounter;
|
|
18
|
+
private pending;
|
|
19
|
+
private scheduler;
|
|
20
|
+
constructor(workerFactoryOverride?: WorkerFactory | undefined);
|
|
21
|
+
static setWorkerFactory(factory?: WorkerFactory): void;
|
|
22
|
+
private resolveWorkerUrl;
|
|
23
|
+
private defaultWorkerFactory;
|
|
24
|
+
private ensureWorker;
|
|
25
|
+
private sendRequest;
|
|
26
|
+
initialize(opts: InitializeOptions): Promise<void>;
|
|
27
|
+
loadModel(opts: InitializeOptions): Promise<void>;
|
|
28
|
+
private readMeasuredFootprintFromWorker;
|
|
29
|
+
unloadModel(modelId: string): Promise<void>;
|
|
30
|
+
generate(req: GenerateRequest): Promise<GenerateResult>;
|
|
31
|
+
generateStream(req: GenerateRequest, onToken: (event: TokenEvent) => void): Promise<GenerateResult>;
|
|
32
|
+
embed(req: EmbedRequest): Promise<EmbedResult>;
|
|
33
|
+
getMemorySnapshot(): Promise<MemorySnapshot>;
|
|
34
|
+
/** Worker WASM linear memory + loaded-model registry (for scheduling UI). */
|
|
35
|
+
fetchWorkerMemory(): Promise<Record<string, unknown>>;
|
|
36
|
+
getWasmMemoryStatus(): Promise<Record<string, unknown>>;
|
|
37
|
+
tokenize(modelId: string, text: string): Promise<TokenizeResult>;
|
|
38
|
+
detokenize(modelId: string, tokens: number[]): Promise<DetokenizeResult>;
|
|
39
|
+
convertJsonSchemaToGrammar(schemaJson: string): Promise<string>;
|
|
40
|
+
private requireLoaded;
|
|
41
|
+
rerank(modelId: string, query: string, documents: string[]): Promise<Array<{
|
|
42
|
+
index: number;
|
|
43
|
+
score: number;
|
|
44
|
+
}>>;
|
|
45
|
+
bench(modelId: string, pp: number, tg: number, pl: number, nr: number): Promise<string>;
|
|
46
|
+
saveSession(modelId: string, filepath: string, tokenSize: number): Promise<number>;
|
|
47
|
+
loadSession(modelId: string, filepath: string): Promise<{
|
|
48
|
+
tokens_loaded: number;
|
|
49
|
+
prompt: string;
|
|
50
|
+
}>;
|
|
51
|
+
applyLoraAdapters(modelId: string, loraAdapters: Array<{
|
|
52
|
+
path: string;
|
|
53
|
+
scaled?: number;
|
|
54
|
+
}>): Promise<void>;
|
|
55
|
+
removeLoraAdapters(modelId: string): Promise<void>;
|
|
56
|
+
getLoadedLoraAdapters(modelId: string): Promise<Array<{
|
|
57
|
+
path: string;
|
|
58
|
+
scaled?: number;
|
|
59
|
+
}>>;
|
|
60
|
+
initMultimodal(modelId: string, path: string, useGpu?: boolean): Promise<boolean>;
|
|
61
|
+
isMultimodalEnabled(modelId: string): Promise<boolean>;
|
|
62
|
+
getMultimodalSupport(modelId: string): Promise<{
|
|
63
|
+
vision: boolean;
|
|
64
|
+
audio: boolean;
|
|
65
|
+
}>;
|
|
66
|
+
releaseMultimodal(modelId: string): Promise<void>;
|
|
67
|
+
initVocoder(modelId: string, path: string, nBatch?: number): Promise<boolean>;
|
|
68
|
+
isVocoderEnabled(modelId: string): Promise<boolean>;
|
|
69
|
+
releaseVocoder(modelId: string): Promise<void>;
|
|
70
|
+
getFormattedAudioCompletion(modelId: string, speaker: object | null, textToSpeak: string): Promise<{
|
|
71
|
+
prompt: string;
|
|
72
|
+
grammar?: string;
|
|
73
|
+
}>;
|
|
74
|
+
getAudioCompletionGuideTokens(modelId: string, textToSpeak: string): Promise<number[]>;
|
|
75
|
+
decodeAudioTokens(modelId: string, tokens: number[]): Promise<number[]>;
|
|
76
|
+
/**
|
|
77
|
+
* Terminate the worker mid-inference. WASM is single-threaded, so posting
|
|
78
|
+
* an abort message cannot be received while generate() is running. Worker
|
|
79
|
+
* termination is the only reliable interrupt. The model will need to be
|
|
80
|
+
* reloaded on the next generate() call.
|
|
81
|
+
*/
|
|
82
|
+
stopGeneration(): void;
|
|
83
|
+
health(): Promise<{
|
|
84
|
+
ok: boolean;
|
|
85
|
+
details?: Record<string, unknown>;
|
|
86
|
+
}>;
|
|
87
|
+
}
|
|
88
|
+
export {};
|