llama-cpp-pro 0.2.2
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/CHANGELOG.md +295 -0
- package/LICENSE +21 -0
- package/LlamaCpp.podspec +33 -0
- package/LlamaCppCapacitor.podspec +33 -0
- package/Package.swift +29 -0
- package/README.md +93 -0
- package/android/build.gradle +88 -0
- package/android/src/main/AndroidManifest.xml +4 -0
- package/android/src/main/CMakeLists-arm64.txt +138 -0
- package/android/src/main/CMakeLists-x86_64.txt +141 -0
- package/android/src/main/CMakeLists.txt +138 -0
- package/android/src/main/java/ai/annadata/plugin/capacitor/LlamaCpp.java +1340 -0
- package/android/src/main/java/ai/annadata/plugin/capacitor/LlamaCppPlugin.java +814 -0
- package/android/src/main/java/ai/annadata/plugin/capacitor/ModelAdmissionController.java +214 -0
- package/android/src/main/jni-chat-session.cpp +261 -0
- package/android/src/main/jni-lora.cpp +197 -0
- package/android/src/main/jni-multimodal.cpp +167 -0
- package/android/src/main/jni-tts.cpp +290 -0
- package/android/src/main/jni-utils.h +148 -0
- package/android/src/main/jni.cpp +1808 -0
- package/android/src/main/jniLibs/arm64-v8a/libllama-cpp-arm64.so +0 -0
- package/android/src/main/res/.gitkeep +0 -0
- package/build-native.sh +280 -0
- package/cmake/desktop-metal-embed.cmake +30 -0
- package/cmake/desktop-sources.cmake +100 -0
- package/cmake/ggml-backends.cmake +44 -0
- package/cpp/LICENSE +21 -0
- package/cpp/README.md +15 -0
- package/cpp/anyascii.c +22223 -0
- package/cpp/anyascii.h +42 -0
- package/cpp/cap-completion.cpp +942 -0
- package/cpp/cap-completion.h +127 -0
- package/cpp/cap-embedding.cpp +193 -0
- package/cpp/cap-embedding.h +35 -0
- package/cpp/cap-ios-bridge.cpp +1810 -0
- package/cpp/cap-ios-bridge.h +61 -0
- package/cpp/cap-llama.cpp +412 -0
- package/cpp/cap-llama.h +161 -0
- package/cpp/cap-mtmd.hpp +602 -0
- package/cpp/cap-native-server.cpp +1095 -0
- package/cpp/cap-native-server.h +40 -0
- package/cpp/cap-tts.cpp +591 -0
- package/cpp/cap-tts.h +59 -0
- package/cpp/cap-wasm-fs.cpp +156 -0
- package/cpp/cap-wasm-jspi.cpp +19 -0
- package/cpp/cap-wasm-jspi.h +30 -0
- package/cpp/cap-wasm-vfs.cpp +22 -0
- package/cpp/chat-parser.cpp +393 -0
- package/cpp/chat-parser.h +120 -0
- package/cpp/chat.cpp +2315 -0
- package/cpp/chat.h +221 -0
- package/cpp/common.cpp +1664 -0
- package/cpp/common.h +744 -0
- package/cpp/ggml-alloc.c +1028 -0
- package/cpp/ggml-alloc.h +76 -0
- package/cpp/ggml-backend-impl.h +255 -0
- package/cpp/ggml-backend-reg.cpp +600 -0
- package/cpp/ggml-backend.cpp +2121 -0
- package/cpp/ggml-backend.h +354 -0
- package/cpp/ggml-common.h +1878 -0
- package/cpp/ggml-cpp.h +39 -0
- package/cpp/ggml-cpu/amx/amx.cpp +221 -0
- package/cpp/ggml-cpu/amx/amx.h +8 -0
- package/cpp/ggml-cpu/amx/common.h +91 -0
- package/cpp/ggml-cpu/amx/mmq.cpp +2512 -0
- package/cpp/ggml-cpu/amx/mmq.h +10 -0
- package/cpp/ggml-cpu/arch/arm/cpu-feats.cpp +94 -0
- package/cpp/ggml-cpu/arch/arm/quants.c +3650 -0
- package/cpp/ggml-cpu/arch/arm/repack.cpp +1891 -0
- package/cpp/ggml-cpu/arch/x86/cpu-feats.cpp +327 -0
- package/cpp/ggml-cpu/arch/x86/quants.c +3820 -0
- package/cpp/ggml-cpu/arch/x86/repack.cpp +6307 -0
- package/cpp/ggml-cpu/arch-fallback.h +215 -0
- package/cpp/ggml-cpu/binary-ops.cpp +158 -0
- package/cpp/ggml-cpu/binary-ops.h +16 -0
- package/cpp/ggml-cpu/common.h +73 -0
- package/cpp/ggml-cpu/ggml-cpu-impl.h +559 -0
- package/cpp/ggml-cpu/ggml-cpu.c +3578 -0
- package/cpp/ggml-cpu/ggml-cpu.cpp +672 -0
- package/cpp/ggml-cpu/ops.cpp +10587 -0
- package/cpp/ggml-cpu/ops.h +114 -0
- package/cpp/ggml-cpu/quants.c +1193 -0
- package/cpp/ggml-cpu/quants.h +97 -0
- package/cpp/ggml-cpu/repack.cpp +1982 -0
- package/cpp/ggml-cpu/repack.h +120 -0
- package/cpp/ggml-cpu/simd-mappings.h +1184 -0
- package/cpp/ggml-cpu/traits.cpp +36 -0
- package/cpp/ggml-cpu/traits.h +38 -0
- package/cpp/ggml-cpu/unary-ops.cpp +186 -0
- package/cpp/ggml-cpu/unary-ops.h +28 -0
- package/cpp/ggml-cpu/vec.cpp +348 -0
- package/cpp/ggml-cpu/vec.h +1121 -0
- package/cpp/ggml-cpu.h +145 -0
- package/cpp/ggml-impl.h +622 -0
- package/cpp/ggml-metal-impl.h +688 -0
- package/cpp/ggml-metal.h +66 -0
- package/cpp/ggml-metal.m +6833 -0
- package/cpp/ggml-metal.metal +10754 -0
- package/cpp/ggml-opt.cpp +1093 -0
- package/cpp/ggml-opt.h +256 -0
- package/cpp/ggml-quants.c +5324 -0
- package/cpp/ggml-quants.h +106 -0
- package/cpp/ggml-threading.cpp +12 -0
- package/cpp/ggml-threading.h +14 -0
- package/cpp/ggml.c +7108 -0
- package/cpp/ggml.h +2492 -0
- package/cpp/gguf.cpp +1358 -0
- package/cpp/gguf.h +202 -0
- package/cpp/json-partial.cpp +256 -0
- package/cpp/json-partial.h +38 -0
- package/cpp/json-schema-to-grammar.cpp +985 -0
- package/cpp/json-schema-to-grammar.h +21 -0
- package/cpp/llama-adapter.cpp +388 -0
- package/cpp/llama-adapter.h +76 -0
- package/cpp/llama-arch.cpp +2355 -0
- package/cpp/llama-arch.h +499 -0
- package/cpp/llama-batch.cpp +875 -0
- package/cpp/llama-batch.h +160 -0
- package/cpp/llama-chat.cpp +783 -0
- package/cpp/llama-chat.h +65 -0
- package/cpp/llama-context.cpp +2788 -0
- package/cpp/llama-context.h +306 -0
- package/cpp/llama-cparams.cpp +5 -0
- package/cpp/llama-cparams.h +41 -0
- package/cpp/llama-cpp.h +30 -0
- package/cpp/llama-grammar.cpp +1229 -0
- package/cpp/llama-grammar.h +173 -0
- package/cpp/llama-graph.cpp +1891 -0
- package/cpp/llama-graph.h +810 -0
- package/cpp/llama-hparams.cpp +180 -0
- package/cpp/llama-hparams.h +233 -0
- package/cpp/llama-impl.cpp +167 -0
- package/cpp/llama-impl.h +61 -0
- package/cpp/llama-io.cpp +15 -0
- package/cpp/llama-io.h +35 -0
- package/cpp/llama-kv-cache-iswa.cpp +318 -0
- package/cpp/llama-kv-cache-iswa.h +135 -0
- package/cpp/llama-kv-cache.cpp +2059 -0
- package/cpp/llama-kv-cache.h +374 -0
- package/cpp/llama-kv-cells.h +491 -0
- package/cpp/llama-memory-hybrid.cpp +258 -0
- package/cpp/llama-memory-hybrid.h +137 -0
- package/cpp/llama-memory-recurrent.cpp +1146 -0
- package/cpp/llama-memory-recurrent.h +179 -0
- package/cpp/llama-memory.cpp +59 -0
- package/cpp/llama-memory.h +119 -0
- package/cpp/llama-mmap.cpp +609 -0
- package/cpp/llama-mmap.h +68 -0
- package/cpp/llama-model-loader.cpp +1166 -0
- package/cpp/llama-model-loader.h +170 -0
- package/cpp/llama-model-saver.cpp +282 -0
- package/cpp/llama-model-saver.h +37 -0
- package/cpp/llama-model.cpp +19061 -0
- package/cpp/llama-model.h +491 -0
- package/cpp/llama-sampling.cpp +2575 -0
- package/cpp/llama-sampling.h +32 -0
- package/cpp/llama-vocab.cpp +3792 -0
- package/cpp/llama-vocab.h +176 -0
- package/cpp/llama.cpp +358 -0
- package/cpp/llama.h +1373 -0
- package/cpp/log.cpp +428 -0
- package/cpp/log.h +103 -0
- package/cpp/minja/chat-template.hpp +550 -0
- package/cpp/minja/minja.hpp +3009 -0
- package/cpp/nlohmann/json.hpp +25526 -0
- package/cpp/nlohmann/json_fwd.hpp +187 -0
- package/cpp/regex-partial.cpp +204 -0
- package/cpp/regex-partial.h +56 -0
- package/cpp/sampling.cpp +579 -0
- package/cpp/sampling.h +107 -0
- package/cpp/tools/mtmd/clip-impl.h +473 -0
- package/cpp/tools/mtmd/clip.cpp +4322 -0
- package/cpp/tools/mtmd/clip.h +106 -0
- package/cpp/tools/mtmd/miniaudio/miniaudio.h +93468 -0
- package/cpp/tools/mtmd/mtmd-audio.cpp +769 -0
- package/cpp/tools/mtmd/mtmd-audio.h +47 -0
- package/cpp/tools/mtmd/mtmd-helper.cpp +460 -0
- package/cpp/tools/mtmd/mtmd-helper.h +95 -0
- package/cpp/tools/mtmd/mtmd.cpp +1066 -0
- package/cpp/tools/mtmd/mtmd.h +302 -0
- package/cpp/tools/mtmd/stb/stb_image.h +7988 -0
- package/cpp/unicode-data.cpp +7034 -0
- package/cpp/unicode-data.h +20 -0
- package/cpp/unicode.cpp +1061 -0
- package/cpp/unicode.h +68 -0
- package/cpp/vendor/cpp-httplib/httplib.cpp +16509 -0
- package/cpp/vendor/cpp-httplib/httplib.h +3883 -0
- package/desktop/electron-builder.config.cjs +157 -0
- package/desktop/entitlements.mac.plist +12 -0
- package/desktop/package.json +11 -0
- package/desktop/resolve-package-root.cjs +88 -0
- package/desktop/src/main/backend-selector.cjs +148 -0
- package/desktop/src/main/gpu-probe.cjs +142 -0
- package/desktop/src/main/index.cjs +58 -0
- package/desktop/src/main/ipc-handlers.cjs +212 -0
- package/desktop/src/main/model-store.cjs +50 -0
- package/desktop/src/main/preload.cjs +39 -0
- package/desktop/src/main/sidecar-client.cjs +76 -0
- package/desktop/src/main/sidecar-manager.cjs +364 -0
- package/dist/docs.json +14357 -0
- package/dist/esm/definitions.d.ts +731 -0
- package/dist/esm/definitions.js +2 -0
- package/dist/esm/definitions.js.map +1 -0
- package/dist/esm/desktop.d.ts +37 -0
- package/dist/esm/desktop.js +133 -0
- package/dist/esm/desktop.js.map +1 -0
- package/dist/esm/index.d.ts +200 -0
- package/dist/esm/index.js +612 -0
- package/dist/esm/index.js.map +1 -0
- package/dist/esm/isomorphic/desktop.runtime.d.ts +37 -0
- package/dist/esm/isomorphic/desktop.runtime.js +36 -0
- package/dist/esm/isomorphic/desktop.runtime.js.map +1 -0
- package/dist/esm/isomorphic/errors.d.ts +6 -0
- package/dist/esm/isomorphic/errors.js +9 -0
- package/dist/esm/isomorphic/errors.js.map +1 -0
- package/dist/esm/isomorphic/model.admission.d.ts +17 -0
- package/dist/esm/isomorphic/model.admission.js +27 -0
- package/dist/esm/isomorphic/model.admission.js.map +1 -0
- package/dist/esm/isomorphic/model.scheduler.d.ts +31 -0
- package/dist/esm/isomorphic/model.scheduler.js +95 -0
- package/dist/esm/isomorphic/model.scheduler.js.map +1 -0
- package/dist/esm/isomorphic/provider.desktop.d.ts +40 -0
- package/dist/esm/isomorphic/provider.desktop.js +411 -0
- package/dist/esm/isomorphic/provider.desktop.js.map +1 -0
- package/dist/esm/isomorphic/provider.factory.d.ts +2 -0
- package/dist/esm/isomorphic/provider.factory.js +16 -0
- package/dist/esm/isomorphic/provider.factory.js.map +1 -0
- package/dist/esm/isomorphic/provider.interface.d.ts +76 -0
- package/dist/esm/isomorphic/provider.interface.js +2 -0
- package/dist/esm/isomorphic/provider.interface.js.map +1 -0
- package/dist/esm/isomorphic/provider.native.d.ts +18 -0
- package/dist/esm/isomorphic/provider.native.js +173 -0
- package/dist/esm/isomorphic/provider.native.js.map +1 -0
- package/dist/esm/isomorphic/provider.web.d.ts +88 -0
- package/dist/esm/isomorphic/provider.web.js +573 -0
- package/dist/esm/isomorphic/provider.web.js.map +1 -0
- package/dist/esm/isomorphic/sidecar-sse.d.ts +14 -0
- package/dist/esm/isomorphic/sidecar-sse.js +76 -0
- package/dist/esm/isomorphic/sidecar-sse.js.map +1 -0
- package/dist/esm/isomorphic/wasmMemoryCalibration.d.ts +26 -0
- package/dist/esm/isomorphic/wasmMemoryCalibration.js +60 -0
- package/dist/esm/isomorphic/wasmMemoryCalibration.js.map +1 -0
- package/dist/esm/isomorphic/wasmMemoryPolicy.d.ts +55 -0
- package/dist/esm/isomorphic/wasmMemoryPolicy.js +93 -0
- package/dist/esm/isomorphic/wasmMemoryPolicy.js.map +1 -0
- package/dist/esm/storage/manifest.d.ts +13 -0
- package/dist/esm/storage/manifest.js +87 -0
- package/dist/esm/storage/manifest.js.map +1 -0
- package/dist/esm/storage/opfs.store.d.ts +31 -0
- package/dist/esm/storage/opfs.store.js +241 -0
- package/dist/esm/storage/opfs.store.js.map +1 -0
- package/dist/esm/web.d.ts +206 -0
- package/dist/esm/web.js +521 -0
- package/dist/esm/web.js.map +1 -0
- package/dist/esm/workers/async-file.d.ts +13 -0
- package/dist/esm/workers/async-file.js +12 -0
- package/dist/esm/workers/async-file.js.map +1 -0
- package/dist/esm/workers/heapfs.d.ts +55 -0
- package/dist/esm/workers/heapfs.js +115 -0
- package/dist/esm/workers/heapfs.js.map +1 -0
- package/dist/esm/workers/wasm.engine.d.ts +86 -0
- package/dist/esm/workers/wasm.engine.js +504 -0
- package/dist/esm/workers/wasm.engine.js.map +1 -0
- package/dist/esm/workers/worker.protocol.d.ts +160 -0
- package/dist/esm/workers/worker.protocol.js +2 -0
- package/dist/esm/workers/worker.protocol.js.map +1 -0
- package/dist/plugin.cjs +3179 -0
- package/dist/plugin.cjs.map +1 -0
- package/dist/plugin.js +3181 -0
- package/dist/plugin.js.map +1 -0
- package/dist/wasm/llama_engine.d.ts +74 -0
- package/dist/wasm/llama_engine.js +1829 -0
- package/dist/wasm/llama_engine.wasm +0 -0
- package/dist/wasm/llama_engine_emscripten.mjs +2 -0
- package/dist/wasm/package.json +16 -0
- package/dist/workers/llm.worker.js +1226 -0
- package/dist/workers/llm.worker.js.map +7 -0
- package/extraResources/llama-wasm/llama_engine.d.ts +74 -0
- package/extraResources/llama-wasm/llama_engine.js +1829 -0
- package/extraResources/llama-wasm/llama_engine.wasm +0 -0
- package/extraResources/llama-wasm/llama_engine_emscripten.mjs +2 -0
- package/extraResources/llama-wasm/package.json +16 -0
- package/extraResources/sidecar/README.md +11 -0
- package/extraResources/sidecar/darwin-arm64 +0 -0
- package/extraResources/sidecar/darwin-x64 +0 -0
- package/ios/CMakeLists-arm64.txt +161 -0
- package/ios/CMakeLists-x86_64.txt +188 -0
- package/ios/CMakeLists.txt +161 -0
- package/ios/Frameworks/llama-cpp.framework/Info.plist +28 -0
- package/ios/Frameworks/llama-cpp.framework/llama-cpp +0 -0
- package/ios/Sources/LlamaCppCapacitor/LlamaCpp.swift +1365 -0
- package/ios/Sources/LlamaCppCapacitor/LlamaCppPlugin.swift +694 -0
- package/ios/Sources/LlamaCppCapacitor/LlamaNativeBridge.swift +349 -0
- package/ios/Sources/LlamaCppCapacitor/ModelAdmissionController.swift +177 -0
- package/ios/embed-metal-shaders.sh +24 -0
- package/ios/metal-embed.cmake +29 -0
- package/package.json +281 -0
- package/scripts/build-js-preserve-wasm.cjs +53 -0
- package/scripts/build-sidecar-linux.sh +6 -0
- package/scripts/build-sidecar-win.bat +19 -0
- package/scripts/build-sidecar.sh +184 -0
- package/scripts/embed-llama-ios-app-framework.sh +63 -0
- package/scripts/ensure-desktop-sidecar-bundle.cjs +103 -0
- package/scripts/ensure-llama-ios-xcframework.sh +108 -0
- package/scripts/fix-esm-extensions.cjs +45 -0
- package/scripts/prepare-js-dist.cjs +28 -0
- package/scripts/stage-desktop-resources.cjs +116 -0
- package/sidecar/CMakeLists.txt +192 -0
- package/sidecar/cap-sidecar-main.cpp +68 -0
- package/types/llama-cpp-pro.d.ts +441 -0
|
@@ -0,0 +1,180 @@
|
|
|
1
|
+
#include "llama-hparams.h"
|
|
2
|
+
|
|
3
|
+
#include "ggml.h"
|
|
4
|
+
|
|
5
|
+
void llama_hparams::set_swa_pattern(uint32_t n_pattern, bool dense_first) {
|
|
6
|
+
if (dense_first) {
|
|
7
|
+
for (uint32_t il = 0; il < n_layer; ++il) {
|
|
8
|
+
swa_layers[il] = n_pattern == 0 || (il % n_pattern != 0);
|
|
9
|
+
}
|
|
10
|
+
} else {
|
|
11
|
+
for (uint32_t il = 0; il < n_layer; ++il) {
|
|
12
|
+
swa_layers[il] = n_pattern == 0 || (il % n_pattern < (n_pattern - 1));
|
|
13
|
+
}
|
|
14
|
+
}
|
|
15
|
+
}
|
|
16
|
+
|
|
17
|
+
bool llama_hparams::is_swa_any() const {
|
|
18
|
+
for (uint32_t il = 0; il < n_layer; ++il) {
|
|
19
|
+
if (swa_layers[il]) {
|
|
20
|
+
return true;
|
|
21
|
+
}
|
|
22
|
+
}
|
|
23
|
+
|
|
24
|
+
return false;
|
|
25
|
+
}
|
|
26
|
+
|
|
27
|
+
uint32_t llama_hparams::n_head(uint32_t il) const {
|
|
28
|
+
if (il < n_layer) {
|
|
29
|
+
return n_head_arr[il];
|
|
30
|
+
}
|
|
31
|
+
|
|
32
|
+
LM_GGML_ABORT("fatal error");
|
|
33
|
+
}
|
|
34
|
+
|
|
35
|
+
uint32_t llama_hparams::n_head_kv(uint32_t il) const {
|
|
36
|
+
if (il < n_layer) {
|
|
37
|
+
return n_head_kv_arr[il];
|
|
38
|
+
}
|
|
39
|
+
|
|
40
|
+
LM_GGML_ABORT("fatal error");
|
|
41
|
+
}
|
|
42
|
+
|
|
43
|
+
uint32_t llama_hparams::n_ff(uint32_t il) const {
|
|
44
|
+
if (il < n_layer) {
|
|
45
|
+
return n_ff_arr[il];
|
|
46
|
+
}
|
|
47
|
+
|
|
48
|
+
LM_GGML_ABORT("fatal error");
|
|
49
|
+
}
|
|
50
|
+
|
|
51
|
+
uint32_t llama_hparams::n_gqa(uint32_t il) const {
|
|
52
|
+
const uint32_t n_head = this->n_head(il);
|
|
53
|
+
const uint32_t n_head_kv = this->n_head_kv(il);
|
|
54
|
+
|
|
55
|
+
if (n_head_kv == 0) {
|
|
56
|
+
return 0;
|
|
57
|
+
}
|
|
58
|
+
|
|
59
|
+
return n_head/n_head_kv;
|
|
60
|
+
}
|
|
61
|
+
|
|
62
|
+
uint32_t llama_hparams::n_embd_k_gqa(uint32_t il) const {
|
|
63
|
+
const uint32_t n_head_kv = this->n_head_kv(il);
|
|
64
|
+
|
|
65
|
+
return n_embd_head_k * n_head_kv;
|
|
66
|
+
}
|
|
67
|
+
|
|
68
|
+
uint32_t llama_hparams::n_embd_v_gqa(uint32_t il) const {
|
|
69
|
+
const uint32_t n_head_kv = this->n_head_kv(il);
|
|
70
|
+
|
|
71
|
+
return n_embd_head_v * n_head_kv;
|
|
72
|
+
}
|
|
73
|
+
|
|
74
|
+
bool llama_hparams::is_n_embd_k_gqa_variable() const {
|
|
75
|
+
const uint32_t val = n_embd_k_gqa();
|
|
76
|
+
for (uint32_t il = 0; il < n_layer; ++il) {
|
|
77
|
+
if (val != n_embd_k_gqa(il)) {
|
|
78
|
+
return true;
|
|
79
|
+
}
|
|
80
|
+
}
|
|
81
|
+
|
|
82
|
+
return false;
|
|
83
|
+
}
|
|
84
|
+
|
|
85
|
+
bool llama_hparams::is_n_embd_v_gqa_variable() const {
|
|
86
|
+
const uint32_t val = n_embd_v_gqa();
|
|
87
|
+
for (uint32_t il = 0; il < n_layer; ++il) {
|
|
88
|
+
if (val != n_embd_v_gqa(il)) {
|
|
89
|
+
return true;
|
|
90
|
+
}
|
|
91
|
+
}
|
|
92
|
+
|
|
93
|
+
return false;
|
|
94
|
+
}
|
|
95
|
+
|
|
96
|
+
uint32_t llama_hparams::n_embd_k_gqa_max() const {
|
|
97
|
+
uint32_t val = n_embd_k_gqa();
|
|
98
|
+
for (uint32_t il = 0; il < n_layer; ++il) {
|
|
99
|
+
val = std::max(val, n_embd_k_gqa(il));
|
|
100
|
+
}
|
|
101
|
+
|
|
102
|
+
return val;
|
|
103
|
+
}
|
|
104
|
+
|
|
105
|
+
uint32_t llama_hparams::n_embd_v_gqa_max() const {
|
|
106
|
+
uint32_t val = n_embd_v_gqa();
|
|
107
|
+
for (uint32_t il = 0; il < n_layer; ++il) {
|
|
108
|
+
val = std::max(val, n_embd_v_gqa(il));
|
|
109
|
+
}
|
|
110
|
+
|
|
111
|
+
return val;
|
|
112
|
+
}
|
|
113
|
+
|
|
114
|
+
uint32_t llama_hparams::n_embd_r() const {
|
|
115
|
+
if (wkv_head_size != 0) {
|
|
116
|
+
// for RWKV models
|
|
117
|
+
return token_shift_count * n_embd;
|
|
118
|
+
}
|
|
119
|
+
|
|
120
|
+
if (n_shortconv_l_cache != 0) {
|
|
121
|
+
// for LFM2 models
|
|
122
|
+
return n_embd * (n_shortconv_l_cache - 1);
|
|
123
|
+
}
|
|
124
|
+
|
|
125
|
+
// TODO: maybe support other convolution strides than 1
|
|
126
|
+
// NOTE: since the first column of the conv_state is shifted out each time, it's not actually needed
|
|
127
|
+
// Corresponds to Mamba's conv_states size
|
|
128
|
+
return (ssm_d_conv > 0 ? ssm_d_conv - 1 : 0) * (ssm_d_inner + 2*ssm_n_group*ssm_d_state);
|
|
129
|
+
}
|
|
130
|
+
|
|
131
|
+
uint32_t llama_hparams::n_embd_s() const {
|
|
132
|
+
if (wkv_head_size != 0) {
|
|
133
|
+
// corresponds to RWKV's wkv_states size
|
|
134
|
+
return n_embd * wkv_head_size;
|
|
135
|
+
}
|
|
136
|
+
|
|
137
|
+
// corresponds to Mamba's ssm_states size
|
|
138
|
+
return ssm_d_state * ssm_d_inner;
|
|
139
|
+
}
|
|
140
|
+
|
|
141
|
+
bool llama_hparams::is_recurrent(uint32_t il) const {
|
|
142
|
+
return recurrent_layer_arr[il];
|
|
143
|
+
}
|
|
144
|
+
|
|
145
|
+
uint32_t llama_hparams::n_pos_per_embd() const {
|
|
146
|
+
return rope_type == LLAMA_ROPE_TYPE_MROPE ? 4 : 1;
|
|
147
|
+
}
|
|
148
|
+
|
|
149
|
+
bool llama_hparams::is_swa(uint32_t il) const {
|
|
150
|
+
if (il < n_layer) {
|
|
151
|
+
return swa_layers[il];
|
|
152
|
+
}
|
|
153
|
+
|
|
154
|
+
LM_GGML_ABORT("fatal error");
|
|
155
|
+
}
|
|
156
|
+
|
|
157
|
+
bool llama_hparams::has_kv(uint32_t il) const {
|
|
158
|
+
if (n_layer_kv_from_start >= 0) {
|
|
159
|
+
if (il < (uint32_t) n_layer_kv_from_start) {
|
|
160
|
+
return true;
|
|
161
|
+
}
|
|
162
|
+
|
|
163
|
+
return false;
|
|
164
|
+
}
|
|
165
|
+
|
|
166
|
+
// by default, all layers have kv
|
|
167
|
+
return true;
|
|
168
|
+
}
|
|
169
|
+
|
|
170
|
+
uint32_t llama_hparams::n_layer_kv() const {
|
|
171
|
+
uint32_t res = 0;
|
|
172
|
+
|
|
173
|
+
for (uint32_t il = 0; il < n_layer; ++il) {
|
|
174
|
+
if (has_kv(il)) {
|
|
175
|
+
res++;
|
|
176
|
+
}
|
|
177
|
+
}
|
|
178
|
+
|
|
179
|
+
return res;
|
|
180
|
+
}
|
|
@@ -0,0 +1,233 @@
|
|
|
1
|
+
#pragma once
|
|
2
|
+
|
|
3
|
+
#include "llama.h"
|
|
4
|
+
|
|
5
|
+
#include <array>
|
|
6
|
+
|
|
7
|
+
// bump if necessary
|
|
8
|
+
#define LLAMA_MAX_LAYERS 512
|
|
9
|
+
#define LLAMA_MAX_EXPERTS 384 // Kimi-K2
|
|
10
|
+
|
|
11
|
+
enum llama_expert_gating_func_type {
|
|
12
|
+
LLAMA_EXPERT_GATING_FUNC_TYPE_NONE = 0,
|
|
13
|
+
LLAMA_EXPERT_GATING_FUNC_TYPE_SOFTMAX = 1,
|
|
14
|
+
LLAMA_EXPERT_GATING_FUNC_TYPE_SIGMOID = 2,
|
|
15
|
+
LLAMA_EXPERT_GATING_FUNC_TYPE_SOFTMAX_WEIGHT = 3, // applied to the router weights instead of the logits
|
|
16
|
+
};
|
|
17
|
+
|
|
18
|
+
enum llama_swa_type {
|
|
19
|
+
LLAMA_SWA_TYPE_NONE = 0,
|
|
20
|
+
LLAMA_SWA_TYPE_STANDARD = 1,
|
|
21
|
+
LLAMA_SWA_TYPE_CHUNKED = 2,
|
|
22
|
+
};
|
|
23
|
+
|
|
24
|
+
struct llama_hparams_posnet {
|
|
25
|
+
uint32_t n_embd;
|
|
26
|
+
uint32_t n_layer;
|
|
27
|
+
};
|
|
28
|
+
|
|
29
|
+
struct llama_hparams_convnext {
|
|
30
|
+
uint32_t n_embd;
|
|
31
|
+
uint32_t n_layer;
|
|
32
|
+
};
|
|
33
|
+
|
|
34
|
+
struct llama_hparams {
|
|
35
|
+
bool vocab_only;
|
|
36
|
+
bool rope_finetuned;
|
|
37
|
+
bool use_par_res;
|
|
38
|
+
bool swin_norm;
|
|
39
|
+
|
|
40
|
+
uint32_t n_ctx_train; // context size the model was trained on
|
|
41
|
+
uint32_t n_embd;
|
|
42
|
+
uint32_t n_embd_features = 0;
|
|
43
|
+
uint32_t n_layer;
|
|
44
|
+
int32_t n_layer_kv_from_start = -1; // if non-negative, the first n_layer_kv_from_start layers have KV cache
|
|
45
|
+
uint32_t n_rot;
|
|
46
|
+
uint32_t n_embd_head_k; // dimension of keys (d_k). d_q is assumed to be the same, but there are n_head q heads, and only n_head_kv k-v heads
|
|
47
|
+
uint32_t n_embd_head_v; // dimension of values (d_v) aka n_embd_head
|
|
48
|
+
uint32_t n_expert = 0;
|
|
49
|
+
uint32_t n_expert_used = 0;
|
|
50
|
+
uint32_t n_rel_attn_bkts = 0;
|
|
51
|
+
|
|
52
|
+
// note: deepseek2 using MLA converts into MQA with larger heads, then decompresses to MHA
|
|
53
|
+
uint32_t n_embd_head_k_mla = 0;
|
|
54
|
+
uint32_t n_embd_head_v_mla = 0;
|
|
55
|
+
|
|
56
|
+
// for WavTokenizer
|
|
57
|
+
struct llama_hparams_posnet posnet;
|
|
58
|
+
struct llama_hparams_convnext convnext;
|
|
59
|
+
|
|
60
|
+
uint32_t n_shortconv_l_cache = 0;
|
|
61
|
+
|
|
62
|
+
std::array<uint32_t, LLAMA_MAX_LAYERS> n_head_arr;
|
|
63
|
+
std::array<uint32_t, LLAMA_MAX_LAYERS> n_head_kv_arr;
|
|
64
|
+
std::array<uint32_t, LLAMA_MAX_LAYERS> n_ff_arr;
|
|
65
|
+
|
|
66
|
+
uint32_t n_layer_dense_lead = 0;
|
|
67
|
+
uint32_t n_lora_q = 0;
|
|
68
|
+
uint32_t n_lora_kv = 0;
|
|
69
|
+
uint32_t n_ff_exp = 0;
|
|
70
|
+
uint32_t n_ff_shexp = 0;
|
|
71
|
+
uint32_t n_expert_shared = 0;
|
|
72
|
+
uint32_t n_norm_groups = 0;
|
|
73
|
+
|
|
74
|
+
float expert_weights_scale = 0.0;
|
|
75
|
+
bool expert_weights_norm = false;
|
|
76
|
+
uint32_t expert_gating_func = LLAMA_EXPERT_GATING_FUNC_TYPE_NONE;
|
|
77
|
+
uint32_t moe_every_n_layers = 0;
|
|
78
|
+
uint32_t nextn_predict_layers = 0;
|
|
79
|
+
|
|
80
|
+
float f_norm_eps;
|
|
81
|
+
float f_norm_rms_eps;
|
|
82
|
+
float f_norm_group_eps;
|
|
83
|
+
|
|
84
|
+
float f_attn_logit_softcapping = 50.0f;
|
|
85
|
+
float f_final_logit_softcapping = 30.0f;
|
|
86
|
+
|
|
87
|
+
// for RWKV
|
|
88
|
+
uint32_t rescale_every_n_layers = 0;
|
|
89
|
+
uint32_t time_mix_extra_dim = 0;
|
|
90
|
+
uint32_t time_decay_extra_dim = 0;
|
|
91
|
+
uint32_t wkv_head_size = 0;
|
|
92
|
+
uint32_t token_shift_count = 2;
|
|
93
|
+
uint32_t n_lora_decay = 0;
|
|
94
|
+
uint32_t n_lora_iclr = 0;
|
|
95
|
+
uint32_t n_lora_value_res_mix = 0;
|
|
96
|
+
uint32_t n_lora_gate = 0;
|
|
97
|
+
|
|
98
|
+
float rope_attn_factor = 1.0f;
|
|
99
|
+
float rope_freq_base_train;
|
|
100
|
+
float rope_freq_base_train_swa;
|
|
101
|
+
float rope_freq_scale_train;
|
|
102
|
+
float rope_freq_scale_train_swa;
|
|
103
|
+
uint32_t n_ctx_orig_yarn;
|
|
104
|
+
float rope_yarn_log_mul = 0.0f;
|
|
105
|
+
|
|
106
|
+
std::array<int, 4> rope_sections;
|
|
107
|
+
|
|
108
|
+
// Sliding Window Attention (SWA)
|
|
109
|
+
llama_swa_type swa_type = LLAMA_SWA_TYPE_NONE;
|
|
110
|
+
// the size of the sliding window (0 - no SWA)
|
|
111
|
+
uint32_t n_swa = 0;
|
|
112
|
+
// if swa_layers[il] == true, then layer il is SWA
|
|
113
|
+
// if swa_layers[il] == false, then layer il is dense (i.e. non-SWA)
|
|
114
|
+
// by default, all layers are dense
|
|
115
|
+
std::array<bool, LLAMA_MAX_LAYERS> swa_layers;
|
|
116
|
+
|
|
117
|
+
// for State Space Models
|
|
118
|
+
uint32_t ssm_d_conv = 0;
|
|
119
|
+
uint32_t ssm_d_inner = 0;
|
|
120
|
+
uint32_t ssm_d_state = 0;
|
|
121
|
+
uint32_t ssm_dt_rank = 0;
|
|
122
|
+
uint32_t ssm_n_group = 0;
|
|
123
|
+
|
|
124
|
+
// for hybrid state space models
|
|
125
|
+
std::array<bool, LLAMA_MAX_LAYERS> recurrent_layer_arr;
|
|
126
|
+
|
|
127
|
+
bool ssm_dt_b_c_rms = false;
|
|
128
|
+
|
|
129
|
+
float f_clamp_kqv = 0.0f;
|
|
130
|
+
float f_max_alibi_bias = 0.0f;
|
|
131
|
+
float f_logit_scale = 0.0f;
|
|
132
|
+
|
|
133
|
+
// Additional scale factors (Granite/Granite MoE)
|
|
134
|
+
float f_residual_scale = 0.0f;
|
|
135
|
+
float f_embedding_scale = 0.0f;
|
|
136
|
+
float f_attention_scale = 0.0f;
|
|
137
|
+
|
|
138
|
+
bool causal_attn = true;
|
|
139
|
+
bool use_alibi = false;
|
|
140
|
+
bool attn_soft_cap = false;
|
|
141
|
+
bool use_kq_norm = true;
|
|
142
|
+
|
|
143
|
+
// for Classifiers
|
|
144
|
+
uint32_t n_cls_out = 1;
|
|
145
|
+
|
|
146
|
+
// llama4 smallthinker
|
|
147
|
+
uint32_t n_moe_layer_step = 0;
|
|
148
|
+
uint32_t n_no_rope_layer_step = 4;
|
|
149
|
+
uint32_t n_attn_temp_floor_scale = 8192;
|
|
150
|
+
float f_attn_temp_scale = 0.1;
|
|
151
|
+
|
|
152
|
+
// gemma3n altup
|
|
153
|
+
uint32_t n_altup = 4; // altup_num_inputs
|
|
154
|
+
uint32_t i_altup_act = 0; // altup_active_idx
|
|
155
|
+
uint32_t laurel_rank = 64;
|
|
156
|
+
uint32_t n_embd_altup = 256;
|
|
157
|
+
|
|
158
|
+
// needed by encoder-decoder models (e.g. T5, FLAN-T5)
|
|
159
|
+
// ref: https://github.com/ggerganov/llama.cpp/pull/8141
|
|
160
|
+
llama_token dec_start_token_id = LLAMA_TOKEN_NULL;
|
|
161
|
+
|
|
162
|
+
enum llama_pooling_type pooling_type = LLAMA_POOLING_TYPE_NONE;
|
|
163
|
+
enum llama_rope_type rope_type = LLAMA_ROPE_TYPE_NONE;
|
|
164
|
+
enum llama_rope_scaling_type rope_scaling_type_train = LLAMA_ROPE_SCALING_TYPE_NONE;
|
|
165
|
+
|
|
166
|
+
// this value n_pattern means that every nth layer is dense (i.e. non-SWA)
|
|
167
|
+
// dense_first means whether the pattern is start with a dense layer
|
|
168
|
+
// note that if n_pattern == 0, all layers are SWA
|
|
169
|
+
// if n_pattern == 1, all layers are dense
|
|
170
|
+
// example 1: n_pattern = 3, dense_first = false
|
|
171
|
+
// il == 0: swa
|
|
172
|
+
// il == 1: swa
|
|
173
|
+
// il == 2: dense
|
|
174
|
+
// il == 3: swa
|
|
175
|
+
// il == 4: swa
|
|
176
|
+
// il == 5: dense
|
|
177
|
+
// il == 6: swa
|
|
178
|
+
// etc ...
|
|
179
|
+
// example 2: n_pattern = 2, dense_first = true
|
|
180
|
+
// il == 0: dense
|
|
181
|
+
// il == 1: swa
|
|
182
|
+
// il == 2: dense
|
|
183
|
+
// il == 3: swa
|
|
184
|
+
// etc ...
|
|
185
|
+
void set_swa_pattern(uint32_t n_pattern, bool dense_first = false);
|
|
186
|
+
|
|
187
|
+
// return true if one of the layers is SWA
|
|
188
|
+
bool is_swa_any() const;
|
|
189
|
+
|
|
190
|
+
uint32_t n_head(uint32_t il = 0) const;
|
|
191
|
+
|
|
192
|
+
uint32_t n_head_kv(uint32_t il = 0) const;
|
|
193
|
+
|
|
194
|
+
uint32_t n_ff(uint32_t il = 0) const;
|
|
195
|
+
|
|
196
|
+
uint32_t n_gqa(uint32_t il = 0) const;
|
|
197
|
+
|
|
198
|
+
// dimension of key embeddings across all k-v heads
|
|
199
|
+
uint32_t n_embd_k_gqa(uint32_t il = 0) const;
|
|
200
|
+
|
|
201
|
+
// dimension of value embeddings across all k-v heads
|
|
202
|
+
uint32_t n_embd_v_gqa(uint32_t il = 0) const;
|
|
203
|
+
|
|
204
|
+
// true if any layer has a different n_embd_k_gqa/n_embd_v_gqa
|
|
205
|
+
bool is_n_embd_k_gqa_variable() const;
|
|
206
|
+
bool is_n_embd_v_gqa_variable() const;
|
|
207
|
+
|
|
208
|
+
// return the maximum n_embd_k_gqa/n_embd_v_gqa across all layers
|
|
209
|
+
uint32_t n_embd_k_gqa_max() const;
|
|
210
|
+
uint32_t n_embd_v_gqa_max() const;
|
|
211
|
+
|
|
212
|
+
// dimension of the rolling state embeddings
|
|
213
|
+
// corresponds to Mamba's conv_states size or RWKV's token_shift states size
|
|
214
|
+
uint32_t n_embd_r() const;
|
|
215
|
+
|
|
216
|
+
// dimension of the recurrent state embeddings
|
|
217
|
+
uint32_t n_embd_s() const;
|
|
218
|
+
|
|
219
|
+
// whether or not the given layer is recurrent (for hybrid models)
|
|
220
|
+
bool is_recurrent(uint32_t il) const;
|
|
221
|
+
|
|
222
|
+
uint32_t n_pos_per_embd() const;
|
|
223
|
+
|
|
224
|
+
bool is_swa(uint32_t il) const;
|
|
225
|
+
|
|
226
|
+
bool has_kv(uint32_t il) const;
|
|
227
|
+
|
|
228
|
+
// number of layers for which has_kv() returns true
|
|
229
|
+
uint32_t n_layer_kv() const;
|
|
230
|
+
};
|
|
231
|
+
|
|
232
|
+
static_assert(std::is_trivially_copyable<llama_hparams>::value, "llama_hparams must be trivially copyable");
|
|
233
|
+
|
|
@@ -0,0 +1,167 @@
|
|
|
1
|
+
#include "llama-impl.h"
|
|
2
|
+
|
|
3
|
+
#include "gguf.h"
|
|
4
|
+
#include "llama.h"
|
|
5
|
+
|
|
6
|
+
#include <cinttypes>
|
|
7
|
+
#include <climits>
|
|
8
|
+
#include <cstdarg>
|
|
9
|
+
#include <cstring>
|
|
10
|
+
#include <vector>
|
|
11
|
+
#include <sstream>
|
|
12
|
+
|
|
13
|
+
struct llama_logger_state {
|
|
14
|
+
lm_ggml_log_callback log_callback = llama_log_callback_default;
|
|
15
|
+
void * log_callback_user_data = nullptr;
|
|
16
|
+
};
|
|
17
|
+
|
|
18
|
+
static llama_logger_state g_logger_state;
|
|
19
|
+
|
|
20
|
+
time_meas::time_meas(int64_t & t_acc, bool disable) : t_start_us(disable ? -1 : lm_ggml_time_us()), t_acc(t_acc) {}
|
|
21
|
+
|
|
22
|
+
time_meas::~time_meas() {
|
|
23
|
+
if (t_start_us >= 0) {
|
|
24
|
+
t_acc += lm_ggml_time_us() - t_start_us;
|
|
25
|
+
}
|
|
26
|
+
}
|
|
27
|
+
|
|
28
|
+
void llama_log_set(lm_ggml_log_callback log_callback, void * user_data) {
|
|
29
|
+
lm_ggml_log_set(log_callback, user_data);
|
|
30
|
+
g_logger_state.log_callback = log_callback ? log_callback : llama_log_callback_default;
|
|
31
|
+
g_logger_state.log_callback_user_data = user_data;
|
|
32
|
+
}
|
|
33
|
+
|
|
34
|
+
static void llama_log_internal_v(lm_ggml_log_level level, const char * format, va_list args) {
|
|
35
|
+
va_list args_copy;
|
|
36
|
+
va_copy(args_copy, args);
|
|
37
|
+
char buffer[128];
|
|
38
|
+
int len = vsnprintf(buffer, 128, format, args);
|
|
39
|
+
if (len < 128) {
|
|
40
|
+
g_logger_state.log_callback(level, buffer, g_logger_state.log_callback_user_data);
|
|
41
|
+
} else {
|
|
42
|
+
char * buffer2 = new char[len + 1];
|
|
43
|
+
vsnprintf(buffer2, len + 1, format, args_copy);
|
|
44
|
+
buffer2[len] = 0;
|
|
45
|
+
g_logger_state.log_callback(level, buffer2, g_logger_state.log_callback_user_data);
|
|
46
|
+
delete[] buffer2;
|
|
47
|
+
}
|
|
48
|
+
va_end(args_copy);
|
|
49
|
+
}
|
|
50
|
+
|
|
51
|
+
void llama_log_internal(lm_ggml_log_level level, const char * format, ...) {
|
|
52
|
+
va_list args;
|
|
53
|
+
va_start(args, format);
|
|
54
|
+
llama_log_internal_v(level, format, args);
|
|
55
|
+
va_end(args);
|
|
56
|
+
}
|
|
57
|
+
|
|
58
|
+
void llama_log_callback_default(lm_ggml_log_level level, const char * text, void * user_data) {
|
|
59
|
+
(void) level;
|
|
60
|
+
(void) user_data;
|
|
61
|
+
fputs(text, stderr);
|
|
62
|
+
fflush(stderr);
|
|
63
|
+
}
|
|
64
|
+
|
|
65
|
+
void replace_all(std::string & s, const std::string & search, const std::string & replace) {
|
|
66
|
+
if (search.empty()) {
|
|
67
|
+
return;
|
|
68
|
+
}
|
|
69
|
+
std::string builder;
|
|
70
|
+
builder.reserve(s.length());
|
|
71
|
+
size_t pos = 0;
|
|
72
|
+
size_t last_pos = 0;
|
|
73
|
+
while ((pos = s.find(search, last_pos)) != std::string::npos) {
|
|
74
|
+
builder.append(s, last_pos, pos - last_pos);
|
|
75
|
+
builder.append(replace);
|
|
76
|
+
last_pos = pos + search.length();
|
|
77
|
+
}
|
|
78
|
+
builder.append(s, last_pos, std::string::npos);
|
|
79
|
+
s = std::move(builder);
|
|
80
|
+
}
|
|
81
|
+
|
|
82
|
+
std::string format(const char * fmt, ...) {
|
|
83
|
+
va_list ap;
|
|
84
|
+
va_list ap2;
|
|
85
|
+
va_start(ap, fmt);
|
|
86
|
+
va_copy(ap2, ap);
|
|
87
|
+
int size = vsnprintf(NULL, 0, fmt, ap);
|
|
88
|
+
LM_GGML_ASSERT(size >= 0 && size < INT_MAX); // NOLINT
|
|
89
|
+
std::vector<char> buf(size + 1);
|
|
90
|
+
int size2 = vsnprintf(buf.data(), size + 1, fmt, ap2);
|
|
91
|
+
LM_GGML_ASSERT(size2 == size);
|
|
92
|
+
va_end(ap2);
|
|
93
|
+
va_end(ap);
|
|
94
|
+
return std::string(buf.data(), size);
|
|
95
|
+
}
|
|
96
|
+
|
|
97
|
+
std::string llama_format_tensor_shape(const std::vector<int64_t> & ne) {
|
|
98
|
+
char buf[256];
|
|
99
|
+
snprintf(buf, sizeof(buf), "%5" PRId64, ne.at(0));
|
|
100
|
+
for (size_t i = 1; i < ne.size(); i++) {
|
|
101
|
+
snprintf(buf + strlen(buf), sizeof(buf) - strlen(buf), ", %5" PRId64, ne.at(i));
|
|
102
|
+
}
|
|
103
|
+
return buf;
|
|
104
|
+
}
|
|
105
|
+
|
|
106
|
+
std::string llama_format_tensor_shape(const struct lm_ggml_tensor * t) {
|
|
107
|
+
char buf[256];
|
|
108
|
+
snprintf(buf, sizeof(buf), "%5" PRId64, t->ne[0]);
|
|
109
|
+
for (int i = 1; i < LM_GGML_MAX_DIMS; i++) {
|
|
110
|
+
snprintf(buf + strlen(buf), sizeof(buf) - strlen(buf), ", %5" PRId64, t->ne[i]);
|
|
111
|
+
}
|
|
112
|
+
return buf;
|
|
113
|
+
}
|
|
114
|
+
|
|
115
|
+
static std::string lm_gguf_data_to_str(enum lm_gguf_type type, const void * data, int i) {
|
|
116
|
+
switch (type) {
|
|
117
|
+
case LM_GGUF_TYPE_UINT8: return std::to_string(((const uint8_t *)data)[i]);
|
|
118
|
+
case LM_GGUF_TYPE_INT8: return std::to_string(((const int8_t *)data)[i]);
|
|
119
|
+
case LM_GGUF_TYPE_UINT16: return std::to_string(((const uint16_t *)data)[i]);
|
|
120
|
+
case LM_GGUF_TYPE_INT16: return std::to_string(((const int16_t *)data)[i]);
|
|
121
|
+
case LM_GGUF_TYPE_UINT32: return std::to_string(((const uint32_t *)data)[i]);
|
|
122
|
+
case LM_GGUF_TYPE_INT32: return std::to_string(((const int32_t *)data)[i]);
|
|
123
|
+
case LM_GGUF_TYPE_UINT64: return std::to_string(((const uint64_t *)data)[i]);
|
|
124
|
+
case LM_GGUF_TYPE_INT64: return std::to_string(((const int64_t *)data)[i]);
|
|
125
|
+
case LM_GGUF_TYPE_FLOAT32: return std::to_string(((const float *)data)[i]);
|
|
126
|
+
case LM_GGUF_TYPE_FLOAT64: return std::to_string(((const double *)data)[i]);
|
|
127
|
+
case LM_GGUF_TYPE_BOOL: return ((const bool *)data)[i] ? "true" : "false";
|
|
128
|
+
default: return format("unknown type %d", type);
|
|
129
|
+
}
|
|
130
|
+
}
|
|
131
|
+
|
|
132
|
+
std::string lm_gguf_kv_to_str(const struct lm_gguf_context * ctx_gguf, int i) {
|
|
133
|
+
const enum lm_gguf_type type = lm_gguf_get_kv_type(ctx_gguf, i);
|
|
134
|
+
|
|
135
|
+
switch (type) {
|
|
136
|
+
case LM_GGUF_TYPE_STRING:
|
|
137
|
+
return lm_gguf_get_val_str(ctx_gguf, i);
|
|
138
|
+
case LM_GGUF_TYPE_ARRAY:
|
|
139
|
+
{
|
|
140
|
+
const enum lm_gguf_type arr_type = lm_gguf_get_arr_type(ctx_gguf, i);
|
|
141
|
+
int arr_n = lm_gguf_get_arr_n(ctx_gguf, i);
|
|
142
|
+
const void * data = arr_type == LM_GGUF_TYPE_STRING ? nullptr : lm_gguf_get_arr_data(ctx_gguf, i);
|
|
143
|
+
std::stringstream ss;
|
|
144
|
+
ss << "[";
|
|
145
|
+
for (int j = 0; j < arr_n; j++) {
|
|
146
|
+
if (arr_type == LM_GGUF_TYPE_STRING) {
|
|
147
|
+
std::string val = lm_gguf_get_arr_str(ctx_gguf, i, j);
|
|
148
|
+
// escape quotes
|
|
149
|
+
replace_all(val, "\\", "\\\\");
|
|
150
|
+
replace_all(val, "\"", "\\\"");
|
|
151
|
+
ss << '"' << val << '"';
|
|
152
|
+
} else if (arr_type == LM_GGUF_TYPE_ARRAY) {
|
|
153
|
+
ss << "???";
|
|
154
|
+
} else {
|
|
155
|
+
ss << lm_gguf_data_to_str(arr_type, data, j);
|
|
156
|
+
}
|
|
157
|
+
if (j < arr_n - 1) {
|
|
158
|
+
ss << ", ";
|
|
159
|
+
}
|
|
160
|
+
}
|
|
161
|
+
ss << "]";
|
|
162
|
+
return ss.str();
|
|
163
|
+
}
|
|
164
|
+
default:
|
|
165
|
+
return lm_gguf_data_to_str(type, lm_gguf_get_val_data(ctx_gguf, i), 0);
|
|
166
|
+
}
|
|
167
|
+
}
|
package/cpp/llama-impl.h
ADDED
|
@@ -0,0 +1,61 @@
|
|
|
1
|
+
#pragma once
|
|
2
|
+
|
|
3
|
+
#include "ggml.h" // for lm_ggml_log_level
|
|
4
|
+
|
|
5
|
+
#include <string>
|
|
6
|
+
#include <vector>
|
|
7
|
+
|
|
8
|
+
#ifdef __GNUC__
|
|
9
|
+
# if defined(__MINGW32__) && !defined(__clang__)
|
|
10
|
+
# define LLAMA_ATTRIBUTE_FORMAT(...) __attribute__((format(gnu_printf, __VA_ARGS__)))
|
|
11
|
+
# else
|
|
12
|
+
# define LLAMA_ATTRIBUTE_FORMAT(...) __attribute__((format(printf, __VA_ARGS__)))
|
|
13
|
+
# endif
|
|
14
|
+
#else
|
|
15
|
+
# define LLAMA_ATTRIBUTE_FORMAT(...)
|
|
16
|
+
#endif
|
|
17
|
+
|
|
18
|
+
//
|
|
19
|
+
// logging
|
|
20
|
+
//
|
|
21
|
+
|
|
22
|
+
LLAMA_ATTRIBUTE_FORMAT(2, 3)
|
|
23
|
+
void llama_log_internal (lm_ggml_log_level level, const char * format, ...);
|
|
24
|
+
void llama_log_callback_default(lm_ggml_log_level level, const char * text, void * user_data);
|
|
25
|
+
|
|
26
|
+
#define LLAMA_LOG(...) llama_log_internal(LM_GGML_LOG_LEVEL_NONE , __VA_ARGS__)
|
|
27
|
+
#define LLAMA_LOG_INFO(...) llama_log_internal(LM_GGML_LOG_LEVEL_INFO , __VA_ARGS__)
|
|
28
|
+
#define LLAMA_LOG_WARN(...) llama_log_internal(LM_GGML_LOG_LEVEL_WARN , __VA_ARGS__)
|
|
29
|
+
#define LLAMA_LOG_ERROR(...) llama_log_internal(LM_GGML_LOG_LEVEL_ERROR, __VA_ARGS__)
|
|
30
|
+
#define LLAMA_LOG_DEBUG(...) llama_log_internal(LM_GGML_LOG_LEVEL_DEBUG, __VA_ARGS__)
|
|
31
|
+
#define LLAMA_LOG_CONT(...) llama_log_internal(LM_GGML_LOG_LEVEL_CONT , __VA_ARGS__)
|
|
32
|
+
|
|
33
|
+
//
|
|
34
|
+
// helpers
|
|
35
|
+
//
|
|
36
|
+
|
|
37
|
+
template <typename T>
|
|
38
|
+
struct no_init {
|
|
39
|
+
T value;
|
|
40
|
+
no_init() { /* do nothing */ }
|
|
41
|
+
};
|
|
42
|
+
|
|
43
|
+
struct time_meas {
|
|
44
|
+
time_meas(int64_t & t_acc, bool disable = false);
|
|
45
|
+
~time_meas();
|
|
46
|
+
|
|
47
|
+
const int64_t t_start_us;
|
|
48
|
+
|
|
49
|
+
int64_t & t_acc;
|
|
50
|
+
};
|
|
51
|
+
|
|
52
|
+
void replace_all(std::string & s, const std::string & search, const std::string & replace);
|
|
53
|
+
|
|
54
|
+
// TODO: rename to llama_format ?
|
|
55
|
+
LLAMA_ATTRIBUTE_FORMAT(1, 2)
|
|
56
|
+
std::string format(const char * fmt, ...);
|
|
57
|
+
|
|
58
|
+
std::string llama_format_tensor_shape(const std::vector<int64_t> & ne);
|
|
59
|
+
std::string llama_format_tensor_shape(const struct lm_ggml_tensor * t);
|
|
60
|
+
|
|
61
|
+
std::string lm_gguf_kv_to_str(const struct lm_gguf_context * ctx_gguf, int i);
|
package/cpp/llama-io.cpp
ADDED
|
@@ -0,0 +1,15 @@
|
|
|
1
|
+
#include "llama-io.h"
|
|
2
|
+
|
|
3
|
+
void llama_io_write_i::write_string(const std::string & str) {
|
|
4
|
+
uint32_t str_size = str.size();
|
|
5
|
+
|
|
6
|
+
write(&str_size, sizeof(str_size));
|
|
7
|
+
write(str.data(), str_size);
|
|
8
|
+
}
|
|
9
|
+
|
|
10
|
+
void llama_io_read_i::read_string(std::string & str) {
|
|
11
|
+
uint32_t str_size;
|
|
12
|
+
read_to(&str_size, sizeof(str_size));
|
|
13
|
+
|
|
14
|
+
str.assign((const char *) read(str_size), str_size);
|
|
15
|
+
}
|
package/cpp/llama-io.h
ADDED
|
@@ -0,0 +1,35 @@
|
|
|
1
|
+
#pragma once
|
|
2
|
+
|
|
3
|
+
#include <cstddef>
|
|
4
|
+
#include <cstdint>
|
|
5
|
+
#include <string>
|
|
6
|
+
|
|
7
|
+
struct lm_ggml_tensor;
|
|
8
|
+
|
|
9
|
+
class llama_io_write_i {
|
|
10
|
+
public:
|
|
11
|
+
llama_io_write_i() = default;
|
|
12
|
+
virtual ~llama_io_write_i() = default;
|
|
13
|
+
|
|
14
|
+
virtual void write(const void * src, size_t size) = 0;
|
|
15
|
+
virtual void write_tensor(const lm_ggml_tensor * tensor, size_t offset, size_t size) = 0;
|
|
16
|
+
|
|
17
|
+
// bytes written so far
|
|
18
|
+
virtual size_t n_bytes() = 0;
|
|
19
|
+
|
|
20
|
+
void write_string(const std::string & str);
|
|
21
|
+
};
|
|
22
|
+
|
|
23
|
+
class llama_io_read_i {
|
|
24
|
+
public:
|
|
25
|
+
llama_io_read_i() = default;
|
|
26
|
+
virtual ~llama_io_read_i() = default;
|
|
27
|
+
|
|
28
|
+
virtual const uint8_t * read(size_t size) = 0;
|
|
29
|
+
virtual void read_to(void * dst, size_t size) = 0;
|
|
30
|
+
|
|
31
|
+
// bytes read so far
|
|
32
|
+
virtual size_t n_bytes() = 0;
|
|
33
|
+
|
|
34
|
+
void read_string(std::string & str);
|
|
35
|
+
};
|