npm - llama-cpp-capacitor - Versions diffs - 0.0.6 → 0.0.7 - Mend

llama-cpp-capacitor 0.0.6 → 0.0.7

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.

Files changed (149) hide show

package/cpp/LICENSE +21 -0
package/cpp/README.md +4 -0
package/cpp/anyascii.c +22223 -0
package/cpp/anyascii.h +42 -0
package/cpp/chat-parser.cpp +393 -0
package/cpp/chat-parser.h +120 -0
package/cpp/chat.cpp +2315 -0
package/cpp/chat.h +221 -0
package/cpp/common.cpp +1619 -0
package/cpp/common.h +744 -0
package/cpp/ggml-alloc.c +1028 -0
package/cpp/ggml-alloc.h +76 -0
package/cpp/ggml-backend-impl.h +255 -0
package/cpp/ggml-backend-reg.cpp +600 -0
package/cpp/ggml-backend.cpp +2118 -0
package/cpp/ggml-backend.h +354 -0
package/cpp/ggml-common.h +1878 -0
package/cpp/ggml-cpp.h +39 -0
package/cpp/ggml-cpu/amx/amx.cpp +221 -0
package/cpp/ggml-cpu/amx/amx.h +8 -0
package/cpp/ggml-cpu/amx/common.h +91 -0
package/cpp/ggml-cpu/amx/mmq.cpp +2512 -0
package/cpp/ggml-cpu/amx/mmq.h +10 -0
package/cpp/ggml-cpu/arch/arm/cpu-feats.cpp +94 -0
package/cpp/ggml-cpu/arch/arm/quants.c +3650 -0
package/cpp/ggml-cpu/arch/arm/repack.cpp +1891 -0
package/cpp/ggml-cpu/arch/x86/cpu-feats.cpp +327 -0
package/cpp/ggml-cpu/arch/x86/quants.c +3820 -0
package/cpp/ggml-cpu/arch/x86/repack.cpp +6307 -0
package/cpp/ggml-cpu/arch-fallback.h +215 -0
package/cpp/ggml-cpu/binary-ops.cpp +158 -0
package/cpp/ggml-cpu/binary-ops.h +16 -0
package/cpp/ggml-cpu/common.h +73 -0
package/cpp/ggml-cpu/ggml-cpu-impl.h +525 -0
package/cpp/ggml-cpu/ggml-cpu.c +3578 -0
package/cpp/ggml-cpu/ggml-cpu.cpp +672 -0
package/cpp/ggml-cpu/ops.cpp +10587 -0
package/cpp/ggml-cpu/ops.h +114 -0
package/cpp/ggml-cpu/quants.c +1193 -0
package/cpp/ggml-cpu/quants.h +97 -0
package/cpp/ggml-cpu/repack.cpp +1982 -0
package/cpp/ggml-cpu/repack.h +120 -0
package/cpp/ggml-cpu/simd-mappings.h +1184 -0
package/cpp/ggml-cpu/traits.cpp +36 -0
package/cpp/ggml-cpu/traits.h +38 -0
package/cpp/ggml-cpu/unary-ops.cpp +186 -0
package/cpp/ggml-cpu/unary-ops.h +28 -0
package/cpp/ggml-cpu/vec.cpp +348 -0
package/cpp/ggml-cpu/vec.h +1121 -0
package/cpp/ggml-cpu.h +145 -0
package/cpp/ggml-impl.h +622 -0
package/cpp/ggml-metal-impl.h +688 -0
package/cpp/ggml-metal.h +66 -0
package/cpp/ggml-metal.m +6833 -0
package/cpp/ggml-opt.cpp +1093 -0
package/cpp/ggml-opt.h +256 -0
package/cpp/ggml-quants.c +5324 -0
package/cpp/ggml-quants.h +106 -0
package/cpp/ggml-threading.cpp +12 -0
package/cpp/ggml-threading.h +14 -0
package/cpp/ggml.c +7108 -0
package/cpp/ggml.h +2492 -0
package/cpp/gguf.cpp +1358 -0
package/cpp/gguf.h +202 -0
package/cpp/json-partial.cpp +256 -0
package/cpp/json-partial.h +38 -0
package/cpp/json-schema-to-grammar.cpp +985 -0
package/cpp/json-schema-to-grammar.h +21 -0
package/cpp/llama-adapter.cpp +388 -0
package/cpp/llama-adapter.h +76 -0
package/cpp/llama-arch.cpp +2355 -0
package/cpp/llama-arch.h +499 -0
package/cpp/llama-batch.cpp +875 -0
package/cpp/llama-batch.h +160 -0
package/cpp/llama-chat.cpp +783 -0
package/cpp/llama-chat.h +65 -0
package/cpp/llama-context.cpp +2748 -0
package/cpp/llama-context.h +306 -0
package/cpp/llama-cparams.cpp +5 -0
package/cpp/llama-cparams.h +41 -0
package/cpp/llama-cpp.h +30 -0
package/cpp/llama-grammar.cpp +1229 -0
package/cpp/llama-grammar.h +173 -0
package/cpp/llama-graph.cpp +1891 -0
package/cpp/llama-graph.h +810 -0
package/cpp/llama-hparams.cpp +180 -0
package/cpp/llama-hparams.h +233 -0
package/cpp/llama-impl.cpp +167 -0
package/cpp/llama-impl.h +61 -0
package/cpp/llama-io.cpp +15 -0
package/cpp/llama-io.h +35 -0
package/cpp/llama-kv-cache-iswa.cpp +318 -0
package/cpp/llama-kv-cache-iswa.h +135 -0
package/cpp/llama-kv-cache.cpp +2059 -0
package/cpp/llama-kv-cache.h +374 -0
package/cpp/llama-kv-cells.h +491 -0
package/cpp/llama-memory-hybrid.cpp +258 -0
package/cpp/llama-memory-hybrid.h +137 -0
package/cpp/llama-memory-recurrent.cpp +1146 -0
package/cpp/llama-memory-recurrent.h +179 -0
package/cpp/llama-memory.cpp +59 -0
package/cpp/llama-memory.h +119 -0
package/cpp/llama-mmap.cpp +600 -0
package/cpp/llama-mmap.h +68 -0
package/cpp/llama-model-loader.cpp +1164 -0
package/cpp/llama-model-loader.h +170 -0
package/cpp/llama-model-saver.cpp +282 -0
package/cpp/llama-model-saver.h +37 -0
package/cpp/llama-model.cpp +19042 -0
package/cpp/llama-model.h +491 -0
package/cpp/llama-sampling.cpp +2575 -0
package/cpp/llama-sampling.h +32 -0
package/cpp/llama-vocab.cpp +3792 -0
package/cpp/llama-vocab.h +176 -0
package/cpp/llama.cpp +358 -0
package/cpp/llama.h +1373 -0
package/cpp/log.cpp +427 -0
package/cpp/log.h +103 -0
package/cpp/minja/chat-template.hpp +550 -0
package/cpp/minja/minja.hpp +3009 -0
package/cpp/nlohmann/json.hpp +25526 -0
package/cpp/nlohmann/json_fwd.hpp +187 -0
package/cpp/regex-partial.cpp +204 -0
package/cpp/regex-partial.h +56 -0
package/cpp/rn-completion.cpp +681 -0
package/cpp/rn-completion.h +116 -0
package/cpp/rn-llama.cpp +345 -0
package/cpp/rn-llama.h +149 -0
package/cpp/rn-mtmd.hpp +602 -0
package/cpp/rn-tts.cpp +591 -0
package/cpp/rn-tts.h +59 -0
package/cpp/sampling.cpp +579 -0
package/cpp/sampling.h +107 -0
package/cpp/tools/mtmd/clip-impl.h +473 -0
package/cpp/tools/mtmd/clip.cpp +4322 -0
package/cpp/tools/mtmd/clip.h +106 -0
package/cpp/tools/mtmd/miniaudio/miniaudio.h +93468 -0
package/cpp/tools/mtmd/mtmd-audio.cpp +769 -0
package/cpp/tools/mtmd/mtmd-audio.h +47 -0
package/cpp/tools/mtmd/mtmd-helper.cpp +460 -0
package/cpp/tools/mtmd/mtmd-helper.h +91 -0
package/cpp/tools/mtmd/mtmd.cpp +1066 -0
package/cpp/tools/mtmd/mtmd.h +298 -0
package/cpp/tools/mtmd/stb/stb_image.h +7988 -0
package/cpp/unicode-data.cpp +7034 -0
package/cpp/unicode-data.h +20 -0
package/cpp/unicode.cpp +1061 -0
package/cpp/unicode.h +68 -0
package/package.json +2 -1

package/cpp/ggml-cpu/repack.h ADDED Viewed

@@ -0,0 +1,120 @@
+#pragma once
+#define LM_GGML_COMMON_DECL_CPP
+#include "ggml-common.h"
+#include "traits.h"
+#include "ggml.h"
+// GGML internal header
+lm_ggml_backend_buffer_type_t lm_ggml_backend_cpu_repack_buffer_type(void);
+template <int K> constexpr int QK_0() {
+    if constexpr (K == 4) {
+        return QK4_0;
+    }
+    if constexpr (K == 8) {
+        return QK8_0;
+    }
+    return -1;
+}
+template <int K, int N> struct block {
+    lm_ggml_half d[N];                         // deltas for N qK_0 blocks
+    int8_t    qs[(QK_0<K>() * N * K) / 8];  // quants for N qK_0 blocks
+};
+// control size
+static_assert(sizeof(block<4, 4>) == 4 * sizeof(lm_ggml_half) + QK8_0 * 2, "wrong block<4,4> size/padding");
+static_assert(sizeof(block<4, 8>) == 8 * sizeof(lm_ggml_half) + QK8_0 * 4, "wrong block<4,8> size/padding");
+static_assert(sizeof(block<8, 4>) == 4 * sizeof(lm_ggml_half) + QK8_0 * 4, "wrong block<8,4> size/padding");
+static_assert(sizeof(block<8, 8>) == 8 * sizeof(lm_ggml_half) + QK8_0 * 8, "wrong block<8,8> size/padding");
+using block_q4_0x4 = block<4, 4>;
+using block_q4_0x8 = block<4, 8>;
+using block_q8_0x4 = block<8, 4>;
+using block_q8_0x8 = block<8, 8>;
+struct block_q4_Kx8 {
+    lm_ggml_half d[8];      // super-block scale for quantized scales
+    lm_ggml_half dmin[8];   // super-block scale for quantized mins
+    uint8_t scales[96];  // scales and mins, quantized with 6 bits
+    uint8_t qs[1024];    // 4--bit quants
+};
+static_assert(sizeof(block_q4_Kx8) == sizeof(lm_ggml_half) * 16 + K_SCALE_SIZE * 8 + QK_K * 4, "wrong q4_K block size/padding");
+struct block_q2_Kx8 {
+    lm_ggml_half d[8];      // super-block scale for quantized scales
+    lm_ggml_half dmin[8];   // super-block scale for quantized mins
+    uint8_t scales[128];  // scales and mins, quantized with 4 bits
+    uint8_t qs[512];    // 2--bit quants
+};
+static_assert(sizeof(block_q2_Kx8) == sizeof(lm_ggml_half) * 16 + QK_K/2 + QK_K * 2, "wrong q2_K block size/padding");
+struct block_q8_Kx4 {
+    float d[4];              // delta
+    int8_t qs[QK_K * 4];     // quants
+    int16_t bsums[QK_K / 4]; // sum of quants in groups of 16
+};
+static_assert(sizeof(block_q8_Kx4) == sizeof(float) * 4 + QK_K * 4 + (QK_K / 4) * sizeof(int16_t), "wrong q8_K block size/padding");
+struct block_iq4_nlx4 {
+    lm_ggml_half d[4];            // deltas for 4 iq4_nl blocks
+    uint8_t   qs[QK4_NL * 2];  // nibbles / quants for 4 iq4_nl blocks
+};
+static_assert(sizeof(block_iq4_nlx4) == 4 * sizeof(lm_ggml_half) + QK4_NL * 2, "wrong iq4_nlx4 block size/padding");
+struct block_iq4_nlx8 {
+    lm_ggml_half d[8];            // deltas for 8 iq4_nl blocks
+    uint8_t   qs[QK4_NL * 4];  // nibbles / quants for 8 iq4_nl blocks
+};
+static_assert(sizeof(block_iq4_nlx8) == 8 * sizeof(lm_ggml_half) + QK4_NL * 4, "wrong iq4_nlx8 block size/padding");
+#if defined(__cplusplus)
+extern "C" {
+#endif
+void lm_ggml_quantize_mat_q8_0_4x4(const float * LM_GGML_RESTRICT x, void * LM_GGML_RESTRICT vy, int64_t k);
+void lm_ggml_quantize_mat_q8_0_4x8(const float * LM_GGML_RESTRICT x, void * LM_GGML_RESTRICT vy, int64_t k);
+void lm_ggml_quantize_mat_q8_K_4x8(const float * LM_GGML_RESTRICT x, void * LM_GGML_RESTRICT vy, int64_t k);
+void lm_ggml_gemv_q4_0_4x4_q8_0(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemv_q4_0_4x8_q8_0(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemv_q4_0_8x8_q8_0(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemv_q4_K_8x8_q8_K(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemv_q2_K_8x8_q8_K(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemv_iq4_nl_4x4_q8_0(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemv_iq4_nl_8x8_q8_0(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemm_q4_0_4x4_q8_0(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemm_q4_0_4x8_q8_0(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemm_q4_0_8x8_q8_0(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemm_q4_K_8x8_q8_K(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemm_q2_K_8x8_q8_K(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemm_iq4_nl_4x4_q8_0(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemm_iq4_nl_8x8_q8_0(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+// Native implementations
+void lm_ggml_quantize_mat_q8_0_4x4_generic(const float * LM_GGML_RESTRICT x, void * LM_GGML_RESTRICT vy, int64_t k);
+void lm_ggml_quantize_mat_q8_0_4x8_generic(const float * LM_GGML_RESTRICT x, void * LM_GGML_RESTRICT vy, int64_t k);
+void lm_ggml_quantize_mat_q8_K_4x8_generic(const float * LM_GGML_RESTRICT x, void * LM_GGML_RESTRICT vy, int64_t k);
+void lm_ggml_gemv_q4_0_4x4_q8_0_generic(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemv_q4_0_4x8_q8_0_generic(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemv_q4_0_8x8_q8_0_generic(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemv_q4_K_8x8_q8_K_generic(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemv_q2_K_8x8_q8_K_generic(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemv_iq4_nl_4x4_q8_0_generic(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemv_iq4_nl_8x8_q8_0_generic(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemm_q4_0_4x4_q8_0_generic(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemm_q4_0_4x8_q8_0_generic(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemm_q4_0_8x8_q8_0_generic(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemm_q4_K_8x8_q8_K_generic(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemm_q2_K_8x8_q8_K_generic(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemm_iq4_nl_4x4_q8_0_generic(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+void lm_ggml_gemm_iq4_nl_8x8_q8_0_generic(int n, float * LM_GGML_RESTRICT s, size_t bs, const void * LM_GGML_RESTRICT vx, const void * LM_GGML_RESTRICT vy, int nr, int nc);
+#if defined(__cplusplus)
+} // extern "C"
+#endif