llama-cpp-pro 0.2.2

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (310) hide show
  1. package/CHANGELOG.md +295 -0
  2. package/LICENSE +21 -0
  3. package/LlamaCpp.podspec +33 -0
  4. package/LlamaCppCapacitor.podspec +33 -0
  5. package/Package.swift +29 -0
  6. package/README.md +93 -0
  7. package/android/build.gradle +88 -0
  8. package/android/src/main/AndroidManifest.xml +4 -0
  9. package/android/src/main/CMakeLists-arm64.txt +138 -0
  10. package/android/src/main/CMakeLists-x86_64.txt +141 -0
  11. package/android/src/main/CMakeLists.txt +138 -0
  12. package/android/src/main/java/ai/annadata/plugin/capacitor/LlamaCpp.java +1340 -0
  13. package/android/src/main/java/ai/annadata/plugin/capacitor/LlamaCppPlugin.java +814 -0
  14. package/android/src/main/java/ai/annadata/plugin/capacitor/ModelAdmissionController.java +214 -0
  15. package/android/src/main/jni-chat-session.cpp +261 -0
  16. package/android/src/main/jni-lora.cpp +197 -0
  17. package/android/src/main/jni-multimodal.cpp +167 -0
  18. package/android/src/main/jni-tts.cpp +290 -0
  19. package/android/src/main/jni-utils.h +148 -0
  20. package/android/src/main/jni.cpp +1808 -0
  21. package/android/src/main/jniLibs/arm64-v8a/libllama-cpp-arm64.so +0 -0
  22. package/android/src/main/res/.gitkeep +0 -0
  23. package/build-native.sh +280 -0
  24. package/cmake/desktop-metal-embed.cmake +30 -0
  25. package/cmake/desktop-sources.cmake +100 -0
  26. package/cmake/ggml-backends.cmake +44 -0
  27. package/cpp/LICENSE +21 -0
  28. package/cpp/README.md +15 -0
  29. package/cpp/anyascii.c +22223 -0
  30. package/cpp/anyascii.h +42 -0
  31. package/cpp/cap-completion.cpp +942 -0
  32. package/cpp/cap-completion.h +127 -0
  33. package/cpp/cap-embedding.cpp +193 -0
  34. package/cpp/cap-embedding.h +35 -0
  35. package/cpp/cap-ios-bridge.cpp +1810 -0
  36. package/cpp/cap-ios-bridge.h +61 -0
  37. package/cpp/cap-llama.cpp +412 -0
  38. package/cpp/cap-llama.h +161 -0
  39. package/cpp/cap-mtmd.hpp +602 -0
  40. package/cpp/cap-native-server.cpp +1095 -0
  41. package/cpp/cap-native-server.h +40 -0
  42. package/cpp/cap-tts.cpp +591 -0
  43. package/cpp/cap-tts.h +59 -0
  44. package/cpp/cap-wasm-fs.cpp +156 -0
  45. package/cpp/cap-wasm-jspi.cpp +19 -0
  46. package/cpp/cap-wasm-jspi.h +30 -0
  47. package/cpp/cap-wasm-vfs.cpp +22 -0
  48. package/cpp/chat-parser.cpp +393 -0
  49. package/cpp/chat-parser.h +120 -0
  50. package/cpp/chat.cpp +2315 -0
  51. package/cpp/chat.h +221 -0
  52. package/cpp/common.cpp +1664 -0
  53. package/cpp/common.h +744 -0
  54. package/cpp/ggml-alloc.c +1028 -0
  55. package/cpp/ggml-alloc.h +76 -0
  56. package/cpp/ggml-backend-impl.h +255 -0
  57. package/cpp/ggml-backend-reg.cpp +600 -0
  58. package/cpp/ggml-backend.cpp +2121 -0
  59. package/cpp/ggml-backend.h +354 -0
  60. package/cpp/ggml-common.h +1878 -0
  61. package/cpp/ggml-cpp.h +39 -0
  62. package/cpp/ggml-cpu/amx/amx.cpp +221 -0
  63. package/cpp/ggml-cpu/amx/amx.h +8 -0
  64. package/cpp/ggml-cpu/amx/common.h +91 -0
  65. package/cpp/ggml-cpu/amx/mmq.cpp +2512 -0
  66. package/cpp/ggml-cpu/amx/mmq.h +10 -0
  67. package/cpp/ggml-cpu/arch/arm/cpu-feats.cpp +94 -0
  68. package/cpp/ggml-cpu/arch/arm/quants.c +3650 -0
  69. package/cpp/ggml-cpu/arch/arm/repack.cpp +1891 -0
  70. package/cpp/ggml-cpu/arch/x86/cpu-feats.cpp +327 -0
  71. package/cpp/ggml-cpu/arch/x86/quants.c +3820 -0
  72. package/cpp/ggml-cpu/arch/x86/repack.cpp +6307 -0
  73. package/cpp/ggml-cpu/arch-fallback.h +215 -0
  74. package/cpp/ggml-cpu/binary-ops.cpp +158 -0
  75. package/cpp/ggml-cpu/binary-ops.h +16 -0
  76. package/cpp/ggml-cpu/common.h +73 -0
  77. package/cpp/ggml-cpu/ggml-cpu-impl.h +559 -0
  78. package/cpp/ggml-cpu/ggml-cpu.c +3578 -0
  79. package/cpp/ggml-cpu/ggml-cpu.cpp +672 -0
  80. package/cpp/ggml-cpu/ops.cpp +10587 -0
  81. package/cpp/ggml-cpu/ops.h +114 -0
  82. package/cpp/ggml-cpu/quants.c +1193 -0
  83. package/cpp/ggml-cpu/quants.h +97 -0
  84. package/cpp/ggml-cpu/repack.cpp +1982 -0
  85. package/cpp/ggml-cpu/repack.h +120 -0
  86. package/cpp/ggml-cpu/simd-mappings.h +1184 -0
  87. package/cpp/ggml-cpu/traits.cpp +36 -0
  88. package/cpp/ggml-cpu/traits.h +38 -0
  89. package/cpp/ggml-cpu/unary-ops.cpp +186 -0
  90. package/cpp/ggml-cpu/unary-ops.h +28 -0
  91. package/cpp/ggml-cpu/vec.cpp +348 -0
  92. package/cpp/ggml-cpu/vec.h +1121 -0
  93. package/cpp/ggml-cpu.h +145 -0
  94. package/cpp/ggml-impl.h +622 -0
  95. package/cpp/ggml-metal-impl.h +688 -0
  96. package/cpp/ggml-metal.h +66 -0
  97. package/cpp/ggml-metal.m +6833 -0
  98. package/cpp/ggml-metal.metal +10754 -0
  99. package/cpp/ggml-opt.cpp +1093 -0
  100. package/cpp/ggml-opt.h +256 -0
  101. package/cpp/ggml-quants.c +5324 -0
  102. package/cpp/ggml-quants.h +106 -0
  103. package/cpp/ggml-threading.cpp +12 -0
  104. package/cpp/ggml-threading.h +14 -0
  105. package/cpp/ggml.c +7108 -0
  106. package/cpp/ggml.h +2492 -0
  107. package/cpp/gguf.cpp +1358 -0
  108. package/cpp/gguf.h +202 -0
  109. package/cpp/json-partial.cpp +256 -0
  110. package/cpp/json-partial.h +38 -0
  111. package/cpp/json-schema-to-grammar.cpp +985 -0
  112. package/cpp/json-schema-to-grammar.h +21 -0
  113. package/cpp/llama-adapter.cpp +388 -0
  114. package/cpp/llama-adapter.h +76 -0
  115. package/cpp/llama-arch.cpp +2355 -0
  116. package/cpp/llama-arch.h +499 -0
  117. package/cpp/llama-batch.cpp +875 -0
  118. package/cpp/llama-batch.h +160 -0
  119. package/cpp/llama-chat.cpp +783 -0
  120. package/cpp/llama-chat.h +65 -0
  121. package/cpp/llama-context.cpp +2788 -0
  122. package/cpp/llama-context.h +306 -0
  123. package/cpp/llama-cparams.cpp +5 -0
  124. package/cpp/llama-cparams.h +41 -0
  125. package/cpp/llama-cpp.h +30 -0
  126. package/cpp/llama-grammar.cpp +1229 -0
  127. package/cpp/llama-grammar.h +173 -0
  128. package/cpp/llama-graph.cpp +1891 -0
  129. package/cpp/llama-graph.h +810 -0
  130. package/cpp/llama-hparams.cpp +180 -0
  131. package/cpp/llama-hparams.h +233 -0
  132. package/cpp/llama-impl.cpp +167 -0
  133. package/cpp/llama-impl.h +61 -0
  134. package/cpp/llama-io.cpp +15 -0
  135. package/cpp/llama-io.h +35 -0
  136. package/cpp/llama-kv-cache-iswa.cpp +318 -0
  137. package/cpp/llama-kv-cache-iswa.h +135 -0
  138. package/cpp/llama-kv-cache.cpp +2059 -0
  139. package/cpp/llama-kv-cache.h +374 -0
  140. package/cpp/llama-kv-cells.h +491 -0
  141. package/cpp/llama-memory-hybrid.cpp +258 -0
  142. package/cpp/llama-memory-hybrid.h +137 -0
  143. package/cpp/llama-memory-recurrent.cpp +1146 -0
  144. package/cpp/llama-memory-recurrent.h +179 -0
  145. package/cpp/llama-memory.cpp +59 -0
  146. package/cpp/llama-memory.h +119 -0
  147. package/cpp/llama-mmap.cpp +609 -0
  148. package/cpp/llama-mmap.h +68 -0
  149. package/cpp/llama-model-loader.cpp +1166 -0
  150. package/cpp/llama-model-loader.h +170 -0
  151. package/cpp/llama-model-saver.cpp +282 -0
  152. package/cpp/llama-model-saver.h +37 -0
  153. package/cpp/llama-model.cpp +19061 -0
  154. package/cpp/llama-model.h +491 -0
  155. package/cpp/llama-sampling.cpp +2575 -0
  156. package/cpp/llama-sampling.h +32 -0
  157. package/cpp/llama-vocab.cpp +3792 -0
  158. package/cpp/llama-vocab.h +176 -0
  159. package/cpp/llama.cpp +358 -0
  160. package/cpp/llama.h +1373 -0
  161. package/cpp/log.cpp +428 -0
  162. package/cpp/log.h +103 -0
  163. package/cpp/minja/chat-template.hpp +550 -0
  164. package/cpp/minja/minja.hpp +3009 -0
  165. package/cpp/nlohmann/json.hpp +25526 -0
  166. package/cpp/nlohmann/json_fwd.hpp +187 -0
  167. package/cpp/regex-partial.cpp +204 -0
  168. package/cpp/regex-partial.h +56 -0
  169. package/cpp/sampling.cpp +579 -0
  170. package/cpp/sampling.h +107 -0
  171. package/cpp/tools/mtmd/clip-impl.h +473 -0
  172. package/cpp/tools/mtmd/clip.cpp +4322 -0
  173. package/cpp/tools/mtmd/clip.h +106 -0
  174. package/cpp/tools/mtmd/miniaudio/miniaudio.h +93468 -0
  175. package/cpp/tools/mtmd/mtmd-audio.cpp +769 -0
  176. package/cpp/tools/mtmd/mtmd-audio.h +47 -0
  177. package/cpp/tools/mtmd/mtmd-helper.cpp +460 -0
  178. package/cpp/tools/mtmd/mtmd-helper.h +95 -0
  179. package/cpp/tools/mtmd/mtmd.cpp +1066 -0
  180. package/cpp/tools/mtmd/mtmd.h +302 -0
  181. package/cpp/tools/mtmd/stb/stb_image.h +7988 -0
  182. package/cpp/unicode-data.cpp +7034 -0
  183. package/cpp/unicode-data.h +20 -0
  184. package/cpp/unicode.cpp +1061 -0
  185. package/cpp/unicode.h +68 -0
  186. package/cpp/vendor/cpp-httplib/httplib.cpp +16509 -0
  187. package/cpp/vendor/cpp-httplib/httplib.h +3883 -0
  188. package/desktop/electron-builder.config.cjs +157 -0
  189. package/desktop/entitlements.mac.plist +12 -0
  190. package/desktop/package.json +11 -0
  191. package/desktop/resolve-package-root.cjs +88 -0
  192. package/desktop/src/main/backend-selector.cjs +148 -0
  193. package/desktop/src/main/gpu-probe.cjs +142 -0
  194. package/desktop/src/main/index.cjs +58 -0
  195. package/desktop/src/main/ipc-handlers.cjs +212 -0
  196. package/desktop/src/main/model-store.cjs +50 -0
  197. package/desktop/src/main/preload.cjs +39 -0
  198. package/desktop/src/main/sidecar-client.cjs +76 -0
  199. package/desktop/src/main/sidecar-manager.cjs +364 -0
  200. package/dist/docs.json +14357 -0
  201. package/dist/esm/definitions.d.ts +731 -0
  202. package/dist/esm/definitions.js +2 -0
  203. package/dist/esm/definitions.js.map +1 -0
  204. package/dist/esm/desktop.d.ts +37 -0
  205. package/dist/esm/desktop.js +133 -0
  206. package/dist/esm/desktop.js.map +1 -0
  207. package/dist/esm/index.d.ts +200 -0
  208. package/dist/esm/index.js +612 -0
  209. package/dist/esm/index.js.map +1 -0
  210. package/dist/esm/isomorphic/desktop.runtime.d.ts +37 -0
  211. package/dist/esm/isomorphic/desktop.runtime.js +36 -0
  212. package/dist/esm/isomorphic/desktop.runtime.js.map +1 -0
  213. package/dist/esm/isomorphic/errors.d.ts +6 -0
  214. package/dist/esm/isomorphic/errors.js +9 -0
  215. package/dist/esm/isomorphic/errors.js.map +1 -0
  216. package/dist/esm/isomorphic/model.admission.d.ts +17 -0
  217. package/dist/esm/isomorphic/model.admission.js +27 -0
  218. package/dist/esm/isomorphic/model.admission.js.map +1 -0
  219. package/dist/esm/isomorphic/model.scheduler.d.ts +31 -0
  220. package/dist/esm/isomorphic/model.scheduler.js +95 -0
  221. package/dist/esm/isomorphic/model.scheduler.js.map +1 -0
  222. package/dist/esm/isomorphic/provider.desktop.d.ts +40 -0
  223. package/dist/esm/isomorphic/provider.desktop.js +411 -0
  224. package/dist/esm/isomorphic/provider.desktop.js.map +1 -0
  225. package/dist/esm/isomorphic/provider.factory.d.ts +2 -0
  226. package/dist/esm/isomorphic/provider.factory.js +16 -0
  227. package/dist/esm/isomorphic/provider.factory.js.map +1 -0
  228. package/dist/esm/isomorphic/provider.interface.d.ts +76 -0
  229. package/dist/esm/isomorphic/provider.interface.js +2 -0
  230. package/dist/esm/isomorphic/provider.interface.js.map +1 -0
  231. package/dist/esm/isomorphic/provider.native.d.ts +18 -0
  232. package/dist/esm/isomorphic/provider.native.js +173 -0
  233. package/dist/esm/isomorphic/provider.native.js.map +1 -0
  234. package/dist/esm/isomorphic/provider.web.d.ts +88 -0
  235. package/dist/esm/isomorphic/provider.web.js +573 -0
  236. package/dist/esm/isomorphic/provider.web.js.map +1 -0
  237. package/dist/esm/isomorphic/sidecar-sse.d.ts +14 -0
  238. package/dist/esm/isomorphic/sidecar-sse.js +76 -0
  239. package/dist/esm/isomorphic/sidecar-sse.js.map +1 -0
  240. package/dist/esm/isomorphic/wasmMemoryCalibration.d.ts +26 -0
  241. package/dist/esm/isomorphic/wasmMemoryCalibration.js +60 -0
  242. package/dist/esm/isomorphic/wasmMemoryCalibration.js.map +1 -0
  243. package/dist/esm/isomorphic/wasmMemoryPolicy.d.ts +55 -0
  244. package/dist/esm/isomorphic/wasmMemoryPolicy.js +93 -0
  245. package/dist/esm/isomorphic/wasmMemoryPolicy.js.map +1 -0
  246. package/dist/esm/storage/manifest.d.ts +13 -0
  247. package/dist/esm/storage/manifest.js +87 -0
  248. package/dist/esm/storage/manifest.js.map +1 -0
  249. package/dist/esm/storage/opfs.store.d.ts +31 -0
  250. package/dist/esm/storage/opfs.store.js +241 -0
  251. package/dist/esm/storage/opfs.store.js.map +1 -0
  252. package/dist/esm/web.d.ts +206 -0
  253. package/dist/esm/web.js +521 -0
  254. package/dist/esm/web.js.map +1 -0
  255. package/dist/esm/workers/async-file.d.ts +13 -0
  256. package/dist/esm/workers/async-file.js +12 -0
  257. package/dist/esm/workers/async-file.js.map +1 -0
  258. package/dist/esm/workers/heapfs.d.ts +55 -0
  259. package/dist/esm/workers/heapfs.js +115 -0
  260. package/dist/esm/workers/heapfs.js.map +1 -0
  261. package/dist/esm/workers/wasm.engine.d.ts +86 -0
  262. package/dist/esm/workers/wasm.engine.js +504 -0
  263. package/dist/esm/workers/wasm.engine.js.map +1 -0
  264. package/dist/esm/workers/worker.protocol.d.ts +160 -0
  265. package/dist/esm/workers/worker.protocol.js +2 -0
  266. package/dist/esm/workers/worker.protocol.js.map +1 -0
  267. package/dist/plugin.cjs +3179 -0
  268. package/dist/plugin.cjs.map +1 -0
  269. package/dist/plugin.js +3181 -0
  270. package/dist/plugin.js.map +1 -0
  271. package/dist/wasm/llama_engine.d.ts +74 -0
  272. package/dist/wasm/llama_engine.js +1829 -0
  273. package/dist/wasm/llama_engine.wasm +0 -0
  274. package/dist/wasm/llama_engine_emscripten.mjs +2 -0
  275. package/dist/wasm/package.json +16 -0
  276. package/dist/workers/llm.worker.js +1226 -0
  277. package/dist/workers/llm.worker.js.map +7 -0
  278. package/extraResources/llama-wasm/llama_engine.d.ts +74 -0
  279. package/extraResources/llama-wasm/llama_engine.js +1829 -0
  280. package/extraResources/llama-wasm/llama_engine.wasm +0 -0
  281. package/extraResources/llama-wasm/llama_engine_emscripten.mjs +2 -0
  282. package/extraResources/llama-wasm/package.json +16 -0
  283. package/extraResources/sidecar/README.md +11 -0
  284. package/extraResources/sidecar/darwin-arm64 +0 -0
  285. package/extraResources/sidecar/darwin-x64 +0 -0
  286. package/ios/CMakeLists-arm64.txt +161 -0
  287. package/ios/CMakeLists-x86_64.txt +188 -0
  288. package/ios/CMakeLists.txt +161 -0
  289. package/ios/Frameworks/llama-cpp.framework/Info.plist +28 -0
  290. package/ios/Frameworks/llama-cpp.framework/llama-cpp +0 -0
  291. package/ios/Sources/LlamaCppCapacitor/LlamaCpp.swift +1365 -0
  292. package/ios/Sources/LlamaCppCapacitor/LlamaCppPlugin.swift +694 -0
  293. package/ios/Sources/LlamaCppCapacitor/LlamaNativeBridge.swift +349 -0
  294. package/ios/Sources/LlamaCppCapacitor/ModelAdmissionController.swift +177 -0
  295. package/ios/embed-metal-shaders.sh +24 -0
  296. package/ios/metal-embed.cmake +29 -0
  297. package/package.json +281 -0
  298. package/scripts/build-js-preserve-wasm.cjs +53 -0
  299. package/scripts/build-sidecar-linux.sh +6 -0
  300. package/scripts/build-sidecar-win.bat +19 -0
  301. package/scripts/build-sidecar.sh +184 -0
  302. package/scripts/embed-llama-ios-app-framework.sh +63 -0
  303. package/scripts/ensure-desktop-sidecar-bundle.cjs +103 -0
  304. package/scripts/ensure-llama-ios-xcframework.sh +108 -0
  305. package/scripts/fix-esm-extensions.cjs +45 -0
  306. package/scripts/prepare-js-dist.cjs +28 -0
  307. package/scripts/stage-desktop-resources.cjs +116 -0
  308. package/sidecar/CMakeLists.txt +192 -0
  309. package/sidecar/cap-sidecar-main.cpp +68 -0
  310. package/types/llama-cpp-pro.d.ts +441 -0
@@ -0,0 +1,1891 @@
1
+ #include "llama-graph.h"
2
+
3
+ #include "llama-impl.h"
4
+ #include "llama-batch.h"
5
+ #include "llama-cparams.h"
6
+
7
+ #include "llama-kv-cache.h"
8
+ #include "llama-kv-cache-iswa.h"
9
+ #include "llama-memory-hybrid.h"
10
+ #include "llama-memory-recurrent.h"
11
+
12
+ #include <cassert>
13
+ #include <cmath>
14
+ #include <cstring>
15
+
16
+ void llm_graph_input_embd::set_input(const llama_ubatch * ubatch) {
17
+ if (ubatch->token) {
18
+ const int64_t n_tokens = ubatch->n_tokens;
19
+
20
+ lm_ggml_backend_tensor_set(tokens, ubatch->token, 0, n_tokens*lm_ggml_element_size(tokens));
21
+ }
22
+
23
+ if (ubatch->embd) {
24
+ const int64_t n_embd = embd->ne[0];
25
+ const int64_t n_tokens = ubatch->n_tokens;
26
+
27
+ lm_ggml_backend_tensor_set(embd, ubatch->embd, 0, n_tokens*n_embd*lm_ggml_element_size(embd));
28
+ }
29
+ }
30
+
31
+ bool llm_graph_input_embd::can_reuse(const llm_graph_params & params) {
32
+ bool res = true;
33
+
34
+ res &= (!tokens && !params.ubatch.token) || (tokens && tokens->ne[0] == params.ubatch.n_tokens);
35
+ res &= (!embd && !params.ubatch.embd) || (embd && embd->ne[0] == params.ubatch.n_tokens);
36
+
37
+ return res;
38
+ }
39
+
40
+ void llm_graph_input_pos::set_input(const llama_ubatch * ubatch) {
41
+ if (ubatch->pos && pos) {
42
+ const int64_t n_tokens = ubatch->n_tokens;
43
+
44
+ if (ubatch->token && n_pos_per_embd == 4) {
45
+ // in case we're using M-RoPE with text tokens, convert the 1D positions to 4D
46
+ // the 3 first dims are the same, and 4th dim is all 0
47
+ std::vector<llama_pos> pos_data(n_tokens*n_pos_per_embd);
48
+ // copy the first dimension
49
+ for (int i = 0; i < n_tokens; ++i) {
50
+ pos_data[ i] = ubatch->pos[i];
51
+ pos_data[ n_tokens + i] = ubatch->pos[i];
52
+ pos_data[2 * n_tokens + i] = ubatch->pos[i];
53
+ pos_data[3 * n_tokens + i] = 0; // 4th dim is 0
54
+ }
55
+ lm_ggml_backend_tensor_set(pos, pos_data.data(), 0, pos_data.size()*lm_ggml_element_size(pos));
56
+ } else {
57
+ lm_ggml_backend_tensor_set(pos, ubatch->pos, 0, n_tokens*n_pos_per_embd*lm_ggml_element_size(pos));
58
+ }
59
+ }
60
+ }
61
+
62
+ bool llm_graph_input_pos::can_reuse(const llm_graph_params & params) {
63
+ bool res = true;
64
+
65
+ res &= pos->ne[0] == params.ubatch.n_tokens;
66
+
67
+ return res;
68
+ }
69
+
70
+ void llm_graph_input_attn_temp::set_input(const llama_ubatch * ubatch) {
71
+ if (ubatch->pos && attn_scale) {
72
+ const int64_t n_tokens = ubatch->n_tokens;
73
+
74
+ std::vector<float> attn_scale_data(n_tokens, 0.0f);
75
+ for (int i = 0; i < n_tokens; ++i) {
76
+ const float pos = ubatch->pos[i];
77
+ attn_scale_data[i] = std::log(
78
+ std::floor((pos + 1.0f) / n_attn_temp_floor_scale) + 1.0
79
+ ) * f_attn_temp_scale + 1.0;
80
+ }
81
+
82
+ lm_ggml_backend_tensor_set(attn_scale, attn_scale_data.data(), 0, n_tokens*lm_ggml_element_size(attn_scale));
83
+ }
84
+ }
85
+
86
+ void llm_graph_input_pos_bucket::set_input(const llama_ubatch * ubatch) {
87
+ if (pos_bucket) {
88
+ const int64_t n_tokens = ubatch->n_tokens;
89
+
90
+ LM_GGML_ASSERT(lm_ggml_backend_buffer_is_host(pos_bucket->buffer));
91
+ LM_GGML_ASSERT(!ubatch->equal_seqs()); // TODO: use ubatch->n_seqs instead of failing
92
+
93
+ int32_t * data = (int32_t *) pos_bucket->data;
94
+
95
+ for (int h = 0; h < 1; ++h) {
96
+ for (int j = 0; j < n_tokens; ++j) {
97
+ for (int i = 0; i < n_tokens; ++i) {
98
+ data[h*(n_tokens*n_tokens) + j*n_tokens + i] = llama_relative_position_bucket(ubatch->pos[i], ubatch->pos[j], hparams.n_rel_attn_bkts, true);
99
+ }
100
+ }
101
+ }
102
+ }
103
+ }
104
+
105
+ void llm_graph_input_pos_bucket_kv::set_input(const llama_ubatch * ubatch) {
106
+ if (pos_bucket) {
107
+ mctx->set_input_pos_bucket(pos_bucket, ubatch);
108
+ }
109
+ }
110
+
111
+ void llm_graph_input_out_ids::set_input(const llama_ubatch * ubatch) {
112
+ LM_GGML_ASSERT(out_ids);
113
+
114
+ const int64_t n_tokens = ubatch->n_tokens;
115
+
116
+ LM_GGML_ASSERT(lm_ggml_backend_buffer_is_host(out_ids->buffer));
117
+ int32_t * data = (int32_t *) out_ids->data;
118
+
119
+ if (n_outputs == n_tokens) {
120
+ for (int i = 0; i < n_tokens; ++i) {
121
+ data[i] = i;
122
+ }
123
+
124
+ return;
125
+ }
126
+
127
+ LM_GGML_ASSERT(ubatch->output);
128
+
129
+ int n_outputs = 0;
130
+
131
+ for (int i = 0; i < n_tokens; ++i) {
132
+ if (ubatch->output[i]) {
133
+ data[n_outputs++] = i;
134
+ }
135
+ }
136
+ }
137
+
138
+ bool llm_graph_input_out_ids::can_reuse(const llm_graph_params & params) {
139
+ bool res = true;
140
+
141
+ res &= n_outputs == params.n_outputs;
142
+
143
+ return res;
144
+ }
145
+
146
+ void llm_graph_input_mean::set_input(const llama_ubatch * ubatch) {
147
+ if (cparams.embeddings && cparams.pooling_type == LLAMA_POOLING_TYPE_MEAN) {
148
+ const int64_t n_tokens = ubatch->n_tokens;
149
+ const int64_t n_seq_tokens = ubatch->n_seq_tokens;
150
+ const int64_t n_seqs_unq = ubatch->n_seqs_unq;
151
+
152
+ LM_GGML_ASSERT(mean);
153
+ LM_GGML_ASSERT(lm_ggml_backend_buffer_is_host(mean->buffer));
154
+
155
+ float * data = (float *) mean->data;
156
+ memset(mean->data, 0, n_tokens*n_seqs_unq*lm_ggml_element_size(mean));
157
+
158
+ std::vector<uint64_t> sums(n_seqs_unq, 0);
159
+ for (int i = 0; i < n_tokens; i += n_seq_tokens) {
160
+ for (int s = 0; s < ubatch->n_seq_id[i]; ++s) {
161
+ const llama_seq_id seq_id = ubatch->seq_id[i][s];
162
+ const int32_t seq_idx = ubatch->seq_idx[seq_id];
163
+
164
+ sums[seq_idx] += ubatch->n_seq_tokens;
165
+ }
166
+ }
167
+
168
+ std::vector<float> div(n_seqs_unq, 0.0f);
169
+ for (int s = 0; s < n_seqs_unq; ++s) {
170
+ const uint64_t sum = sums[s];
171
+ if (sum > 0) {
172
+ div[s] = 1.0f/float(sum);
173
+ }
174
+ }
175
+
176
+ for (int i = 0; i < n_tokens; i += n_seq_tokens) {
177
+ for (int s = 0; s < ubatch->n_seq_id[i]; ++s) {
178
+ const llama_seq_id seq_id = ubatch->seq_id[i][s];
179
+ const int32_t seq_idx = ubatch->seq_idx[seq_id];
180
+
181
+ for (int j = 0; j < n_seq_tokens; ++j) {
182
+ data[seq_idx*n_tokens + i + j] = div[seq_idx];
183
+ }
184
+ }
185
+ }
186
+ }
187
+ }
188
+
189
+ void llm_graph_input_cls::set_input(const llama_ubatch * ubatch) {
190
+ const int64_t n_tokens = ubatch->n_tokens;
191
+ const int64_t n_seqs_unq = ubatch->n_seqs_unq;
192
+
193
+ if (cparams.embeddings && (
194
+ cparams.pooling_type == LLAMA_POOLING_TYPE_CLS ||
195
+ cparams.pooling_type == LLAMA_POOLING_TYPE_RANK ||
196
+ cparams.pooling_type == LLAMA_POOLING_TYPE_LAST
197
+ )) {
198
+ LM_GGML_ASSERT(cls);
199
+ LM_GGML_ASSERT(lm_ggml_backend_buffer_is_host(cls->buffer));
200
+
201
+ uint32_t * data = (uint32_t *) cls->data;
202
+ memset(cls->data, 0, n_seqs_unq*lm_ggml_element_size(cls));
203
+
204
+ std::vector<int> target_pos(n_seqs_unq, -1);
205
+ std::vector<int> target_row(n_seqs_unq, -1);
206
+
207
+ bool last = cparams.pooling_type == LLAMA_POOLING_TYPE_LAST;
208
+
209
+ for (int i = 0; i < n_tokens; ++i) {
210
+ const llama_pos pos = ubatch->pos[i];
211
+
212
+ for (int s = 0; s < ubatch->n_seq_id[i]; ++s) {
213
+ const llama_seq_id seq_id = ubatch->seq_id[i][s];
214
+ const int32_t seq_idx = ubatch->seq_idx[seq_id];
215
+
216
+ if (
217
+ (target_pos[seq_idx] == -1) ||
218
+ ( last && pos >= target_pos[seq_idx]) ||
219
+ (!last && pos < target_pos[seq_idx])
220
+ ) {
221
+ target_pos[seq_idx] = pos;
222
+ target_row[seq_idx] = i;
223
+ }
224
+ }
225
+ }
226
+
227
+ for (int s = 0; s < n_seqs_unq; ++s) {
228
+ if (target_row[s] >= 0) {
229
+ data[s] = target_row[s];
230
+ }
231
+ }
232
+ }
233
+ }
234
+
235
+ void llm_graph_input_rs::set_input(const llama_ubatch * ubatch) {
236
+ LM_GGML_UNUSED(ubatch);
237
+
238
+ const int64_t n_rs = mctx->get_n_rs();
239
+
240
+ if (s_copy) {
241
+ LM_GGML_ASSERT(lm_ggml_backend_buffer_is_host(s_copy->buffer));
242
+ int32_t * data = (int32_t *) s_copy->data;
243
+
244
+ // assuming copy destinations ALWAYS happen ONLY on the cells between head and head+n
245
+ for (uint32_t i = 0; i < n_rs; ++i) {
246
+ data[i] = mctx->s_copy(i);
247
+ }
248
+ }
249
+ }
250
+
251
+ void llm_graph_input_cross_embd::set_input(const llama_ubatch * ubatch) {
252
+ LM_GGML_UNUSED(ubatch);
253
+
254
+ if (cross_embd && !cross->v_embd.empty()) {
255
+ assert(cross_embd->type == LM_GGML_TYPE_F32);
256
+
257
+ lm_ggml_backend_tensor_set(cross_embd, cross->v_embd.data(), 0, lm_ggml_nbytes(cross_embd));
258
+ }
259
+ }
260
+
261
+ void llm_graph_input_attn_no_cache::set_input(const llama_ubatch * ubatch) {
262
+ const int64_t n_kv = ubatch->n_tokens;
263
+ const int64_t n_tokens = ubatch->n_tokens;
264
+
265
+ LM_GGML_ASSERT(kq_mask);
266
+ LM_GGML_ASSERT(lm_ggml_backend_buffer_is_host(kq_mask->buffer));
267
+
268
+ float * data = (float *) kq_mask->data;
269
+
270
+ for (int h = 0; h < 1; ++h) {
271
+ for (int i1 = 0; i1 < n_tokens; ++i1) {
272
+ const llama_seq_id s1 = ubatch->seq_id[i1][0];
273
+
274
+ for (int i0 = 0; i0 < n_tokens; ++i0) {
275
+ float f = -INFINITY;
276
+
277
+ for (int s = 0; s < ubatch->n_seq_id[i0]; ++s) {
278
+ const llama_seq_id s0 = ubatch->seq_id[i0][0];
279
+
280
+ // TODO: reimplement this like in llama_kv_cache
281
+ if (s0 == s1 && (!cparams.causal_attn || ubatch->pos[i0] <= ubatch->pos[i1])) {
282
+ if (hparams.use_alibi) {
283
+ f = -std::abs(ubatch->pos[i0] - ubatch->pos[i1]);
284
+ } else {
285
+ f = 0.0f;
286
+ }
287
+ break;
288
+ }
289
+ }
290
+
291
+ data[h*(n_kv*n_tokens) + i1*n_kv + i0] = f;
292
+ }
293
+ }
294
+ }
295
+ }
296
+
297
+ void llm_graph_input_attn_kv::set_input(const llama_ubatch * ubatch) {
298
+ mctx->set_input_k_idxs(self_k_idxs, ubatch);
299
+ mctx->set_input_v_idxs(self_v_idxs, ubatch);
300
+
301
+ mctx->set_input_kq_mask(self_kq_mask, ubatch, cparams.causal_attn);
302
+ }
303
+
304
+ bool llm_graph_input_attn_kv::can_reuse(const llm_graph_params & params) {
305
+ const auto * mctx = static_cast<const llama_kv_cache_context *>(params.mctx);
306
+
307
+ this->mctx = mctx;
308
+
309
+ bool res = true;
310
+
311
+ res &= self_k_idxs->ne[0] == params.ubatch.n_tokens;
312
+ //res &= self_v_idxs->ne[0] == params.ubatch.n_tokens; // TODO: need to move this to the unified cache and check there
313
+
314
+ res &= self_kq_mask->ne[0] == mctx->get_n_kv();
315
+ res &= self_kq_mask->ne[1] == LM_GGML_PAD(params.ubatch.n_tokens, LM_GGML_KQ_MASK_PAD);
316
+
317
+ res &= mctx->get_supports_set_rows(); // TODO: tmp
318
+
319
+ return res;
320
+ }
321
+
322
+ void llm_graph_input_attn_kv_iswa::set_input(const llama_ubatch * ubatch) {
323
+ mctx->get_base()->set_input_k_idxs(self_k_idxs, ubatch);
324
+ mctx->get_base()->set_input_v_idxs(self_v_idxs, ubatch);
325
+
326
+ mctx->get_base()->set_input_kq_mask(self_kq_mask, ubatch, cparams.causal_attn);
327
+
328
+ mctx->get_swa()->set_input_k_idxs(self_k_idxs_swa, ubatch);
329
+ mctx->get_swa()->set_input_v_idxs(self_v_idxs_swa, ubatch);
330
+
331
+ mctx->get_swa()->set_input_kq_mask(self_kq_mask_swa, ubatch, cparams.causal_attn);
332
+ }
333
+
334
+ bool llm_graph_input_attn_kv_iswa::can_reuse(const llm_graph_params & params) {
335
+ const auto * mctx = static_cast<const llama_kv_cache_iswa_context *>(params.mctx);
336
+
337
+ this->mctx = mctx;
338
+
339
+ bool res = true;
340
+
341
+ res &= self_k_idxs->ne[0] == params.ubatch.n_tokens;
342
+ //res &= self_v_idxs->ne[0] == params.ubatch.n_tokens; // TODO: need to move this to the unified cache and check there
343
+
344
+ res &= self_k_idxs_swa->ne[0] == params.ubatch.n_tokens;
345
+ //res &= self_v_idxs_swa->ne[0] == params.ubatch.n_tokens; // TODO: need to move this to the unified cache and check there
346
+
347
+ res &= self_kq_mask->ne[0] == mctx->get_base()->get_n_kv();
348
+ res &= self_kq_mask->ne[1] == LM_GGML_PAD(params.ubatch.n_tokens, LM_GGML_KQ_MASK_PAD);
349
+
350
+ res &= self_kq_mask_swa->ne[0] == mctx->get_swa()->get_n_kv();
351
+ res &= self_kq_mask_swa->ne[1] == LM_GGML_PAD(params.ubatch.n_tokens, LM_GGML_KQ_MASK_PAD);
352
+
353
+ res &= mctx->get_base()->get_supports_set_rows(); // TODO: tmp
354
+
355
+ return res;
356
+ }
357
+
358
+ void llm_graph_input_attn_cross::set_input(const llama_ubatch * ubatch) {
359
+ LM_GGML_ASSERT(cross_kq_mask);
360
+
361
+ const int64_t n_enc = cross_kq_mask->ne[0];
362
+ const int64_t n_tokens = ubatch->n_tokens;
363
+
364
+ LM_GGML_ASSERT(lm_ggml_backend_buffer_is_host(cross_kq_mask->buffer));
365
+ LM_GGML_ASSERT(!ubatch->equal_seqs()); // TODO: use ubatch->n_seqs instead of failing
366
+
367
+ float * data = (float *) cross_kq_mask->data;
368
+
369
+ for (int h = 0; h < 1; ++h) {
370
+ for (int i = 0; i < n_tokens; ++i) {
371
+ for (int j = 0; j < n_enc; ++j) {
372
+ float f = -INFINITY;
373
+
374
+ for (int s = 0; s < ubatch->n_seq_id[i]; ++s) {
375
+ const llama_seq_id seq_id = ubatch->seq_id[i][s];
376
+
377
+ if (cross->seq_ids_enc[j].find(seq_id) != cross->seq_ids_enc[j].end()) {
378
+ f = 0.0f;
379
+ }
380
+ }
381
+
382
+ data[h*(n_enc*n_tokens) + i*n_enc + j] = f;
383
+ }
384
+ }
385
+
386
+ for (int i = n_tokens; i < LM_GGML_PAD(n_tokens, LM_GGML_KQ_MASK_PAD); ++i) {
387
+ for (int j = 0; j < n_enc; ++j) {
388
+ data[h*(n_enc*n_tokens) + i*n_enc + j] = -INFINITY;
389
+ }
390
+ }
391
+ }
392
+ }
393
+
394
+ void llm_graph_input_mem_hybrid::set_input(const llama_ubatch * ubatch) {
395
+ inp_attn->set_input(ubatch);
396
+ inp_rs->set_input(ubatch);
397
+ }
398
+
399
+ //
400
+ // llm_graph_result
401
+ //
402
+
403
+ llm_graph_result::llm_graph_result(int64_t max_nodes) : max_nodes(max_nodes) {
404
+ reset();
405
+
406
+ const char * LLAMA_GRAPH_RESULT_DEBUG = getenv("LLAMA_GRAPH_RESULT_DEBUG");
407
+ debug = LLAMA_GRAPH_RESULT_DEBUG ? atoi(LLAMA_GRAPH_RESULT_DEBUG) : 0;
408
+ }
409
+
410
+ int64_t llm_graph_result::get_max_nodes() const {
411
+ return max_nodes;
412
+ }
413
+
414
+ void llm_graph_result::reset() {
415
+ t_tokens = nullptr;
416
+ t_logits = nullptr;
417
+ t_embd = nullptr;
418
+ t_embd_pooled = nullptr;
419
+
420
+ params = {};
421
+
422
+ inputs.clear();
423
+
424
+ buf_compute_meta.resize(lm_ggml_tensor_overhead()*max_nodes + lm_ggml_graph_overhead_custom(max_nodes, false));
425
+
426
+ lm_ggml_init_params params = {
427
+ /*.mem_size =*/ buf_compute_meta.size(),
428
+ /*.mem_buffer =*/ buf_compute_meta.data(),
429
+ /*.no_alloc =*/ true,
430
+ };
431
+
432
+ ctx_compute.reset(lm_ggml_init(params));
433
+
434
+ gf = lm_ggml_new_graph_custom(ctx_compute.get(), max_nodes, false);
435
+ }
436
+
437
+ void llm_graph_result::set_inputs(const llama_ubatch * ubatch) {
438
+ for (auto & input : inputs) {
439
+ input->set_input(ubatch);
440
+ }
441
+ }
442
+
443
+ bool llm_graph_result::can_reuse(const llm_graph_params & params) {
444
+ if (!this->params.allow_reuse(params)) {
445
+ if (debug > 1) {
446
+ LLAMA_LOG_DEBUG("%s: cannot reuse graph due to incompatible graph parameters\n", __func__);
447
+ }
448
+
449
+ return false;
450
+ }
451
+
452
+ if (debug > 1) {
453
+ LLAMA_LOG_DEBUG("%s: checking compatibility of %d inputs:\n", __func__, (int) inputs.size());
454
+ }
455
+
456
+ bool res = true;
457
+
458
+ for (auto & input : inputs) {
459
+ const bool cur = input->can_reuse(params);
460
+
461
+ if (debug > 1) {
462
+ LLAMA_LOG_DEBUG("%s: can_reuse = %d\n", "placeholder", cur);
463
+ }
464
+
465
+ res = res && cur;
466
+ }
467
+
468
+ if (debug > 0) {
469
+ LLAMA_LOG_DEBUG("%s: can reuse graph = %d\n", __func__, res);
470
+ }
471
+
472
+ return res;
473
+ }
474
+
475
+ llm_graph_input_i * llm_graph_result::add_input(llm_graph_input_ptr input) {
476
+ inputs.emplace_back(std::move(input));
477
+ return inputs.back().get();
478
+ }
479
+
480
+ void llm_graph_result::set_params(const llm_graph_params & params) {
481
+ this->params = params;
482
+ }
483
+
484
+ //
485
+ // llm_graph_context
486
+ //
487
+
488
+ llm_graph_context::llm_graph_context(const llm_graph_params & params) :
489
+ arch (params.arch),
490
+ hparams (params.hparams),
491
+ cparams (params.cparams),
492
+ ubatch (params.ubatch),
493
+ n_embd (hparams.n_embd),
494
+ n_layer (hparams.n_layer),
495
+ n_rot (hparams.n_rot),
496
+ n_ctx (cparams.n_ctx),
497
+ n_head (hparams.n_head()),
498
+ n_head_kv (hparams.n_head_kv()),
499
+ n_embd_head_k (hparams.n_embd_head_k),
500
+ n_embd_k_gqa (hparams.n_embd_k_gqa()),
501
+ n_embd_head_v (hparams.n_embd_head_v),
502
+ n_embd_v_gqa (hparams.n_embd_v_gqa()),
503
+ n_expert (hparams.n_expert),
504
+ n_expert_used (cparams.warmup ? hparams.n_expert : hparams.n_expert_used),
505
+ freq_base (cparams.rope_freq_base),
506
+ freq_scale (cparams.rope_freq_scale),
507
+ ext_factor (cparams.yarn_ext_factor),
508
+ attn_factor (cparams.yarn_attn_factor),
509
+ beta_fast (cparams.yarn_beta_fast),
510
+ beta_slow (cparams.yarn_beta_slow),
511
+ norm_eps (hparams.f_norm_eps),
512
+ norm_rms_eps (hparams.f_norm_rms_eps),
513
+ n_tokens (ubatch.n_tokens),
514
+ n_outputs (params.n_outputs),
515
+ n_ctx_orig (cparams.n_ctx_orig_yarn),
516
+ pooling_type (cparams.pooling_type),
517
+ rope_type (hparams.rope_type),
518
+ sched (params.sched),
519
+ backend_cpu (params.backend_cpu),
520
+ cvec (params.cvec),
521
+ loras (params.loras),
522
+ mctx (params.mctx),
523
+ cross (params.cross),
524
+ cb_func (params.cb),
525
+ res (params.res),
526
+ ctx0 (res->get_ctx()),
527
+ gf (res->get_gf()) {
528
+ res->set_params(params);
529
+ }
530
+
531
+ void llm_graph_context::cb(lm_ggml_tensor * cur, const char * name, int il) const {
532
+ if (cb_func) {
533
+ cb_func(ubatch, cur, name, il);
534
+ }
535
+ }
536
+
537
+ lm_ggml_tensor * llm_graph_context::build_cvec(
538
+ lm_ggml_tensor * cur,
539
+ int il) const {
540
+ return cvec->apply_to(ctx0, cur, il);
541
+ }
542
+
543
+ lm_ggml_tensor * llm_graph_context::build_lora_mm(
544
+ lm_ggml_tensor * w,
545
+ lm_ggml_tensor * cur) const {
546
+ lm_ggml_tensor * res = lm_ggml_mul_mat(ctx0, w, cur);
547
+
548
+ for (const auto & lora : *loras) {
549
+ llama_adapter_lora_weight * lw = lora.first->get_weight(w);
550
+ if (lw == nullptr) {
551
+ continue;
552
+ }
553
+
554
+ const float adapter_scale = lora.second;
555
+ const float scale = lw->get_scale(lora.first->alpha, adapter_scale);
556
+
557
+ lm_ggml_tensor * ab_cur = lm_ggml_mul_mat(
558
+ ctx0, lw->b,
559
+ lm_ggml_mul_mat(ctx0, lw->a, cur)
560
+ );
561
+
562
+ ab_cur = lm_ggml_scale(ctx0, ab_cur, scale);
563
+ res = lm_ggml_add(ctx0, res, ab_cur);
564
+ }
565
+
566
+ return res;
567
+ }
568
+
569
+ lm_ggml_tensor * llm_graph_context::build_lora_mm_id(
570
+ lm_ggml_tensor * w, // lm_ggml_tensor * as
571
+ lm_ggml_tensor * cur, // lm_ggml_tensor * b
572
+ lm_ggml_tensor * ids) const {
573
+ lm_ggml_tensor * res = lm_ggml_mul_mat_id(ctx0, w, cur, ids);
574
+ for (const auto & lora : *loras) {
575
+ llama_adapter_lora_weight * lw = lora.first->get_weight(w);
576
+ if (lw == nullptr) {
577
+ continue;
578
+ }
579
+
580
+ const float alpha = lora.first->alpha;
581
+ const float rank = (float) lw->b->ne[0];
582
+ const float scale = alpha ? lora.second * alpha / rank : lora.second;
583
+
584
+ lm_ggml_tensor * ab_cur = lm_ggml_mul_mat_id(
585
+ ctx0, lw->b,
586
+ lm_ggml_mul_mat_id(ctx0, lw->a, cur, ids),
587
+ ids
588
+ );
589
+
590
+ ab_cur = lm_ggml_scale(ctx0, ab_cur, scale);
591
+ res = lm_ggml_add(ctx0, res, ab_cur);
592
+ }
593
+
594
+ return res;
595
+ }
596
+
597
+ lm_ggml_tensor * llm_graph_context::build_norm(
598
+ lm_ggml_tensor * cur,
599
+ lm_ggml_tensor * mw,
600
+ lm_ggml_tensor * mb,
601
+ llm_norm_type type,
602
+ int il) const {
603
+ switch (type) {
604
+ case LLM_NORM: cur = lm_ggml_norm (ctx0, cur, hparams.f_norm_eps); break;
605
+ case LLM_NORM_RMS: cur = lm_ggml_rms_norm(ctx0, cur, hparams.f_norm_rms_eps); break;
606
+ case LLM_NORM_GROUP:
607
+ {
608
+ cur = lm_ggml_reshape_3d(ctx0, cur, cur->ne[0], 1, cur->ne[1]);
609
+ cur = lm_ggml_group_norm(ctx0, cur, hparams.n_norm_groups, hparams.f_norm_group_eps);
610
+ cur = lm_ggml_reshape_2d(ctx0, cur, cur->ne[0], cur->ne[2]);
611
+ } break;
612
+ }
613
+
614
+ if (mw || mb) {
615
+ cb(cur, "norm", il);
616
+ }
617
+
618
+ if (mw) {
619
+ cur = lm_ggml_mul(ctx0, cur, mw);
620
+ if (mb) {
621
+ cb(cur, "norm_w", il);
622
+ }
623
+ }
624
+
625
+ if (mb) {
626
+ cur = lm_ggml_add(ctx0, cur, mb);
627
+ }
628
+
629
+ return cur;
630
+ }
631
+
632
+ lm_ggml_tensor * llm_graph_context::build_ffn(
633
+ lm_ggml_tensor * cur,
634
+ lm_ggml_tensor * up,
635
+ lm_ggml_tensor * up_b,
636
+ lm_ggml_tensor * up_s,
637
+ lm_ggml_tensor * gate,
638
+ lm_ggml_tensor * gate_b,
639
+ lm_ggml_tensor * gate_s,
640
+ lm_ggml_tensor * down,
641
+ lm_ggml_tensor * down_b,
642
+ lm_ggml_tensor * down_s,
643
+ lm_ggml_tensor * act_scales,
644
+ llm_ffn_op_type type_op,
645
+ llm_ffn_gate_type type_gate,
646
+ int il) const {
647
+ lm_ggml_tensor * tmp = up ? build_lora_mm(up, cur) : cur;
648
+ cb(tmp, "ffn_up", il);
649
+
650
+ if (up_b) {
651
+ tmp = lm_ggml_add(ctx0, tmp, up_b);
652
+ cb(tmp, "ffn_up_b", il);
653
+ }
654
+
655
+ if (up_s) {
656
+ tmp = lm_ggml_mul(ctx0, tmp, up_s);
657
+ cb(tmp, "ffn_up_s", il);
658
+ }
659
+
660
+ if (gate) {
661
+ switch (type_gate) {
662
+ case LLM_FFN_SEQ:
663
+ {
664
+ cur = build_lora_mm(gate, tmp);
665
+ cb(cur, "ffn_gate", il);
666
+ } break;
667
+ case LLM_FFN_PAR:
668
+ {
669
+ cur = build_lora_mm(gate, cur);
670
+ cb(cur, "ffn_gate", il);
671
+ } break;
672
+ }
673
+
674
+ if (gate_b) {
675
+ cur = lm_ggml_add(ctx0, cur, gate_b);
676
+ cb(cur, "ffn_gate_b", il);
677
+ }
678
+
679
+ if (gate_s) {
680
+ cur = lm_ggml_mul(ctx0, cur, gate_s);
681
+ cb(cur, "ffn_gate_s", il);
682
+ }
683
+
684
+ } else {
685
+ cur = tmp;
686
+ }
687
+
688
+ switch (type_op) {
689
+ case LLM_FFN_SILU:
690
+ if (gate && type_gate == LLM_FFN_PAR) {
691
+ cur = lm_ggml_swiglu_split(ctx0, cur, tmp);
692
+ cb(cur, "ffn_swiglu", il);
693
+ type_gate = LLM_FFN_SEQ;
694
+ } else {
695
+ cur = lm_ggml_silu(ctx0, cur);
696
+ cb(cur, "ffn_silu", il);
697
+ } break;
698
+ case LLM_FFN_GELU:
699
+ if (gate && type_gate == LLM_FFN_PAR) {
700
+ cur = lm_ggml_geglu_split(ctx0, cur, tmp);
701
+ cb(cur, "ffn_geglu", il);
702
+ type_gate = LLM_FFN_SEQ;
703
+ } else {
704
+ cur = lm_ggml_gelu(ctx0, cur);
705
+ cb(cur, "ffn_gelu", il);
706
+ if (act_scales != NULL) {
707
+ cur = lm_ggml_div(ctx0, cur, act_scales);
708
+ cb(cur, "ffn_act", il);
709
+ }
710
+ } break;
711
+ case LLM_FFN_RELU:
712
+ if (gate && type_gate == LLM_FFN_PAR) {
713
+ cur = lm_ggml_reglu_split(ctx0, cur, tmp);
714
+ cb(cur, "ffn_reglu", il);
715
+ type_gate = LLM_FFN_SEQ;
716
+ } else {
717
+ cur = lm_ggml_relu(ctx0, cur);
718
+ cb(cur, "ffn_relu", il);
719
+ } break;
720
+ case LLM_FFN_RELU_SQR:
721
+ {
722
+ cur = lm_ggml_relu(ctx0, cur);
723
+ cb(cur, "ffn_relu", il);
724
+
725
+ cur = lm_ggml_sqr(ctx0, cur);
726
+ cb(cur, "ffn_sqr(relu)", il);
727
+ } break;
728
+ case LLM_FFN_SWIGLU:
729
+ {
730
+ cur = lm_ggml_swiglu(ctx0, cur);
731
+ cb(cur, "ffn_swiglu", il);
732
+ } break;
733
+ case LLM_FFN_GEGLU:
734
+ {
735
+ cur = lm_ggml_geglu(ctx0, cur);
736
+ cb(cur, "ffn_geglu", il);
737
+ } break;
738
+ case LLM_FFN_REGLU:
739
+ {
740
+ cur = lm_ggml_reglu(ctx0, cur);
741
+ cb(cur, "ffn_reglu", il);
742
+ } break;
743
+ default:
744
+ LM_GGML_ABORT("fatal error");
745
+ }
746
+
747
+ if (gate && type_gate == LLM_FFN_PAR) {
748
+ cur = lm_ggml_mul(ctx0, cur, tmp);
749
+ cb(cur, "ffn_gate_par", il);
750
+ }
751
+
752
+ if (down) {
753
+ cur = build_lora_mm(down, cur);
754
+ if (arch == LLM_ARCH_GLM4 || arch == LLM_ARCH_GLM4_MOE) {
755
+ // GLM4 and GLM4_MOE seem to have numerical issues with half-precision accumulators
756
+ lm_ggml_mul_mat_set_prec(cur, LM_GGML_PREC_F32);
757
+ }
758
+ }
759
+
760
+ if (down_b) {
761
+ cb(cur, "ffn_down", il);
762
+ }
763
+
764
+ if (down_b) {
765
+ cur = lm_ggml_add(ctx0, cur, down_b);
766
+ }
767
+
768
+ if (down_s) {
769
+ cur = lm_ggml_mul(ctx0, cur, down_s);
770
+ cb(cur, "ffn_down_s", il);
771
+ }
772
+
773
+ return cur;
774
+ }
775
+
776
+ lm_ggml_tensor * llm_graph_context::build_moe_ffn(
777
+ lm_ggml_tensor * cur,
778
+ lm_ggml_tensor * gate_inp,
779
+ lm_ggml_tensor * up_exps,
780
+ lm_ggml_tensor * gate_exps,
781
+ lm_ggml_tensor * down_exps,
782
+ lm_ggml_tensor * exp_probs_b,
783
+ int64_t n_expert,
784
+ int64_t n_expert_used,
785
+ llm_ffn_op_type type_op,
786
+ bool norm_w,
787
+ bool scale_w,
788
+ float w_scale,
789
+ llama_expert_gating_func_type gating_op,
790
+ int il,
791
+ lm_ggml_tensor * probs_in) const {
792
+ return build_moe_ffn(
793
+ cur,
794
+ gate_inp, /* gate_inp_b */ nullptr,
795
+ up_exps, /* up_exps_b */ nullptr,
796
+ gate_exps, /* gate_exps_b */ nullptr,
797
+ down_exps, /* down_exps_b */ nullptr,
798
+ exp_probs_b,
799
+ n_expert,
800
+ n_expert_used,
801
+ type_op,
802
+ norm_w,
803
+ scale_w,
804
+ w_scale,
805
+ gating_op,
806
+ il,
807
+ probs_in
808
+ );
809
+ }
810
+
811
+ lm_ggml_tensor * llm_graph_context::build_moe_ffn(
812
+ lm_ggml_tensor * cur,
813
+ lm_ggml_tensor * gate_inp,
814
+ lm_ggml_tensor * gate_inp_b,
815
+ lm_ggml_tensor * up_exps,
816
+ lm_ggml_tensor * up_exps_b,
817
+ lm_ggml_tensor * gate_exps,
818
+ lm_ggml_tensor * gate_exps_b,
819
+ lm_ggml_tensor * down_exps,
820
+ lm_ggml_tensor * down_exps_b,
821
+ lm_ggml_tensor * exp_probs_b,
822
+ int64_t n_expert,
823
+ int64_t n_expert_used,
824
+ llm_ffn_op_type type_op,
825
+ bool norm_w,
826
+ bool scale_w,
827
+ float w_scale,
828
+ llama_expert_gating_func_type gating_op,
829
+ int il,
830
+ lm_ggml_tensor * probs_in) const {
831
+ const int64_t n_embd = cur->ne[0];
832
+ const int64_t n_tokens = cur->ne[1];
833
+ const bool weight_before_ffn = arch == LLM_ARCH_LLAMA4; // for llama4, we apply the sigmoid-ed weights before the FFN
834
+
835
+ lm_ggml_tensor * logits = nullptr;
836
+
837
+ if (probs_in == nullptr) {
838
+ logits = build_lora_mm(gate_inp, cur); // [n_expert, n_tokens]
839
+ cb(logits, "ffn_moe_logits", il);
840
+ } else {
841
+ logits = probs_in;
842
+ }
843
+
844
+ if (gate_inp_b) {
845
+ logits = lm_ggml_add(ctx0, logits, gate_inp_b);
846
+ cb(logits, "ffn_moe_logits_biased", il);
847
+ }
848
+
849
+ lm_ggml_tensor * probs = nullptr;
850
+ switch (gating_op) {
851
+ case LLAMA_EXPERT_GATING_FUNC_TYPE_SOFTMAX:
852
+ {
853
+ probs = lm_ggml_soft_max(ctx0, logits); // [n_expert, n_tokens]
854
+ } break;
855
+ case LLAMA_EXPERT_GATING_FUNC_TYPE_SIGMOID:
856
+ {
857
+ probs = lm_ggml_sigmoid(ctx0, logits); // [n_expert, n_tokens]
858
+ } break;
859
+ case LLAMA_EXPERT_GATING_FUNC_TYPE_SOFTMAX_WEIGHT:
860
+ {
861
+ probs = logits; // [n_expert, n_tokens]
862
+ } break;
863
+ default:
864
+ LM_GGML_ABORT("fatal error");
865
+ }
866
+ cb(probs, "ffn_moe_probs", il);
867
+
868
+ // add experts selection bias - introduced in DeepSeek V3
869
+ // leave probs unbiased as it's later used to get expert weights
870
+ lm_ggml_tensor * selection_probs = probs;
871
+ if (exp_probs_b != nullptr) {
872
+ selection_probs = lm_ggml_add(ctx0, probs, exp_probs_b);
873
+ cb(selection_probs, "ffn_moe_probs_biased", il);
874
+ }
875
+
876
+ // llama4 doesn't have exp_probs_b, and sigmoid is only used after top_k
877
+ // see: https://github.com/meta-llama/llama-models/blob/699a02993512fb36936b1b0741e13c06790bcf98/models/llama4/moe.py#L183-L198
878
+ if (arch == LLM_ARCH_LLAMA4) {
879
+ selection_probs = logits;
880
+ }
881
+
882
+ // select experts
883
+ lm_ggml_tensor * selected_experts = lm_ggml_top_k(ctx0, selection_probs, n_expert_used); // [n_expert_used, n_tokens]
884
+ cb(selected_experts->src[0], "ffn_moe_argsort", il);
885
+ cb(selected_experts, "ffn_moe_topk", il);
886
+
887
+ lm_ggml_tensor * weights = lm_ggml_get_rows(ctx0,
888
+ lm_ggml_reshape_3d(ctx0, probs, 1, n_expert, n_tokens), selected_experts); // [1, n_expert_used, n_tokens]
889
+ cb(weights, "ffn_moe_weights", il);
890
+
891
+ if (gating_op == LLAMA_EXPERT_GATING_FUNC_TYPE_SOFTMAX_WEIGHT) {
892
+ weights = lm_ggml_reshape_2d(ctx0, weights, n_expert_used, n_tokens);
893
+ weights = lm_ggml_soft_max(ctx0, weights); // [n_expert_used, n_tokens]
894
+ weights = lm_ggml_reshape_3d(ctx0, weights, 1, n_expert_used, n_tokens);
895
+ cb(weights, "ffn_moe_weights_softmax", il);
896
+ }
897
+
898
+ if (norm_w) {
899
+ weights = lm_ggml_reshape_2d(ctx0, weights, n_expert_used, n_tokens);
900
+
901
+ lm_ggml_tensor * weights_sum = lm_ggml_sum_rows(ctx0, weights); // [1, n_tokens]
902
+ cb(weights_sum, "ffn_moe_weights_sum", il);
903
+
904
+ weights = lm_ggml_div(ctx0, weights, weights_sum); // [n_expert_used, n_tokens]
905
+ cb(weights, "ffn_moe_weights_norm", il);
906
+
907
+ weights = lm_ggml_reshape_3d(ctx0, weights, 1, n_expert_used, n_tokens);
908
+ }
909
+ if (scale_w) {
910
+ weights = lm_ggml_scale(ctx0, weights, w_scale);
911
+ cb(weights, "ffn_moe_weights_scaled", il);
912
+ }
913
+
914
+ cur = lm_ggml_reshape_3d(ctx0, cur, n_embd, 1, n_tokens);
915
+
916
+ if (weight_before_ffn) {
917
+ // repeat cur to [n_embd, n_expert_used, n_tokens]
918
+ lm_ggml_tensor * repeated = lm_ggml_repeat_4d(ctx0, cur, n_embd, n_expert_used, n_tokens, 1);
919
+ cur = lm_ggml_mul(ctx0, repeated, weights);
920
+ cb(cur, "ffn_moe_weighted", il);
921
+ }
922
+
923
+ lm_ggml_tensor * up = build_lora_mm_id(up_exps, cur, selected_experts); // [n_ff, n_expert_used, n_tokens]
924
+ cb(up, "ffn_moe_up", il);
925
+
926
+ if (up_exps_b) {
927
+ up = lm_ggml_add_id(ctx0, up, up_exps_b, selected_experts);
928
+ cb(up, "ffn_moe_up_biased", il);
929
+ }
930
+
931
+ lm_ggml_tensor * experts = nullptr;
932
+ if (gate_exps) {
933
+ cur = build_lora_mm_id(gate_exps, cur, selected_experts); // [n_ff, n_expert_used, n_tokens]
934
+ cb(cur, "ffn_moe_gate", il);
935
+ } else {
936
+ cur = up;
937
+ }
938
+
939
+ if (gate_exps_b) {
940
+ cur = lm_ggml_add_id(ctx0, cur, gate_exps_b, selected_experts);
941
+ cb(cur, "ffn_moe_gate_biased", il);
942
+ }
943
+
944
+ switch (type_op) {
945
+ case LLM_FFN_SILU:
946
+ if (gate_exps) {
947
+ cur = lm_ggml_swiglu_split(ctx0, cur, up);
948
+ cb(cur, "ffn_moe_swiglu", il);
949
+ } else {
950
+ cur = lm_ggml_silu(ctx0, cur);
951
+ cb(cur, "ffn_moe_silu", il);
952
+ } break;
953
+ case LLM_FFN_GELU:
954
+ if (gate_exps) {
955
+ cur = lm_ggml_geglu_split(ctx0, cur, up);
956
+ cb(cur, "ffn_moe_geglu", il);
957
+ } else {
958
+ cur = lm_ggml_gelu(ctx0, cur);
959
+ cb(cur, "ffn_moe_gelu", il);
960
+ } break;
961
+ case LLM_FFN_SWIGLU_OAI_MOE:
962
+ {
963
+ // TODO: move to hparams?
964
+ constexpr float alpha = 1.702f;
965
+ constexpr float limit = 7.0f;
966
+ cur = lm_ggml_swiglu_oai(ctx0, cur, up, alpha, limit);
967
+ cb(cur, "ffn_moe_swiglu_oai", il);
968
+ } break;
969
+ case LLM_FFN_RELU:
970
+ if (gate_exps) {
971
+ cur = lm_ggml_reglu_split(ctx0, cur, up);
972
+ cb(cur, "ffn_moe_reglu", il);
973
+ } else {
974
+ cur = lm_ggml_relu(ctx0, cur);
975
+ cb(cur, "ffn_moe_relu", il);
976
+ } break;
977
+ default:
978
+ LM_GGML_ABORT("fatal error");
979
+ }
980
+
981
+ experts = build_lora_mm_id(down_exps, cur, selected_experts); // [n_embd, n_expert_used, n_tokens]
982
+ cb(experts, "ffn_moe_down", il);
983
+
984
+ if (down_exps_b) {
985
+ experts = lm_ggml_add_id(ctx0, experts, down_exps_b, selected_experts);
986
+ cb(experts, "ffn_moe_down_biased", il);
987
+ }
988
+
989
+ if (!weight_before_ffn) {
990
+ experts = lm_ggml_mul(ctx0, experts, weights);
991
+ cb(cur, "ffn_moe_weighted", il);
992
+ }
993
+
994
+ lm_ggml_tensor * cur_experts[LLAMA_MAX_EXPERTS] = { nullptr };
995
+
996
+ assert(n_expert_used > 0);
997
+
998
+ // order the views before the adds
999
+ for (uint32_t i = 0; i < hparams.n_expert_used; ++i) {
1000
+ cur_experts[i] = lm_ggml_view_2d(ctx0, experts, n_embd, n_tokens, experts->nb[2], i*experts->nb[1]);
1001
+
1002
+ lm_ggml_build_forward_expand(gf, cur_experts[i]);
1003
+ }
1004
+
1005
+ // aggregate experts
1006
+ // note: here we explicitly use hparams.n_expert_used instead of n_expert_used
1007
+ // to avoid potentially a large number of add nodes during warmup
1008
+ // ref: https://github.com/ggml-org/llama.cpp/pull/14753
1009
+ lm_ggml_tensor * moe_out = cur_experts[0];
1010
+
1011
+ for (uint32_t i = 1; i < hparams.n_expert_used; ++i) {
1012
+ moe_out = lm_ggml_add(ctx0, moe_out, cur_experts[i]);
1013
+ }
1014
+
1015
+ if (hparams.n_expert_used == 1) {
1016
+ // avoid returning a non-contiguous tensor
1017
+ moe_out = lm_ggml_cont(ctx0, moe_out);
1018
+ }
1019
+
1020
+ cb(moe_out, "ffn_moe_out", il);
1021
+
1022
+ return moe_out;
1023
+ }
1024
+
1025
+ // input embeddings with optional lora
1026
+ lm_ggml_tensor * llm_graph_context::build_inp_embd(lm_ggml_tensor * tok_embd) const {
1027
+ const int64_t n_embd = hparams.n_embd;
1028
+
1029
+ auto inp = std::make_unique<llm_graph_input_embd>();
1030
+
1031
+ lm_ggml_tensor * cur = nullptr;
1032
+
1033
+ if (ubatch.token) {
1034
+ inp->tokens = lm_ggml_new_tensor_1d(ctx0, LM_GGML_TYPE_I32, ubatch.n_tokens);
1035
+ //cb(inp->tokens, "inp_tokens", -1);
1036
+ lm_ggml_set_input(inp->tokens);
1037
+ res->t_tokens = inp->tokens;
1038
+
1039
+ cur = lm_ggml_get_rows(ctx0, tok_embd, inp->tokens);
1040
+
1041
+ // apply lora for embedding tokens if needed
1042
+ for (const auto & lora : *loras) {
1043
+ llama_adapter_lora_weight * lw = lora.first->get_weight(tok_embd);
1044
+ if (lw == nullptr) {
1045
+ continue;
1046
+ }
1047
+
1048
+ const float adapter_scale = lora.second;
1049
+ const float scale = lw->get_scale(lora.first->alpha, adapter_scale);
1050
+
1051
+ lm_ggml_tensor * inpL_delta = lm_ggml_scale(ctx0, lm_ggml_mul_mat(
1052
+ ctx0, lw->b, // non-transposed lora_b
1053
+ lm_ggml_get_rows(ctx0, lw->a, inp->tokens)
1054
+ ), scale);
1055
+
1056
+ cur = lm_ggml_add(ctx0, cur, inpL_delta);
1057
+ }
1058
+ } else {
1059
+ inp->embd = lm_ggml_new_tensor_2d(ctx0, LM_GGML_TYPE_F32, n_embd, ubatch.n_tokens);
1060
+ lm_ggml_set_input(inp->embd);
1061
+
1062
+ cur = inp->embd;
1063
+ }
1064
+
1065
+ // For Granite architecture
1066
+ if (hparams.f_embedding_scale != 0.0f) {
1067
+ cur = lm_ggml_scale(ctx0, cur, hparams.f_embedding_scale);
1068
+ }
1069
+
1070
+ cb(cur, "inp_embd", -1);
1071
+
1072
+ res->add_input(std::move(inp));
1073
+
1074
+ return cur;
1075
+ }
1076
+
1077
+ lm_ggml_tensor * llm_graph_context::build_inp_pos() const {
1078
+ auto inp = std::make_unique<llm_graph_input_pos>(hparams.n_pos_per_embd());
1079
+
1080
+ auto & cur = inp->pos;
1081
+
1082
+ cur = lm_ggml_new_tensor_1d(ctx0, LM_GGML_TYPE_I32, (int64_t)n_tokens*hparams.n_pos_per_embd());
1083
+ lm_ggml_set_input(cur);
1084
+
1085
+ res->add_input(std::move(inp));
1086
+
1087
+ return cur;
1088
+ }
1089
+
1090
+ lm_ggml_tensor * llm_graph_context::build_inp_attn_scale() const {
1091
+ auto inp = std::make_unique<llm_graph_input_attn_temp>(hparams.n_attn_temp_floor_scale, hparams.f_attn_temp_scale);
1092
+
1093
+ auto & cur = inp->attn_scale;
1094
+
1095
+ // this need to be 1x1xN for broadcasting
1096
+ cur = lm_ggml_new_tensor_3d(ctx0, LM_GGML_TYPE_F32, 1, 1, n_tokens);
1097
+ lm_ggml_set_input(cur);
1098
+
1099
+ res->add_input(std::move(inp));
1100
+
1101
+ return cur;
1102
+ }
1103
+
1104
+ lm_ggml_tensor * llm_graph_context::build_inp_out_ids() const {
1105
+ // note: when all tokens are output, we could skip this optimization to spare the lm_ggml_get_rows() calls,
1106
+ // but this would make the graph topology depend on the number of output tokens, which can interere with
1107
+ // features that require constant topology such as pipline parallelism
1108
+ // ref: https://github.com/ggml-org/llama.cpp/pull/14275#issuecomment-2987424471
1109
+ //if (n_outputs < n_tokens) {
1110
+ // return nullptr;
1111
+ //}
1112
+
1113
+ auto inp = std::make_unique<llm_graph_input_out_ids>(hparams, cparams, n_outputs);
1114
+
1115
+ auto & cur = inp->out_ids;
1116
+
1117
+ cur = lm_ggml_new_tensor_1d(ctx0, LM_GGML_TYPE_I32, n_outputs);
1118
+ lm_ggml_set_input(cur);
1119
+
1120
+ res->add_input(std::move(inp));
1121
+
1122
+ return cur;
1123
+ }
1124
+
1125
+ lm_ggml_tensor * llm_graph_context::build_inp_mean() const {
1126
+ auto inp = std::make_unique<llm_graph_input_mean>(cparams);
1127
+
1128
+ auto & cur = inp->mean;
1129
+
1130
+ cur = lm_ggml_new_tensor_2d(ctx0, LM_GGML_TYPE_F32, n_tokens, ubatch.n_seqs_unq);
1131
+ lm_ggml_set_input(cur);
1132
+
1133
+ res->add_input(std::move(inp));
1134
+
1135
+ return cur;
1136
+ }
1137
+
1138
+ lm_ggml_tensor * llm_graph_context::build_inp_cls() const {
1139
+ auto inp = std::make_unique<llm_graph_input_cls>(cparams);
1140
+
1141
+ auto & cur = inp->cls;
1142
+
1143
+ cur = lm_ggml_new_tensor_1d(ctx0, LM_GGML_TYPE_I32, ubatch.n_seqs_unq);
1144
+ lm_ggml_set_input(cur);
1145
+
1146
+ res->add_input(std::move(inp));
1147
+
1148
+ return cur;
1149
+ }
1150
+
1151
+ lm_ggml_tensor * llm_graph_context::build_inp_cross_embd() const {
1152
+ auto inp = std::make_unique<llm_graph_input_cross_embd>(cross);
1153
+
1154
+ auto & cur = inp->cross_embd;
1155
+
1156
+ // if we have the output embeddings from the encoder, use them directly
1157
+ // TODO: needs more work to be correct, for now just use the tensor shape
1158
+ //if (cross->t_embd) {
1159
+ // cur = lm_ggml_view_tensor(ctx0, cross->t_embd);
1160
+
1161
+ // return cur;
1162
+ //}
1163
+
1164
+ const auto n_embd = !cross->v_embd.empty() ? cross->n_embd : hparams.n_embd;
1165
+ const auto n_enc = !cross->v_embd.empty() ? cross->n_enc : hparams.n_ctx_train;
1166
+
1167
+ cur = lm_ggml_new_tensor_2d(ctx0, LM_GGML_TYPE_F32, n_embd, n_enc);
1168
+ lm_ggml_set_input(cur);
1169
+
1170
+ res->add_input(std::move(inp));
1171
+
1172
+ return cur;
1173
+ }
1174
+
1175
+ lm_ggml_tensor * llm_graph_context::build_inp_pos_bucket_enc() const {
1176
+ auto inp = std::make_unique<llm_graph_input_pos_bucket>(hparams);
1177
+
1178
+ auto & cur = inp->pos_bucket;
1179
+
1180
+ cur = lm_ggml_new_tensor_2d(ctx0, LM_GGML_TYPE_I32, n_tokens, n_tokens);
1181
+ lm_ggml_set_input(cur);
1182
+
1183
+ res->add_input(std::move(inp));
1184
+
1185
+ return cur;
1186
+ }
1187
+
1188
+ lm_ggml_tensor * llm_graph_context::build_inp_pos_bucket_dec() const {
1189
+ const auto * mctx_cur = static_cast<const llama_kv_cache_context *>(mctx);
1190
+
1191
+ auto inp = std::make_unique<llm_graph_input_pos_bucket_kv>(hparams, mctx_cur);
1192
+
1193
+ const auto n_kv = mctx_cur->get_n_kv();
1194
+
1195
+ auto & cur = inp->pos_bucket;
1196
+
1197
+ cur = lm_ggml_new_tensor_2d(ctx0, LM_GGML_TYPE_I32, n_kv, n_tokens);
1198
+ lm_ggml_set_input(cur);
1199
+
1200
+ res->add_input(std::move(inp));
1201
+
1202
+ return cur;
1203
+ }
1204
+
1205
+ lm_ggml_tensor * llm_graph_context::build_pos_bias(lm_ggml_tensor * pos_bucket, lm_ggml_tensor * attn_rel_b) const {
1206
+ lm_ggml_tensor * pos_bucket_1d = lm_ggml_reshape_1d(ctx0, pos_bucket, pos_bucket->ne[0] * pos_bucket->ne[1]);
1207
+ cb(pos_bucket_1d, "pos_bucket_1d", -1);
1208
+
1209
+ lm_ggml_tensor * pos_bias = lm_ggml_get_rows(ctx0, attn_rel_b, pos_bucket_1d);
1210
+
1211
+ pos_bias = lm_ggml_reshape_3d(ctx0, pos_bias, pos_bias->ne[0], pos_bucket->ne[0], pos_bucket->ne[1]);
1212
+ pos_bias = lm_ggml_permute (ctx0, pos_bias, 2, 0, 1, 3);
1213
+ pos_bias = lm_ggml_cont (ctx0, pos_bias);
1214
+
1215
+ cb(pos_bias, "pos_bias", -1);
1216
+
1217
+ return pos_bias;
1218
+ }
1219
+
1220
+ lm_ggml_tensor * llm_graph_context::build_attn_mha(
1221
+ lm_ggml_tensor * q,
1222
+ lm_ggml_tensor * k,
1223
+ lm_ggml_tensor * v,
1224
+ lm_ggml_tensor * kq_b,
1225
+ lm_ggml_tensor * kq_mask,
1226
+ lm_ggml_tensor * sinks,
1227
+ lm_ggml_tensor * v_mla,
1228
+ float kq_scale) const {
1229
+ const bool v_trans = v->nb[1] > v->nb[2];
1230
+
1231
+ // split the batch into streams if needed
1232
+ const auto n_stream = k->ne[3];
1233
+
1234
+ q = lm_ggml_reshape_4d(ctx0, q, q->ne[0], q->ne[1], q->ne[2]/n_stream, n_stream);
1235
+
1236
+ q = lm_ggml_permute(ctx0, q, 0, 2, 1, 3);
1237
+ k = lm_ggml_permute(ctx0, k, 0, 2, 1, 3);
1238
+ v = lm_ggml_permute(ctx0, v, 0, 2, 1, 3);
1239
+
1240
+ const auto n_kv = k->ne[1];
1241
+
1242
+ lm_ggml_tensor * cur;
1243
+
1244
+ // TODO: replace hardcoded padding with ggml-provided padding
1245
+ if (cparams.flash_attn && (n_kv % 256 == 0) && kq_b == nullptr) {
1246
+ LM_GGML_ASSERT(kq_b == nullptr && "Flash attention does not support KQ bias yet");
1247
+
1248
+ if (v_trans) {
1249
+ v = lm_ggml_transpose(ctx0, v);
1250
+ }
1251
+
1252
+ // this can happen when KV cache is not used (e.g. an embedding model with non-causal attn)
1253
+ if (k->type == LM_GGML_TYPE_F32) {
1254
+ k = lm_ggml_cast(ctx0, k, LM_GGML_TYPE_F16);
1255
+ }
1256
+
1257
+ if (v->type == LM_GGML_TYPE_F32) {
1258
+ v = lm_ggml_cast(ctx0, v, LM_GGML_TYPE_F16);
1259
+ }
1260
+
1261
+ cur = lm_ggml_flash_attn_ext(ctx0, q, k, v, kq_mask, kq_scale, hparams.f_max_alibi_bias,
1262
+ hparams.attn_soft_cap ? hparams.f_attn_logit_softcapping : 0.0f);
1263
+
1264
+ lm_ggml_flash_attn_ext_add_sinks(cur, sinks);
1265
+ lm_ggml_flash_attn_ext_set_prec (cur, LM_GGML_PREC_F32);
1266
+
1267
+ if (v_mla) {
1268
+ #if 0
1269
+ // v_mla can be applied as a matrix-vector multiplication with broadcasting across dimension 3 == n_tokens.
1270
+ // However, the code is optimized for dimensions 0 and 1 being large, so this is ineffient.
1271
+ cur = lm_ggml_reshape_4d(ctx0, cur, v_mla->ne[0], 1, n_head, n_tokens);
1272
+ cur = lm_ggml_mul_mat(ctx0, v_mla, cur);
1273
+ #else
1274
+ // It's preferable to do the calculation as a matrix-matrix multiplication with n_tokens in dimension 1.
1275
+ // The permutations are noops and only change how the tensor data is interpreted.
1276
+ cur = lm_ggml_permute(ctx0, cur, 0, 2, 1, 3);
1277
+ cur = lm_ggml_mul_mat(ctx0, v_mla, cur);
1278
+ cur = lm_ggml_permute(ctx0, cur, 0, 2, 1, 3);
1279
+ cur = lm_ggml_cont(ctx0, cur); // Needed because lm_ggml_reshape_2d expects contiguous inputs.
1280
+ #endif
1281
+ }
1282
+
1283
+ cur = lm_ggml_reshape_2d(ctx0, cur, cur->ne[0]*cur->ne[1], cur->ne[2]*cur->ne[3]);
1284
+ } else {
1285
+ lm_ggml_tensor * kq = lm_ggml_mul_mat(ctx0, k, q);
1286
+
1287
+ // note: this op tends to require high floating point range
1288
+ // while for some models F16 is enough, for others it is not, so we default to F32 here
1289
+ lm_ggml_mul_mat_set_prec(kq, LM_GGML_PREC_F32);
1290
+
1291
+ if (arch == LLM_ARCH_GROK) {
1292
+ // need to do the following:
1293
+ // multiply by attn_output_multiplyer of 0.08838834764831845
1294
+ // and then :
1295
+ // kq = 30 * tanh(kq / 30)
1296
+ // before the softmax below
1297
+
1298
+ kq = lm_ggml_tanh(ctx0, lm_ggml_scale(ctx0, kq, 0.08838834764831845f/30.0f));
1299
+ kq = lm_ggml_scale(ctx0, kq, 30);
1300
+ }
1301
+
1302
+ if (hparams.attn_soft_cap) {
1303
+ kq = lm_ggml_scale(ctx0, kq, 1.0f / hparams.f_attn_logit_softcapping);
1304
+ kq = lm_ggml_tanh (ctx0, kq);
1305
+ kq = lm_ggml_scale(ctx0, kq, hparams.f_attn_logit_softcapping);
1306
+ }
1307
+
1308
+ if (kq_b) {
1309
+ kq = lm_ggml_add(ctx0, kq, kq_b);
1310
+ }
1311
+
1312
+ kq = lm_ggml_soft_max_ext(ctx0, kq, kq_mask, kq_scale, hparams.f_max_alibi_bias);
1313
+ lm_ggml_soft_max_add_sinks(kq, sinks);
1314
+
1315
+ if (!v_trans) {
1316
+ // note: avoid this branch
1317
+ v = lm_ggml_cont(ctx0, lm_ggml_transpose(ctx0, v));
1318
+ }
1319
+
1320
+ lm_ggml_tensor * kqv = lm_ggml_mul_mat(ctx0, v, kq);
1321
+
1322
+ // for MLA with the absorption optimization, we need to "decompress" from MQA back to MHA
1323
+ if (v_mla) {
1324
+ kqv = lm_ggml_mul_mat(ctx0, v_mla, kqv);
1325
+ }
1326
+
1327
+ cur = lm_ggml_permute(ctx0, kqv, 0, 2, 1, 3);
1328
+
1329
+ // recombine streams
1330
+ cur = lm_ggml_cont_2d(ctx0, cur, cur->ne[0]*cur->ne[1], cur->ne[2]*cur->ne[3]);
1331
+
1332
+ if (!cparams.offload_kqv) {
1333
+ // all nodes between the KV store and the attention output are run on the CPU
1334
+ lm_ggml_backend_sched_set_tensor_backend(sched, cur, backend_cpu);
1335
+ }
1336
+ }
1337
+
1338
+ lm_ggml_build_forward_expand(gf, cur);
1339
+
1340
+ return cur;
1341
+ }
1342
+
1343
+ llm_graph_input_attn_no_cache * llm_graph_context::build_attn_inp_no_cache() const {
1344
+ auto inp = std::make_unique<llm_graph_input_attn_no_cache>(hparams, cparams);
1345
+
1346
+ // note: there is no KV cache, so the number of KV values is equal to the number of tokens in the batch
1347
+ inp->kq_mask = lm_ggml_new_tensor_4d(ctx0, LM_GGML_TYPE_F32, n_tokens, LM_GGML_PAD(n_tokens, LM_GGML_KQ_MASK_PAD), 1, 1);
1348
+ lm_ggml_set_input(inp->kq_mask);
1349
+
1350
+ inp->kq_mask_cnv = cparams.flash_attn ? lm_ggml_cast(ctx0, inp->kq_mask, LM_GGML_TYPE_F16) : inp->kq_mask;
1351
+
1352
+ return (llm_graph_input_attn_no_cache *) res->add_input(std::move(inp));
1353
+ }
1354
+
1355
+ lm_ggml_tensor * llm_graph_context::build_attn(
1356
+ llm_graph_input_attn_no_cache * inp,
1357
+ lm_ggml_tensor * wo,
1358
+ lm_ggml_tensor * wo_b,
1359
+ lm_ggml_tensor * q_cur,
1360
+ lm_ggml_tensor * k_cur,
1361
+ lm_ggml_tensor * v_cur,
1362
+ lm_ggml_tensor * kq_b,
1363
+ lm_ggml_tensor * sinks,
1364
+ lm_ggml_tensor * v_mla,
1365
+ float kq_scale,
1366
+ int il) const {
1367
+ LM_GGML_UNUSED(n_tokens);
1368
+
1369
+ // these nodes are added to the graph together so that they are not reordered
1370
+ // by doing so, the number of splits in the graph is reduced
1371
+ lm_ggml_build_forward_expand(gf, q_cur);
1372
+ lm_ggml_build_forward_expand(gf, k_cur);
1373
+ lm_ggml_build_forward_expand(gf, v_cur);
1374
+
1375
+ const auto & kq_mask = inp->get_kq_mask();
1376
+
1377
+ // [TAG_NO_CACHE_PAD]
1378
+ // TODO: if ubatch.equal_seqs() == true, we can split the three tensors below into ubatch.n_seqs_unq streams
1379
+ assert(!ubatch.equal_seqs());
1380
+
1381
+ lm_ggml_tensor * q = q_cur;
1382
+ lm_ggml_tensor * k = k_cur;
1383
+ lm_ggml_tensor * v = v_cur;
1384
+
1385
+ lm_ggml_tensor * cur = build_attn_mha(q, k, v, kq_b, kq_mask, sinks, v_mla, kq_scale);
1386
+ cb(cur, "kqv_out", il);
1387
+
1388
+ if (wo) {
1389
+ cur = build_lora_mm(wo, cur);
1390
+ }
1391
+
1392
+ if (wo_b) {
1393
+ //cb(cur, "kqv_wo", il);
1394
+ }
1395
+
1396
+ if (wo_b) {
1397
+ cur = lm_ggml_add(ctx0, cur, wo_b);
1398
+ }
1399
+
1400
+ return cur;
1401
+ }
1402
+
1403
+ static std::unique_ptr<llm_graph_input_attn_kv> build_attn_inp_kv_impl(
1404
+ lm_ggml_context * ctx0,
1405
+ const llama_ubatch & ubatch,
1406
+ const llama_hparams & hparams,
1407
+ const llama_cparams & cparams,
1408
+ const llama_kv_cache_context * mctx_cur) {
1409
+
1410
+ auto inp = std::make_unique<llm_graph_input_attn_kv>(hparams, cparams, mctx_cur);
1411
+
1412
+ {
1413
+ LM_GGML_ASSERT(hparams.swa_type == LLAMA_SWA_TYPE_NONE && "Use llama_kv_cache_iswa for SWA");
1414
+
1415
+ const auto n_kv = mctx_cur->get_n_kv();
1416
+ const auto n_tokens = ubatch.n_tokens;
1417
+ const auto n_stream = cparams.kv_unified ? 1 : ubatch.n_seqs_unq;
1418
+
1419
+ inp->self_k_idxs = mctx_cur->build_input_k_idxs(ctx0, ubatch);
1420
+ inp->self_v_idxs = mctx_cur->build_input_v_idxs(ctx0, ubatch);
1421
+
1422
+ inp->self_kq_mask = lm_ggml_new_tensor_4d(ctx0, LM_GGML_TYPE_F32, n_kv, LM_GGML_PAD(n_tokens/n_stream, LM_GGML_KQ_MASK_PAD), 1, n_stream);
1423
+ lm_ggml_set_input(inp->self_kq_mask);
1424
+
1425
+ inp->self_kq_mask_cnv = cparams.flash_attn ? lm_ggml_cast(ctx0, inp->self_kq_mask, LM_GGML_TYPE_F16) : inp->self_kq_mask;
1426
+ }
1427
+
1428
+ return inp;
1429
+ }
1430
+
1431
+ llm_graph_input_attn_kv * llm_graph_context::build_attn_inp_kv() const {
1432
+ const auto * mctx_cur = static_cast<const llama_kv_cache_context *>(mctx);
1433
+
1434
+ auto inp = build_attn_inp_kv_impl(ctx0, ubatch, hparams, cparams, mctx_cur);
1435
+
1436
+ return (llm_graph_input_attn_kv *) res->add_input(std::move(inp));
1437
+ }
1438
+
1439
+ lm_ggml_tensor * llm_graph_context::build_attn(
1440
+ llm_graph_input_attn_kv * inp,
1441
+ lm_ggml_tensor * wo,
1442
+ lm_ggml_tensor * wo_b,
1443
+ lm_ggml_tensor * q_cur,
1444
+ lm_ggml_tensor * k_cur,
1445
+ lm_ggml_tensor * v_cur,
1446
+ lm_ggml_tensor * kq_b,
1447
+ lm_ggml_tensor * sinks,
1448
+ lm_ggml_tensor * v_mla,
1449
+ float kq_scale,
1450
+ int il) const {
1451
+ // these nodes are added to the graph together so that they are not reordered
1452
+ // by doing so, the number of splits in the graph is reduced
1453
+ lm_ggml_build_forward_expand(gf, q_cur);
1454
+ lm_ggml_build_forward_expand(gf, k_cur);
1455
+ lm_ggml_build_forward_expand(gf, v_cur);
1456
+
1457
+ const auto * mctx_cur = inp->mctx;
1458
+
1459
+ // store to KV cache
1460
+ {
1461
+ const auto & k_idxs = inp->get_k_idxs();
1462
+ const auto & v_idxs = inp->get_v_idxs();
1463
+
1464
+ lm_ggml_build_forward_expand(gf, mctx_cur->cpy_k(ctx0, k_cur, k_idxs, il));
1465
+ lm_ggml_build_forward_expand(gf, mctx_cur->cpy_v(ctx0, v_cur, v_idxs, il));
1466
+ }
1467
+
1468
+ const auto & kq_mask = inp->get_kq_mask();
1469
+
1470
+ lm_ggml_tensor * q = q_cur;
1471
+ lm_ggml_tensor * k = mctx_cur->get_k(ctx0, il);
1472
+ lm_ggml_tensor * v = mctx_cur->get_v(ctx0, il);
1473
+
1474
+ lm_ggml_tensor * cur = build_attn_mha(q, k, v, kq_b, kq_mask, sinks, v_mla, kq_scale);
1475
+ cb(cur, "kqv_out", il);
1476
+
1477
+ if (wo) {
1478
+ cur = build_lora_mm(wo, cur);
1479
+ if (arch == LLM_ARCH_GLM4 || arch == LLM_ARCH_GLM4_MOE) {
1480
+ // GLM4 and GLM4_MOE seem to have numerical issues with half-precision accumulators
1481
+ lm_ggml_mul_mat_set_prec(cur, LM_GGML_PREC_F32);
1482
+ }
1483
+ }
1484
+
1485
+ if (wo_b) {
1486
+ cur = lm_ggml_add(ctx0, cur, wo_b);
1487
+ }
1488
+
1489
+ return cur;
1490
+ }
1491
+
1492
+ lm_ggml_tensor * llm_graph_context::build_attn(
1493
+ llm_graph_input_attn_kv_iswa * inp,
1494
+ lm_ggml_tensor * wo,
1495
+ lm_ggml_tensor * wo_b,
1496
+ lm_ggml_tensor * q_cur,
1497
+ lm_ggml_tensor * k_cur,
1498
+ lm_ggml_tensor * v_cur,
1499
+ lm_ggml_tensor * kq_b,
1500
+ lm_ggml_tensor * sinks,
1501
+ lm_ggml_tensor * v_mla,
1502
+ float kq_scale,
1503
+ int il) const {
1504
+ // these nodes are added to the graph together so that they are not reordered
1505
+ // by doing so, the number of splits in the graph is reduced
1506
+ lm_ggml_build_forward_expand(gf, q_cur);
1507
+
1508
+ if (k_cur) {
1509
+ lm_ggml_build_forward_expand(gf, k_cur);
1510
+ }
1511
+
1512
+ if (v_cur) {
1513
+ lm_ggml_build_forward_expand(gf, v_cur);
1514
+ }
1515
+
1516
+ const auto * mctx_iswa = inp->mctx;
1517
+
1518
+ const bool is_swa = hparams.is_swa(il);
1519
+
1520
+ const auto * mctx_cur = is_swa ? mctx_iswa->get_swa() : mctx_iswa->get_base();
1521
+
1522
+ // optionally store to KV cache
1523
+ if (k_cur) {
1524
+ const auto & k_idxs = is_swa ? inp->get_k_idxs_swa() : inp->get_k_idxs();
1525
+
1526
+ lm_ggml_build_forward_expand(gf, mctx_cur->cpy_k(ctx0, k_cur, k_idxs, il));
1527
+ }
1528
+
1529
+ if (v_cur) {
1530
+ const auto & v_idxs = is_swa ? inp->get_v_idxs_swa() : inp->get_v_idxs();
1531
+
1532
+ lm_ggml_build_forward_expand(gf, mctx_cur->cpy_v(ctx0, v_cur, v_idxs, il));
1533
+ }
1534
+
1535
+ const auto & kq_mask = is_swa ? inp->get_kq_mask_swa() : inp->get_kq_mask();
1536
+
1537
+ lm_ggml_tensor * q = q_cur;
1538
+ lm_ggml_tensor * k = mctx_cur->get_k(ctx0, il);
1539
+ lm_ggml_tensor * v = mctx_cur->get_v(ctx0, il);
1540
+
1541
+ lm_ggml_tensor * cur = build_attn_mha(q, k, v, kq_b, kq_mask, sinks, v_mla, kq_scale);
1542
+ cb(cur, "kqv_out", il);
1543
+
1544
+ if (wo) {
1545
+ cur = build_lora_mm(wo, cur);
1546
+ }
1547
+
1548
+ if (wo_b) {
1549
+ //cb(cur, "kqv_wo", il);
1550
+ }
1551
+
1552
+ if (wo_b) {
1553
+ cur = lm_ggml_add(ctx0, cur, wo_b);
1554
+ }
1555
+
1556
+ return cur;
1557
+ }
1558
+
1559
+ llm_graph_input_attn_cross * llm_graph_context::build_attn_inp_cross() const {
1560
+ auto inp = std::make_unique<llm_graph_input_attn_cross>(cross);
1561
+
1562
+ const int32_t n_enc = !cross->v_embd.empty() ? cross->n_enc : hparams.n_ctx_train;
1563
+
1564
+ inp->cross_kq_mask = lm_ggml_new_tensor_4d(ctx0, LM_GGML_TYPE_F32, n_enc, LM_GGML_PAD(n_tokens, LM_GGML_KQ_MASK_PAD), 1, 1);
1565
+ lm_ggml_set_input(inp->cross_kq_mask);
1566
+
1567
+ inp->cross_kq_mask_cnv = cparams.flash_attn ? lm_ggml_cast(ctx0, inp->cross_kq_mask, LM_GGML_TYPE_F16) : inp->cross_kq_mask;
1568
+
1569
+ return (llm_graph_input_attn_cross *) res->add_input(std::move(inp));
1570
+ }
1571
+
1572
+ lm_ggml_tensor * llm_graph_context::build_attn(
1573
+ llm_graph_input_attn_cross * inp,
1574
+ lm_ggml_tensor * wo,
1575
+ lm_ggml_tensor * wo_b,
1576
+ lm_ggml_tensor * q_cur,
1577
+ lm_ggml_tensor * k_cur,
1578
+ lm_ggml_tensor * v_cur,
1579
+ lm_ggml_tensor * kq_b,
1580
+ lm_ggml_tensor * sinks,
1581
+ lm_ggml_tensor * v_mla,
1582
+ float kq_scale,
1583
+ int il) const {
1584
+ // these nodes are added to the graph together so that they are not reordered
1585
+ // by doing so, the number of splits in the graph is reduced
1586
+ lm_ggml_build_forward_expand(gf, q_cur);
1587
+ lm_ggml_build_forward_expand(gf, k_cur);
1588
+ lm_ggml_build_forward_expand(gf, v_cur);
1589
+
1590
+ const auto & kq_mask = inp->get_kq_mask_cross();
1591
+
1592
+ lm_ggml_tensor * q = q_cur;
1593
+ lm_ggml_tensor * k = k_cur;
1594
+ lm_ggml_tensor * v = v_cur;
1595
+
1596
+ lm_ggml_tensor * cur = build_attn_mha(q, k, v, kq_b, kq_mask, sinks, v_mla, kq_scale);
1597
+ cb(cur, "kqv_out", il);
1598
+
1599
+ if (wo) {
1600
+ cur = build_lora_mm(wo, cur);
1601
+ }
1602
+
1603
+ if (wo_b) {
1604
+ //cb(cur, "kqv_wo", il);
1605
+ }
1606
+
1607
+ if (wo_b) {
1608
+ cur = lm_ggml_add(ctx0, cur, wo_b);
1609
+ }
1610
+
1611
+ return cur;
1612
+ }
1613
+
1614
+ // TODO: maybe separate the inner implementation into a separate function
1615
+ // like with the non-sliding window equivalent
1616
+ // once sliding-window hybrid caches are a thing.
1617
+ llm_graph_input_attn_kv_iswa * llm_graph_context::build_attn_inp_kv_iswa() const {
1618
+ const auto * mctx_cur = static_cast<const llama_kv_cache_iswa_context *>(mctx);
1619
+
1620
+ auto inp = std::make_unique<llm_graph_input_attn_kv_iswa>(hparams, cparams, mctx_cur);
1621
+
1622
+ const auto n_stream = cparams.kv_unified ? 1 : ubatch.n_seqs_unq;
1623
+
1624
+ {
1625
+ const auto n_kv = mctx_cur->get_base()->get_n_kv();
1626
+
1627
+ inp->self_k_idxs = mctx_cur->get_base()->build_input_k_idxs(ctx0, ubatch);
1628
+ inp->self_v_idxs = mctx_cur->get_base()->build_input_v_idxs(ctx0, ubatch);
1629
+
1630
+ inp->self_kq_mask = lm_ggml_new_tensor_4d(ctx0, LM_GGML_TYPE_F32, n_kv, LM_GGML_PAD(n_tokens/n_stream, LM_GGML_KQ_MASK_PAD), 1, n_stream);
1631
+ lm_ggml_set_input(inp->self_kq_mask);
1632
+
1633
+ inp->self_kq_mask_cnv = cparams.flash_attn ? lm_ggml_cast(ctx0, inp->self_kq_mask, LM_GGML_TYPE_F16) : inp->self_kq_mask;
1634
+ }
1635
+
1636
+ {
1637
+ LM_GGML_ASSERT(hparams.swa_type != LLAMA_SWA_TYPE_NONE && "Use llama_kv_cache for non-SWA");
1638
+
1639
+ const auto n_kv = mctx_cur->get_swa()->get_n_kv();
1640
+
1641
+ inp->self_k_idxs_swa = mctx_cur->get_swa()->build_input_k_idxs(ctx0, ubatch);
1642
+ inp->self_v_idxs_swa = mctx_cur->get_swa()->build_input_v_idxs(ctx0, ubatch);
1643
+
1644
+ inp->self_kq_mask_swa = lm_ggml_new_tensor_4d(ctx0, LM_GGML_TYPE_F32, n_kv, LM_GGML_PAD(n_tokens/n_stream, LM_GGML_KQ_MASK_PAD), 1, n_stream);
1645
+ lm_ggml_set_input(inp->self_kq_mask_swa);
1646
+
1647
+ inp->self_kq_mask_swa_cnv = cparams.flash_attn ? lm_ggml_cast(ctx0, inp->self_kq_mask_swa, LM_GGML_TYPE_F16) : inp->self_kq_mask_swa;
1648
+ }
1649
+
1650
+ return (llm_graph_input_attn_kv_iswa *) res->add_input(std::move(inp));
1651
+ }
1652
+
1653
+ lm_ggml_tensor * llm_graph_context::build_rs(
1654
+ lm_ggml_tensor * s,
1655
+ lm_ggml_tensor * state_copy_main,
1656
+ lm_ggml_tensor * state_copy_extra,
1657
+ int32_t state_size,
1658
+ int32_t n_seqs,
1659
+ uint32_t n_rs,
1660
+ uint32_t rs_head,
1661
+ uint32_t rs_size,
1662
+ int32_t rs_zero,
1663
+ const llm_graph_get_rows_fn & get_state_rows) const {
1664
+
1665
+ lm_ggml_tensor * states = lm_ggml_reshape_2d(ctx0, s, state_size, rs_size);
1666
+
1667
+ // Clear a single state which will then be copied to the other cleared states.
1668
+ // Note that this is a no-op when the view is zero-sized.
1669
+ lm_ggml_tensor * state_zero = lm_ggml_view_1d(ctx0, states, state_size*(rs_zero >= 0), rs_zero*states->nb[1]*(rs_zero >= 0));
1670
+ lm_ggml_build_forward_expand(gf, lm_ggml_scale_inplace(ctx0, state_zero, 0));
1671
+
1672
+ // copy states
1673
+ // NOTE: assuming the copy destinations are ALL contained between rs_head and rs_head + n_rs
1674
+ // {state_size, rs_size} -> {state_size, n_seqs}
1675
+ lm_ggml_tensor * output_states = get_state_rows(ctx0, states, state_copy_main);
1676
+ lm_ggml_build_forward_expand(gf, output_states);
1677
+
1678
+ // copy extra states which won't be changed further (between n_seqs and n_rs)
1679
+ lm_ggml_tensor * states_extra = lm_ggml_get_rows(ctx0, states, state_copy_extra);
1680
+ lm_ggml_build_forward_expand(gf,
1681
+ lm_ggml_cpy(ctx0,
1682
+ states_extra,
1683
+ lm_ggml_view_1d(ctx0, s, state_size*(n_rs - n_seqs), (rs_head + n_seqs)*state_size*lm_ggml_element_size(s))));
1684
+
1685
+ return output_states;
1686
+ }
1687
+
1688
+ static std::unique_ptr<llm_graph_input_rs> build_rs_inp_impl(
1689
+ lm_ggml_context * ctx0,
1690
+ const llama_ubatch & ubatch,
1691
+ const llama_memory_recurrent_context * mctx_cur) {
1692
+
1693
+ auto inp = std::make_unique<llm_graph_input_rs>(mctx_cur);
1694
+
1695
+ const int64_t n_rs = mctx_cur->get_n_rs();
1696
+ const int64_t n_seqs = ubatch.n_seqs;
1697
+
1698
+ inp->s_copy = lm_ggml_new_tensor_1d(ctx0, LM_GGML_TYPE_I32, n_rs);
1699
+ lm_ggml_set_input(inp->s_copy);
1700
+
1701
+ inp->s_copy_main = lm_ggml_view_1d(ctx0, inp->s_copy, n_seqs, 0);
1702
+ inp->s_copy_extra = lm_ggml_view_1d(ctx0, inp->s_copy, n_rs - n_seqs, n_seqs * inp->s_copy->nb[0]);
1703
+
1704
+ return inp;
1705
+ }
1706
+
1707
+ llm_graph_input_rs * llm_graph_context::build_rs_inp() const {
1708
+ const auto * mctx_cur = static_cast<const llama_memory_recurrent_context *>(mctx);
1709
+
1710
+ auto inp = build_rs_inp_impl(ctx0, ubatch, mctx_cur);
1711
+
1712
+ return (llm_graph_input_rs *) res->add_input(std::move(inp));
1713
+ }
1714
+
1715
+ lm_ggml_tensor * llm_graph_context::build_rs(
1716
+ llm_graph_input_rs * inp,
1717
+ lm_ggml_tensor * s,
1718
+ int32_t state_size,
1719
+ int32_t n_seqs,
1720
+ const llm_graph_get_rows_fn & get_state_rows) const {
1721
+ const auto * kv_state = inp->mctx;
1722
+
1723
+ return build_rs(s, inp->s_copy_main, inp->s_copy_extra, state_size, n_seqs,
1724
+ kv_state->get_n_rs(), kv_state->get_head(), kv_state->get_size(), kv_state->get_rs_z(),
1725
+ get_state_rows);
1726
+ }
1727
+
1728
+ lm_ggml_tensor * llm_graph_context::build_rwkv_token_shift_load(
1729
+ llm_graph_input_rs * inp,
1730
+ const llama_ubatch & ubatch,
1731
+ int il) const {
1732
+ const auto * mctx_cur = static_cast<const llama_memory_recurrent_context *>(mctx);
1733
+
1734
+ const auto token_shift_count = hparams.token_shift_count;
1735
+
1736
+ const int64_t n_seqs = ubatch.n_seqs;
1737
+
1738
+ lm_ggml_tensor * token_shift_all = mctx_cur->get_r_l(il);
1739
+
1740
+ lm_ggml_tensor * token_shift = build_rs(
1741
+ inp, token_shift_all,
1742
+ hparams.n_embd_r(), n_seqs);
1743
+
1744
+ token_shift = lm_ggml_reshape_3d(ctx0, token_shift, hparams.n_embd, token_shift_count, n_seqs);
1745
+
1746
+ return token_shift;
1747
+ }
1748
+
1749
+ lm_ggml_tensor * llm_graph_context::build_rwkv_token_shift_store(
1750
+ lm_ggml_tensor * token_shift,
1751
+ const llama_ubatch & ubatch,
1752
+ int il) const {
1753
+ const auto * mctx_cur = static_cast<const llama_memory_recurrent_context *>(mctx);
1754
+
1755
+ const auto token_shift_count = hparams.token_shift_count;
1756
+ const auto n_embd = hparams.n_embd;
1757
+
1758
+ const int64_t n_seqs = ubatch.n_seqs;
1759
+
1760
+ const auto kv_head = mctx_cur->get_head();
1761
+
1762
+ return lm_ggml_cpy(
1763
+ ctx0,
1764
+ lm_ggml_view_1d(ctx0, token_shift, n_embd * n_seqs * token_shift_count, 0),
1765
+ lm_ggml_view_1d(ctx0, mctx_cur->get_r_l(il), hparams.n_embd_r()*n_seqs, hparams.n_embd_r()*kv_head*lm_ggml_element_size(mctx_cur->get_r_l(il)))
1766
+ );
1767
+ }
1768
+
1769
+ llm_graph_input_mem_hybrid * llm_graph_context::build_inp_mem_hybrid() const {
1770
+ const auto * mctx_cur = static_cast<const llama_memory_hybrid_context *>(mctx);
1771
+
1772
+ auto inp_rs = build_rs_inp_impl(ctx0, ubatch, mctx_cur->get_recr());
1773
+ auto inp_attn = build_attn_inp_kv_impl(ctx0, ubatch, hparams, cparams, mctx_cur->get_attn());
1774
+
1775
+ auto inp = std::make_unique<llm_graph_input_mem_hybrid>(std::move(inp_attn), std::move(inp_rs), mctx_cur);
1776
+
1777
+ return (llm_graph_input_mem_hybrid *) res->add_input(std::move(inp));
1778
+ }
1779
+
1780
+ void llm_graph_context::build_pooling(
1781
+ lm_ggml_tensor * cls,
1782
+ lm_ggml_tensor * cls_b,
1783
+ lm_ggml_tensor * cls_out,
1784
+ lm_ggml_tensor * cls_out_b) const {
1785
+ if (!cparams.embeddings) {
1786
+ return;
1787
+ }
1788
+
1789
+ lm_ggml_tensor * inp = res->t_embd;
1790
+
1791
+ //// find result_norm tensor for input
1792
+ //for (int i = lm_ggml_graph_n_nodes(gf) - 1; i >= 0; --i) {
1793
+ // inp = lm_ggml_graph_node(gf, i);
1794
+ // if (strcmp(inp->name, "result_norm") == 0 || strcmp(inp->name, "result_embd") == 0) {
1795
+ // break;
1796
+ // }
1797
+
1798
+ // inp = nullptr;
1799
+ //}
1800
+
1801
+ LM_GGML_ASSERT(inp != nullptr && "missing result_norm/result_embd tensor");
1802
+
1803
+ lm_ggml_tensor * cur;
1804
+
1805
+ switch (pooling_type) {
1806
+ case LLAMA_POOLING_TYPE_NONE:
1807
+ {
1808
+ cur = inp;
1809
+ } break;
1810
+ case LLAMA_POOLING_TYPE_MEAN:
1811
+ {
1812
+ lm_ggml_tensor * inp_mean = build_inp_mean();
1813
+ cur = lm_ggml_mul_mat(ctx0, lm_ggml_cont(ctx0, lm_ggml_transpose(ctx0, inp)), inp_mean);
1814
+ } break;
1815
+ case LLAMA_POOLING_TYPE_CLS:
1816
+ case LLAMA_POOLING_TYPE_LAST:
1817
+ {
1818
+ lm_ggml_tensor * inp_cls = build_inp_cls();
1819
+ cur = lm_ggml_get_rows(ctx0, inp, inp_cls);
1820
+ } break;
1821
+ case LLAMA_POOLING_TYPE_RANK:
1822
+ {
1823
+ lm_ggml_tensor * inp_cls = build_inp_cls();
1824
+ inp = lm_ggml_get_rows(ctx0, inp, inp_cls);
1825
+
1826
+ if (cls) {
1827
+ // classification head
1828
+ // https://github.com/huggingface/transformers/blob/5af7d41e49bbfc8319f462eb45253dcb3863dfb7/src/transformers/models/roberta/modeling_roberta.py#L1566
1829
+ cur = lm_ggml_mul_mat(ctx0, cls, inp);
1830
+ if (cls_b) {
1831
+ cur = lm_ggml_add(ctx0, cur, cls_b);
1832
+ }
1833
+ cur = lm_ggml_tanh(ctx0, cur);
1834
+
1835
+ // some models don't have `cls_out`, for example: https://huggingface.co/jinaai/jina-reranker-v1-tiny-en
1836
+ // https://huggingface.co/jinaai/jina-reranker-v1-tiny-en/blob/cb5347e43979c3084a890e3f99491952603ae1b7/modeling_bert.py#L884-L896
1837
+ if (cls_out) {
1838
+ cur = lm_ggml_mul_mat(ctx0, cls_out, cur);
1839
+ if (cls_out_b) {
1840
+ cur = lm_ggml_add(ctx0, cur, cls_out_b);
1841
+ }
1842
+ }
1843
+ } else if (cls_out) {
1844
+ // Single layer classification head (direct projection)
1845
+ // https://github.com/huggingface/transformers/blob/f4fc42216cd56ab6b68270bf80d811614d8d59e4/src/transformers/models/bert/modeling_bert.py#L1476
1846
+ cur = lm_ggml_mul_mat(ctx0, cls_out, inp);
1847
+ if (cls_out_b) {
1848
+ cur = lm_ggml_add(ctx0, cur, cls_out_b);
1849
+ }
1850
+ } else {
1851
+ LM_GGML_ABORT("RANK pooling requires either cls+cls_b or cls_out+cls_out_b");
1852
+ }
1853
+ } break;
1854
+ default:
1855
+ {
1856
+ LM_GGML_ABORT("unknown pooling type");
1857
+ }
1858
+ }
1859
+
1860
+ cb(cur, "result_embd_pooled", -1);
1861
+ res->t_embd_pooled = cur;
1862
+
1863
+ lm_ggml_build_forward_expand(gf, cur);
1864
+ }
1865
+
1866
+ int32_t llama_relative_position_bucket(llama_pos x, llama_pos y, uint64_t n_buckets, bool bidirectional) {
1867
+ // TODO move to hparams if a T5 variant appears that uses a different value
1868
+ const int64_t max_distance = 128;
1869
+
1870
+ if (bidirectional) {
1871
+ n_buckets >>= 1;
1872
+ }
1873
+
1874
+ const int64_t max_exact = n_buckets >> 1;
1875
+
1876
+ int32_t relative_position = x - y;
1877
+ int32_t relative_bucket = 0;
1878
+
1879
+ if (bidirectional) {
1880
+ relative_bucket += (relative_position > 0) * n_buckets;
1881
+ relative_position = abs(relative_position);
1882
+ } else {
1883
+ relative_position = -std::min<int32_t>(relative_position, 0);
1884
+ }
1885
+
1886
+ int32_t relative_position_if_large = floorf(max_exact + logf(1.0 * relative_position / max_exact) * (n_buckets - max_exact) / log(1.0 * max_distance / max_exact));
1887
+ relative_position_if_large = std::min<int32_t>(relative_position_if_large, n_buckets - 1);
1888
+ relative_bucket += (relative_position < max_exact ? relative_position : relative_position_if_large);
1889
+
1890
+ return relative_bucket;
1891
+ }