@mlbottleneck/engine 0.4.0

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
@@ -0,0 +1 @@
1
+ {"generatedAt":"2026-08-23T15:45:49.157Z","source":"https://www.localmaxxing.com","goldCases":[{"id":"cmsuc6va105fims0190dgg8cp","hfId":"Qwen/Qwen3.8-27B","presetKey":"qwen3.8_27b","model":"Qwen3.8-27B","paramsB":28,"activeParamsB":null,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10352-baf0025de+umafix","quantKey":"q4","quantization":"UD-Q4_K_XL","contextLength":8192,"promptTokens":1227,"outputTokens":512,"kvCacheDtype":"fp16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":11.8,"prefillTokS":196.4,"ttftMs":6247.29,"peakVramGb":18,"reproducibility":7,"verified":false,"createdAt":"2026-08-15T12:12:56.665Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model Qwen3.8-27B-UD-Q4_K_XL.gguf -ngl 999 -c 8192 -fa on --no-mmap -np 1 -b 2048 -ub 1024 --temp 0 --no-cache-prompt","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.8-27B"},{"id":"cmso6s32v0001p301rz7n7tnl","hfId":"meta-models/Muse-Glimmer-30B","presetKey":"muse_glimmer_30b","model":"Muse-Glimmer-30B","paramsB":30,"activeParamsB":null,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":2,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10344-11-gdd1ea5243","quantKey":"int8","quantization":"UD-Q8_K_XL","contextLength":1372,"promptTokens":1116,"outputTokens":256,"kvCacheDtype":"f16","backend":"rocm","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":15.906,"prefillTokS":903.344,"ttftMs":1235.41,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-08-11T04:54:51.800Z","command":"/home/mikekey/.config/llama-swap/gpu-order.sh exec /home/mikekey/Experiments/llama.cpp/build-rocm/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --prio 3 -m /home/mikekey/models/gguf/meta/Muse-Glimmer-30B-UD-Q8_K_XL.gguf --mmproj /home/mikekey/models/gguf/meta/mmproj-Muse-Glimmer-30B-Q8_0.gguf --reasoning-format auto --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 --repeat-penalty 1.0 -ctk f16 -ctv f16 -ts 1/1/0 -np 1 -c 131072","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-models%2FMuse-Glimmer-30B"},{"id":"cms0rbqc700bgs201zchaje6n","hfId":"HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive","presetKey":"qwen3.6_35b_a3b","model":"Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive","paramsB":35,"activeParamsB":3,"hardwareTemplate":"Mac M5 Max (128)","hardware":"M5 Max","deviceCount":1,"memoryGB":128,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10079","quantKey":"q6","quantization":"Q6_K_P","contextLength":8192,"promptTokens":556,"outputTokens":128,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":99.72,"prefillTokS":null,"ttftMs":20.1,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-07-25T19:23:32.503Z","command":"llama-server -m Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q6_K_P.gguf --host 127.0.0.1 --port 8089 -ngl 99 -c 8192 --flash-attn on --temp 0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=HauhauCS%2FQwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive"},{"id":"cmqfktwk900b5mt019mtarh5q","hfId":"google/gemma-4-E2B-it","presetKey":"gemma4_e2b","model":"gemma-4-E2B-it","paramsB":5,"activeParamsB":null,"hardwareTemplate":"GTX 1060","hardware":"GTX 1060","deviceCount":1,"memoryGB":3,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9626-4988f6e86","quantKey":"q4","quantization":"Q4_K_S","contextLength":2048,"promptTokens":29,"outputTokens":100,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":48.18,"prefillTokS":129.32,"ttftMs":8399.1,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-06-15T18:58:51.034Z","command":"llama-server -m gemma-4-E2B-it-Q4_K_S -c 2048 --temp 0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=google%2Fgemma-4-E2B-it"},{"id":"cmqe2l7qs00x0mp014qzmtd5a","hfId":"Qwen/Qwen3.6-27B","presetKey":"qwen3.6_27b","model":"Qwen3.6-27B","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RTX 5090","hardware":"RTX 5090","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b741 (1fd6dfe)","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":74,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":70.1,"prefillTokS":2014.4,"ttftMs":36.73,"peakVramGb":16.1,"reproducibility":7,"verified":false,"createdAt":"2026-06-14T17:40:26.357Z","command":"llama-server -m Qwen3.6-27B-Q4_K_M.gguf --alias qwen3.6-27b-q4km -ngl 999 -fa on -c 8192 -ctk q8_0 -ctv q8_0 -np 1 --temp 0 --host 127.0.0.1 --port 8080","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.6-27B"},{"id":"cmpag0uvt004io101t6rm25o1","hfId":"Lasimeri/MiniMax-M2.7-int4-AutoRound","presetKey":"minimax_m2.7","model":"MiniMax-M2.7-int4-AutoRound","paramsB":32,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B70","hardware":"Intel Arc Pro B70","deviceCount":4,"memoryGB":32,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.20.1-local","quantKey":"q4","quantization":"INT4 AutoRound W4A16","contextLength":2048,"promptTokens":512,"outputTokens":1536,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":66.60932103987211,"prefillTokS":null,"ttftMs":null,"peakVramGb":29.3,"reproducibility":7,"verified":false,"createdAt":"2026-05-18T00:05:44.153Z","command":"LABEL=sample-hidden-clone-fulllogits-bench BENCH_REPEATS=2 RUN_EXTENDED_QUALITY=1 RUN_REPEAT_ARITHMETIC_QUALITY=1 REPEAT_ARITHMETIC_RUNS=16 VLLM_CACHE_ROOT=/mnt/fast-ai/vllm-cache-exp/minimax-strict-sample-hidden-clone-fulllogits-20260517 VLLM_RUNTIME_REQUIRE_ANY_MARKERS=VLLM_XPU_COMPILE_ALLREDUCE_NO_CLONE,VLLM_XPU_CLONE_SAMPLE_HIDDEN VLLM_XPU_COMPILE_ALLREDUCE_NO_CLONE=1 VLLM_XPU_CLONE_SAMPLE_HIDDEN=1 VLLM_MINIMAX_M2_CLONE_FINAL_HIDDEN=0 VLLM_BENCH_TEMPERATURE=0 CCL_TOPO_P2P_ACCESS=1 ONEAPI_DEVICE_SELECTOR=level_zero:0,1,2,3 ZE_AFFINITY_MASK=0,1,2,3 /home/steve/llm-optimizations-publish/scripts/run-minimax-strict-quality-gated-candidate.sh","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Lasimeri%2FMiniMax-M2.7-int4-AutoRound"},{"id":"cmoh3k1zb000fl704qcvewppz","hfId":"Qwen/Qwen3.6-27B","presetKey":"qwen3.6_27b","model":"Qwen3.6-27B","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RTX 3090","hardware":"RTX 3090","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b8892-0d0764dfd","quantKey":"q4","quantization":"UD-Q4_K_XL","contextLength":131072,"promptTokens":4096,"outputTokens":512,"kvCacheDtype":"q8_0","backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":37.88,"prefillTokS":null,"ttftMs":3782.9,"peakVramGb":21.6,"reproducibility":7,"verified":false,"createdAt":"2026-04-27T11:11:25.703Z","command":"./llama.cpp/llama-server \\\n --model unsloth/Qwen3.6-27B-GGUF/Qwen3.6-27B-UD-Q4_K_XL.gguf \\\n --alias \"unsloth/Qwen3.6-27B\" \\\n --host 0.0.0.0 --port 8001 \\\n --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.00 \\\n --kv-unified \\\n --cache-type-k q8_0 --cache-type-v q8_0 \\\n --flash-attn on --fit on \\\n --ctx-size 131072","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.6-27B"},{"id":"cmt3jngze0njfmv0133xpneeu","hfId":"unsloth/Qwen3.8-27B-GGUF","presetKey":"qwen3.8_27b","model":"Qwen3.8-27B-GGUF","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RTX 5070","hardware":"RTX 5070","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10449","quantKey":"q2","quantization":"UD-Q2_K_XL","contextLength":16384,"promptTokens":512,"outputTokens":1024,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":0,"batchSize":1,"observedTokS":45.81943,"prefillTokS":879.743668,"ttftMs":581.99,"peakVramGb":9.571,"reproducibility":6,"verified":false,"createdAt":"2026-08-21T22:51:44.187Z","command":"CUDA_VISIBLE_DEVICES=0 llama-bench -m Qwen3.8-27B-UD-Q2_K_XL.gguf -p 512 -n 1024 -d 0 -r 5 -b 256 -ub 64 -fa on -ctk q8_0 -ctv q8_0 -ngl -1 -dev CUDA0 -nkvo 0 --offline","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.8-27B-GGUF"},{"id":"cmt38y1zc0lprmv01ft85edfl","hfId":"ggml-org/gpt-oss-20b-GGUF","presetKey":"gpt_oss_20b","model":"gpt-oss-20b-GGUF","paramsB":22,"activeParamsB":null,"hardwareTemplate":"Mac M1 Max (64)","hardware":"M1 Max","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10520 (cd644c395, homebrew)","quantKey":"q4","quantization":"MXFP4","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":74.64,"prefillTokS":916.24,"ttftMs":558.8,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-08-21T17:52:02.184Z","command":"/opt/homebrew/bin/llama-bench -m /Users/sgtpooki/Library/Caches/llama.cpp/gpt-oss-20b-MXFP4.gguf -p 512 -n 128","source":"https://www.localmaxxing.com/en/leaderboard?hfId=ggml-org%2Fgpt-oss-20b-GGUF"},{"id":"cmt209j9m094smv012cbmznuu","hfId":"ornith-ai/Ornith-1.5-35B-A3B-GGUF","presetKey":"ornith_1.5_35b_a3b","model":"Ornith-1.5-35B-A3B-GGUF","paramsB":35,"activeParamsB":3,"hardwareTemplate":"RTX 3080","hardware":"RTX 3080","deviceCount":1,"memoryGB":10,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10472","quantKey":"q4","quantization":"Q4_K_M","contextLength":131072,"promptTokens":2700,"outputTokens":256,"kvCacheDtype":"q8_0","backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":64.44,"prefillTokS":596.32,"ttftMs":4466.1,"peakVramGb":9.61,"reproducibility":6,"verified":false,"createdAt":"2026-08-20T21:01:15.083Z","command":"llama-server \\\n -m Ornith-1.5-35B-Q4_K_M.gguf \\\n --host 127.0.0.1 --port 8099 \\\n --device CUDA0 --n-gpu-layers 99 \\\n --ctx-size 131072 \\\n --flash-attn on \\\n --cache-type-k q8_0 --cache-type-v q8_0 \\\n --parallel 1 --jinja \\\n --spec-type none","source":"https://www.localmaxxing.com/en/leaderboard?hfId=ornith-ai%2FOrnith-1.5-35B-A3B-GGUF"},{"id":"cmsyvzb190dowms01ss5wwp1u","hfId":"unsloth/gemma-4-E2B-it-GGUF","presetKey":"gemma4_e2b","model":"gemma-4-E2B-it-GGUF","paramsB":2,"activeParamsB":null,"hardwareTemplate":"RTX 3060","hardware":"RTX 3060","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10443","quantKey":"q4","quantization":"Q4_K_M","contextLength":32768,"promptTokens":490,"outputTokens":925,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":113.4,"prefillTokS":3555.41,"ttftMs":null,"peakVramGb":1.87,"reproducibility":6,"verified":false,"createdAt":"2026-08-18T16:38:00.862Z","command":"/home/mani/llama.cpp/build/bin/llama-server --model /home/mani/llama_models/gemma-4-e2b/gemma-4-E2B-it-Q4_K_M.gguf --alias gemma-4-E2B --host 127.0.0.1 --port 8094 -ngl 99 -fa on -ctk q4_0 -ctv q4_0 -c 32768 -n 8192 --reasoning on --jinja","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2Fgemma-4-E2B-it-GGUF"},{"id":"cmsu31w30051dms01kzdplz5k","hfId":"unsloth/Qwen3.8-27B-GGUF","presetKey":"qwen3.8_27b","model":"Qwen3.8-27B-GGUF","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RX 7900 XTX","hardware":"RX 7900 XTX","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"llama.cpp ROCm build","quantKey":"q4","quantization":"Q4_K_M","contextLength":2048,"promptTokens":490,"outputTokens":1024,"kvCacheDtype":"q8_0","backend":"rocm","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":34.5,"prefillTokS":null,"ttftMs":167.2,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-08-15T07:57:07.885Z","command":"llama-server -m Qwen3.8-27B-Q4_K_M.gguf --mmproj mmproj-F16.gguf -ngl 99 --host 0.0.0.0 --port 11436 -c 131072 --parallel 1 --reasoning-preserve --flash-attn on --cache-type-k q8_0 --cache-type-v q8_0 --image-min-tokens 1024","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.8-27B-GGUF"},{"id":"cmsovepw700e6mp01lmkajllm","hfId":"unsloth/Muse-Glimmer-30B-GGUF","presetKey":"muse_glimmer_30b","model":"Muse-Glimmer-30B-GGUF","paramsB":30,"activeParamsB":null,"hardwareTemplate":"RTX PRO 6000 Blackwell","hardware":"RTX PRO 6000 Blackwell","deviceCount":1,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"10355","quantKey":"int8","quantization":"Q8_K_XL","contextLength":131072,"promptTokens":512,"outputTokens":512,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":48.1,"prefillTokS":3624,"ttftMs":402,"peakVramGb":32.8,"reproducibility":6,"verified":false,"createdAt":"2026-08-11T16:24:18.583Z","command":"llama-server -m /home/<USER>/models/Muse-Glimmer-30B-GGUF-unsloth/Muse-Glimmer-30B-UD-Q8_K_XL.gguf --mmproj /home/<USER>/models/Muse-Glimmer-30B-GGUF/mmproj-kquant.gguf --host 0.0.0.0 --port 8092 -ngl 99 -c 131072 -n 16000 --reasoning off --alias muse-q8-llamacpp","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FMuse-Glimmer-30B-GGUF"},{"id":"cmsmi0yui0033o001nx5g426q","hfId":"Qwen/Qwen3-0.6B","presetKey":"qwen3_0.6b","model":"Qwen3-0.6B","paramsB":1,"activeParamsB":null,"hardwareTemplate":"Mac M4 Pro (48)","hardware":"M4 Pro","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10333","quantKey":"bfloat16","quantization":"BF16","contextLength":2048,"promptTokens":512,"outputTokens":512,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":60.99,"prefillTokS":2385.49,"ttftMs":null,"peakVramGb":1.4,"reproducibility":6,"verified":false,"createdAt":"2026-08-10T00:34:09.642Z","command":"llama-bench -m ./qwen3-0.6b-bf16.gguf","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-0.6B"},{"id":"cmsgb07z6012zpp01zkgaxjnw","hfId":"unsloth/Qwen3.6-35B-A3B-GGUF","presetKey":"qwen3.6_35b_a3b","model":"Qwen3.6-35B-A3B-GGUF","paramsB":35,"activeParamsB":null,"hardwareTemplate":"Tesla V100 32GB","hardware":"Tesla V100","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"e031d95","quantKey":"q4","quantization":"Q4_K_M","contextLength":65536,"promptTokens":45536,"outputTokens":2000,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":75.43,"prefillTokS":635.78,"ttftMs":71635,"peakVramGb":21.59,"reproducibility":6,"verified":false,"createdAt":"2026-08-05T16:31:00.451Z","command":"llama-server -m model.gguf -c 65536 -ngl 99 -ncmoe 0 -ctk q8_0 -ctv q8_0 -b 2048 -ub 512 -t 32 -np 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.6-35B-A3B-GGUF"},{"id":"cms7rjnlp009hpf01req2oz1w","hfId":"openai/gpt-oss-20b","presetKey":"gpt_oss_20b","model":"gpt-oss-20b","paramsB":22,"activeParamsB":null,"hardwareTemplate":"RX 6700 XT","hardware":"RX 6700 XT","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"e1a1abb","quantKey":"int8","quantization":"Q8_0","contextLength":4736,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"rocm","splitMode":null,"cpuMoeLayers":24,"decodeDepthTokens":4096,"batchSize":1,"observedTokS":24.48,"prefillTokS":842.1,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-30T17:04:05.437Z","command":"llama-bench -m <model> -p 512 -n 128 -d 4096 -ncmoe 24 (HSA_OVERRIDE_GFX_VERSION=10.3.0)","source":"https://www.localmaxxing.com/en/leaderboard?hfId=openai%2Fgpt-oss-20b"},{"id":"cmryoj31g0435o401cbxy7hen","hfId":"poolside/Laguna-S-2.1-GGUF","presetKey":"laguna_s_2.1","model":"Laguna-S-2.1-GGUF","paramsB":118,"activeParamsB":null,"hardwareTemplate":"NVIDIA DGX Spark (GB10)","hardware":"GB10 Grace Blackwell","deviceCount":1,"memoryGB":128,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"1 (04b2b72)","quantKey":"q4","quantization":"Q4_K_M","contextLength":9280,"promptTokens":8192,"outputTokens":1024,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":19.3,"prefillTokS":785.3,"ttftMs":10431.6,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-24T08:29:44.356Z","command":"llama-server --model laguna-s-2.1-Q4_K_M.gguf --alias poolside/Laguna-S-2.1-GGUF --ctx-size 9280 --parallel 1 --batch-size 2048 --ubatch-size 1024 --n-gpu-layers auto --fit on --fit-target 24576 --flash-attn on --cache-type-k q4_0 --cache-type-v q4_0 --cache-ram 0 --cache-reuse 0 --context-checkpoints 0 --host 127.0.0.1 --port 8000 --metrics","source":"https://www.localmaxxing.com/en/leaderboard?hfId=poolside%2FLaguna-S-2.1-GGUF"},{"id":"cmrkosr4e04irmj01l92xk44a","hfId":"LiquidAI/LFM2-350M","presetKey":"lfm2_350m","model":"LFM2-350M","paramsB":null,"activeParamsB":null,"hardwareTemplate":"AMD Radeon 780M (Ryzen 7840HS / 8745H)","hardware":"AMD Ryzen 7 7840HS","deviceCount":1,"memoryGB":null,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"commit 6b4dc21, AVX2 -Ofast Zen4-tuned no-repack build","quantKey":"q2","quantization":"Q2_K_S","contextLength":512,"promptTokens":256,"outputTokens":256,"kvCacheDtype":"f16","backend":"cpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":294.741056,"prefillTokS":1059.446184,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-14T13:28:29.006Z","command":"taskset -c 0-15 llama-bench -m LFM2-350M-Q2_K_S-imatrix.gguf -p 256 -n 0 -b 1024 -ub 512 -t 16 --poll 100 -ctk f16 -ctv f16 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2-350M"},{"id":"cmrjrlnjp02tumj01o0fdo23w","hfId":"Jiunsong/supergemma4-26b-uncensored-gguf-v2","presetKey":"gemma4_26b_a4b","model":"supergemma4-26b-uncensored-gguf-v2","paramsB":26,"activeParamsB":null,"hardwareTemplate":"RTX 5060 Ti 16GB","hardware":"RTX 5060 Ti","deviceCount":2,"memoryGB":16,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":32768,"promptTokens":37,"outputTokens":256,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":89.4,"prefillTokS":297,"ttftMs":124.58,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-13T21:59:10.453Z","command":"llama-server -m supergemma4-26b-uncensored-fast-v2-Q4_K_M.gguf -ngl 99 --tensor-split 0.5,0.5 -c 32768 -fa on --cache-type-k q4_0 --cache-type-v q4_0 -np 1 --temp 0 --host 0.0.0.0 --port 8080","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Jiunsong%2Fsupergemma4-26b-uncensored-gguf-v2"},{"id":"cmr3y4bw40002mx01idpcyfbx","hfId":"Qwen/Qwen3.5-9B","presetKey":"qwen3.5_9b","model":"Qwen3.5-9B","paramsB":9,"activeParamsB":null,"hardwareTemplate":"RTX 3060 Ti","hardware":"RTX 3060 Ti","deviceCount":1,"memoryGB":8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"llama.cpp b9860","quantKey":"q4","quantization":"Q4_K_M","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":63.48,"prefillTokS":2060.07,"ttftMs":248.5,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-02T20:17:20.693Z","command":"llama-bench -m /home/wstone/models/Qwen3.5-9B-GGUF/Qwen3.5-9B-Q4_K_M.gguf -ngl 99 -fa on -p 512 -n 128 -r 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.5-9B"},{"id":"cmr29whkt05fppi01w8clprkb","hfId":"LiquidAI/LFM2.5-1.2B-Instruct-GGUF","presetKey":"lfm2.5_1.2b","model":"LFM2.5-1.2B-Instruct-GGUF","paramsB":1,"activeParamsB":null,"hardwareTemplate":"Mac M5 Pro (64)","hardware":"M5 Pro","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"9850 (4f31eedb0)","quantKey":"q4","quantization":"Q4_K_M","contextLength":4224,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":3584,"batchSize":1,"observedTokS":267.84,"prefillTokS":5701.71,"ttftMs":89.8,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-01T16:11:37.854Z","command":"llama-bench -m /LiquidAI/LFM2.5-1.2B-Instruct-GGUF/LFM2.5-1.2B-Instruct-Q4_K_M.gguf \\\n -ngl 999 \\\n -b 2048 \\\n -ub 512 \\\n -d 3584 \\\n -pg 512,128 \\","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2.5-1.2B-Instruct-GGUF"},{"id":"cmp54jfz9003vo301ikhi2ysx","hfId":"unsloth/Qwen3.6-27B-GGUF","presetKey":"qwen3.6_27b","model":"Qwen3.6-27B-GGUF","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RTX A5000","hardware":"RTX A5000","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"320a6a44a","quantKey":"q4","quantization":"Q4_K_M","contextLength":4096,"promptTokens":1045,"outputTokens":512,"kvCacheDtype":"fp16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":32.250073,"prefillTokS":869.582326,"ttftMs":null,"peakVramGb":16.149,"reproducibility":6,"verified":false,"createdAt":"2026-05-14T06:45:25.030Z","command":"/data/bt/os/llama.cpp/llama.cpp-bench-upstream/build-bench-cuda-gcc15/bin/llama-server -m /data/bt/models/hub/models--unsloth--Qwen3.6-27B-GGUF/snapshots/82d411acf4a06cfb8d9b073a5211bf410bfc29bf/Qwen3.6-27B-Q4_K_M.gguf -a qwen3.6-27b-q4_k_m -ngl 999 -fa on -c 4096 -b 2048 -ub 512 -np 1 --no-context-shift --metrics --no-webui --host 127.0.0.1 --port 18107","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.6-27B-GGUF"},{"id":"cmoyx4mha0037tl01zq557zle","hfId":"google/gemma-4-E4B-it","presetKey":"gemma4_e4b","model":"gemma-4-E4B-it","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RX 9060 XT","hardware":"RX 9060 XT","deviceCount":1,"memoryGB":16,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9090","quantKey":"int8","quantization":"Q8","contextLength":8192,"promptTokens":8192,"outputTokens":128,"kvCacheDtype":"auto","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":52.73,"prefillTokS":2118.5,"ttftMs":3866.89,"peakVramGb":5.6,"reproducibility":6,"verified":false,"createdAt":"2026-05-09T22:31:19.246Z","command":"llama-bench -m E:\\AI\\llmfit\\gemma-4-E4B-it-Q8_0.gguf -ngl 999 -fa 1 -p 8192 -n 128 -r 3 -o md","source":"https://www.localmaxxing.com/en/leaderboard?hfId=google%2Fgemma-4-E4B-it"},{"id":"cmolpeunj000el2045o540qlc","hfId":"Qwen/Qwen3.6-35B-A3B","presetKey":"qwen3.6_35b_a3b","model":"Qwen3.6-35B-A3B","paramsB":36,"activeParamsB":3,"hardwareTemplate":"RTX 5080","hardware":"RTX 5080","deviceCount":1,"memoryGB":16,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b8986","quantKey":"q3","quantization":"IQ3_XXS","contextLength":131072,"promptTokens":512,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":150.6,"prefillTokS":null,"ttftMs":null,"peakVramGb":14.2,"reproducibility":6,"verified":false,"createdAt":"2026-04-30T16:34:19.184Z","command":"/llama.cpp/build/bin/llama-server \\\n -m Qwen3.6-35B-A3B-UD-IQ3_XXS.gguf \\\n -ngl 99 \\\n -np 1 \\\n --flash-attn on \\\n --cache-type-k q8_0 \\\n --cache-type-v q8_0 \\\n --ctx-size 131072 \\\n --host 0.0.0.0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.6-35B-A3B"},{"id":"cmok73fys000dl1040u12pav9","hfId":"Qwen/Qwen3.6-27B","presetKey":"qwen3.6_27b","model":"Qwen3.6-27B","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RTX 4090","hardware":"RTX 4090","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b8963","quantKey":"q4","quantization":"IQ4_NL","contextLength":98304,"promptTokens":252,"outputTokens":1024,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":44.2,"prefillTokS":null,"ttftMs":850,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-04-29T15:13:47.668Z","command":"llama-server --model Qwen3.6-27B-IQ4_NL.gguf --port 8080 -c 98304 --flash-attn on --cache-type-k q8_0 --cache-type-v q8_0 --n-gpu-layers 99 --no-mmap --jinja --batch-size 4096 --ubatch-size 512","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.6-27B"},{"id":"cmogt0ksa000wjv04oqlbcm4w","hfId":"Qwen/Qwen3.5-9B","presetKey":"qwen3.5_9b","model":"Qwen3.5-9B","paramsB":9,"activeParamsB":null,"hardwareTemplate":"RTX 3090 Ti","hardware":"RTX 3090 Ti","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b1-6217b49 (CUDA)","quantKey":"q4","quantization":"UD-Q4_K_XL","contextLength":8192,"promptTokens":512,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":119.05,"prefillTokS":null,"ttftMs":155.81,"peakVramGb":8,"reproducibility":6,"verified":false,"createdAt":"2026-04-27T06:16:20.795Z","command":"llama-server -m Qwen3.5-9B-UD-Q4_K_XL.gguf --alias qwen3.5-9b-q4 -ngl 999 -fa 1 --no-mmap -c 8192 -ctk q8_0 -ctv q8_0 -b 2048 -ub 2048 --metrics --jinja --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --host 127.0.0.1 --port 8003","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.5-9B"},{"id":"cmofnviki000ll704ogjm0ei2","hfId":"unsloth/Qwen3-Coder-Next","presetKey":"qwen3_coder_next","model":"Qwen3-Coder-Next","paramsB":null,"activeParamsB":null,"hardwareTemplate":"Mac M3 Ultra (512)","hardware":"M3 Ultra","deviceCount":1,"memoryGB":512,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b8920","quantKey":"q5","quantization":"Q5_K_XL","contextLength":8192,"promptTokens":59,"outputTokens":256,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":57.14,"prefillTokS":null,"ttftMs":175.5,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-04-26T11:04:40.386Z","command":"llama-server -m Qwen3-Coder-Next-UD-Q5_K_XL-00001-of-00003.gguf -c 32768 --port 8081 -ngl 99 -fa on --fit off","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3-Coder-Next"},{"id":"cmofia1vo0009l7048w39brkk","hfId":"unsloth/Qwen3.6-27B-UD-MLX-4bit","presetKey":"qwen3.6_27b","model":"Qwen3.6-27B-UD-MLX-4bit","paramsB":27,"activeParamsB":null,"hardwareTemplate":"Mac M4 Max (128)","hardware":"M4 Max","deviceCount":1,"memoryGB":64,"runtimeKey":"mlx","engine":"mlx","engineVersion":"mlx-lm 0.31.3 / mlx 0.31.2 / mlx-metal 0.31.2","quantKey":"q4","quantization":"int4","contextLength":6128,"promptTokens":128,"outputTokens":6000,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":18.434,"prefillTokS":null,"ttftMs":676,"peakVramGb":25.896,"reproducibility":6,"verified":false,"createdAt":"2026-04-26T08:28:00.900Z","command":"mlx_lm.benchmark --model unsloth/Qwen3.6-27B-UD-MLX-4bit --prompt-tokens 128 --generation-tokens 6000","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.6-27B-UD-MLX-4bit"},{"id":"cmt0cxfpd0emems01x6er620u","hfId":"ornith-ai/Ornith-1.5-35B-A3B-GGUF","presetKey":"ornith_1.5_35b_a3b","model":"Ornith-1.5-35B-A3B-GGUF","paramsB":35,"activeParamsB":3,"hardwareTemplate":"RTX 4070","hardware":"RTX 4070","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":131072,"promptTokens":125120,"outputTokens":120,"kvCacheDtype":"q4_0","backend":null,"splitMode":null,"cpuMoeLayers":22,"decodeDepthTokens":null,"batchSize":1,"observedTokS":36.31,"prefillTokS":584.62,"ttftMs":650,"peakVramGb":11.5,"reproducibility":5,"verified":false,"createdAt":"2026-08-19T17:20:13.250Z","command":"llama-server -m /home/llm/models/ornith-1.5-35b/Ornith-1.5-35B-Q4_K_M.gguf -ngl 99 --n-cpu-moe 22 -c 131072 -fa on --jinja -np 1 -ctk q4_0 -ctv q4_0 -b 1024 -ub 512 --temp 1.0 --top-p 0.95 --top-k 20 --reasoning on","source":"https://www.localmaxxing.com/en/leaderboard?hfId=ornith-ai%2FOrnith-1.5-35B-A3B-GGUF"},{"id":"cmsw04ez308grms01d0b67xkh","hfId":"unsloth/Qwen3.8-27B-GGUF","presetKey":"qwen3.8_27b","model":"Qwen3.8-27B-GGUF","paramsB":28,"activeParamsB":null,"hardwareTemplate":"A100","hardware":"A100","deviceCount":1,"memoryGB":40,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"int8","quantization":"Q8_0","contextLength":65536,"promptTokens":4096,"outputTokens":256,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":33.72,"prefillTokS":1088.2,"ttftMs":10193.9,"peakVramGb":30,"reproducibility":5,"verified":false,"createdAt":"2026-08-16T16:10:39.183Z","command":"llama-server -m Qwen3.8-27B-Q8_0.gguf --host 0.0.0.0 --port 8080 -c 65536 --cache-type-k q8_0 --cache-type-v q8_0 --flash-attn on -ngl 99","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.8-27B-GGUF"},{"id":"cmqzbq4ou02hioe0194o2c1c4","hfId":"meta-llama/Meta-Llama-3-8B-Instruct","presetKey":"llama3_8b","model":"Meta-Llama-3-8B-Instruct","paramsB":8,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B60","hardware":"Intel Arc Pro B60","deviceCount":2,"memoryGB":48,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_0","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":2048,"batchSize":1,"observedTokS":64.395111,"prefillTokS":826.005659,"ttftMs":619.9,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T14:39:21.918Z","command":"llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/Meta-Llama-3-8B-Instruct-Q4_0.gguf -p 512 -n 128 -d 2048 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-llama%2FMeta-Llama-3-8B-Instruct"},{"id":"cmqg905oo0032p20194xx8szd","hfId":"LiquidAI/LFM2.5-8B-A1B","presetKey":"lfm2.5_8b_a1b","model":"LFM2.5-8B-A1B","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RTX 5070 Ti","hardware":"RTX 5070 Ti","deviceCount":1,"memoryGB":16,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"int8","quantization":"Q8_K_XL","contextLength":4096,"promptTokens":31,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":301.3,"prefillTokS":1622.5,"ttftMs":19.11,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-16T06:15:33.576Z","command":"llama-server at 192.168.0.65:8080 -m LFM2.5-8B-A1B-Q8_K_XL.gguf","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2.5-8B-A1B"},{"id":"cmsuc5fri05ffms01u7umamgt","hfId":"unsloth/Qwen3.8-27B-GGUF","presetKey":"qwen3.8_27b","model":"Qwen3.8-27B-GGUF","paramsB":28,"activeParamsB":null,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10352-baf0025de+umafix","quantKey":"q4","quantization":"UD-Q4_K_XL","contextLength":8192,"promptTokens":1227,"outputTokens":512,"kvCacheDtype":"fp16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":11.8,"prefillTokS":196.4,"ttftMs":6247.29,"peakVramGb":18,"reproducibility":7,"verified":false,"createdAt":"2026-08-15T12:11:49.902Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model Qwen3.8-27B-UD-Q4_K_XL.gguf -ngl 999 -c 8192 -fa on --no-mmap -np 1 -b 2048 -ub 1024 --temp 0 --no-cache-prompt","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.8-27B-GGUF"},{"id":"cmsnhy3zj00f7o001zp5c1eyf","hfId":"meta-models/Muse-Glimmer-30B","presetKey":"muse_glimmer_30b","model":"Muse-Glimmer-30B","paramsB":30,"activeParamsB":null,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":2,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10344-11-gdd1ea5243","quantKey":"int8","quantization":"UD-Q8_K_XL","contextLength":834,"promptTokens":578,"outputTokens":256,"kvCacheDtype":"f16","backend":"rocm","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":15.965,"prefillTokS":661.728,"ttftMs":873.47,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-08-10T17:19:42.512Z","command":"/home/mikekey/.config/llama-swap/gpu-order.sh exec /home/mikekey/Experiments/llama.cpp/build-rocm/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --prio 3 -m /home/mikekey/models/gguf/meta/Muse-Glimmer-30B-UD-Q8_K_XL.gguf --mmproj /home/mikekey/models/gguf/meta/mmproj-Muse-Glimmer-30B-Q8_0.gguf --reasoning-format auto --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 --repeat-penalty 1.0 -ctk f16 -ctv f16 -ts 1/1/0 -np 1 -c 131072","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-models%2FMuse-Glimmer-30B"},{"id":"cms3cgoml00wls201xbqtguju","hfId":"pipenetwork/Laguna-S-2.1-MLX-4bit","presetKey":"laguna_s_2.1","model":"Laguna-S-2.1-MLX-4bit","paramsB":118,"activeParamsB":null,"hardwareTemplate":"Mac M5 Max (128)","hardware":"M5 Max","deviceCount":1,"memoryGB":128,"runtimeKey":"mlx","engine":"mlx","engineVersion":"mlx 0.32.0 + mlx-lm 0.31.3","quantKey":"q4","quantization":"4bit-affine-gs64","contextLength":952,"promptTokens":814,"outputTokens":128,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":13.28,"prefillTokS":51.8,"ttftMs":15720.9,"peakVramGb":66,"reproducibility":6,"verified":false,"createdAt":"2026-07-27T14:50:47.854Z","command":"python -c 'import mlx_lm; mlx_lm.generate(...)' (stock, no opts)","source":"https://www.localmaxxing.com/en/leaderboard?hfId=pipenetwork%2FLaguna-S-2.1-MLX-4bit"},{"id":"cmqfksb9u00azmt01jfy0rl7s","hfId":"Qwen/Qwen2.5-Coder-7B","presetKey":"qwen2.5_7b","model":"Qwen2.5-Coder-7B","paramsB":8,"activeParamsB":null,"hardwareTemplate":"GTX 1060","hardware":"GTX 1060","deviceCount":1,"memoryGB":3,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9626-4988f6e86","quantKey":"q4","quantization":"Q4_K_M","contextLength":2048,"promptTokens":30,"outputTokens":100,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":3.12,"prefillTokS":13.94,"ttftMs":42149.88,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-06-15T18:57:36.786Z","command":"llama-server -m Qwopus3.5-9B-coder-Exp-Q4_K_M -c 2048 --temp 0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen2.5-Coder-7B"},{"id":"cmqe2e4m600wvmp01ofxpvoab","hfId":"Qwen/Qwen3.6-27B","presetKey":"qwen3.6_27b","model":"Qwen3.6-27B","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RTX 5090","hardware":"RTX 5090","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b741 (1fd6dfe)","quantKey":"q3","quantization":"UD-Q3_K_XL","contextLength":8192,"promptTokens":74,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":73.5,"prefillTokS":2063.4,"ttftMs":35.86,"peakVramGb":14.2,"reproducibility":7,"verified":false,"createdAt":"2026-06-14T17:34:55.710Z","command":"llama-server -m Qwen3.6-27B-UD-Q3_K_XL.gguf --alias qwen3.6-27b-q3kxl -ngl 999 -fa on -c 8192 -ctk q8_0 -ctv q8_0 -np 1 --temp 0 --host 127.0.0.1 --port 8080","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.6-27B"},{"id":"cmpaepjz10043o101822jzc73","hfId":"Lasimeri/MiniMax-M2.7-int4-AutoRound","presetKey":"minimax_m2.7","model":"MiniMax-M2.7-int4-AutoRound","paramsB":32,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B70","hardware":"Intel Arc Pro B70","deviceCount":4,"memoryGB":32,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.20.1-local","quantKey":"q4","quantization":"INT4 AutoRound W4A16","contextLength":2048,"promptTokens":512,"outputTokens":1536,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":66.48535508598121,"prefillTokS":null,"ttftMs":null,"peakVramGb":29.3,"reproducibility":7,"verified":false,"createdAt":"2026-05-17T23:28:57.181Z","command":"LABEL=no-clone-clonefinal-fulllogits-bench BENCH_REPEATS=2 RUN_EXTENDED_QUALITY=1 RUN_REPEAT_ARITHMETIC_QUALITY=1 REPEAT_ARITHMETIC_RUNS=16 VLLM_CACHE_ROOT=/mnt/fast-ai/vllm-cache-exp/minimax-strict-no-clone-clonefinal-fulllogits-20260517 VLLM_RUNTIME_REQUIRE_ANY_MARKERS=VLLM_XPU_COMPILE_ALLREDUCE_NO_CLONE,VLLM_MINIMAX_M2_CLONE_FINAL_HIDDEN VLLM_XPU_COMPILE_ALLREDUCE_NO_CLONE=1 VLLM_MINIMAX_M2_CLONE_FINAL_HIDDEN=1 VLLM_BENCH_TEMPERATURE=0 CCL_TOPO_P2P_ACCESS=1 ONEAPI_DEVICE_SELECTOR=level_zero:0,1,2,3 ZE_AFFINITY_MASK=0,1,2,3 /home/steve/llm-optimizations-publish/scripts/run-minimax-strict-quality-gated-candidate.sh","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Lasimeri%2FMiniMax-M2.7-int4-AutoRound"},{"id":"cmoh3cued0004js0482vbtb3k","hfId":"Qwen/Qwen3.6-27B","presetKey":"qwen3.6_27b","model":"Qwen3.6-27B","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RTX 3090","hardware":"RTX 3090","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b8892-0d0764dfd","quantKey":"q4","quantization":"UD-Q4_K_XL","contextLength":131072,"promptTokens":512,"outputTokens":256,"kvCacheDtype":"q8_0","backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":38.78,"prefillTokS":null,"ttftMs":813.9,"peakVramGb":21.58,"reproducibility":7,"verified":false,"createdAt":"2026-04-27T11:05:49.286Z","command":"./llama.cpp/llama-server \\\n --model unsloth/Qwen3.6-27B-GGUF/Qwen3.6-27B-UD-Q4_K_XL.gguf \\\n --alias \"unsloth/Qwen3.6-27B\" \\\n --host 0.0.0.0 --port 8001 \\\n --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.00 \\\n --kv-unified \\\n --cache-type-k q8_0 --cache-type-v q8_0 \\\n --flash-attn on --fit on \\\n --ctx-size 131072","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.6-27B"},{"id":"cmsv68xl3085ims01w8aeacig","hfId":"unsloth/Qwen3.8-27B-GGUF","presetKey":"qwen3.8_27b","model":"Qwen3.8-27B-GGUF","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RTX 5070","hardware":"RTX 5070","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10449+0d9ceae1e","quantKey":"q2","quantization":"UD-IQ2_XXS","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":"fp16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":46.3218078,"prefillTokS":997.4961168,"ttftMs":541.1506557982648,"peakVramGb":10.107421875,"reproducibility":6,"verified":false,"createdAt":"2026-08-16T02:14:21.448Z","command":"llama-bench -m Qwen3.8-27B-UD-IQ2_XXS.gguf -p 512 -n 128 -b 2048 -ub 512 -ngl -1 -o json -r 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.8-27B-GGUF"},{"id":"cmrxr3rz900wjo4010q4gt3uj","hfId":"badtheorylabs/BTL-3-Compact","presetKey":"qwen3.6_27b","model":"BTL-3-Compact","paramsB":28,"activeParamsB":null,"hardwareTemplate":"Mac M1 Max (64)","hardware":"M1 Max","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"btl3-fork-34db15e","quantKey":"q2","quantization":"AVQ2","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":3.78,"prefillTokS":4.76,"ttftMs":107563,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-23T16:54:02.853Z","command":"/Users/sgtpooki/lmx-m1max/btl3-src/native/llama.cpp/build/bin/llama-bench -m /Users/sgtpooki/lmx-m1max/btl3-model/model/BTL-3-Compact-AVQ2.gguf -p 512 -n 128 -r 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=badtheorylabs%2FBTL-3-Compact"},{"id":"cmt1zgkzp08yxmv01h4zcha9k","hfId":"LiquidAI/LFM2.5-8B-A1B-GGUF","presetKey":"lfm2.5_8b_a1b","model":"LFM2.5-8B-A1B-GGUF","paramsB":8,"activeParamsB":1,"hardwareTemplate":"RTX 3080","hardware":"RTX 3080","deviceCount":1,"memoryGB":10,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10472","quantKey":"q6","quantization":"Q6_K","contextLength":128000,"promptTokens":2617,"outputTokens":256,"kvCacheDtype":"q8_0","backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":277.81,"prefillTokS":9840.68,"ttftMs":286.4,"peakVramGb":8.07,"reproducibility":6,"verified":false,"createdAt":"2026-08-20T20:38:44.293Z","command":"llama-server \\\n -m LFM2.5-8B-A1B-Q6_K.gguf \\\n --host 127.0.0.1 --port 8099 \\\n --device CUDA0 --n-gpu-layers 99 \\\n --ctx-size 128000 \\\n --flash-attn on \\\n --cache-type-k q8_0 --cache-type-v q8_0 \\\n --parallel 1 --jinja \\\n --spec-type none","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2.5-8B-A1B-GGUF"},{"id":"cmsyvzaq70dotms01buj7i7zt","hfId":"unsloth/Qwen3.5-4B-GGUF","presetKey":"qwen3.5_4b","model":"Qwen3.5-4B-GGUF","paramsB":4,"activeParamsB":null,"hardwareTemplate":"RTX 3060","hardware":"RTX 3060","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10443","quantKey":"q4","quantization":"Q4_K_M","contextLength":32768,"promptTokens":261,"outputTokens":3525,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":78.63,"prefillTokS":2111.87,"ttftMs":null,"peakVramGb":3.5,"reproducibility":6,"verified":false,"createdAt":"2026-08-18T16:38:00.463Z","command":"/home/mani/llama.cpp/build/bin/llama-server --model /home/mani/llama_models/qwen3.5-4b/Qwen3.5-4B-Q4_K_M.gguf --alias Qwen3.5-4B --host 127.0.0.1 --port 8094 -ngl 99 -fa on -ctk q4_0 -ctv q4_0 -c 32768 -n 8192 --reasoning on --jinja","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.5-4B-GGUF"},{"id":"cmsu31vtf051ams01lvffu63n","hfId":"unsloth/Qwen3.8-27B-GGUF","presetKey":"qwen3.8_27b","model":"Qwen3.8-27B-GGUF","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RX 7900 XTX","hardware":"RX 7900 XTX","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"llama.cpp ROCm build","quantKey":"q4","quantization":"Q4_K_M","contextLength":2048,"promptTokens":74,"outputTokens":256,"kvCacheDtype":"q8_0","backend":"rocm","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":34.7,"prefillTokS":430.1,"ttftMs":172.06,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-08-15T07:57:07.540Z","command":"llama-server -m Qwen3.8-27B-Q4_K_M.gguf --mmproj mmproj-F16.gguf -ngl 99 --host 0.0.0.0 --port 11436 -c 131072 --parallel 1 --reasoning-preserve --flash-attn on --cache-type-k q8_0 --cache-type-v q8_0 --image-min-tokens 1024","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.8-27B-GGUF"},{"id":"cmsovepet00e0mp01w8cnywhq","hfId":"unsloth/Muse-Glimmer-30B-GGUF","presetKey":"muse_glimmer_30b","model":"Muse-Glimmer-30B-GGUF","paramsB":30,"activeParamsB":null,"hardwareTemplate":"RTX PRO 6000 Blackwell","hardware":"RTX PRO 6000 Blackwell","deviceCount":1,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"10355","quantKey":"int8","quantization":"Q8_K_XL","contextLength":131072,"promptTokens":0,"outputTokens":13566,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":48.1,"prefillTokS":3624,"ttftMs":402,"peakVramGb":32.8,"reproducibility":6,"verified":false,"createdAt":"2026-08-11T16:24:17.957Z","command":"llama-server -m /home/<USER>/models/Muse-Glimmer-30B-GGUF-unsloth/Muse-Glimmer-30B-UD-Q8_K_XL.gguf --mmproj /home/<USER>/models/Muse-Glimmer-30B-GGUF/mmproj-kquant.gguf --host 0.0.0.0 --port 8092 -ngl 99 -c 131072 -n 16000 --reasoning off --alias muse-q8-llamacpp","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FMuse-Glimmer-30B-GGUF"},{"id":"cmqw2nbhr036tqr01x5x4dln8","hfId":"lmstudio-community/gemma-4-26B-A4B-it-QAT-MLX-4bit","presetKey":"gemma4_26b_a4b","model":"gemma-4-26B-A4B-it-QAT-MLX-4bit","paramsB":5,"activeParamsB":4,"hardwareTemplate":"Mac M4 Pro (48)","hardware":"M4 Pro","deviceCount":1,"memoryGB":48,"runtimeKey":"mlx","engine":"mlx","engineVersion":"0.31.3","quantKey":"q4","quantization":"MLX-4bit","contextLength":2176,"promptTokens":2048,"outputTokens":128,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":65.346,"prefillTokS":782.941,"ttftMs":null,"peakVramGb":15.74,"reproducibility":6,"verified":false,"createdAt":"2026-06-27T08:01:55.695Z","command":"mlx_lm.benchmark --model /Users/c/.lmstudio/models/lmstudio-community/gemma-4-26B-A4B-it-QAT-MLX-4bit -p 2048 -g 128","source":"https://www.localmaxxing.com/en/leaderboard?hfId=lmstudio-community%2Fgemma-4-26B-A4B-it-QAT-MLX-4bit"},{"id":"cmsgayw0c012wpp01s52mb6w2","hfId":"unsloth/Qwen3.6-35B-A3B-GGUF","presetKey":"qwen3.6_35b_a3b","model":"Qwen3.6-35B-A3B-GGUF","paramsB":35,"activeParamsB":null,"hardwareTemplate":"Tesla V100 32GB","hardware":"Tesla V100","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"e031d95","quantKey":"q4","quantization":"Q4_K_M","contextLength":65536,"promptTokens":45536,"outputTokens":2000,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":67.15,"prefillTokS":636.17,"ttftMs":71593.4,"peakVramGb":21.28,"reproducibility":6,"verified":false,"createdAt":"2026-08-05T16:29:58.285Z","command":"llama-server -m model.gguf -c 65536 -ngl 99 -ncmoe 0 -ctk q4_0 -ctv q4_0 -b 2048 -ub 512 -t 32 -np 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.6-35B-A3B-GGUF"},{"id":"cms7rjnar009cpf01mjqkyj2i","hfId":"openai/gpt-oss-20b","presetKey":"gpt_oss_20b","model":"gpt-oss-20b","paramsB":22,"activeParamsB":null,"hardwareTemplate":"RX 6700 XT","hardware":"RX 6700 XT","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"e1a1abb","quantKey":"int8","quantization":"Q8_0","contextLength":640,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"rocm","splitMode":null,"cpuMoeLayers":24,"decodeDepthTokens":0,"batchSize":1,"observedTokS":24.79,"prefillTokS":895.35,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-30T17:04:05.044Z","command":"llama-bench -m <model> -p 512 -n 128 -d 0 -ncmoe 24 (HSA_OVERRIDE_GFX_VERSION=10.3.0)","source":"https://www.localmaxxing.com/en/leaderboard?hfId=openai%2Fgpt-oss-20b"},{"id":"cmoz8yudz000ppd01j7w6kvtw","hfId":"cyankiwi/MiniMax-M2.7-AWQ-4bit","presetKey":"minimax_m2.7","model":"MiniMax-M2.7-AWQ-4bit","paramsB":37,"activeParamsB":null,"hardwareTemplate":"NVIDIA DGX Spark (GB10)","hardware":"GB10 Grace Blackwell","deviceCount":2,"memoryGB":128,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.20.2rc1.dev173+g171d59ae8.d20260509","quantKey":"q4","quantization":"AWQ-4bit","contextLength":128000,"promptTokens":64,"outputTokens":256,"kvCacheDtype":"fp8","backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":27.26,"prefillTokS":null,"ttftMs":128.8,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-05-10T04:02:44.952Z","command":"vllm serve /root/minimax-m27-weights -tp 2 --distributed-executor-backend ray --gpu-memory-utilization 0.85 --max-model-len 128000 --max-num-seqs 4 --max-num-batched-tokens 8192 --enable-prefix-caching --enable-chunked-prefill --kv-cache-dtype fp8 --attention-backend flashinfer --dtype auto --disable-custom-all-reduce --load-format fastsafetensors --tool-call-parser minimax_m2 --reasoning-parser minimax_m2_append_think --trust-remote-code","source":"https://www.localmaxxing.com/en/leaderboard?hfId=cyankiwi%2FMiniMax-M2.7-AWQ-4bit"},{"id":"cmrkofvdg04iimj01jxayakxc","hfId":"LiquidAI/LFM2-350M","presetKey":"lfm2_350m","model":"LFM2-350M","paramsB":null,"activeParamsB":null,"hardwareTemplate":"AMD Radeon 780M (Ryzen 7840HS / 8745H)","hardware":"AMD Ryzen 7 7840HS","deviceCount":1,"memoryGB":null,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"commit 6b4dc21, AVX2 -Ofast Zen4-tuned no-repack build","quantKey":"q2","quantization":"Q2_K_S","contextLength":512,"promptTokens":256,"outputTokens":256,"kvCacheDtype":"f16","backend":"cpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":307.746098,"prefillTokS":981.431321,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-14T13:18:27.988Z","command":"taskset -c 0-7 llama-bench -m LFM2-350M-Q2_K_S-imatrix.gguf -p 256 -n 0 -b 512 -ub 128 -t 8 --poll 100 -ctk f16 -ctv f16 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2-350M"},{"id":"cmqxp7xtm0026pk016cmvxnyp","hfId":"unsloth/Qwen3.6-27B-MTP-GGUF","presetKey":"qwen3.6_27b","model":"Qwen3.6-27B-MTP-GGUF","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RTX 5060 Ti 16GB","hardware":"RTX 5060 Ti","deviceCount":1,"memoryGB":15.9,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q3","quantization":"Q3_K_M","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":26.72,"prefillTokS":858.43,"ttftMs":596.4,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-28T11:21:35.482Z","command":"/data/bin/llama-bench -m /data/models/unsloth/Qwen3.6-27B-MTP-GGUF/Qwen3.6-27B-Q3_K_M.gguf -p 512 -n 128","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.6-27B-MTP-GGUF"},{"id":"cmr3xrxp9073api0188lx0wao","hfId":"nvidia/NVIDIA-Nemotron-Nano-9B-v2","presetKey":"nemotron_nano_9b_v2","model":"NVIDIA-Nemotron-Nano-9B-v2","paramsB":9,"activeParamsB":null,"hardwareTemplate":"RTX 3060 Ti","hardware":"RTX 3060 Ti","deviceCount":1,"memoryGB":8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"llama.cpp b9860","quantKey":"q4","quantization":"IQ4_XS","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":64.25,"prefillTokS":1755.89,"ttftMs":291.6,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-02T20:07:42.429Z","command":"llama-bench -m /home/wstone/models/NVIDIA-Nemotron-Nano-9B-v2-GGUF/nvidia_NVIDIA-Nemotron-Nano-9B-v2-IQ4_XS.gguf -ngl 99 -fa on -p 512 -n 128 -r 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=nvidia%2FNVIDIA-Nemotron-Nano-9B-v2"},{"id":"cmr205eje01peld01titntt2h","hfId":"unsloth/NVIDIA-Nemotron-3-Nano-4B-GGUF","presetKey":"nemotron3_nano_4b","model":"NVIDIA-Nemotron-3-Nano-4B-GGUF","paramsB":9,"activeParamsB":null,"hardwareTemplate":"Mac M5 Pro (64)","hardware":"M5 Pro","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"9850 (4f31eedb0)","quantKey":"q4","quantization":"Q4_K_S","contextLength":4224,"promptTokens":512,"outputTokens":124,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":3584,"batchSize":1,"observedTokS":63.17,"prefillTokS":1129.81,"ttftMs":453.26,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-01T11:38:37.658Z","command":"llama-bench -m /unsloth/NVIDIA-Nemotron-3-Nano-4B-GGUF/NVIDIA-Nemotron-3-Nano-4B-Q4_K_S.gguf \\\n -ngl 999 \\\n -b 2048 \\\n -ub 512 \\\n -d 3584 \\\n -pg 512,128 \\\n -r 5 \\\n -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FNVIDIA-Nemotron-3-Nano-4B-GGUF"},{"id":"cmp54i3hq003so301uxfnlqf6","hfId":"ggml-org/gemma-4-E4B-it-GGUF","presetKey":"gemma4_e4b","model":"gemma-4-E4B-it-GGUF","paramsB":4,"activeParamsB":null,"hardwareTemplate":"RTX A5000","hardware":"RTX A5000","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"320a6a44a","quantKey":"int8","quantization":"Q8_0","contextLength":4096,"promptTokens":1010,"outputTokens":512,"kvCacheDtype":"fp16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":95.305454,"prefillTokS":5160.945357,"ttftMs":null,"peakVramGb":5.597,"reproducibility":6,"verified":false,"createdAt":"2026-05-14T06:44:22.190Z","command":"/data/bt/os/llama.cpp/llama.cpp-bench-upstream/build-bench-cuda-gcc15/bin/llama-server -m /data/bt/models/hub/models--ggml-org--gemma-4-E4B-it-GGUF/snapshots/2714b5519c6c3516b1000e7c5e1eba998dfe1fe8/gemma-4-E4B-it-Q8_0.gguf -a gemma-4-e4b-it-q8_0 -ngl 999 -fa on -c 4096 -b 2048 -ub 512 -np 1 --no-context-shift --metrics --no-webui --host 127.0.0.1 --port 18106","source":"https://www.localmaxxing.com/en/leaderboard?hfId=ggml-org%2Fgemma-4-E4B-it-GGUF"},{"id":"cmoysse6g0017tl011zbu40x4","hfId":"google/gemma-4-E4B-it","presetKey":"gemma4_e4b","model":"gemma-4-E4B-it","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RX 9060 XT","hardware":"RX 9060 XT","deviceCount":1,"memoryGB":16,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9090","quantKey":"int8","quantization":"Q8_0","contextLength":4096,"promptTokens":4096,"outputTokens":128,"kvCacheDtype":null,"backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":52.51,"prefillTokS":2605.95,"ttftMs":1572,"peakVramGb":5.5,"reproducibility":6,"verified":false,"createdAt":"2026-05-09T20:29:50.153Z","command":"llama-bench -m gemma-4-E4B-it-Q8_0.gguf -ngl 999 -fa 1 -p 4096 -n 128 -r 3 -o md","source":"https://www.localmaxxing.com/en/leaderboard?hfId=google%2Fgemma-4-E4B-it"},{"id":"cmqzc92o002jaoe017h8htgvi","hfId":"meta-llama/Meta-Llama-3-8B-Instruct","presetKey":"llama3_8b","model":"Meta-Llama-3-8B-Instruct","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RTX 5080","hardware":"RTX 5080","deviceCount":1,"memoryGB":16,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_0","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":32768,"batchSize":1,"observedTokS":79.464004,"prefillTokS":2034.997834,"ttftMs":251.6,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T14:54:05.760Z","command":"llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/Meta-Llama-3-8B-Instruct-Q4_0.gguf -p 512 -n 128 -d 32768 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-llama%2FMeta-Llama-3-8B-Instruct"},{"id":"cmohe99tn0015js04kxz8g21x","hfId":"unsloth/Qwen3.6-27B","presetKey":"qwen3.6_27b","model":"Qwen3.6-27B","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RTX 4090","hardware":"RTX 4090","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b8931","quantKey":"q3","quantization":"Q3_K_XL","contextLength":8192,"promptTokens":0,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":49.37,"prefillTokS":null,"ttftMs":162.51,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-04-27T16:10:58.427Z","command":"llama-server -m Qwen3.6-27B-UD-Q3_K_XL.gguf -c 140000 --n-gpu-layers 999 -fa on --cache-type-k q8_0 --cache-type-v q8_0 --threads 12 --ubatch-size 1024 --batch-size 1024 --prio 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.6-27B"},{"id":"cmogsu1xc000mjv04iforumvd","hfId":"Qwen/Qwen3-8B","presetKey":"qwen3_8b","model":"Qwen3-8B","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RTX 3090 Ti","hardware":"RTX 3090 Ti","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b1-6217b49 (CUDA)","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":512,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":133.01,"prefillTokS":null,"ttftMs":122.57,"peakVramGb":7,"reproducibility":6,"verified":false,"createdAt":"2026-04-27T06:11:16.416Z","command":"llama-server -m Qwen3-8B-Q4_K_M.gguf --alias qwen3-8b-q4 -ngl 999 -fa 1 --no-mmap -c 8192 -ctk q8_0 -ctv q8_0 -b 2048 -ub 2048 --metrics --jinja --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --host 127.0.0.1 --port 8003","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-8B"},{"id":"cmofnhpmi0006l50472qditti","hfId":"mlx-community/gemma-4-26b-a4b-it-4bit","presetKey":"gemma4_26b_a4b","model":"gemma-4-26b-a4b-it-4bit","paramsB":26,"activeParamsB":null,"hardwareTemplate":"Mac M3 Ultra (512)","hardware":"M3 Ultra","deviceCount":1,"memoryGB":512,"runtimeKey":"mlx","engine":"mlx","engineVersion":"0.31.2","quantKey":"q4","quantization":"4bit","contextLength":8192,"promptTokens":65,"outputTokens":256,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":96.71,"prefillTokS":null,"ttftMs":145,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-04-26T10:53:56.347Z","command":"mlx_lm.server --model mlx-community/gemma-4-26b-a4b-it-4bit --port 8085","source":"https://www.localmaxxing.com/en/leaderboard?hfId=mlx-community%2Fgemma-4-26b-a4b-it-4bit"},{"id":"cmofi32rs000rjx04be81ns5r","hfId":"unsloth/Qwen3.6-27B-UD-MLX-4bit","presetKey":"qwen3.6_27b","model":"Qwen3.6-27B-UD-MLX-4bit","paramsB":27,"activeParamsB":null,"hardwareTemplate":"Mac M4 Max (128)","hardware":"M4 Max","deviceCount":1,"memoryGB":64,"runtimeKey":"mlx","engine":"mlx","engineVersion":"mlx-lm 0.31.3 / mlx 0.31.2 / mlx-metal 0.31.2","quantKey":"q4","quantization":"int4","contextLength":6128,"promptTokens":128,"outputTokens":6000,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":18.435,"prefillTokS":null,"ttftMs":676,"peakVramGb":25.895,"reproducibility":6,"verified":false,"createdAt":"2026-04-26T08:22:35.465Z","command":"mlx_lm.benchmark --model unsloth/Qwen3.6-27B-UD-MLX-4bit --prompt-tokens 128 --generation-tokens 6000","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.6-27B-UD-MLX-4bit"},{"id":"cmt0cxf290em9ms01t26mvcya","hfId":"ornith-ai/Ornith-1.5-35B-A3B-GGUF","presetKey":"ornith_1.5_35b_a3b","model":"Ornith-1.5-35B-A3B-GGUF","paramsB":35,"activeParamsB":3,"hardwareTemplate":"RTX 4070","hardware":"RTX 4070","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":32768,"promptTokens":31960,"outputTokens":120,"kvCacheDtype":"q4_0","backend":null,"splitMode":null,"cpuMoeLayers":22,"decodeDepthTokens":null,"batchSize":1,"observedTokS":51.62,"prefillTokS":500.91,"ttftMs":650,"peakVramGb":11.5,"reproducibility":5,"verified":false,"createdAt":"2026-08-19T17:20:12.417Z","command":"llama-server -m /home/llm/models/ornith-1.5-35b/Ornith-1.5-35B-Q4_K_M.gguf -ngl 99 --n-cpu-moe 22 -c 131072 -fa on --jinja -np 1 -ctk q4_0 -ctv q4_0 -b 1024 -ub 512 --temp 1.0 --top-p 0.95 --top-k 20 --reasoning on","source":"https://www.localmaxxing.com/en/leaderboard?hfId=ornith-ai%2FOrnith-1.5-35B-A3B-GGUF"},{"id":"cmsw04em208goms01hgpi47ex","hfId":"unsloth/Qwen3.8-27B-GGUF","presetKey":"qwen3.8_27b","model":"Qwen3.8-27B-GGUF","paramsB":28,"activeParamsB":null,"hardwareTemplate":"A100","hardware":"A100","deviceCount":1,"memoryGB":40,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":65536,"promptTokens":4096,"outputTokens":256,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":41.13,"prefillTokS":1053,"ttftMs":10666.5,"peakVramGb":19,"reproducibility":5,"verified":false,"createdAt":"2026-08-16T16:10:38.715Z","command":"llama-server -m Qwen3.8-27B-Q4_K_M.gguf --host 0.0.0.0 --port 8080 -c 65536 --cache-type-k q8_0 --cache-type-v q8_0 --flash-attn on -ngl 99","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.8-27B-GGUF"},{"id":"cmqzbpv1e02hboe017l1zsqqw","hfId":"meta-llama/Meta-Llama-3-8B-Instruct","presetKey":"llama3_8b","model":"Meta-Llama-3-8B-Instruct","paramsB":8,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B60","hardware":"Intel Arc Pro B60","deviceCount":2,"memoryGB":48,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_0","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":32768,"batchSize":1,"observedTokS":36.09854,"prefillTokS":97.208641,"ttftMs":5267,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T14:39:09.410Z","command":"llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/Meta-Llama-3-8B-Instruct-Q4_0.gguf -p 512 -n 128 -d 32768 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-llama%2FMeta-Llama-3-8B-Instruct"},{"id":"cmqg8xj1i002zp2017no4kbxi","hfId":"LiquidAI/LFM2.5-8B-A1B","presetKey":"lfm2.5_8b_a1b","model":"LFM2.5-8B-A1B","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RTX 5070 Ti","hardware":"RTX 5070 Ti","deviceCount":1,"memoryGB":16,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"int8","quantization":"Q8_0","contextLength":4096,"promptTokens":31,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":313.4,"prefillTokS":1552.5,"ttftMs":19.97,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-16T06:13:30.919Z","command":"llama-server at 192.168.0.65:8080 -m LFM2.5-8B-A1B-Q8_0.gguf","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2.5-8B-A1B"},{"id":"cmsubuipc05erms01agdryqi6","hfId":"Qwen/Qwen3.8-27B","presetKey":"qwen3.8_27b","model":"Qwen3.8-27B","paramsB":28,"activeParamsB":null,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10352-baf0025de+umafix","quantKey":"q4","quantization":"IQ4_XS","contextLength":8192,"promptTokens":1227,"outputTokens":512,"kvCacheDtype":"fp16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":13,"prefillTokS":189.1,"ttftMs":6488.32,"peakVramGb":15.6,"reproducibility":7,"verified":false,"createdAt":"2026-08-15T12:03:20.496Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model Qwen3.8-27B-IQ4_XS.gguf -ngl 999 -c 8192 -fa on --no-mmap -np 1 -b 2048 -ub 1024 --temp 0 --no-cache-prompt","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.8-27B"},{"id":"cmsnhwun700f2o001m18whbhk","hfId":"meta-models/Muse-Glimmer-30B","presetKey":"muse_glimmer_30b","model":"Muse-Glimmer-30B","paramsB":30,"activeParamsB":null,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":2,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10344-11-gdd1ea5243","quantKey":"int8","quantization":"UD-Q8_K_XL","contextLength":834,"promptTokens":578,"outputTokens":256,"kvCacheDtype":"f16","backend":"rocm","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":15.985,"prefillTokS":660.073,"ttftMs":875.66,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-08-10T17:18:43.748Z","command":"/home/mikekey/.config/llama-swap/gpu-order.sh exec /home/mikekey/Experiments/llama.cpp/build-rocm/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --prio 3 -m /home/mikekey/models/gguf/meta/Muse-Glimmer-30B-UD-Q8_K_XL.gguf --mmproj /home/mikekey/models/gguf/meta/mmproj-Muse-Glimmer-30B-Q8_0.gguf --reasoning-format auto --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 --repeat-penalty 1.0 -ctk f16 -ctv f16 -ts 1/1/0 -np 1 -c 131072","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-models%2FMuse-Glimmer-30B"},{"id":"cms3cfc7n00whs201jezvrtmu","hfId":"pipenetwork/Laguna-S-2.1-MLX-4bit","presetKey":"laguna_s_2.1","model":"Laguna-S-2.1-MLX-4bit","paramsB":118,"activeParamsB":null,"hardwareTemplate":"Mac M5 Max (128)","hardware":"M5 Max","deviceCount":1,"memoryGB":128,"runtimeKey":"mlx","engine":"mlx","engineVersion":"mlx 0.32.0 + mlx-lm 0.31.3 + zmlx 0.9.0","quantKey":"q4","quantization":"4bit-affine-gs64","contextLength":1800,"promptTokens":1574,"outputTokens":128,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":60.87,"prefillTokS":842.6,"ttftMs":1868,"peakVramGb":66,"reproducibility":6,"verified":false,"createdAt":"2026-07-27T14:49:45.108Z","command":"python bench_speed.py (optimized: compile+zmlx+sigmoid+masks+bf16gate)","source":"https://www.localmaxxing.com/en/leaderboard?hfId=pipenetwork%2FLaguna-S-2.1-MLX-4bit"},{"id":"cmqfkm91z00apmt019l2gm5uw","hfId":"LiquidAI/LFM2-8B-A1B","presetKey":"lfm2.5_8b_a1b","model":"LFM2-8B-A1B","paramsB":8,"activeParamsB":1,"hardwareTemplate":"GTX 1060","hardware":"GTX 1060","deviceCount":1,"memoryGB":3,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9626-4988f6e86","quantKey":"q4","quantization":"Q4_K_M","contextLength":2048,"promptTokens":31,"outputTokens":100,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":9.88,"prefillTokS":13.17,"ttftMs":18068.44,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-06-15T18:52:53.975Z","command":"llama-server -m LFM2-8B-A1B-cmoe-on -c 2048 --temp 0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2-8B-A1B"},{"id":"cmqe271kv00wpmp01ysznkyfp","hfId":"Qwen/Qwen3.6-27B","presetKey":"qwen3.6_27b","model":"Qwen3.6-27B","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RTX 5090","hardware":"RTX 5090","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b741 (1fd6dfe)","quantKey":"q3","quantization":"Q3_K_S","contextLength":8192,"promptTokens":74,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":72.4,"prefillTokS":2059.2,"ttftMs":35.94,"peakVramGb":12.3,"reproducibility":7,"verified":false,"createdAt":"2026-06-14T17:29:25.183Z","command":"llama-server -m Qwen3.6-27B-Q3_K_S.gguf --alias qwen3.6-27b-q3ks -ngl 999 -fa on -c 8192 -ctk q8_0 -ctv q8_0 -np 1 --temp 0 --host 127.0.0.1 --port 8080","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.6-27B"},{"id":"cmst4iust02r7ms01jjmtfmeu","hfId":"Qwen/Qwen3.8-27B","presetKey":"qwen3.8_27b","model":"Qwen3.8-27B","paramsB":28,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B70","hardware":"Intel Arc Pro B70","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10255+ SYCL (071327508) build-sycl-0804","quantKey":"q4","quantization":"Q4_K_M","contextLength":131072,"promptTokens":0,"outputTokens":0,"kvCacheDtype":"q8_0/q4_1","backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":22.3,"prefillTokS":null,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-08-14T15:50:32.813Z","command":"llama-server -m Qwen3.8-27B-Q4_K_M.gguf -ngl 99 -ncmoe 0 -fa on -ctk q8_0 -ctv q4_1 -c 131072 -b 8192 -ub 4096 -t 8 --no-mmap -dev SYCL0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.8-27B"},{"id":"cmsurfonh06t1ms01sq2vmpx4","hfId":"unsloth/Qwen3.8-27B-GGUF","presetKey":"qwen3.8_27b","model":"Qwen3.8-27B-GGUF","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RTX 3090","hardware":"RTX 3090","deviceCount":1,"memoryGB":24,"runtimeKey":"ollama","engine":"ollama","engineVersion":"0.30.8","quantKey":"q4","quantization":"Q4_K_M","contextLength":32768,"promptTokens":22,"outputTokens":256,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":40.8,"prefillTokS":325,"ttftMs":67.7,"peakVramGb":17.56,"reproducibility":6,"verified":false,"createdAt":"2026-08-15T19:19:42.221Z","command":"ollama serve","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.8-27B-GGUF"},{"id":"cmsv63prk085dms01ir66ibr7","hfId":"AtomicChat/Qwen3.8-27B-GGUF","presetKey":"qwen3.8_27b","model":"Qwen3.8-27B-GGUF","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RTX 5070","hardware":"RTX 5070","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10449+0d9ceae1e","quantKey":"q2","quantization":"AD-IQ2-XS","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":"fp16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":45.844727,"prefillTokS":1029.090494,"ttftMs":543.5761353932321,"peakVramGb":10.083984375,"reproducibility":6,"verified":false,"createdAt":"2026-08-16T02:10:18.032Z","command":"llama-bench -m Qwen3.8-27B-AD-IQ2_XS.gguf -p 512 -n 128 -b 2048 -ub 512 -ngl -1 -o json -r 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=AtomicChat%2FQwen3.8-27B-GGUF"},{"id":"cmrxivspk0090o401a8500ki3","hfId":"poolside/Laguna-XS-2.1-GGUF","presetKey":"laguna_xs_2.1","model":"Laguna-XS-2.1-GGUF","paramsB":33,"activeParamsB":null,"hardwareTemplate":"Mac M1 Max (64)","hardware":"M1 Max","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"master-e6dd0e2+pr25442-metal-f16-fix","quantKey":"q4","quantization":"Q4_K_M","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":62.3,"prefillTokS":726.02,"ttftMs":705.2,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-23T13:03:53.624Z","command":"/Users/sgtpooki/lmx-m1max/llama.cpp-src/build/bin/llama-bench -m /Users/sgtpooki/lmx-m1max/laguna-gguf/Laguna-XS-2.1-Q4_K_M.gguf -p 512 -n 128 -r 3 -fa 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=poolside%2FLaguna-XS-2.1-GGUF"},{"id":"cmt1yj9k908ovmv01mljue7be","hfId":"ornith-ai/Ornith-1.5-35B-A3B-GGUF","presetKey":"ornith_1.5_35b_a3b","model":"Ornith-1.5-35B-A3B-GGUF","paramsB":35,"activeParamsB":3,"hardwareTemplate":"RTX 3080","hardware":"RTX 3080","deviceCount":1,"memoryGB":10,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10472","quantKey":"q4","quantization":"Q4_K_M","contextLength":32768,"promptTokens":2700,"outputTokens":256,"kvCacheDtype":"q8_0","backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":57.14,"prefillTokS":671.47,"ttftMs":3902.6,"peakVramGb":9.53,"reproducibility":6,"verified":false,"createdAt":"2026-08-20T20:12:49.834Z","command":"llama-server \\\n -m Ornith-1.5-35B-Q4_K_M.gguf \\\n --host 127.0.0.1 --port 8099 \\\n --device CUDA0 --n-gpu-layers 99 \\\n --ctx-size 32768 \\\n --flash-attn on \\\n --cache-type-k q8_0 --cache-type-v q8_0 \\\n --parallel 1 --jinja \\\n --spec-type none","source":"https://www.localmaxxing.com/en/leaderboard?hfId=ornith-ai%2FOrnith-1.5-35B-A3B-GGUF"},{"id":"cmsyvzago0doqms01ftifbhpx","hfId":"unsloth/gemma-4-E4B-it-GGUF","presetKey":"gemma4_e4b","model":"gemma-4-E4B-it-GGUF","paramsB":4,"activeParamsB":null,"hardwareTemplate":"RTX 3060","hardware":"RTX 3060","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10443","quantKey":"q4","quantization":"Q4_K_M","contextLength":32768,"promptTokens":264,"outputTokens":538,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":70.91,"prefillTokS":2051.01,"ttftMs":null,"peakVramGb":3.5,"reproducibility":6,"verified":false,"createdAt":"2026-08-18T16:38:00.120Z","command":"/home/mani/llama.cpp/build/bin/llama-server --model /home/mani/llama_models/gemma-4-e4b/gemma-4-E4B-it-Q4_K_M.gguf --alias gemma-4-E4B --host 127.0.0.1 --port 8094 -ngl 99 -fa on -ctk q4_0 -ctv q4_0 -c 32768 -n 8192 --reasoning on --jinja","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2Fgemma-4-E4B-it-GGUF"},{"id":"cmrlfrnz60bw6mj01g4ytl79y","hfId":"Qwen/Qwen3-Coder-30B-A3B-Instruct","presetKey":"qwen3_30b_a3b","model":"Qwen3-Coder-30B-A3B-Instruct","paramsB":31,"activeParamsB":3,"hardwareTemplate":"RX 7900 XTX","hardware":"RX 7900 XTX","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"LM Studio ROCm bundle 2.24.0","quantKey":"q4","quantization":"Q4_K_M","contextLength":2048,"promptTokens":512,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"rocm","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":43.8,"prefillTokS":230,"ttftMs":2116,"peakVramGb":24.15,"reproducibility":6,"verified":false,"createdAt":"2026-07-15T02:03:27.906Z","command":"llama-server --model lmstudio-community/Qwen3-Coder-30B-A3B-Instruct-GGUF/Qwen3-Coder-30B-A3B-Instruct-Q4_K_M.gguf --no-webui --jinja --ctx-size 262144 --n-gpu-layers 999999 --n-cpu-moe 0 --main-gpu 0 --tensor-split 0 --split-mode layer --batch-size 2048 --ubatch-size 512 --threads 6 --parallel 1 --cache-type-k q8_0 --cache-type-v q8_0 --flash-attn on --kv-offload --kv-unified --no-direct-io --mlock","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-Coder-30B-A3B-Instruct"},{"id":"cmsoveowo00dsmp01cf38c65a","hfId":"meta-models/Muse-Glimmer-30B","presetKey":"muse_glimmer_30b","model":"Muse-Glimmer-30B","paramsB":30,"activeParamsB":null,"hardwareTemplate":"RTX PRO 6000 Blackwell","hardware":"RTX PRO 6000 Blackwell","deviceCount":1,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"10355","quantKey":"bfloat16","quantization":"BF16","contextLength":131072,"promptTokens":0,"outputTokens":14544,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":28.75,"prefillTokS":3665,"ttftMs":394,"peakVramGb":52.32,"reproducibility":6,"verified":false,"createdAt":"2026-08-11T16:24:17.305Z","command":"llama-server -m /home/<USER>/models/Muse-Glimmer-30B-GGUF-BF16/Muse-Glimmer-30B-BF16-00001-of-00002.gguf --host 0.0.0.0 --port 8094 -ngl 99 -c 131072 -n 16000 --reasoning off --jinja --alias muse-bf16-llamacpp","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-models%2FMuse-Glimmer-30B"},{"id":"cmqw1n3wx0360qr0199fgmgv1","hfId":"unsloth/Qwen3.6-27B-GGUF","presetKey":"qwen3.6_27b","model":"Qwen3.6-27B-GGUF","paramsB":28,"activeParamsB":null,"hardwareTemplate":"Mac M4 Pro (48)","hardware":"M4 Pro","deviceCount":1,"memoryGB":48,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"build: 3fc4e1052 (9820)","quantKey":"q4","quantization":"Q4_K_XL","contextLength":640,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":11.99,"prefillTokS":122.63,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-06-27T07:33:46.257Z","command":"llama-bench -m /Users/c/.lmstudio/models/unsloth/Qwen3.6-27B-GGUF/Qwen3.6-27B-UD-Q4_K_XL.gguf -ngl 99 -fa 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.6-27B-GGUF"},{"id":"cmsgaxk2m012tpp01gxpkqxkx","hfId":"unsloth/Qwen3.6-35B-A3B-GGUF","presetKey":"qwen3.6_35b_a3b","model":"Qwen3.6-35B-A3B-GGUF","paramsB":35,"activeParamsB":null,"hardwareTemplate":"Tesla V100 32GB","hardware":"Tesla V100","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"e031d95","quantKey":"q4","quantization":"Q4_K_M","contextLength":65536,"promptTokens":45536,"outputTokens":2000,"kvCacheDtype":"f16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":91.03,"prefillTokS":638.74,"ttftMs":71301.1,"peakVramGb":22.06,"reproducibility":6,"verified":false,"createdAt":"2026-08-05T16:28:56.159Z","command":"llama-server -m model.gguf -c 65536 -ngl 99 -ncmoe 0 -ctk f16 -ctv f16 -b 2048 -ub 512 -t 32 -np 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.6-35B-A3B-GGUF"},{"id":"cms7rjmyw0097pf01repkp95h","hfId":"openai/gpt-oss-20b","presetKey":"gpt_oss_20b","model":"gpt-oss-20b","paramsB":22,"activeParamsB":null,"hardwareTemplate":"RX 6700 XT","hardware":"RX 6700 XT","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"e1a1abb","quantKey":"int8","quantization":"Q8_0","contextLength":4736,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"vulkan","splitMode":null,"cpuMoeLayers":24,"decodeDepthTokens":4096,"batchSize":1,"observedTokS":19.77,"prefillTokS":354.55,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-30T17:04:04.616Z","command":"llama-bench -m <model> -p 512 -n 128 -d 4096 -ncmoe 24","source":"https://www.localmaxxing.com/en/leaderboard?hfId=openai%2Fgpt-oss-20b"},{"id":"cmoz5vwfn0065tl01l620zyd6","hfId":"cyankiwi/MiniMax-M2.7-AWQ-4bit","presetKey":"minimax_m2.7","model":"MiniMax-M2.7-AWQ-4bit","paramsB":37,"activeParamsB":null,"hardwareTemplate":"NVIDIA DGX Spark (GB10)","hardware":"GB10 Grace Blackwell","deviceCount":2,"memoryGB":128,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.20.1rc1.dev96+gefdc95674.d20260430","quantKey":"q4","quantization":"AWQ-4bit","contextLength":128000,"promptTokens":64,"outputTokens":1024,"kvCacheDtype":"fp8","backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":26.63,"prefillTokS":null,"ttftMs":133.4,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-05-10T02:36:28.786Z","command":"vllm serve /root/minimax-m27-weights -tp 2 --distributed-executor-backend ray --gpu-memory-utilization 0.85 --max-model-len 128000 --max-num-seqs 4 --max-num-batched-tokens 8192 --enable-prefix-caching --enable-chunked-prefill --kv-cache-dtype fp8 --attention-backend flashinfer --dtype auto --disable-custom-all-reduce --load-format fastsafetensors --tool-call-parser minimax_m2 --reasoning-parser minimax_m2 --trust-remote-code","source":"https://www.localmaxxing.com/en/leaderboard?hfId=cyankiwi%2FMiniMax-M2.7-AWQ-4bit"},{"id":"cmrk9x5o504d4mj01l9p6gn9p","hfId":"LiquidAI/LFM2-350M","presetKey":"lfm2_350m","model":"LFM2-350M","paramsB":null,"activeParamsB":null,"hardwareTemplate":"AMD Radeon 780M (Ryzen 7840HS / 8745H)","hardware":"AMD Ryzen 7 7840HS","deviceCount":1,"memoryGB":null,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"commit 6b4dc21","quantKey":"q4","quantization":"Q4_K_M","contextLength":512,"promptTokens":64,"outputTokens":256,"kvCacheDtype":null,"backend":"cpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":219.416625,"prefillTokS":1560.526723,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-14T06:32:00.246Z","command":"taskset -c 0-7 llama-bench -m LFM2-350M-Q4_K_M.gguf -t 8 -p 64 -n 256 -b 4096 -ub 1024 --poll 50 --prio 0 -r 3 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2-350M"},{"id":"cmqxp3rll0023pk01514mjpbd","hfId":"unsloth/gemma-4-12b-it-GGUF","presetKey":"gemma4_12b","model":"gemma-4-12b-it-GGUF","paramsB":12,"activeParamsB":null,"hardwareTemplate":"RTX 5060 Ti 16GB","hardware":"RTX 5060 Ti","deviceCount":1,"memoryGB":15.9,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_XL","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":51.34,"prefillTokS":2257.67,"ttftMs":226.8,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-28T11:18:20.794Z","command":"/data/bin/llama-bench -m /data/models/unsloth/gemma-4-12b-it-GGUF/gemma-4-12b-it-UD-Q4_K_XL.gguf -p 512 -n 128","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2Fgemma-4-12b-it-GGUF"},{"id":"cmr3xrn1t0737pi018kagz17t","hfId":"nvidia/NVIDIA-Nemotron-Nano-9B-v2","presetKey":"nemotron_nano_9b_v2","model":"NVIDIA-Nemotron-Nano-9B-v2","paramsB":9,"activeParamsB":null,"hardwareTemplate":"RTX 3060 Ti","hardware":"RTX 3060 Ti","deviceCount":1,"memoryGB":8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"llama.cpp b9860","quantKey":"q4","quantization":"IQ4_XS","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":64.25,"prefillTokS":1755.89,"ttftMs":291.6,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-02T20:07:28.626Z","command":"llama-bench -m /home/wstone/models/NVIDIA-Nemotron-Nano-9B-v2-GGUF/nvidia_NVIDIA-Nemotron-Nano-9B-v2-IQ4_XS.gguf -ngl 99 -fa on -p 512 -n 128 -r 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=nvidia%2FNVIDIA-Nemotron-Nano-9B-v2"},{"id":"cmr1zzrgt01p4ld01oz8j601i","hfId":"unsloth/gemma-4-26B-A4B-it-GGUF","presetKey":"gemma4_26b_a4b","model":"gemma-4-26B-A4B-it-GGUF","paramsB":26,"activeParamsB":null,"hardwareTemplate":"Mac M5 Pro (64)","hardware":"M5 Pro","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"9850 (4f31eedb0)","quantKey":"q4","quantization":"UD-Q4_K_XL","contextLength":4224,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":3584,"batchSize":1,"observedTokS":54.97,"prefillTokS":1147.49,"ttftMs":446.23,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-01T11:34:14.478Z","command":"llama-bench -m /unsloth/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q4_K_XL.gguf \\ -ngl 999 \\ -b 2048 \\ -ub 512 \\ -d 3584 \\ -pg 512,128 \\ -r 5 \\ -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2Fgemma-4-26B-A4B-it-GGUF"},{"id":"cmp54gr03003po301zr2e8u9o","hfId":"ggml-org/gemma-4-E4B-it-GGUF","presetKey":"gemma4_e4b","model":"gemma-4-E4B-it-GGUF","paramsB":4,"activeParamsB":null,"hardwareTemplate":"RTX A5000","hardware":"RTX A5000","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"320a6a44a","quantKey":"q4","quantization":"Q4_K_M","contextLength":4096,"promptTokens":1010,"outputTokens":512,"kvCacheDtype":"fp16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":120.979227,"prefillTokS":4757.143181,"ttftMs":null,"peakVramGb":3.722,"reproducibility":6,"verified":false,"createdAt":"2026-05-14T06:43:19.348Z","command":"/data/bt/os/llama.cpp/llama.cpp-bench-upstream/build-bench-cuda-gcc15/bin/llama-server -m /data/bt/models/hub/models--ggml-org--gemma-4-E4B-it-GGUF/snapshots/2714b5519c6c3516b1000e7c5e1eba998dfe1fe8/gemma-4-E4B-it-Q4_K_M.gguf -a gemma-4-e4b-it-q4_k_m -ngl 999 -fa on -c 4096 -b 2048 -ub 512 -np 1 --no-context-shift --metrics --no-webui --host 127.0.0.1 --port 18105","source":"https://www.localmaxxing.com/en/leaderboard?hfId=ggml-org%2Fgemma-4-E4B-it-GGUF"},{"id":"cmoyqfwcp000otl01xpdzfxpo","hfId":"OBLITERATUS/gemma-4-E4B-it-OBLITERATED","presetKey":"gemma4_e4b","model":"gemma-4-E4B-it-OBLITERATED","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RX 9060 XT","hardware":"RX 9060 XT","deviceCount":1,"memoryGB":16,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9090","quantKey":"int8","quantization":"Q8_0","contextLength":4096,"promptTokens":4096,"outputTokens":128,"kvCacheDtype":"auto","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":53.85,"prefillTokS":2590.49,"ttftMs":1581,"peakVramGb":5.3,"reproducibility":6,"verified":false,"createdAt":"2026-05-09T19:24:07.946Z","command":"llama-bench -m gemma-4-E4B-it-OBLITERATED.Q8_0.gguf -ngl 999 -fa 1 -p 4096 -n 128 -r 3 -o md","source":"https://www.localmaxxing.com/en/leaderboard?hfId=OBLITERATUS%2Fgemma-4-E4B-it-OBLITERATED"},{"id":"cmqzc7sjb02j5oe012cqu2jcn","hfId":"meta-llama/Meta-Llama-3-8B-Instruct","presetKey":"llama3_8b","model":"Meta-Llama-3-8B-Instruct","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RTX 5080","hardware":"RTX 5080","deviceCount":1,"memoryGB":16,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_0","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":8192,"batchSize":1,"observedTokS":123.94137,"prefillTokS":5951.850186,"ttftMs":86,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T14:53:05.976Z","command":"llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/Meta-Llama-3-8B-Instruct-Q4_0.gguf -p 512 -n 128 -d 8192 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-llama%2FMeta-Llama-3-8B-Instruct"},{"id":"cmohe2eo50019kw04s0yxiow1","hfId":"Qwen/Qwen3.6-27B","presetKey":"qwen3.6_27b","model":"Qwen3.6-27B","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RTX 4090","hardware":"RTX 4090","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b8931","quantKey":"q4","quantization":"Q4_K_P","contextLength":8192,"promptTokens":0,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":42.7,"prefillTokS":null,"ttftMs":151.22,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-04-27T16:05:38.118Z","command":"llama-server -m Qwen3.6-27B-Uncensored-HauhauCS-Aggressive-Q4_K_P.gguf -c 120000 --n-gpu-layers 999 -fa on --cache-type-k q8_0 --cache-type-v q8_0 --threads 12 --ubatch-size 1024 --batch-size 1024 --prio 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.6-27B"},{"id":"cmogsauq70006k40418jb5vob","hfId":"Qwen/Qwen3.6-35B-A3B","presetKey":"qwen3.6_35b_a3b","model":"Qwen3.6-35B-A3B","paramsB":36,"activeParamsB":3,"hardwareTemplate":"RTX 3090 Ti","hardware":"RTX 3090 Ti","deviceCount":2,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b1-6217b49 (CUDA)","quantKey":"q6","quantization":"UD-Q6_K_XL","contextLength":65536,"promptTokens":512,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":131.58,"prefillTokS":null,"ttftMs":212.55,"peakVramGb":17,"reproducibility":6,"verified":false,"createdAt":"2026-04-27T05:56:20.624Z","command":"llama-server -m Qwen3.6-35B-A3B-UD-Q6_K_XL.gguf --alias qwen3.6-35b-a3b-q6 -ngl 999 -fa 1 --no-mmap -c 65536 --cache-reuse 256 -ctk q8_0 -ctv q8_0 --no-context-shift --parallel 4 -b 2048 -ub 2048 --metrics --jinja --chat-template-kwargs '{\"enable_thinking\":false}' --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --host 0.0.0.0 --port 8000","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.6-35B-A3B"},{"id":"cmqwfc3xt03epqr01hnsxtixd","hfId":"Qwen/Qwen3-1.7B","presetKey":"qwen3_1.7b","model":"Qwen3-1.7B","paramsB":2,"activeParamsB":null,"hardwareTemplate":"Mac M3 Ultra (512)","hardware":"M3 Ultra","deviceCount":1,"memoryGB":512,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":50,"outputTokens":472,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":213.01,"prefillTokS":null,"ttftMs":23.9,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-27T13:57:07.697Z","command":"/opt/homebrew/bin/llama-server -m /Volumes/Extreme Pro/Lilly-transfer/localmaxxing-candidates/ggml-org__Qwen3-1.7B-GGUF/Qwen3-1.7B-Q4_K_M.gguf --host 127.0.0.1 --port 8097 -ngl 99 --fit off -c 8192 -fa on --reasoning off --reasoning-format none","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-1.7B"},{"id":"cmsdfst6o0062pp014i4f29gp","hfId":"unsloth/Qwen3.6-27B-GGUF","presetKey":"qwen3.6_27b","model":"Qwen3.6-27B-GGUF","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RTX 4070","hardware":"RTX 4070","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q2","quantization":"UD-IQ2_XXS","contextLength":98304,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":98304,"batchSize":1,"observedTokS":21.050943,"prefillTokS":368.11481,"ttftMs":1390.9,"peakVramGb":11.9,"reproducibility":5,"verified":false,"createdAt":"2026-08-03T16:21:54.240Z","command":"llama-bench -m /home/llm/models/qwen36-lowbit/Qwen3.6-27B-UD-IQ2_XXS.gguf -p 512 -n 128 -d 98304 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.6-27B-GGUF"},{"id":"cmqzbokfk02h4oe01gddjtrzx","hfId":"meta-llama/Meta-Llama-3-8B-Instruct","presetKey":"llama3_8b","model":"Meta-Llama-3-8B-Instruct","paramsB":8,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B60","hardware":"Intel Arc Pro B60","deviceCount":2,"memoryGB":48,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_0","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":8192,"batchSize":1,"observedTokS":55.654575,"prefillTokS":364.802576,"ttftMs":1403.5,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T14:38:09.008Z","command":"llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/Meta-Llama-3-8B-Instruct-Q4_0.gguf -p 512 -n 128 -d 8192 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-llama%2FMeta-Llama-3-8B-Instruct"},{"id":"cmqg8ivnf002tp201kpqfp8ho","hfId":"LiquidAI/LFM2.5-8B-A1B","presetKey":"lfm2.5_8b_a1b","model":"LFM2.5-8B-A1B","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RTX 5070 Ti","hardware":"RTX 5070 Ti","deviceCount":1,"memoryGB":16,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_XL","contextLength":4096,"promptTokens":31,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":402.3,"prefillTokS":1940.7,"ttftMs":15.97,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-16T06:02:07.419Z","command":"llama-server at 192.168.0.65:8080 -m LFM2.5-8B-A1B-UD-Q4_K_XL.gguf","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2.5-8B-A1B"},{"id":"cmssl2vlp01mjms011599q3d8","hfId":"poolside/Laguna-S-2.1","presetKey":"laguna_s_2.1","model":"Laguna-S-2.1","paramsB":118,"activeParamsB":null,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10352-baf0025de+umafix","quantKey":"q3","quantization":"Q3_K_XL","contextLength":10240,"promptTokens":5801,"outputTokens":256,"kvCacheDtype":"fp16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":42.3,"prefillTokS":619.8,"ttftMs":9360,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-08-14T06:46:14.653Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model Laguna-S-2.1-UD-Q3_K_XL-00001-of-00003.gguf -ngl 999 -c 10240 -fa on --no-mmap -np 1 -b 2048 -ub 1024 --temp 0 --no-cache-prompt","source":"https://www.localmaxxing.com/en/leaderboard?hfId=poolside%2FLaguna-S-2.1"},{"id":"cmsnfwn9m00d8o001elsb3flc","hfId":"Qwen/Qwen3.6-35B-A3B","presetKey":"qwen3.6_35b_a3b","model":"Qwen3.6-35B-A3B","paramsB":36,"activeParamsB":3,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":2,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10106-1-g779d20bdc","quantKey":"q4","quantization":"Q4_K_M","contextLength":787,"promptTokens":531,"outputTokens":256,"kvCacheDtype":"f16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":91.037,"prefillTokS":1517.002,"ttftMs":350.03,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-08-10T16:22:34.954Z","command":"/home/mikekey/.config/llama-swap/gpu-order.sh exec /home/mikekey/Experiments/llama.cpp/build-vulkan/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --prio 3 -m /home/mikekey/models/Qwen3.6-35B-A3B-Q4_K_M.gguf --reasoning-format auto --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 --presence-penalty 0.00 --repeat-penalty 1.0 -ctk f16 -ctv f16 -ts 1/1/0 -np 1 -c 262144 --chat-template-kwargs '{\"preserve_thinking\": true}'","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.6-35B-A3B"},{"id":"cms3cdzla00wes2010jqnoxge","hfId":"pipenetwork/Laguna-S-2.1-MLX-4bit","presetKey":"laguna_s_2.1","model":"Laguna-S-2.1-MLX-4bit","paramsB":118,"activeParamsB":null,"hardwareTemplate":"Mac M5 Max (128)","hardware":"M5 Max","deviceCount":1,"memoryGB":128,"runtimeKey":"mlx","engine":"mlx","engineVersion":"mlx 0.32.0 + mlx-lm 0.31.3 + zmlx 0.9.0","quantKey":"q4","quantization":"4bit-affine-gs64","contextLength":1200,"promptTokens":814,"outputTokens":128,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":63.84,"prefillTokS":1015.5,"ttftMs":801.6,"peakVramGb":66,"reproducibility":6,"verified":false,"createdAt":"2026-07-27T14:48:42.094Z","command":"python bench_speed.py (optimized: compile+zmlx+sigmoid+masks+bf16gate)","source":"https://www.localmaxxing.com/en/leaderboard?hfId=pipenetwork%2FLaguna-S-2.1-MLX-4bit"},{"id":"cmqeiwk0a017qmp01n4q8i907","hfId":"LiquidAI/LFM2-8B-A1B","presetKey":"lfm2.5_8b_a1b","model":"LFM2-8B-A1B","paramsB":8,"activeParamsB":1,"hardwareTemplate":"GTX 1060","hardware":"GTX 1060","deviceCount":2,"memoryGB":6,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9553","quantKey":"q4","quantization":"Q4_K_M","contextLength":2048,"promptTokens":23,"outputTokens":2,"kvCacheDtype":"q4_0","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":18.3,"prefillTokS":13.5,"ttftMs":null,"peakVramGb":1.15,"reproducibility":6,"verified":false,"createdAt":"2026-06-15T01:17:09.322Z","command":"llama-server.exe --models-preset models.ini --models-max 1 --models-autoload -fa on --fit off -t 12 --parallel 1 -ub 1024 --cache-reuse 256 -ctk q4_0 -ctv q4_0 --host 0.0.0.0 --port 8092","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2-8B-A1B"},{"id":"cmqe1zyj700wjmp01uf8rwu45","hfId":"Qwen/Qwen3.6-27B","presetKey":"qwen3.6_27b","model":"Qwen3.6-27B","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RTX 5090","hardware":"RTX 5090","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b741 (1fd6dfe)","quantKey":"q3","quantization":"Q3_K_M","contextLength":8192,"promptTokens":74,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":74.4,"prefillTokS":2069.2,"ttftMs":35.76,"peakVramGb":13.5,"reproducibility":7,"verified":false,"createdAt":"2026-06-14T17:23:54.643Z","command":"llama-server -m Qwen3.6-27B-Q3_K_M.gguf --alias qwen3.6-27b-q3km -ngl 999 -fa on -c 8192 -ctk q8_0 -ctv q8_0 -np 1 --temp 0 --host 127.0.0.1 --port 8080","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.6-27B"},{"id":"cmst4itcb02r2ms01c133omai","hfId":"Qwen/Qwen3.8-27B","presetKey":"qwen3.8_27b","model":"Qwen3.8-27B","paramsB":28,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B70","hardware":"Intel Arc Pro B70","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10255+ SYCL (071327508) build-sycl-0804","quantKey":"q4","quantization":"Q4_K_M","contextLength":131072,"promptTokens":0,"outputTokens":0,"kvCacheDtype":"q8_0/q4_1","backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":22.3,"prefillTokS":null,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-08-14T15:50:30.923Z","command":"llama-server -m Qwen3.8-27B-Q4_K_M.gguf -ngl 99 -ncmoe 0 -fa on -ctk q8_0 -ctv q4_1 -c 131072 -b 8192 -ub 4096 -t 8 --no-mmap -dev SYCL0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.8-27B"},{"id":"cmsi0mqaz01lipp01en3jbm8a","hfId":"unsloth/DeepSeek-V4-Flash-0731-GGUF","presetKey":"deepseek_v4_flash","model":"DeepSeek-V4-Flash-0731-GGUF","paramsB":304,"activeParamsB":null,"hardwareTemplate":"RTX 3090","hardware":"RTX 3090","deviceCount":4,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"69 (fork ds4-longctx @ e6718011c)","quantKey":"q2","quantization":"UD-IQ2_M","contextLength":131072,"promptTokens":130333,"outputTokens":128,"kvCacheDtype":"fp8","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":40.97,"prefillTokS":null,"ttftMs":null,"peakVramGb":90.3,"reproducibility":6,"verified":false,"createdAt":"2026-08-06T21:16:07.212Z","command":"CUDA_VISIBLE_DEVICES=0,1,2,3 GGML_CUDA_P2P=1 DSV4_CONSTANT_SHAPE=1 DSV4_SPARSE_FA=1 DSV4_FA_UNION=1 DSV4_IDX_SKIP=1 DSV4_MOE_TILE=1 DSV4_MOE_RESIDENT=1 DSV4_GLU_FUSE=1 DSV4_MOE_FUSE=1 DSV4_DECODE_FUSED_IDX=1 DSV4_DECODE_RADIX_TOPK=1 DSV4_PREFILL_RADIX_TOPK=1 DSV4_MMVQ_SMALLK=1 DSV4_STABLE_TOPO=1 GGML_GALLOC_STICKY=1 DSV4_PREFILL_GRAPHS=1 DSV4_AGENT_CKPT_TAIL=1 llama-server -m DeepSeek-V4-Flash-0731-UD-IQ2_M-00001-of-00003.gguf -ngl 999 -ts 1,1,0.95,1.05 --split-mode layer --flash-attn on --no-repack --ctx-size 131072 --batch-size 8192 --ubatch-size 384 --ctx-checkpoints 1 -t 8 --parallel 1 --jinja --reasoning-budget 1024 --reasoning-budget-message 'Okay, that is enough thinking. Let me get to work.'","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FDeepSeek-V4-Flash-0731-GGUF"},{"id":"cmr717ajg00jlmn01j7xg0gn2","hfId":"unsloth/gemma-4-12b-it-GGUF","presetKey":"gemma4_12b","model":"gemma-4-12b-it-GGUF","paramsB":12,"activeParamsB":null,"hardwareTemplate":"RTX 5070","hardware":"RTX 5070","deviceCount":1,"memoryGB":11.9,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q6","quantization":"UD-Q6_K_XL","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":51.26,"prefillTokS":2768.78,"ttftMs":184.9,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-07-05T00:06:56.284Z","command":"/home/cheez/Projects/local-llm/llama.cpp/build-cuda-sm120/bin/llama-bench -m '/home/cheez/Projects/local-llm/models/gguf-quants/gemma-4-12b-it-unsloth/gemma-4-12b-it-UD-Q6_K_XL.gguf' -p 512 -n 128","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2Fgemma-4-12b-it-GGUF"},{"id":"cmq1eccf500mko6015zitbqv8","hfId":"openai/gpt-oss-20b","presetKey":"gpt_oss_20b","model":"gpt-oss-20b","paramsB":22,"activeParamsB":null,"hardwareTemplate":"Mac M1 Max (64)","hardware":"M1 Max","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9535 (da87e9b61)","quantKey":"int8","quantization":"Q8_0","contextLength":640,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":83.58,"prefillTokS":1021.94,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-06-05T20:48:27.617Z","command":"llama-bench -m gpt-oss-20b-Q8_0.gguf -p 512 -n 128","source":"https://www.localmaxxing.com/en/leaderboard?hfId=openai%2Fgpt-oss-20b"},{"id":"cmt1xl3kj08f0mv015i8944of","hfId":"LiquidAI/LFM2.5-8B-A1B-GGUF","presetKey":"lfm2.5_8b_a1b","model":"LFM2.5-8B-A1B-GGUF","paramsB":8,"activeParamsB":1,"hardwareTemplate":"RTX 3080","hardware":"RTX 3080","deviceCount":1,"memoryGB":10,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10472","quantKey":"q4","quantization":"Q4_K_M","contextLength":128000,"promptTokens":2617,"outputTokens":256,"kvCacheDtype":"q8_0","backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":328.42,"prefillTokS":10731.79,"ttftMs":260.5,"peakVramGb":6.39,"reproducibility":6,"verified":false,"createdAt":"2026-08-20T19:46:15.763Z","command":"llama-server \\\n -m LFM2.5-8B-A1B-Q4_K_M.gguf \\\n --host 127.0.0.1 --port 8099 \\\n --device CUDA0 --n-gpu-layers 99 \\\n --ctx-size 128000 \\\n --flash-attn on \\\n --cache-type-k q8_0 --cache-type-v q8_0 \\\n --parallel 1 --jinja \\\n --spec-type none","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2.5-8B-A1B-GGUF"},{"id":"cmsyvz9uj0donms011f86emb7","hfId":"empero-ai/Qwythos-9B-v2-GGUF","presetKey":"qwen3.5_9b","model":"Qwythos-9B-v2-GGUF","paramsB":9,"activeParamsB":null,"hardwareTemplate":"RTX 3060","hardware":"RTX 3060","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10443","quantKey":"q4","quantization":"Q4_K_M","contextLength":32768,"promptTokens":283,"outputTokens":1362,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":51.06,"prefillTokS":1446.65,"ttftMs":null,"peakVramGb":5.76,"reproducibility":6,"verified":false,"createdAt":"2026-08-18T16:37:59.324Z","command":"/home/mani/llama.cpp/build/bin/llama-server --model /home/mani/llama_models/qwythos-9b-v2/Qwythos-9B-v2-Q4_K_M.gguf --alias Qwythos-9B-v2 --host 127.0.0.1 --port 8094 -ngl 99 -fa on -ctk q4_0 -ctv q4_0 -c 32768 -n 8192 --reasoning on --jinja","source":"https://www.localmaxxing.com/en/leaderboard?hfId=empero-ai%2FQwythos-9B-v2-GGUF"},{"id":"cmrq0hblz05n6lg01cswo0exb","hfId":"madeby561/GLM-5.2-MXFP8-NVFP4-NF3-Hybrid","presetKey":"glm5_2","model":"GLM-5.2-MXFP8-NVFP4-NF3-Hybrid","paramsB":753,"activeParamsB":null,"hardwareTemplate":"RTX PRO 6000 Blackwell","hardware":"RTX PRO 6000 Blackwell","deviceCount":4,"memoryGB":96,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.11.2.dev280","quantKey":"q4","quantization":"MXFP8_NVFP4_NF3","contextLength":131072,"promptTokens":34,"outputTokens":256,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":36.788,"prefillTokS":null,"ttftMs":210.675,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-18T06:54:21.959Z","command":"vllm serve madeby561/GLM-5.2-MXFP8-NVFP4-NF3-Hybrid --tensor-parallel-size 4 --decode-context-parallel-size 1 --max-model-len 131072 --gpu-memory-utilization 0.95 --enable-prefix-caching","source":"https://www.localmaxxing.com/en/leaderboard?hfId=madeby561%2FGLM-5.2-MXFP8-NVFP4-NF3-Hybrid"},{"id":"cmqw1kxb7035xqr01hjd6ubdf","hfId":"unsloth/Qwen3.6-35B-A3B-GGUF","presetKey":"qwen3.6_35b_a3b","model":"Qwen3.6-35B-A3B-GGUF","paramsB":35,"activeParamsB":null,"hardwareTemplate":"Mac M4 Pro (48)","hardware":"M4 Pro","deviceCount":1,"memoryGB":48,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"build: 3fc4e1052 (9820)","quantKey":"q4","quantization":"Q4_K_XL","contextLength":640,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":47.12,"prefillTokS":741.26,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-06-27T07:32:04.388Z","command":"llama-bench -m /Users/c/.lmstudio/models/unsloth/Qwen3.6-35B-A3B-GGUF/Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf -ngl 99 -fa 1 ","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.6-35B-A3B-GGUF"},{"id":"cmoqgwavz000sig04umz3jazs","hfId":"Qwen/Qwen3.6-35B-A3B","presetKey":"qwen3.6_35b_a3b","model":"Qwen3.6-35B-A3B","paramsB":36,"activeParamsB":3,"hardwareTemplate":"Tesla V100 32GB","hardware":"Tesla V100","deviceCount":1,"memoryGB":32,"runtimeKey":"ollama","engine":"ollama","engineVersion":"0.22.1","quantKey":"q4","quantization":"Q4_K_M","contextLength":96000,"promptTokens":768,"outputTokens":1969,"kvCacheDtype":"fp8","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":66.82,"prefillTokS":null,"ttftMs":40000,"peakVramGb":28,"reproducibility":6,"verified":false,"createdAt":"2026-05-04T00:34:47.712Z","command":"name: ollama-nvidia\nservices:\n ollama:\n cpu_shares: 90\n command: []\n container_name: ollama\n deploy:\n resources:\n limits:\n memory: 35776056376\n reservations:\n memory: \"2147483648\"\n devices:\n - capabilities:\n - gpu\n device_ids:\n - \"0\"\n - \"2\"\n environment:\n - OLLAMA_CONTEXT_LENGTH=96000\n - OLLAMA_FLASH_ATTENTION=1\n - OLLAMA_KEEP_ALIVE=24h\n - OLLAMA_KV_CACHE_TYPE=q8_0\n - OLLAMA_NUM_PARALLEL=2\n image: ollama/ollama:0.22.1\n labels:\n icon: https://cdn.jsdelivr.net/gh/IceWhaleTech/CasaOS-AppStore@main/Apps/Ollama/icon.png\n ports:\n - target: 11434\n published: \"7005\"\n protocol: tcp\n restart: unless-stopped\n volumes:\n - type: bind\n source: /media/1T-SSD/ollama-nvidia\n target: /root/.ollama\n - type: bind\n source: /media/ZimaOS-HD/AppData/open-webui-ollama/open-webui/uploads\n target: /home/open_webui","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.6-35B-A3B"},{"id":"cms7rjl42008lpf01z6y3cib6","hfId":"deepreinforce-ai/Ornith-1.0-9B","presetKey":"ornith_1_9b","model":"Ornith-1.0-9B","paramsB":null,"activeParamsB":null,"hardwareTemplate":"RX 6700 XT","hardware":"RX 6700 XT","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"e1a1abb","quantKey":"int8","quantization":"Q8_0","contextLength":4736,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"rocm","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":4096,"batchSize":1,"observedTokS":35.8,"prefillTokS":985.43,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-30T17:04:02.211Z","command":"llama-bench -m <model> -p 512 -n 128 -d 4096 (HSA_OVERRIDE_GFX_VERSION=10.3.0)","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-9B"},{"id":"cmouqgx9q00jtld01ajgiran7","hfId":"Qwen/Qwen3.5-27B","presetKey":"qwen3.5_27b","model":"Qwen3.5-27B","paramsB":28,"activeParamsB":null,"hardwareTemplate":"NVIDIA DGX Spark (GB10)","hardware":"GB10 Grace Blackwell","deviceCount":1,"memoryGB":128,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.19.2rc1.dev213+g9558f4390.d20260426","quantKey":"q4","quantization":"NVFP4","contextLength":4096,"promptTokens":2048,"outputTokens":32,"kvCacheDtype":"auto","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":11.49,"prefillTokS":3132.1,"ttftMs":658.47,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-05-07T00:13:51.087Z","command":"VLLM_NVFP4_GEMM_BACKEND=cutlass FLASHQLA_HKV_O_BK=128 FLASHQLA_HKV_O_BV=128 vllm serve /models/AxionML-Qwen3.5-27B-NVFP4 --host 127.0.0.1 --port 8000 --trust-remote-code --max-model-len 4096 --served-model-name qwen35-27b-axionml-nvfp4 --generation-config vllm --load-format fastsafetensors --attention-backend FLASH_ATTN --gpu-memory-utilization 0.90 --max-num-batched-tokens 8192 --max-num-seqs 1 --enable-chunked-prefill","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.5-27B"},{"id":"cmrk9ka7c04czmj01lavq1wer","hfId":"LiquidAI/LFM2-350M","presetKey":"lfm2_350m","model":"LFM2-350M","paramsB":null,"activeParamsB":null,"hardwareTemplate":"AMD Radeon 780M (Ryzen 7840HS / 8745H)","hardware":"AMD Ryzen 7 7840HS","deviceCount":1,"memoryGB":null,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"commit 6b4dc21","quantKey":"q4","quantization":"Q4_K_M","contextLength":512,"promptTokens":64,"outputTokens":256,"kvCacheDtype":null,"backend":"cpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":218.4862,"prefillTokS":1551.972562,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-14T06:21:59.593Z","command":"taskset -c 0-7 llama-bench -m LFM2-350M-Q4_K_M.gguf -t 8 -p 64 -n 256 -b 512 -ub 128 --poll 50 --prio 0 -r 3 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2-350M"},{"id":"cmqxp2pjo0020pk012y61px5c","hfId":"unsloth/gemma-4-26B-A4B-it-GGUF","presetKey":"gemma4_26b_a4b","model":"gemma-4-26B-A4B-it-GGUF","paramsB":26,"activeParamsB":null,"hardwareTemplate":"RTX 5060 Ti 16GB","hardware":"RTX 5060 Ti","deviceCount":1,"memoryGB":15.9,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q3","quantization":"Q3_K_XL","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":101.15,"prefillTokS":3469.94,"ttftMs":147.6,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-28T11:17:31.477Z","command":"/data/bin/llama-bench -m /data/models/unsloth/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q3_K_XL.gguf -p 512 -n 128","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2Fgemma-4-26B-A4B-it-GGUF"},{"id":"cms3nhd9z01ajs201gezzdhlu","hfId":"deepseek-ai/DeepSeek-R1-Distill-Qwen-7B","presetKey":"deepseek_r1_distill_8b","model":"DeepSeek-R1-Distill-Qwen-7B","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RTX 3060 Ti","hardware":"RTX 3060 Ti","deviceCount":1,"memoryGB":8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":98304,"promptTokens":98304,"outputTokens":128,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":18.82,"prefillTokS":987.23,"ttftMs":1,"peakVramGb":6.66,"reproducibility":5,"verified":false,"createdAt":"2026-07-27T19:59:15.575Z","command":"llama-bench -m -p 98304 -n 128 -ngl 28 -sm layer -fa on -ctk q4_0 -ctv q4_0 -r 5","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepseek-ai%2FDeepSeek-R1-Distill-Qwen-7B"},{"id":"cmr1zul9i01ozld01ojwfzzcy","hfId":"unsloth/Qwen3.5-9B-MTP-GGUF","presetKey":"qwen3.5_9b","model":"Qwen3.5-9B-MTP-GGUF","paramsB":9,"activeParamsB":null,"hardwareTemplate":"Mac M5 Pro (64)","hardware":"M5 Pro","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"9850 (4f31eedb0)","quantKey":"q4","quantization":"Q4_K_S","contextLength":4224,"promptTokens":512,"outputTokens":122,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":3584,"batchSize":1,"observedTokS":45.34,"prefillTokS":961.59,"ttftMs":532.45,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-01T11:30:13.159Z","command":"llama-bench -m /unsloth/Qwen3.5-9B-MTP-GGUF/Qwen3.5-9B-Q4_K_S.gguf \\ -ngl 999 \\ -b 2048 \\ -ub 512 \\ -d 3584 \\ -pg 512,128 \\ -r 5 \\ -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.5-9B-MTP-GGUF"},{"id":"cmp54fejg003mo301r2zpuyam","hfId":"ggml-org/gemma-3-1b-it-GGUF","presetKey":"gemma3_1b","model":"gemma-3-1b-it-GGUF","paramsB":1,"activeParamsB":null,"hardwareTemplate":"RTX A5000","hardware":"RTX A5000","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"320a6a44a","quantKey":"int8","quantization":"Q8_0","contextLength":4096,"promptTokens":1010,"outputTokens":512,"kvCacheDtype":"fp16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":281.895677,"prefillTokS":17924.005145,"ttftMs":null,"peakVramGb":1.778,"reproducibility":6,"verified":false,"createdAt":"2026-05-14T06:42:16.540Z","command":"/data/bt/os/llama.cpp/llama.cpp-bench-upstream/build-bench-cuda-gcc15/bin/llama-server -m /data/bt/models/hub/models--ggml-org--gemma-3-1b-it-GGUF/snapshots/f9c28bcd85737ffc5aef028638d3341d49869c27/gemma-3-1b-it-Q8_0.gguf -a gemma-3-1b-it-q8_0 -ngl 999 -fa on -c 4096 -b 2048 -ub 512 -np 1 --no-context-shift --metrics --no-webui --host 127.0.0.1 --port 18104","source":"https://www.localmaxxing.com/en/leaderboard?hfId=ggml-org%2Fgemma-3-1b-it-GGUF"},{"id":"cmqzc6hz802j0oe01bdebz72l","hfId":"meta-llama/Meta-Llama-3-8B-Instruct","presetKey":"llama3_8b","model":"Meta-Llama-3-8B-Instruct","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RTX 5080","hardware":"RTX 5080","deviceCount":1,"memoryGB":16,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_0","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":4096,"batchSize":1,"observedTokS":135.00005,"prefillTokS":7025.115985,"ttftMs":72.9,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T14:52:05.637Z","command":"llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/Meta-Llama-3-8B-Instruct-Q4_0.gguf -p 512 -n 128 -d 4096 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-llama%2FMeta-Llama-3-8B-Instruct"},{"id":"cmohdrtfo000hkw04cjyedef1","hfId":"Qwen/Qwen3.6-35B-A3B","presetKey":"qwen3.6_35b_a3b","model":"Qwen3.6-35B-A3B","paramsB":36,"activeParamsB":3,"hardwareTemplate":"RTX 4090","hardware":"RTX 4090","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b8931","quantKey":"q3","quantization":"Q3_K_P","contextLength":8192,"promptTokens":0,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":157.72,"prefillTokS":null,"ttftMs":174.91,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-04-27T15:57:24.037Z","command":"llama-server -m Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q3_K_P.gguf -c 140000 --n-gpu-layers 999 -fa on --cache-type-k q8_0 --cache-type-v q8_0 --no-mmap --threads 12 --ubatch-size 1024 --batch-size 1024 --prio 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.6-35B-A3B"},{"id":"cmqv9afov02krqr012eaowanb","hfId":"deepreinforce-ai/Ornith-1.0-35B","presetKey":"ornith_1_35b_a3b","model":"Ornith-1.0-35B","paramsB":null,"activeParamsB":null,"hardwareTemplate":"Mac M3 Ultra (512)","hardware":"M3 Ultra","deviceCount":1,"memoryGB":512,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":50,"outputTokens":512,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":89.06,"prefillTokS":null,"ttftMs":110.9,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-26T18:20:05.743Z","command":"/opt/homebrew/bin/llama-server -m /Volumes/Extreme Pro/Lilly-transfer/localmaxxing-candidates/deepreinforce-ai__Ornith-1.0-35B-GGUF/ornith-1.0-35b-Q4_K_M.gguf --host 127.0.0.1 --port 8097 -ngl 99 --fit off -c 8192 -fa on --reasoning off --reasoning-format none","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-35B"},{"id":"cmqzb6k1f02fxoe01txts3241","hfId":"deepreinforce-ai/Ornith-1.0-35B-GGUF","presetKey":"ornith_1_35b_a3b","model":"Ornith-1.0-35B-GGUF","paramsB":35,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B60","hardware":"Intel Arc Pro B60","deviceCount":2,"memoryGB":48,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":4096,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":64.37,"prefillTokS":838.34,"ttftMs":610.7,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T14:24:08.692Z","command":"/home/maxious/llama-master/build-sycl-new/bin/llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/ornith-1.0-35b-Q4_K_M.gguf -p 512 -n 128 -fa 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-35B-GGUF"},{"id":"cmsski5ys01m0ms01p4xsudnc","hfId":"poolside/Laguna-S-2.1","presetKey":"laguna_s_2.1","model":"Laguna-S-2.1","paramsB":118,"activeParamsB":null,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10352-baf0025de+umafix","quantKey":"q2","quantization":"IQ2_M","contextLength":10240,"promptTokens":5801,"outputTokens":256,"kvCacheDtype":"fp16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":42.3,"prefillTokS":619.8,"ttftMs":9360,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-08-14T06:30:08.309Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model Laguna-S-2.1-UD-IQ2_M.gguf -ngl 999 -c 10240 -fa on --no-mmap -np 1 -b 4096 -ub 2048 --temp 0 --no-cache-prompt","source":"https://www.localmaxxing.com/en/leaderboard?hfId=poolside%2FLaguna-S-2.1"},{"id":"cmsnfrdpr00cvo001mza1i4t3","hfId":"Qwen/Qwen3.6-35B-A3B","presetKey":"qwen3.6_35b_a3b","model":"Qwen3.6-35B-A3B","paramsB":36,"activeParamsB":3,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":2,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10106-1-g779d20bdc","quantKey":"int8","quantization":"Q8_0","contextLength":787,"promptTokens":531,"outputTokens":256,"kvCacheDtype":"f16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":79.232,"prefillTokS":1722.182,"ttftMs":308.33,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-08-10T16:18:29.295Z","command":"/home/mikekey/.config/llama-swap/gpu-order.sh exec /home/mikekey/Experiments/llama.cpp/build-vulkan/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --prio 3 -m /home/mikekey/models/Qwen3.6-35B-A3B-Q8_0.gguf --reasoning-format auto --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 --presence-penalty 0.00 --repeat-penalty 1.0 -ctk f16 -ctv f16 -ts 1/1/0 -np 1 -c 262144 --chat-template-kwargs '{\"preserve_thinking\": true}'","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.6-35B-A3B"},{"id":"cmqt075yk013zqr013j7ckdou","hfId":"Qwen/Qwen3.6-35B-A3B","presetKey":"qwen3.6_35b_a3b","model":"Qwen3.6-35B-A3B","paramsB":36,"activeParamsB":3,"hardwareTemplate":"Mac M5 Max (128)","hardware":"M5 Max","deviceCount":1,"memoryGB":128,"runtimeKey":"mlx","engine":"mlx","engineVersion":"mlx-lm 0.31.3","quantKey":"q4","quantization":"4bit","contextLength":2048,"promptTokens":256,"outputTokens":128,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":134.049,"prefillTokS":1766.72,"ttftMs":null,"peakVramGb":19.94,"reproducibility":6,"verified":false,"createdAt":"2026-06-25T04:30:04.269Z","command":"mlx_lm.benchmark --model mlx-community/Qwen3.6-35B-A3B-4bit --prompt-tokens 256 --generation-tokens 128 --num-trials 5","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.6-35B-A3B"},{"id":"cmqeiwjsy017nmp018makkboq","hfId":"OBLITERATUS/gemma-4-E4B-it-OBLITERATED","presetKey":"gemma4_e4b","model":"gemma-4-E4B-it-OBLITERATED","paramsB":8,"activeParamsB":null,"hardwareTemplate":"GTX 1060","hardware":"GTX 1060","deviceCount":2,"memoryGB":6,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9553","quantKey":"q4","quantization":"Q4_K_M","contextLength":2048,"promptTokens":25,"outputTokens":4,"kvCacheDtype":"q4_0","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":27.2,"prefillTokS":53.1,"ttftMs":null,"peakVramGb":4.61,"reproducibility":6,"verified":false,"createdAt":"2026-06-15T01:17:09.058Z","command":"llama-server.exe --models-preset models.ini --models-max 1 --models-autoload -fa on --fit off -t 12 --parallel 1 -ub 1024 --cache-reuse 256 -ctk q4_0 -ctv q4_0 --host 0.0.0.0 --port 8092","source":"https://www.localmaxxing.com/en/leaderboard?hfId=OBLITERATUS%2Fgemma-4-E4B-it-OBLITERATED"},{"id":"cmqe0z08p00u7mp01e6pspds1","hfId":"nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16","presetKey":"nemotron3_nano_30b_a3b","model":"NVIDIA-Nemotron-3-Nano-30B-A3B-BF16","paramsB":32,"activeParamsB":3,"hardwareTemplate":"RTX 5090","hardware":"RTX 5090","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b741 (1fd6dfe)","quantKey":"q4","quantization":"UD-Q4_K_XL","contextLength":8192,"promptTokens":83,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":313.1,"prefillTokS":1787.1,"ttftMs":46.44,"peakVramGb":21.7,"reproducibility":7,"verified":false,"createdAt":"2026-06-14T16:55:10.585Z","command":"llama-server -m Nemotron-3-Nano-30B-A3B-UD-Q4_K_XL.gguf --alias nemotron-3-nano-q4 -ngl 999 -fa on -c 8192 -ctk q8_0 -ctv q8_0 -np 1 --temp 0 --host 127.0.0.1 --port 8080","source":"https://www.localmaxxing.com/en/leaderboard?hfId=nvidia%2FNVIDIA-Nemotron-3-Nano-30B-A3B-BF16"},{"id":"cmst47p6902qgms01zcll5fhm","hfId":"Qwen/Qwen3.8-27B","presetKey":"qwen3.8_27b","model":"Qwen3.8-27B","paramsB":28,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B70","hardware":"Intel Arc Pro B70","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10255+ SYCL (071327508) build-sycl-0804","quantKey":"q4","quantization":"Q4_K_M","contextLength":131072,"promptTokens":0,"outputTokens":0,"kvCacheDtype":"q8_0/q4_1","backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":17.78,"prefillTokS":787.45,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-08-14T15:41:52.305Z","command":"llama-server -m Qwen3.8-27B-Q4_K_M.gguf -ngl 99 -ncmoe 0 -fa on -ctk q8_0 -ctv q4_1 -c 131072 -b 8192 -ub 4096 -t 8 --no-mmap -dev SYCL0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.8-27B"},{"id":"cmsi0l2sc01lepp019uelu1ga","hfId":"unsloth/DeepSeek-V4-Flash-0731-GGUF","presetKey":"deepseek_v4_flash","model":"DeepSeek-V4-Flash-0731-GGUF","paramsB":304,"activeParamsB":null,"hardwareTemplate":"RTX 3090","hardware":"RTX 3090","deviceCount":4,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"69 (fork ds4-longctx @ e6718011c)","quantKey":"q2","quantization":"UD-IQ2_M","contextLength":131072,"promptTokens":32768,"outputTokens":256,"kvCacheDtype":"fp8","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":41.07,"prefillTokS":1745.4,"ttftMs":18774,"peakVramGb":90.3,"reproducibility":6,"verified":false,"createdAt":"2026-08-06T21:14:50.076Z","command":"CUDA_VISIBLE_DEVICES=0,1,2,3 GGML_CUDA_P2P=1 DSV4_CONSTANT_SHAPE=1 DSV4_SPARSE_FA=1 DSV4_FA_UNION=1 DSV4_IDX_SKIP=1 DSV4_MOE_TILE=1 DSV4_MOE_RESIDENT=1 DSV4_GLU_FUSE=1 DSV4_MOE_FUSE=1 DSV4_DECODE_FUSED_IDX=1 DSV4_DECODE_RADIX_TOPK=1 DSV4_PREFILL_RADIX_TOPK=1 DSV4_MMVQ_SMALLK=1 DSV4_STABLE_TOPO=1 GGML_GALLOC_STICKY=1 DSV4_PREFILL_GRAPHS=1 DSV4_AGENT_CKPT_TAIL=1 llama-server -m DeepSeek-V4-Flash-0731-UD-IQ2_M-00001-of-00003.gguf -ngl 999 -ts 1,1,0.95,1.05 --split-mode layer --flash-attn on --no-repack --ctx-size 131072 --batch-size 8192 --ubatch-size 384 --ctx-checkpoints 1 -t 8 --parallel 1 --jinja --reasoning-budget 1024 --reasoning-budget-message 'Okay, that is enough thinking. Let me get to work.'","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FDeepSeek-V4-Flash-0731-GGUF"},{"id":"cmr713hr000jhmn01402hfujj","hfId":"unsloth/gemma-4-12b-it-GGUF","presetKey":"gemma4_12b","model":"gemma-4-12b-it-GGUF","paramsB":12,"activeParamsB":null,"hardwareTemplate":"RTX 5070","hardware":"RTX 5070","deviceCount":1,"memoryGB":11.9,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q5","quantization":"UD-Q5_K_XL","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":62.76,"prefillTokS":3050.42,"ttftMs":167.8,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-07-05T00:03:59.004Z","command":"/home/cheez/Projects/local-llm/llama.cpp/build-cuda-sm120/bin/llama-bench -m '/home/cheez/Projects/local-llm/models/gguf-quants/gemma-4-12b-it-unsloth/gemma-4-12b-it-UD-Q5_K_XL.gguf' -p 512 -n 128","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2Fgemma-4-12b-it-GGUF"},{"id":"cmq1dygk600mco601ugevjjt7","hfId":"meta-llama/Llama-3.2-3B-Instruct","presetKey":"llama3.2_3b","model":"Llama-3.2-3B-Instruct","paramsB":3,"activeParamsB":null,"hardwareTemplate":"Mac M1 Max (64)","hardware":"M1 Max","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9535 (da87e9b61)","quantKey":"bfloat16","quantization":"BF16","contextLength":640,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":50.92,"prefillTokS":1218.95,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-06-05T20:37:39.798Z","command":"llama-bench -m Llama-3.2-3B-Instruct-BF16.gguf -p 512 -n 128","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-llama%2FLlama-3.2-3B-Instruct"},{"id":"cmt0nl2j30f22ms019spiygf2","hfId":"ornith-ai/Ornith-1.5-9B-GGUF","presetKey":"ornith_1.5_9b","model":"Ornith-1.5-9B-GGUF","paramsB":9,"activeParamsB":null,"hardwareTemplate":"RTX 3080","hardware":"RTX 3080","deviceCount":1,"memoryGB":10,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10472","quantKey":"q6","quantization":"Q6_K","contextLength":131072,"promptTokens":2700,"outputTokens":256,"kvCacheDtype":"q4_0","backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":82.8,"prefillTokS":3397.36,"ttftMs":799.9,"peakVramGb":8.46,"reproducibility":6,"verified":false,"createdAt":"2026-08-19T22:18:32.079Z","command":"llama-server \\\n -m Ornith-1.5-9B-Q6_K.gguf \\\n --host 127.0.0.1 \\\n --port 8099 \\\n --device CUDA0 \\\n --n-gpu-layers 99 \\\n --ctx-size 131072 \\\n --flash-attn on \\\n --cache-type-k q4_0 \\\n --cache-type-v q4_0 \\\n --parallel 1 \\\n --jinja \\\n --spec-type none","source":"https://www.localmaxxing.com/en/leaderboard?hfId=ornith-ai%2FOrnith-1.5-9B-GGUF"},{"id":"cmsyvz9lt0doims01orzvuxqa","hfId":"ornith-ai/Ornith-1.0-9B-GGUF","presetKey":"ornith_1_9b","model":"Ornith-1.0-9B-GGUF","paramsB":9,"activeParamsB":null,"hardwareTemplate":"RTX 3060","hardware":"RTX 3060","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10443","quantKey":"q4","quantization":"Q4_K_M","contextLength":32768,"promptTokens":570,"outputTokens":1780,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":52.47,"prefillTokS":1457.6,"ttftMs":null,"peakVramGb":5.66,"reproducibility":6,"verified":false,"createdAt":"2026-08-18T16:37:59.009Z","command":"/home/mani/llama.cpp/build/bin/llama-server --model /home/mani/llama_models/ornith-1.0-9b/ornith-1.0-9b-Q4_K_M.gguf --alias Ornith-1.0-9B --host 127.0.0.1 --port 8094 -ngl 99 -fa on -ctk q4_0 -ctv q4_0 -c 32768 -n 8192 --reasoning on --jinja","source":"https://www.localmaxxing.com/en/leaderboard?hfId=ornith-ai%2FOrnith-1.0-9B-GGUF"},{"id":"cmrk4wz2u031emj017sulp4fn","hfId":"openai/gpt-oss-120b","presetKey":"gpt_oss_120b","model":"gpt-oss-120b","paramsB":117,"activeParamsB":null,"hardwareTemplate":"RTX PRO 6000 Blackwell","hardware":"RTX PRO 6000 Blackwell","deviceCount":1,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"master+2969d6d","quantKey":"float16","quantization":"F16","contextLength":15964,"promptTokens":15708,"outputTokens":256,"kvCacheDtype":"f16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":187.844,"prefillTokS":8147.497,"ttftMs":1927.95,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-14T04:11:53.623Z","command":"llama-server -m gpt-oss-120b-F16.gguf -ctk f16 -ctv f16 -c 131072 -np 1 -ngl 999","source":"https://www.localmaxxing.com/en/leaderboard?hfId=openai%2Fgpt-oss-120b"},{"id":"cms7rjktp008gpf01i2vw6zqj","hfId":"deepreinforce-ai/Ornith-1.0-9B","presetKey":"ornith_1_9b","model":"Ornith-1.0-9B","paramsB":null,"activeParamsB":null,"hardwareTemplate":"RX 6700 XT","hardware":"RX 6700 XT","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"e1a1abb","quantKey":"int8","quantization":"Q8_0","contextLength":640,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"rocm","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":0,"batchSize":1,"observedTokS":36.27,"prefillTokS":1047.05,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-30T17:04:01.837Z","command":"llama-bench -m <model> -p 512 -n 128 -d 0 (HSA_OVERRIDE_GFX_VERSION=10.3.0)","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-9B"},{"id":"cmoupygde00jild019l34ykjf","hfId":"Qwen/Qwen3.5-27B","presetKey":"qwen3.5_27b","model":"Qwen3.5-27B","paramsB":28,"activeParamsB":null,"hardwareTemplate":"NVIDIA DGX Spark (GB10)","hardware":"GB10 Grace Blackwell","deviceCount":1,"memoryGB":128,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.19.2rc1.dev213+g9558f4390.d20260426","quantKey":"q4","quantization":"NVFP4","contextLength":20000,"promptTokens":16384,"outputTokens":32,"kvCacheDtype":"auto","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":11.08,"prefillTokS":1486.64,"ttftMs":11032.62,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-05-06T23:59:29.379Z","command":"VLLM_NVFP4_GEMM_BACKEND=cutlass FLASHQLA_HKV_O_BK=128 FLASHQLA_HKV_O_BV=128 vllm serve /models/AxionML-Qwen3.5-27B-NVFP4 --host 127.0.0.1 --port 8000 --trust-remote-code --max-model-len 20000 --served-model-name qwen35-27b-axionml-nvfp4 --generation-config vllm --load-format fastsafetensors --attention-backend FLASH_ATTN --gpu-memory-utilization 0.90 --max-num-batched-tokens 20000 --max-num-seqs 1 --enable-chunked-prefill","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.5-27B"},{"id":"cmrk9k8mf04cumj01rlxwclft","hfId":"LiquidAI/LFM2-350M","presetKey":"lfm2_350m","model":"LFM2-350M","paramsB":null,"activeParamsB":null,"hardwareTemplate":"AMD Radeon 780M (Ryzen 7840HS / 8745H)","hardware":"AMD Ryzen 7 7840HS","deviceCount":1,"memoryGB":null,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"commit 6b4dc21","quantKey":"q4","quantization":"Q4_0","contextLength":512,"promptTokens":64,"outputTokens":256,"kvCacheDtype":null,"backend":"cpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":230.715748,"prefillTokS":1656.591867,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-14T06:21:57.543Z","command":"taskset -c 0-7 llama-bench -m LFM2-350M-Q4_0.gguf -t 8 -p 64 -n 256 -b 2048 -ub 512 --poll 0 --prio 0 -r 3 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2-350M"},{"id":"cmqxoymb7001wpk01vmfwatf6","hfId":"unsloth/gemma-4-26B-A4B-it-GGUF","presetKey":"gemma4_26b_a4b","model":"gemma-4-26B-A4B-it-GGUF","paramsB":26,"activeParamsB":null,"hardwareTemplate":"RTX 5060 Ti 16GB","hardware":"RTX 5060 Ti","deviceCount":1,"memoryGB":15.9,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q3","quantization":"Q3_K_M","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":105.72,"prefillTokS":3460.79,"ttftMs":147.9,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-28T11:14:20.660Z","command":"/data/bin/llama-bench -m /data/models/unsloth/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q3_K_M.gguf -p 512 -n 128","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2Fgemma-4-26B-A4B-it-GGUF"},{"id":"cms3nhbh001aes2019re28842","hfId":"deepseek-ai/DeepSeek-R1-Distill-Qwen-7B","presetKey":"deepseek_r1_distill_8b","model":"DeepSeek-R1-Distill-Qwen-7B","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RTX 3060 Ti","hardware":"RTX 3060 Ti","deviceCount":1,"memoryGB":8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":8192,"outputTokens":128,"kvCacheDtype":"f16","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":72.51,"prefillTokS":2617.46,"ttftMs":4628.4,"peakVramGb":6.66,"reproducibility":5,"verified":false,"createdAt":"2026-07-27T19:59:13.236Z","command":"llama-bench -m -p 8192 -n 128 -ngl 28 -sm layer -fa on -ctk f16 -ctv f16 -r 5","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepseek-ai%2FDeepSeek-R1-Distill-Qwen-7B"},{"id":"cmr1zmvq601otld01prpkme22","hfId":"unsloth/gpt-oss-20b-GGUF","presetKey":"gpt_oss_20b","model":"gpt-oss-20b-GGUF","paramsB":22,"activeParamsB":null,"hardwareTemplate":"Mac M5 Pro (64)","hardware":"M5 Pro","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"9850 (4f31eedb0)","quantKey":"q4","quantization":"Q4_K_M","contextLength":4224,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":3584,"batchSize":1,"observedTokS":69.45,"prefillTokS":1235.19,"ttftMs":415.1,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-01T11:24:13.471Z","command":"llama-bench -m /unsloth/gpt-oss-20b-GGUF/gpt-oss-20b-UD-Q8_K_XL.gguf \\\n -ngl 999 \\\n -b 2048 \\\n -ub 512 \\\n -d 3584 \\\n -pg 512,128 \\\n -r 5 \\\n -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2Fgpt-oss-20b-GGUF"},{"id":"cmp54e23i003jo301urnzxs61","hfId":"ggml-org/gemma-3-1b-it-GGUF","presetKey":"gemma3_1b","model":"gemma-3-1b-it-GGUF","paramsB":1,"activeParamsB":null,"hardwareTemplate":"RTX A5000","hardware":"RTX A5000","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"320a6a44a","quantKey":"q4","quantization":"Q4_K_M","contextLength":4096,"promptTokens":1010,"outputTokens":512,"kvCacheDtype":"fp16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":325.190709,"prefillTokS":17334.699786,"ttftMs":null,"peakVramGb":1.534,"reproducibility":6,"verified":false,"createdAt":"2026-05-14T06:41:13.758Z","command":"/data/bt/os/llama.cpp/llama.cpp-bench-upstream/build-bench-cuda-gcc15/bin/llama-server -m /data/bt/models/hub/models--ggml-org--gemma-3-1b-it-GGUF/snapshots/f9c28bcd85737ffc5aef028638d3341d49869c27/gemma-3-1b-it-Q4_K_M.gguf -a gemma-3-1b-it-q4_k_m -ngl 999 -fa on -c 4096 -b 2048 -ub 512 -np 1 --no-context-shift --metrics --no-webui --host 127.0.0.1 --port 18103","source":"https://www.localmaxxing.com/en/leaderboard?hfId=ggml-org%2Fgemma-3-1b-it-GGUF"},{"id":"cmqzbysgw02iboe0142t8ebme","hfId":"openai/gpt-oss-20b","presetKey":"gpt_oss_20b","model":"gpt-oss-20b","paramsB":22,"activeParamsB":null,"hardwareTemplate":"RTX 5080","hardware":"RTX 5080","deviceCount":1,"memoryGB":16,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"int8","quantization":"Q8_0","contextLength":4096,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":222.39,"prefillTokS":10586.3,"ttftMs":48.4,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T14:46:05.984Z","command":"/home/maxious/llama-master/build-cuda/bin/llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/gpt-oss-20b-Q8_0.gguf -p 512 -n 128 -fa 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=openai%2Fgpt-oss-20b"},{"id":"cmohdl6vt000wkw04nd6tci35","hfId":"Qwen/Qwen3.6-35B-A3B","presetKey":"qwen3.6_35b_a3b","model":"Qwen3.6-35B-A3B","paramsB":36,"activeParamsB":3,"hardwareTemplate":"RTX 4090","hardware":"RTX 4090","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b8931","quantKey":"q3","quantization":"Q3_K_P","contextLength":8192,"promptTokens":0,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":157.72,"prefillTokS":null,"ttftMs":174.91,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-04-27T15:52:14.873Z","command":"llama-server -m Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q3_K_P.gguf -c 140000 --n-gpu-layers 999 -fa on --cache-type-k q8_0 --cache-type-v q8_0 --no-mmap --reasoning on --reasoning-budget 8192 --threads 12 --ubatch-size 1024 --batch-size 1024 --prio 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.6-35B-A3B"},{"id":"cmqv8uq9t02kmqr01gu72gd0a","hfId":"deepreinforce-ai/Ornith-1.0-9B","presetKey":"ornith_1_9b","model":"Ornith-1.0-9B","paramsB":null,"activeParamsB":null,"hardwareTemplate":"Mac M3 Ultra (512)","hardware":"M3 Ultra","deviceCount":1,"memoryGB":512,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":50,"outputTokens":512,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":77.52,"prefillTokS":null,"ttftMs":103.7,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-26T18:07:52.962Z","command":"/opt/homebrew/bin/llama-server -m /Volumes/Extreme Pro/Lilly-transfer/localmaxxing-candidates/deepreinforce-ai__Ornith-1.0-9B-GGUF/ornith-1.0-9b-Q4_K_M.gguf --host 127.0.0.1 --port 8097 -ngl 99 --fit off -c 8192 -fa on --reasoning off --reasoning-format none","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-9B"},{"id":"cmqzb1csj02fhoe01ptuqb5wa","hfId":"openai/gpt-oss-20b","presetKey":"gpt_oss_20b","model":"gpt-oss-20b","paramsB":22,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B60","hardware":"Intel Arc Pro B60","deviceCount":2,"memoryGB":48,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"int8","quantization":"Q8_0","contextLength":4096,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":33.04,"prefillTokS":847.36,"ttftMs":604.2,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T14:20:06.020Z","command":"/home/maxious/llama-master/build-sycl-new/bin/llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/gpt-oss-20b-Q8_0.gguf -p 512 -n 128 -fa 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=openai%2Fgpt-oss-20b"},{"id":"cmsskeo5c01lrms01izfo4i55","hfId":"poolside/Laguna-S-2.1","presetKey":"laguna_s_2.1","model":"Laguna-S-2.1","paramsB":118,"activeParamsB":null,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10352-baf0025de+umafix","quantKey":"q3","quantization":"Q3_K_XL","contextLength":10240,"promptTokens":5801,"outputTokens":256,"kvCacheDtype":"fp16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":31.4,"prefillTokS":601.3,"ttftMs":9647.68,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-08-14T06:27:25.248Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model Laguna-S-2.1-UD-Q3_K_XL-00001-of-00003.gguf -ngl 999 -c 10240 -fa on --no-mmap -np 1 -b 4096 -ub 2048 --temp 0 --no-cache-prompt","source":"https://www.localmaxxing.com/en/leaderboard?hfId=poolside%2FLaguna-S-2.1"},{"id":"cmsf8solv00uspp01hd2cbyif","hfId":"deepreinforce-ai/Ornith-1.0-9B","presetKey":"ornith_1_9b","model":"Ornith-1.0-9B","paramsB":null,"activeParamsB":null,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10107","quantKey":"bfloat16","quantization":"BF16","contextLength":787,"promptTokens":531,"outputTokens":256,"kvCacheDtype":"f16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":31.158,"prefillTokS":1631.628,"ttftMs":325.44,"peakVramGb":25.8,"reproducibility":7,"verified":false,"createdAt":"2026-08-04T22:41:23.347Z","command":"/home/mikekey/Experiments/llama.cpp/build-vulkan/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --prio 3 -m /home/mikekey/models/gguf/misc/ornith-1.0-9b-bf16.gguf --reasoning-format auto --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 --repeat-penalty 1.0 -ctk f16 -ctv f16 -ts 1/0/0 -np 1 -c 262144","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-9B"},{"id":"cmqszh4zr0133qr01rrrw4ylz","hfId":"openai/gpt-oss-20b","presetKey":"gpt_oss_20b","model":"gpt-oss-20b","paramsB":22,"activeParamsB":null,"hardwareTemplate":"Mac M5 Max (128)","hardware":"M5 Max","deviceCount":1,"memoryGB":128,"runtimeKey":"mlx","engine":"mlx","engineVersion":"mlx-lm 0.31.3","quantKey":"q4","quantization":"MXFP4","contextLength":2048,"promptTokens":256,"outputTokens":128,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":137.013,"prefillTokS":2151.262,"ttftMs":null,"peakVramGb":12.35,"reproducibility":6,"verified":false,"createdAt":"2026-06-25T04:09:49.959Z","command":"mlx_lm.benchmark --model mlx-community/gpt-oss-20b-MXFP4-Q8 --prompt-tokens 256 --generation-tokens 128 --num-trials 5","source":"https://www.localmaxxing.com/en/leaderboard?hfId=openai%2Fgpt-oss-20b"},{"id":"cmqeiu03b017dmp010sirxauc","hfId":"LiquidAI/LFM2-8B-A1B","presetKey":"lfm2.5_8b_a1b","model":"LFM2-8B-A1B","paramsB":8,"activeParamsB":1,"hardwareTemplate":"GTX 1060","hardware":"GTX 1060","deviceCount":2,"memoryGB":6,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9553","quantKey":"q4","quantization":"Q4_K_M","contextLength":2048,"promptTokens":23,"outputTokens":2,"kvCacheDtype":"q4_0","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":18.3,"prefillTokS":13.5,"ttftMs":null,"peakVramGb":1.15,"reproducibility":6,"verified":false,"createdAt":"2026-06-15T01:15:10.199Z","command":"llama-server.exe --models-preset models.ini --models-max 1 --models-autoload -fa on --fit off -t 12 --parallel 1 -ub 1024 --cache-reuse 256 -ctk q4_0 -ctv q4_0 --host 0.0.0.0 --port 8092","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2-8B-A1B"},{"id":"cmqe0qfq700tump014x7698g7","hfId":"Qwen/Qwen3-8B","presetKey":"qwen3_8b","model":"Qwen3-8B","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RTX 5090","hardware":"RTX 5090","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b741 (1fd6dfe)","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":72,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":227.1,"prefillTokS":3942.4,"ttftMs":18.26,"peakVramGb":5.6,"reproducibility":7,"verified":false,"createdAt":"2026-06-14T16:48:30.752Z","command":"llama-server -m Qwen3-8B-Q4_K_M.gguf --alias qwen3-8b-q4km -ngl 999 -fa on -c 8192 -ctk q8_0 -ctv q8_0 -np 1 --temp 0 --host 127.0.0.1 --port 8080","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-8B"},{"id":"cmsqqwxla00qbmr01cc4923on","hfId":"nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16","presetKey":"nemotron3.5_lightning_30b_a3b","model":"NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16","paramsB":32,"activeParamsB":3,"hardwareTemplate":"Intel Arc Pro B70","hardware":"Intel Arc Pro B70","deviceCount":1,"memoryGB":32,"runtimeKey":"vllm","engine":"vllm","engineVersion":"v0.26.1rc1.dev668+g3ee2df303 (XPU) + deterministic grouped-GEMM fix","quantKey":"q4","quantization":"GPTQ-INT4-G64-sym-local","contextLength":16384,"promptTokens":0,"outputTokens":0,"kvCacheDtype":"default","backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":92.65,"prefillTokS":null,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-08-12T23:54:02.638Z","command":"VLLM_XPU_ENABLE_XPU_GRAPH=1 vllm serve /model --dtype bfloat16 --quantization gptq --max-model-len 16384 --gpu-memory-utilization 0.90 --no-enable-prefix-caching --async-scheduling","source":"https://www.localmaxxing.com/en/leaderboard?hfId=nvidia%2FNVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16"},{"id":"cmritr24h0240mj01cmzivkk4","hfId":"deepseek-ai/DeepSeek-V4-Flash","presetKey":"deepseek_v4_flash","model":"DeepSeek-V4-Flash","paramsB":291,"activeParamsB":null,"hardwareTemplate":"RTX 3090","hardware":"RTX 3090","deviceCount":4,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"cchuter-v4-hybrid (637f2cd+wip 2026-07-10)","quantKey":"q2","quantization":"IQ2_XXS","contextLength":2048,"promptTokens":25,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":35.3,"prefillTokS":null,"ttftMs":1283.45,"peakVramGb":83.9,"reproducibility":6,"verified":false,"createdAt":"2026-07-13T06:11:35.681Z","command":"GGML_CUDA_P2P=1 DSV4_EXPERT_PARALLEL=1 DSV4_EP_TO_LAYER=1 DSV4_CONSTANT_SHAPE=1 DSV4_SPARSE_FA=1 DSV4_FA_UNION=1 DSV4_IDX_SKIP=1 DSV4_MOE_TILE=1 DSV4_MOE_RESIDENT=1 DSV4_GLU_FUSE=1 DSV4_MOE_FUSE=1 DSV4_DECODE_FUSED_IDX=1 DSV4_DECODE_RADIX_TOPK=1 llama-server -m DeepSeek-V4-Flash-IQ2XXS-imatrix.gguf -ngl 999 --split-mode layer --tensor-split 1,1,1,0.85 --flash-attn on --no-repack --fit off --ctx-size 131072 --batch-size 4096 --ubatch-size 512 --parallel 1 --reasoning on # cchuter DS4 fork, hybrid EP-prefill->layer-decode","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepseek-ai%2FDeepSeek-V4-Flash"},{"id":"cmr70fmmk00immn01m9xdhtpc","hfId":"ggml-org/gemma-4-12B-it-GGUF","presetKey":"gemma4_12b","model":"gemma-4-12B-it-GGUF","paramsB":12,"activeParamsB":null,"hardwareTemplate":"RTX 5070","hardware":"RTX 5070","deviceCount":1,"memoryGB":11.9,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":72.11,"prefillTokS":3173.17,"ttftMs":161.4,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-07-04T23:45:25.580Z","command":"/home/cheez/Projects/local-llm/llama.cpp/build-cuda-sm120/bin/llama-bench -m '/home/cheez/Projects/local-llm/models/gguf-quants/gemma-4-12b-it-ggml/gemma-4-12B-it-Q4_K_M.gguf' -p 512 -n 128","source":"https://www.localmaxxing.com/en/leaderboard?hfId=ggml-org%2Fgemma-4-12B-it-GGUF"},{"id":"cmsy9ga9g0cuvms01owx8zfa1","hfId":"orcarouter/Qwen3.8-27B-Uncensored-GGUF","presetKey":"qwen3.8_27b","model":"Qwen3.8-27B-Uncensored-GGUF","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RTX 3080","hardware":"RTX 3080","deviceCount":1,"memoryGB":10,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10472","quantKey":"q2","quantization":"IQ2_XXS","contextLength":16384,"promptTokens":2700,"outputTokens":256,"kvCacheDtype":"q8_0","backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":47.32,"prefillTokS":1204.29,"ttftMs":2247.9,"peakVramGb":8.615,"reproducibility":6,"verified":false,"createdAt":"2026-08-18T06:07:21.845Z","command":"llama-server -m Qwen3.8-27B-Uncensored-IQ2_XXS.gguf -c 16384 -ngl 99 -fa on -ctk q8_0 -ctv q8_0 --parallel 1 --jinja --spec-type none","source":"https://www.localmaxxing.com/en/leaderboard?hfId=orcarouter%2FQwen3.8-27B-Uncensored-GGUF"},{"id":"cmsyvz9bk0dofms017di2u5ts","hfId":"unsloth/gemma-4-12b-it-GGUF","presetKey":"gemma4_12b","model":"gemma-4-12b-it-GGUF","paramsB":12,"activeParamsB":null,"hardwareTemplate":"RTX 3060","hardware":"RTX 3060","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10443","quantKey":"q4","quantization":"Q4_K_M","contextLength":32768,"promptTokens":264,"outputTokens":1107,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":36.96,"prefillTokS":892.67,"ttftMs":null,"peakVramGb":7.59,"reproducibility":6,"verified":false,"createdAt":"2026-08-18T16:37:58.641Z","command":"/home/mani/llama.cpp/build/bin/llama-server --model /home/mani/llama_models/gemma-4-12b/gemma-4-12b-it-Q4_K_M.gguf --alias gemma-4-12b --host 127.0.0.1 --port 8094 -ngl 99 -fa on -ctk q4_0 -ctv q4_0 -c 32768 -n 8192 --reasoning on --jinja","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2Fgemma-4-12b-it-GGUF"},{"id":"cmrk4wysa0319mj01fakt059u","hfId":"openai/gpt-oss-120b","presetKey":"gpt_oss_120b","model":"gpt-oss-120b","paramsB":117,"activeParamsB":null,"hardwareTemplate":"RTX PRO 6000 Blackwell","hardware":"RTX PRO 6000 Blackwell","deviceCount":1,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"master+2969d6d","quantKey":"float16","quantization":"F16","contextLength":4502,"promptTokens":4246,"outputTokens":256,"kvCacheDtype":"f16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":196.042,"prefillTokS":7252.748,"ttftMs":585.43,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-14T04:11:53.242Z","command":"llama-server -m gpt-oss-120b-F16.gguf -ctk f16 -ctv f16 -c 131072 -np 1 -ngl 999","source":"https://www.localmaxxing.com/en/leaderboard?hfId=openai%2Fgpt-oss-120b"},{"id":"cms7rjki2008bpf01x61qnogp","hfId":"deepreinforce-ai/Ornith-1.0-9B","presetKey":"ornith_1_9b","model":"Ornith-1.0-9B","paramsB":null,"activeParamsB":null,"hardwareTemplate":"RX 6700 XT","hardware":"RX 6700 XT","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"e1a1abb","quantKey":"int8","quantization":"Q8_0","contextLength":4736,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":4096,"batchSize":1,"observedTokS":38.02,"prefillTokS":736.82,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-30T17:04:01.418Z","command":"llama-bench -m <model> -p 512 -n 128 -d 4096","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-9B"},{"id":"cmoupq9n400j6ld0151q4j9ch","hfId":"Qwen/Qwen3.5-27B","presetKey":"qwen3.5_27b","model":"Qwen3.5-27B","paramsB":28,"activeParamsB":null,"hardwareTemplate":"NVIDIA DGX Spark (GB10)","hardware":"GB10 Grace Blackwell","deviceCount":1,"memoryGB":128,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.19.2rc1.dev213+g9558f4390.d20260426","quantKey":"q4","quantization":"NVFP4","contextLength":4096,"promptTokens":2048,"outputTokens":32,"kvCacheDtype":"auto","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":11.49,"prefillTokS":3132.1,"ttftMs":658.47,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-05-06T23:53:07.408Z","command":"VLLM_NVFP4_GEMM_BACKEND=cutlass FLASHQLA_HKV_O_BK=128 FLASHQLA_HKV_O_BV=128 vllm serve /models/AxionML-Qwen3.5-27B-NVFP4 --host 127.0.0.1 --port 8000 --trust-remote-code --max-model-len 4096 --served-model-name qwen35-27b-axionml-nvfp4 --generation-config vllm --load-format fastsafetensors --attention-backend FLASH_ATTN --gpu-memory-utilization 0.90 --max-num-batched-tokens 8192 --max-num-seqs 1 --enable-chunked-prefill","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.5-27B"},{"id":"cmrk97czp04cimj01rx20apb1","hfId":"LiquidAI/LFM2-350M","presetKey":"lfm2_350m","model":"LFM2-350M","paramsB":null,"activeParamsB":null,"hardwareTemplate":"AMD Radeon 780M (Ryzen 7840HS / 8745H)","hardware":"AMD Ryzen 7 7840HS","deviceCount":1,"memoryGB":null,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"commit 6b4dc21","quantKey":"q2","quantization":"Q2_K","contextLength":512,"promptTokens":64,"outputTokens":256,"kvCacheDtype":null,"backend":"cpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":288.830789,"prefillTokS":990.326919,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-14T06:11:56.678Z","command":"taskset -c 0-7 llama-bench -m LFM2-350M-Q2_K.gguf -t 8 -p 64 -n 256 -b 512 -ub 128 --poll 50 --prio 0 -r 3 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2-350M"},{"id":"cmqg7kj2j000qp2016ybj1t69","hfId":"LiquidAI/LFM2.5-8B-A1B","presetKey":"lfm2.5_8b_a1b","model":"LFM2.5-8B-A1B","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RTX 5060 Ti 16GB","hardware":"RTX 5060 Ti","deviceCount":1,"memoryGB":16,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"int8","quantization":"Q8_K_XL","contextLength":4096,"promptTokens":31,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":183.1,"prefillTokS":1241.4,"ttftMs":24.97,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-16T05:35:24.811Z","command":"CUDA_VISIBLE_DEVICES=0 llama-server -m LFM2.5-8B-A1B-UD-Q8_K_XL.gguf -c 4096 --port 8080","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2.5-8B-A1B"},{"id":"cms3nh9o601a9s2012n5l7wkb","hfId":"deepseek-ai/DeepSeek-R1-Distill-Qwen-7B","presetKey":"deepseek_r1_distill_8b","model":"DeepSeek-R1-Distill-Qwen-7B","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RTX 3060 Ti","hardware":"RTX 3060 Ti","deviceCount":1,"memoryGB":8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":65536,"promptTokens":65536,"outputTokens":128,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":25.38,"prefillTokS":1266.78,"ttftMs":82710.1,"peakVramGb":6.66,"reproducibility":5,"verified":false,"createdAt":"2026-07-27T19:59:10.902Z","command":"llama-bench -m -p 65536 -n 128 -ngl 28 -sm layer -fa on -ctk q4_0 -ctv q4_0 -r 5","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepseek-ai%2FDeepSeek-R1-Distill-Qwen-7B"},{"id":"cmr1za43x01ocld0173wikwr8","hfId":"unsloth/gemma-4-E2B-it-GGUF","presetKey":"gemma4_e2b","model":"gemma-4-E2B-it-GGUF","paramsB":2,"activeParamsB":null,"hardwareTemplate":"Mac M5 Pro (64)","hardware":"M5 Pro","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"9850 (4f31eedb0)","quantKey":"int8","quantization":"Q8_K_XL","contextLength":4224,"promptTokens":512,"outputTokens":124,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":3584,"batchSize":1,"observedTokS":77.41,"prefillTokS":2543.25,"ttftMs":201.32,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-01T11:14:17.806Z","command":"llama-bench -m /unsloth/gemma-4-E2B-it-GGUF/gemma-4-E2B-it-UD-Q8_K_XL.gguf \\ -ngl 999 \\ -b 2048 \\ -ub 512 \\ -d 3584 \\ -pg 512,128 \\ -r 5 \\ -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2Fgemma-4-E2B-it-GGUF"},{"id":"cmp545bce0032o301p6e2pk0f","hfId":"ggml-org/gemma-4-E4B-it-GGUF","presetKey":"gemma4_e4b","model":"gemma-4-E4B-it-GGUF","paramsB":4,"activeParamsB":null,"hardwareTemplate":"RTX A5000","hardware":"RTX A5000","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"ce735c9","quantKey":"int8","quantization":"Q8_0","contextLength":4096,"promptTokens":1010,"outputTokens":512,"kvCacheDtype":"fp16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":95.305454,"prefillTokS":5160.945357,"ttftMs":null,"peakVramGb":5.597,"reproducibility":6,"verified":false,"createdAt":"2026-05-14T06:34:25.838Z","command":"/data/bt/os/llama.cpp/llama.cpp-bench-upstream/build-bench-cuda-gcc15/bin/llama-server -m /data/bt/models/hub/models--ggml-org--gemma-4-E4B-it-GGUF/snapshots/2714b5519c6c3516b1000e7c5e1eba998dfe1fe8/gemma-4-E4B-it-Q8_0.gguf -a gemma-4-e4b-it-q8_0 -ngl 999 -fa on -c 4096 -b 2048 -ub 512 -np 1 --no-context-shift --metrics --no-webui --host 127.0.0.1 --port 18106","source":"https://www.localmaxxing.com/en/leaderboard?hfId=ggml-org%2Fgemma-4-E4B-it-GGUF"},{"id":"cmqzbxhuf02i8oe01hp1zn8kp","hfId":"Qwen/Qwen3.5-9B","presetKey":"qwen3.5_9b","model":"Qwen3.5-9B","paramsB":9,"activeParamsB":null,"hardwareTemplate":"RTX 5080","hardware":"RTX 5080","deviceCount":1,"memoryGB":16,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"int8","quantization":"Q8_0","contextLength":4096,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":79.63,"prefillTokS":6285.85,"ttftMs":81.5,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T14:45:05.559Z","command":"/home/maxious/llama-master/build-cuda/bin/llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/Qwopus3.5-9B-Coder-MTP-Q8_0.gguf -p 512 -n 128 -fa 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.5-9B"},{"id":"cmohdd82h000okw04we7c4ggp","hfId":"llmfan46/Qwen3.6-35B-A3B-uncensored-heretic","presetKey":"qwen3.6_35b_a3b","model":"Qwen3.6-35B-A3B-uncensored-heretic","paramsB":36,"activeParamsB":3,"hardwareTemplate":"RTX 4090","hardware":"RTX 4090","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b8931","quantKey":"q3","quantization":"Q3_K_M","contextLength":8192,"promptTokens":0,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":164.09,"prefillTokS":null,"ttftMs":183.04,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-04-27T15:46:03.161Z","command":"llama-server -m Qwen3.6-35B-A3B-uncensored-heretic-Q3_K_M.gguf -c 140000 --n-gpu-layers 999 -fa on --cache-type-k q8_0 --cache-type-v q8_0 --no-mmap --reasoning on --reasoning-budget 8192 --threads 12 --ubatch-size 1024 --batch-size 1024 --prio 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=llmfan46%2FQwen3.6-35B-A3B-uncensored-heretic"},{"id":"cmqpwubh900u5qo01vedtzx2t","hfId":"google/gemma-3-4b-it","presetKey":"gemma3_4b","model":"gemma-3-4b-it","paramsB":4,"activeParamsB":null,"hardwareTemplate":"Mac M3 Ultra (512)","hardware":"M3 Ultra","deviceCount":1,"memoryGB":512,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":44,"outputTokens":512,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":127.15,"prefillTokS":null,"ttftMs":184.9,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-23T00:32:47.518Z","command":"/opt/homebrew/bin/llama-server -m /Volumes/Extreme Pro/Lilly-transfer/localmaxxing-candidates/ggml-org__gemma-3-4b-it-GGUF/gemma-3-4b-it-Q4_K_M.gguf --host 127.0.0.1 --port 8097 -ngl 99 --fit off -c 8192 -fa on --reasoning off --reasoning-format none","source":"https://www.localmaxxing.com/en/leaderboard?hfId=google%2Fgemma-3-4b-it"},{"id":"cmqzayrrc02feoe010r834ske","hfId":"Qwen/Qwen3.5-9B","presetKey":"qwen3.5_9b","model":"Qwen3.5-9B","paramsB":9,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B60","hardware":"Intel Arc Pro B60","deviceCount":2,"memoryGB":48,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"int8","quantization":"Q8_0","contextLength":4096,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":27.71,"prefillTokS":1426.41,"ttftMs":358.9,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T14:18:05.448Z","command":"/home/maxious/llama-master/build-sycl-new/bin/llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/Qwopus3.5-9B-Coder-MTP-Q8_0.gguf -p 512 -n 128 -fa 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.5-9B"},{"id":"cmssh4ev301ehms01s9tkzzst","hfId":"poolside/Laguna-S-2.1","presetKey":"laguna_s_2.1","model":"Laguna-S-2.1","paramsB":118,"activeParamsB":null,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10352-baf0025de+umafix","quantKey":"q2","quantization":"IQ2_M","contextLength":8192,"promptTokens":1194,"outputTokens":299,"kvCacheDtype":"fp16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":44.4,"prefillTokS":427,"ttftMs":2796.38,"peakVramGb":35.7,"reproducibility":7,"verified":false,"createdAt":"2026-08-14T04:55:27.807Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model Laguna-S-2.1-UD-IQ2_M.gguf -ngl 999 -c 8192 -fa on --no-mmap -np 1 -b 2048 -ub 1024 --temp 0 --no-cache-prompt","source":"https://www.localmaxxing.com/en/leaderboard?hfId=poolside%2FLaguna-S-2.1"},{"id":"cmsf8gj7100tkpp01lg91zxzd","hfId":"deepreinforce-ai/Ornith-1.0-35B","presetKey":"ornith_1_35b_a3b","model":"Ornith-1.0-35B","paramsB":null,"activeParamsB":null,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":2,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10107","quantKey":"int8","quantization":"Q8_0","contextLength":787,"promptTokens":531,"outputTokens":256,"kvCacheDtype":"f16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":80.116,"prefillTokS":1556.092,"ttftMs":341.24,"peakVramGb":42.91,"reproducibility":7,"verified":false,"createdAt":"2026-08-04T22:31:56.461Z","command":"/home/mikekey/Experiments/llama.cpp/build-vulkan/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --prio 3 -m /home/mikekey/models/gguf/misc/ornith-1.0-35b-Q8_0.gguf --reasoning-format auto --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 --repeat-penalty 1.0 -ctk f16 -ctv f16 -ts 0/1/1 -np 1 -c 262144 --chat-template-kwargs '{\"preserve_thinking\": true}'","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-35B"},{"id":"cmqptcu9x00sgqo01ivq06sdp","hfId":"unsloth/Qwen3.6-35B-A3B-MTP-GGUF","presetKey":"qwen3.6_35b_a3b","model":"Qwen3.6-35B-A3B-MTP-GGUF","paramsB":35,"activeParamsB":null,"hardwareTemplate":"Mac M5 Max (128)","hardware":"M5 Max","deviceCount":1,"memoryGB":128,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9430","quantKey":"q4","quantization":"Q4_K_XL","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":97.01,"prefillTokS":3038.17,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-06-22T22:55:13.221Z","command":"llama-bench -m Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf -p 512 -n 128 -fa 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.6-35B-A3B-MTP-GGUF"},{"id":"cmooa6kqi0011kw04syvpj0ak","hfId":"Qwen/Qwen3.6-35B-A3B","presetKey":"qwen3.6_35b_a3b","model":"Qwen3.6-35B-A3B","paramsB":36,"activeParamsB":3,"hardwareTemplate":"GTX 1060","hardware":"GTX 1060","deviceCount":1,"memoryGB":6,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q2","quantization":"UD-IQ2_M","contextLength":76800,"promptTokens":21,"outputTokens":200,"kvCacheDtype":"q4_0","backend":null,"splitMode":null,"cpuMoeLayers":26,"decodeDepthTokens":null,"batchSize":1,"observedTokS":15,"prefillTokS":null,"ttftMs":null,"peakVramGb":5.9,"reproducibility":5,"verified":false,"createdAt":"2026-05-02T11:51:17.370Z","command":"llama-server -m Huihui-Qwen3.6-35B-A3B-abliterated.i1-IQ2_M.gguf -c 76800 -ngl 99 -ncmoe 26 --flash-attn on -b 1024 --cache-type-k q4_0 --cache-type-v q4_0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.6-35B-A3B"},{"id":"cmqdzy3so00t1mp01vqgylwx9","hfId":"zai-org/GLM-4.7-Flash","presetKey":"glm4.7_flash","model":"GLM-4.7-Flash","paramsB":31,"activeParamsB":null,"hardwareTemplate":"RTX 5090","hardware":"RTX 5090","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b741 (1fd6dfe)","quantKey":"q6","quantization":"UD-Q6_K_XL","contextLength":8192,"promptTokens":69,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":175.9,"prefillTokS":5434.6,"ttftMs":12.7,"peakVramGb":25,"reproducibility":7,"verified":false,"createdAt":"2026-06-14T16:26:28.921Z","command":"llama-server -m GLM-4.7-Flash-UD-Q6_K_XL.gguf --alias glm-4.7-flash-q6 -ngl 999 -fa on -c 8192 -ctk q8_0 -ctv q8_0 -np 1 --temp 0 --host 127.0.0.1 --port 8080","source":"https://www.localmaxxing.com/en/leaderboard?hfId=zai-org%2FGLM-4.7-Flash"},{"id":"cmsqkpa4f00o8mr019bfk7kv0","hfId":"nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16","presetKey":"nemotron3.5_lightning_30b_a3b","model":"NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16","paramsB":32,"activeParamsB":3,"hardwareTemplate":"Intel Arc Pro B70","hardware":"Intel Arc Pro B70","deviceCount":1,"memoryGB":32,"runtimeKey":"vllm","engine":"vllm","engineVersion":"v0.26.1rc1.dev668+g3ee2df303 (XPU)","quantKey":"q4","quantization":"GPTQ-INT4-G64-sym-local","contextLength":16384,"promptTokens":0,"outputTokens":0,"kvCacheDtype":"default","backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":93,"prefillTokS":4900,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-08-12T21:00:07.935Z","command":"VLLM_XPU_ENABLE_XPU_GRAPH=1 vllm serve /mnt/models/nemotron-lightning-gptq-sym64-20260812 --host 0.0.0.0 --port 8001 --no-enable-prefix-caching --async-scheduling --gpu-memory-utilization 0.95 --max-model-len 16384 --enforce-eager false --trust-remote-code","source":"https://www.localmaxxing.com/en/leaderboard?hfId=nvidia%2FNVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16"},{"id":"cmrij107g01prmj01c3pcnf3u","hfId":"cyankiwi/gemma-4-12B-it-AWQ-INT4","presetKey":"gemma4_12b","model":"gemma-4-12B-it-AWQ-INT4","paramsB":12,"activeParamsB":null,"hardwareTemplate":"RTX 3090","hardware":"RTX 3090","deviceCount":4,"memoryGB":96,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.23.0","quantKey":"q4","quantization":"AWQ","contextLength":2048,"promptTokens":34,"outputTokens":256,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":105.4,"prefillTokS":null,"ttftMs":26.53,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-13T01:11:23.980Z","command":"VLLM_ATTENTION_BACKEND=FLASH_ATTN vllm serve cyankiwi/gemma-4-12B-it-AWQ-INT4 --tensor-parallel-size 4 --max-model-len 32768 --max-num-seqs 1 --gpu-memory-utilization 0.90 --disable-custom-all-reduce --trust-remote-code # vLLM 0.23","source":"https://www.localmaxxing.com/en/leaderboard?hfId=cyankiwi%2Fgemma-4-12B-it-AWQ-INT4"},{"id":"cmsy7g9830ct8ms014824moau","hfId":"unsloth/Muse-Glimmer-30B-GGUF","presetKey":"muse_glimmer_30b","model":"Muse-Glimmer-30B-GGUF","paramsB":30,"activeParamsB":null,"hardwareTemplate":"RTX 3080","hardware":"RTX 3080","deviceCount":1,"memoryGB":10,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10472","quantKey":"q3","quantization":"UD-Q3_K_XL","contextLength":16384,"promptTokens":2471,"outputTokens":256,"kvCacheDtype":"q8_0","backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":13.78,"prefillTokS":891.31,"ttftMs":2810.9,"peakVramGb":9.408,"reproducibility":6,"verified":false,"createdAt":"2026-08-18T05:11:21.268Z","command":"llama-server -m Muse-Glimmer-30B-UD-Q3_K_XL.gguf -c 16384 -ngl 40 -fa on -ctk q8_0 -ctv q8_0 --parallel 1 --jinja --spec-type none","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FMuse-Glimmer-30B-GGUF"},{"id":"cmsyvz8zx0docms01bah9z5zv","hfId":"unsloth/Qwen3.5-9B-GGUF","presetKey":"qwen3.5_9b","model":"Qwen3.5-9B-GGUF","paramsB":9,"activeParamsB":null,"hardwareTemplate":"RTX 3060","hardware":"RTX 3060","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10443","quantKey":"q4","quantization":"Q4_K_M","contextLength":32768,"promptTokens":261,"outputTokens":2272,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":51.89,"prefillTokS":1457.92,"ttftMs":null,"peakVramGb":5.71,"reproducibility":6,"verified":false,"createdAt":"2026-08-18T16:37:58.222Z","command":"/home/mani/llama.cpp/build/bin/llama-server --model /home/mani/llama_models/qwen3.5-9b/Qwen3.5-9B-Q4_K_M.gguf --alias Qwen3.5-9B --host 127.0.0.1 --port 8094 -ngl 99 -fa on -ctk q4_0 -ctv q4_0 -c 32768 -n 8192 --reasoning on --jinja","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.5-9B-GGUF"},{"id":"cmrk4wyg20314mj01pzu6ogi5","hfId":"openai/gpt-oss-120b","presetKey":"gpt_oss_120b","model":"gpt-oss-120b","paramsB":117,"activeParamsB":null,"hardwareTemplate":"RTX PRO 6000 Blackwell","hardware":"RTX PRO 6000 Blackwell","deviceCount":1,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"master+2969d6d","quantKey":"float16","quantization":"F16","contextLength":845,"promptTokens":589,"outputTokens":256,"kvCacheDtype":"f16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":203.423,"prefillTokS":3903.09,"ttftMs":150.91,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-14T04:11:52.803Z","command":"llama-server -m gpt-oss-120b-F16.gguf -ctk f16 -ctv f16 -c 131072 -np 1 -ngl 999","source":"https://www.localmaxxing.com/en/leaderboard?hfId=openai%2Fgpt-oss-120b"},{"id":"cms7rjjx60081pf01j4vkfkzj","hfId":"google/gemma-4-12B-it","presetKey":"gemma4_12b","model":"gemma-4-12B-it","paramsB":12,"activeParamsB":null,"hardwareTemplate":"RX 6700 XT","hardware":"RX 6700 XT","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"e1a1abb","quantKey":"q4","quantization":"Q4_K_M","contextLength":4736,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"rocm","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":4096,"batchSize":1,"observedTokS":34.97,"prefillTokS":504.16,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-30T17:04:00.666Z","command":"llama-bench -m <model> -p 512 -n 128 -d 4096 (HSA_OVERRIDE_GFX_VERSION=10.3.0)","source":"https://www.localmaxxing.com/en/leaderboard?hfId=google%2Fgemma-4-12B-it"},{"id":"cms0k7i40006ls201s7w1wb0r","hfId":"openai/gpt-oss-20b","presetKey":"gpt_oss_20b","model":"gpt-oss-20b","paramsB":22,"activeParamsB":null,"hardwareTemplate":"NVIDIA DGX Spark (GB10)","hardware":"GB10 Grace Blackwell","deviceCount":1,"memoryGB":128,"runtimeKey":"vllm","engine":"vllm","engineVersion":"","quantKey":"q4","quantization":"MXFP4","contextLength":32768,"promptTokens":535,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":49.19,"prefillTokS":7215.52,"ttftMs":74.1,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-07-25T16:04:17.904Z","command":"vllm serve openai/gpt-oss-20b --served-model-name triage --gpu-memory-utilization 0.26 --enable-prefix-caching --max-model-len 32768 --max-num-seqs 8 --reasoning-parser openai_gptoss --tool-call-parser openai --enable-auto-tool-choice --host 0.0.0.0 --port 8105","source":"https://www.localmaxxing.com/en/leaderboard?hfId=openai%2Fgpt-oss-20b"},{"id":"cmriqry4a022bmj011r1izha9","hfId":"meta-llama/Llama-3.2-1B-Instruct","presetKey":"llama3.2_1b","model":"Llama-3.2-1B-Instruct","paramsB":1,"activeParamsB":null,"hardwareTemplate":"AMD Radeon 780M (Ryzen 7840HS / 8745H)","hardware":"AMD Ryzen 7 7840HS","deviceCount":1,"memoryGB":null,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"commit 6b4dc21","quantKey":"q4","quantization":"Q4_K_M","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":68.239114,"prefillTokS":493.796542,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-13T04:48:18.299Z","command":"llama-bench -m Llama-3.2-1B-Instruct-Q4_K_M.gguf -t 8 -p 512 -n 128 -r 2 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-llama%2FLlama-3.2-1B-Instruct"},{"id":"cmqg6j391000rpi01eeyduyqa","hfId":"LiquidAI/LFM2.5-8B-A1B","presetKey":"lfm2.5_8b_a1b","model":"LFM2.5-8B-A1B","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RTX 5060 Ti 16GB","hardware":"RTX 5060 Ti","deviceCount":1,"memoryGB":16,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_XL","contextLength":4096,"promptTokens":31,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":254.3,"prefillTokS":1436.7,"ttftMs":21.58,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-16T05:06:18.037Z","command":"CUDA_VISIBLE_DEVICES=0 llama-server -m LFM2.5-8B-A1B-UD-Q4_K_XL.gguf -c 4096 --port 8080","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2.5-8B-A1B"},{"id":"cms3ngw8g019cs201a8w9z4dd","hfId":"Qwen/Qwen3-1.7B-GGUF","presetKey":"qwen3_1.7b","model":"Qwen3-1.7B-GGUF","paramsB":2,"activeParamsB":null,"hardwareTemplate":"RTX 3060 Ti","hardware":"RTX 3060 Ti","deviceCount":1,"memoryGB":8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":98304,"promptTokens":98304,"outputTokens":128,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":35.88,"prefillTokS":1790.14,"ttftMs":1,"peakVramGb":5.82,"reproducibility":5,"verified":false,"createdAt":"2026-07-27T19:58:53.488Z","command":"llama-bench -m -p 98304 -n 128 -ngl 28 -sm layer -fa on -ctk q4_0 -ctv q4_0 -r 5","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-1.7B-GGUF"},{"id":"cmr1z5bag01o2ld01p75g502z","hfId":"Abiray/MiniCPM5-1B-GGUF","presetKey":"minicpm5_1b","model":"MiniCPM5-1B-GGUF","paramsB":1,"activeParamsB":null,"hardwareTemplate":"Mac M5 Pro (64)","hardware":"M5 Pro","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"9850 (4f31eedb0)","quantKey":"int8","quantization":"Q8_0","contextLength":4224,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":3584,"batchSize":1,"observedTokS":198.24,"prefillTokS":3952.71,"ttftMs":129.53,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-01T11:10:33.832Z","command":"llama-bench -m /Abiray/MiniCPM5-1B-GGUF/minicpm5-1b-Q8_0.gguf \\ -ngl 999 \\ -b 2048 \\ -ub 512 \\ -d 3584 \\ -pg 512,128 \\ -r 5 \\ -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Abiray%2FMiniCPM5-1B-GGUF"},{"id":"cmp543yxd002zo301bq62sv35","hfId":"ggml-org/gemma-4-E4B-it-GGUF","presetKey":"gemma4_e4b","model":"gemma-4-E4B-it-GGUF","paramsB":4,"activeParamsB":null,"hardwareTemplate":"RTX A5000","hardware":"RTX A5000","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"ce735c9","quantKey":"q4","quantization":"Q4_K_M","contextLength":4096,"promptTokens":1010,"outputTokens":512,"kvCacheDtype":"fp16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":120.979227,"prefillTokS":4757.143181,"ttftMs":null,"peakVramGb":3.722,"reproducibility":6,"verified":false,"createdAt":"2026-05-14T06:33:23.089Z","command":"/data/bt/os/llama.cpp/llama.cpp-bench-upstream/build-bench-cuda-gcc15/bin/llama-server -m /data/bt/models/hub/models--ggml-org--gemma-4-E4B-it-GGUF/snapshots/2714b5519c6c3516b1000e7c5e1eba998dfe1fe8/gemma-4-E4B-it-Q4_K_M.gguf -a gemma-4-e4b-it-q4_k_m -ngl 999 -fa on -c 4096 -b 2048 -ub 512 -np 1 --no-context-shift --metrics --no-webui --host 127.0.0.1 --port 18105","source":"https://www.localmaxxing.com/en/leaderboard?hfId=ggml-org%2Fgemma-4-E4B-it-GGUF"},{"id":"cmqzbtn8902hsoe012ipenqyw","hfId":"meta-llama/Llama-3.2-1B-Instruct","presetKey":"llama3.2_1b","model":"Llama-3.2-1B-Instruct","paramsB":1,"activeParamsB":null,"hardwareTemplate":"RTX 5080","hardware":"RTX 5080","deviceCount":1,"memoryGB":16,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"int8","quantization":"Q8_0","contextLength":4096,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":448.11,"prefillTokS":35896.7,"ttftMs":14.3,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T14:42:05.913Z","command":"/home/maxious/llama-master/build-cuda/bin/llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/Llama-3.2-1B.Q8_0.gguf -p 512 -n 128 -fa 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-llama%2FLlama-3.2-1B-Instruct"},{"id":"cmosdr72m0005l50423g2a02c","hfId":"Qwen/Qwen3-30B-A3B","presetKey":"qwen3_30b_a3b","model":"Qwen3-30B-A3B","paramsB":30,"activeParamsB":null,"hardwareTemplate":"Mac M3 Ultra (512)","hardware":"M3 Ultra","deviceCount":1,"memoryGB":512,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":50,"outputTokens":184,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":101.95,"prefillTokS":null,"ttftMs":76,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-05-05T08:42:22.990Z","command":"/opt/homebrew/bin/llama-server -m /Volumes/Extreme Pro/Lilly-transfer/localmaxxing-candidates/Qwen__Qwen3-30B-A3B-GGUF/Qwen3-30B-A3B-Q4_K_M.gguf --host 127.0.0.1 --port 8097 -ngl 99 --fit off -c 8192 -fa on --reasoning off --reasoning-format none","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-30B-A3B"},{"id":"cmqzasd4202ezoe01sfwb2nm8","hfId":"meta-llama/Llama-3.2-1B-Instruct","presetKey":"llama3.2_1b","model":"Llama-3.2-1B-Instruct","paramsB":1,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B60","hardware":"Intel Arc Pro B60","deviceCount":2,"memoryGB":48,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"int8","quantization":"Q8_0","contextLength":4096,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":194.89,"prefillTokS":8336.42,"ttftMs":61.4,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T14:13:06.530Z","command":"/home/maxious/llama-master/build-sycl-new/bin/llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/Llama-3.2-1B.Q8_0.gguf -p 512 -n 128 -fa 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-llama%2FLlama-3.2-1B-Instruct"},{"id":"cmssh1h2l01ecms01t4k8q4xz","hfId":"poolside/Laguna-S-2.1","presetKey":"laguna_s_2.1","model":"Laguna-S-2.1","paramsB":118,"activeParamsB":null,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10352-baf0025de+umafix","quantKey":"q2","quantization":"IQ2_M","contextLength":8192,"promptTokens":1194,"outputTokens":312,"kvCacheDtype":"fp16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":44,"prefillTokS":553.9,"ttftMs":2155.61,"peakVramGb":36.7,"reproducibility":7,"verified":false,"createdAt":"2026-08-14T04:53:10.701Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model Laguna-S-2.1-UD-IQ2_M.gguf -ngl 999 -c 8192 -fa on --no-mmap -np 1 -b 2048 -ub 1024 --temp 0 --no-cache-prompt","source":"https://www.localmaxxing.com/en/leaderboard?hfId=poolside%2FLaguna-S-2.1"},{"id":"cmsf3iks000pkpp011537t04i","hfId":"deepseek-ai/DeepSeek-V4-Flash","presetKey":"deepseek_v4_flash","model":"DeepSeek-V4-Flash","paramsB":291,"activeParamsB":null,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":3,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10107","quantKey":"q2","quantization":"AD-IQ1_M","contextLength":782,"promptTokens":526,"outputTokens":256,"kvCacheDtype":"f16","backend":"rocm","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":21.386,"prefillTokS":278.863,"ttftMs":1886.23,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-08-04T20:13:33.743Z","command":"/home/mikekey/Experiments/llama.cpp/build-rocm/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --prio 3 --no-mmap -m /home/mikekey/models/hf/hub/models--AtomicChat--DeepSeek-V4-Flash-0731-GGUF/snapshots/b744b2af48c0008788234b5421122c62b6811b2e/AD-IQ1_M/DeepSeek-V4-Flash-0731-AD-IQ1_M-00001-of-00004.gguf --reasoning-format auto --temp 0.6 --top-p 0.95 --min-p 0.0 --repeat-penalty 1.0 -ctk f16 -ctv f16 -ts 1/1/1 -np 1 -c 32768","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepseek-ai%2FDeepSeek-V4-Flash"},{"id":"cmqpara9r00m8qo01qj7725ov","hfId":"mlx-community/Qwen3-Coder-30B-A3B-Instruct-4bit","presetKey":"qwen3_30b_a3b","model":"Qwen3-Coder-30B-A3B-Instruct-4bit","paramsB":30,"activeParamsB":null,"hardwareTemplate":"Mac M5 Max (128)","hardware":"M5 Max","deviceCount":1,"memoryGB":128,"runtimeKey":"mlx","engine":"mlx","engineVersion":"mlx-lm 0.31.3","quantKey":"q4","quantization":"4bit","contextLength":2048,"promptTokens":256,"outputTokens":128,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":140.694,"prefillTokS":1801.56,"ttftMs":null,"peakVramGb":17.475,"reproducibility":6,"verified":false,"createdAt":"2026-06-22T14:14:34.431Z","command":"mlx_lm.benchmark --model mlx-community/Qwen3-Coder-30B-A3B-Instruct-4bit --prompt-tokens 256 --generation-tokens 128 --num-trials 5","source":"https://www.localmaxxing.com/en/leaderboard?hfId=mlx-community%2FQwen3-Coder-30B-A3B-Instruct-4bit"},{"id":"cmqdzr0s500smmp01heujx7zc","hfId":"google/gemma-4-31B-it","presetKey":"gemma4_31b","model":"gemma-4-31B-it","paramsB":33,"activeParamsB":null,"hardwareTemplate":"RTX 5090","hardware":"RTX 5090","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b741 (1fd6dfe)","quantKey":"q4","quantization":"UD-Q4_K_XL-QAT","contextLength":8192,"promptTokens":82,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":68.5,"prefillTokS":710.6,"ttftMs":115.4,"peakVramGb":17.8,"reproducibility":7,"verified":false,"createdAt":"2026-06-14T16:20:58.421Z","command":"llama-server -m gemma-4-31B-it-qat-UD-Q4_K_XL.gguf --alias gemma-4-31b-qat-q4 -ngl 999 -fa on -c 8192 -ctk q8_0 -ctv q8_0 -np 1 --temp 0 --host 127.0.0.1 --port 8080","source":"https://www.localmaxxing.com/en/leaderboard?hfId=google%2Fgemma-4-31B-it"},{"id":"cmsqkp05t00o3mr01q3thwe7c","hfId":"nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16","presetKey":"nemotron3.5_lightning_30b_a3b","model":"NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16","paramsB":32,"activeParamsB":3,"hardwareTemplate":"Intel Arc Pro B70","hardware":"Intel Arc Pro B70","deviceCount":1,"memoryGB":32,"runtimeKey":"vllm","engine":"vllm","engineVersion":"v0.26.1rc1.dev668+g3ee2df303 (XPU)","quantKey":"q4","quantization":"GPTQ-INT4-G64-sym-local","contextLength":16384,"promptTokens":0,"outputTokens":0,"kvCacheDtype":"default","backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":93,"prefillTokS":4900,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-08-12T20:59:55.025Z","command":"VLLM_XPU_ENABLE_XPU_GRAPH=1 vllm serve /mnt/models/nemotron-lightning-gptq-sym64-20260812 --host 0.0.0.0 --port 8001 --no-enable-prefix-caching --async-scheduling --gpu-memory-utilization 0.95 --max-model-len 16384 --enforce-eager false --trust-remote-code","source":"https://www.localmaxxing.com/en/leaderboard?hfId=nvidia%2FNVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16"},{"id":"cmrigvbc301l5mj01ikusuv64","hfId":"cyankiwi/Qwen3.5-122B-A10B-AWQ-4bit","presetKey":"qwen3.5_122b_a10b","model":"Qwen3.5-122B-A10B-AWQ-4bit","paramsB":125,"activeParamsB":10,"hardwareTemplate":"RTX 3090","hardware":"RTX 3090","deviceCount":4,"memoryGB":96,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.23.0","quantKey":"q4","quantization":"AWQ","contextLength":2048,"promptTokens":32,"outputTokens":256,"kvCacheDtype":"auto","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":94.2,"prefillTokS":null,"ttftMs":116.85,"peakVramGb":88.8,"reproducibility":6,"verified":false,"createdAt":"2026-07-13T00:10:59.235Z","command":"VLLM_ATTENTION_BACKEND=FLASH_ATTN PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True vllm serve cyankiwi/Qwen3.5-122B-A10B-AWQ-4bit --tensor-parallel-size 4 --max-model-len 32768 --max-num-seqs 1 --max-num-batched-tokens 2048 --gpu-memory-utilization 0.94 --trust-remote-code","source":"https://www.localmaxxing.com/en/leaderboard?hfId=cyankiwi%2FQwen3.5-122B-A10B-AWQ-4bit"},{"id":"cmsy7eupf0cszms017nvp2dye","hfId":"google/gemma-4-12B-it-qat-q4_0-gguf","presetKey":"gemma4_12b","model":"gemma-4-12B-it-qat-q4_0-gguf","paramsB":12,"activeParamsB":null,"hardwareTemplate":"RTX 3080","hardware":"RTX 3080","deviceCount":1,"memoryGB":10,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10472","quantKey":"q4","quantization":"Q4_0","contextLength":32768,"promptTokens":2585,"outputTokens":256,"kvCacheDtype":"q8_0","backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":71.23,"prefillTokS":2698.78,"ttftMs":976.5,"peakVramGb":7.467,"reproducibility":6,"verified":false,"createdAt":"2026-08-18T05:10:15.796Z","command":"llama-server -m gemma-4-12b-it-qat-q4_0.gguf -c 32768 -ngl 99 -fa on -ctk q8_0 -ctv q8_0 --parallel 1 --jinja --spec-type none","source":"https://www.localmaxxing.com/en/leaderboard?hfId=google%2Fgemma-4-12B-it-qat-q4_0-gguf"},{"id":"cmsyor6ym0d4rms0194u5jikk","hfId":"unsloth/phi-4-GGUF","presetKey":"phi4_14b","model":"phi-4-GGUF","paramsB":15,"activeParamsB":null,"hardwareTemplate":"RTX 3060","hardware":"RTX 3060","deviceCount":2,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10443","quantKey":"q4","quantization":"Q4_K_M","contextLength":16384,"promptTokens":0,"outputTokens":0,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":34.2,"prefillTokS":889.5,"ttftMs":null,"peakVramGb":9.8,"reproducibility":6,"verified":false,"createdAt":"2026-08-18T13:15:45.022Z","command":"llama-server -m phi-4-Q4_K_M.gguf -ngl 99 -sm layer -fa on -ctk q4_0 -ctv q4_0 -c 16384 -n 8192 --reasoning on --jinja","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2Fphi-4-GGUF"},{"id":"cmr1ipwec01eeld01nn27xd9d","hfId":"unsloth/GLM-5.2-GGUF","presetKey":"glm5_2","model":"GLM-5.2-GGUF","paramsB":null,"activeParamsB":null,"hardwareTemplate":"RTX PRO 6000 Blackwell","hardware":"RTX PRO 6000 Blackwell","deviceCount":4,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"0eca4d4","quantKey":"q4","quantization":"UD-IQ4_XS","contextLength":65536,"promptTokens":874,"outputTokens":600,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":39.75,"prefillTokS":561.23,"ttftMs":3971.3,"peakVramGb":345.29,"reproducibility":6,"verified":false,"createdAt":"2026-07-01T03:30:40.837Z","command":"CUDA_VISIBLE_DEVICES=0,1,2,3 LD_LIBRARY_PATH=~/code/ggml-org/llama.cpp/build/bin llama-server --model GLM-5.2-UD-IQ4_XS-00001-of-00009.gguf --host 0.0.0.0 --port 8001 --alias GLM-5.2-UD-IQ4_XS --ctx-size 65536 --n-gpu-layers 999 --parallel 1 --flash-attn on --jinja --metrics","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FGLM-5.2-GGUF"},{"id":"cms7rjjej007upf01u75lbr49","hfId":"google/gemma-4-12B-it","presetKey":"gemma4_12b","model":"gemma-4-12B-it","paramsB":12,"activeParamsB":null,"hardwareTemplate":"RX 6700 XT","hardware":"RX 6700 XT","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"e1a1abb","quantKey":"q4","quantization":"Q4_K_M","contextLength":640,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"rocm","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":0,"batchSize":1,"observedTokS":37.29,"prefillTokS":561.11,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-30T17:03:59.995Z","command":"llama-bench -m <model> -p 512 -n 128 -d 0 (HSA_OVERRIDE_GFX_VERSION=10.3.0)","source":"https://www.localmaxxing.com/en/leaderboard?hfId=google%2Fgemma-4-12B-it"},{"id":"cmof5xmak0004jy04vgp81qqc","hfId":"Qwen/Qwen3.5-122B-A10B","presetKey":"qwen3.5_122b_a10b","model":"Qwen3.5-122B-A10B","paramsB":125,"activeParamsB":10,"hardwareTemplate":"NVIDIA DGX Spark (GB10)","hardware":"GB10 Grace Blackwell","deviceCount":1,"memoryGB":128,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"turboquant 8590cbff9","quantKey":"q6","quantization":"UD-Q6_K_XL","contextLength":100000,"promptTokens":0,"outputTokens":128,"kvCacheDtype":"q8_0/turbo3","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":17.1068,"prefillTokS":null,"ttftMs":null,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-04-26T02:42:25.436Z","command":"llama-bench -m Qwen3.5-122B-A10B-UD-Q6_K_XL-00001-of-00004.gguf -ngl 99 -fa 1 -ctk q8_0 -ctv turbo3 -p 0 -n 128","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.5-122B-A10B"},{"id":"cmriqrxk40226mj0188m30it1","hfId":"meta-llama/Llama-3.2-1B-Instruct","presetKey":"llama3.2_1b","model":"Llama-3.2-1B-Instruct","paramsB":1,"activeParamsB":null,"hardwareTemplate":"AMD Radeon 780M (Ryzen 7840HS / 8745H)","hardware":"AMD Ryzen 7 7840HS","deviceCount":1,"memoryGB":null,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"commit 6b4dc21","quantKey":"q2","quantization":"Q2_K","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":91.130813,"prefillTokS":319.741842,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-13T04:48:17.572Z","command":"llama-bench -m Llama-3.2-1B-Instruct-Q2_K.gguf -t 8 -p 512 -n 128 -r 2 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-llama%2FLlama-3.2-1B-Instruct"},{"id":"cms3nguah0199s201uywz5uji","hfId":"Qwen/Qwen3-1.7B-GGUF","presetKey":"qwen3_1.7b","model":"Qwen3-1.7B-GGUF","paramsB":2,"activeParamsB":null,"hardwareTemplate":"RTX 3060 Ti","hardware":"RTX 3060 Ti","deviceCount":1,"memoryGB":8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":8192,"outputTokens":128,"kvCacheDtype":"f16","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":155.1,"prefillTokS":7469.47,"ttftMs":1780.9,"peakVramGb":5.82,"reproducibility":5,"verified":false,"createdAt":"2026-07-27T19:58:50.969Z","command":"llama-bench -m -p 8192 -n 128 -ngl 28 -sm layer -fa on -ctk f16 -ctv f16 -r 5","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-1.7B-GGUF"},{"id":"cmr1z1vh701nrld016ef93bq0","hfId":"lmstudio-community/NVIDIA-Nemotron-3-Nano-4B-GGUF","presetKey":"nemotron3_nano_4b","model":"NVIDIA-Nemotron-3-Nano-4B-GGUF","paramsB":9,"activeParamsB":null,"hardwareTemplate":"Mac M5 Pro (64)","hardware":"M5 Pro","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"9850 (4f31eedb0)","quantKey":"int8","quantization":"Q8_0","contextLength":4224,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":3584,"batchSize":1,"observedTokS":53.81,"prefillTokS":1184.13,"ttftMs":432.38,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-01T11:07:53.371Z","command":"llama-bench -m /lmstudio-community/NVIDIA-Nemotron-3-Nano-4B-GGUF/NVIDIA-Nemotron-3-Nano-4B-Q8_0.gguf \\ -ngl 999 \\ -b 2048 \\ -ub 512 \\ -d 3584 \\ -pg 512,128 \\ -r 5 \\ -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=lmstudio-community%2FNVIDIA-Nemotron-3-Nano-4B-GGUF"},{"id":"cmp542mft002so301jxkarssw","hfId":"ggml-org/gemma-3-1b-it-GGUF","presetKey":"gemma3_1b","model":"gemma-3-1b-it-GGUF","paramsB":1,"activeParamsB":null,"hardwareTemplate":"RTX A5000","hardware":"RTX A5000","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"ce735c9","quantKey":"int8","quantization":"Q8_0","contextLength":4096,"promptTokens":1010,"outputTokens":512,"kvCacheDtype":"fp16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":281.895677,"prefillTokS":17924.005145,"ttftMs":null,"peakVramGb":1.778,"reproducibility":6,"verified":false,"createdAt":"2026-05-14T06:32:20.250Z","command":"/data/bt/os/llama.cpp/llama.cpp-bench-upstream/build-bench-cuda-gcc15/bin/llama-server -m /data/bt/models/hub/models--ggml-org--gemma-3-1b-it-GGUF/snapshots/f9c28bcd85737ffc5aef028638d3341d49869c27/gemma-3-1b-it-Q8_0.gguf -a gemma-3-1b-it-q8_0 -ngl 999 -fa on -c 4096 -b 2048 -ub 512 -np 1 --no-context-shift --metrics --no-webui --host 127.0.0.1 --port 18104","source":"https://www.localmaxxing.com/en/leaderboard?hfId=ggml-org%2Fgemma-3-1b-it-GGUF"},{"id":"cmoqlsqkp0009jm04fxywoea3","hfId":"Qwen/Qwen3-Coder-30B-A3B-Instruct","presetKey":"qwen3_30b_a3b","model":"Qwen3-Coder-30B-A3B-Instruct","paramsB":31,"activeParamsB":3,"hardwareTemplate":"Mac M3 Ultra (512)","hardware":"M3 Ultra","deviceCount":1,"memoryGB":512,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":46,"outputTokens":418,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":100,"prefillTokS":null,"ttftMs":79.4,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-05-04T02:51:59.497Z","command":"/opt/homebrew/bin/llama-server -m /Volumes/Extreme Pro/Lilly-transfer/localmaxxing-candidates/unsloth__Qwen3-Coder-30B-A3B-Instruct-GGUF/Qwen3-Coder-30B-A3B-Instruct-Q4_K_M.gguf --host 127.0.0.1 --port 8097 -ngl 99 --fit off -c 8192 -fa on --reasoning off --reasoning-format none","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-Coder-30B-A3B-Instruct"},{"id":"cmqz9ux7902czoe01w2hnu01w","hfId":"deepreinforce-ai/Ornith-1.0-35B-GGUF","presetKey":"ornith_1_35b_a3b","model":"Ornith-1.0-35B-GGUF","paramsB":35,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B60","hardware":"Intel Arc Pro B60","deviceCount":2,"memoryGB":48,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":4096,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":60.79,"prefillTokS":1128.11,"ttftMs":453.9,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T13:47:06.262Z","command":"/home/maxious/llama-master/build-vulkan/bin/llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/ornith-1.0-35b-Q4_K_M.gguf -p 512 -n 128 -fa 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-35B-GGUF"},{"id":"cmssgddjf01a8ms01a640pl0k","hfId":"poolside/Laguna-S-2.1","presetKey":"laguna_s_2.1","model":"Laguna-S-2.1","paramsB":118,"activeParamsB":null,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10352-baf0025de+umafix","quantKey":"q3","quantization":"Q3_K_XL","contextLength":8192,"promptTokens":1194,"outputTokens":357,"kvCacheDtype":"fp16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":33,"prefillTokS":541.5,"ttftMs":2205.06,"peakVramGb":52.4,"reproducibility":7,"verified":false,"createdAt":"2026-08-14T04:34:26.379Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model Laguna-S-2.1-UD-Q3_K_XL-00001-of-00003.gguf -ngl 999 -c 8192 -fa on --no-mmap -np 1 -b 2048 -ub 1024 --temp 0 --no-cache-prompt","source":"https://www.localmaxxing.com/en/leaderboard?hfId=poolside%2FLaguna-S-2.1"},{"id":"cmsf0imtw00ozpp01r0896sen","hfId":"deepseek-ai/DeepSeek-V4-Flash","presetKey":"deepseek_v4_flash","model":"DeepSeek-V4-Flash","paramsB":291,"activeParamsB":null,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":3,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10103-4-g779d20bdc","quantKey":"q2","quantization":"AD-IQ1_M","contextLength":782,"promptTokens":526,"outputTokens":256,"kvCacheDtype":"f16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":9.246,"prefillTokS":118.597,"ttftMs":4435.19,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-08-04T18:49:37.556Z","command":"/home/mikekey/Experiments/llama.cpp/build-vulkan/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --prio 3 -m /home/mikekey/models/hf/hub/models--AtomicChat--DeepSeek-V4-Flash-0731-GGUF/snapshots/b744b2af48c0008788234b5421122c62b6811b2e/AD-IQ1_M/DeepSeek-V4-Flash-0731-AD-IQ1_M-00001-of-00004.gguf --reasoning-format auto --temp 0.6 --top-p 0.95 --min-p 0.0 --repeat-penalty 1.0 -ctk f16 -ctv f16 -ts 1/1/1 -np 1 -c 32768","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepseek-ai%2FDeepSeek-V4-Flash"},{"id":"cmqdzjwwf00rvmp01wh65kqgx","hfId":"google/gemma-4-31B-it","presetKey":"gemma4_31b","model":"gemma-4-31B-it","paramsB":33,"activeParamsB":null,"hardwareTemplate":"RTX 5090","hardware":"RTX 5090","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b741 (1fd6dfe)","quantKey":"q6","quantization":"UD-Q6_K_XL","contextLength":8192,"promptTokens":82,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":46.5,"prefillTokS":520.1,"ttftMs":157.67,"peakVramGb":27.3,"reproducibility":7,"verified":false,"createdAt":"2026-06-14T16:15:26.799Z","command":"llama-server -m gemma-4-31B-it-UD-Q6_K_XL.gguf --alias gemma-4-31b-q6 -ngl 999 -fa on -c 8192 -ctk q8_0 -ctv q8_0 -np 1 --temp 0 --host 127.0.0.1 --port 8080","source":"https://www.localmaxxing.com/en/leaderboard?hfId=google%2Fgemma-4-31B-it"},{"id":"cmrvyib4x09rklg01d8d0sk8t","hfId":"google/gemma-4-31B-it","presetKey":"gemma4_31b","model":"gemma-4-31B-it","paramsB":33,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B70","hardware":"Intel Arc Pro B70","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9853","quantKey":"q4","quantization":"Q4_K_M","contextLength":131072,"promptTokens":4021,"outputTokens":350,"kvCacheDtype":"q8_0","backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":16.377053,"prefillTokS":332.892435,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-22T10:45:45.826Z","command":"llama-server -m gemma-4-31B-it-Q4_K_M.gguf -dev SYCL0 --parallel 1 -ngl 99 -ncmoe 0 -fa on -ctk q8_0 -ctv q4_1 -c 131072 -t 8 -b 8192 -ub 4096","source":"https://www.localmaxxing.com/en/leaderboard?hfId=google%2Fgemma-4-31B-it"},{"id":"cmpyrv3dt004lo601l0roizmr","hfId":"unsloth/gemma-4-12b-it-GGUF","presetKey":"gemma4_12b","model":"gemma-4-12b-it-GGUF","paramsB":12,"activeParamsB":null,"hardwareTemplate":"RTX 3090","hardware":"RTX 3090","deviceCount":2,"memoryGB":48,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b1-8ad8aef","quantKey":"int8","quantization":"Q8_K_XL","contextLength":131072,"promptTokens":100000,"outputTokens":285,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":48,"prefillTokS":null,"ttftMs":1035.1,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-06-04T00:43:38.850Z","command":"llama-server -m gemma-4-12b-it-UD-Q8_K_XL.gguf -ngl 999 -fa1 -c 0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2Fgemma-4-12b-it-GGUF"},{"id":"cmsy7c1q60csrms01xfzjikb2","hfId":"unsloth/Qwen3.8-27B-GGUF","presetKey":"qwen3.8_27b","model":"Qwen3.8-27B-GGUF","paramsB":28,"activeParamsB":null,"hardwareTemplate":"RTX 3080","hardware":"RTX 3080","deviceCount":1,"memoryGB":10,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10472","quantKey":"q2","quantization":"IQ2_XXS","contextLength":65536,"promptTokens":2700,"outputTokens":256,"kvCacheDtype":"q4_0","backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":44.41,"prefillTokS":1079.44,"ttftMs":2525.5,"peakVramGb":9.662,"reproducibility":6,"verified":false,"createdAt":"2026-08-18T05:08:04.927Z","command":"llama-server -m Qwen3.8-27B-UD-IQ2_XXS.gguf -c 65536 -ngl 99 -fa on -ctk q4_0 -ctv q4_0 --parallel 1 --jinja --spec-type none","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3.8-27B-GGUF"},{"id":"cmsyor53a0d4hms01cyj8vns9","hfId":"unsloth/gpt-oss-20b-GGUF","presetKey":"gpt_oss_20b","model":"gpt-oss-20b-GGUF","paramsB":22,"activeParamsB":null,"hardwareTemplate":"RTX 3060","hardware":"RTX 3060","deviceCount":2,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10443","quantKey":"q4","quantization":"Q4_K_M","contextLength":65536,"promptTokens":0,"outputTokens":0,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":93.44,"prefillTokS":895.4,"ttftMs":null,"peakVramGb":12.2,"reproducibility":6,"verified":false,"createdAt":"2026-08-18T13:15:42.598Z","command":"llama-server -m gpt-oss-20b-Q4_K_M.gguf -ngl 99 -sm layer -fa on -ctk q4_0 -ctv q4_0 -c 65536 -n 8192 --reasoning on --jinja","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2Fgpt-oss-20b-GGUF"},{"id":"cmr1i80z0017cld01eq8s90bm","hfId":"unsloth/GLM-5.2-GGUF","presetKey":"glm5_2","model":"GLM-5.2-GGUF","paramsB":null,"activeParamsB":null,"hardwareTemplate":"RTX PRO 6000 Blackwell","hardware":"RTX PRO 6000 Blackwell","deviceCount":4,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"0eca4d4","quantKey":"q4","quantization":"UD-IQ4_XS","contextLength":131072,"promptTokens":872,"outputTokens":600,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":39.73,"prefillTokS":562.56,"ttftMs":4034.7,"peakVramGb":351.87,"reproducibility":6,"verified":false,"createdAt":"2026-07-01T03:16:46.956Z","command":"CUDA_VISIBLE_DEVICES=0,1,2,3 LD_LIBRARY_PATH=~/code/ggml-org/llama.cpp/build/bin llama-server --model GLM-5.2-UD-IQ4_XS-00001-of-00009.gguf --host 0.0.0.0 --port 8001 --alias GLM-5.2-UD-IQ4_XS --ctx-size 131072 --n-gpu-layers 999 --parallel 1 --flash-attn on --jinja --metrics","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FGLM-5.2-GGUF"},{"id":"cms7rjiwj007npf013n0hz5oe","hfId":"google/gemma-4-12B-it","presetKey":"gemma4_12b","model":"gemma-4-12B-it","paramsB":12,"activeParamsB":null,"hardwareTemplate":"RX 6700 XT","hardware":"RX 6700 XT","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"e1a1abb","quantKey":"q4","quantization":"Q4_K_M","contextLength":4736,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":4096,"batchSize":1,"observedTokS":38.3,"prefillTokS":505.09,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-30T17:03:59.347Z","command":"llama-bench -m <model> -p 512 -n 128 -d 4096","source":"https://www.localmaxxing.com/en/leaderboard?hfId=google%2Fgemma-4-12B-it"},{"id":"cmriqdxoj021rmj0195xjqp5b","hfId":"LiquidAI/LFM2.5-1.2B-Instruct","presetKey":"lfm2.5_1.2b","model":"LFM2.5-1.2B-Instruct","paramsB":1,"activeParamsB":null,"hardwareTemplate":"AMD Radeon 780M (Ryzen 7840HS / 8745H)","hardware":"AMD Ryzen 7 7840HS","deviceCount":1,"memoryGB":null,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"commit 6b4dc21","quantKey":"q4","quantization":"Q4_K_M","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":74.795149,"prefillTokS":473.910472,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-13T04:37:24.547Z","command":"llama-bench -m LFM2.5-1.2B-Instruct-Q4_K_M.gguf -t 8 -p 512 -n 128 -r 2 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2.5-1.2B-Instruct"},{"id":"cms3ngsff0196s2017r1470tq","hfId":"Qwen/Qwen3-1.7B-GGUF","presetKey":"qwen3_1.7b","model":"Qwen3-1.7B-GGUF","paramsB":2,"activeParamsB":null,"hardwareTemplate":"RTX 3060 Ti","hardware":"RTX 3060 Ti","deviceCount":1,"memoryGB":8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":65536,"promptTokens":65536,"outputTokens":128,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":49.58,"prefillTokS":2438.06,"ttftMs":1,"peakVramGb":5.82,"reproducibility":5,"verified":false,"createdAt":"2026-07-27T19:58:48.556Z","command":"llama-bench -m -p 65536 -n 128 -ngl 28 -sm layer -fa on -ctk q4_0 -ctv q4_0 -r 5","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-1.7B-GGUF"},{"id":"cmr1ywwuy01nkld01ors1o461","hfId":"lmstudio-community/LFM2.5-1.2B-Instruct-GGUF","presetKey":"lfm2.5_1.2b","model":"LFM2.5-1.2B-Instruct-GGUF","paramsB":1,"activeParamsB":null,"hardwareTemplate":"Mac M5 Pro (64)","hardware":"M5 Pro","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"9850 (4f31eedb0)","quantKey":"int8","quantization":"Q8_0","contextLength":4224,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":3584,"batchSize":1,"observedTokS":186.04,"prefillTokS":5820.14,"ttftMs":87.97,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-01T11:04:01.882Z","command":"llama-bench -m /lmstudio-community/LFM2.5-1.2B-Instruct-GGUF/LFM2.5-1.2B-Instruct-Q8_0.gguf \\\n -ngl 999 \\\n -b 2048 \\\n -ub 512 \\\n -d 3584 \\\n -pg 512,128 \\\n -r 5 \\\n -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=lmstudio-community%2FLFM2.5-1.2B-Instruct-GGUF"},{"id":"cmp5419yh002no30141vcrtfp","hfId":"ggml-org/gemma-3-1b-it-GGUF","presetKey":"gemma3_1b","model":"gemma-3-1b-it-GGUF","paramsB":1,"activeParamsB":null,"hardwareTemplate":"RTX A5000","hardware":"RTX A5000","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"ce735c9","quantKey":"q4","quantization":"Q4_K_M","contextLength":4096,"promptTokens":1010,"outputTokens":512,"kvCacheDtype":"fp16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":325.190709,"prefillTokS":17334.699786,"ttftMs":null,"peakVramGb":1.534,"reproducibility":6,"verified":false,"createdAt":"2026-05-14T06:31:17.417Z","command":"/data/bt/os/llama.cpp/llama.cpp-bench-upstream/build-bench-cuda-gcc15/bin/llama-server -m /data/bt/models/hub/models--ggml-org--gemma-3-1b-it-GGUF/snapshots/f9c28bcd85737ffc5aef028638d3341d49869c27/gemma-3-1b-it-Q4_K_M.gguf -a gemma-3-1b-it-q4_k_m -ngl 999 -fa on -c 4096 -b 2048 -ub 512 -np 1 --no-context-shift --metrics --no-webui --host 127.0.0.1 --port 18103","source":"https://www.localmaxxing.com/en/leaderboard?hfId=ggml-org%2Fgemma-3-1b-it-GGUF"},{"id":"cmogns0yz0008jv042uh8y8fu","hfId":"Qwen/Qwen3-8B-GGUF","presetKey":"qwen3_8b","model":"Qwen3-8B-GGUF","paramsB":8,"activeParamsB":null,"hardwareTemplate":"Mac M3 Ultra (512)","hardware":"M3 Ultra","deviceCount":1,"memoryGB":512,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":46,"outputTokens":512,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":88.25,"prefillTokS":null,"ttftMs":5801.8,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-04-27T03:49:43.788Z","command":"/opt/homebrew/bin/llama-server -m /Volumes/Extreme Pro/Lilly-transfer/localmaxxing-candidates/Qwen__Qwen3-8B-GGUF/Qwen3-8B-Q4_K_M.gguf --host 127.0.0.1 --port 8097 -ngl 99 --fit off -c 8192 -fa on","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-8B-GGUF"},{"id":"cmqz9r1xv02cpoe01ir9haeez","hfId":"openai/gpt-oss-20b","presetKey":"gpt_oss_20b","model":"gpt-oss-20b","paramsB":22,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B60","hardware":"Intel Arc Pro B60","deviceCount":2,"memoryGB":48,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"int8","quantization":"Q8_0","contextLength":4096,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":47.25,"prefillTokS":1622.35,"ttftMs":315.6,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T13:44:05.779Z","command":"/home/maxious/llama-master/build-vulkan/bin/llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/gpt-oss-20b-Q8_0.gguf -p 512 -n 128 -fa 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=openai%2Fgpt-oss-20b"},{"id":"cmsqzr7q000y6mr016hjh06l0","hfId":"deepreinforce-ai/Ornith-1.0-35B","presetKey":"ornith_1_35b_a3b","model":"Ornith-1.0-35B","paramsB":null,"activeParamsB":null,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10352-baf0025de+umafix","quantKey":"q4","quantization":"Q4_K_XL","contextLength":8192,"promptTokens":1185,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":60.7,"prefillTokS":1222.7,"ttftMs":969.15,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-08-13T04:01:32.376Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model Ornith-1.0-35B-UD-Q4_K_XL.gguf -ngl 999 -c 8192 -fa on --no-mmap -np 1 -b 2048 -ub 1024 --temp 0 --no-cache-prompt -ctk q8_0 -ctv q8_0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-35B"},{"id":"cmsf0dwna00oupp01f0yp06ee","hfId":"deepseek-ai/DeepSeek-V4-Flash","presetKey":"deepseek_v4_flash","model":"DeepSeek-V4-Flash","paramsB":291,"activeParamsB":null,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":3,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10103-4-g779d20bdc","quantKey":"q2","quantization":"AD-IQ1_M","contextLength":782,"promptTokens":526,"outputTokens":256,"kvCacheDtype":"f16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":9.209,"prefillTokS":119.475,"ttftMs":4402.59,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-08-04T18:45:56.998Z","command":"/home/mikekey/Experiments/llama.cpp/build-vulkan/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --prio 3 -m /home/mikekey/models/hf/hub/models--AtomicChat--DeepSeek-V4-Flash-0731-GGUF/snapshots/b744b2af48c0008788234b5421122c62b6811b2e/AD-IQ1_M/DeepSeek-V4-Flash-0731-AD-IQ1_M-00001-of-00004.gguf --reasoning-format auto --temp 0.6 --top-p 0.95 --min-p 0.0 --repeat-penalty 1.0 -ctk f16 -ctv f16 -ts 1/1/1 -np 1 -c 32768","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepseek-ai%2FDeepSeek-V4-Flash"},{"id":"cmqdzcto500r0mp019jylhjqk","hfId":"google/gemma-4-12B-it","presetKey":"gemma4_12b","model":"gemma-4-12B-it","paramsB":12,"activeParamsB":null,"hardwareTemplate":"RTX 5090","hardware":"RTX 5090","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b741 (1fd6dfe)","quantKey":"int8","quantization":"UD-Q8_K_XL","contextLength":8192,"promptTokens":82,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":87.2,"prefillTokS":965,"ttftMs":84.97,"peakVramGb":13.7,"reproducibility":7,"verified":false,"createdAt":"2026-06-14T16:09:56.021Z","command":"llama-server -m gemma-4-12b-it-UD-Q8_K_XL.gguf --alias gemma-4-12b-q8 -ngl 999 -fa on -c 8192 -ctk q8_0 -ctv q8_0 -np 1 --temp 0 --host 127.0.0.1 --port 8080","source":"https://www.localmaxxing.com/en/leaderboard?hfId=google%2Fgemma-4-12B-it"},{"id":"cmrvxubyz09r0lg01tk6weu2m","hfId":"deepreinforce-ai/Ornith-1.0-35B","presetKey":"ornith_1_35b_a3b","model":"Ornith-1.0-35B","paramsB":null,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B70","hardware":"Intel Arc Pro B70","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10053+PR25690","quantKey":"q5","quantization":"Q5_K_M","contextLength":32768,"promptTokens":4096,"outputTokens":128,"kvCacheDtype":"q8_0","backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":0,"batchSize":1,"observedTokS":78.695671,"prefillTokS":1589.767314,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-22T10:27:07.163Z","command":"llama-bench -m ornith-1.0-35b-Q5_K_M.gguf -ngl 99 -dev SYCL0 -p 512,4096,8192,32768 -n 128 -r 5 -o json -b 8192 -ub 4096 -mmp 0 -t 8 --flash-attn on -d 0 -ctk q8_0 -ctv q4_1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-35B"},{"id":"cmpynmmgs003fo601rhou4z6x","hfId":"unsloth/gemma-4-12b-it-GGUF","presetKey":"gemma4_12b","model":"gemma-4-12b-it-GGUF","paramsB":12,"activeParamsB":null,"hardwareTemplate":"RTX 3090","hardware":"RTX 3090","deviceCount":2,"memoryGB":48,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b1-8ad8aef","quantKey":"int8","quantization":"Q8_K_XL","contextLength":131072,"promptTokens":1000,"outputTokens":284,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":52.97,"prefillTokS":2862.27,"ttftMs":349.4,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-06-03T22:45:05.212Z","command":"llama-server -m gemma-4-12b-it-UD-Q8_K_XL.gguf -ngl 999 -fa1 -c 0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2Fgemma-4-12b-it-GGUF"},{"id":"cmsyor4ry0d4ems01su66yl6z","hfId":"unsloth/Qwen3-30B-A3B-Thinking-2507-GGUF","presetKey":"qwen3_30b_a3b","model":"Qwen3-30B-A3B-Thinking-2507-GGUF","paramsB":31,"activeParamsB":3,"hardwareTemplate":"RTX 3060","hardware":"RTX 3060","deviceCount":2,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10443","quantKey":"q4","quantization":"Q4_K_M","contextLength":65536,"promptTokens":0,"outputTokens":0,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":94.29,"prefillTokS":1073.4,"ttftMs":null,"peakVramGb":20.1,"reproducibility":6,"verified":false,"createdAt":"2026-08-18T13:15:42.190Z","command":"llama-server -m Qwen3-30B-A3B-Thinking-2507-Q4_K_M.gguf -ngl 99 -sm layer -fa on -ctk q4_0 -ctv q4_0 -c 65536 -n 8192 --reasoning on --jinja","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3-30B-A3B-Thinking-2507-GGUF"},{"id":"cmqyk38gy023apk01k16p11kg","hfId":"nvidia/Gemma-4-31B-IT-NVFP4","presetKey":"gemma4_31b","model":"Gemma-4-31B-IT-NVFP4","paramsB":33,"activeParamsB":null,"hardwareTemplate":"RTX PRO 6000 Blackwell","hardware":"RTX PRO 6000 Blackwell","deviceCount":1,"memoryGB":71.7,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.8.4","quantKey":"q4","quantization":"NVFP4","contextLength":131072,"promptTokens":34,"outputTokens":256,"kvCacheDtype":"fp8","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":31.7,"prefillTokS":830.9,"ttftMs":40.92,"peakVramGb":67.8,"reproducibility":6,"verified":false,"createdAt":"2026-06-29T01:45:44.099Z","command":"vllm serve --model nvidia/Gemma-4-31B-IT-NVFP4 --quantization modelopt --max-model-len 131072 --gpu-memory-utilization 0.90 --served-model-name gemma4-31b --enable-auto-tool-choice --tool-call-parser gemma4 --reasoning-parser gemma4 --kv-cache-dtype fp8","source":"https://www.localmaxxing.com/en/leaderboard?hfId=nvidia%2FGemma-4-31B-IT-NVFP4"},{"id":"cms7rjhue0079pf0112136h51","hfId":"meta-llama/Llama-3.2-3B-Instruct","presetKey":"llama3.2_3b","model":"Llama-3.2-3B-Instruct","paramsB":3,"activeParamsB":null,"hardwareTemplate":"RX 6700 XT","hardware":"RX 6700 XT","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"e1a1abb","quantKey":"bfloat16","quantization":"BF16","contextLength":4736,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"rocm","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":4096,"batchSize":1,"observedTokS":43.58,"prefillTokS":598.2,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-30T17:03:57.974Z","command":"llama-bench -m <model> -p 512 -n 128 -d 4096 (HSA_OVERRIDE_GFX_VERSION=10.3.0)","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-llama%2FLlama-3.2-3B-Instruct"},{"id":"cmriq98zf020wmj01cxujrtqn","hfId":"google/gemma-3-1b-it","presetKey":"gemma3_1b","model":"gemma-3-1b-it","paramsB":1,"activeParamsB":null,"hardwareTemplate":"AMD Radeon 780M (Ryzen 7840HS / 8745H)","hardware":"AMD Ryzen 7 7840HS","deviceCount":1,"memoryGB":null,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"commit 6b4dc21","quantKey":"q4","quantization":"Q4_K_M","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":61.256258,"prefillTokS":481.063833,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-13T04:33:45.915Z","command":"llama-bench -m gemma-3-1b-it-Q4_K_M.gguf -t 8 -p 512 -n 128 -r 2 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=google%2Fgemma-3-1b-it"},{"id":"cms3l6yzg0188s201957oq56f","hfId":"Qwen/Qwen3-0.6B","presetKey":"qwen3_0.6b","model":"Qwen3-0.6B","paramsB":1,"activeParamsB":null,"hardwareTemplate":"RTX 3060 Ti","hardware":"RTX 3060 Ti","deviceCount":1,"memoryGB":8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":98304,"promptTokens":98304,"outputTokens":128,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":39.36,"prefillTokS":2150.18,"ttftMs":1,"peakVramGb":5.16,"reproducibility":5,"verified":false,"createdAt":"2026-07-27T18:55:11.260Z","command":"llama-bench -m -p 98304 -n 128 -ngl 28 -sm layer -fa on -ctk q4_0 -ctv q4_0 -r 5","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-0.6B"},{"id":"cmpsgtmtq008rmq013fj38mgm","hfId":"LiquidAI/LFM2.5-8B-A1B","presetKey":"lfm2.5_8b_a1b","model":"LFM2.5-8B-A1B","paramsB":8,"activeParamsB":null,"hardwareTemplate":"Mac M5 Pro (64)","hardware":"M5 Pro","deviceCount":1,"memoryGB":48,"runtimeKey":"mlx","engine":"mlx","engineVersion":"","quantKey":"q4","quantization":"INT4","contextLength":2048,"promptTokens":24,"outputTokens":512,"kvCacheDtype":null,"backend":"metal","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":189.3,"prefillTokS":179.6,"ttftMs":133.6,"peakVramGb":4.82,"reproducibility":6,"verified":false,"createdAt":"2026-05-30T14:47:57.902Z","command":"mlx_lm.generate -m LiquidAI/LFM2.5-8B-A1B-MLX-4bit --max-tokens 512 --temp 0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2.5-8B-A1B"},{"id":"cmqz9ohf602cloe01jy203dsa","hfId":"Qwen/Qwen3.5-9B","presetKey":"qwen3.5_9b","model":"Qwen3.5-9B","paramsB":9,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B60","hardware":"Intel Arc Pro B60","deviceCount":2,"memoryGB":48,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"int8","quantization":"Q8_0","contextLength":4096,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":33.14,"prefillTokS":1364.31,"ttftMs":375.3,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T13:42:05.875Z","command":"/home/maxious/llama-master/build-vulkan/bin/llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/Qwopus3.5-9B-Coder-MTP-Q8_0.gguf -p 512 -n 128 -fa 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.5-9B"},{"id":"cmsqzpsqq00y1mr016r55823a","hfId":"deepreinforce-ai/Ornith-1.0-35B","presetKey":"ornith_1_35b_a3b","model":"Ornith-1.0-35B","paramsB":null,"activeParamsB":null,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10352-baf0025de+umafix","quantKey":"q4","quantization":"Q4_K_XL","contextLength":8192,"promptTokens":1185,"outputTokens":512,"kvCacheDtype":"fp16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":60.5,"prefillTokS":1221.6,"ttftMs":970.04,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-08-13T04:00:26.306Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model Ornith-1.0-35B-UD-Q4_K_XL.gguf -ngl 999 -c 8192 -fa on --no-mmap -np 1 -b 2048 -ub 1024 --temp 0 --no-cache-prompt","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-35B"},{"id":"cmqvps58102w5qr0179eorswk","hfId":"Qwen/Qwen3-Coder-30B-A3B-Instruct","presetKey":"qwen3_30b_a3b","model":"Qwen3-Coder-30B-A3B-Instruct","paramsB":31,"activeParamsB":3,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":3,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9626-2-g038121ab1","quantKey":"int8","quantization":"Q8_0","contextLength":685,"promptTokens":530,"outputTokens":155,"kvCacheDtype":"q8_0","backend":"rocm","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":75.92,"prefillTokS":2766.503,"ttftMs":191.58,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-06-27T02:01:45.841Z","command":"/home/mikekey/Experiments/llama.cpp/build-vulkan/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --prio 3 -m /home/mikekey/models/gguf/qwen/Qwen3-Coder-30B-A3B-Instruct-Q8_0.gguf --temp 0.7 --top-p 0.8 --top-k 20 --min-p 0.0 --repeat-penalty 1.05 -ctk q8_0 -ctv q8_0 -ts 1/1/1 -c 262144","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-Coder-30B-A3B-Instruct"},{"id":"cmsr3qabo00zsmr01kdgxxn8c","hfId":"unsloth/GLM-4.7-Flash-GGUF","presetKey":"glm4.7_flash","model":"GLM-4.7-Flash-GGUF","paramsB":null,"activeParamsB":null,"hardwareTemplate":"RTX 5090","hardware":"RTX 5090","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"10085 (b4aa7dd47)","quantKey":"q5","quantization":"Q5_K_M","contextLength":131072,"promptTokens":127176,"outputTokens":1536,"kvCacheDtype":"fp16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":63.4684517168712,"prefillTokS":5254.989463245321,"ttftMs":null,"peakVramGb":27.447265625,"reproducibility":6,"verified":false,"createdAt":"2026-08-13T05:52:47.556Z","command":"llama-server --model /path/to/GLM-4.7-Flash-Q5_K_M.gguf --alias glm-4.7-flash-q5km --host 127.0.0.1 --port 8099 -ngl 99 -np 24 -c 131072 -n 64 -fa on --jinja --reasoning off","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FGLM-4.7-Flash-GGUF"},{"id":"cmrnbufoa003olg01egqdwy36","hfId":"google/gemma-4-31B-it","presetKey":"gemma4_31b","model":"gemma-4-31B-it","paramsB":33,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B70","hardware":"Intel Arc Pro B70","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9853 SYCL","quantKey":"q4","quantization":"Q4_K_M","contextLength":131072,"promptTokens":0,"outputTokens":0,"kvCacheDtype":"q8_0/q4_1","backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":16.38,"prefillTokS":332.89,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-16T09:49:11.002Z","command":"llama-server -m gemma-4-31B-it-Q4_K_M.gguf -fa on -ctk q8_0 -ctv q4_1 -c 131072 -b 8192 -ub 4096","source":"https://www.localmaxxing.com/en/leaderboard?hfId=google%2Fgemma-4-31B-it"},{"id":"cmowtjezk00dho201za7d1kcx","hfId":"Qwen/Qwen3.5-122B-A10B-FP8","presetKey":"qwen3.5_122b_a10b","model":"Qwen3.5-122B-A10B-FP8","paramsB":125,"activeParamsB":null,"hardwareTemplate":"RTX 3090","hardware":"RTX 3090","deviceCount":8,"memoryGB":192,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.20.2rc1.dev93+g51f22dcfd","quantKey":"fp8","quantization":"FP8","contextLength":8192,"promptTokens":0,"outputTokens":1000,"kvCacheDtype":"auto","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":7.44,"prefillTokS":null,"ttftMs":194,"peakVramGb":170.4,"reproducibility":6,"verified":false,"createdAt":"2026-05-08T11:15:18.560Z","command":"vllm serve Qwen/Qwen3.5-122B-A10B-FP8 --tensor-parallel-size 8 --enable-expert-parallel --dtype float16 --max-model-len 8192 --gpu-memory-utilization 0.88 --enable-prefix-caching --enable-chunked-prefill --enforce-eager --max-num-seqs 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.5-122B-A10B-FP8"},{"id":"cmsyoq3hx0d47ms01vplfthik","hfId":"unsloth/gemma-4-26B-A4B-it-GGUF","presetKey":"gemma4_26b_a4b","model":"gemma-4-26B-A4B-it-GGUF","paramsB":26,"activeParamsB":null,"hardwareTemplate":"RTX 3060","hardware":"RTX 3060","deviceCount":2,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10443","quantKey":"q4","quantization":"UD-Q4_K_M","contextLength":65536,"promptTokens":0,"outputTokens":0,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":62.07,"prefillTokS":794.6,"ttftMs":null,"peakVramGb":18,"reproducibility":6,"verified":false,"createdAt":"2026-08-18T13:14:53.877Z","command":"llama-server -m gemma-4-26B-A4B-it-UD-Q4_K_M.gguf -ngl 99 -sm layer -fa on -ctk q4_0 -ctv q4_0 -c 65536 -n 8192 --reasoning on --jinja","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2Fgemma-4-26B-A4B-it-GGUF"},{"id":"cmowsbhfu00bgo201qmy1waqt","hfId":"HauhauCS/Qwen3.5-122B-A10B-Uncensored-HauhauCS-Aggressive","presetKey":"qwen3.5_122b_a10b","model":"Qwen3.5-122B-A10B-Uncensored-HauhauCS-Aggressive","paramsB":122,"activeParamsB":10,"hardwareTemplate":"RTX PRO 6000 Blackwell","hardware":"RTX PRO 6000 Blackwell","deviceCount":1,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"unknown","quantKey":"q4","quantization":"Q4_K_P","contextLength":65536,"promptTokens":65024,"outputTokens":128,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":79.1972687594015,"prefillTokS":2325.693611110281,"ttftMs":27958.97090200015,"peakVramGb":75.2333984375,"reproducibility":6,"verified":false,"createdAt":"2026-05-08T10:41:08.874Z","command":"CUDA_DEVICE_ORDER=PCI_BUS_ID CUDA_VISIBLE_DEVICES=1 /usr/local/bin/llama-server -m /LINUX/Models/HauhauCS/Qwen3.5-122B-A10B-Uncensored-HauhauCS-Aggressive/Qwen3.5-122B-A10B-Uncensored-HauhauCS-Aggressive-Q4_K_P.gguf --host 127.0.0.1 --port 8001 --ctx-size 65536 --alias qwen35-hauhau-q4kp -ngl 999 --flash-attn on --batch-size 512 --ubatch-size 512 --cache-type-k q8_0 --cache-type-v q8_0 --parallel 1 --jinja","source":"https://www.localmaxxing.com/en/leaderboard?hfId=HauhauCS%2FQwen3.5-122B-A10B-Uncensored-HauhauCS-Aggressive"},{"id":"cms7rjhj70074pf0193kh9fkf","hfId":"meta-llama/Llama-3.2-3B-Instruct","presetKey":"llama3.2_3b","model":"Llama-3.2-3B-Instruct","paramsB":3,"activeParamsB":null,"hardwareTemplate":"RX 6700 XT","hardware":"RX 6700 XT","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"e1a1abb","quantKey":"bfloat16","quantization":"BF16","contextLength":640,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"rocm","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":0,"batchSize":1,"observedTokS":49.59,"prefillTokS":663.18,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-30T17:03:57.572Z","command":"llama-bench -m <model> -p 512 -n 128 -d 0 (HSA_OVERRIDE_GFX_VERSION=10.3.0)","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-llama%2FLlama-3.2-3B-Instruct"},{"id":"cmriq98gr020tmj01u80wkyuo","hfId":"google/gemma-3-1b-it","presetKey":"gemma3_1b","model":"gemma-3-1b-it","paramsB":1,"activeParamsB":null,"hardwareTemplate":"AMD Radeon 780M (Ryzen 7840HS / 8745H)","hardware":"AMD Ryzen 7 7840HS","deviceCount":1,"memoryGB":null,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"commit 6b4dc21","quantKey":"q2","quantization":"Q2_K","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":70.262391,"prefillTokS":481.89598,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-13T04:33:45.243Z","command":"llama-bench -m gemma-3-1b-it-Q2_K.gguf -t 8 -p 512 -n 128 -r 2 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=google%2Fgemma-3-1b-it"},{"id":"cms3l6wiz0185s201gmbav35i","hfId":"Qwen/Qwen3-0.6B","presetKey":"qwen3_0.6b","model":"Qwen3-0.6B","paramsB":1,"activeParamsB":null,"hardwareTemplate":"RTX 3060 Ti","hardware":"RTX 3060 Ti","deviceCount":1,"memoryGB":8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":8192,"outputTokens":128,"kvCacheDtype":"f16","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":208.09,"prefillTokS":12420.96,"ttftMs":1143.7,"peakVramGb":5.16,"reproducibility":5,"verified":false,"createdAt":"2026-07-27T18:55:08.075Z","command":"llama-bench -m -p 8192 -n 128 -ngl 28 -sm layer -fa on -ctk f16 -ctv f16 -r 5","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-0.6B"},{"id":"cmqz9i27502c4oe019xta6dos","hfId":"meta-llama/Llama-3.2-1B-Instruct","presetKey":"llama3.2_1b","model":"Llama-3.2-1B-Instruct","paramsB":1,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B60","hardware":"Intel Arc Pro B60","deviceCount":2,"memoryGB":48,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"int8","quantization":"Q8_0","contextLength":4096,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":183.79,"prefillTokS":7610.7,"ttftMs":67.3,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T13:37:06.209Z","command":"/home/maxious/llama-master/build-vulkan/bin/llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/Llama-3.2-1B.Q8_0.gguf -p 512 -n 128 -fa 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-llama%2FLlama-3.2-1B-Instruct"},{"id":"cmsqafauz00lhmr014m6nwpvj","hfId":"samuelcardillo/Qwopus-MoE-35B-A3B-GGUF","presetKey":"qwen3.5_35b_a3b","model":"Qwopus-MoE-35B-A3B-GGUF","paramsB":35,"activeParamsB":3,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10347-e6f10a799","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":1185,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":74.5,"prefillTokS":1250.6,"ttftMs":947.58,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-08-12T16:12:26.171Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model Qwopus-MoE-35B-A3B-Q4_K_M.gguf -ngl 999 -c 8192 -fa on --no-mmap -np 1 -b 2048 -ub 1024 --temp 0 --no-cache-prompt --ctx-checkpoints 0 -ctk q8_0 -ctv q8_0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=samuelcardillo%2FQwopus-MoE-35B-A3B-GGUF"},{"id":"cmqvpqzmh02w0qr01ft1meqp0","hfId":"Qwen/Qwen3-Coder-30B-A3B-Instruct","presetKey":"qwen3_30b_a3b","model":"Qwen3-Coder-30B-A3B-Instruct","paramsB":31,"activeParamsB":3,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":3,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9626-2-g038121ab1","quantKey":"int8","quantization":"Q8_0","contextLength":686,"promptTokens":530,"outputTokens":156,"kvCacheDtype":"q8_0","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":82.026,"prefillTokS":2454.732,"ttftMs":215.91,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-06-27T02:00:51.930Z","command":"/home/mikekey/Experiments/llama.cpp/build-vulkan/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --prio 3 -m /home/mikekey/models/gguf/qwen/Qwen3-Coder-30B-A3B-Instruct-Q8_0.gguf --temp 0.7 --top-p 0.8 --top-k 20 --min-p 0.0 --repeat-penalty 1.05 -ctk q8_0 -ctv q8_0 -ts 1/1/1 -c 262144","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-Coder-30B-A3B-Instruct"},{"id":"cmsr3qa2a00zpmr011b4q8x9i","hfId":"unsloth/GLM-4.7-Flash-GGUF","presetKey":"glm4.7_flash","model":"GLM-4.7-Flash-GGUF","paramsB":null,"activeParamsB":null,"hardwareTemplate":"RTX 5090","hardware":"RTX 5090","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"10085 (b4aa7dd47)","quantKey":"q5","quantization":"Q5_K_M","contextLength":65536,"promptTokens":63588,"outputTokens":768,"kvCacheDtype":"fp16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":62.36803638135456,"prefillTokS":5163.878512262466,"ttftMs":null,"peakVramGb":24.037109375,"reproducibility":6,"verified":false,"createdAt":"2026-08-13T05:52:47.219Z","command":"llama-server --model /path/to/GLM-4.7-Flash-Q5_K_M.gguf --alias glm-4.7-flash-q5km --host 127.0.0.1 --port 8098 -ngl 99 -np 12 -c 65536 -n 64 -fa on --jinja --reasoning off","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FGLM-4.7-Flash-GGUF"},{"id":"cmrmnp7h81nntmj01lfenydgj","hfId":"0xSero/DeepSeek-V4-Flash-180B","presetKey":"deepseek_v4_flash_reap_180b","model":"DeepSeek-V4-Flash-180B","paramsB":158,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B70","hardware":"Intel Arc Pro B70","deviceCount":4,"memoryGB":32,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.1.dev1082+g382bbd514.xpu; local vLLM a681dbb2b; XPU kernels 6522849b0; oneCCL 48fda4f0e","quantKey":"fp8","quantization":"FP8","contextLength":1024,"promptTokens":62,"outputTokens":128,"kvCacheDtype":"fp8","backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":43.76667326627197,"prefillTokS":null,"ttftMs":308.684051502496,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-15T22:33:16.317Z","command":"VLLM_XPU_V4_M1_ROUTER_NORM=1 VLLM_XPU_V4_M1_DIRECT_ROUTED_MOE=1 ONECCL_FORCE_PRELOAD=1 B70_ONECCL_SYCL_ALLREDUCE_MAX_BYTES=131072 ONECCL_LIB_DIR=/mnt/fast-ai/runtime/oneccl-2021.17.2-b70-wideepoch-48fda4f/lib COMPILATION_CONFIG='{\"cudagraph_mode\":\"PIECEWISE\"}' experiments/deepseek-v4-flash-reap-xpu-b70/scripts/serve-k160-tp4-smoke.sh","source":"https://www.localmaxxing.com/en/leaderboard?hfId=0xSero%2FDeepSeek-V4-Flash-180B"},{"id":"cmowthjrn00ddo201655dmytj","hfId":"Qwen/Qwen3.5-122B-A10B-GPTQ-Int4","presetKey":"qwen3.5_122b_a10b","model":"Qwen3.5-122B-A10B-GPTQ-Int4","paramsB":125,"activeParamsB":10,"hardwareTemplate":"RTX 3090","hardware":"RTX 3090","deviceCount":8,"memoryGB":192,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.20.2rc1.dev93+g51f22dcfd","quantKey":"q4","quantization":"GPTQ Int4","contextLength":8192,"promptTokens":0,"outputTokens":1000,"kvCacheDtype":"auto","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":49.08,"prefillTokS":null,"ttftMs":177,"peakVramGb":170.4,"reproducibility":6,"verified":false,"createdAt":"2026-05-08T11:13:51.443Z","command":"vllm serve Qwen/Qwen3.5-122B-A10B-GPTQ-Int4 --tensor-parallel-size 8 --enable-expert-parallel --dtype float16 --max-model-len 8192 --gpu-memory-utilization 0.90 --enable-prefix-caching --enable-chunked-prefill --max-num-seqs 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.5-122B-A10B-GPTQ-Int4"},{"id":"cmsyi0tmz0cznms01wqv3la16","hfId":"unsloth/Muse-Glimmer-30B-GGUF","presetKey":"muse_glimmer_30b","model":"Muse-Glimmer-30B-GGUF","paramsB":30,"activeParamsB":null,"hardwareTemplate":"RTX 3060","hardware":"RTX 3060","deviceCount":2,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10443","quantKey":"q4","quantization":"UD-Q4_K_XL","contextLength":65536,"promptTokens":0,"outputTokens":0,"kvCacheDtype":"q4_0","backend":null,"splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":19.6,"prefillTokS":920.8,"ttftMs":1200,"peakVramGb":15.8,"reproducibility":6,"verified":false,"createdAt":"2026-08-18T10:07:17.004Z","command":"llama-server --model Muse-Glimmer-30B-UD-Q4_K_XL.gguf -ngl 99 -sm layer -fa on -ctk q4_0 -ctv q4_0 -c 65536 -n 8192 --reasoning on --jinja","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FMuse-Glimmer-30B-GGUF"},{"id":"cmows9org00b7o201bx92fk1a","hfId":"HauhauCS/Qwen3.5-122B-A10B-Uncensored-HauhauCS-Aggressive","presetKey":"qwen3.5_122b_a10b","model":"Qwen3.5-122B-A10B-Uncensored-HauhauCS-Aggressive","paramsB":122,"activeParamsB":10,"hardwareTemplate":"RTX PRO 6000 Blackwell","hardware":"RTX PRO 6000 Blackwell","deviceCount":1,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"unknown","quantKey":"q4","quantization":"Q4_K_P","contextLength":32768,"promptTokens":32256,"outputTokens":128,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":94.60077090037038,"prefillTokS":2526.915081980196,"ttftMs":12764.97189399925,"peakVramGb":74.7724609375,"reproducibility":6,"verified":false,"createdAt":"2026-05-08T10:39:45.053Z","command":"CUDA_DEVICE_ORDER=PCI_BUS_ID CUDA_VISIBLE_DEVICES=1 /usr/local/bin/llama-server -m /LINUX/Models/HauhauCS/Qwen3.5-122B-A10B-Uncensored-HauhauCS-Aggressive/Qwen3.5-122B-A10B-Uncensored-HauhauCS-Aggressive-Q4_K_P.gguf --host 127.0.0.1 --port 8001 --ctx-size 32768 --alias qwen35-hauhau-q4kp -ngl 999 --flash-attn on --batch-size 512 --ubatch-size 512 --cache-type-k q8_0 --cache-type-v q8_0 --parallel 1 --jinja","source":"https://www.localmaxxing.com/en/leaderboard?hfId=HauhauCS%2FQwen3.5-122B-A10B-Uncensored-HauhauCS-Aggressive"},{"id":"cms7rjh84006zpf019f00niwo","hfId":"meta-llama/Llama-3.2-3B-Instruct","presetKey":"llama3.2_3b","model":"Llama-3.2-3B-Instruct","paramsB":3,"activeParamsB":null,"hardwareTemplate":"RX 6700 XT","hardware":"RX 6700 XT","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"e1a1abb","quantKey":"bfloat16","quantization":"BF16","contextLength":4736,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":4096,"batchSize":1,"observedTokS":47.06,"prefillTokS":790.97,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-30T17:03:57.173Z","command":"llama-bench -m <model> -p 512 -n 128 -d 4096","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-llama%2FLlama-3.2-3B-Instruct"},{"id":"cmrip1elo0202mj01l4c46e92","hfId":"Qwen/Qwen3-0.6B","presetKey":"qwen3_0.6b","model":"Qwen3-0.6B","paramsB":1,"activeParamsB":null,"hardwareTemplate":"AMD Radeon 780M (Ryzen 7840HS / 8745H)","hardware":"AMD Ryzen 7 7840HS","deviceCount":1,"memoryGB":null,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"commit 6b4dc21","quantKey":"q4","quantization":"Q4_K_M","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":121.08196,"prefillTokS":854.43173,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-13T03:59:40.332Z","command":"llama-bench -m Qwen3-0.6B-Q4_K_M.gguf -t 8 -p 512 -n 128 -r 2 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-0.6B"},{"id":"cms3l6uk30182s20183881w3s","hfId":"Qwen/Qwen3-0.6B","presetKey":"qwen3_0.6b","model":"Qwen3-0.6B","paramsB":1,"activeParamsB":null,"hardwareTemplate":"RTX 3060 Ti","hardware":"RTX 3060 Ti","deviceCount":1,"memoryGB":8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":65536,"promptTokens":65536,"outputTokens":128,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":55.53,"prefillTokS":3044.74,"ttftMs":1,"peakVramGb":5.16,"reproducibility":5,"verified":false,"createdAt":"2026-07-27T18:55:05.523Z","command":"llama-bench -m -p 65536 -n 128 -ngl 28 -sm layer -fa on -ctk q4_0 -ctv q4_0 -r 5","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-0.6B"},{"id":"cmqz9cwcc02bioe01j2odfron","hfId":"meta-llama/Meta-Llama-3-8B-Instruct","presetKey":"llama3_8b","model":"Meta-Llama-3-8B-Instruct","paramsB":8,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B60","hardware":"Intel Arc Pro B60","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_0","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":32768,"batchSize":1,"observedTokS":36.075545,"prefillTokS":97.257158,"ttftMs":5264.4,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T13:33:05.341Z","command":"llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/Meta-Llama-3-8B-Instruct-Q4_0.gguf -p 512 -n 128 -d 32768 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-llama%2FMeta-Llama-3-8B-Instruct"},{"id":"cmsqacq4i00lemr01lirb6h9q","hfId":"samuelcardillo/Qwopus-MoE-35B-A3B-GGUF","presetKey":"qwen3.5_35b_a3b","model":"Qwopus-MoE-35B-A3B-GGUF","paramsB":35,"activeParamsB":3,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10347-e6f10a799","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":1185,"outputTokens":512,"kvCacheDtype":"fp16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":74.3,"prefillTokS":1259.5,"ttftMs":940.81,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-08-12T16:10:25.986Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model Qwopus-MoE-35B-A3B-Q4_K_M.gguf -ngl 999 -c 8192 -fa on --no-mmap -np 1 -b 2048 -ub 1024 --temp 0 --no-cache-prompt --ctx-checkpoints 0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=samuelcardillo%2FQwopus-MoE-35B-A3B-GGUF"},{"id":"cmqvmv2ph02s3qr01dhsf0zl9","hfId":"deepreinforce-ai/Ornith-1.0-9B","presetKey":"ornith_1_9b","model":"Ornith-1.0-9B","paramsB":null,"activeParamsB":null,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":3,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9626-2-g038121ab1","quantKey":"bfloat16","quantization":"BF16","contextLength":787,"promptTokens":531,"outputTokens":256,"kvCacheDtype":"q8_0","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":25.757,"prefillTokS":1373.288,"ttftMs":386.66,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-06-27T00:40:03.702Z","command":"/home/mikekey/Experiments/llama.cpp/build-vulkan/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --prio 3 -m /home/mikekey/models/gguf/misc/ornith-1.0-9b-bf16.gguf --reasoning-format auto --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 --repeat-penalty 1.0 -ctk q8_0 -ctv q8_0 -ts 1/1/1 -c 262144 --chat-template-kwargs '{\"preserve_thinking\": true}'","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-9B"},{"id":"cmsr3q9h300zmmr01y3h5eyyu","hfId":"unsloth/GLM-4.7-Flash-GGUF","presetKey":"glm4.7_flash","model":"GLM-4.7-Flash-GGUF","paramsB":null,"activeParamsB":null,"hardwareTemplate":"RTX 5090","hardware":"RTX 5090","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"10085 (b4aa7dd47)","quantKey":"q5","quantization":"Q5_K_M","contextLength":65536,"promptTokens":5719,"outputTokens":4439,"kvCacheDtype":"fp16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":219.1954633847959,"prefillTokS":3846.654766809472,"ttftMs":null,"peakVramGb":23.990234375,"reproducibility":6,"verified":false,"createdAt":"2026-08-13T05:52:46.455Z","command":"llama-server --model /path/to/GLM-4.7-Flash-Q5_K_M.gguf --alias glm-4.7-flash-q5km --host 127.0.0.1 --port 8097 -ngl 99 -c 65536 -n 8192 --reasoning off --jinja","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FGLM-4.7-Flash-GGUF"},{"id":"cmrmjd3io1nn1mj013stqoe4b","hfId":"0xSero/DeepSeek-V4-Flash-180B","presetKey":"deepseek_v4_flash_reap_180b","model":"DeepSeek-V4-Flash-180B","paramsB":158,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B70","hardware":"Intel Arc Pro B70","deviceCount":4,"memoryGB":32,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.1.dev1082+g382bbd514.xpu; local vLLM a66f3486c; XPU kernels 2a07cf2e8; oneCCL 6da44bcb5","quantKey":"fp8","quantization":"FP8","contextLength":1024,"promptTokens":62,"outputTokens":128,"kvCacheDtype":"fp8","backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":41.73325598932311,"prefillTokS":null,"ttftMs":307.7580259960087,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-15T20:31:52.848Z","command":"VLLM_XPU_V4_M1_BIASED_TOPK=1 ONECCL_FORCE_PRELOAD=1 B70_ONECCL_SYCL_ALLREDUCE_MAX_BYTES=131072 ONECCL_LIB_DIR=/mnt/fast-ai/runtime/oneccl-2021.17.2-b70-sizegate/lib GPU_MEMORY_UTILIZATION=0.94 COMPILATION_CONFIG='{\"cudagraph_mode\":\"PIECEWISE\"}' VLLM_EXTRA_ARGS='--enable-prompt-tokens-details' experiments/deepseek-v4-flash-reap-xpu-b70/scripts/serve-k160-tp4-smoke.sh","source":"https://www.localmaxxing.com/en/leaderboard?hfId=0xSero%2FDeepSeek-V4-Flash-180B"},{"id":"cmowla4rq004io201otfp0rdo","hfId":"bartowski/moonshotai_Kimi-K2.5-GGUF","presetKey":"kimi_k2.5","model":"moonshotai_Kimi-K2.5-GGUF","paramsB":null,"activeParamsB":null,"hardwareTemplate":"RTX 3090","hardware":"RTX 3090","deviceCount":8,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"8178 (3e6ab244a)","quantKey":"q2","quantization":"IQ1_S","contextLength":4096,"promptTokens":155,"outputTokens":512,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":5.54,"prefillTokS":null,"ttftMs":142,"peakVramGb":155.9,"reproducibility":6,"verified":false,"createdAt":"2026-05-08T07:24:08.487Z","command":"CUDA_VISIBLE_DEVICES=2,3,4,5,6,7,8,9 llama-server -m /data/models/kimi-k25-gguf/bartowski-moonshotai-kimi-k25-iq1s/moonshotai_Kimi-K2.5-IQ1_S-00001-of-00006.gguf -c 4096 -b 512 -ub 128 -ngl 48 --split-mode layer --tensor-split 1,1,1,1,1,1,1,1 -fa -ctk q4_0 -ctv q4_0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=bartowski%2Fmoonshotai_Kimi-K2.5-GGUF"},{"id":"cmrz3fzd0064fo401ez1cro4z","hfId":"Qwen/Qwen3-1.7B","presetKey":"qwen3_1.7b","model":"Qwen3-1.7B","paramsB":2,"activeParamsB":null,"hardwareTemplate":"RTX 3060","hardware":"RTX 3060","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9775 / 7529fdaaf","quantKey":"int8","quantization":"Q8_0","contextLength":4608,"promptTokens":4096,"outputTokens":512,"kvCacheDtype":"f16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":147.688289,"prefillTokS":7568.056027,"ttftMs":547.993226470444,"peakVramGb":3.9541015625,"reproducibility":6,"verified":false,"createdAt":"2026-07-24T15:27:13.860Z","command":"/home/dario/llama.cpp/build/bin/llama-bench -m /mnt/hdd/lmstudio_models/tiny-throughput-bench/gguf/qwen3-1.7b/Qwen3-1.7B-Q8_0.gguf -p 4096 -n 512 -b 4096 -ub 1024 -t 16 -ngl 99 -fa on -r 2 -o json --no-warmup","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-1.7B"},{"id":"cmsoxtuma00ftmp01axh5avuw","hfId":"nvidia/Llama-3.1-8B-Instruct-FP8","presetKey":"llama3_8b","model":"Llama-3.1-8B-Instruct-FP8","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RTX PRO 6000 Blackwell","hardware":"RTX PRO 6000 Blackwell","deviceCount":1,"memoryGB":96,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.26.0","quantKey":"fp8","quantization":"FP8","contextLength":32768,"promptTokens":534,"outputTokens":512,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":158.07,"prefillTokS":null,"ttftMs":null,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-08-11T17:32:03.779Z","command":"vllm serve nvidia/Llama-3.1-8B-Instruct-FP8 \\\n --host 127.0.0.1 --port 8000 \\\n --served-model-name nvidia/Llama-3.1-8B-Instruct-FP8 \\\n --trust-remote-code --generation-config vllm \\\n --max-model-len 32768 --gpu-memory-utilization 0.90 \\\n --max-num-batched-tokens 8192 --max-num-seqs 4","source":"https://www.localmaxxing.com/en/leaderboard?hfId=nvidia%2FLlama-3.1-8B-Instruct-FP8"},{"id":"cmrip18mf01zzmj017yt1klxk","hfId":"Qwen/Qwen3-0.6B","presetKey":"qwen3_0.6b","model":"Qwen3-0.6B","paramsB":1,"activeParamsB":null,"hardwareTemplate":"AMD Radeon 780M (Ryzen 7840HS / 8745H)","hardware":"AMD Ryzen 7 7840HS","deviceCount":1,"memoryGB":null,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"commit 6b4dc21","quantKey":"q2","quantization":"Q2_K","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":152.450441,"prefillTokS":536.435086,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-13T03:59:32.584Z","command":"llama-bench -m Qwen3-0.6B-Q2_K.gguf -t 8 -p 512 -n 128 -r 2 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-0.6B"},{"id":"cms3l6etk017hs201vk6yvja6","hfId":"lmstudio-community/OpenReasoning-Nemotron-7B-GGUF","presetKey":"qwen2.5_7b","model":"OpenReasoning-Nemotron-7B-GGUF","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RTX 3060 Ti","hardware":"RTX 3060 Ti","deviceCount":1,"memoryGB":8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":98304,"promptTokens":98304,"outputTokens":128,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":19.13,"prefillTokS":996.75,"ttftMs":1,"peakVramGb":6.66,"reproducibility":5,"verified":false,"createdAt":"2026-07-27T18:54:45.128Z","command":"llama-bench -m -p 98304 -n 128 -ngl 28 -sm layer -fa on -ctk q4_0 -ctv q4_0 -r 5","source":"https://www.localmaxxing.com/en/leaderboard?hfId=lmstudio-community%2FOpenReasoning-Nemotron-7B-GGUF"},{"id":"cmqz9bmvd02baoe01dpyirfum","hfId":"meta-llama/Meta-Llama-3-8B-Instruct","presetKey":"llama3_8b","model":"Meta-Llama-3-8B-Instruct","paramsB":8,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B60","hardware":"Intel Arc Pro B60","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_0","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":8192,"batchSize":1,"observedTokS":55.91331,"prefillTokS":365.396468,"ttftMs":1401.2,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T13:32:06.410Z","command":"llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/Meta-Llama-3-8B-Instruct-Q4_0.gguf -p 512 -n 128 -d 8192 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-llama%2FMeta-Llama-3-8B-Instruct"},{"id":"cmsqa7k6300l4mr01acmy35rl","hfId":"deepreinforce-ai/Ornith-1.0-35B-GGUF","presetKey":"ornith_1_35b_a3b","model":"Ornith-1.0-35B-GGUF","paramsB":35,"activeParamsB":null,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10347-e6f10a799","quantKey":"q4","quantization":"Q4_K_XL","contextLength":8192,"promptTokens":1185,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":60.5,"prefillTokS":1267.4,"ttftMs":935.01,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-08-12T16:06:24.987Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model Ornith-1.0-35B-UD-Q4_K_XL.gguf -ngl 999 -c 8192 -fa on --no-mmap -np 1 -b 2048 -ub 1024 --temp 0 --no-cache-prompt --ctx-checkpoints 0 -ctk q8_0 -ctv q8_0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-35B-GGUF"},{"id":"cmqvmue0e02ryqr01eaxts1d6","hfId":"deepreinforce-ai/Ornith-1.0-9B","presetKey":"ornith_1_9b","model":"Ornith-1.0-9B","paramsB":null,"activeParamsB":null,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":3,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9626-2-g038121ab1","quantKey":"bfloat16","quantization":"BF16","contextLength":787,"promptTokens":531,"outputTokens":256,"kvCacheDtype":"q8_0","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":25.702,"prefillTokS":1415.092,"ttftMs":375.24,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-06-27T00:39:31.695Z","command":"/home/mikekey/Experiments/llama.cpp/build-vulkan/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --prio 3 -m /home/mikekey/models/gguf/misc/ornith-1.0-9b-bf16.gguf --reasoning-format auto --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 --repeat-penalty 1.0 -ctk q8_0 -ctv q8_0 -ts 1/1/1 -c 262144 --chat-template-kwargs '{\"preserve_thinking\": true}'","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-9B"},{"id":"cmsnf2nue00blo001wfvsb35t","hfId":"Preyazz/Muse-Glimmer-30B-NVFP4","presetKey":"muse_glimmer_30b","model":"Muse-Glimmer-30B-NVFP4","paramsB":30,"activeParamsB":null,"hardwareTemplate":"RTX 5090","hardware":"RTX 5090","deviceCount":1,"memoryGB":32,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.1.dev1+g075d645af","quantKey":"q4","quantization":"NVFP4","contextLength":8192,"promptTokens":76,"outputTokens":256,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":63.3,"prefillTokS":3031.888103896833,"ttftMs":20.2444180031307,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-08-10T15:59:16.022Z","command":"cd {PROJECT_ROOT} && source .venv-vllm/bin/activate && MAX_JOBS=4 NVCC_THREADS=2 TORCH_CUDA_ARCH_LIST=12.0a VLLM_USE_DEEP_GEMM=0 HF_HOME={PROJECT_ROOT}/.cache/huggingface XDG_CACHE_HOME={PROJECT_ROOT}/.cache vllm serve {PROJECT_ROOT}/models/preyazz-muse-glimmer-30b-nvfp4 --served-model-name muse-glimmer --host 127.0.0.1 --port 8000 --tensor-parallel-size 1 --gpu-memory-utilization 0.88 --max-model-len 8192 --max-num-seqs 8 --max-num-batched-tokens 8192 --limit-mm-per-prompt '{\"image\":1,\"video\":0}' --enable-auto-tool-choice --tool-call-parser muse_glimmer --reasoning-parser muse_glimmer --generation-config auto","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Preyazz%2FMuse-Glimmer-30B-NVFP4"},{"id":"cmrm601ig1hsmmj017npoivfd","hfId":"0xSero/DeepSeek-V4-Flash-180B","presetKey":"deepseek_v4_flash_reap_180b","model":"DeepSeek-V4-Flash-180B","paramsB":158,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B70","hardware":"Intel Arc Pro B70","deviceCount":4,"memoryGB":32,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.1.dev1082+g382bbd514.xpu; local vLLM 3a74a38a3; XPU kernels ef307a8f4","quantKey":"fp8","quantization":"FP8","contextLength":1024,"promptTokens":62,"outputTokens":128,"kvCacheDtype":"fp8","backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":40.13572390518797,"prefillTokS":null,"ttftMs":156.9011259998661,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-15T14:17:48.712Z","command":"/home/steve/.venvs/deepseek-v4-xpu/bin/vllm serve /mnt/fast-ai/llm-models/deepseek-v4-flash-xpu/current-k160 --host 127.0.0.1 --port 18080 --served-model-name deepseek-v4-flash-k160 --dtype auto --tensor-parallel-size 4 --data-parallel-size 1 --data-parallel-size-local 1 --pipeline-parallel-size 1 --distributed-executor-backend mp --enable-expert-parallel --all2all-backend allgather_reducescatter --max-model-len 1024 --max-num-batched-tokens 1024 --max-num-seqs 1 --gpu-memory-utilization 0.95 --kv-cache-dtype fp8 --block-size 256 --tokenizer-mode deepseek_v4 --reasoning-parser deepseek_v4 --tool-call-parser deepseek_v4 --enable-auto-tool-choice --no-enable-prefix-caching --generation-config vllm --enable-prompt-tokens-details","source":"https://www.localmaxxing.com/en/leaderboard?hfId=0xSero%2FDeepSeek-V4-Flash-180B"},{"id":"cmowl8p9b004do201mjwd3lht","hfId":"bartowski/zai-org_GLM-5.1-GGUF","presetKey":"glm5_1","model":"zai-org_GLM-5.1-GGUF","paramsB":null,"activeParamsB":null,"hardwareTemplate":"RTX 3090","hardware":"RTX 3090","deviceCount":8,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"8178 (3e6ab244a)","quantKey":"q2","quantization":"IQ1_S","contextLength":8192,"promptTokens":155,"outputTokens":1000,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":26.13,"prefillTokS":null,"ttftMs":74,"peakVramGb":148.4,"reproducibility":6,"verified":false,"createdAt":"2026-05-08T07:23:01.728Z","command":"CUDA_VISIBLE_DEVICES=2,3,4,5,6,7,8,9 llama-server -m /data/models/glm51-gguf/bartowski-zai-org-glm51-iq1s/zai-org_GLM-5.1-IQ1_S-00001-of-00004.gguf -c 8192 -ngl 999 --split-mode layer --tensor-split 1,1,1,1,1,1,1,1 -fa -ctk q4_0 -ctv q4_0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=bartowski%2Fzai-org_GLM-5.1-GGUF"},{"id":"cmrz3enlm064co4016dvuc0cm","hfId":"Qwen/Qwen3-0.6B","presetKey":"qwen3_0.6b","model":"Qwen3-0.6B","paramsB":1,"activeParamsB":null,"hardwareTemplate":"RTX 3060","hardware":"RTX 3060","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9775 / 7529fdaaf","quantKey":"int8","quantization":"Q8_0","contextLength":4608,"promptTokens":4096,"outputTokens":512,"kvCacheDtype":"f16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":310.390516,"prefillTokS":13631.588349,"ttftMs":303.7003051624325,"peakVramGb":2.8369140625,"reproducibility":6,"verified":false,"createdAt":"2026-07-24T15:26:11.963Z","command":"/home/dario/llama.cpp/build/bin/llama-bench -m /mnt/hdd/lmstudio_models/tiny-throughput-bench/gguf/qwen3-0.6b/Qwen3-0.6B-Q8_0.gguf -p 4096 -n 512 -b 4096 -ub 1024 -t 16 -ngl 99 -fa on -r 2 -o json --no-warmup","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-0.6B"},{"id":"cmsoxttnl00fcmp01r6socqro","hfId":"Qwen/Qwen3-Coder-Next-FP8","presetKey":"qwen3_coder_next","model":"Qwen3-Coder-Next-FP8","paramsB":80,"activeParamsB":null,"hardwareTemplate":"RTX PRO 6000 Blackwell","hardware":"RTX PRO 6000 Blackwell","deviceCount":1,"memoryGB":96,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.26.0","quantKey":"fp8","quantization":"FP8","contextLength":32768,"promptTokens":541,"outputTokens":512,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":174.33,"prefillTokS":null,"ttftMs":null,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-08-11T17:32:02.529Z","command":"vllm serve Qwen/Qwen3-Coder-Next-FP8 \\\n --host 127.0.0.1 --port 8000 \\\n --served-model-name Qwen/Qwen3-Coder-Next-FP8 \\\n --trust-remote-code --generation-config vllm \\\n --max-model-len 32768 --gpu-memory-utilization 0.90 \\\n --max-num-batched-tokens 8192 --max-num-seqs 4","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-Coder-Next-FP8"},{"id":"cmrionvie01zkmj016zd0xs7h","hfId":"LiquidAI/LFM2-350M","presetKey":"lfm2_350m","model":"LFM2-350M","paramsB":null,"activeParamsB":null,"hardwareTemplate":"AMD Radeon 780M (Ryzen 7840HS / 8745H)","hardware":"AMD Ryzen 7 7840HS","deviceCount":1,"memoryGB":null,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"commit 6b4dc21","quantKey":"int8","quantization":"Q8_0","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":142.123964,"prefillTokS":1379.419072,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-13T03:49:09.063Z","command":"llama-bench -m LFM2-350M-Q8_0.gguf -t 8 -p 512 -n 128 -r 2 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2-350M"},{"id":"cms3l69r4017es201e8y6vzzm","hfId":"lmstudio-community/OpenReasoning-Nemotron-7B-GGUF","presetKey":"qwen2.5_7b","model":"OpenReasoning-Nemotron-7B-GGUF","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RTX 3060 Ti","hardware":"RTX 3060 Ti","deviceCount":1,"memoryGB":8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":8192,"outputTokens":128,"kvCacheDtype":"f16","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":73.46,"prefillTokS":2538.6,"ttftMs":4604.4,"peakVramGb":6.66,"reproducibility":5,"verified":false,"createdAt":"2026-07-27T18:54:38.560Z","command":"llama-bench -m -p 8192 -n 128 -ngl 28 -sm layer -fa on -ctk f16 -ctv f16 -r 5","source":"https://www.localmaxxing.com/en/leaderboard?hfId=lmstudio-community%2FOpenReasoning-Nemotron-7B-GGUF"},{"id":"cmqz9acff02b5oe01i2kpmikb","hfId":"meta-llama/Meta-Llama-3-8B-Instruct","presetKey":"llama3_8b","model":"Meta-Llama-3-8B-Instruct","paramsB":8,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B60","hardware":"Intel Arc Pro B60","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_0","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":null,"splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":4096,"batchSize":1,"observedTokS":61.249446,"prefillTokS":584.881546,"ttftMs":875.4,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T13:31:06.219Z","command":"llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/Meta-Llama-3-8B-Instruct-Q4_0.gguf -p 512 -n 128 -d 4096 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-llama%2FMeta-Llama-3-8B-Instruct"},{"id":"cmsq6gbej00jimr01qenjw1f5","hfId":"unsloth/GLM-4.7-Flash-GGUF","presetKey":"glm4.7_flash","model":"GLM-4.7-Flash-GGUF","paramsB":null,"activeParamsB":null,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10347-e6f10a799","quantKey":"q4","quantization":"Q4_K_XL","contextLength":8192,"promptTokens":1172,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":62.6,"prefillTokS":914.6,"ttftMs":1281.37,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-08-12T14:21:15.067Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model GLM-4.7-Flash-UD-Q4_K_XL.gguf -ngl 999 -c 8192 -fa on --no-mmap -np 1 -b 2048 -ub 1024 --temp 0 --no-cache-prompt -ctk q8_0 -ctv q8_0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FGLM-4.7-Flash-GGUF"},{"id":"cmqvmtpcd02rtqr01g2fq2vl1","hfId":"deepreinforce-ai/Ornith-1.0-9B","presetKey":"ornith_1_9b","model":"Ornith-1.0-9B","paramsB":null,"activeParamsB":null,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":3,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9626-2-g038121ab1","quantKey":"bfloat16","quantization":"BF16","contextLength":787,"promptTokens":531,"outputTokens":256,"kvCacheDtype":"q8_0","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":25.5,"prefillTokS":1320.063,"ttftMs":402.25,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-06-27T00:38:59.726Z","command":"/home/mikekey/Experiments/llama.cpp/build-vulkan/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --prio 3 -m /home/mikekey/models/gguf/misc/ornith-1.0-9b-bf16.gguf --reasoning-format auto --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 --repeat-penalty 1.0 -ctk q8_0 -ctv q8_0 -ts 1/1/1 -c 262144 --chat-template-kwargs '{\"preserve_thinking\": true}'","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-9B"},{"id":"cmt04563z0ehpms01an9c50gz","hfId":"unsloth/DeepSeek-V4-Flash-0731-GGUF","presetKey":"deepseek_v4_flash","model":"DeepSeek-V4-Flash-0731-GGUF","paramsB":304,"activeParamsB":null,"hardwareTemplate":"RTX 5090","hardware":"RTX 5090","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q2","quantization":"UD-IQ1_S","contextLength":2048,"promptTokens":25,"outputTokens":256,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":null,"cpuMoeLayers":34,"decodeDepthTokens":null,"batchSize":1,"observedTokS":18,"prefillTokS":107.1,"ttftMs":233.43,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-08-19T13:14:17.520Z","command":"llama-server --model DeepSeek-V4-Flash-0731-UD-IQ1_S-00001-of-00003.gguf --ctx-size 65536 --n-gpu-layers 999 --n-cpu-moe 34 --cache-type-k q8_0 --cache-type-v q8_0 --flash-attn on --jinja --threads 8","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FDeepSeek-V4-Flash-0731-GGUF"},{"id":"cmr916in500jkqr01hfsj5m38","hfId":"deepreinforce-ai/Ornith-1.0-35B","presetKey":"ornith_1_35b_a3b","model":"Ornith-1.0-35B","paramsB":null,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B70","hardware":"Intel Arc Pro B70","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9853 SYCL","quantKey":"q5","quantization":"Q5_K_M","contextLength":131072,"promptTokens":0,"outputTokens":0,"kvCacheDtype":"q5_0/q4_1","backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":67.6,"prefillTokS":1242.31,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-06T09:41:52.481Z","command":"llama-server -m ornith-1.0-35b-Q5_K_M.gguf --parallel 1 --ctx-size 131072 -fa on -ctk q5_0 -ctv q4_1 -b 8192 -ub 4096","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-35B"},{"id":"cmofeyn1i000gl204hiwvdqj0","hfId":"unsloth/gemma-4-31B-it-GGUF","presetKey":"gemma4_31b","model":"gemma-4-31B-it-GGUF","paramsB":31,"activeParamsB":null,"hardwareTemplate":"RTX 3090","hardware":"RTX 3090","deviceCount":2,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b8870","quantKey":"q6","quantization":"UD-Q6_K_XL","contextLength":32768,"promptTokens":512,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":"row","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":14.38,"prefillTokS":null,"ttftMs":2263.37,"peakVramGb":20.7,"reproducibility":6,"verified":false,"createdAt":"2026-04-26T06:55:09.606Z","command":"llama-server -m gemma-4-31B-it-UD-Q6_K_XL.gguf -ngl 999 -fa 1 --no-mmap --mlock -c 32768 -sm row -ts 1,1 -ctk q8_0 -ctv q8_0 -b 4096 -ub 4096 --parallel 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2Fgemma-4-31B-it-GGUF"},{"id":"cmrz39cnl063so4016tt0flhl","hfId":"LiquidAI/LFM2.5-350M","presetKey":"lfm2.5_350m","model":"LFM2.5-350M","paramsB":null,"activeParamsB":null,"hardwareTemplate":"RTX 3060","hardware":"RTX 3060","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9775 / 7529fdaaf","quantKey":"int8","quantization":"Q8_0","contextLength":4608,"promptTokens":4096,"outputTokens":512,"kvCacheDtype":"f16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":574.672959,"prefillTokS":29574.289371,"ttftMs":140.2387988111371,"peakVramGb":1.8857421875,"reproducibility":6,"verified":false,"createdAt":"2026-07-24T15:22:04.497Z","command":"/home/dario/llama.cpp/build/bin/llama-bench -m /mnt/hdd/lmstudio_models/tiny-throughput-bench/gguf/lfm2.5-350m/LFM2.5-350M-Q8_0.gguf -p 4096 -n 512 -b 4096 -ub 1024 -t 16 -ngl 99 -fa on -r 2 -o json --no-warmup","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2.5-350M"},{"id":"cmsoxtt1l00f9mp0185rby2p4","hfId":"Qwen/Qwen3-Coder-30B-A3B-Instruct-FP8","presetKey":"qwen3_30b_a3b","model":"Qwen3-Coder-30B-A3B-Instruct-FP8","paramsB":31,"activeParamsB":3,"hardwareTemplate":"RTX PRO 6000 Blackwell","hardware":"RTX PRO 6000 Blackwell","deviceCount":1,"memoryGB":96,"runtimeKey":"vllm","engine":"vllm","engineVersion":"0.26.0","quantKey":"fp8","quantization":"FP8","contextLength":32768,"promptTokens":541,"outputTokens":512,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":26.05,"prefillTokS":null,"ttftMs":null,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-08-11T17:32:01.737Z","command":"vllm serve Qwen/Qwen3-Coder-30B-A3B-Instruct-FP8 \\\n --host 127.0.0.1 --port 8000 \\\n --served-model-name Qwen/Qwen3-Coder-30B-A3B-Instruct-FP8 \\\n --trust-remote-code --generation-config vllm \\\n --max-model-len 32768 --gpu-memory-utilization 0.90 \\\n --max-num-batched-tokens 8192 --max-num-seqs 4","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-Coder-30B-A3B-Instruct-FP8"},{"id":"cmrio40wi01vqmj01j70m0yx2","hfId":"Qwen/Qwen3-0.6B","presetKey":"qwen3_0.6b","model":"Qwen3-0.6B","paramsB":1,"activeParamsB":null,"hardwareTemplate":"AMD Radeon 780M (Ryzen 7840HS / 8745H)","hardware":"AMD Ryzen 7 7840HS","deviceCount":1,"memoryGB":null,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"commit 6b4dc21","quantKey":"int8","quantization":"Q8_0","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":81.450405,"prefillTokS":756.486629,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-13T03:33:42.930Z","command":"llama-bench -m Qwen3-0.6B-Q8_0.gguf -t 8 -p 512 -n 128 -r 2 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-0.6B"},{"id":"cms3l67sh017bs201fasn9ya5","hfId":"lmstudio-community/OpenReasoning-Nemotron-7B-GGUF","presetKey":"qwen2.5_7b","model":"OpenReasoning-Nemotron-7B-GGUF","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RTX 3060 Ti","hardware":"RTX 3060 Ti","deviceCount":1,"memoryGB":8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":65536,"promptTokens":65536,"outputTokens":128,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":25.67,"prefillTokS":1276.78,"ttftMs":82331.4,"peakVramGb":6.66,"reproducibility":5,"verified":false,"createdAt":"2026-07-27T18:54:36.017Z","command":"llama-bench -m -p 65536 -n 128 -ngl 28 -sm layer -fa on -ctk q4_0 -ctv q4_0 -r 5","source":"https://www.localmaxxing.com/en/leaderboard?hfId=lmstudio-community%2FOpenReasoning-Nemotron-7B-GGUF"},{"id":"cmqz8ohfg02agoe01lyvye66v","hfId":"deepreinforce-ai/Ornith-1.0-35B-GGUF","presetKey":"ornith_1_35b_a3b","model":"Ornith-1.0-35B-GGUF","paramsB":35,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B60","hardware":"Intel Arc Pro B60","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":4096,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":64.58,"prefillTokS":842.54,"ttftMs":607.7,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T13:14:06.268Z","command":"/home/maxious/llama-master/build-sycl-new/bin/llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/ornith-1.0-35b-Q4_K_M.gguf -p 512 -n 128 -fa 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-35B-GGUF"},{"id":"cmsq6dztn00jfmr01h1kg864p","hfId":"unsloth/GLM-4.7-Flash-GGUF","presetKey":"glm4.7_flash","model":"GLM-4.7-Flash-GGUF","paramsB":null,"activeParamsB":null,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10347-e6f10a799","quantKey":"q4","quantization":"Q4_K_XL","contextLength":8192,"promptTokens":1172,"outputTokens":512,"kvCacheDtype":"fp16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":68.5,"prefillTokS":1095.7,"ttftMs":1069.63,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-08-12T14:19:26.747Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model GLM-4.7-Flash-UD-Q4_K_XL.gguf -ngl 999 -c 8192 -fa on --no-mmap -np 1 -b 2048 -ub 1024 --temp 0 --no-cache-prompt","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FGLM-4.7-Flash-GGUF"},{"id":"cmqubmrjg023gqr014q6wh7ad","hfId":"deepreinforce-ai/Ornith-1.0-35B","presetKey":"ornith_1_35b_a3b","model":"Ornith-1.0-35B","paramsB":null,"activeParamsB":null,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":3,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9626-2-g038121ab1","quantKey":"int8","quantization":"Q8_0","contextLength":787,"promptTokens":531,"outputTokens":256,"kvCacheDtype":"q8_0","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":67.776,"prefillTokS":1359.515,"ttftMs":390.58,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-06-26T02:37:54.028Z","command":"/home/mikekey/Experiments/llama.cpp/build-vulkan/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --prio 3 -m /home/mikekey/models/gguf/misc/ornith-1.0-35b-Q8_0.gguf --reasoning-format auto --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 --repeat-penalty 1.0 -ctk q8_0 -ctv q8_0 -ts 1/1/1 -c 262144 --chat-template-kwargs '{\"preserve_thinking\": true}'","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-35B"},{"id":"cmrejmi9i000epb01vrfkojuw","hfId":"Qwen/Qwen3.5-9B","presetKey":"qwen3.5_9b","model":"Qwen3.5-9B","paramsB":9,"activeParamsB":null,"hardwareTemplate":"RTX 5090","hardware":"RTX 5090","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q6","quantization":"Q6_K","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":170.01,"prefillTokS":11132.33,"ttftMs":46,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-07-10T06:17:02.454Z","command":"/usr/bin/llama-bench -m /home/chan/downloads/Qwen3.5-9B-UD-Q6_K_XL.gguf -p 512 -n 128","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.5-9B"},{"id":"cmr89jhtd009zqr01sbpwoum8","hfId":"poolside/Laguna-XS-2.1-GGUF","presetKey":"laguna_xs_2.1","model":"Laguna-XS-2.1-GGUF","paramsB":33,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B70","hardware":"Intel Arc Pro B70","deviceCount":1,"memoryGB":30.3,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"SYCL moe-ready build used by the Agentic Arcade B70 campaign","quantKey":"q5","quantization":"Q5_K_M GGUF","contextLength":131072,"promptTokens":127,"outputTokens":90,"kvCacheDtype":"q8_0","backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":63.71,"prefillTokS":338.98,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-05T20:48:08.689Z","command":"GGML_SYCL_DISABLE_DNN=1 llama-server -m Laguna-XS-2.1-Q4_K_M.gguf -c 131072 -np 32 -ngl 99 -fa on -ctk q8_0 -ctv q8_0 -b 8192 -ub 4096 --jinja; concurrent_agents.py client sweep","source":"https://www.localmaxxing.com/en/leaderboard?hfId=poolside%2FLaguna-XS-2.1-GGUF"},{"id":"cmsnf37pe00bqo001jze3l8kj","hfId":"unsloth/Muse-Glimmer-30B-GGUF","presetKey":"muse_glimmer_30b","model":"Muse-Glimmer-30B-GGUF","paramsB":30,"activeParamsB":null,"hardwareTemplate":"RTX 3090","hardware":"RTX 3090","deviceCount":2,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q6","quantization":"Unsloth-Dynamic-Q6_K_XL","contextLength":2048,"promptTokens":0,"outputTokens":128,"kvCacheDtype":"q8_0","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":31.671169,"prefillTokS":1604.010013,"ttftMs":176.09,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-08-10T15:59:41.762Z","command":"/home/lotto/llama.cpp/build/bin/llama-bench -m /home/lotto/models/Muse-Glimmer-30B-GGUF/Muse-Glimmer-30B-UD-Q6_K_XL.gguf -p 0 -n 128 -ngl 999 -sm layer -ts 1/1 -fa 1 -ctk q8_0 -ctv q8_0 -r 5 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FMuse-Glimmer-30B-GGUF"},{"id":"cmrz354ye063no401xdkrx978","hfId":"LiquidAI/LFM2.5-1.2B-Instruct","presetKey":"lfm2.5_1.2b","model":"LFM2.5-1.2B-Instruct","paramsB":1,"activeParamsB":null,"hardwareTemplate":"RTX 3060","hardware":"RTX 3060","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9775 / 7529fdaaf","quantKey":"int8","quantization":"Q8_0","contextLength":4608,"promptTokens":4096,"outputTokens":512,"kvCacheDtype":"f16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":231.224959,"prefillTokS":12424.226539,"ttftMs":334.0032629331749,"peakVramGb":2.7041015625,"reproducibility":6,"verified":false,"createdAt":"2026-07-24T15:18:47.894Z","command":"/home/dario/llama.cpp/build/bin/llama-bench -m /mnt/hdd/lmstudio_models/tiny-throughput-bench/gguf/lfm2.5-1.2b/LFM2.5-1.2B-Instruct-Q8_0.gguf -p 4096 -n 512 -b 4096 -ub 1024 -t 16 -ngl 99 -fa on -r 2 -o json --no-warmup","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2.5-1.2B-Instruct"},{"id":"cms0cmhvq0032s2014bolsk2a","hfId":"poolside/Laguna-S-2.1","presetKey":"laguna_s_2.1","model":"Laguna-S-2.1","paramsB":118,"activeParamsB":null,"hardwareTemplate":"RTX PRO 6000 Blackwell","hardware":"RTX PRO 6000 Blackwell","deviceCount":4,"memoryGB":96,"runtimeKey":"vllm","engine":"vllm","engineVersion":"","quantKey":"bfloat16","quantization":"BF16","contextLength":2048,"promptTokens":26479,"outputTokens":1568,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":126.5678223671921,"prefillTokS":10729.67764998092,"ttftMs":50.04908949922537,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-07-25T12:32:00.518Z","command":"vllm serve poolside/Laguna-S-2.1 --tensor-parallel-size 4 --gpu-memory-utilization 0.9 --max-num-seqs 64 --enable-prefix-caching","source":"https://www.localmaxxing.com/en/leaderboard?hfId=poolside%2FLaguna-S-2.1"},{"id":"cmri8p1lb01comj01acjkzy1q","hfId":"Qwen/Qwen3-8B","presetKey":"qwen3_8b","model":"Qwen3-8B","paramsB":8,"activeParamsB":null,"hardwareTemplate":"AMD Radeon 780M (Ryzen 7840HS / 8745H)","hardware":"AMD Ryzen 7 7840HS","deviceCount":1,"memoryGB":null,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b1-6b4dc21","quantKey":"q4","quantization":"Q4_K_M","contextLength":512,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":12.27328,"prefillTokS":81.302815,"ttftMs":null,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-12T20:22:09.744Z","command":"llama-bench -m Qwen3-8B-Q4_K_M.gguf -t 8 -p 512 -n 128 -r 2 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-8B"},{"id":"cms3gnqdk0119s201gzopdhz3","hfId":"nvidia/NVIDIA-Nemotron-3-Nano-4B-BF16","presetKey":"nemotron3_nano_4b","model":"NVIDIA-Nemotron-3-Nano-4B-BF16","paramsB":9,"activeParamsB":null,"hardwareTemplate":"RTX 3060 Ti","hardware":"RTX 3060 Ti","deviceCount":1,"memoryGB":8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":98304,"promptTokens":98304,"outputTokens":128,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":60.28,"prefillTokS":1959.04,"ttftMs":1,"peakVramGb":3.9,"reproducibility":5,"verified":false,"createdAt":"2026-07-27T16:48:15.176Z","command":"llama-bench -m -p 98304 -n 128 -ngl 42 -sm layer -fa on -ctk q4_0 -ctv q4_0 -r 5","source":"https://www.localmaxxing.com/en/leaderboard?hfId=nvidia%2FNVIDIA-Nemotron-3-Nano-4B-BF16"},{"id":"cmqz8jby302a5oe01m92emkr5","hfId":"openai/gpt-oss-20b","presetKey":"gpt_oss_20b","model":"gpt-oss-20b","paramsB":22,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B60","hardware":"Intel Arc Pro B60","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"int8","quantization":"Q8_0","contextLength":4096,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":33.04,"prefillTokS":848.7,"ttftMs":603.3,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T13:10:05.883Z","command":"/home/maxious/llama-master/build-sycl-new/bin/llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/gpt-oss-20b-Q8_0.gguf -p 512 -n 128 -fa 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=openai%2Fgpt-oss-20b"},{"id":"cmspz0td000epmr01hmbmekku","hfId":"meta-models/Muse-Glimmer-30B","presetKey":"muse_glimmer_30b","model":"Muse-Glimmer-30B","paramsB":30,"activeParamsB":null,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10352-baf0025de","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":1210,"outputTokens":512,"kvCacheDtype":"fp16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":12.9,"prefillTokS":260.2,"ttftMs":4649.86,"peakVramGb":16.4,"reproducibility":7,"verified":false,"createdAt":"2026-08-12T10:53:14.533Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model muse-glimmer-30B-kquant-17gb.gguf -ngl 999 -c 8192 -fa on --no-mmap -np 1 -b 2048 -ub 1024 --temp 0 --no-cache-prompt","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-models%2FMuse-Glimmer-30B"},{"id":"cmpbxz6fj004mpc01vg5u2x74","hfId":"Qwen/Qwen3-Coder-30B-A3B-Instruct","presetKey":"qwen3_30b_a3b","model":"Qwen3-Coder-30B-A3B-Instruct","paramsB":31,"activeParamsB":3,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":2,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9219-5-geea8a2d8c","quantKey":"int8","quantization":"Q8_0","contextLength":686,"promptTokens":530,"outputTokens":156,"kvCacheDtype":"q8_0","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":84.233,"prefillTokS":null,"ttftMs":29.95,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-05-19T01:16:05.071Z","command":"/home/mikekey/Experiments/llama.cpp/build-vulkan/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --parallel 2 --main-gpu 0 --prio 3 -m /home/mikekey/models/gguf/qwen/Qwen3-Coder-30B-A3B-Instruct-Q8_0.gguf --temp 0.7 --top-p 0.8 --top-k 20 --min-p 0.0 --repeat-penalty 1.05 -ctk q8_0 -ctv q8_0 -ts 1/1 -c 196608","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-Coder-30B-A3B-Instruct"},{"id":"cmqzl6kti02q2oe01l9sp10zx","hfId":"deepreinforce-ai/Ornith-1.0-35B-GGUF","presetKey":"ornith_1_35b_a3b","model":"Ornith-1.0-35B-GGUF","paramsB":35,"activeParamsB":null,"hardwareTemplate":"RTX 5090","hardware":"RTX 5090","deviceCount":1,"memoryGB":32,"runtimeKey":"ollama","engine":"ollama","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":2048,"promptTokens":512,"outputTokens":512,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":252.6,"prefillTokS":1,"ttftMs":1,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T19:04:05.862Z","command":"ollama run","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-35B-GGUF"},{"id":"cmr6xkr2f00gomn01k4u2dua8","hfId":"unsloth/GLM-4.7-Flash-GGUF","presetKey":"glm4.7_flash","model":"GLM-4.7-Flash-GGUF","paramsB":null,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B70","hardware":"Intel Arc Pro B70","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"fdb1db877","quantKey":"q4","quantization":"GGUF UD-Q4_K_XL","contextLength":4096,"promptTokens":62,"outputTokens":128,"kvCacheDtype":"K=f16 V=f16","backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":40.7691297367011,"prefillTokS":null,"ttftMs":206.2063349876553,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-04T22:25:25.767Z","command":"llama-server -m /mnt/usb-models/llm-models/glm-4.7-flash-gguf/GLM-4.7-Flash-UD-Q4_K_XL.gguf -c 4096 -ngl 99 -b 1024 -ub 256 -fa on --ctx-checkpoints 0 --jinja --reasoning off","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FGLM-4.7-Flash-GGUF"},{"id":"cmskztdkv00bxpb018itbgfi0","hfId":"AtomicChat/DeepSeek-V4-Flash-0731-GGUF","presetKey":"deepseek_v4_flash","model":"DeepSeek-V4-Flash-0731-GGUF","paramsB":304,"activeParamsB":null,"hardwareTemplate":"RTX 3090","hardware":"RTX 3090","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q2","quantization":"IQ2_XSS","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":36,"decodeDepthTokens":null,"batchSize":1,"observedTokS":19.39,"prefillTokS":209.38,"ttftMs":2445.3,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-08-08T23:16:36.224Z","command":"llama-bench -hf AtomicChat/DeepSeek-V4-Flash-0731-GGUF:IQ2_XXS -ngl 999 -ncmoe 36 -fa off -lm none -r 5 -p 512 -n 128","source":"https://www.localmaxxing.com/en/leaderboard?hfId=AtomicChat%2FDeepSeek-V4-Flash-0731-GGUF"},{"id":"cmrz34f5m063io401jbnu5gqg","hfId":"LiquidAI/LFM2-350M","presetKey":"lfm2_350m","model":"LFM2-350M","paramsB":null,"activeParamsB":null,"hardwareTemplate":"RTX 3060","hardware":"RTX 3060","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9775 / 7529fdaaf","quantKey":"int8","quantization":"Q8_0","contextLength":4608,"promptTokens":4096,"outputTokens":512,"kvCacheDtype":"f16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":574.517925,"prefillTokS":29705.051909,"ttftMs":139.6295930062837,"peakVramGb":1.8857421875,"reproducibility":6,"verified":false,"createdAt":"2026-07-24T15:18:14.459Z","command":"/home/dario/llama.cpp/build/bin/llama-bench -m /mnt/hdd/lmstudio_models/tiny-throughput-bench/gguf/lfm2-350m/LFM2-350M-Q8_0.gguf -p 4096 -n 512 -b 4096 -ub 1024 -t 16 -ngl 99 -fa on -r 2 -o json --no-warmup","source":"https://www.localmaxxing.com/en/leaderboard?hfId=LiquidAI%2FLFM2-350M"},{"id":"cmot0019h0005jv04grub94v5","hfId":"nvidia/Gemma-4-26B-A4B-NVFP4","presetKey":"gemma4_26b_a4b","model":"Gemma-4-26B-A4B-NVFP4","paramsB":14,"activeParamsB":null,"hardwareTemplate":"RTX PRO 6000 Blackwell","hardware":"RTX PRO 6000 Blackwell","deviceCount":1,"memoryGB":96,"runtimeKey":"vllm","engine":"vllm","engineVersion":"","quantKey":"q4","quantization":"NVFP4","contextLength":131072,"promptTokens":512,"outputTokens":512,"kvCacheDtype":"fp8","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":36.9,"prefillTokS":6446,"ttftMs":60,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-05-05T19:05:06.917Z","command":"vllm nvidia/gemma-4-31B-it-NVFP4\n --served-model-name gemma-4-31B-it-NVFP4\n --kv-cache-dtype fp8\n --gpu-memory-utilization 0.95\n --max-model-len 131072\n --max-num-seqs 8\n --tensor-parallel-size 1\n --enable-auto-tool-choice\n --tool-call-parser gemma4\n --chat-template examples/tool_chat_template_gemma4.jinja\n --reasoning-parser gemma4\n --async-scheduling\n --max-num-seqs 256\n --enable-prefix-caching\n --port 8000\n","source":"https://www.localmaxxing.com/en/leaderboard?hfId=nvidia%2FGemma-4-26B-A4B-NVFP4"},{"id":"cmr2oodnn06jbpi015ypot1mv","hfId":"Qwen/Qwen3.5-4B","presetKey":"qwen3.5_4b","model":"Qwen3.5-4B","paramsB":4,"activeParamsB":null,"hardwareTemplate":"AMD Radeon 780M (Ryzen 7840HS / 8745H)","hardware":"AMD Ryzen 7 8745H w/ Radeon 780M","deviceCount":1,"memoryGB":null,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_XL","contextLength":65536,"promptTokens":506,"outputTokens":512,"kvCacheDtype":null,"backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":39.6,"prefillTokS":329,"ttftMs":1537,"peakVramGb":3.5,"reproducibility":6,"verified":false,"createdAt":"2026-07-01T23:05:13.763Z","command":"llama-server -m Qwen3.5-4B-UD-Q4_K_XL.gguf -c 65536 -ngl 99 --temp 0.0 --no-mmap --port 8080","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.5-4B"},{"id":"cms3gnlyw0116s201x88tix2z","hfId":"nvidia/NVIDIA-Nemotron-3-Nano-4B-BF16","presetKey":"nemotron3_nano_4b","model":"NVIDIA-Nemotron-3-Nano-4B-BF16","paramsB":9,"activeParamsB":null,"hardwareTemplate":"RTX 3060 Ti","hardware":"RTX 3060 Ti","deviceCount":1,"memoryGB":8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":8192,"outputTokens":128,"kvCacheDtype":"f16","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":116.92,"prefillTokS":2935.33,"ttftMs":3614.8,"peakVramGb":3.9,"reproducibility":5,"verified":false,"createdAt":"2026-07-27T16:48:09.464Z","command":"llama-bench -m -p 8192 -n 128 -ngl 42 -sm layer -fa on -ctk f16 -ctv f16 -r 5","source":"https://www.localmaxxing.com/en/leaderboard?hfId=nvidia%2FNVIDIA-Nemotron-3-Nano-4B-BF16"},{"id":"cmqz8grd102a0oe01kq2b9iau","hfId":"Qwen/Qwen3.5-9B","presetKey":"qwen3.5_9b","model":"Qwen3.5-9B","paramsB":9,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B60","hardware":"Intel Arc Pro B60","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"int8","quantization":"Q8_0","contextLength":4096,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":27.72,"prefillTokS":1425.32,"ttftMs":359.2,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T13:08:05.893Z","command":"/home/maxious/llama-master/build-sycl-new/bin/llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/Qwopus3.5-9B-Coder-MTP-Q8_0.gguf -p 512 -n 128 -fa 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.5-9B"},{"id":"cmspyy0bx00ejmr014ssfizr0","hfId":"meta-models/Muse-Glimmer-30B-GGUF","presetKey":"muse_glimmer_30b","model":"Muse-Glimmer-30B-GGUF","paramsB":30,"activeParamsB":null,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10352-baf0025de","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":1210,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":12.9,"prefillTokS":268.5,"ttftMs":4506.58,"peakVramGb":16.3,"reproducibility":7,"verified":false,"createdAt":"2026-08-12T10:51:03.597Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model muse-glimmer-30B-kquant-17gb.gguf -ngl 999 -c 8192 -fa on -ctk q8_0 -ctv q8_0 --no-mmap -np 1 -b 2048 -ub 1024 --temp 0 --no-cache-prompt","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-models%2FMuse-Glimmer-30B-GGUF"},{"id":"cmpbxheqq004fpc01y6ga7mf9","hfId":"Qwen/Qwen3-Coder-30B-A3B-Instruct","presetKey":"qwen3_30b_a3b","model":"Qwen3-Coder-30B-A3B-Instruct","paramsB":31,"activeParamsB":3,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":2,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9219-5-geea8a2d8c","quantKey":"int8","quantization":"Q8_0","contextLength":686,"promptTokens":530,"outputTokens":156,"kvCacheDtype":"q8_0","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":84.459,"prefillTokS":null,"ttftMs":29.63,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-05-19T01:02:16.034Z","command":"/home/mikekey/Experiments/llama.cpp/build-vulkan/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --parallel 2 --main-gpu 0 --prio 3 -m /home/mikekey/models/gguf/qwen/Qwen3-Coder-30B-A3B-Instruct-Q8_0.gguf --temp 0.7 --top-p 0.8 --top-k 20 --min-p 0.0 --repeat-penalty 1.05 -ctk q8_0 -ctv q8_0 -ts 1/1 -c 196608","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-Coder-30B-A3B-Instruct"},{"id":"cmqxpgrdz002epk0198amy3h9","hfId":"unsloth/gemma-4-31B-it-GGUF","presetKey":"gemma4_31b","model":"gemma-4-31B-it-GGUF","paramsB":31,"activeParamsB":null,"hardwareTemplate":"RTX 5090","hardware":"RTX 5090","deviceCount":1,"memoryGB":31.8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q6","quantization":"Q6_K_XL","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":51.68,"prefillTokS":3308.41,"ttftMs":154.8,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-28T11:28:27.047Z","command":"/data/bin/llama-bench -m /data/models/unsloth/gemma-4-31B-it-GGUF/gemma-4-31B-it-UD-Q6_K_XL.gguf -p 512 -n 128","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2Fgemma-4-31B-it-GGUF"},{"id":"cmr6w2ekt00gimn01orbith22","hfId":"unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF","presetKey":"qwen3_30b_a3b","model":"Qwen3-Coder-30B-A3B-Instruct-GGUF","paramsB":30,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B70","hardware":"Intel Arc Pro B70","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"llama.cpp fdb1db877 / llama-server 9763 dec5ca557","quantKey":"q4","quantization":"GGUF UD-Q4_K_XL","contextLength":4096,"promptTokens":65,"outputTokens":128,"kvCacheDtype":"K=f16 V=f16","backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":108.1165394591524,"prefillTokS":null,"ttftMs":164.1294390428811,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-04T21:43:10.158Z","command":"llama-server -m /mnt/usb-models/llm-models/qwen3-coder-30b-a3b-instruct-gguf/Qwen3-Coder-30B-A3B-Instruct-UD-Q4_K_XL.gguf -c 4096 -ngl 99 -b 1024 -ub 256 -fa on --ctx-checkpoints 0 --jinja --reasoning off","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3-Coder-30B-A3B-Instruct-GGUF"},{"id":"cmskziup700bqpb01vqnn450o","hfId":"AtomicChat/DeepSeek-V4-Flash-0731-GGUF","presetKey":"deepseek_v4_flash","model":"DeepSeek-V4-Flash-0731-GGUF","paramsB":304,"activeParamsB":null,"hardwareTemplate":"RTX 3090","hardware":"RTX 3090","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q2","quantization":"IQ2_XSS","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":36,"decodeDepthTokens":null,"batchSize":1,"observedTokS":20.68,"prefillTokS":209.58,"ttftMs":2443,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-08-08T23:08:25.195Z","command":"llama-bench -hf AtomicChat/DeepSeek-V4-Flash-0731-GGUF:IQ2_XXS -ngl 999 -ncmoe 36 -fa off -lm none -r 5 -p 512 -n 128","source":"https://www.localmaxxing.com/en/leaderboard?hfId=AtomicChat%2FDeepSeek-V4-Flash-0731-GGUF"},{"id":"cmrz00pyt05imo401x9ourh7w","hfId":"Jackrong/Qwen3.5-9B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF","presetKey":"qwen3.5_9b","model":"Qwen3.5-9B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF","paramsB":9,"activeParamsB":null,"hardwareTemplate":"RTX 3060","hardware":"RTX 3060","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9775 / be4a6a63e","quantKey":"q4","quantization":"Q4_K_M","contextLength":4608,"promptTokens":4096,"outputTokens":512,"kvCacheDtype":"f16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":52.405545,"prefillTokS":1639.947285,"ttftMs":2516.723208225755,"peakVramGb":7.286,"reproducibility":6,"verified":false,"createdAt":"2026-07-24T13:51:22.997Z","command":"/home/dario/llama.cpp/build/bin/llama-bench -m /mnt/hdd/lmstudio_models/Jackrong/Qwen3.5-9B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF/Qwen3.5-9B.Q4_K_M.gguf -p 4096 -n 512 -b 4096 -ub 1024 -t 16 -ngl 99 -fa on -r 2 -o json --no-warmup","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Jackrong%2FQwen3.5-9B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF"},{"id":"cmqz3ljia023soe0118qzcuxu","hfId":"Qwen/Qwen3.5-4B","presetKey":"qwen3.5_4b","model":"Qwen3.5-4B","paramsB":4,"activeParamsB":null,"hardwareTemplate":"AMD Radeon 780M (Ryzen 7840HS / 8745H)","hardware":"AMD Ryzen 7 8745H w/ Radeon 780M","deviceCount":1,"memoryGB":null,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_XL","contextLength":65536,"promptTokens":1261,"outputTokens":512,"kvCacheDtype":null,"backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":28,"prefillTokS":347,"ttftMs":3639,"peakVramGb":3.5,"reproducibility":6,"verified":false,"createdAt":"2026-06-29T10:51:50.914Z","command":"llama-server -m Qwen3.5-4B-UD-Q4_K_XL.gguf -c 65536 -ngl 99 --temp 0.0 --no-mmap --port 8080","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.5-4B"},{"id":"cms3gnjhu0113s2014ef2duq9","hfId":"nvidia/NVIDIA-Nemotron-3-Nano-4B-BF16","presetKey":"nemotron3_nano_4b","model":"NVIDIA-Nemotron-3-Nano-4B-BF16","paramsB":9,"activeParamsB":null,"hardwareTemplate":"RTX 3060 Ti","hardware":"RTX 3060 Ti","deviceCount":1,"memoryGB":8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":65536,"promptTokens":65536,"outputTokens":128,"kvCacheDtype":"q4_0","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":72.64,"prefillTokS":2246.11,"ttftMs":42350.8,"peakVramGb":3.9,"reproducibility":5,"verified":false,"createdAt":"2026-07-27T16:48:06.258Z","command":"llama-bench -m -p 65536 -n 128 -ngl 42 -sm layer -fa on -ctk q4_0 -ctv q4_0 -r 5","source":"https://www.localmaxxing.com/en/leaderboard?hfId=nvidia%2FNVIDIA-Nemotron-3-Nano-4B-BF16"},{"id":"cmqz8ac2r029coe01j2tda8ws","hfId":"meta-llama/Llama-3.2-1B-Instruct","presetKey":"llama3.2_1b","model":"Llama-3.2-1B-Instruct","paramsB":1,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B60","hardware":"Intel Arc Pro B60","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"int8","quantization":"Q8_0","contextLength":4096,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":194.71,"prefillTokS":8333.45,"ttftMs":61.4,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T13:03:06.147Z","command":"/home/maxious/llama-master/build-sycl-new/bin/llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/Llama-3.2-1B.Q8_0.gguf -p 512 -n 128 -fa 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-llama%2FLlama-3.2-1B-Instruct"},{"id":"cmspywlu800egmr01wkumj1vl","hfId":"meta-models/Muse-Glimmer-30B-GGUF","presetKey":"muse_glimmer_30b","model":"Muse-Glimmer-30B-GGUF","paramsB":30,"activeParamsB":null,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10352-baf0025de","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":1210,"outputTokens":512,"kvCacheDtype":"fp16","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":12.9,"prefillTokS":260.2,"ttftMs":4649.86,"peakVramGb":16.4,"reproducibility":7,"verified":false,"createdAt":"2026-08-12T10:49:58.161Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model muse-glimmer-30B-kquant-17gb.gguf -ngl 999 -c 8192 -fa on --no-mmap -np 1 -b 2048 -ub 1024 --temp 0 --no-cache-prompt","source":"https://www.localmaxxing.com/en/leaderboard?hfId=meta-models%2FMuse-Glimmer-30B-GGUF"},{"id":"cmpbwqzh90044pc01hkit3p4h","hfId":"Qwen/Qwen3-Coder-30B-A3B-Instruct","presetKey":"qwen3_30b_a3b","model":"Qwen3-Coder-30B-A3B-Instruct","paramsB":31,"activeParamsB":3,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":2,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9219-5-geea8a2d8c","quantKey":"int8","quantization":"Q8_0","contextLength":686,"promptTokens":530,"outputTokens":156,"kvCacheDtype":"q8_0","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":84.127,"prefillTokS":null,"ttftMs":213.13,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-05-19T00:41:43.197Z","command":"/home/mikekey/Experiments/llama.cpp/build-vulkan/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --parallel 2 --main-gpu 0 --prio 3 -m /home/mikekey/models/gguf/qwen/Qwen3-Coder-30B-A3B-Instruct-Q8_0.gguf --temp 0.7 --top-p 0.8 --top-k 20 --min-p 0.0 --repeat-penalty 1.05 -ctk q8_0 -ctv q8_0 -ts 1/1 -c 196608","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-Coder-30B-A3B-Instruct"},{"id":"cmqxolrvl001spk01fjsgg723","hfId":"unsloth/gemma-4-26B-A4B-it-GGUF","presetKey":"gemma4_26b_a4b","model":"gemma-4-26B-A4B-it-GGUF","paramsB":26,"activeParamsB":null,"hardwareTemplate":"RTX 5090","hardware":"RTX 5090","deviceCount":1,"memoryGB":31.8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q3","quantization":"Q3_K_M","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":255.67,"prefillTokS":12653.88,"ttftMs":40.5,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-28T11:04:21.345Z","command":"/data/bin/llama-bench -m /data/models/unsloth/gemma-4-26B-A4B-it-GGUF/gemma-4-26B-A4B-it-UD-Q3_K_M.gguf -p 512 -n 128","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2Fgemma-4-26B-A4B-it-GGUF"},{"id":"cmr6rr2kv008imn019frg0x3m","hfId":"unsloth/Qwen3-30B-A3B-Instruct-2507-GGUF","presetKey":"qwen3_30b_a3b","model":"Qwen3-30B-A3B-Instruct-2507-GGUF","paramsB":31,"activeParamsB":3,"hardwareTemplate":"Intel Arc Pro B70","hardware":"Intel Arc Pro B70","deviceCount":1,"memoryGB":32,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"llama-server version 9763 (dec5ca557), IntelLLVM 2026.0.0; source snapshot fdb1db877c526ec90f668eca1b858da5dba85560","quantKey":"q4","quantization":"GGUF UD-Q4_K_XL","contextLength":4096,"promptTokens":65,"outputTokens":128,"kvCacheDtype":"K=f16 V=f16","backend":"xpu","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":107.4838836326736,"prefillTokS":null,"ttftMs":166.9534610118717,"peakVramGb":null,"reproducibility":6,"verified":false,"createdAt":"2026-07-04T19:42:22.927Z","command":"llama-server -m /mnt/usb-models/llm-models/qwen3-30b-a3b-instruct-2507-gguf/Qwen3-30B-A3B-Instruct-2507-UD-Q4_K_XL.gguf -c 4096 -ngl 99 -b 1024 -ub 256 -fa on","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FQwen3-30B-A3B-Instruct-2507-GGUF"},{"id":"cmsetv2sl00mbpp01kiwms814","hfId":"unsloth/Laguna-S-2.1-GGUF","presetKey":"laguna_s_2.1","model":"Laguna-S-2.1-GGUF","paramsB":118,"activeParamsB":null,"hardwareTemplate":"RTX 3090","hardware":"RTX 3090","deviceCount":2,"memoryGB":48,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"IQ4_NL","contextLength":2048,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":43.709952,"prefillTokS":440.675297,"ttftMs":1161.9,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-08-04T15:43:20.806Z","command":"/home/lotto/llama.cpp-laguna/build/bin/llama-bench -m /home/lotto/models/Laguna-S-2.1-GGUF/UD-IQ4_NL/Laguna-S-2.1-UD-IQ4_NL-00001-of-00003.gguf -fa on -sm layer -fitt 1024 -r 3 -o json","source":"https://www.localmaxxing.com/en/leaderboard?hfId=unsloth%2FLaguna-S-2.1-GGUF"},{"id":"cmrz00npf05ido401xbgnsbdt","hfId":"Qwen/Qwen3.5-9B","presetKey":"qwen3.5_9b","model":"Qwen3.5-9B","paramsB":9,"activeParamsB":null,"hardwareTemplate":"RTX 3060","hardware":"RTX 3060","deviceCount":1,"memoryGB":12,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9775 / be4a6a63e","quantKey":"q3","quantization":"Q3_K_M","contextLength":4608,"promptTokens":4096,"outputTokens":512,"kvCacheDtype":"f16","backend":"cuda","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":44.032147,"prefillTokS":1527.579889,"ttftMs":2704.076171577261,"peakVramGb":6.331,"reproducibility":6,"verified":false,"createdAt":"2026-07-24T13:51:20.067Z","command":"/home/dario/llama.cpp/build/bin/llama-bench -m /mnt/hdd/models/Qwen3.5-9B-Q3_K_M.gguf -p 4096 -n 512 -b 4096 -ub 1024 -t 16 -ngl 99 -fa on -r 2 -o json --no-warmup","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.5-9B"},{"id":"cmqgegonk005ep201crkea5mc","hfId":"Qwen/Qwen3.5-9B","presetKey":"qwen3.5_9b","model":"Qwen3.5-9B","paramsB":9,"activeParamsB":null,"hardwareTemplate":"AMD Radeon 780M (Ryzen 7840HS / 8745H)","hardware":"AMD Ryzen 7 8745H w/ Radeon 780M","deviceCount":1,"memoryGB":null,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":32768,"promptTokens":356,"outputTokens":512,"kvCacheDtype":null,"backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":13.9,"prefillTokS":218.4,"ttftMs":1630,"peakVramGb":4,"reproducibility":6,"verified":false,"createdAt":"2026-06-16T08:48:22.736Z","command":"llama-server -m Qwen3.5-9B-Q4_K_M.gguf -c 32768 --temp 0.0","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3.5-9B"},{"id":"cms3gn4lm010is201iwvyi6ee","hfId":"Qwen/Qwen3-8B","presetKey":"qwen3_8b","model":"Qwen3-8B","paramsB":8,"activeParamsB":null,"hardwareTemplate":"RTX 3060 Ti","hardware":"RTX 3060 Ti","deviceCount":1,"memoryGB":8,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":8192,"outputTokens":128,"kvCacheDtype":"f16","backend":"cuda","splitMode":"layer","cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":52.99,"prefillTokS":2055.42,"ttftMs":5493.9,"peakVramGb":7.45,"reproducibility":5,"verified":false,"createdAt":"2026-07-27T16:47:46.954Z","command":"llama-bench -m -p 8192 -n 128 -ngl 36 -sm layer -fa on -ctk f16 -ctv f16 -r 5","source":"https://www.localmaxxing.com/en/leaderboard?hfId=Qwen%2FQwen3-8B"},{"id":"cmqz7ogqg0280oe012egym1x1","hfId":"deepreinforce-ai/Ornith-1.0-35B-GGUF","presetKey":"ornith_1_35b_a3b","model":"Ornith-1.0-35B-GGUF","paramsB":35,"activeParamsB":null,"hardwareTemplate":"Intel Arc Pro B60","hardware":"Intel Arc Pro B60","deviceCount":1,"memoryGB":24,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"","quantKey":"q4","quantization":"Q4_K_M","contextLength":4096,"promptTokens":512,"outputTokens":128,"kvCacheDtype":null,"backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":60.84,"prefillTokS":1124.54,"ttftMs":455.3,"peakVramGb":null,"reproducibility":5,"verified":false,"createdAt":"2026-06-29T12:46:05.752Z","command":"/home/maxious/llama-master/build-vulkan/bin/llama-bench -m /run/media/maxious/6C4A1C714A1C39F2/koboldcpp/ornith-1.0-35b-Q4_K_M.gguf -p 512 -n 128 -fa 1","source":"https://www.localmaxxing.com/en/leaderboard?hfId=deepreinforce-ai%2FOrnith-1.0-35B-GGUF"},{"id":"cmspws9ic00cgmr012lbucdxg","hfId":"samuelcardillo/Qwopus-MoE-35B-A3B-GGUF","presetKey":"qwen3.5_35b_a3b","model":"Qwopus-MoE-35B-A3B-GGUF","paramsB":35,"activeParamsB":3,"hardwareTemplate":"AMD Strix Halo (Ryzen AI Max+ 395)","hardware":"Ryzen AI Max 395","deviceCount":1,"memoryGB":64,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b10347-e6f10a799","quantKey":"q4","quantization":"Q4_K_M","contextLength":8192,"promptTokens":1185,"outputTokens":512,"kvCacheDtype":"q8_0","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":74.7,"prefillTokS":739.9,"ttftMs":1601.49,"peakVramGb":20.3,"reproducibility":7,"verified":false,"createdAt":"2026-08-12T09:50:36.324Z","command":"GGML_VK_MMID_ROWLISTS=1 GGML_VK_MMID_SMALLN=1 GGML_VK_MMID_BM64=1 GGML_VK_MMID_WAVE32=1 GGML_VK_MMID_F16B=1 GGML_VK_MMID_M128=1 GGML_VK_FA_WAVE32=1 llama-server --model Qwopus-MoE-35B-A3B-Q4_K_M.gguf -ngl 999 -c 8192 -fa on -ctk q8_0 -ctv q8_0 --no-mmap -np 1 -b 2048 -ub 1024 --temp 0 --jinja --no-cache-prompt","source":"https://www.localmaxxing.com/en/leaderboard?hfId=samuelcardillo%2FQwopus-MoE-35B-A3B-GGUF"},{"id":"cmpbkmxr1014bmn01v1p1g35k","hfId":"moonshotai/Kimi-Dev-72B","presetKey":"qwen2.5_72b","model":"Kimi-Dev-72B","paramsB":73,"activeParamsB":null,"hardwareTemplate":"AMD Radeon AI PRO R9700","hardware":"Radeon AI Pro R9700","deviceCount":3,"memoryGB":96,"runtimeKey":"llama_cpp","engine":"llama.cpp","engineVersion":"b9139-7-gc792fcb85","quantKey":"q4","quantization":"Q4_0","contextLength":807,"promptTokens":551,"outputTokens":256,"kvCacheDtype":"q8_0","backend":"vulkan","splitMode":null,"cpuMoeLayers":null,"decodeDepthTokens":null,"batchSize":1,"observedTokS":10.628,"prefillTokS":null,"ttftMs":105.43,"peakVramGb":null,"reproducibility":7,"verified":false,"createdAt":"2026-05-18T19:02:38.942Z","command":"/home/mikekey/Experiments/llama.cpp/build-vulkan/bin/llama-server --port ${PORT} --host 0.0.0.0 --no-webui -ngl 99 --jinja --flash-attn auto --cache-reuse 256 --parallel 2 --main-gpu 0 --prio 3 -m /home/mikekey/models/gguf/misc/Kimi-Dev-72B-Q4_0.gguf --temp 0.7 --top-p 0.8 --top-k 20 --repeat-penalty 1.05 -ctk q8_0 -ctv q8_0 -ts 1/1/1 -c 131072","source":"https://www.localmaxxing.com/en/leaderboard?hfId=moonshotai%2FKimi-Dev-72B"}]}