@agentjido/llmdb 2026.8.2 → 2026.8.3
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/dist/full.js +177 -169
- package/dist/generated/manifest.d.ts +1 -1
- package/dist/generated/manifest.js +1 -1
- package/dist/generated/provider-loaders.js +8 -0
- package/dist/providers/abacus.d.ts +1 -1
- package/dist/providers/abacus.js +1 -1
- package/dist/providers/aiand.d.ts +1 -1
- package/dist/providers/aiand.js +1 -1
- package/dist/providers/aihubmix.d.ts +1 -1
- package/dist/providers/aihubmix.js +1 -1
- package/dist/providers/alibaba.d.ts +1 -1
- package/dist/providers/alibaba.js +1 -1
- package/dist/providers/alibaba_cn.js +1 -1
- package/dist/providers/alibaba_token_plan.d.ts +1 -1
- package/dist/providers/alibaba_token_plan.js +1 -1
- package/dist/providers/alibaba_token_plan_cn.d.ts +1 -1
- package/dist/providers/alibaba_token_plan_cn.js +1 -1
- package/dist/providers/amazon_bedrock.d.ts +1 -1
- package/dist/providers/amazon_bedrock.js +1 -1
- package/dist/providers/ambient.js +1 -1
- package/dist/providers/amd.d.ts +11 -0
- package/dist/providers/amd.js +5 -0
- package/dist/providers/anthropic.js +1 -1
- package/dist/providers/azure.d.ts +1 -1
- package/dist/providers/azure.js +1 -1
- package/dist/providers/azure_cognitive_services.d.ts +1 -1
- package/dist/providers/azure_cognitive_services.js +1 -1
- package/dist/providers/baseten.d.ts +1 -1
- package/dist/providers/baseten.js +1 -1
- package/dist/providers/berget.js +1 -1
- package/dist/providers/blueclaw.js +1 -1
- package/dist/providers/chutes.d.ts +1 -1
- package/dist/providers/chutes.js +1 -1
- package/dist/providers/clarifai.js +1 -1
- package/dist/providers/cloudferro_sherlock.js +1 -1
- package/dist/providers/cloudflare_ai_gateway.d.ts +1 -1
- package/dist/providers/cloudflare_ai_gateway.js +1 -1
- package/dist/providers/cloudflare_workers_ai.d.ts +1 -1
- package/dist/providers/cloudflare_workers_ai.js +1 -1
- package/dist/providers/coralbricks.d.ts +11 -0
- package/dist/providers/coralbricks.js +5 -0
- package/dist/providers/cortecs.d.ts +1 -1
- package/dist/providers/cortecs.js +1 -1
- package/dist/providers/crof.js +1 -1
- package/dist/providers/crossmodel.d.ts +1 -1
- package/dist/providers/crossmodel.js +1 -1
- package/dist/providers/crusoe.d.ts +11 -0
- package/dist/providers/crusoe.js +5 -0
- package/dist/providers/daoxe.js +1 -1
- package/dist/providers/deepinfra.d.ts +1 -1
- package/dist/providers/deepinfra.js +1 -1
- package/dist/providers/deepseek.js +1 -1
- package/dist/providers/digitalocean.d.ts +1 -1
- package/dist/providers/digitalocean.js +1 -1
- package/dist/providers/edenai.d.ts +11 -0
- package/dist/providers/edenai.js +5 -0
- package/dist/providers/empiriolabs.d.ts +1 -1
- package/dist/providers/empiriolabs.js +1 -1
- package/dist/providers/evroc.d.ts +1 -1
- package/dist/providers/evroc.js +1 -1
- package/dist/providers/fastrouter.js +1 -1
- package/dist/providers/fireworks_ai.d.ts +1 -1
- package/dist/providers/fireworks_ai.js +1 -1
- package/dist/providers/friendli.d.ts +1 -1
- package/dist/providers/friendli.js +1 -1
- package/dist/providers/github_copilot.d.ts +1 -1
- package/dist/providers/github_copilot.js +1 -1
- package/dist/providers/gmicloud.js +1 -1
- package/dist/providers/google.d.ts +1 -1
- package/dist/providers/google.js +1 -1
- package/dist/providers/google_vertex.d.ts +1 -1
- package/dist/providers/google_vertex.js +1 -1
- package/dist/providers/greenpt.js +1 -1
- package/dist/providers/groq.js +1 -1
- package/dist/providers/hetzner.d.ts +1 -1
- package/dist/providers/hetzner.js +1 -1
- package/dist/providers/huggingface.d.ts +1 -1
- package/dist/providers/huggingface.js +1 -1
- package/dist/providers/hyper.d.ts +1 -1
- package/dist/providers/hyper.js +1 -1
- package/dist/providers/impossibl.js +1 -1
- package/dist/providers/inceptron.d.ts +1 -1
- package/dist/providers/inceptron.js +1 -1
- package/dist/providers/inferx.d.ts +1 -1
- package/dist/providers/inferx.js +1 -1
- package/dist/providers/infomaniak.js +1 -1
- package/dist/providers/io_net.js +1 -1
- package/dist/providers/kenari.js +1 -1
- package/dist/providers/kilo.d.ts +1 -1
- package/dist/providers/kilo.js +1 -1
- package/dist/providers/llmgateway.d.ts +1 -1
- package/dist/providers/llmgateway.js +1 -1
- package/dist/providers/llmtr.d.ts +1 -1
- package/dist/providers/llmtr.js +1 -1
- package/dist/providers/lmstudio.js +1 -1
- package/dist/providers/meganova.js +1 -1
- package/dist/providers/merge_gateway.d.ts +1 -1
- package/dist/providers/merge_gateway.js +1 -1
- package/dist/providers/meta.d.ts +1 -1
- package/dist/providers/meta.js +1 -1
- package/dist/providers/modal.js +1 -1
- package/dist/providers/modelscope.js +1 -1
- package/dist/providers/nano_gpt.d.ts +1 -1
- package/dist/providers/nano_gpt.js +1 -1
- package/dist/providers/nearai.js +1 -1
- package/dist/providers/nebius.d.ts +1 -1
- package/dist/providers/nebius.js +1 -1
- package/dist/providers/neon.d.ts +1 -1
- package/dist/providers/neon.js +1 -1
- package/dist/providers/neuralwatt.d.ts +1 -1
- package/dist/providers/neuralwatt.js +1 -1
- package/dist/providers/novita_ai.js +1 -1
- package/dist/providers/nvidia.d.ts +1 -1
- package/dist/providers/nvidia.js +1 -1
- package/dist/providers/ofox.d.ts +1 -1
- package/dist/providers/ofox.js +1 -1
- package/dist/providers/opencode.d.ts +1 -1
- package/dist/providers/opencode.js +1 -1
- package/dist/providers/opencode_go.d.ts +1 -1
- package/dist/providers/opencode_go.js +1 -1
- package/dist/providers/openrouter.d.ts +1 -1
- package/dist/providers/openrouter.js +1 -1
- package/dist/providers/perplexity_agent.d.ts +1 -1
- package/dist/providers/perplexity_agent.js +1 -1
- package/dist/providers/pioneer.d.ts +1 -1
- package/dist/providers/pioneer.js +1 -1
- package/dist/providers/privatemode_ai.d.ts +1 -1
- package/dist/providers/privatemode_ai.js +1 -1
- package/dist/providers/regolo_ai.d.ts +1 -1
- package/dist/providers/regolo_ai.js +1 -1
- package/dist/providers/requesty.d.ts +1 -1
- package/dist/providers/requesty.js +1 -1
- package/dist/providers/runinfra.d.ts +11 -0
- package/dist/providers/runinfra.js +5 -0
- package/dist/providers/salad_cloud.d.ts +11 -0
- package/dist/providers/salad_cloud.js +5 -0
- package/dist/providers/scnet_token_plan.d.ts +11 -0
- package/dist/providers/scnet_token_plan.js +5 -0
- package/dist/providers/siliconflow.js +1 -1
- package/dist/providers/siliconflow_cn.js +1 -1
- package/dist/providers/snowflake_cortex.d.ts +1 -1
- package/dist/providers/snowflake_cortex.js +1 -1
- package/dist/providers/stackit.js +1 -1
- package/dist/providers/submodel.js +1 -1
- package/dist/providers/synthetic.js +1 -1
- package/dist/providers/tensorx.js +1 -1
- package/dist/providers/thinkingmachines.js +1 -1
- package/dist/providers/tinfoil.d.ts +1 -1
- package/dist/providers/tinfoil.js +1 -1
- package/dist/providers/togetherai.d.ts +1 -1
- package/dist/providers/togetherai.js +1 -1
- package/dist/providers/umans_ai.d.ts +1 -1
- package/dist/providers/umans_ai.js +1 -1
- package/dist/providers/umans_ai_coding_plan.d.ts +1 -1
- package/dist/providers/umans_ai_coding_plan.js +1 -1
- package/dist/providers/upstage.d.ts +1 -1
- package/dist/providers/upstage.js +1 -1
- package/dist/providers/venice.d.ts +1 -1
- package/dist/providers/venice.js +1 -1
- package/dist/providers/vercel.d.ts +1 -1
- package/dist/providers/vercel.js +1 -1
- package/dist/providers/vivgrid.d.ts +1 -1
- package/dist/providers/vivgrid.js +1 -1
- package/dist/providers/vultr.js +1 -1
- package/dist/providers/wandb.d.ts +1 -1
- package/dist/providers/wandb.js +1 -1
- package/dist/providers/watsonx.d.ts +11 -0
- package/dist/providers/watsonx.js +5 -0
- package/dist/providers/xai.d.ts +1 -1
- package/dist/providers/xai.js +1 -1
- package/dist/providers/zai_coding_plan.d.ts +1 -1
- package/dist/providers/zai_coding_plan.js +1 -1
- package/dist/providers/zeldoc.d.ts +1 -1
- package/dist/providers/zeldoc.js +1 -1
- package/dist/providers/zenmux.d.ts +1 -1
- package/dist/providers/zenmux.js +1 -1
- package/dist/providers/zhipuai_coding_plan.d.ts +1 -1
- package/dist/providers/zhipuai_coding_plan.js +1 -1
- package/dist/snapshot.js +352 -336
- package/package.json +2 -2
package/dist/providers/wandb.js
CHANGED
|
@@ -1,5 +1,5 @@
|
|
|
1
1
|
import { createProviderCatalog } from "../provider.js";
|
|
2
2
|
|
|
3
|
-
export const data = {"alias_of":null,"base_url":"https://api.inference.wandb.ai/v1","catalog_only":true,"config_schema":null,"doc":"https://docs.wandb.ai/guides/integrations/inference/","env":["WANDB_API_KEY"],"exclude_models":null,"extra":null,"id":"wandb","models":{"JetBrains/Mellum2-12B-A2.5B-Instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.05,"output":0.1},"deprecated":false,"extra":{"attachment":false,"description":"Mellum2-12B-A2.5B-Instruct is a fast MoE model with 131K context built for coding, tool use, and low-latency AI workflows.","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"JetBrains/Mellum2-12B-A2.5B-Instruct","knowledge":null,"last_updated":"2026-06-01","lifecycle":null,"limits":{"context":131072,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mellum2 12B A2.5B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-06-01","retired":false,"tags":null},"MiniMaxAI/MiniMax-M2.5":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.3,"input":0.3,"output":1.2},"deprecated":false,"extra":{"attachment":false,"description":"MoE model with a highly sparse architecture designed for high-throughput and low latency with strong coding capabilities.","family":"minimax-m2.5","llmfit":{"architecture":"minimax_m2","context_length":196608,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/MiniMax-M2.5-GGUF"},{"provider":"mradermacher","repo":"mradermacher/MiniMax-M2.5-GGUF"}],"hf_downloads":772099,"hf_likes":1502,"matched_hugging_face_id":"MiniMaxAI/MiniMax-M2.5","memory":{"min_ram_gb":127.8,"min_vram_gb":117.1,"recommended_ram_gb":213.0},"model_id":"MiniMaxAI/MiniMax-M2.5","moe":{"active_experts":8,"active_parameters":18224821702,"is_moe":true,"num_experts":256},"parameter_count":"228.7B","parameters_raw":228703644928,"pipeline_tag":"text-generation","provider":"minimaxai","quantization":"Q4_K_M","release_date":"2026-02-12","source":"llmfit","use_case":"Lightweight, edge deployment"},"open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"MiniMaxAI/MiniMax-M2.5","knowledge":null,"last_updated":"2026-02-12","lifecycle":null,"limits":{"context":196608,"output":196608},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MiniMax M2.5","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-02-12","retired":false,"tags":null},"MiniMaxAI/MiniMax-M3":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.23,"output":0.96},"deprecated":false,"extra":{"attachment":true,"description":"MiniMax M3 is a multimodal MoE model with 23B active parameters optimized for coding and agentic workflows.","family":"minimax-m3","llmfit":{"architecture":"minimax_m3_vl","context_length":1048576,"discovered":false,"gguf_sources":[],"hf_downloads":164790,"hf_likes":1418,"matched_hugging_face_id":"MiniMaxAI/MiniMax-M3","memory":{"min_ram_gb":238.6,"min_vram_gb":218.7,"recommended_ram_gb":397.7},"model_id":"MiniMaxAI/MiniMax-M3","moe":{"active_experts":4,"active_parameters":10000000000,"is_moe":true,"num_experts":128},"parameter_count":"427.0B","parameters_raw":427040140160,"pipeline_tag":"image-text-to-text","provider":"minimaxai","quantization":"Q4_K_M","release_date":"2026-06-02","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"MiniMaxAI/MiniMax-M3","knowledge":null,"last_updated":"2026-06-12","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"MiniMax M3","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-06-12","retired":false,"tags":null},"OpenPipe/Qwen3-14B-Instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.05,"output":0.22},"deprecated":false,"extra":{"attachment":false,"description":"An efficient multilingual, dense, instruction-tuned model, optimized by OpenPipe for building agents with finetuning.","family":"qwen","llmfit":{"architecture":"qwen3","context_length":40960,"discovered":true,"gguf_sources":[],"hf_downloads":17462,"hf_likes":0,"matched_hugging_face_id":"OpenPipe/Qwen3-14B-Instruct","memory":{"min_ram_gb":8.3,"min_vram_gb":7.6,"recommended_ram_gb":13.8},"model_id":"OpenPipe/Qwen3-14B-Instruct","parameter_count":"14.8B","parameters_raw":14768307200,"pipeline_tag":"text-generation","provider":"openpipe","quantization":"Q4_K_M","source":"llmfit","use_case":"Instruction following, chat"},"open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"OpenPipe/Qwen3-14B-Instruct","knowledge":null,"last_updated":"2025-04-29","lifecycle":null,"limits":{"context":32768,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3 14B Instruct","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2025-04-29","retired":false,"tags":null},"Qwen/Qwen3-30B-A3B-Instruct-2507":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.1,"input":0.1,"output":0.3},"deprecated":false,"extra":{"attachment":false,"description":"Qwen3-30B-A3B-Instruct-2507 is a 30.5B MoE instruction-tuned model with enhanced reasoning, coding, and long-context understanding.","family":"qwen","llmfit":{"architecture":"qwen3_moe","context_length":262144,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/Qwen3-30B-A3B-Instruct-2507-GGUF"},{"provider":"mradermacher","repo":"mradermacher/Qwen3-30B-A3B-Instruct-2507-GGUF"}],"hf_downloads":1902844,"hf_likes":822,"matched_hugging_face_id":"Qwen/Qwen3-30B-A3B-Instruct-2507","memory":{"min_ram_gb":17.1,"min_vram_gb":15.6,"recommended_ram_gb":28.4},"model_id":"Qwen/Qwen3-30B-A3B-Instruct-2507","moe":{"active_experts":8,"active_parameters":3339450907,"is_moe":true,"num_experts":128},"parameter_count":"30.5B","parameters_raw":30532122624,"pipeline_tag":"text-generation","provider":"Alibaba","quantization":"Q4_K_M","release_date":"2025-07-28","source":"llmfit","use_case":"Instruction following, chat"},"open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"Qwen/Qwen3-30B-A3B-Instruct-2507","knowledge":null,"last_updated":"2025-07-29","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3 30B A3B Instruct 2507","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2025-07-29","retired":false,"tags":null},"Qwen/Qwen3-Coder-480B-A35B-Instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":1,"input":1,"output":1.5},"deprecated":false,"extra":{"attachment":false,"description":"Mixture-of-Experts model optimized for agentic coding tasks such as function calling, tool use, and long-context reasoning.","family":"qwen","llmfit":{"architecture":"qwen3_moe","context_length":262144,"discovered":false,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/Qwen3-Coder-480B-A35B-Instruct-GGUF"}],"hf_downloads":91304,"hf_likes":1357,"matched_hugging_face_id":"Qwen/Qwen3-Coder-480B-A35B-Instruct","memory":{"min_ram_gb":268.3,"min_vram_gb":245.9,"recommended_ram_gb":447.2},"model_id":"Qwen/Qwen3-Coder-480B-A35B-Instruct","moe":{"active_experts":8,"active_parameters":35000000000,"is_moe":true,"num_experts":160},"parameter_count":"480.2B","parameters_raw":480154875392,"pipeline_tag":"text-generation","provider":"Alibaba","quantization":"Q4_K_M","release_date":"2025-07-22","source":"llmfit","use_case":"Code generation and completion"},"open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"Qwen/Qwen3-Coder-480B-A35B-Instruct","knowledge":"2025-04","last_updated":"2025-07-22","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3 Coder 480B A35B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2025-07-22","retired":false,"tags":null},"Qwen/Qwen3.5-35B-A3B":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.25,"input":0.25,"output":1.25},"deprecated":false,"extra":{"attachment":true,"description":"Qwen3.5-35B-A3B is an open-weights multimodal MoE model built for efficient, high-throughput inference across chat, reasoning, and agentic tasks.","family":"qwen3.5","llmfit":{"architecture":"qwen3_5_moe","context_length":262144,"discovered":false,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/Qwen3.5-35B-A3B-GGUF"},{"provider":"ggml-org","repo":"ggml-org/Qwen3.5-35B-A3B-GGUF"},{"provider":"mradermacher","repo":"mradermacher/Qwen3.5-35B-A3B-GGUF"}],"hf_downloads":2582188,"hf_likes":1480,"matched_hugging_face_id":"Qwen/Qwen3.5-35B-A3B","memory":{"min_ram_gb":20.1,"min_vram_gb":18.4,"recommended_ram_gb":33.5},"model_id":"Qwen/Qwen3.5-35B-A3B","moe":{"active_experts":8,"active_parameters":3000000000,"is_moe":true,"num_experts":256},"parameter_count":"36.0B","parameters_raw":35951822704,"pipeline_tag":"image-text-to-text","provider":"Alibaba","quantization":"Q4_K_M","release_date":"2026-02-24","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"Qwen/Qwen3.5-35B-A3B","knowledge":null,"last_updated":"2026-02-24","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5-35B-A3B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-02-24","retired":false,"tags":null},"Qwen/Qwen3.6-27B":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.12,"input":0.6,"output":3.6},"deprecated":false,"extra":{"attachment":true,"description":"Qwen3.6-27B is a 27B dense multimodal model with 262K context built for flagship-level agentic coding.","family":"qwen3.6","llmfit":{"architecture":"qwen3_5","context_length":262144,"discovered":false,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/Qwen3.6-27B-GGUF"},{"provider":"ggml-org","repo":"ggml-org/Qwen3.6-27B-GGUF"},{"provider":"mradermacher","repo":"mradermacher/Qwen3.6-27B-GGUF"}],"hf_downloads":6895121,"hf_likes":2145,"matched_hugging_face_id":"Qwen/Qwen3.6-27B","memory":{"min_ram_gb":15.5,"min_vram_gb":14.2,"recommended_ram_gb":25.9},"model_id":"Qwen/Qwen3.6-27B","parameter_count":"27.8B","parameters_raw":27781427952,"pipeline_tag":"image-text-to-text","provider":"Alibaba","quantization":"Q4_K_M","release_date":"2026-04-21","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"Qwen/Qwen3.6-27B","knowledge":null,"last_updated":"2026-04-22","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.6 27B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-04-22","retired":false,"tags":null},"Qwen/Qwen3.6-35B-A3B":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.25,"input":0.25,"output":1.25},"deprecated":false,"extra":{"attachment":true,"description":"Qwen3.6-35B-A3B is an MoE multimodal model with 262K context optimized for agentic coding workflows.","family":"qwen3.6","llmfit":{"architecture":"qwen3_5_moe","context_length":262144,"discovered":false,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/Qwen3.6-35B-A3B-GGUF"},{"provider":"ggml-org","repo":"ggml-org/Qwen3.6-35B-A3B-GGUF"},{"provider":"mradermacher","repo":"mradermacher/Qwen3.6-35B-A3B-GGUF"}],"hf_downloads":5928967,"hf_likes":2614,"matched_hugging_face_id":"Qwen/Qwen3.6-35B-A3B","memory":{"min_ram_gb":20.1,"min_vram_gb":18.4,"recommended_ram_gb":33.5},"model_id":"Qwen/Qwen3.6-35B-A3B","moe":{"active_experts":8,"active_parameters":3000000000,"is_moe":true,"num_experts":256},"parameter_count":"36.0B","parameters_raw":35951822704,"pipeline_tag":"image-text-to-text","provider":"Alibaba","quantization":"Q4_K_M","release_date":"2026-04-15","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"Qwen/Qwen3.6-35B-A3B","knowledge":null,"last_updated":"2026-04-15","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.6 35B A3B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-04-15","retired":false,"tags":null},"deepseek-ai/DeepSeek-V3.1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.55,"input":0.55,"output":1.65},"deprecated":false,"extra":{"attachment":false,"description":"A large hybrid model that supports both thinking and non-thinking modes via prompt templates.","family":"deepseek","llmfit":{"architecture":"deepseek_v3","context_length":6553600,"discovered":true,"gguf_sources":[],"hf_downloads":273040,"hf_likes":825,"matched_hugging_face_id":"deepseek-ai/DeepSeek-V3.1","memory":{"min_ram_gb":382.5,"min_vram_gb":350.6,"recommended_ram_gb":637.5},"model_id":"deepseek-ai/DeepSeek-V3.1","moe":{"active_experts":8,"active_parameters":54548594820,"is_moe":true,"num_experts":256},"parameter_count":"684.5B","parameters_raw":684531386000,"pipeline_tag":"text-generation","provider":"DeepSeek","quantization":"Q4_K_M","release_date":"2025-08-21","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"deepseek-ai/DeepSeek-V3.1","knowledge":null,"last_updated":"2025-08-21","lifecycle":null,"limits":{"context":161000,"output":161000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V3.1","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2025-08-21","retired":false,"tags":null},"deepseek-ai/DeepSeek-V4-Flash":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.07,"input":0.14,"output":0.28},"deprecated":false,"extra":{"attachment":false,"description":"DeepSeek V4-Flash is an MoE model with 1M context length great for coding, reasoning, and agentic workloads.","family":"deepseek","llmfit":{"architecture":"deepseek_v4","context_length":16777216,"discovered":false,"gguf_sources":[],"hf_downloads":2746291,"hf_likes":1982,"matched_hugging_face_id":"deepseek-ai/DeepSeek-V4-Flash","memory":{"min_ram_gb":162.6,"min_vram_gb":149.0,"recommended_ram_gb":271.0},"model_id":"deepseek-ai/DeepSeek-V4-Flash","moe":{"active_experts":6,"active_parameters":13000000000,"is_moe":true,"num_experts":256},"parameter_count":"290.9B","parameters_raw":290944616402,"pipeline_tag":"text-generation","provider":"DeepSeek","quantization":"Q4_K_M","release_date":"2026-04-22","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"deepseek-ai/DeepSeek-V4-Flash","knowledge":"2025-05","last_updated":"2026-04-24","lifecycle":null,"limits":{"context":1048576,"output":1048576},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Flash","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-04-24","retired":false,"tags":null},"deepseek-ai/DeepSeek-V4-Flash-0731":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.07,"input":0.13,"output":0.28},"deprecated":false,"extra":{"attachment":false,"description":"DeepSeek V4-Flash-0731 is an MoE model great for coding, reasoning, and agentic workloads.","family":"deepseek","llmfit":{"architecture":"deepseek_v4","context_length":16777216,"discovered":true,"gguf_sources":[],"hf_downloads":236076,"hf_likes":1963,"matched_hugging_face_id":"deepseek-ai/DeepSeek-V4-Flash-0731","memory":{"min_ram_gb":170.0,"min_vram_gb":155.8,"recommended_ram_gb":283.3},"model_id":"deepseek-ai/DeepSeek-V4-Flash-0731","moe":{"active_experts":6,"active_parameters":21981788050,"is_moe":true,"num_experts":256},"parameter_count":"304.2B","parameters_raw":304180418494,"pipeline_tag":"text-generation","provider":"DeepSeek","quantization":"Q4_K_M","release_date":"2026-07-31","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"deepseek-ai/DeepSeek-V4-Flash-0731","knowledge":"2025-05","last_updated":"2026-07-31","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Flash 0731","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-07-31","retired":false,"tags":null},"deepseek-ai/DeepSeek-V4-Pro":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.14,"input":1.74,"output":3.48},"deprecated":false,"extra":{"attachment":false,"description":"DeepSeek V4-Pro is a 1.6T-parameter MoE model with 49B active parameters excelling at advanced reasoning, coding, and complex agentic workloads.","family":"deepseek","llmfit":{"architecture":"deepseek_v4","context_length":16777216,"discovered":false,"gguf_sources":[],"hf_downloads":1596582,"hf_likes":5373,"matched_hugging_face_id":"deepseek-ai/DeepSeek-V4-Pro","memory":{"min_ram_gb":893.4,"min_vram_gb":819.0,"recommended_ram_gb":1489.0},"model_id":"deepseek-ai/DeepSeek-V4-Pro","moe":{"active_experts":6,"active_parameters":49000000000,"is_moe":true,"num_experts":384},"parameter_count":"1598.8B","parameters_raw":1598839674782,"pipeline_tag":"text-generation","provider":"DeepSeek","quantization":"Q4_K_M","release_date":"2026-04-22","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"deepseek-ai/DeepSeek-V4-Pro","knowledge":"2025-05","last_updated":"2026-04-24","lifecycle":null,"limits":{"context":1048576,"output":1048576},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Pro","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-04-24","retired":false,"tags":null},"google/gemma-4-31B-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.1,"input":0.1,"output":0.34},"deprecated":false,"extra":{"attachment":true,"description":"Gemma 4 31B Dense is designed for advanced reasoning, agentic workflows, and longer context and is natively trained on 140+ languages.","family":"gemma","llmfit":{"architecture":"gemma4","context_length":262144,"discovered":false,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/gemma-4-31B-it-GGUF"}],"hf_downloads":11886065,"hf_likes":3433,"matched_hugging_face_id":"google/gemma-4-31B-it","memory":{"min_ram_gb":18.3,"min_vram_gb":16.7,"recommended_ram_gb":30.4},"model_id":"google/gemma-4-31B-it","parameter_count":"32.7B","parameters_raw":32682372656,"pipeline_tag":"image-text-to-text","provider":"Google","quantization":"Q4_K_M","release_date":"2026-03-11","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"google/gemma-4-31B-it","knowledge":null,"last_updated":"2026-04-02","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 4 31B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-04-02","retired":false,"tags":null},"ibm-granite/granite-4.1-8b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.05,"output":0.1},"deprecated":false,"extra":{"attachment":false,"description":"Granite 4.1 8B is a long-context instruct model capable of enhanced tool calling, instruction following, and chat capabilities.","family":"granite","llmfit":{"architecture":"granite","context_length":131072,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/granite-4.1-8b-GGUF"},{"provider":"mradermacher","repo":"mradermacher/granite-4.1-8b-GGUF"}],"hf_downloads":4085575,"hf_likes":243,"matched_hugging_face_id":"ibm-granite/granite-4.1-8b","memory":{"min_ram_gb":4.9,"min_vram_gb":4.5,"recommended_ram_gb":8.2},"model_id":"ibm-granite/granite-4.1-8b","parameter_count":"8.8B","parameters_raw":8791592960,"pipeline_tag":"text-generation","provider":"ibm-granite","quantization":"Q4_K_M","release_date":"2026-04-06","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"ibm-granite/granite-4.1-8b","knowledge":null,"last_updated":"2026-04-29","lifecycle":null,"limits":{"context":131072,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Granite 4.1 8B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-04-29","retired":false,"tags":null},"meta-llama/Llama-3.1-70B-Instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.8,"input":0.8,"output":0.8},"deprecated":false,"extra":{"attachment":false,"description":"Efficient conversational model optimized for responsive multilingual chatbot interactions.","family":"llama","llmfit":{"architecture":"llama","context_length":4096,"discovered":false,"gguf_sources":[],"hf_downloads":812989,"hf_likes":938,"matched_hugging_face_id":"meta-llama/Llama-3.1-70B-Instruct","memory":{"min_ram_gb":39.4,"min_vram_gb":36.1,"recommended_ram_gb":65.7},"model_id":"meta-llama/Llama-3.1-70B-Instruct","parameter_count":"70.6B","parameters_raw":70553706496,"pipeline_tag":"text-generation","provider":"Meta","quantization":"Q4_K_M","release_date":"2024-07-16","source":"llmfit","use_case":"Instruction following, chat"},"open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"meta-llama/Llama-3.1-70B-Instruct","knowledge":null,"last_updated":"2024-07-23","lifecycle":null,"limits":{"context":128000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 70B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2024-07-23","retired":false,"tags":null},"meta-llama/Llama-3.1-8B-Instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.22,"input":0.22,"output":0.22},"deprecated":false,"extra":{"attachment":false,"description":"Efficient conversational model optimized for responsive multilingual chatbot interactions.","family":"llama","llmfit":{"architecture":"llama","context_length":4096,"discovered":false,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/Llama-3.1-8B-Instruct-GGUF"}],"hf_downloads":7886695,"hf_likes":6455,"matched_hugging_face_id":"meta-llama/Llama-3.1-8B-Instruct","memory":{"min_ram_gb":4.5,"min_vram_gb":4.1,"recommended_ram_gb":7.5},"model_id":"meta-llama/Llama-3.1-8B-Instruct","parameter_count":"8.0B","parameters_raw":8030261248,"pipeline_tag":"text-generation","provider":"Meta","quantization":"Q4_K_M","release_date":"2024-07-18","source":"llmfit","use_case":"Instruction following, chat"},"open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"meta-llama/Llama-3.1-8B-Instruct","knowledge":"2023-12","last_updated":"2024-07-23","lifecycle":null,"limits":{"context":128000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 8B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2024-07-23","retired":false,"tags":null},"meta-llama/Llama-3.3-70B-Instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.71,"input":0.71,"output":0.71},"deprecated":false,"extra":{"attachment":false,"description":"Multilingual model excelling in conversational tasks, detailed instruction-following, and coding.","family":"llama","llmfit":{"architecture":"llama","context_length":4096,"discovered":false,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/Llama-3.3-70B-Instruct-GGUF"},{"provider":"bartowski","repo":"bartowski/Llama-3.3-70B-Instruct-GGUF"},{"provider":"mradermacher","repo":"mradermacher/Llama-3.3-70B-Instruct-GGUF"}],"hf_downloads":478538,"hf_likes":2936,"matched_hugging_face_id":"meta-llama/Llama-3.3-70B-Instruct","memory":{"min_ram_gb":39.4,"min_vram_gb":36.1,"recommended_ram_gb":65.7},"model_id":"meta-llama/Llama-3.3-70B-Instruct","parameter_count":"70.6B","parameters_raw":70553706496,"pipeline_tag":"text-generation","provider":"Meta","quantization":"Q4_K_M","release_date":"2024-11-26","source":"llmfit","use_case":"Instruction following, chat"},"open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"meta-llama/Llama-3.3-70B-Instruct","knowledge":"2023-12","last_updated":"2024-12-01","lifecycle":null,"limits":{"context":128000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.3 70B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2024-12-01","retired":false,"tags":null},"moonshotai/Kimi-K2.6":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":0.65,"output":3.41},"deprecated":false,"extra":{"attachment":true,"description":"Kimi K2.6 is a multimodal Mixture-of-Experts language model featuring 32 billion activated parameters and a total of 1 trillion parameters.","family":"kimi-k2","llmfit":{"architecture":"kimi_k25","context_length":16777216,"discovered":true,"gguf_sources":[],"hf_downloads":875729,"hf_likes":0,"matched_hugging_face_id":"moonshotai/Kimi-K2.6","memory":{"min_ram_gb":591.5,"min_vram_gb":542.2,"recommended_ram_gb":985.9},"model_id":"moonshotai/Kimi-K2.6","moe":{"active_experts":8,"active_parameters":73880719970,"is_moe":true,"num_experts":384},"parameter_count":"1058.6B","parameters_raw":1058589420528,"pipeline_tag":"image-text-to-text","provider":"moonshotai","quantization":"Q4_K_M","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"moonshotai/Kimi-K2.6","knowledge":"2025-01","last_updated":"2026-04-20","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Kimi K2.6","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-04-20","retired":false,"tags":null},"moonshotai/Kimi-K2.7-Code":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":0.71,"output":3.5},"deprecated":false,"extra":{"attachment":true,"description":"Kimi K2.7 Code is a 1T-parameter MoE model with 32B active parameters purpose-built for long-horizon agentic coding and software engineering.","family":"kimi-k2","llmfit":{"architecture":"kimi_k25","context_length":16777216,"discovered":true,"gguf_sources":[],"hf_downloads":695030,"hf_likes":0,"matched_hugging_face_id":"moonshotai/Kimi-K2.7-Code","memory":{"min_ram_gb":591.5,"min_vram_gb":542.2,"recommended_ram_gb":985.9},"model_id":"moonshotai/Kimi-K2.7-Code","moe":{"active_experts":8,"active_parameters":73880719970,"is_moe":true,"num_experts":384},"parameter_count":"1058.6B","parameters_raw":1058589420528,"pipeline_tag":"image-text-to-text","provider":"moonshotai","quantization":"Q4_K_M","source":"llmfit","use_case":"Code generation and completion"},"open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"moonshotai/Kimi-K2.7-Code","knowledge":"2025-01","last_updated":"2026-06-12","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Kimi K2.7 Code","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-06-12","retired":false,"tags":null},"moonshotai/Kimi-K3":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.3,"input":3,"output":15},"deprecated":false,"extra":{"attachment":true,"description":"Kimi K3 is a 2.8T-parameter multimodal MoE model with 104B active parameters built for long-horizon coding and agentic workflows.","family":"kimi-k3","llmfit":{"architecture":"kimi_k3","context_length":1048576,"discovered":true,"gguf_sources":[],"hf_downloads":967622,"hf_likes":0,"matched_hugging_face_id":"moonshotai/Kimi-K3","memory":{"min_ram_gb":1553.4,"min_vram_gb":1424.0,"recommended_ram_gb":2589.0},"model_id":"moonshotai/Kimi-K3","parameter_count":"2779.9B","parameters_raw":2779931837184,"pipeline_tag":"image-text-to-text","provider":"moonshotai","quantization":"Q4_K_M","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"moonshotai/Kimi-K3","knowledge":null,"last_updated":"2026-07-16","lifecycle":null,"limits":{"context":1048576,"output":1048576},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Kimi K3","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-07-16","retired":false,"tags":null},"nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"input":0.2,"output":0.8},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron 3 is a LatentMoE model designed to deliver strong agentic, reasoning, and conversational capabilities.","family":"nemotron","llmfit":{"architecture":"nemotron_h","context_length":262144,"discovered":true,"gguf_sources":[],"hf_downloads":210668,"hf_likes":271,"matched_hugging_face_id":"nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8","memory":{"min_ram_gb":69.1,"min_vram_gb":63.3,"recommended_ram_gb":115.1},"model_id":"nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8","moe":{"active_experts":22,"active_parameters":11226390744,"is_moe":true,"num_experts":512},"parameter_count":"123.6B","parameters_raw":123611012096,"pipeline_tag":"text-generation","provider":"nvidia","quantization":"Q4_K_M","release_date":"2026-03-10","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8","knowledge":null,"last_updated":"2026-03-11","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Nemotron 3 Super","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-03-11","retired":false,"tags":null},"nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":0.75,"output":2.75},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron 3 Ultra is a powerful MoE model designed for long-running agents across coding, deep research, and enterprise automation.","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B","knowledge":null,"last_updated":"2026-06-04","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Nemotron 3 Ultra","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-06-04","retired":false,"tags":null},"openai/gpt-oss-120b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.03,"input":0.03,"output":0.17},"deprecated":false,"extra":{"attachment":false,"description":"Efficient Mixture-of-Experts model designed for high-reasoning, agentic and general-purpose use cases.","family":"gpt-oss","llmfit":{"architecture":"gpt_oss","context_length":4194304,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/gpt-oss-120b-GGUF"},{"provider":"ggml-org","repo":"ggml-org/gpt-oss-120b-GGUF"}],"hf_downloads":4197649,"hf_likes":5069,"matched_hugging_face_id":"openai/gpt-oss-120b","memory":{"min_ram_gb":67.3,"min_vram_gb":61.7,"recommended_ram_gb":112.1},"model_id":"openai/gpt-oss-120b","moe":{"active_experts":4,"active_parameters":9595358141,"is_moe":true,"num_experts":128},"parameter_count":"120.4B","parameters_raw":120412337472,"pipeline_tag":"text-generation","provider":"openai","quantization":"Q4_K_M","release_date":"2025-08-04","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"openai/gpt-oss-120b","knowledge":null,"last_updated":"2025-08-05","lifecycle":null,"limits":{"context":131072,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"gpt-oss-120b","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2025-08-05","retired":false,"tags":null},"openai/gpt-oss-20b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.03,"input":0.03,"output":0.13},"deprecated":false,"extra":{"attachment":false,"description":"Lower latency Mixture-of-Experts model trained on OpenAI's Harmony response format with reasoning capabilities.","family":"gpt-oss","llmfit":{"architecture":"gpt_oss","context_length":4194304,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/gpt-oss-20b-GGUF"},{"provider":"ggml-org","repo":"ggml-org/gpt-oss-20b-GGUF"},{"provider":"mradermacher","repo":"mradermacher/gpt-oss-20b-GGUF"}],"hf_downloads":8501701,"hf_likes":4869,"matched_hugging_face_id":"openai/gpt-oss-20b","memory":{"min_ram_gb":12.0,"min_vram_gb":11.0,"recommended_ram_gb":20.0},"model_id":"openai/gpt-oss-20b","moe":{"active_experts":4,"active_parameters":3630142231,"is_moe":true,"num_experts":32},"parameter_count":"21.5B","parameters_raw":21511953984,"pipeline_tag":"text-generation","provider":"openai","quantization":"Q4_K_M","release_date":"2025-08-04","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"openai/gpt-oss-20b","knowledge":null,"last_updated":"2025-08-05","lifecycle":null,"limits":{"context":131072,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"gpt-oss-20b","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2025-08-05","retired":false,"tags":null},"zai-org/GLM-5.1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.26,"input":1.4,"output":4.4},"deprecated":false,"extra":{"attachment":false,"description":"Powerful MoE model for long-horizon agentic engineering and advanced reasoning.","family":"glm","llmfit":{"architecture":"glm_moe_dsa","context_length":202752,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/GLM-5.1-GGUF"}],"hf_downloads":76699,"hf_likes":1840,"matched_hugging_face_id":"zai-org/GLM-5.1","memory":{"min_ram_gb":421.3,"min_vram_gb":386.1,"recommended_ram_gb":702.1},"model_id":"zai-org/GLM-5.1","moe":{"active_experts":8,"active_parameters":60073548574,"is_moe":true,"num_experts":256},"parameter_count":"753.9B","parameters_raw":753864139008,"pipeline_tag":"text-generation","provider":"zai-org","quantization":"Q4_K_M","release_date":"2026-04-03","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"zai-org/GLM-5.1","knowledge":null,"last_updated":"2026-04-07","lifecycle":null,"limits":{"context":202752,"output":202752},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 5.1","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-04-07","retired":false,"tags":null},"zai-org/GLM-5.2":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.14,"input":0.76,"output":2.42},"deprecated":false,"extra":{"attachment":false,"description":"GLM-5.2 is a Mixture-of-Experts language model featuring 40 billion activated parameters and a total of 744 billion parameters.","family":"glm","llmfit":{"architecture":"glm_moe_dsa","context_length":1048576,"discovered":true,"gguf_sources":[],"hf_downloads":2180509,"hf_likes":4785,"matched_hugging_face_id":"zai-org/GLM-5.2","memory":{"min_ram_gb":421.0,"min_vram_gb":385.9,"recommended_ram_gb":701.6},"model_id":"zai-org/GLM-5.2","moe":{"active_experts":8,"active_parameters":60030979632,"is_moe":true,"num_experts":256},"parameter_count":"753.3B","parameters_raw":753329940480,"pipeline_tag":"text-generation","provider":"zai-org","quantization":"Q4_K_M","release_date":"2026-06-16","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"zai-org/GLM-5.2","knowledge":null,"last_updated":"2026-06-16","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 5.2","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-06-16","retired":false,"tags":null}},"name":"Weights & Biases","pricing_defaults":null};
|
|
3
|
+
export const data = {"alias_of":null,"base_url":"https://api.inference.wandb.ai/v1","catalog_only":true,"config_schema":null,"doc":"https://docs.wandb.ai/guides/integrations/inference/","env":["WANDB_API_KEY"],"exclude_models":null,"extra":null,"id":"wandb","models":{"JetBrains/Mellum2-12B-A2.5B-Instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.05,"output":0.1},"deprecated":false,"extra":{"attachment":false,"description":"Mellum2-12B-A2.5B-Instruct is a fast MoE model with 131K context built for coding, tool use, and low-latency AI workflows.","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"JetBrains/Mellum2-12B-A2.5B-Instruct","knowledge":null,"last_updated":"2026-06-01","lifecycle":null,"limits":{"context":131072,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mellum2 12B A2.5B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-06-01","retired":false,"tags":null},"MiniMaxAI/MiniMax-M2.5":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.3,"input":0.3,"output":1.2},"deprecated":false,"extra":{"attachment":false,"description":"MoE model with a highly sparse architecture designed for high-throughput and low latency with strong coding capabilities.","family":"minimax-m2.5","llmfit":{"architecture":"minimax_m2","context_length":196608,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/MiniMax-M2.5-GGUF"}],"hf_downloads":718615,"hf_likes":1503,"matched_hugging_face_id":"MiniMaxAI/MiniMax-M2.5","memory":{"min_ram_gb":127.8,"min_vram_gb":117.1,"recommended_ram_gb":213.0},"model_id":"MiniMaxAI/MiniMax-M2.5","moe":{"active_experts":8,"active_parameters":18224821702,"is_moe":true,"num_experts":256},"parameter_count":"228.7B","parameters_raw":228703644928,"pipeline_tag":"text-generation","provider":"minimaxai","quantization":"Q4_K_M","release_date":"2026-02-12","source":"llmfit","use_case":"Lightweight, edge deployment"},"open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"MiniMaxAI/MiniMax-M2.5","knowledge":null,"last_updated":"2026-02-12","lifecycle":null,"limits":{"context":196608,"output":196608},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MiniMax M2.5","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-02-12","retired":false,"tags":null},"MiniMaxAI/MiniMax-M3":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.23,"output":0.96},"deprecated":false,"extra":{"attachment":true,"description":"MiniMax M3 is a multimodal MoE model with 23B active parameters optimized for coding and agentic workflows.","family":"minimax-m3","llmfit":{"architecture":"minimax_m3_vl","context_length":1048576,"discovered":false,"gguf_sources":[],"hf_downloads":170183,"hf_likes":1473,"matched_hugging_face_id":"MiniMaxAI/MiniMax-M3","memory":{"min_ram_gb":238.6,"min_vram_gb":218.7,"recommended_ram_gb":397.7},"model_id":"MiniMaxAI/MiniMax-M3","moe":{"active_experts":4,"active_parameters":10000000000,"is_moe":true,"num_experts":128},"parameter_count":"427.0B","parameters_raw":427040140160,"pipeline_tag":"image-text-to-text","provider":"minimaxai","quantization":"Q4_K_M","release_date":"2026-06-02","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"MiniMaxAI/MiniMax-M3","knowledge":null,"last_updated":"2026-06-12","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"MiniMax M3","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-06-12","retired":false,"tags":null},"OpenPipe/Qwen3-14B-Instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.05,"output":0.22},"deprecated":false,"extra":{"attachment":false,"description":"An efficient multilingual, dense, instruction-tuned model, optimized by OpenPipe for building agents with finetuning.","family":"qwen","llmfit":{"architecture":"qwen3","context_length":40960,"discovered":true,"gguf_sources":[],"hf_downloads":14348,"hf_likes":0,"matched_hugging_face_id":"OpenPipe/Qwen3-14B-Instruct","memory":{"min_ram_gb":8.3,"min_vram_gb":7.6,"recommended_ram_gb":13.8},"model_id":"OpenPipe/Qwen3-14B-Instruct","parameter_count":"14.8B","parameters_raw":14768307200,"pipeline_tag":"text-generation","provider":"openpipe","quantization":"Q4_K_M","source":"llmfit","use_case":"Instruction following, chat"},"open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"OpenPipe/Qwen3-14B-Instruct","knowledge":null,"last_updated":"2025-04-29","lifecycle":null,"limits":{"context":32768,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3 14B Instruct","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2025-04-29","retired":false,"tags":null},"Qwen/Qwen3-30B-A3B-Instruct-2507":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.1,"input":0.1,"output":0.3},"deprecated":false,"extra":{"attachment":false,"description":"Qwen3-30B-A3B-Instruct-2507 is a 30.5B MoE instruction-tuned model with enhanced reasoning, coding, and long-context understanding.","family":"qwen","llmfit":{"architecture":"qwen3_moe","context_length":262144,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/Qwen3-30B-A3B-Instruct-2507-GGUF"},{"provider":"mradermacher","repo":"mradermacher/Qwen3-30B-A3B-Instruct-2507-GGUF"}],"hf_downloads":1903290,"hf_likes":827,"matched_hugging_face_id":"Qwen/Qwen3-30B-A3B-Instruct-2507","memory":{"min_ram_gb":17.1,"min_vram_gb":15.6,"recommended_ram_gb":28.4},"model_id":"Qwen/Qwen3-30B-A3B-Instruct-2507","moe":{"active_experts":8,"active_parameters":3339450907,"is_moe":true,"num_experts":128},"parameter_count":"30.5B","parameters_raw":30532122624,"pipeline_tag":"text-generation","provider":"Alibaba","quantization":"Q4_K_M","release_date":"2025-07-28","source":"llmfit","use_case":"Instruction following, chat"},"open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"Qwen/Qwen3-30B-A3B-Instruct-2507","knowledge":null,"last_updated":"2025-07-29","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3 30B A3B Instruct 2507","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2025-07-29","retired":false,"tags":null},"Qwen/Qwen3-Coder-480B-A35B-Instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":1,"input":1,"output":1.5},"deprecated":false,"extra":{"attachment":false,"description":"Mixture-of-Experts model optimized for agentic coding tasks such as function calling, tool use, and long-context reasoning.","family":"qwen","llmfit":{"architecture":"qwen3_moe","context_length":262144,"discovered":false,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/Qwen3-Coder-480B-A35B-Instruct-GGUF"}],"hf_downloads":91107,"hf_likes":1360,"matched_hugging_face_id":"Qwen/Qwen3-Coder-480B-A35B-Instruct","memory":{"min_ram_gb":268.3,"min_vram_gb":245.9,"recommended_ram_gb":447.2},"model_id":"Qwen/Qwen3-Coder-480B-A35B-Instruct","moe":{"active_experts":8,"active_parameters":35000000000,"is_moe":true,"num_experts":160},"parameter_count":"480.2B","parameters_raw":480154875392,"pipeline_tag":"text-generation","provider":"Alibaba","quantization":"Q4_K_M","release_date":"2025-07-22","source":"llmfit","use_case":"Code generation and completion"},"open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"Qwen/Qwen3-Coder-480B-A35B-Instruct","knowledge":"2025-04","last_updated":"2025-07-22","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3 Coder 480B A35B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2025-07-22","retired":false,"tags":null},"Qwen/Qwen3.5-35B-A3B":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.25,"input":0.25,"output":1.25},"deprecated":false,"extra":{"attachment":true,"description":"Qwen3.5-35B-A3B is an open-weights multimodal MoE model built for efficient, high-throughput inference across chat, reasoning, and agentic tasks.","family":"qwen3.5","llmfit":{"architecture":"qwen3_5_moe","context_length":262144,"discovered":false,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/Qwen3.5-35B-A3B-GGUF"},{"provider":"ggml-org","repo":"ggml-org/Qwen3.5-35B-A3B-GGUF"},{"provider":"mradermacher","repo":"mradermacher/Qwen3.5-35B-A3B-GGUF"}],"hf_downloads":2397838,"hf_likes":1489,"matched_hugging_face_id":"Qwen/Qwen3.5-35B-A3B","memory":{"min_ram_gb":20.1,"min_vram_gb":18.4,"recommended_ram_gb":33.5},"model_id":"Qwen/Qwen3.5-35B-A3B","moe":{"active_experts":8,"active_parameters":3000000000,"is_moe":true,"num_experts":256},"parameter_count":"36.0B","parameters_raw":35951822704,"pipeline_tag":"image-text-to-text","provider":"Alibaba","quantization":"Q4_K_M","release_date":"2026-02-24","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"Qwen/Qwen3.5-35B-A3B","knowledge":null,"last_updated":"2026-02-24","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5-35B-A3B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-02-24","retired":false,"tags":null},"Qwen/Qwen3.6-27B":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.12,"input":0.6,"output":3.6},"deprecated":false,"extra":{"attachment":true,"description":"Qwen3.6-27B is a 27B dense multimodal model with 262K context built for flagship-level agentic coding.","family":"qwen3.6","llmfit":{"architecture":"qwen3_5","context_length":262144,"discovered":false,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/Qwen3.6-27B-GGUF"},{"provider":"ggml-org","repo":"ggml-org/Qwen3.6-27B-GGUF"},{"provider":"mradermacher","repo":"mradermacher/Qwen3.6-27B-GGUF"}],"hf_downloads":6928584,"hf_likes":2266,"matched_hugging_face_id":"Qwen/Qwen3.6-27B","memory":{"min_ram_gb":15.5,"min_vram_gb":14.2,"recommended_ram_gb":25.9},"model_id":"Qwen/Qwen3.6-27B","parameter_count":"27.8B","parameters_raw":27781427952,"pipeline_tag":"image-text-to-text","provider":"Alibaba","quantization":"Q4_K_M","release_date":"2026-04-21","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"Qwen/Qwen3.6-27B","knowledge":null,"last_updated":"2026-04-22","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.6 27B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-04-22","retired":false,"tags":null},"Qwen/Qwen3.6-35B-A3B":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.25,"input":0.25,"output":1.25},"deprecated":false,"extra":{"attachment":true,"description":"Qwen3.6-35B-A3B is an MoE multimodal model with 262K context optimized for agentic coding workflows.","family":"qwen3.6","llmfit":{"architecture":"qwen3_5_moe","context_length":262144,"discovered":false,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/Qwen3.6-35B-A3B-GGUF"},{"provider":"ggml-org","repo":"ggml-org/Qwen3.6-35B-A3B-GGUF"},{"provider":"mradermacher","repo":"mradermacher/Qwen3.6-35B-A3B-GGUF"}],"hf_downloads":5895532,"hf_likes":2697,"matched_hugging_face_id":"Qwen/Qwen3.6-35B-A3B","memory":{"min_ram_gb":20.1,"min_vram_gb":18.4,"recommended_ram_gb":33.5},"model_id":"Qwen/Qwen3.6-35B-A3B","moe":{"active_experts":8,"active_parameters":3000000000,"is_moe":true,"num_experts":256},"parameter_count":"36.0B","parameters_raw":35951822704,"pipeline_tag":"image-text-to-text","provider":"Alibaba","quantization":"Q4_K_M","release_date":"2026-04-15","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"Qwen/Qwen3.6-35B-A3B","knowledge":null,"last_updated":"2026-04-15","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.6 35B A3B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-04-15","retired":false,"tags":null},"deepseek-ai/DeepSeek-V3.1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.55,"input":0.55,"output":1.65},"deprecated":false,"extra":{"attachment":false,"description":"A large hybrid model that supports both thinking and non-thinking modes via prompt templates.","family":"deepseek","llmfit":{"architecture":"deepseek_v3","context_length":6553600,"discovered":true,"gguf_sources":[],"hf_downloads":232218,"hf_likes":826,"matched_hugging_face_id":"deepseek-ai/DeepSeek-V3.1","memory":{"min_ram_gb":382.5,"min_vram_gb":350.6,"recommended_ram_gb":637.5},"model_id":"deepseek-ai/DeepSeek-V3.1","moe":{"active_experts":8,"active_parameters":54548594820,"is_moe":true,"num_experts":256},"parameter_count":"684.5B","parameters_raw":684531386000,"pipeline_tag":"text-generation","provider":"DeepSeek","quantization":"Q4_K_M","release_date":"2025-08-21","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"deepseek-ai/DeepSeek-V3.1","knowledge":null,"last_updated":"2025-08-21","lifecycle":null,"limits":{"context":161000,"output":161000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V3.1","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2025-08-21","retired":false,"tags":null},"deepseek-ai/DeepSeek-V4-Flash":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.07,"input":0.14,"output":0.28},"deprecated":false,"extra":{"attachment":false,"description":"DeepSeek V4-Flash is an MoE model with 1M context length great for coding, reasoning, and agentic workloads.","family":"deepseek","llmfit":{"architecture":"deepseek_v4","context_length":16777216,"discovered":false,"gguf_sources":[],"hf_downloads":2045206,"hf_likes":2109,"matched_hugging_face_id":"deepseek-ai/DeepSeek-V4-Flash","memory":{"min_ram_gb":162.6,"min_vram_gb":149.0,"recommended_ram_gb":271.0},"model_id":"deepseek-ai/DeepSeek-V4-Flash","moe":{"active_experts":6,"active_parameters":13000000000,"is_moe":true,"num_experts":256},"parameter_count":"290.9B","parameters_raw":290944616402,"pipeline_tag":"text-generation","provider":"DeepSeek","quantization":"Q4_K_M","release_date":"2026-04-22","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"deepseek-ai/DeepSeek-V4-Flash","knowledge":"2025-05","last_updated":"2026-04-24","lifecycle":null,"limits":{"context":1048576,"output":1048576},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Flash","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-04-24","retired":false,"tags":null},"deepseek-ai/DeepSeek-V4-Flash-0731":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.07,"input":0.13,"output":0.28},"deprecated":false,"extra":{"attachment":false,"description":"DeepSeek V4-Flash-0731 is an MoE model great for coding, reasoning, and agentic workloads.","family":"deepseek","llmfit":{"architecture":"deepseek_v4","context_length":16777216,"discovered":true,"gguf_sources":[],"hf_downloads":1872232,"hf_likes":3464,"matched_hugging_face_id":"deepseek-ai/DeepSeek-V4-Flash-0731","memory":{"min_ram_gb":170.0,"min_vram_gb":155.8,"recommended_ram_gb":283.3},"model_id":"deepseek-ai/DeepSeek-V4-Flash-0731","moe":{"active_experts":6,"active_parameters":21981788050,"is_moe":true,"num_experts":256},"parameter_count":"304.2B","parameters_raw":304180418494,"pipeline_tag":"text-generation","provider":"DeepSeek","quantization":"Q4_K_M","release_date":"2026-07-31","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"deepseek-ai/DeepSeek-V4-Flash-0731","knowledge":"2025-05","last_updated":"2026-07-31","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Flash 0731","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-07-31","retired":false,"tags":null},"deepseek-ai/DeepSeek-V4-Pro":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"input":1.15,"output":2.55},"deprecated":false,"extra":{"attachment":false,"description":"DeepSeek V4-Pro is a 1.6T-parameter MoE model with 49B active parameters excelling at advanced reasoning, coding, and complex agentic workloads.","family":"deepseek","llmfit":{"architecture":"deepseek_v4","context_length":16777216,"discovered":false,"gguf_sources":[],"hf_downloads":1278742,"hf_likes":5452,"matched_hugging_face_id":"deepseek-ai/DeepSeek-V4-Pro","memory":{"min_ram_gb":893.4,"min_vram_gb":819.0,"recommended_ram_gb":1489.0},"model_id":"deepseek-ai/DeepSeek-V4-Pro","moe":{"active_experts":6,"active_parameters":49000000000,"is_moe":true,"num_experts":384},"parameter_count":"1598.8B","parameters_raw":1598839674782,"pipeline_tag":"text-generation","provider":"DeepSeek","quantization":"Q4_K_M","release_date":"2026-04-22","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"deepseek-ai/DeepSeek-V4-Pro","knowledge":"2025-05","last_updated":"2026-04-24","lifecycle":null,"limits":{"context":1048576,"output":1048576},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Pro","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-04-24","retired":false,"tags":null},"google/gemma-4-31B-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.1,"input":0.1,"output":0.34},"deprecated":false,"extra":{"attachment":true,"description":"Gemma 4 31B Dense is designed for advanced reasoning, agentic workflows, and longer context and is natively trained on 140+ languages.","family":"gemma","llmfit":{"architecture":"gemma4","context_length":262144,"discovered":false,"gguf_sources":[{"provider":"ggml-org","repo":"ggml-org/gemma-4-31B-it-GGUF"}],"hf_downloads":9704552,"hf_likes":3575,"matched_hugging_face_id":"google/gemma-4-31B-it","memory":{"min_ram_gb":17.5,"min_vram_gb":16.0,"recommended_ram_gb":29.1},"model_id":"google/gemma-4-31B-it","parameter_count":"31.3B","parameters_raw":31273088876,"pipeline_tag":"image-text-to-text","provider":"Google","quantization":"Q4_K_M","release_date":"2026-03-11","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"google/gemma-4-31B-it","knowledge":null,"last_updated":"2026-04-02","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 4 31B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-04-02","retired":false,"tags":null},"ibm-granite/granite-4.1-8b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.05,"output":0.1},"deprecated":false,"extra":{"attachment":false,"description":"Granite 4.1 8B is a long-context instruct model capable of enhanced tool calling, instruction following, and chat capabilities.","family":"granite","llmfit":{"architecture":"granite","context_length":131072,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/granite-4.1-8b-GGUF"},{"provider":"mradermacher","repo":"mradermacher/granite-4.1-8b-GGUF"}],"hf_downloads":3380740,"hf_likes":250,"matched_hugging_face_id":"ibm-granite/granite-4.1-8b","memory":{"min_ram_gb":4.9,"min_vram_gb":4.5,"recommended_ram_gb":8.2},"model_id":"ibm-granite/granite-4.1-8b","parameter_count":"8.8B","parameters_raw":8791592960,"pipeline_tag":"text-generation","provider":"ibm-granite","quantization":"Q4_K_M","release_date":"2026-04-06","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"ibm-granite/granite-4.1-8b","knowledge":null,"last_updated":"2026-04-29","lifecycle":null,"limits":{"context":131072,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Granite 4.1 8B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-04-29","retired":false,"tags":null},"meta-llama/Llama-3.1-70B-Instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.8,"input":0.8,"output":0.8},"deprecated":false,"extra":{"attachment":false,"description":"Efficient conversational model optimized for responsive multilingual chatbot interactions.","family":"llama","llmfit":{"architecture":"llama","context_length":4096,"discovered":false,"gguf_sources":[],"hf_downloads":788367,"hf_likes":948,"matched_hugging_face_id":"meta-llama/Llama-3.1-70B-Instruct","memory":{"min_ram_gb":39.4,"min_vram_gb":36.1,"recommended_ram_gb":65.7},"model_id":"meta-llama/Llama-3.1-70B-Instruct","parameter_count":"70.6B","parameters_raw":70553706496,"pipeline_tag":"text-generation","provider":"Meta","quantization":"Q4_K_M","release_date":"2024-07-16","source":"llmfit","use_case":"Instruction following, chat"},"open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"meta-llama/Llama-3.1-70B-Instruct","knowledge":null,"last_updated":"2024-07-23","lifecycle":null,"limits":{"context":128000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 70B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2024-07-23","retired":false,"tags":null},"meta-llama/Llama-3.1-8B-Instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.22,"input":0.22,"output":0.22},"deprecated":false,"extra":{"attachment":false,"description":"Efficient conversational model optimized for responsive multilingual chatbot interactions.","family":"llama","llmfit":{"architecture":"llama","context_length":4096,"discovered":false,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/Llama-3.1-8B-Instruct-GGUF"}],"hf_downloads":7461917,"hf_likes":6615,"matched_hugging_face_id":"meta-llama/Llama-3.1-8B-Instruct","memory":{"min_ram_gb":4.5,"min_vram_gb":4.1,"recommended_ram_gb":7.5},"model_id":"meta-llama/Llama-3.1-8B-Instruct","parameter_count":"8.0B","parameters_raw":8030261248,"pipeline_tag":"text-generation","provider":"Meta","quantization":"Q4_K_M","release_date":"2024-07-18","source":"llmfit","use_case":"Instruction following, chat"},"open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"meta-llama/Llama-3.1-8B-Instruct","knowledge":"2023-12","last_updated":"2024-07-23","lifecycle":null,"limits":{"context":128000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 8B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2024-07-23","retired":false,"tags":null},"meta-llama/Llama-3.3-70B-Instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.71,"input":0.71,"output":0.71},"deprecated":false,"extra":{"attachment":false,"description":"Multilingual model excelling in conversational tasks, detailed instruction-following, and coding.","family":"llama","llmfit":{"architecture":"llama","context_length":4096,"discovered":false,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/Llama-3.3-70B-Instruct-GGUF"},{"provider":"bartowski","repo":"bartowski/Llama-3.3-70B-Instruct-GGUF"},{"provider":"mradermacher","repo":"mradermacher/Llama-3.3-70B-Instruct-GGUF"}],"hf_downloads":312172,"hf_likes":2952,"matched_hugging_face_id":"meta-llama/Llama-3.3-70B-Instruct","memory":{"min_ram_gb":39.4,"min_vram_gb":36.1,"recommended_ram_gb":65.7},"model_id":"meta-llama/Llama-3.3-70B-Instruct","parameter_count":"70.6B","parameters_raw":70553706496,"pipeline_tag":"text-generation","provider":"Meta","quantization":"Q4_K_M","release_date":"2024-11-26","source":"llmfit","use_case":"Instruction following, chat"},"open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"meta-llama/Llama-3.3-70B-Instruct","knowledge":"2023-12","last_updated":"2024-12-01","lifecycle":null,"limits":{"context":128000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.3 70B","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2024-12-01","retired":false,"tags":null},"moonshotai/Kimi-K2.6":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":0.65,"output":3.41},"deprecated":false,"extra":{"attachment":true,"description":"Kimi K2.6 is a multimodal Mixture-of-Experts language model featuring 32 billion activated parameters and a total of 1 trillion parameters.","family":"kimi-k2","llmfit":{"architecture":"kimi_k25","context_length":16777216,"discovered":true,"gguf_sources":[],"hf_downloads":805859,"hf_likes":0,"matched_hugging_face_id":"moonshotai/Kimi-K2.6","memory":{"min_ram_gb":573.8,"min_vram_gb":526.0,"recommended_ram_gb":956.4},"model_id":"moonshotai/Kimi-K2.6","moe":{"active_experts":8,"active_parameters":71667623138,"is_moe":true,"num_experts":384},"parameter_count":"1026.9B","parameters_raw":1026879376368,"pipeline_tag":"image-text-to-text","provider":"moonshotai","quantization":"Q4_K_M","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"moonshotai/Kimi-K2.6","knowledge":"2025-01","last_updated":"2026-04-20","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Kimi K2.6","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-04-20","retired":false,"tags":null},"moonshotai/Kimi-K2.7-Code":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":0.71,"output":3.5},"deprecated":false,"extra":{"attachment":true,"description":"Kimi K2.7 Code is a 1T-parameter MoE model with 32B active parameters purpose-built for long-horizon agentic coding and software engineering.","family":"kimi-k2","llmfit":{"architecture":"kimi_k25","context_length":16777216,"discovered":true,"gguf_sources":[],"hf_downloads":568317,"hf_likes":0,"matched_hugging_face_id":"moonshotai/Kimi-K2.7-Code","memory":{"min_ram_gb":573.8,"min_vram_gb":526.0,"recommended_ram_gb":956.4},"model_id":"moonshotai/Kimi-K2.7-Code","moe":{"active_experts":8,"active_parameters":71667623138,"is_moe":true,"num_experts":384},"parameter_count":"1026.9B","parameters_raw":1026879376368,"pipeline_tag":"image-text-to-text","provider":"moonshotai","quantization":"Q4_K_M","source":"llmfit","use_case":"Code generation and completion"},"open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"moonshotai/Kimi-K2.7-Code","knowledge":"2025-01","last_updated":"2026-06-12","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Kimi K2.7 Code","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-06-12","retired":false,"tags":null},"moonshotai/Kimi-K3":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.3,"input":3,"output":15},"deprecated":false,"extra":{"attachment":true,"description":"Kimi K3 is a 2.8T-parameter multimodal MoE model with 104B active parameters built for long-horizon coding and agentic workflows.","family":"kimi-k3","llmfit":{"architecture":"kimi_k3","context_length":1048576,"discovered":true,"gguf_sources":[],"hf_downloads":2136775,"hf_likes":0,"matched_hugging_face_id":"moonshotai/Kimi-K3","memory":{"min_ram_gb":1553.4,"min_vram_gb":1424.0,"recommended_ram_gb":2589.0},"model_id":"moonshotai/Kimi-K3","parameter_count":"2779.9B","parameters_raw":2779931837184,"pipeline_tag":"image-text-to-text","provider":"moonshotai","quantization":"Q4_K_M","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"moonshotai/Kimi-K3","knowledge":null,"last_updated":"2026-07-16","lifecycle":null,"limits":{"context":1048576,"output":1048576},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Kimi K3","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-07-16","retired":false,"tags":null},"nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"input":0.2,"output":0.8},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron 3 is a LatentMoE model designed to deliver strong agentic, reasoning, and conversational capabilities.","family":"nemotron","llmfit":{"architecture":"nemotron_h","context_length":262144,"discovered":true,"gguf_sources":[],"hf_downloads":180816,"hf_likes":273,"matched_hugging_face_id":"nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8","memory":{"min_ram_gb":69.1,"min_vram_gb":63.3,"recommended_ram_gb":115.1},"model_id":"nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8","moe":{"active_experts":22,"active_parameters":11226390744,"is_moe":true,"num_experts":512},"parameter_count":"123.6B","parameters_raw":123611012096,"pipeline_tag":"text-generation","provider":"nvidia","quantization":"Q4_K_M","release_date":"2026-03-10","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-FP8","knowledge":null,"last_updated":"2026-03-11","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Nemotron 3 Super","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-03-11","retired":false,"tags":null},"nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":0.75,"output":2.75},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron 3 Ultra is a powerful MoE model designed for long-running agents across coding, deep research, and enterprise automation.","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B","knowledge":null,"last_updated":"2026-06-04","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Nemotron 3 Ultra","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-06-04","retired":false,"tags":null},"nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.1,"output":0.25},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron 3.5 Lightning is an MoE model built for fast, reliable agentic tasks across use cases such as financial services, cybersecurity, telecom, and retail.","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B","knowledge":null,"last_updated":"2026-08-11","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Nemotron 3.5 Lightning","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-08-11","retired":false,"tags":null},"openai/gpt-oss-120b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.03,"input":0.03,"output":0.17},"deprecated":false,"extra":{"attachment":false,"description":"Efficient Mixture-of-Experts model designed for high-reasoning, agentic and general-purpose use cases.","family":"gpt-oss","llmfit":{"architecture":"gpt_oss","context_length":4194304,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/gpt-oss-120b-GGUF"},{"provider":"ggml-org","repo":"ggml-org/gpt-oss-120b-GGUF"}],"hf_downloads":4479205,"hf_likes":5106,"matched_hugging_face_id":"openai/gpt-oss-120b","memory":{"min_ram_gb":65.3,"min_vram_gb":59.8,"recommended_ram_gb":108.8},"model_id":"openai/gpt-oss-120b","moe":{"active_experts":4,"active_parameters":9309823421,"is_moe":true,"num_experts":128},"parameter_count":"116.8B","parameters_raw":116829156672,"pipeline_tag":"text-generation","provider":"openai","quantization":"Q4_K_M","release_date":"2025-08-04","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"openai/gpt-oss-120b","knowledge":null,"last_updated":"2025-08-05","lifecycle":null,"limits":{"context":131072,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"gpt-oss-120b","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2025-08-05","retired":false,"tags":null},"openai/gpt-oss-20b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.03,"input":0.03,"output":0.13},"deprecated":false,"extra":{"attachment":false,"description":"Lower latency Mixture-of-Experts model trained on OpenAI's Harmony response format with reasoning capabilities.","family":"gpt-oss","llmfit":{"architecture":"gpt_oss","context_length":4194304,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/gpt-oss-20b-GGUF"},{"provider":"ggml-org","repo":"ggml-org/gpt-oss-20b-GGUF"},{"provider":"mradermacher","repo":"mradermacher/gpt-oss-20b-GGUF"}],"hf_downloads":7966494,"hf_likes":4923,"matched_hugging_face_id":"openai/gpt-oss-20b","memory":{"min_ram_gb":12.0,"min_vram_gb":11.0,"recommended_ram_gb":20.0},"model_id":"openai/gpt-oss-20b","moe":{"active_experts":4,"active_parameters":3630142231,"is_moe":true,"num_experts":32},"parameter_count":"21.5B","parameters_raw":21511953984,"pipeline_tag":"text-generation","provider":"openai","quantization":"Q4_K_M","release_date":"2025-08-04","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"openai/gpt-oss-20b","knowledge":null,"last_updated":"2025-08-05","lifecycle":null,"limits":{"context":131072,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"gpt-oss-20b","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2025-08-05","retired":false,"tags":null},"zai-org/GLM-5.1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.26,"input":1.4,"output":4.4},"deprecated":false,"extra":{"attachment":false,"description":"Powerful MoE model for long-horizon agentic engineering and advanced reasoning.","family":"glm","llmfit":{"architecture":"glm_moe_dsa","context_length":202752,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/GLM-5.1-GGUF"}],"hf_downloads":78747,"hf_likes":1840,"matched_hugging_face_id":"zai-org/GLM-5.1","memory":{"min_ram_gb":421.3,"min_vram_gb":386.1,"recommended_ram_gb":702.1},"model_id":"zai-org/GLM-5.1","moe":{"active_experts":8,"active_parameters":60073548574,"is_moe":true,"num_experts":256},"parameter_count":"753.9B","parameters_raw":753864139008,"pipeline_tag":"text-generation","provider":"zai-org","quantization":"Q4_K_M","release_date":"2026-04-03","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"zai-org/GLM-5.1","knowledge":null,"last_updated":"2026-04-07","lifecycle":null,"limits":{"context":202752,"output":202752},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 5.1","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-04-07","retired":false,"tags":null},"zai-org/GLM-5.2":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.14,"input":0.76,"output":2.42},"deprecated":false,"extra":{"attachment":false,"description":"GLM-5.2 is a Mixture-of-Experts language model featuring 40 billion activated parameters and a total of 744 billion parameters.","family":"glm","llmfit":{"architecture":"glm_moe_dsa","context_length":1048576,"discovered":true,"gguf_sources":[],"hf_downloads":2705686,"hf_likes":4983,"matched_hugging_face_id":"zai-org/GLM-5.2","memory":{"min_ram_gb":421.0,"min_vram_gb":385.9,"recommended_ram_gb":701.6},"model_id":"zai-org/GLM-5.2","moe":{"active_experts":8,"active_parameters":60030979632,"is_moe":true,"num_experts":256},"parameter_count":"753.3B","parameters_raw":753329940480,"pipeline_tag":"text-generation","provider":"zai-org","quantization":"Q4_K_M","release_date":"2026-06-16","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"zai-org/GLM-5.2","knowledge":null,"last_updated":"2026-06-16","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 5.2","pricing":null,"provider":"wandb","provider_model_id":null,"release_date":"2026-06-16","retired":false,"tags":null}},"name":"Weights & Biases","pricing_defaults":null};
|
|
4
4
|
const provider = /* @__PURE__ */ createProviderCatalog(data);
|
|
5
5
|
export default provider;
|
|
@@ -0,0 +1,11 @@
|
|
|
1
|
+
import type {
|
|
2
|
+
Provider,
|
|
3
|
+
ProviderCatalog,
|
|
4
|
+
} from "../types.js";
|
|
5
|
+
|
|
6
|
+
export declare const data: Provider;
|
|
7
|
+
declare const provider: ProviderCatalog<
|
|
8
|
+
"watsonx",
|
|
9
|
+
"ibm/granite-4-h-small" | "meta-llama/llama-3-3-70b-instruct" | "meta-llama/llama-4-maverick-17b-128e-instruct-fp8" | "mistralai/mistral-small-3-1-24b-instruct-2503" | "openai/gpt-oss-120b"
|
|
10
|
+
>;
|
|
11
|
+
export default provider;
|
|
@@ -0,0 +1,5 @@
|
|
|
1
|
+
import { createProviderCatalog } from "../provider.js";
|
|
2
|
+
|
|
3
|
+
export const data = {"alias_of":null,"base_url":null,"catalog_only":true,"config_schema":null,"doc":"https://www.ibm.com/docs/en/watsonx/saas?topic=solutions-supported-foundation-models","env":["WATSONX_AI_APIKEY","WATSONX_AI_PROJECT_ID"],"exclude_models":null,"extra":null,"id":"watsonx","models":{"ibm/granite-4-h-small":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0.0636,"output":0.265},"deprecated":false,"extra":{"attachment":false,"description":"Open-weight hybrid model for enterprise chat, coding, retrieval-augmented generation, and tool-calling workloads","family":"granite","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"ibm/granite-4-h-small","knowledge":null,"last_updated":"2025-10-02","lifecycle":null,"limits":{"context":131072,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Granite-4.0-H-Small","pricing":null,"provider":"watsonx","provider_model_id":null,"release_date":"2025-10-02","retired":false,"tags":null},"meta-llama/llama-3-3-70b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0.7526,"output":0.7526},"deprecated":false,"extra":{"attachment":true,"description":"Popular open Llama workhorse for multilingual chat, coding, and self-hosting","family":"llama","open_weights":true,"temperature":true},"family":null,"id":"meta-llama/llama-3-3-70b-instruct","knowledge":"2023-12","last_updated":"2024-12-06","lifecycle":null,"limits":{"context":131072,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama-3.3-70B-Instruct","pricing":null,"provider":"watsonx","provider_model_id":null,"release_date":"2024-12-06","retired":false,"tags":null},"meta-llama/llama-4-maverick-17b-128e-instruct-fp8":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0.371,"output":1.484},"deprecated":false,"extra":{"attachment":true,"description":"Open multimodal Llama for strong reasoning with efficient everyday serving","family":"llama","open_weights":true,"temperature":true},"family":null,"id":"meta-llama/llama-4-maverick-17b-128e-instruct-fp8","knowledge":"2024-08","last_updated":"2025-04-05","lifecycle":null,"limits":{"context":131072,"output":8192},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Llama 4 Maverick 17B 128E Instruct FP8","pricing":null,"provider":"watsonx","provider_model_id":null,"release_date":"2025-04-05","retired":false,"tags":null},"mistralai/mistral-small-3-1-24b-instruct-2503":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0.106,"output":0.318},"deprecated":false,"extra":{"attachment":true,"description":"Efficient multimodal model for instruction following, coding, reasoning, and function calling","family":"mistral-small","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"mistralai/mistral-small-3-1-24b-instruct-2503","knowledge":"2024-06","last_updated":"2025-03-17","lifecycle":null,"limits":{"context":131072,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Mistral Small 3.1 24B","pricing":null,"provider":"watsonx","provider_model_id":null,"release_date":"2025-03-17","retired":false,"tags":null},"openai/gpt-oss-120b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0.159,"output":0.636},"deprecated":false,"extra":{"attachment":false,"description":"Open GPT reasoning model for self-hosted agents and controllable deployments","family":"gpt-oss","llmfit":{"architecture":"gpt_oss","context_length":4194304,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/gpt-oss-120b-GGUF"},{"provider":"ggml-org","repo":"ggml-org/gpt-oss-120b-GGUF"}],"hf_downloads":4479205,"hf_likes":5106,"matched_hugging_face_id":"openai/gpt-oss-120b","memory":{"min_ram_gb":65.3,"min_vram_gb":59.8,"recommended_ram_gb":108.8},"model_id":"openai/gpt-oss-120b","moe":{"active_experts":4,"active_parameters":9309823421,"is_moe":true,"num_experts":128},"parameter_count":"116.8B","parameters_raw":116829156672,"pipeline_tag":"text-generation","provider":"openai","quantization":"Q4_K_M","release_date":"2025-08-04","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"openai/gpt-oss-120b","knowledge":null,"last_updated":"2025-08-05","lifecycle":null,"limits":{"context":131072,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GPT OSS 120B","pricing":null,"provider":"watsonx","provider_model_id":null,"release_date":"2025-08-05","retired":false,"tags":null}},"name":"watsonx.ai","pricing_defaults":null};
|
|
4
|
+
const provider = /* @__PURE__ */ createProviderCatalog(data);
|
|
5
|
+
export default provider;
|
package/dist/providers/xai.d.ts
CHANGED
|
@@ -6,6 +6,6 @@ import type {
|
|
|
6
6
|
export declare const data: Provider;
|
|
7
7
|
declare const provider: ProviderCatalog<
|
|
8
8
|
"xai",
|
|
9
|
-
"grok-3" | "grok-3-mini" | "grok-3-mini-fast" | "grok-3-mini-fast-latest" | "grok-3-mini-latest" | "grok-4" | "grok-4-0709" | "grok-4-1-fast-non-reasoning" | "grok-4-1-fast-reasoning" | "grok-4-fast" | "grok-4-fast-non-reasoning" | "grok-4-fast-reasoning" | "grok-4.20" | "grok-4.20-0309" | "grok-4.20-0309-non-reasoning" | "grok-4.20-0309-reasoning" | "grok-4.20-beta" | "grok-4.20-beta-0309" | "grok-4.20-beta-0309-non-reasoning" | "grok-4.20-beta-0309-reasoning" | "grok-4.20-beta-latest" | "grok-4.20-beta-latest-non-reasoning" | "grok-4.20-beta-latest-reasoning" | "grok-4.20-beta-non-reasoning" | "grok-4.20-beta-reasoning" | "grok-4.20-experimental-beta-0304" | "grok-4.20-experimental-beta-0304-non-reasoning" | "grok-4.20-experimental-beta-0304-reasoning" | "grok-4.20-experimental-beta-latest" | "grok-4.20-experimental-beta-non-reasoning-latest" | "grok-4.20-experimental-beta-reasoning-latest" | "grok-4.20-multi-agent" | "grok-4.20-multi-agent-0309" | "grok-4.20-multi-agent-beta-0309" | "grok-4.20-multi-agent-beta-latest" | "grok-4.20-multi-agent-experimental-beta-0304" | "grok-4.20-multi-agent-experimental-beta-latest" | "grok-4.20-multi-agent-latest" | "grok-4.20-non-reasoning" | "grok-4.20-non-reasoning-gv2" | "grok-4.20-non-reasoning-latest" | "grok-4.20-reasoning" | "grok-4.20-reasoning-gv2" | "grok-4.20-reasoning-latest" | "grok-4.3" | "grok-4.3-latest" | "grok-4.5" | "grok-4.5-latest" | "grok-4.6" | "grok-build-0.1" | "grok-build-latest" | "grok-code-fast" | "grok-code-fast-1" | "grok-code-fast-1-0825" | "grok-imagine-image" | "grok-imagine-image-2.0" | "grok-imagine-image-2026-03-02" | "grok-imagine-image-pro" | "grok-imagine-image-quality" | "grok-imagine-image-quality-20260403" | "grok-imagine-image-quality-latest" | "grok-imagine-video" | "grok-imagine-video-1.5" | "grok-imagine-video-1.5-2026-05-30" | "grok-imagine-video-1.5-preview"
|
|
9
|
+
"grok-3" | "grok-3-mini" | "grok-3-mini-fast" | "grok-3-mini-fast-latest" | "grok-3-mini-latest" | "grok-4" | "grok-4-0709" | "grok-4-1-fast-non-reasoning" | "grok-4-1-fast-reasoning" | "grok-4-fast" | "grok-4-fast-non-reasoning" | "grok-4-fast-reasoning" | "grok-4.20" | "grok-4.20-0309" | "grok-4.20-0309-non-reasoning" | "grok-4.20-0309-reasoning" | "grok-4.20-beta" | "grok-4.20-beta-0309" | "grok-4.20-beta-0309-non-reasoning" | "grok-4.20-beta-0309-reasoning" | "grok-4.20-beta-latest" | "grok-4.20-beta-latest-non-reasoning" | "grok-4.20-beta-latest-reasoning" | "grok-4.20-beta-non-reasoning" | "grok-4.20-beta-reasoning" | "grok-4.20-experimental-beta-0304" | "grok-4.20-experimental-beta-0304-non-reasoning" | "grok-4.20-experimental-beta-0304-reasoning" | "grok-4.20-experimental-beta-latest" | "grok-4.20-experimental-beta-non-reasoning-latest" | "grok-4.20-experimental-beta-reasoning-latest" | "grok-4.20-multi-agent" | "grok-4.20-multi-agent-0309" | "grok-4.20-multi-agent-beta-0309" | "grok-4.20-multi-agent-beta-latest" | "grok-4.20-multi-agent-experimental-beta-0304" | "grok-4.20-multi-agent-experimental-beta-latest" | "grok-4.20-multi-agent-latest" | "grok-4.20-non-reasoning" | "grok-4.20-non-reasoning-gv2" | "grok-4.20-non-reasoning-latest" | "grok-4.20-reasoning" | "grok-4.20-reasoning-gv2" | "grok-4.20-reasoning-latest" | "grok-4.3" | "grok-4.3-latest" | "grok-4.5" | "grok-4.5-latest" | "grok-4.6" | "grok-build-0.1" | "grok-build-latest" | "grok-code-fast" | "grok-code-fast-1" | "grok-code-fast-1-0825" | "grok-imagine-image" | "grok-imagine-image-2.0" | "grok-imagine-image-2026-03-02" | "grok-imagine-image-pro" | "grok-imagine-image-quality" | "grok-imagine-image-quality-20260403" | "grok-imagine-image-quality-latest" | "grok-imagine-video" | "grok-imagine-video-1.5" | "grok-imagine-video-1.5-2026-05-30" | "grok-imagine-video-1.5-preview"
|
|
10
10
|
>;
|
|
11
11
|
export default provider;
|