@agentjido/llmdb 2026.8.2
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- package/LICENSE +203 -0
- package/README.md +117 -0
- package/dist/catalog.d.ts +2 -0
- package/dist/catalog.js +53 -0
- package/dist/errors.d.ts +14 -0
- package/dist/errors.js +20 -0
- package/dist/full.d.ts +3 -0
- package/dist/full.js +191 -0
- package/dist/generated/manifest.d.ts +3 -0
- package/dist/generated/manifest.js +1 -0
- package/dist/generated/provider-loaders.d.ts +3 -0
- package/dist/generated/provider-loaders.js +185 -0
- package/dist/index.d.ts +8 -0
- package/dist/index.js +8 -0
- package/dist/lazy.d.ts +9 -0
- package/dist/lazy.js +73 -0
- package/dist/provider.d.ts +2 -0
- package/dist/provider.js +63 -0
- package/dist/providers/302ai.d.ts +11 -0
- package/dist/providers/302ai.js +5 -0
- package/dist/providers/abacus.d.ts +11 -0
- package/dist/providers/abacus.js +5 -0
- package/dist/providers/abliteration_ai.d.ts +11 -0
- package/dist/providers/abliteration_ai.js +5 -0
- package/dist/providers/ai_router.d.ts +11 -0
- package/dist/providers/ai_router.js +5 -0
- package/dist/providers/aiand.d.ts +11 -0
- package/dist/providers/aiand.js +5 -0
- package/dist/providers/aihubmix.d.ts +11 -0
- package/dist/providers/aihubmix.js +5 -0
- package/dist/providers/aki_io.d.ts +11 -0
- package/dist/providers/aki_io.js +5 -0
- package/dist/providers/alibaba.d.ts +11 -0
- package/dist/providers/alibaba.js +5 -0
- package/dist/providers/alibaba_cn.d.ts +11 -0
- package/dist/providers/alibaba_cn.js +5 -0
- package/dist/providers/alibaba_coding_plan.d.ts +11 -0
- package/dist/providers/alibaba_coding_plan.js +5 -0
- package/dist/providers/alibaba_coding_plan_cn.d.ts +11 -0
- package/dist/providers/alibaba_coding_plan_cn.js +5 -0
- package/dist/providers/alibaba_token_plan.d.ts +11 -0
- package/dist/providers/alibaba_token_plan.js +5 -0
- package/dist/providers/alibaba_token_plan_cn.d.ts +11 -0
- package/dist/providers/alibaba_token_plan_cn.js +5 -0
- package/dist/providers/amazon_bedrock.d.ts +11 -0
- package/dist/providers/amazon_bedrock.js +5 -0
- package/dist/providers/ambient.d.ts +11 -0
- package/dist/providers/ambient.js +5 -0
- package/dist/providers/anthropic.d.ts +11 -0
- package/dist/providers/anthropic.js +5 -0
- package/dist/providers/anyapi.d.ts +11 -0
- package/dist/providers/anyapi.js +5 -0
- package/dist/providers/atomic_chat.d.ts +11 -0
- package/dist/providers/atomic_chat.js +5 -0
- package/dist/providers/auriko.d.ts +11 -0
- package/dist/providers/auriko.js +5 -0
- package/dist/providers/azure.d.ts +11 -0
- package/dist/providers/azure.js +5 -0
- package/dist/providers/azure_cognitive_services.d.ts +11 -0
- package/dist/providers/azure_cognitive_services.js +5 -0
- package/dist/providers/bailing.d.ts +11 -0
- package/dist/providers/bailing.js +5 -0
- package/dist/providers/baseten.d.ts +11 -0
- package/dist/providers/baseten.js +5 -0
- package/dist/providers/berget.d.ts +11 -0
- package/dist/providers/berget.js +5 -0
- package/dist/providers/blueclaw.d.ts +11 -0
- package/dist/providers/blueclaw.js +5 -0
- package/dist/providers/cerebras.d.ts +11 -0
- package/dist/providers/cerebras.js +5 -0
- package/dist/providers/chutes.d.ts +11 -0
- package/dist/providers/chutes.js +5 -0
- package/dist/providers/clarifai.d.ts +11 -0
- package/dist/providers/clarifai.js +5 -0
- package/dist/providers/claudinio.d.ts +11 -0
- package/dist/providers/claudinio.js +5 -0
- package/dist/providers/cline_pass.d.ts +11 -0
- package/dist/providers/cline_pass.js +5 -0
- package/dist/providers/cloudferro_sherlock.d.ts +11 -0
- package/dist/providers/cloudferro_sherlock.js +5 -0
- package/dist/providers/cloudflare_ai_gateway.d.ts +11 -0
- package/dist/providers/cloudflare_ai_gateway.js +5 -0
- package/dist/providers/cloudflare_workers_ai.d.ts +11 -0
- package/dist/providers/cloudflare_workers_ai.js +5 -0
- package/dist/providers/cohere.d.ts +11 -0
- package/dist/providers/cohere.js +5 -0
- package/dist/providers/cortecs.d.ts +11 -0
- package/dist/providers/cortecs.js +5 -0
- package/dist/providers/crof.d.ts +11 -0
- package/dist/providers/crof.js +5 -0
- package/dist/providers/crossmodel.d.ts +11 -0
- package/dist/providers/crossmodel.js +5 -0
- package/dist/providers/daoxe.d.ts +11 -0
- package/dist/providers/daoxe.js +5 -0
- package/dist/providers/databricks.d.ts +11 -0
- package/dist/providers/databricks.js +5 -0
- package/dist/providers/deepinfra.d.ts +11 -0
- package/dist/providers/deepinfra.js +5 -0
- package/dist/providers/deepseek.d.ts +11 -0
- package/dist/providers/deepseek.js +5 -0
- package/dist/providers/digitalocean.d.ts +11 -0
- package/dist/providers/digitalocean.js +5 -0
- package/dist/providers/dinference.d.ts +11 -0
- package/dist/providers/dinference.js +5 -0
- package/dist/providers/drun.d.ts +11 -0
- package/dist/providers/drun.js +5 -0
- package/dist/providers/ebcloud.d.ts +11 -0
- package/dist/providers/ebcloud.js +5 -0
- package/dist/providers/elevenlabs.d.ts +11 -0
- package/dist/providers/elevenlabs.js +5 -0
- package/dist/providers/empiriolabs.d.ts +11 -0
- package/dist/providers/empiriolabs.js +5 -0
- package/dist/providers/evroc.d.ts +11 -0
- package/dist/providers/evroc.js +5 -0
- package/dist/providers/fastrouter.d.ts +11 -0
- package/dist/providers/fastrouter.js +5 -0
- package/dist/providers/fireworks_ai.d.ts +11 -0
- package/dist/providers/fireworks_ai.js +5 -0
- package/dist/providers/freemodel.d.ts +11 -0
- package/dist/providers/freemodel.js +5 -0
- package/dist/providers/friendli.d.ts +11 -0
- package/dist/providers/friendli.js +5 -0
- package/dist/providers/frogbot.d.ts +11 -0
- package/dist/providers/frogbot.js +5 -0
- package/dist/providers/github_copilot.d.ts +11 -0
- package/dist/providers/github_copilot.js +5 -0
- package/dist/providers/github_models.d.ts +11 -0
- package/dist/providers/github_models.js +5 -0
- package/dist/providers/gitlab.d.ts +11 -0
- package/dist/providers/gitlab.js +5 -0
- package/dist/providers/gmicloud.d.ts +11 -0
- package/dist/providers/gmicloud.js +5 -0
- package/dist/providers/google.d.ts +11 -0
- package/dist/providers/google.js +5 -0
- package/dist/providers/google_vertex.d.ts +11 -0
- package/dist/providers/google_vertex.js +5 -0
- package/dist/providers/google_vertex_anthropic.d.ts +11 -0
- package/dist/providers/google_vertex_anthropic.js +5 -0
- package/dist/providers/greenpt.d.ts +11 -0
- package/dist/providers/greenpt.js +5 -0
- package/dist/providers/groq.d.ts +11 -0
- package/dist/providers/groq.js +5 -0
- package/dist/providers/helicone.d.ts +11 -0
- package/dist/providers/helicone.js +5 -0
- package/dist/providers/hetzner.d.ts +11 -0
- package/dist/providers/hetzner.js +5 -0
- package/dist/providers/hpc_ai.d.ts +11 -0
- package/dist/providers/hpc_ai.js +5 -0
- package/dist/providers/huggingface.d.ts +11 -0
- package/dist/providers/huggingface.js +5 -0
- package/dist/providers/hyper.d.ts +11 -0
- package/dist/providers/hyper.js +5 -0
- package/dist/providers/iflowcn.d.ts +11 -0
- package/dist/providers/iflowcn.js +5 -0
- package/dist/providers/impossibl.d.ts +11 -0
- package/dist/providers/impossibl.js +5 -0
- package/dist/providers/inception.d.ts +11 -0
- package/dist/providers/inception.js +5 -0
- package/dist/providers/inceptron.d.ts +11 -0
- package/dist/providers/inceptron.js +5 -0
- package/dist/providers/inference.d.ts +11 -0
- package/dist/providers/inference.js +5 -0
- package/dist/providers/inferx.d.ts +11 -0
- package/dist/providers/inferx.js +5 -0
- package/dist/providers/infomaniak.d.ts +11 -0
- package/dist/providers/infomaniak.js +5 -0
- package/dist/providers/io_net.d.ts +11 -0
- package/dist/providers/io_net.js +5 -0
- package/dist/providers/jiekou.d.ts +11 -0
- package/dist/providers/jiekou.js +5 -0
- package/dist/providers/kenari.d.ts +11 -0
- package/dist/providers/kenari.js +5 -0
- package/dist/providers/kilo.d.ts +11 -0
- package/dist/providers/kilo.js +5 -0
- package/dist/providers/kimi_for_coding.d.ts +11 -0
- package/dist/providers/kimi_for_coding.js +5 -0
- package/dist/providers/kuae_cloud_coding_plan.d.ts +11 -0
- package/dist/providers/kuae_cloud_coding_plan.js +5 -0
- package/dist/providers/lilac.d.ts +11 -0
- package/dist/providers/lilac.js +5 -0
- package/dist/providers/llama.d.ts +11 -0
- package/dist/providers/llama.js +5 -0
- package/dist/providers/llmgateway.d.ts +11 -0
- package/dist/providers/llmgateway.js +5 -0
- package/dist/providers/llmtr.d.ts +11 -0
- package/dist/providers/llmtr.js +5 -0
- package/dist/providers/lmstudio.d.ts +11 -0
- package/dist/providers/lmstudio.js +5 -0
- package/dist/providers/longcat.d.ts +11 -0
- package/dist/providers/longcat.js +5 -0
- package/dist/providers/lucidquery.d.ts +11 -0
- package/dist/providers/lucidquery.js +5 -0
- package/dist/providers/lynkr.d.ts +11 -0
- package/dist/providers/lynkr.js +5 -0
- package/dist/providers/meganova.d.ts +11 -0
- package/dist/providers/meganova.js +5 -0
- package/dist/providers/merge_gateway.d.ts +11 -0
- package/dist/providers/merge_gateway.js +5 -0
- package/dist/providers/meta.d.ts +11 -0
- package/dist/providers/meta.js +5 -0
- package/dist/providers/minimax.d.ts +11 -0
- package/dist/providers/minimax.js +5 -0
- package/dist/providers/minimax_cn.d.ts +11 -0
- package/dist/providers/minimax_cn.js +5 -0
- package/dist/providers/minimax_cn_coding_plan.d.ts +11 -0
- package/dist/providers/minimax_cn_coding_plan.js +5 -0
- package/dist/providers/minimax_coding_plan.d.ts +11 -0
- package/dist/providers/minimax_coding_plan.js +5 -0
- package/dist/providers/mistral.d.ts +11 -0
- package/dist/providers/mistral.js +5 -0
- package/dist/providers/mixlayer.d.ts +11 -0
- package/dist/providers/mixlayer.js +5 -0
- package/dist/providers/moark.d.ts +11 -0
- package/dist/providers/moark.js +5 -0
- package/dist/providers/modal.d.ts +11 -0
- package/dist/providers/modal.js +5 -0
- package/dist/providers/model_oracle_ai.d.ts +11 -0
- package/dist/providers/model_oracle_ai.js +5 -0
- package/dist/providers/modelis.d.ts +11 -0
- package/dist/providers/modelis.js +5 -0
- package/dist/providers/modelscope.d.ts +11 -0
- package/dist/providers/modelscope.js +5 -0
- package/dist/providers/moonshotai.d.ts +11 -0
- package/dist/providers/moonshotai.js +5 -0
- package/dist/providers/moonshotai_cn.d.ts +11 -0
- package/dist/providers/moonshotai_cn.js +5 -0
- package/dist/providers/morph.d.ts +11 -0
- package/dist/providers/morph.js +5 -0
- package/dist/providers/nano_gpt.d.ts +11 -0
- package/dist/providers/nano_gpt.js +5 -0
- package/dist/providers/nearai.d.ts +11 -0
- package/dist/providers/nearai.js +5 -0
- package/dist/providers/nebius.d.ts +11 -0
- package/dist/providers/nebius.js +5 -0
- package/dist/providers/neon.d.ts +11 -0
- package/dist/providers/neon.js +5 -0
- package/dist/providers/neuralwatt.d.ts +11 -0
- package/dist/providers/neuralwatt.js +5 -0
- package/dist/providers/nova.d.ts +11 -0
- package/dist/providers/nova.js +5 -0
- package/dist/providers/novita_ai.d.ts +11 -0
- package/dist/providers/novita_ai.js +5 -0
- package/dist/providers/nvidia.d.ts +11 -0
- package/dist/providers/nvidia.js +5 -0
- package/dist/providers/ofox.d.ts +11 -0
- package/dist/providers/ofox.js +5 -0
- package/dist/providers/ollama_cloud.d.ts +11 -0
- package/dist/providers/ollama_cloud.js +5 -0
- package/dist/providers/openai.d.ts +11 -0
- package/dist/providers/openai.js +5 -0
- package/dist/providers/opencode.d.ts +11 -0
- package/dist/providers/opencode.js +5 -0
- package/dist/providers/opencode_go.d.ts +11 -0
- package/dist/providers/opencode_go.js +5 -0
- package/dist/providers/openrouter.d.ts +11 -0
- package/dist/providers/openrouter.js +5 -0
- package/dist/providers/orcarouter.d.ts +11 -0
- package/dist/providers/orcarouter.js +5 -0
- package/dist/providers/ovhcloud.d.ts +11 -0
- package/dist/providers/ovhcloud.js +5 -0
- package/dist/providers/perplexity.d.ts +11 -0
- package/dist/providers/perplexity.js +5 -0
- package/dist/providers/perplexity_agent.d.ts +11 -0
- package/dist/providers/perplexity_agent.js +5 -0
- package/dist/providers/pioneer.d.ts +11 -0
- package/dist/providers/pioneer.js +5 -0
- package/dist/providers/poe.d.ts +11 -0
- package/dist/providers/poe.js +5 -0
- package/dist/providers/poolside.d.ts +11 -0
- package/dist/providers/poolside.js +5 -0
- package/dist/providers/privatemode_ai.d.ts +11 -0
- package/dist/providers/privatemode_ai.js +5 -0
- package/dist/providers/qihang_ai.d.ts +11 -0
- package/dist/providers/qihang_ai.js +5 -0
- package/dist/providers/qiniu_ai.d.ts +11 -0
- package/dist/providers/qiniu_ai.js +5 -0
- package/dist/providers/qvac.d.ts +11 -0
- package/dist/providers/qvac.js +5 -0
- package/dist/providers/regolo_ai.d.ts +11 -0
- package/dist/providers/regolo_ai.js +5 -0
- package/dist/providers/requesty.d.ts +11 -0
- package/dist/providers/requesty.js +5 -0
- package/dist/providers/routing_run.d.ts +11 -0
- package/dist/providers/routing_run.js +5 -0
- package/dist/providers/sakana.d.ts +11 -0
- package/dist/providers/sakana.js +5 -0
- package/dist/providers/sap_ai_core.d.ts +11 -0
- package/dist/providers/sap_ai_core.js +5 -0
- package/dist/providers/sarvam.d.ts +11 -0
- package/dist/providers/sarvam.js +5 -0
- package/dist/providers/scaleway.d.ts +11 -0
- package/dist/providers/scaleway.js +5 -0
- package/dist/providers/scx.d.ts +11 -0
- package/dist/providers/scx.js +5 -0
- package/dist/providers/siliconflow.d.ts +11 -0
- package/dist/providers/siliconflow.js +5 -0
- package/dist/providers/siliconflow_cn.d.ts +11 -0
- package/dist/providers/siliconflow_cn.js +5 -0
- package/dist/providers/snowflake_cortex.d.ts +11 -0
- package/dist/providers/snowflake_cortex.js +5 -0
- package/dist/providers/stackit.d.ts +11 -0
- package/dist/providers/stackit.js +5 -0
- package/dist/providers/stepfun.d.ts +11 -0
- package/dist/providers/stepfun.js +5 -0
- package/dist/providers/stepfun_ai.d.ts +11 -0
- package/dist/providers/stepfun_ai.js +5 -0
- package/dist/providers/stepfun_ai_step_plan.d.ts +11 -0
- package/dist/providers/stepfun_ai_step_plan.js +5 -0
- package/dist/providers/stepfun_step_plan.d.ts +11 -0
- package/dist/providers/stepfun_step_plan.js +5 -0
- package/dist/providers/subconscious.d.ts +11 -0
- package/dist/providers/subconscious.js +5 -0
- package/dist/providers/submodel.d.ts +11 -0
- package/dist/providers/submodel.js +5 -0
- package/dist/providers/synthetic.d.ts +11 -0
- package/dist/providers/synthetic.js +5 -0
- package/dist/providers/tencent_coding_plan.d.ts +11 -0
- package/dist/providers/tencent_coding_plan.js +5 -0
- package/dist/providers/tencent_token_plan.d.ts +11 -0
- package/dist/providers/tencent_token_plan.js +5 -0
- package/dist/providers/tencent_tokenhub.d.ts +11 -0
- package/dist/providers/tencent_tokenhub.js +5 -0
- package/dist/providers/tensorx.d.ts +11 -0
- package/dist/providers/tensorx.js +5 -0
- package/dist/providers/the_grid_ai.d.ts +11 -0
- package/dist/providers/the_grid_ai.js +5 -0
- package/dist/providers/thinkingmachines.d.ts +11 -0
- package/dist/providers/thinkingmachines.js +5 -0
- package/dist/providers/tinfoil.d.ts +11 -0
- package/dist/providers/tinfoil.js +5 -0
- package/dist/providers/togetherai.d.ts +11 -0
- package/dist/providers/togetherai.js +5 -0
- package/dist/providers/trustedrouter.d.ts +11 -0
- package/dist/providers/trustedrouter.js +5 -0
- package/dist/providers/umans_ai.d.ts +11 -0
- package/dist/providers/umans_ai.js +5 -0
- package/dist/providers/umans_ai_coding_plan.d.ts +11 -0
- package/dist/providers/umans_ai_coding_plan.js +5 -0
- package/dist/providers/unorouter.d.ts +11 -0
- package/dist/providers/unorouter.js +5 -0
- package/dist/providers/upstage.d.ts +11 -0
- package/dist/providers/upstage.js +5 -0
- package/dist/providers/v0.d.ts +11 -0
- package/dist/providers/v0.js +5 -0
- package/dist/providers/venice.d.ts +11 -0
- package/dist/providers/venice.js +5 -0
- package/dist/providers/vercel.d.ts +11 -0
- package/dist/providers/vercel.js +5 -0
- package/dist/providers/vivgrid.d.ts +11 -0
- package/dist/providers/vivgrid.js +5 -0
- package/dist/providers/vultr.d.ts +11 -0
- package/dist/providers/vultr.js +5 -0
- package/dist/providers/wafer_ai.d.ts +11 -0
- package/dist/providers/wafer_ai.js +5 -0
- package/dist/providers/wandb.d.ts +11 -0
- package/dist/providers/wandb.js +5 -0
- package/dist/providers/xai.d.ts +11 -0
- package/dist/providers/xai.js +5 -0
- package/dist/providers/xiaomi.d.ts +11 -0
- package/dist/providers/xiaomi.js +5 -0
- package/dist/providers/xiaomi_token_plan_ams.d.ts +11 -0
- package/dist/providers/xiaomi_token_plan_ams.js +5 -0
- package/dist/providers/xiaomi_token_plan_cn.d.ts +11 -0
- package/dist/providers/xiaomi_token_plan_cn.js +5 -0
- package/dist/providers/xiaomi_token_plan_sgp.d.ts +11 -0
- package/dist/providers/xiaomi_token_plan_sgp.js +5 -0
- package/dist/providers/xpersona.d.ts +11 -0
- package/dist/providers/xpersona.js +5 -0
- package/dist/providers/zai.d.ts +11 -0
- package/dist/providers/zai.js +5 -0
- package/dist/providers/zai_coder.d.ts +11 -0
- package/dist/providers/zai_coder.js +5 -0
- package/dist/providers/zai_coding_plan.d.ts +11 -0
- package/dist/providers/zai_coding_plan.js +5 -0
- package/dist/providers/zeldoc.d.ts +11 -0
- package/dist/providers/zeldoc.js +5 -0
- package/dist/providers/zenifra.d.ts +11 -0
- package/dist/providers/zenifra.js +5 -0
- package/dist/providers/zenmux.d.ts +11 -0
- package/dist/providers/zenmux.js +5 -0
- package/dist/providers/zhipuai.d.ts +11 -0
- package/dist/providers/zhipuai.js +5 -0
- package/dist/providers/zhipuai_coding_plan.d.ts +11 -0
- package/dist/providers/zhipuai_coding_plan.js +5 -0
- package/dist/snapshot.d.ts +3 -0
- package/dist/snapshot.js +377 -0
- package/dist/spec.d.ts +4 -0
- package/dist/spec.js +46 -0
- package/dist/types.d.ts +287 -0
- package/dist/types.js +1 -0
- package/package.json +80 -0
|
@@ -0,0 +1,5 @@
|
|
|
1
|
+
import { createProviderCatalog } from "../provider.js";
|
|
2
|
+
|
|
3
|
+
export const data = {"alias_of":null,"base_url":"https://nano-gpt.com/api/v1","catalog_only":true,"config_schema":null,"doc":"https://docs.nano-gpt.com","env":["NANO_GPT_API_KEY"],"exclude_models":null,"extra":null,"id":"nano_gpt","models":{"Baichuan-M2":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":7.865,"input":15.73,"output":15.73},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"baichuan","open_weights":false,"structured_output":false},"family":null,"id":"Baichuan-M2","knowledge":null,"last_updated":"2025-08-19","lifecycle":null,"limits":{"context":32768,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Baichuan M2 32B Medical","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-19","retired":false,"tags":null},"Baichuan4-Air":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.0785,"input":0.157,"output":0.157},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"baichuan","open_weights":false,"structured_output":false},"family":null,"id":"Baichuan4-Air","knowledge":null,"last_updated":"2025-08-19","lifecycle":null,"limits":{"context":32768,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Baichuan 4 Air","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-19","retired":false,"tags":null},"Baichuan4-Turbo":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.21,"input":2.42,"output":2.42},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"baichuan","open_weights":false,"structured_output":false},"family":null,"id":"Baichuan4-Turbo","knowledge":null,"last_updated":"2025-08-19","lifecycle":null,"limits":{"context":128000,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Baichuan 4 Turbo","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-19","retired":false,"tags":null},"Doctor-Shotgun/MS3.2-24B-Magnum-Diamond":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2465,"input":0.493,"output":0.493},"deprecated":false,"extra":{"attachment":false,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","family":"mistral","open_weights":true,"structured_output":false},"family":null,"id":"Doctor-Shotgun/MS3.2-24B-Magnum-Diamond","knowledge":null,"last_updated":"2025-11-24","lifecycle":null,"limits":{"context":16384,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MS3.2 24B Magnum Diamond","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-11-24","retired":false,"tags":null},"EVA-UNIT-01/EVA-LLaMA-3.33-70B-v0.0":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.003,"input":2.006,"output":2.006},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"EVA-UNIT-01/EVA-LLaMA-3.33-70B-v0.0","knowledge":null,"last_updated":"2025-07-26","lifecycle":null,"limits":{"context":16384,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"EVA Llama 3.33 70B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-26","retired":false,"tags":null},"EVA-UNIT-01/EVA-LLaMA-3.33-70B-v0.1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.003,"input":2.006,"output":2.006},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"EVA-UNIT-01/EVA-LLaMA-3.33-70B-v0.1","knowledge":null,"last_updated":"2025-09-25","lifecycle":null,"limits":{"context":16384,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"EVA-LLaMA-3.33-70B-v0.1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-25","retired":false,"tags":null},"EVA-UNIT-01/EVA-Qwen2.5-32B-v0.2":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.3995,"input":0.799,"output":0.799},"deprecated":false,"extra":{"attachment":false,"description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","open_weights":true,"structured_output":false},"family":null,"id":"EVA-UNIT-01/EVA-Qwen2.5-32B-v0.2","knowledge":null,"last_updated":"2025-07-26","lifecycle":null,"limits":{"context":16384,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"EVA-Qwen2.5-32B-v0.2","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-26","retired":false,"tags":null},"EVA-UNIT-01/EVA-Qwen2.5-72B-v0.2":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.3995,"input":0.799,"output":0.799},"deprecated":false,"extra":{"attachment":false,"description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","open_weights":true,"structured_output":false},"family":null,"id":"EVA-UNIT-01/EVA-Qwen2.5-72B-v0.2","knowledge":null,"last_updated":"2025-09-25","lifecycle":null,"limits":{"context":16384,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"EVA-Qwen2.5-72B-v0.2","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-25","retired":false,"tags":null},"Envoid/Llama-3.05-NT-Storybreaker-Ministral-70B":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2465,"input":0.493,"output":0.493},"deprecated":false,"extra":{"attachment":false,"description":"Compact Mistral model for edge, latency-sensitive, and cost-efficient workloads","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"Envoid/Llama-3.05-NT-Storybreaker-Ministral-70B","knowledge":null,"last_updated":"2024-12-01","lifecycle":null,"limits":{"context":16384,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.05 Storybreaker Ministral 70b","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"Envoid/Llama-3.05-Nemotron-Tenyxchat-Storybreaker-70B":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2465,"input":0.493,"output":0.493},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","family":"nemotron","open_weights":true,"structured_output":false},"family":null,"id":"Envoid/Llama-3.05-Nemotron-Tenyxchat-Storybreaker-70B","knowledge":null,"last_updated":"2024-12-01","lifecycle":null,"limits":{"context":16384,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Nemotron Tenyxchat Storybreaker 70b","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"GLM-4.6-Derestricted-v5":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.2,"input":0.4,"output":1.5},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"glm","open_weights":true,"reasoning_options":[],"structured_output":false},"family":null,"id":"GLM-4.6-Derestricted-v5","knowledge":null,"last_updated":"2025-12-23","lifecycle":null,"limits":{"context":131072,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4.6 Derestricted v5","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-23","retired":false,"tags":null},"GalrionSoftworks/MN-LooseCannon-12B-v1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2465,"input":0.493,"output":0.493},"deprecated":false,"extra":{"attachment":false,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","family":"mistral-nemo","open_weights":true,"structured_output":false},"family":null,"id":"GalrionSoftworks/MN-LooseCannon-12B-v1","knowledge":null,"last_updated":"2024-07-01","lifecycle":null,"limits":{"context":16384,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MN-LooseCannon-12B-v1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"Gemma-4-31B-Claude-4.6-Opus-Reasoning-Distilled":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.0306,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"O-series reasoning model for hard analysis, math, coding, and planning","family":"claude","open_weights":true,"reasoning_options":[],"structured_output":false},"family":null,"id":"Gemma-4-31B-Claude-4.6-Opus-Reasoning-Distilled","knowledge":null,"last_updated":"2026-05-01","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 4 31B Claude 4.6 Opus Reasoning Distilled","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-01","retired":false,"tags":null},"Gemma-4-31B-Cognitive-Unshackled":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemma","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":false},"family":null,"id":"Gemma-4-31B-Cognitive-Unshackled","knowledge":null,"last_updated":"2026-05-01","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 4 31B Cognitive Unshackled","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-01","retired":false,"tags":null},"Gemma-4-31B-DarkIdol":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemma","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":false},"family":null,"id":"Gemma-4-31B-DarkIdol","knowledge":null,"last_updated":"2026-05-01","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 4 31B DarkIdol","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-01","retired":false,"tags":null},"Gemma-4-31B-GarnetV2":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemma","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":false},"family":null,"id":"Gemma-4-31B-GarnetV2","knowledge":null,"last_updated":"2026-05-01","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 4 31B Garnet V2","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-01","retired":false,"tags":null},"Gemma-4-31B-Gemopus":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemma","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":false},"family":null,"id":"Gemma-4-31B-Gemopus","knowledge":null,"last_updated":"2026-05-01","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 4 31B Gemopus","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-01","retired":false,"tags":null},"Gemma-4-31B-Musica-v1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemma","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":false},"family":null,"id":"Gemma-4-31B-Musica-v1","knowledge":null,"last_updated":"2026-05-01","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 4 31B Musica v1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-01","retired":false,"tags":null},"Gemma-4-31B-Queen":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemma","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":false},"family":null,"id":"Gemma-4-31B-Queen","knowledge":null,"last_updated":"2026-05-01","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 4 31B Queen","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-01","retired":false,"tags":null},"Gryphe/MythoMax-L2-13b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.05015,"input":0.1003,"output":0.1003},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"Gryphe/MythoMax-L2-13b","knowledge":null,"last_updated":"2025-08-08","lifecycle":null,"limits":{"context":4000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MythoMax 13B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-08","retired":false,"tags":null},"LLM360/K2-Think":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.085,"input":0.17,"output":0.68},"deprecated":false,"extra":{"attachment":false,"description":"Kimi reasoning model for long-horizon research, planning, and tool use","family":"kimi-thinking","open_weights":true,"structured_output":false},"family":null,"id":"LLM360/K2-Think","knowledge":null,"last_updated":"2025-07-26","lifecycle":null,"limits":{"context":128000,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"K2-Think","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-26","retired":false,"tags":null},"LatitudeGames/Wayfarer-Large-70B-Llama-3.3":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.35,"input":0.7,"output":0.7},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"LatitudeGames/Wayfarer-Large-70B-Llama-3.3","knowledge":null,"last_updated":"2025-02-20","lifecycle":null,"limits":{"context":16384,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.3 70B Wayfarer","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-02-20","retired":false,"tags":null},"MarinaraSpaghetti/NemoMix-Unleashed-12B":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2465,"input":0.493,"output":0.493},"deprecated":false,"extra":{"attachment":false,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","family":"mistral-nemo","llmfit":{"architecture":"mistral","context_length":4096,"discovered":true,"gguf_sources":[],"hf_downloads":0,"hf_likes":0,"matched_hugging_face_id":"MarinaraSpaghetti/NemoMix-Unleashed-12B","memory":{"min_ram_gb":6.8,"min_vram_gb":6.3,"recommended_ram_gb":11.4},"model_id":"MarinaraSpaghetti/NemoMix-Unleashed-12B","parameter_count":"12.2B","parameters_raw":12247782400,"pipeline_tag":"text-generation","provider":"marinaraspaghetti","quantization":"Q4_K_M","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"structured_output":false},"family":null,"id":"MarinaraSpaghetti/NemoMix-Unleashed-12B","knowledge":null,"last_updated":"2024-07-01","lifecycle":null,"limits":{"context":32768,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"NemoMix 12B Unleashed","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"Meta-Llama-3-1-8B-Instruct-FP8":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.01,"input":0.02,"output":0.03},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"Meta-Llama-3-1-8B-Instruct-FP8","knowledge":null,"last_updated":"2024-07-23","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 8B (decentralized)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"MiniMax-M1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.0697,"input":0.1394,"output":1.3328},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"minimax","open_weights":true,"structured_output":false},"family":null,"id":"MiniMax-M1","knowledge":null,"last_updated":"2025-06-16","lifecycle":null,"limits":{"context":1000000,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MiniMax M1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-01-08","retired":false,"tags":null},"MiniMax-M2":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.085,"input":0.17,"output":1.53},"deprecated":false,"extra":{"attachment":false,"description":"Efficient open MiniMax model built for coding agents and tool-heavy workflows","family":"minimax","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":true},"family":null,"id":"MiniMax-M2","knowledge":null,"last_updated":"2025-10-27","lifecycle":null,"limits":{"context":200000,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MiniMax M2","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-10-27","retired":false,"tags":null},"MiniMaxAI/MiniMax-M1-80k":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.3026,"input":0.6052,"output":2.4225},"deprecated":false,"extra":{"attachment":false,"description":"MiniMax model for chat, coding, office work, and agentic tasks","family":"minimax","llmfit":{"architecture":"minimax_m1","context_length":4096,"discovered":true,"gguf_sources":[],"hf_downloads":0,"hf_likes":0,"matched_hugging_face_id":"MiniMaxAI/MiniMax-M1-80k","memory":{"min_ram_gb":254.9,"min_vram_gb":233.6,"recommended_ram_gb":424.8},"model_id":"MiniMaxAI/MiniMax-M1-80k","parameter_count":"456.1B","parameters_raw":456089655296,"pipeline_tag":"text-generation","provider":"minimaxai","quantization":"Q4_K_M","source":"llmfit","use_case":"Lightweight, edge deployment"},"open_weights":false,"structured_output":false},"family":null,"id":"MiniMaxAI/MiniMax-M1-80k","knowledge":null,"last_updated":"2025-06-16","lifecycle":null,"limits":{"context":1000000,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MiniMax M1 80K","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-01-08","retired":false,"tags":null},"NeverSleep/Lumimaid-v0.2-70B":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.5,"input":1,"output":1.5},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"NeverSleep/Lumimaid-v0.2-70B","knowledge":null,"last_updated":"2024-07-01","lifecycle":null,"limits":{"context":16384,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Lumimaid v0.2","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"NousResearch/Hermes-4-70B:thinking":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1003,"input":0.2006,"output":0.3995},"deprecated":false,"extra":{"attachment":false,"description":"General-purpose chat model for instruction following, writing, and analysis","family":"nousresearch","open_weights":true,"structured_output":false},"family":null,"id":"NousResearch/Hermes-4-70B:thinking","knowledge":null,"last_updated":"2025-09-17","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Hermes 4 (Thinking)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-17","retired":false,"tags":null},"NousResearch/hermes-3-llama-3.1-70b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.204,"input":0.408,"output":0.408},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"nousresearch","open_weights":true,"structured_output":false},"family":null,"id":"NousResearch/hermes-3-llama-3.1-70b","knowledge":null,"last_updated":"2026-01-07","lifecycle":null,"limits":{"context":65536,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Hermes 3 70B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-01-07","retired":false,"tags":null},"NousResearch/hermes-4-405b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":1.2},"deprecated":false,"extra":{"attachment":false,"description":"Flagship model for demanding analysis, coding, and production agent workflows","family":"nousresearch","open_weights":true,"structured_output":true},"family":null,"id":"NousResearch/hermes-4-405b","knowledge":null,"last_updated":"2025-08-26","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Hermes 4 Large","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-26","retired":false,"tags":null},"NousResearch/hermes-4-405b:thinking":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":1.2},"deprecated":false,"extra":{"attachment":false,"description":"Flagship model for demanding analysis, coding, and production agent workflows","family":"nousresearch","open_weights":true,"structured_output":true},"family":null,"id":"NousResearch/hermes-4-405b:thinking","knowledge":null,"last_updated":"2024-01-01","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Hermes 4 Large (Thinking)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"NousResearch/hermes-4-70b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1003,"input":0.2006,"output":0.3995},"deprecated":false,"extra":{"attachment":false,"description":"General-purpose chat model for instruction following, writing, and analysis","family":"nousresearch","open_weights":true,"structured_output":false},"family":null,"id":"NousResearch/hermes-4-70b","knowledge":null,"last_updated":"2025-07-03","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Hermes 4 Medium","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-03","retired":false,"tags":null},"Qwen3.5-27B-Anko":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-Anko","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Anko","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-30","retired":false,"tags":null},"Qwen3.5-27B-BlueStar-Derestricted":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-BlueStar-Derestricted","knowledge":null,"last_updated":"2026-04-06","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B BlueStar Derestricted","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-06","retired":false,"tags":null},"Qwen3.5-27B-BlueStar-Derestricted-Lite":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-BlueStar-Derestricted-Lite","knowledge":null,"last_updated":"2026-04-06","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B BlueStar Derestricted Lite","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-06","retired":false,"tags":null},"Qwen3.5-27B-BlueStar-v2-Derestricted":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-BlueStar-v2-Derestricted","knowledge":null,"last_updated":"2026-04-06","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B BlueStar v2 Derestricted","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-06","retired":false,"tags":null},"Qwen3.5-27B-BlueStar-v2-Derestricted-Lite":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-BlueStar-v2-Derestricted-Lite","knowledge":null,"last_updated":"2026-04-06","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B BlueStar v2 Derestricted Lite","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-06","retired":false,"tags":null},"Qwen3.5-27B-BlueStar-v3-Derestricted":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-BlueStar-v3-Derestricted","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B BlueStar v3 Derestricted","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-30","retired":false,"tags":null},"Qwen3.5-27B-BlueStar-v3-Derestricted-Lite":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-BlueStar-v3-Derestricted-Lite","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B BlueStar v3 Derestricted Lite","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-30","retired":false,"tags":null},"Qwen3.5-27B-Derestricted":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-Derestricted","knowledge":null,"last_updated":"2026-03-17","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Derestricted","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-17","retired":false,"tags":null},"Qwen3.5-27B-Infracelestial":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-Infracelestial","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Infracelestial","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-30","retired":false,"tags":null},"Qwen3.5-27B-Marvin-DPO-V2-Derestricted":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-Marvin-DPO-V2-Derestricted","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Marvin DPO V2 Derestricted","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-30","retired":false,"tags":null},"Qwen3.5-27B-Marvin-DPO-V2-Derestricted-Lite":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-Marvin-DPO-V2-Derestricted-Lite","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Marvin DPO V2 Derestricted Lite","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-30","retired":false,"tags":null},"Qwen3.5-27B-Marvin-V2-Derestricted":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-Marvin-V2-Derestricted","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Marvin V2 Derestricted","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-30","retired":false,"tags":null},"Qwen3.5-27B-Marvin-V2-Derestricted-Lite":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-Marvin-V2-Derestricted-Lite","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Marvin V2 Derestricted Lite","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-30","retired":false,"tags":null},"Qwen3.5-27B-Musica-v1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-Musica-v1","knowledge":null,"last_updated":"2026-03-27","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Musica v1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-27","retired":false,"tags":null},"Qwen3.5-27B-NaNovel-Derestricted":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-NaNovel-Derestricted","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B NaNovel Derestricted","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-30","retired":false,"tags":null},"Qwen3.5-27B-NaNovel-Derestricted-Lite":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-NaNovel-Derestricted-Lite","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B NaNovel Derestricted Lite","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-30","retired":false,"tags":null},"Qwen3.5-27B-Omega-Evolution-v2.0-Derestricted":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-Omega-Evolution-v2.0-Derestricted","knowledge":null,"last_updated":"2026-04-06","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Omega Evolution v2.0 Derestricted","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-06","retired":false,"tags":null},"Qwen3.5-27B-Omega-Evolution-v2.0-Derestricted-Lite":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-Omega-Evolution-v2.0-Derestricted-Lite","knowledge":null,"last_updated":"2026-04-06","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Omega Evolution v2.0 Derestricted Lite","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-06","retired":false,"tags":null},"Qwen3.5-27B-Omega-Evolution-v2.2-Derestricted":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-Omega-Evolution-v2.2-Derestricted","knowledge":null,"last_updated":"2026-05-02","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Omega Evolution v2.2 Derestricted","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-02","retired":false,"tags":null},"Qwen3.5-27B-Omega-Evolution-v2.2-Derestricted-Lite":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-Omega-Evolution-v2.2-Derestricted-Lite","knowledge":null,"last_updated":"2026-05-02","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Omega Evolution v2.2 Derestricted Lite","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-02","retired":false,"tags":null},"Qwen3.5-27B-Queen-Derestricted":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-Queen-Derestricted","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Queen Derestricted","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-30","retired":false,"tags":null},"Qwen3.5-27B-Queen-Derestricted-Lite":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-Queen-Derestricted-Lite","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Queen Derestricted Lite","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-30","retired":false,"tags":null},"Qwen3.5-27B-RpRMax-v1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-RpRMax-v1","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B RpRMax v1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-30","retired":false,"tags":null},"Qwen3.5-27B-Vivid-Durian":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-Vivid-Durian","knowledge":null,"last_updated":"2026-03-18","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Vivid Durian","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-18","retired":false,"tags":null},"Qwen3.5-27B-Writer-Derestricted":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-Writer-Derestricted","knowledge":null,"last_updated":"2026-04-06","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Writer Derestricted","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-06","retired":false,"tags":null},"Qwen3.5-27B-Writer-Derestricted-Lite":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-Writer-Derestricted-Lite","knowledge":null,"last_updated":"2026-04-06","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Writer Derestricted Lite","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-06","retired":false,"tags":null},"Qwen3.5-27B-Writer-V2-Derestricted":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-Writer-V2-Derestricted","knowledge":null,"last_updated":"2026-04-06","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Writer V2 Derestricted","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-06","retired":false,"tags":null},"Qwen3.5-27B-Writer-V2-Derestricted-Lite":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-Writer-V2-Derestricted-Lite","knowledge":null,"last_updated":"2026-04-06","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Writer V2 Derestricted Lite","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-06","retired":false,"tags":null},"Qwen3.5-27B-earica-Derestricted":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-earica-Derestricted","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B earica Derestricted","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-30","retired":false,"tags":null},"Qwen3.5-27B-earica-Derestricted-Lite":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.306},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"Qwen3.5-27B-earica-Derestricted-Lite","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 27B earica Derestricted Lite","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-30","retired":false,"tags":null},"ReadyArt/MS3.2-The-Omega-Directive-24B-Unslop-v2.0":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.25,"input":0.5,"output":0.5},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"ReadyArt/MS3.2-The-Omega-Directive-24B-Unslop-v2.0","knowledge":null,"last_updated":"2025-12-08","lifecycle":null,"limits":{"context":16384,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Omega Directive 24B Unslop v2.0","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-08","retired":false,"tags":null},"Salesforce/Llama-xLAM-2-70b-fc-r":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.25,"input":2.5,"output":2.5},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"Salesforce/Llama-xLAM-2-70b-fc-r","knowledge":null,"last_updated":"2025-04-13","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama-xLAM-2 70B fc-r","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-13","retired":false,"tags":null},"Sao10K/L3-8B-Stheno-v3.2":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1003,"input":0.2006,"output":0.2006},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","llmfit":{"architecture":"llama","context_length":8192,"discovered":true,"gguf_sources":[],"hf_downloads":19944,"hf_likes":0,"matched_hugging_face_id":"Sao10K/L3-8B-Stheno-v3.2","memory":{"min_ram_gb":4.5,"min_vram_gb":4.1,"recommended_ram_gb":7.5},"model_id":"Sao10K/L3-8B-Stheno-v3.2","parameter_count":"8.0B","parameters_raw":8030261248,"pipeline_tag":"text-generation","provider":"sao10k","quantization":"Q4_K_M","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"structured_output":false},"family":null,"id":"Sao10K/L3-8B-Stheno-v3.2","knowledge":null,"last_updated":"2024-11-29","lifecycle":null,"limits":{"context":16384,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Sao10K Stheno 8b","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"Sao10K/L3.1-70B-Euryale-v2.2":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.153,"input":0.306,"output":0.357},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"Sao10K/L3.1-70B-Euryale-v2.2","knowledge":null,"last_updated":"2024-07-23","lifecycle":null,"limits":{"context":20480,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 70B Euryale","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"Sao10K/L3.1-70B-Hanami-x1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2465,"input":0.493,"output":0.493},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"Sao10K/L3.1-70B-Hanami-x1","knowledge":null,"last_updated":"2024-07-23","lifecycle":null,"limits":{"context":16384,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 70B Hanami","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"Sao10K/L3.3-70B-Euryale-v2.3":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2465,"input":0.493,"output":0.493},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","llmfit":{"architecture":"llama","context_length":1048576,"discovered":true,"gguf_sources":[{"provider":"bartowski","repo":"bartowski/L3.3-70B-Euryale-v2.3-GGUF"},{"provider":"mradermacher","repo":"mradermacher/L3.3-70B-Euryale-v2.3-GGUF"}],"hf_downloads":49996,"hf_likes":0,"matched_hugging_face_id":"Sao10K/L3.3-70B-Euryale-v2.3","memory":{"min_ram_gb":39.4,"min_vram_gb":36.1,"recommended_ram_gb":65.7},"model_id":"Sao10K/L3.3-70B-Euryale-v2.3","parameter_count":"70.6B","parameters_raw":70553706496,"pipeline_tag":"text-generation","provider":"sao10k","quantization":"Q4_K_M","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"structured_output":false},"family":null,"id":"Sao10K/L3.3-70B-Euryale-v2.3","knowledge":null,"last_updated":"2024-12-06","lifecycle":null,"limits":{"context":20480,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.3 70B Euryale","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"Steelskull/L3.3-Cu-Mai-R1-70b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2465,"input":0.493,"output":0.493},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"Steelskull/L3.3-Cu-Mai-R1-70b","knowledge":null,"last_updated":"2024-12-06","lifecycle":null,"limits":{"context":16384,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.3 70B Cu Mai","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"Steelskull/L3.3-Electra-R1-70b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.349945,"input":0.69989,"output":0.69989},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"Steelskull/L3.3-Electra-R1-70b","knowledge":null,"last_updated":"2024-12-06","lifecycle":null,"limits":{"context":16384,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Steelskull Electra R1 70b","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"Steelskull/L3.3-MS-Evayale-70B":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2465,"input":0.493,"output":0.493},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"Steelskull/L3.3-MS-Evayale-70B","knowledge":null,"last_updated":"2024-12-06","lifecycle":null,"limits":{"context":16384,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Evayale 70b ","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"Steelskull/L3.3-MS-Nevoria-70b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2465,"input":0.493,"output":0.493},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","llmfit":{"architecture":"llama","context_length":1048576,"discovered":true,"gguf_sources":[{"provider":"bartowski","repo":"bartowski/L3.3-MS-Nevoria-70b-GGUF"},{"provider":"mradermacher","repo":"mradermacher/L3.3-MS-Nevoria-70b-GGUF"}],"hf_downloads":1050,"hf_likes":0,"matched_hugging_face_id":"Steelskull/L3.3-MS-Nevoria-70b","memory":{"min_ram_gb":39.4,"min_vram_gb":36.1,"recommended_ram_gb":65.7},"model_id":"Steelskull/L3.3-MS-Nevoria-70b","parameter_count":"70.6B","parameters_raw":70553706496,"pipeline_tag":"text-generation","provider":"steelskull","quantization":"Q4_K_M","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"structured_output":false},"family":null,"id":"Steelskull/L3.3-MS-Nevoria-70b","knowledge":null,"last_updated":"2024-12-06","lifecycle":null,"limits":{"context":16384,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Steelskull Nevoria 70b","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"Steelskull/L3.3-Nevoria-R1-70b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2465,"input":0.493,"output":0.493},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","llmfit":{"architecture":"llama","context_length":4096,"discovered":true,"gguf_sources":[],"hf_downloads":0,"hf_likes":0,"matched_hugging_face_id":"Steelskull/L3.3-Nevoria-R1-70b","memory":{"min_ram_gb":39.4,"min_vram_gb":36.1,"recommended_ram_gb":65.7},"model_id":"Steelskull/L3.3-Nevoria-R1-70b","parameter_count":"70.6B","parameters_raw":70553706496,"pipeline_tag":"text-generation","provider":"steelskull","quantization":"Q4_K_M","source":"llmfit","use_case":"Advanced reasoning, chain-of-thought"},"open_weights":true,"structured_output":false},"family":null,"id":"Steelskull/L3.3-Nevoria-R1-70b","knowledge":null,"last_updated":"2024-12-06","lifecycle":null,"limits":{"context":16384,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Steelskull Nevoria R1 70b","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"TEE/deepseek-v3.1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.5,"input":1,"output":2.5},"deprecated":false,"extra":{"attachment":false,"description":"DeepSeek chat model for instruction following, coding, and analysis","family":"deepseek","open_weights":true,"structured_output":false},"family":null,"id":"TEE/deepseek-v3.1","knowledge":null,"last_updated":"2025-08-21","lifecycle":null,"limits":{"context":164000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V3.1 TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"TEE/deepseek-v3.2":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.25,"input":0.5,"output":1},"deprecated":false,"extra":{"attachment":false,"description":"DeepSeek chat model for instruction following, coding, and analysis","family":"deepseek","open_weights":true,"structured_output":false},"family":null,"id":"TEE/deepseek-v3.2","knowledge":null,"last_updated":"2025-12-01","lifecycle":null,"limits":{"context":164000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V3.2 TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"TEE/deepseek-v4-flash":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.04,"input":0.2,"output":0.4},"deprecated":false,"extra":{"attachment":false,"description":"Fast DeepSeek V4 lane for economical reasoning, coding, and long-context work","family":"deepseek-flash","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"TEE/deepseek-v4-flash","knowledge":"2025-05","last_updated":"2026-04-24","lifecycle":null,"limits":{"context":1048576,"output":1048576},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Flash TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-24","retired":false,"tags":null},"TEE/gemma-3-27b-it":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1,"input":0.2,"output":0.8},"deprecated":false,"extra":{"attachment":false,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"gemma","open_weights":true,"structured_output":false},"family":null,"id":"TEE/gemma-3-27b-it","knowledge":null,"last_updated":"2025-03-10","lifecycle":null,"limits":{"context":131072,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Gemma 3 27B TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"TEE/gemma-4-26b-a4b-uncensored":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.075,"input":0.15,"output":0.7},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"gemma","open_weights":true,"structured_output":true},"family":null,"id":"TEE/gemma-4-26b-a4b-uncensored","knowledge":null,"last_updated":"2026-05-23","lifecycle":null,"limits":{"context":65536,"output":65536},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 4 26B A4B Uncensored TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-23","retired":false,"tags":null},"TEE/gemma-4-31b-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.075,"input":0.15,"output":0.46},"deprecated":false,"extra":{"attachment":false,"description":"Largest Gemma 4 instruction model for open, self-hosted chat and reasoning","family":"gemma","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":false,"temperature":true},"family":null,"id":"TEE/gemma-4-31b-it","knowledge":null,"last_updated":"2026-04-02","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Gemma 4 31B IT TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-02","retired":false,"tags":null},"TEE/gemma4-31b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.45,"input":0.45,"output":1},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"gemma","open_weights":true,"structured_output":true},"family":null,"id":"TEE/gemma4-31b","knowledge":null,"last_updated":"2026-04-04","lifecycle":null,"limits":{"context":262144,"output":131072},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 4 31B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-04","retired":false,"tags":null},"TEE/gemma4-31b:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.45,"input":0.45,"output":1},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"gemma","open_weights":true,"reasoning_options":[],"structured_output":true},"family":null,"id":"TEE/gemma4-31b:thinking","knowledge":null,"last_updated":"2026-05-02","lifecycle":null,"limits":{"context":262144,"output":131072},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 4 31B Thinking TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-02","retired":false,"tags":null},"TEE/glm-4.7":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.425,"input":0.85,"output":3.3},"deprecated":false,"extra":{"attachment":false,"description":"Mature GLM model for dependable coding, reasoning, and structured agent tasks","family":"glm","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"TEE/glm-4.7","knowledge":"2025-04","last_updated":"2025-12-22","lifecycle":null,"limits":{"context":131000,"output":65535},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4.7 TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-22","retired":false,"tags":null},"TEE/glm-5.1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.3,"input":1.5,"output":5.25},"deprecated":false,"extra":{"attachment":false,"description":"Strong GLM coding model for agentic engineering, terminals, and repository generation","family":"glm","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":false,"temperature":true},"family":null,"id":"TEE/glm-5.1","knowledge":null,"last_updated":"2026-04-07","lifecycle":null,"limits":{"context":202752,"output":65535},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 5.1 TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-07","retired":false,"tags":null},"TEE/glm-5.1-thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.3,"input":1.5,"output":5.25},"deprecated":false,"extra":{"attachment":false,"description":"Strong GLM coding model for agentic engineering, terminals, and repository generation","family":"glm","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"TEE/glm-5.1-thinking","knowledge":null,"last_updated":"2026-04-07","lifecycle":null,"limits":{"context":202752,"output":65535},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 5.1 Thinking TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-07","retired":false,"tags":null},"TEE/glm-5.2":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"input":1.4,"output":4.6},"deprecated":false,"extra":{"attachment":false,"description":"Open flagship GLM for long-horizon coding agents and million-token context work","family":"glm","open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"TEE/glm-5.2","knowledge":null,"last_updated":"2026-06-13","lifecycle":null,"limits":{"context":1048576,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 5.2 TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-13","retired":false,"tags":null},"TEE/glm-5.2:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"input":1.4,"output":4.6},"deprecated":false,"extra":{"attachment":false,"description":"Open flagship GLM for long-horizon coding agents and million-token context work","family":"glm","open_weights":true,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"TEE/glm-5.2:thinking","knowledge":null,"last_updated":"2026-06-13","lifecycle":null,"limits":{"context":1048576,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 5.2 Thinking TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-13","retired":false,"tags":null},"TEE/gpt-oss-120b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":2,"input":2,"output":2},"deprecated":false,"extra":{"attachment":false,"description":"Open GPT reasoning model for self-hosted agents and controllable deployments","family":"gpt-oss","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"TEE/gpt-oss-120b","knowledge":null,"last_updated":"2025-08-05","lifecycle":null,"limits":{"context":131072,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GPT-OSS 120B TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-05","retired":false,"tags":null},"TEE/gpt-oss-20b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1,"input":0.2,"output":0.8},"deprecated":false,"extra":{"attachment":false,"description":"Open GPT reasoning model for self-hosted agents and controllable deployments","family":"gpt-oss","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"TEE/gpt-oss-20b","knowledge":null,"last_updated":"2025-08-05","lifecycle":null,"limits":{"context":131072,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GPT-OSS 20B TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-05","retired":false,"tags":null},"TEE/kimi-k2.5":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.3,"input":0.6,"output":3},"deprecated":false,"extra":{"attachment":true,"description":"Earlier Kimi frontier model for long-context agents, coding, and multimodal work","family":"kimi-k2","open_weights":true,"structured_output":false,"temperature":false},"family":null,"id":"TEE/kimi-k2.5","knowledge":"2025-01","last_updated":"2026-01","lifecycle":null,"limits":{"context":128000,"output":65535},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Kimi K2.5 TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-01","retired":false,"tags":null},"TEE/kimi-k2.5-thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.3,"input":0.6,"output":3},"deprecated":false,"extra":{"attachment":true,"description":"Earlier Kimi frontier model for long-context agents, coding, and multimodal work","family":"kimi-k2","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":false},"family":null,"id":"TEE/kimi-k2.5-thinking","knowledge":"2025-01","last_updated":"2026-01","lifecycle":null,"limits":{"context":128000,"output":65535},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Kimi K2.5 Thinking TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-01","retired":false,"tags":null},"TEE/kimi-k2.6":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.375,"input":1.5,"output":5.25},"deprecated":false,"extra":{"attachment":true,"description":"Multimodal Kimi workhorse for agent loops, coding tasks, and visual context","family":"kimi-k2","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"TEE/kimi-k2.6","knowledge":"2025-01","last_updated":"2026-04-21","lifecycle":null,"limits":{"context":262144,"output":65536},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Kimi K2.6 TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-21","retired":false,"tags":null},"TEE/kimi-k3":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":1.5,"input":3,"output":15},"deprecated":false,"extra":{"attachment":true,"description":"Multimodal Kimi model with 1M context and toggleable max-effort thinking for long-horizon agent work","family":"kimi-k3","open_weights":true,"reasoning_options":[{"type":"effort","values":["low","high","max"]}],"structured_output":true,"temperature":false},"family":null,"id":"TEE/kimi-k3","knowledge":null,"last_updated":"2026-07-16","lifecycle":null,"limits":{"context":1048576,"output":65535},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Kimi K3 TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-16","retired":false,"tags":null},"TEE/llama3-3-70b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":2,"input":2,"output":2},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"TEE/llama3-3-70b","knowledge":null,"last_updated":"2025-07-03","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.3 70B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-03","retired":false,"tags":null},"TEE/minimax-m2.5":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.1,"input":0.2,"output":1.38},"deprecated":false,"extra":{"attachment":false,"description":"Prior MiniMax coding model for agent workflows, office edits, and automation","family":"minimax","open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"TEE/minimax-m2.5","knowledge":null,"last_updated":"2026-02-12","lifecycle":null,"limits":{"context":196608,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MiniMax M2.5 TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-12","retired":false,"tags":null},"TEE/qwen2.5-vl-72b-instruct":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.35,"input":0.7,"output":0.7},"deprecated":false,"extra":{"attachment":true,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","open_weights":true,"structured_output":false},"family":null,"id":"TEE/qwen2.5-vl-72b-instruct","knowledge":null,"last_updated":"2025-02-01","lifecycle":null,"limits":{"context":65536,"output":8192},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen2.5 VL 72B TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"TEE/qwen3.5-122b-a10b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.23,"input":0.46,"output":3.68},"deprecated":false,"extra":{"attachment":false,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":false,"temperature":true},"family":null,"id":"TEE/qwen3.5-122b-a10b","knowledge":null,"last_updated":"2026-02-23","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3.5 122B A10B TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-23","retired":false,"tags":null},"TEE/qwen3.5-27b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":2.4},"deprecated":false,"extra":{"attachment":true,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"TEE/qwen3.5-27b","knowledge":null,"last_updated":"2026-02-23","lifecycle":null,"limits":{"context":262144,"output":65536},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.5 27B TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-23","retired":false,"tags":null},"TEE/qwen3.5-397b-a17b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.275,"input":0.55,"output":3.5},"deprecated":false,"extra":{"attachment":false,"description":"Large open Qwen multimodal MoE for visual agents and long technical tasks","family":"qwen","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"TEE/qwen3.5-397b-a17b","knowledge":null,"last_updated":"2026-02-15","lifecycle":null,"limits":{"context":262144,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3.5 397B A17B TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-15","retired":false,"tags":null},"TEE/qwen3.6-27b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.16,"input":0.32,"output":2.7},"deprecated":false,"extra":{"attachment":true,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":true},"family":null,"id":"TEE/qwen3.6-27b","knowledge":null,"last_updated":"2026-04-22","lifecycle":null,"limits":{"context":262144,"output":65536},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.6 27B TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-22","retired":false,"tags":null},"TEE/qwen3.6-35b-a3b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1,"input":0.2,"output":1.27},"deprecated":false,"extra":{"attachment":false,"description":"Open multimodal Qwen MoE for local agents that need vision, audio, and code","family":"qwen","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"TEE/qwen3.6-35b-a3b","knowledge":null,"last_updated":"2026-04-17","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3.6 35B A3B TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-17","retired":false,"tags":null},"TEE/qwen3.6-35b-a3b-uncensored":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":1.5},"deprecated":false,"extra":{"attachment":true,"description":"Multimodal reasoning model for visual analysis, planning, and tool use","family":"qwen3.6","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":131072,"min":1024,"type":"budget_tokens"}],"structured_output":true},"family":null,"id":"TEE/qwen3.6-35b-a3b-uncensored","knowledge":null,"last_updated":"2026-05-23","lifecycle":null,"limits":{"context":131072,"output":131072},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.6 35B A3B Uncensored TEE","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-23","retired":false,"tags":null},"THUDM/GLM-4-32B-0414":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1,"input":0.2,"output":0.2},"deprecated":false,"extra":{"attachment":false,"description":"Flagship GLM model for hybrid reasoning, coding, and agentic engineering","family":"glm","open_weights":true,"structured_output":false},"family":null,"id":"THUDM/GLM-4-32B-0414","knowledge":null,"last_updated":"2025-04-14","lifecycle":null,"limits":{"context":128000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4 32B 0414","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"THUDM/GLM-4-9B-0414":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1,"input":0.2,"output":0.2},"deprecated":false,"extra":{"attachment":false,"description":"Flagship GLM model for hybrid reasoning, coding, and agentic engineering","family":"glm","open_weights":true,"structured_output":false},"family":null,"id":"THUDM/GLM-4-9B-0414","knowledge":null,"last_updated":"2025-04-14","lifecycle":null,"limits":{"context":32000,"output":8000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4 9B 0414","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"THUDM/GLM-Z1-9B-0414":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1,"input":0.2,"output":0.2},"deprecated":false,"extra":{"attachment":false,"description":"Flagship GLM model for hybrid reasoning, coding, and agentic engineering","family":"glm-z","open_weights":true,"structured_output":false},"family":null,"id":"THUDM/GLM-Z1-9B-0414","knowledge":null,"last_updated":"2025-04-14","lifecycle":null,"limits":{"context":32000,"output":8000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM Z1 9B 0414","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"TheDrummer/Anubis-70B-v1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.155,"input":0.31,"output":0.31},"deprecated":false,"extra":{"attachment":false,"description":"General-purpose chat model for instruction following, writing, and analysis","open_weights":true,"structured_output":false},"family":null,"id":"TheDrummer/Anubis-70B-v1","knowledge":null,"last_updated":"2024-01-01","lifecycle":null,"limits":{"context":65536,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Anubis 70B v1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"TheDrummer/Anubis-70B-v1.1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.155,"input":0.31,"output":0.31},"deprecated":false,"extra":{"attachment":false,"description":"General-purpose chat model for instruction following, writing, and analysis","open_weights":true,"structured_output":false},"family":null,"id":"TheDrummer/Anubis-70B-v1.1","knowledge":null,"last_updated":"2024-01-01","lifecycle":null,"limits":{"context":131072,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Anubis 70B v1.1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"TheDrummer/Cydonia-24B-v2":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.05015,"input":0.1003,"output":0.1207},"deprecated":false,"extra":{"attachment":false,"description":"General-purpose chat model for instruction following, writing, and analysis","open_weights":true,"structured_output":false},"family":null,"id":"TheDrummer/Cydonia-24B-v2","knowledge":null,"last_updated":"2025-02-17","lifecycle":null,"limits":{"context":16384,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"The Drummer Cydonia 24B v2","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-02-17","retired":false,"tags":null},"TheDrummer/Cydonia-24B-v4":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1003,"input":0.2006,"output":0.2414},"deprecated":false,"extra":{"attachment":false,"description":"General-purpose chat model for instruction following, writing, and analysis","open_weights":true,"structured_output":false},"family":null,"id":"TheDrummer/Cydonia-24B-v4","knowledge":null,"last_updated":"2025-07-22","lifecycle":null,"limits":{"context":16384,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"The Drummer Cydonia 24B v4","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-22","retired":false,"tags":null},"TheDrummer/Cydonia-24B-v4.1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.16,"input":0.35,"output":0.55},"deprecated":false,"extra":{"attachment":false,"description":"General-purpose chat model for instruction following, writing, and analysis","open_weights":true,"structured_output":false},"family":null,"id":"TheDrummer/Cydonia-24B-v4.1","knowledge":null,"last_updated":"2025-08-19","lifecycle":null,"limits":{"context":131072,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"The Drummer Cydonia 24B v4.1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-19","retired":false,"tags":null},"TheDrummer/Cydonia-24B-v4.3":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.05015,"input":0.1003,"output":0.1207},"deprecated":false,"extra":{"attachment":false,"description":"General-purpose chat model for instruction following, writing, and analysis","open_weights":true,"structured_output":false},"family":null,"id":"TheDrummer/Cydonia-24B-v4.3","knowledge":null,"last_updated":"2025-12-25","lifecycle":null,"limits":{"context":32768,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"The Drummer Cydonia 24B v4.3","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-25","retired":false,"tags":null},"TheDrummer/Magidonia-24B-v4.3":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.05015,"input":0.1003,"output":0.1207},"deprecated":false,"extra":{"attachment":false,"description":"General-purpose chat model for instruction following, writing, and analysis","open_weights":true,"structured_output":false},"family":null,"id":"TheDrummer/Magidonia-24B-v4.3","knowledge":null,"last_updated":"2025-12-25","lifecycle":null,"limits":{"context":32768,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"The Drummer Magidonia 24B v4.3","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-25","retired":false,"tags":null},"TheDrummer/Rocinante-12B-v1.1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.204,"input":0.408,"output":0.595},"deprecated":false,"extra":{"attachment":false,"description":"General-purpose chat model for instruction following, writing, and analysis","open_weights":true,"structured_output":false},"family":null,"id":"TheDrummer/Rocinante-12B-v1.1","knowledge":null,"last_updated":"2024-01-01","lifecycle":null,"limits":{"context":16384,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Rocinante 12b","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"TheDrummer/UnslopNemo-12B-v4.1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2465,"input":0.493,"output":0.493},"deprecated":false,"extra":{"attachment":true,"description":"Multimodal model for analyzing text, images, documents, and rich media","open_weights":true,"structured_output":false},"family":null,"id":"TheDrummer/UnslopNemo-12B-v4.1","knowledge":null,"last_updated":"2024-01-01","lifecycle":null,"limits":{"context":8192,"output":8192},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"UnslopNemo 12b v4","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"TheDrummer/skyfall-36b-v2":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.25,"input":0.55,"output":0.8},"deprecated":false,"extra":{"attachment":true,"description":"Multimodal model for analyzing text, images, documents, and rich media","open_weights":true,"structured_output":false},"family":null,"id":"TheDrummer/skyfall-36b-v2","knowledge":null,"last_updated":"2025-03-10","lifecycle":null,"limits":{"context":32000,"output":32768},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"TheDrummer Skyfall 36B V2","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-03-10","retired":false,"tags":null},"Tongyi-Zhiwen/QwenLong-L1-32B":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.07,"input":0.14,"output":0.6},"deprecated":false,"extra":{"attachment":false,"description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","llmfit":{"architecture":"qwen2","context_length":131072,"discovered":true,"gguf_sources":[],"hf_downloads":0,"hf_likes":0,"matched_hugging_face_id":"Tongyi-Zhiwen/QwenLong-L1-32B","memory":{"min_ram_gb":18.3,"min_vram_gb":16.8,"recommended_ram_gb":30.5},"model_id":"Tongyi-Zhiwen/QwenLong-L1-32B","parameter_count":"32.8B","parameters_raw":32763876352,"pipeline_tag":"text-generation","provider":"tongyi-zhiwen","quantization":"Q4_K_M","source":"llmfit","use_case":"General purpose text generation"},"open_weights":false,"structured_output":false},"family":null,"id":"Tongyi-Zhiwen/QwenLong-L1-32B","knowledge":null,"last_updated":"2025-01-25","lifecycle":null,"limits":{"context":128000,"output":40960},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"QwenLong L1 32B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"VongolaChouko/Starcannon-Unleashed-12B-v1.0":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2465,"input":0.493,"output":0.493},"deprecated":false,"extra":{"attachment":false,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","family":"mistral-nemo","open_weights":true,"structured_output":false},"family":null,"id":"VongolaChouko/Starcannon-Unleashed-12B-v1.0","knowledge":null,"last_updated":"2024-07-01","lifecycle":null,"limits":{"context":16384,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mistral Nemo Starcannon 12b v1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"abacusai/Dracarys-72B-Instruct":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2465,"input":0.493,"output":0.493},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"abacusai/Dracarys-72B-Instruct","knowledge":null,"last_updated":"2025-08-02","lifecycle":null,"limits":{"context":16384,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 70B Dracarys 2","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-02","retired":false,"tags":null},"aion-labs/aion-2.0":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2,"input":0.8,"output":1.6},"deprecated":false,"extra":{"attachment":false,"description":"General-purpose chat model for instruction following, writing, and analysis","open_weights":false,"structured_output":false},"family":null,"id":"aion-labs/aion-2.0","knowledge":null,"last_updated":"2026-02-23","lifecycle":null,"limits":{"context":131072,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"AionLabs: Aion-2.0","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-23","retired":false,"tags":null},"aion-labs/aion-2.5":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.35,"input":1,"output":3},"deprecated":false,"extra":{"attachment":false,"description":"General-purpose chat model for instruction following, writing, and analysis","open_weights":false,"structured_output":false},"family":null,"id":"aion-labs/aion-2.5","knowledge":null,"last_updated":"2026-03-20","lifecycle":null,"limits":{"context":131072,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"AionLabs: Aion-2.5","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-20","retired":false,"tags":null},"aion-labs/aion-3.0":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.75,"input":3,"output":6},"deprecated":false,"extra":{"attachment":false,"description":"Aion 3.0 is a GLM-family collaborative generation model tuned for immersive roleplay and storytelling, with stronger narrative structure, tension, conflict, and nuanced mature themes.","open_weights":false,"reasoning_options":[],"structured_output":false},"family":null,"id":"aion-labs/aion-3.0","knowledge":null,"last_updated":"2026-07-07","lifecycle":null,"limits":{"context":131072,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"AionLabs: Aion 3.0","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-07","retired":false,"tags":null},"aion-labs/aion-3.0-mini":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.18,"input":0.7,"output":1.4},"deprecated":false,"extra":{"attachment":false,"description":"Aion 3.0 Mini is a DeepSeek-family collaborative generation model tuned for immersive roleplay and storytelling, with stronger narrative structure, tension, conflict, and nuanced mature themes.","open_weights":false,"reasoning_options":[],"structured_output":false},"family":null,"id":"aion-labs/aion-3.0-mini","knowledge":null,"last_updated":"2026-07-07","lifecycle":null,"limits":{"context":131072,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"AionLabs: Aion 3.0 Mini","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-07","retired":false,"tags":null},"aion-labs/aion-rp-llama-3.1-8b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.4,"input":0.8,"output":1.6},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":false,"structured_output":false},"family":null,"id":"aion-labs/aion-rp-llama-3.1-8b","knowledge":null,"last_updated":"2024-07-23","lifecycle":null,"limits":{"context":32768,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 8b (uncensored)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"alibaba/qwen3.6-27b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1015,"input":0.203,"output":2.24},"deprecated":false,"extra":{"attachment":true,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"alibaba/qwen3.6-27b","knowledge":null,"last_updated":"2026-04-22","lifecycle":null,"limits":{"context":260096,"output":65536},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.6 27B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-22","retired":false,"tags":null},"alibaba/qwen3.6-27b:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.1015,"input":0.203,"output":2.24},"deprecated":false,"extra":{"attachment":true,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","open_weights":true,"reasoning_options":[{"max":131072,"min":1024,"type":"budget_tokens"}],"structured_output":false,"temperature":true},"family":null,"id":"alibaba/qwen3.6-27b:thinking","knowledge":null,"last_updated":"2026-04-22","lifecycle":null,"limits":{"context":260096,"output":65536},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.6 27B Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-22","retired":false,"tags":null},"alibaba/qwen3.6-flash":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.02,"cache_write":0.24,"input":0.19,"output":1.16},"deprecated":false,"extra":{"attachment":true,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen3.6","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"alibaba/qwen3.6-flash","knowledge":null,"last_updated":"2026-04-27","lifecycle":null,"limits":{"context":991808,"output":65536},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.6 Flash","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-27","retired":false,"tags":null},"amazon/nova-2-lite-v1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.255,"input":0.51,"output":4.25},"deprecated":false,"extra":{"attachment":false,"description":"Efficient model for low-latency assistance, extraction, and routine automation","family":"nova","open_weights":false,"structured_output":false},"family":null,"id":"amazon/nova-2-lite-v1","knowledge":null,"last_updated":"2024-12-03","lifecycle":null,"limits":{"context":1000000,"output":65535},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Amazon Nova 2 Lite","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"amazon/nova-lite-v1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.02975,"input":0.0595,"output":0.238},"deprecated":false,"extra":{"attachment":false,"description":"Efficient model for low-latency assistance, extraction, and routine automation","family":"nova-lite","open_weights":false,"structured_output":false},"family":null,"id":"amazon/nova-lite-v1","knowledge":null,"last_updated":"2024-12-03","lifecycle":null,"limits":{"context":300000,"output":5120},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Amazon Nova Lite 1.0","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-12-03","retired":false,"tags":null},"amazon/nova-micro-v1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.01785,"input":0.0357,"output":0.1394},"deprecated":false,"extra":{"attachment":false,"description":"Efficient model for low-latency assistance, extraction, and routine automation","family":"nova-micro","open_weights":false,"structured_output":false},"family":null,"id":"amazon/nova-micro-v1","knowledge":null,"last_updated":"2024-12-03","lifecycle":null,"limits":{"context":128000,"output":5120},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Amazon Nova Micro 1.0","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"amazon/nova-pro-v1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.3995,"input":0.799,"output":3.196},"deprecated":false,"extra":{"attachment":false,"description":"Flagship model for demanding analysis, coding, and production agent workflows","family":"nova-pro","open_weights":false,"structured_output":false},"family":null,"id":"amazon/nova-pro-v1","knowledge":null,"last_updated":"2024-12-03","lifecycle":null,"limits":{"context":300000,"output":32000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Amazon Nova Pro 1.0","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-12-03","retired":false,"tags":null},"anthracite-org/magnum-v2-72b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.003,"input":2.006,"output":2.992},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"anthracite-org/magnum-v2-72b","knowledge":null,"last_updated":"2024-07-01","lifecycle":null,"limits":{"context":16384,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Magnum V2 72B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"anthracite-org/magnum-v4-72b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.003,"input":2.006,"output":2.992},"deprecated":false,"extra":{"attachment":true,"description":"Open Llama multimodal model for image understanding and text reasoning","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"anthracite-org/magnum-v4-72b","knowledge":null,"last_updated":"2025-01-01","lifecycle":null,"limits":{"context":16384,"output":8192},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"Magnum v4 72B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"anthropic/claude-fable-5":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":1,"cache_write":12.5,"input":10,"output":50},"deprecated":false,"extra":{"attachment":true,"description":"Claude model for creative writing, analysis, and controlled agent workflows","family":"claude-fable","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":false},"family":null,"id":"anthropic/claude-fable-5","knowledge":"2026-01-31","last_updated":"2026-06-09","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude Fable 5","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-09","retired":false,"tags":null},"anthropic/claude-fable-latest":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":1,"cache_write":12.5,"input":10,"output":50},"deprecated":false,"extra":{"attachment":true,"description":"Compatibility alias for Claude Fable.","family":"claude-fable","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh","max"]}],"structured_output":true},"family":null,"id":"anthropic/claude-fable-latest","knowledge":null,"last_updated":"2026-06-09","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude Fable Latest","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-09","retired":false,"tags":null},"anthropic/claude-haiku-latest":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.1,"input":1,"output":5},"deprecated":false,"extra":{"attachment":true,"description":"Fast Claude model for responsive assistance, classification, and lightweight agents","family":"claude-haiku","open_weights":false,"reasoning_options":[{"type":"toggle"},{"max":63999,"min":1024,"type":"budget_tokens"}],"structured_output":true},"family":null,"id":"anthropic/claude-haiku-latest","knowledge":null,"last_updated":"2026-03-29","lifecycle":null,"limits":{"context":200000,"output":64000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude Haiku Latest","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-29","retired":false,"tags":null},"anthropic/claude-opus-4.6":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"input":5,"output":25},"deprecated":false,"extra":{"attachment":true,"description":"High-end Claude for difficult coding, planning, and slower expert reasoning","family":"claude-opus","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"anthropic/claude-opus-4.6","knowledge":"2025-05-31","last_updated":"2026-03-13","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4.6 Opus","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-05","retired":false,"tags":null},"anthropic/claude-opus-4.6:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"input":5,"output":25},"deprecated":false,"extra":{"attachment":true,"description":"High-end Claude for difficult coding, planning, and slower expert reasoning","family":"claude-opus","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"anthropic/claude-opus-4.6:thinking","knowledge":"2025-05-31","last_updated":"2026-03-13","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4.6 Opus Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-05","retired":false,"tags":null},"anthropic/claude-opus-4.6:thinking:low":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"input":5,"output":25},"deprecated":false,"extra":{"attachment":true,"description":"High-end Claude for difficult coding, planning, and slower expert reasoning","family":"claude-opus","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"anthropic/claude-opus-4.6:thinking:low","knowledge":"2025-05-31","last_updated":"2026-03-13","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4.6 Opus Thinking Low","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-05","retired":false,"tags":null},"anthropic/claude-opus-4.6:thinking:max":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"input":5,"output":25},"deprecated":false,"extra":{"attachment":true,"description":"High-end Claude for difficult coding, planning, and slower expert reasoning","family":"claude-opus","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"anthropic/claude-opus-4.6:thinking:max","knowledge":"2025-05-31","last_updated":"2026-03-13","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4.6 Opus Thinking Max","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-05","retired":false,"tags":null},"anthropic/claude-opus-4.6:thinking:medium":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"input":5,"output":25},"deprecated":false,"extra":{"attachment":true,"description":"High-end Claude for difficult coding, planning, and slower expert reasoning","family":"claude-opus","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"anthropic/claude-opus-4.6:thinking:medium","knowledge":"2025-05-31","last_updated":"2026-03-13","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4.6 Opus Thinking Medium","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-05","retired":false,"tags":null},"anthropic/claude-opus-4.7":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"input":5,"output":25},"deprecated":false,"extra":{"attachment":true,"description":"Stronger Opus tier for advanced software work and high-stakes reasoning","family":"claude-opus","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":false},"family":null,"id":"anthropic/claude-opus-4.7","knowledge":"2026-01-31","last_updated":"2026-04-16","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4.7 Opus","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-16","retired":false,"tags":null},"anthropic/claude-opus-4.7:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"input":5,"output":25},"deprecated":false,"extra":{"attachment":true,"description":"Stronger Opus tier for advanced software work and high-stakes reasoning","family":"claude-opus","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":false},"family":null,"id":"anthropic/claude-opus-4.7:thinking","knowledge":"2026-01-31","last_updated":"2026-04-16","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4.7 Opus Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-16","retired":false,"tags":null},"anthropic/claude-opus-4.8":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"input":5,"output":25},"deprecated":false,"extra":{"attachment":true,"description":"Top Claude Opus tier for the hardest reasoning, coding, and long-horizon agents","family":"claude-opus","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":false},"family":null,"id":"anthropic/claude-opus-4.8","knowledge":"2026-01","last_updated":"2026-05-28","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude Opus 4.8","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-28","retired":false,"tags":null},"anthropic/claude-opus-4.8:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"input":5,"output":25},"deprecated":false,"extra":{"attachment":true,"description":"Top Claude Opus tier for the hardest reasoning, coding, and long-horizon agents","family":"claude-opus","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":false},"family":null,"id":"anthropic/claude-opus-4.8:thinking","knowledge":"2026-01","last_updated":"2026-05-28","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude Opus 4.8 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-28","retired":false,"tags":null},"anthropic/claude-opus-5":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"cache_write":6.25,"input":5,"output":25},"deprecated":false,"extra":{"attachment":true,"description":"Strongest Claude Opus model for coding, agents, and professional work","family":"claude-opus","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":false},"family":null,"id":"anthropic/claude-opus-5","knowledge":"2026-05","last_updated":"2026-07-24","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude Opus 5","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-24","retired":false,"tags":null},"anthropic/claude-opus-latest":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"cache_write":6.25,"input":5,"output":25},"deprecated":false,"extra":{"attachment":true,"description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh","max"]}],"structured_output":true},"family":null,"id":"anthropic/claude-opus-latest","knowledge":null,"last_updated":"2026-03-29","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude Opus Latest","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-29","retired":false,"tags":null},"anthropic/claude-sonnet-4.6":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.3,"input":3,"output":15},"deprecated":false,"extra":{"attachment":true,"description":"Claude workhorse for coding agents, careful analysis, and production cost control","family":"claude-sonnet","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"anthropic/claude-sonnet-4.6","knowledge":"2025-08-31","last_updated":"2026-03-13","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude Sonnet 4.6","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-17","retired":false,"tags":null},"anthropic/claude-sonnet-4.6:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.3,"input":3,"output":15},"deprecated":false,"extra":{"attachment":true,"description":"Claude workhorse for coding agents, careful analysis, and production cost control","family":"claude-sonnet","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"anthropic/claude-sonnet-4.6:thinking","knowledge":"2025-08-31","last_updated":"2026-03-13","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude Sonnet 4.6 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-17","retired":false,"tags":null},"anthropic/claude-sonnet-5":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"cache_write":2.5,"input":2,"output":10},"deprecated":false,"extra":{"attachment":true,"description":"Everyday Claude agent model for coding, planning, browsing, and general work","family":"claude-sonnet","open_weights":false,"structured_output":true,"temperature":false},"family":null,"id":"anthropic/claude-sonnet-5","knowledge":"2026-01-31","last_updated":"2026-06-30","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude Sonnet 5","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-30","retired":false,"tags":null},"anthropic/claude-sonnet-5:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"cache_write":2.5,"input":2,"output":10},"deprecated":false,"extra":{"attachment":true,"description":"Everyday Claude agent model for coding, planning, browsing, and general work","family":"claude-sonnet","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":false},"family":null,"id":"anthropic/claude-sonnet-5:thinking","knowledge":"2026-01-31","last_updated":"2026-06-30","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude Sonnet 5 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-30","retired":false,"tags":null},"anthropic/claude-sonnet-latest":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"cache_write":2.5,"input":2,"output":10},"deprecated":false,"extra":{"attachment":true,"description":"Balanced Claude model for coding, analysis, agent workflows, and cost control","family":"claude-sonnet","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh","max"]}],"structured_output":true},"family":null,"id":"anthropic/claude-sonnet-latest","knowledge":null,"last_updated":"2026-03-01","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude Sonnet Latest","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-01","retired":false,"tags":null},"arcee-ai/trinity-large-thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.125,"input":0.25,"output":0.9},"deprecated":false,"extra":{"attachment":false,"description":"Flagship model for demanding analysis, coding, and production agent workflows","family":"trinity","open_weights":true,"reasoning_options":[],"structured_output":false},"family":null,"id":"arcee-ai/trinity-large-thinking","knowledge":null,"last_updated":"2026-04-01","lifecycle":null,"limits":{"context":262144,"output":80000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Trinity Large Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-01","retired":false,"tags":null},"asi1-mini":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.5,"input":1,"output":1},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":false,"structured_output":false},"family":null,"id":"asi1-mini","knowledge":null,"last_updated":"2025-03-25","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"ASI1 Mini","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-03-25","retired":false,"tags":null},"auto-model":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Automatic model router for matching prompts to suitable backends and budgets","family":"auto","open_weights":false,"structured_output":false},"family":null,"id":"auto-model","knowledge":null,"last_updated":"2024-06-01","lifecycle":null,"limits":{"context":1000000,"output":1000000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Auto model","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-16","retired":false,"tags":null},"auto-model-basic":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":4.998,"input":9.996,"output":19.992},"deprecated":false,"extra":{"attachment":false,"description":"Automatic model router for matching prompts to suitable backends and budgets","family":"auto","open_weights":false,"structured_output":false},"family":null,"id":"auto-model-basic","knowledge":null,"last_updated":"2024-06-01","lifecycle":null,"limits":{"context":1000000,"output":1000000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Auto model (Basic)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-16","retired":false,"tags":null},"auto-model-premium":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":4.998,"input":9.996,"output":19.992},"deprecated":false,"extra":{"attachment":false,"description":"Automatic model router for matching prompts to suitable backends and budgets","family":"auto","open_weights":false,"structured_output":false},"family":null,"id":"auto-model-premium","knowledge":null,"last_updated":"2024-06-01","lifecycle":null,"limits":{"context":1000000,"output":1000000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Auto model (Premium)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-16","retired":false,"tags":null},"auto-model-standard":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":4.998,"input":9.996,"output":19.992},"deprecated":false,"extra":{"attachment":false,"description":"Automatic model router for matching prompts to suitable backends and budgets","family":"auto","open_weights":false,"structured_output":false},"family":null,"id":"auto-model-standard","knowledge":null,"last_updated":"2024-06-01","lifecycle":null,"limits":{"context":1000000,"output":1000000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Auto model (Standard)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-16","retired":false,"tags":null},"azure-gpt-4-turbo":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":10,"output":30},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gpt","open_weights":false,"structured_output":false},"family":null,"id":"azure-gpt-4-turbo","knowledge":null,"last_updated":"2024-01-01","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Azure gpt-4-turbo","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"azure-gpt-4o":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":1.25,"input":2.5,"output":10},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gpt","open_weights":false,"structured_output":true},"family":null,"id":"azure-gpt-4o","knowledge":null,"last_updated":"2024-05-13","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Azure gpt-4o","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"azure-gpt-4o-mini":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.075,"input":0.15,"output":0.6},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gpt","open_weights":false,"structured_output":true},"family":null,"id":"azure-gpt-4o-mini","knowledge":null,"last_updated":"2024-07-18","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Azure gpt-4o-mini","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"azure-o1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":7.5,"input":15,"output":60},"deprecated":false,"extra":{"attachment":false,"description":"O-series reasoning model for hard analysis, math, coding, and planning","family":"o","open_weights":false,"structured_output":false},"family":null,"id":"azure-o1","knowledge":null,"last_updated":"2024-12-17","lifecycle":null,"limits":{"context":200000,"output":100000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Azure o1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"azure-o3-mini":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.55,"input":1.1,"output":4.4},"deprecated":false,"extra":{"attachment":false,"description":"O-series reasoning model for hard analysis, math, coding, and planning","family":"o","open_weights":false,"structured_output":false},"family":null,"id":"azure-o3-mini","knowledge":null,"last_updated":"2025-01-31","lifecycle":null,"limits":{"context":200000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Azure o3-mini","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"baidu/ernie-4.5-vl-28b-a3b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.07,"input":0.14,"output":0.56},"deprecated":false,"extra":{"attachment":true,"description":"Multimodal model for analyzing text, images, documents, and rich media","family":"ernie","open_weights":true,"structured_output":false},"family":null,"id":"baidu/ernie-4.5-vl-28b-a3b","knowledge":null,"last_updated":"2025-06-30","lifecycle":null,"limits":{"context":32768,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"ERNIE 4.5 VL 28B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-11-01","retired":false,"tags":null},"baseten/Kimi-K2-Instruct-FP4":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2,"input":0.4,"output":1.8},"deprecated":false,"extra":{"attachment":false,"description":"Kimi model for long-context chat, coding, and agentic reasoning","family":"kimi-k2","open_weights":true,"structured_output":false},"family":null,"id":"baseten/Kimi-K2-Instruct-FP4","knowledge":null,"last_updated":"2025-07-11","lifecycle":null,"limits":{"context":128000,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Kimi K2 0711 Instruct FP4","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"brave":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":5,"output":5},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":false,"structured_output":false},"family":null,"id":"brave","knowledge":null,"last_updated":"2024-01-01","lifecycle":null,"limits":{"context":8192,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Brave (Answers)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-13","retired":false,"tags":null},"brave-pro":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":5,"output":5},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":false,"structured_output":false},"family":null,"id":"brave-pro","knowledge":null,"last_updated":"2024-01-01","lifecycle":null,"limits":{"context":8192,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Brave (Pro)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-10","retired":false,"tags":null},"brave-research":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":5,"output":5},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":false,"structured_output":false},"family":null,"id":"brave-research","knowledge":null,"last_updated":"2024-01-01","lifecycle":null,"limits":{"context":16384,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Brave (Research)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-10","retired":false,"tags":null},"bytedance-seed/seed-2.0-lite":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.125,"input":0.25,"output":2},"deprecated":false,"extra":{"attachment":false,"description":"Efficient model for low-latency assistance, extraction, and routine automation","family":"seed","open_weights":false,"structured_output":true},"family":null,"id":"bytedance-seed/seed-2.0-lite","knowledge":null,"last_updated":"2026-03-10","lifecycle":null,"limits":{"context":262144,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"ByteDance Seed 2.0 Lite","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-10","retired":false,"tags":null},"bytedance/doubao-seed-2.1-pro":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.5,"input":1,"output":5},"deprecated":false,"extra":{"attachment":false,"description":"Higher-capability model in the Doubao Seed 2.1 family for agentic coding, long-context analysis, complex instruction following, and productivity workflows. Supports a 256k context window and up to 128k output tokens. Note: privacy and logging guarantees may be limited.","family":"seed","open_weights":false,"structured_output":false},"family":null,"id":"bytedance/doubao-seed-2.1-pro","knowledge":null,"last_updated":"2026-06-23","lifecycle":null,"limits":{"context":256000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Doubao Seed 2.1 Pro","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-23","retired":false,"tags":null},"bytedance/doubao-seed-2.1-turbo":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.25,"input":0.5,"output":2.5},"deprecated":false,"extra":{"attachment":false,"description":"Fast, lower-cost model in the Doubao Seed 2.1 family for everyday chat, coding assistance, document work, and high-throughput productivity tasks. Supports a 256k context window and up to 128k output tokens. Note: privacy and logging guarantees may be limited.","family":"seed","open_weights":false,"structured_output":false},"family":null,"id":"bytedance/doubao-seed-2.1-turbo","knowledge":null,"last_updated":"2026-06-23","lifecycle":null,"limits":{"context":256000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Doubao Seed 2.1 Turbo","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-23","retired":false,"tags":null},"bytedance/doubao-seed-character":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.0236,"cache_write":0.0025,"input":0.1179,"output":0.2947},"deprecated":false,"extra":{"attachment":true,"description":"ByteDance's character-focused Doubao Seed model for roleplay, persona consistency, dialogue, and creative character interactions. It supports text and image input with a 128k context window. Requests route through ZenMux to ByteDance; ZenMux does not publish a model-API zero-retention or training guarantee, so avoid sensitive data.","family":"seed","open_weights":false,"reasoning_options":[],"structured_output":false},"family":null,"id":"bytedance/doubao-seed-character","knowledge":null,"last_updated":"2026-07-18","lifecycle":null,"limits":{"context":128000,"output":32768},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Doubao Seed Character","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-18","retired":false,"tags":null},"celeris-1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1,"input":2,"output":6},"deprecated":false,"extra":{"attachment":false,"description":"Celeris 1 is a diffusion language model built for ultra-low-latency classification, extraction, judging, query rewriting, and other short structured responses.","open_weights":false,"structured_output":false},"family":null,"id":"celeris-1","knowledge":null,"last_updated":"2026-07-25","lifecycle":null,"limits":{"context":8192,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Celeris 1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-25","retired":false,"tags":null},"chutesai/Mistral-Small-3.2-24B-Instruct-2506":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1,"input":0.2,"output":0.4},"deprecated":false,"extra":{"attachment":false,"description":"Efficient Mistral model for fast chat, extraction, and production assistants","family":"chutesai","open_weights":true,"structured_output":false},"family":null,"id":"chutesai/Mistral-Small-3.2-24B-Instruct-2506","knowledge":null,"last_updated":"2025-04-15","lifecycle":null,"limits":{"context":128000,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mistral Small 3.2 24b Instruct","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-15","retired":false,"tags":null},"claude-haiku-4-5-20251001":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.1,"input":1,"output":5},"deprecated":false,"extra":{"attachment":true,"description":"Fast Claude model for responsive assistance, classification, and lightweight agents","family":"claude-haiku","open_weights":false,"structured_output":true,"temperature":true},"family":null,"id":"claude-haiku-4-5-20251001","knowledge":"2025-02-28","last_updated":"2025-10-15","lifecycle":null,"limits":{"context":200000,"output":64000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude Haiku 4.5","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-10-15","retired":false,"tags":null},"claude-haiku-4-5-20251001-thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.1,"input":1,"output":5},"deprecated":false,"extra":{"attachment":true,"description":"Fast Claude model for responsive assistance, classification, and lightweight agents","family":"claude-haiku","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"claude-haiku-4-5-20251001-thinking","knowledge":"2025-02-28","last_updated":"2025-10-15","lifecycle":null,"limits":{"context":200000,"output":64000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude Haiku 4.5 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-10-15","retired":false,"tags":null},"claude-opus-4-1-20250805":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":1.5,"input":15,"output":75},"deprecated":false,"extra":{"attachment":true,"description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","open_weights":false,"structured_output":true,"temperature":true},"family":null,"id":"claude-opus-4-1-20250805","knowledge":"2025-03-31","last_updated":"2025-08-05","lifecycle":null,"limits":{"context":200000,"output":32000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4.1 Opus","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-05","retired":false,"tags":null},"claude-opus-4-1-thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":1.5,"input":15,"output":75},"deprecated":false,"extra":{"attachment":true,"description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"claude-opus-4-1-thinking","knowledge":"2025-03-31","last_updated":"2025-08-05","lifecycle":null,"limits":{"context":200000,"output":32000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4.1 Opus Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-05","retired":false,"tags":null},"claude-opus-4-1-thinking:1024":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":1.5,"input":15,"output":75},"deprecated":false,"extra":{"attachment":true,"description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"claude-opus-4-1-thinking:1024","knowledge":"2025-03-31","last_updated":"2025-08-05","lifecycle":null,"limits":{"context":200000,"output":32000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4.1 Opus Thinking (1K)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-05","retired":false,"tags":null},"claude-opus-4-1-thinking:32000":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":1.5,"input":15,"output":75},"deprecated":false,"extra":{"attachment":true,"description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"claude-opus-4-1-thinking:32000","knowledge":"2025-03-31","last_updated":"2025-08-05","lifecycle":null,"limits":{"context":200000,"output":32000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4.1 Opus Thinking (32K)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-05","retired":false,"tags":null},"claude-opus-4-1-thinking:32768":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":1.5,"input":15,"output":75},"deprecated":false,"extra":{"attachment":true,"description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"claude-opus-4-1-thinking:32768","knowledge":"2025-03-31","last_updated":"2025-08-05","lifecycle":null,"limits":{"context":200000,"output":32000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4.1 Opus Thinking (32K)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-05","retired":false,"tags":null},"claude-opus-4-1-thinking:8192":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":1.5,"input":15,"output":75},"deprecated":false,"extra":{"attachment":true,"description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"claude-opus-4-1-thinking:8192","knowledge":"2025-03-31","last_updated":"2025-08-05","lifecycle":null,"limits":{"context":200000,"output":32000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4.1 Opus Thinking (8K)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-05","retired":false,"tags":null},"claude-opus-4-20250514":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":1.5,"input":15,"output":75},"deprecated":false,"extra":{"attachment":true,"description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","open_weights":false,"structured_output":true,"temperature":true},"family":null,"id":"claude-opus-4-20250514","knowledge":"2025-03-31","last_updated":"2025-05-22","lifecycle":null,"limits":{"context":200000,"output":32000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4 Opus","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-05-22","retired":false,"tags":null},"claude-opus-4-5-20251101":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"input":5,"output":25},"deprecated":false,"extra":{"attachment":true,"description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"claude-opus-4-5-20251101","knowledge":"2025-05","last_updated":"2025-11-01","lifecycle":null,"limits":{"context":200000,"output":32000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4.5 Opus","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-11-01","retired":false,"tags":null},"claude-opus-4-5-20251101:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"input":5,"output":25},"deprecated":false,"extra":{"attachment":true,"description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"claude-opus-4-5-20251101:thinking","knowledge":"2025-05","last_updated":"2025-11-01","lifecycle":null,"limits":{"context":200000,"output":32000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4.5 Opus Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-11-01","retired":false,"tags":null},"claude-opus-4-thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":1.5,"input":15,"output":75},"deprecated":false,"extra":{"attachment":true,"description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"claude-opus-4-thinking","knowledge":"2025-03-31","last_updated":"2025-05-22","lifecycle":null,"limits":{"context":200000,"output":32000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4 Opus Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-05-22","retired":false,"tags":null},"claude-opus-4-thinking:1024":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":1.5,"input":15,"output":75},"deprecated":false,"extra":{"attachment":true,"description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"claude-opus-4-thinking:1024","knowledge":"2025-03-31","last_updated":"2025-05-22","lifecycle":null,"limits":{"context":200000,"output":32000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4 Opus Thinking (1K)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-05-22","retired":false,"tags":null},"claude-opus-4-thinking:32000":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":1.5,"input":15,"output":75},"deprecated":false,"extra":{"attachment":true,"description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"claude-opus-4-thinking:32000","knowledge":"2025-03-31","last_updated":"2025-05-22","lifecycle":null,"limits":{"context":200000,"output":32000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4 Opus Thinking (32K)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-05-22","retired":false,"tags":null},"claude-opus-4-thinking:32768":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":1.5,"input":15,"output":75},"deprecated":false,"extra":{"attachment":true,"description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"claude-opus-4-thinking:32768","knowledge":"2025-03-31","last_updated":"2025-05-22","lifecycle":null,"limits":{"context":200000,"output":32000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4 Opus Thinking (32K)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-05-22","retired":false,"tags":null},"claude-opus-4-thinking:8192":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":1.5,"input":15,"output":75},"deprecated":false,"extra":{"attachment":true,"description":"Flagship Claude model for deep reasoning, coding, and long-horizon agents","family":"claude-opus","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"claude-opus-4-thinking:8192","knowledge":"2025-03-31","last_updated":"2025-05-22","lifecycle":null,"limits":{"context":200000,"output":32000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4 Opus Thinking (8K)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-05-22","retired":false,"tags":null},"claude-sonnet-4-20250514":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.3,"input":3,"output":15},"deprecated":false,"extra":{"attachment":true,"description":"Balanced Claude model for coding, analysis, agent workflows, and cost control","family":"claude-sonnet","open_weights":false,"structured_output":true,"temperature":true},"family":null,"id":"claude-sonnet-4-20250514","knowledge":"2025-03-31","last_updated":"2025-05-22","lifecycle":null,"limits":{"context":200000,"output":64000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4 Sonnet","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-05-22","retired":false,"tags":null},"claude-sonnet-4-5-20250929":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.3,"input":3,"output":15},"deprecated":false,"extra":{"attachment":true,"description":"Balanced Claude model for coding, analysis, agent workflows, and cost control","family":"claude-sonnet","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"claude-sonnet-4-5-20250929","knowledge":"2025-07-31","last_updated":"2025-09-29","lifecycle":null,"limits":{"context":1000000,"output":64000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude Sonnet 4.5","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-29","retired":false,"tags":null},"claude-sonnet-4-5-20250929-thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.3,"input":3,"output":15},"deprecated":false,"extra":{"attachment":true,"description":"Balanced Claude model for coding, analysis, agent workflows, and cost control","family":"claude-sonnet","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"claude-sonnet-4-5-20250929-thinking","knowledge":"2025-07-31","last_updated":"2025-09-29","lifecycle":null,"limits":{"context":1000000,"output":64000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude Sonnet 4.5 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-29","retired":false,"tags":null},"claude-sonnet-4-thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.3,"input":3,"output":15},"deprecated":false,"extra":{"attachment":true,"description":"Balanced Claude model for coding, analysis, agent workflows, and cost control","family":"claude-sonnet","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"claude-sonnet-4-thinking","knowledge":"2025-03-31","last_updated":"2025-05-22","lifecycle":null,"limits":{"context":1000000,"output":64000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4 Sonnet Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-05-22","retired":false,"tags":null},"claude-sonnet-4-thinking:1024":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.3,"input":3,"output":15},"deprecated":false,"extra":{"attachment":true,"description":"Balanced Claude model for coding, analysis, agent workflows, and cost control","family":"claude-sonnet","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"claude-sonnet-4-thinking:1024","knowledge":"2025-03-31","last_updated":"2025-05-22","lifecycle":null,"limits":{"context":1000000,"output":64000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4 Sonnet Thinking (1K)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-05-22","retired":false,"tags":null},"claude-sonnet-4-thinking:32768":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.3,"input":3,"output":15},"deprecated":false,"extra":{"attachment":true,"description":"Balanced Claude model for coding, analysis, agent workflows, and cost control","family":"claude-sonnet","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"claude-sonnet-4-thinking:32768","knowledge":"2025-03-31","last_updated":"2025-05-22","lifecycle":null,"limits":{"context":1000000,"output":64000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4 Sonnet Thinking (32K)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-05-22","retired":false,"tags":null},"claude-sonnet-4-thinking:64000":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.3,"input":3,"output":15},"deprecated":false,"extra":{"attachment":true,"description":"Balanced Claude model for coding, analysis, agent workflows, and cost control","family":"claude-sonnet","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"claude-sonnet-4-thinking:64000","knowledge":"2025-03-31","last_updated":"2025-05-22","lifecycle":null,"limits":{"context":1000000,"output":64000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4 Sonnet Thinking (64K)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-05-22","retired":false,"tags":null},"claude-sonnet-4-thinking:8192":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.3,"input":3,"output":15},"deprecated":false,"extra":{"attachment":true,"description":"Balanced Claude model for coding, analysis, agent workflows, and cost control","family":"claude-sonnet","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"claude-sonnet-4-thinking:8192","knowledge":"2025-03-31","last_updated":"2025-05-22","lifecycle":null,"limits":{"context":1000000,"output":64000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claude 4 Sonnet Thinking (8K)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-05-22","retired":false,"tags":null},"claw-high":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":2.5,"input":5,"output":25},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":false,"reasoning_options":[],"structured_output":true},"family":null,"id":"claw-high","knowledge":null,"last_updated":"2026-05-11","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Claw High","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-11","retired":false,"tags":null},"claw-low":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.025,"cache_write":0.08333,"input":0.25,"output":1.5},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":false,"reasoning_options":[],"structured_output":true},"family":null,"id":"claw-low","knowledge":null,"last_updated":"2026-05-11","lifecycle":null,"limits":{"context":1048576,"output":65536},"modalities":{"input":["text","image","video","pdf"],"output":["text"]},"model":null,"name":"Claw Low","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-11","retired":false,"tags":null},"claw-medium":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.1575,"input":0.315,"output":1.26},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":false,"reasoning_options":[],"structured_output":true},"family":null,"id":"claw-medium","knowledge":null,"last_updated":"2026-05-11","lifecycle":null,"limits":{"context":204800,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Claw Medium","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-11","retired":false,"tags":null},"cohere/command-r-plus-08-2024":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.428,"input":2.856,"output":14.246},"deprecated":false,"extra":{"attachment":false,"description":"Cohere's RAG workhorse for long-context enterprise search and tool use","family":"command-r","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"cohere/command-r-plus-08-2024","knowledge":"2024-06-01","last_updated":"2024-08-30","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Cohere: Command R+","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-08-30","retired":false,"tags":null},"cohere/north-mini-code":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.1,"input":0.2,"output":0.8},"deprecated":false,"extra":{"attachment":false,"description":"Cohere coding model for practical software engineering and agentic edits","family":"north","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":true},"family":null,"id":"cohere/north-mini-code","knowledge":"2025-09-23","last_updated":"2026-06-09","lifecycle":null,"limits":{"context":256000,"output":64000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Cohere North Mini Code 1.0","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-09","retired":false,"tags":null},"command-a-plus-05-2026":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":1.25,"input":2.5,"output":10},"deprecated":false,"extra":{"attachment":true,"description":"Cohere's stronger command model for multilingual agents and enterprise workflows","family":"command-a","open_weights":true,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"command-a-plus-05-2026","knowledge":"2025-04-01","last_updated":"2026-06-09","lifecycle":null,"limits":{"context":128000,"output":64000},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Cohere Command A+ (05/2026)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-20","retired":false,"tags":null},"command-a-reasoning-08-2025":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.25,"input":2.5,"output":10},"deprecated":false,"extra":{"attachment":false,"description":"Cohere reasoning model for multilingual enterprise agents, tools, and complex workflows","family":"command-a","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"command-a-reasoning-08-2025","knowledge":"2024-06-01","last_updated":"2025-08-21","lifecycle":null,"limits":{"context":256000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Cohere Command A (08/2025)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-21","retired":false,"tags":null},"crofai/greg-2-super":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.25,"input":1.5,"output":5},"deprecated":false,"extra":{"attachment":false,"description":"Greg 2 Super is CrofAI's balanced Greg 2 model for strong UI design, frontend iteration, coding, writing, and everyday agent tasks at a lower cost than Ultra.","open_weights":false,"structured_output":true},"family":null,"id":"crofai/greg-2-super","knowledge":null,"last_updated":"2026-06-19","lifecycle":null,"limits":{"context":229376,"output":229376},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Greg 2 Super","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-19","retired":false,"tags":null},"crofai/greg-2-ultra":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"input":3,"output":10},"deprecated":false,"extra":{"attachment":false,"description":"Greg 2 Ultra is CrofAI's most capable Greg 2 model, tuned for premium UI design, agentic coding, creative writing, and higher-end general reasoning tasks.","open_weights":false,"structured_output":true},"family":null,"id":"crofai/greg-2-ultra","knowledge":null,"last_updated":"2026-06-19","lifecycle":null,"limits":{"context":229376,"output":229376},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Greg 2 Ultra","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-19","retired":false,"tags":null},"deepclaude":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.3,"input":3,"output":15},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":false,"structured_output":false},"family":null,"id":"deepclaude","knowledge":null,"last_updated":"2025-02-01","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"DeepClaude","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-03-10","retired":false,"tags":null},"deepcogito/cogito-v1-preview-qwen-32B":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.9,"input":1.8,"output":1.8},"deprecated":false,"extra":{"attachment":false,"description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","llmfit":{"architecture":"qwen2","context_length":131072,"discovered":true,"gguf_sources":[{"provider":"mradermacher","repo":"mradermacher/cogito-v1-preview-qwen-32B-GGUF"}],"hf_downloads":60591,"hf_likes":0,"matched_hugging_face_id":"deepcogito/cogito-v1-preview-qwen-32B","memory":{"min_ram_gb":18.3,"min_vram_gb":16.8,"recommended_ram_gb":30.5},"model_id":"deepcogito/cogito-v1-preview-qwen-32B","parameter_count":"32.8B","parameters_raw":32759790592,"pipeline_tag":"text-generation","provider":"deepcogito","quantization":"Q4_K_M","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"structured_output":false},"family":null,"id":"deepcogito/cogito-v1-preview-qwen-32B","knowledge":null,"last_updated":"2025-05-10","lifecycle":null,"limits":{"context":128000,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Cogito v1 Preview Qwen 32B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-05-10","retired":false,"tags":null},"deepseek-ai/DeepSeek-R1-0528":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.2,"input":0.4,"output":1.7},"deprecated":false,"extra":{"attachment":false,"description":"DeepSeek reasoning model for multi-step analysis, math, coding, and tools","family":"deepseek","llmfit":{"architecture":"deepseek_v3","context_length":6553600,"discovered":true,"gguf_sources":[],"hf_downloads":206900,"hf_likes":2457,"matched_hugging_face_id":"deepseek-ai/DeepSeek-R1-0528","memory":{"min_ram_gb":382.5,"min_vram_gb":350.6,"recommended_ram_gb":637.5},"model_id":"deepseek-ai/DeepSeek-R1-0528","moe":{"active_experts":8,"active_parameters":54548594820,"is_moe":true,"num_experts":256},"parameter_count":"684.5B","parameters_raw":684531386000,"pipeline_tag":"text-generation","provider":"DeepSeek","quantization":"Q4_K_M","release_date":"2025-05-28","source":"llmfit","use_case":"Advanced reasoning, chain-of-thought"},"open_weights":true,"reasoning_options":[],"structured_output":false},"family":null,"id":"deepseek-ai/DeepSeek-R1-0528","knowledge":null,"last_updated":"2025-05-28","lifecycle":null,"limits":{"context":128000,"output":163840},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek R1 0528","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-05-28","retired":false,"tags":null},"deepseek-ai/DeepSeek-V3.1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1,"input":0.2,"output":0.7},"deprecated":false,"extra":{"attachment":true,"description":"DeepSeek chat model for instruction following, coding, and analysis","family":"deepseek","llmfit":{"architecture":"deepseek_v3","context_length":6553600,"discovered":true,"gguf_sources":[],"hf_downloads":273040,"hf_likes":825,"matched_hugging_face_id":"deepseek-ai/DeepSeek-V3.1","memory":{"min_ram_gb":382.5,"min_vram_gb":350.6,"recommended_ram_gb":637.5},"model_id":"deepseek-ai/DeepSeek-V3.1","moe":{"active_experts":8,"active_parameters":54548594820,"is_moe":true,"num_experts":256},"parameter_count":"684.5B","parameters_raw":684531386000,"pipeline_tag":"text-generation","provider":"DeepSeek","quantization":"Q4_K_M","release_date":"2025-08-21","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"structured_output":false},"family":null,"id":"deepseek-ai/DeepSeek-V3.1","knowledge":null,"last_updated":"2025-07-26","lifecycle":null,"limits":{"context":128000,"output":65536},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"DeepSeek V3.1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-26","retired":false,"tags":null},"deepseek-ai/DeepSeek-V3.1-Terminus":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.125,"input":0.25,"output":0.7},"deprecated":false,"extra":{"attachment":false,"description":"DeepSeek chat model for instruction following, coding, and analysis","family":"deepseek","llmfit":{"architecture":"deepseek_v3","context_length":6553600,"discovered":true,"gguf_sources":[],"hf_downloads":16978,"hf_likes":0,"matched_hugging_face_id":"deepseek-ai/DeepSeek-V3.1-Terminus","memory":{"min_ram_gb":382.5,"min_vram_gb":350.6,"recommended_ram_gb":637.5},"model_id":"deepseek-ai/DeepSeek-V3.1-Terminus","moe":{"active_experts":8,"active_parameters":54548594820,"is_moe":true,"num_experts":256},"parameter_count":"684.5B","parameters_raw":684531386000,"pipeline_tag":"text-generation","provider":"DeepSeek","quantization":"Q4_K_M","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"structured_output":true},"family":null,"id":"deepseek-ai/DeepSeek-V3.1-Terminus","knowledge":null,"last_updated":"2025-08-02","lifecycle":null,"limits":{"context":128000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V3.1 Terminus","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-02","retired":false,"tags":null},"deepseek-ai/DeepSeek-V3.1-Terminus:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.125,"input":0.25,"output":0.7},"deprecated":false,"extra":{"attachment":false,"description":"DeepSeek chat model for instruction following, coding, and analysis","family":"deepseek-thinking","open_weights":true,"structured_output":true},"family":null,"id":"deepseek-ai/DeepSeek-V3.1-Terminus:thinking","knowledge":null,"last_updated":"2025-09-22","lifecycle":null,"limits":{"context":128000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V3.1 Terminus (Thinking)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"deepseek-ai/DeepSeek-V3.1:thinking":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1,"input":0.2,"output":0.7},"deprecated":false,"extra":{"attachment":false,"description":"DeepSeek chat model for instruction following, coding, and analysis","family":"deepseek-thinking","open_weights":true,"structured_output":false},"family":null,"id":"deepseek-ai/DeepSeek-V3.1:thinking","knowledge":null,"last_updated":"2025-08-21","lifecycle":null,"limits":{"context":128000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V3.1 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"deepseek-ai/deepseek-v3.2-exp":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.14,"input":0.28,"output":0.42},"deprecated":false,"extra":{"attachment":false,"description":"DeepSeek chat model for instruction following, coding, and analysis","family":"deepseek","open_weights":true,"structured_output":false},"family":null,"id":"deepseek-ai/deepseek-v3.2-exp","knowledge":null,"last_updated":"2025-09-29","lifecycle":null,"limits":{"context":163840,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V3.2 Exp","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"deepseek-ai/deepseek-v3.2-exp-thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.14,"input":0.28,"output":0.42},"deprecated":false,"extra":{"attachment":false,"description":"DeepSeek chat model for instruction following, coding, and analysis","family":"deepseek-thinking","open_weights":true,"reasoning_options":[],"structured_output":false},"family":null,"id":"deepseek-ai/deepseek-v3.2-exp-thinking","knowledge":null,"last_updated":"2025-09-29","lifecycle":null,"limits":{"context":163840,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V3.2 Exp Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"deepseek-chat":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.1,"output":0.425},"deprecated":false,"extra":{"attachment":true,"description":"DeepSeek chat model for instruction following, coding, and analysis","family":"deepseek","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"deepseek-chat","knowledge":"2025-09","last_updated":"2026-02-28","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"DeepSeek V3/Deepseek Chat","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-01","retired":false,"tags":null},"deepseek-chat-cheaper":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.1,"output":0.425},"deprecated":false,"extra":{"attachment":true,"description":"Chat-tuned GPT model for conversational assistance, writing, and tool workflows","family":"deepseek","open_weights":true,"structured_output":true},"family":null,"id":"deepseek-chat-cheaper","knowledge":null,"last_updated":"2025-04-15","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"DeepSeek V3/Chat Cheaper","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-15","retired":false,"tags":null},"deepseek-r1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.2,"input":0.4,"output":1.7},"deprecated":false,"extra":{"attachment":false,"description":"Classic open reasoning model for transparent math, coding, and deliberate problem solving","family":"deepseek-thinking","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":true},"family":null,"id":"deepseek-r1","knowledge":"2024-07","last_updated":"2025-05-29","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek R1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-01-20","retired":false,"tags":null},"deepseek-r1-sambanova":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":2.499,"input":4.998,"output":6.987},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"deepseek","open_weights":true,"structured_output":false},"family":null,"id":"deepseek-r1-sambanova","knowledge":null,"last_updated":"2025-02-20","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek R1 Fast","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-02-20","retired":false,"tags":null},"deepseek-reasoner":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2,"input":0.4,"output":1.7},"deprecated":false,"extra":{"attachment":false,"description":"DeepSeek reasoning model for multi-step analysis, math, coding, and tools","family":"deepseek-thinking","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"deepseek-reasoner","knowledge":"2025-09","last_updated":"2026-02-28","lifecycle":null,"limits":{"context":64000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek Reasoner","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-01","retired":false,"tags":null},"deepseek-reasoner-cheaper":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2,"input":0.4,"output":1.7},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"deepseek","open_weights":true,"structured_output":false},"family":null,"id":"deepseek-reasoner-cheaper","knowledge":null,"last_updated":"2025-01-20","lifecycle":null,"limits":{"context":128000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Deepseek R1 Cheaper","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"deepseek-v3-0324":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.135,"input":0.2,"output":0.77},"deprecated":false,"extra":{"attachment":false,"description":"Chat-tuned GPT model for conversational assistance, writing, and tool workflows","family":"deepseek","open_weights":true,"structured_output":true},"family":null,"id":"deepseek-v3-0324","knowledge":null,"last_updated":"2025-03-24","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek Chat 0324","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"deepseek/deepseek-latest":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.11,"input":1.1,"output":2.2},"deprecated":false,"extra":{"attachment":false,"description":"DeepSeek chat model for instruction following, coding, and analysis","family":"deepseek","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high","max"]}],"structured_output":true},"family":null,"id":"deepseek/deepseek-latest","knowledge":null,"last_updated":"2026-05-03","lifecycle":null,"limits":{"context":1048576,"output":384000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek Latest","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-03","retired":false,"tags":null},"deepseek/deepseek-prover-v2-671b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.5,"input":1,"output":2.5},"deprecated":false,"extra":{"attachment":false,"description":"Flagship DeepSeek model for coding, reasoning, and agentic work","family":"deepseek","open_weights":true,"structured_output":false},"family":null,"id":"deepseek/deepseek-prover-v2-671b","knowledge":null,"last_updated":"2025-04-30","lifecycle":null,"limits":{"context":160000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek Prover v2 671B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-11-15","retired":false,"tags":null},"deepseek/deepseek-v3.2":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.14,"input":0.28,"output":0.42},"deprecated":false,"extra":{"attachment":true,"description":"DeepSeek chat model for instruction following, coding, and analysis","family":"deepseek","open_weights":true,"structured_output":true},"family":null,"id":"deepseek/deepseek-v3.2","knowledge":null,"last_updated":"2025-12-01","lifecycle":null,"limits":{"context":163000,"output":65536},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"DeepSeek V3.2","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-01","retired":false,"tags":null},"deepseek/deepseek-v3.2:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.14,"input":0.28,"output":0.42},"deprecated":false,"extra":{"attachment":true,"description":"DeepSeek chat model for instruction following, coding, and analysis","family":"deepseek","open_weights":true,"reasoning_options":[],"structured_output":true},"family":null,"id":"deepseek/deepseek-v3.2:thinking","knowledge":null,"last_updated":"2025-12-01","lifecycle":null,"limits":{"context":163000,"output":65536},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"DeepSeek V3.2 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-01","retired":false,"tags":null},"deepseek/deepseek-v4-flash":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.014,"input":0.07,"output":0.14},"deprecated":false,"extra":{"attachment":false,"description":"Fast DeepSeek V4 lane for economical reasoning, coding, and long-context work","family":"deepseek-flash","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"deepseek/deepseek-v4-flash","knowledge":"2025-05","last_updated":"2026-04-24","lifecycle":null,"limits":{"context":1048576,"output":384000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Flash","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-24","retired":false,"tags":null},"deepseek/deepseek-v4-flash-0731":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.014,"input":0.14,"output":0.28},"deprecated":false,"extra":{"attachment":false,"description":"Official DeepSeek V4 Flash release with enhanced agentic capabilities and integrated DSpark speculative decoding","family":"deepseek-flash","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","low","high","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"deepseek/deepseek-v4-flash-0731","knowledge":"2025-05","last_updated":"2026-07-31","lifecycle":null,"limits":{"context":1000000,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Flash 0731","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-31","retired":false,"tags":null},"deepseek/deepseek-v4-flash-0731-cheaper":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.0028,"input":0.14,"output":0.28},"deprecated":false,"extra":{"attachment":false,"description":"DeepSeek V4 Flash 0731 Cheaper is the same re-post-trained Mixture-of-Experts model with a 1M-token context window. This route goes directly to DeepSeek to use its lower cached-input pricing. ⚠️ Privacy and logging guarantees are limited.","family":"deepseek","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","low","high","max"]}],"structured_output":true},"family":null,"id":"deepseek/deepseek-v4-flash-0731-cheaper","knowledge":null,"last_updated":"2026-08-01","lifecycle":null,"limits":{"context":1048576,"output":384000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Flash 0731 Cheaper","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-08-01","retired":false,"tags":null},"deepseek/deepseek-v4-flash-0731-cheaper:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.0028,"input":0.14,"output":0.28},"deprecated":false,"extra":{"attachment":false,"description":"DeepSeek V4 Flash 0731 Cheaper Thinking enables reasoning by default on the same re-post-trained Mixture-of-Experts model with a 1M-token context window. This route goes directly to DeepSeek to use its lower cached-input pricing. ⚠️ Privacy and logging guarantees are limited.","family":"deepseek","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","low","high","max"]}],"structured_output":true},"family":null,"id":"deepseek/deepseek-v4-flash-0731-cheaper:thinking","knowledge":null,"last_updated":"2026-08-01","lifecycle":null,"limits":{"context":1048576,"output":384000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Flash 0731 Cheaper (Thinking)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-08-01","retired":false,"tags":null},"deepseek/deepseek-v4-flash-0731:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.014,"input":0.14,"output":0.28},"deprecated":false,"extra":{"attachment":false,"description":"Official DeepSeek V4 Flash release with enhanced agentic capabilities and integrated DSpark speculative decoding","family":"deepseek-flash","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","low","high","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"deepseek/deepseek-v4-flash-0731:thinking","knowledge":"2025-05","last_updated":"2026-07-31","lifecycle":null,"limits":{"context":1000000,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Flash 0731 (Thinking)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-31","retired":false,"tags":null},"deepseek/deepseek-v4-flash-latest":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.0028,"input":0.14,"output":0.28},"deprecated":false,"extra":{"attachment":false,"description":"Compatibility alias that routes to the newest dated DeepSeek V4 Flash release. Currently routes to DeepSeek V4 Flash 0731. ⚠️ This route goes directly to DeepSeek, so privacy and logging guarantees are limited.","family":"deepseek","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","low","high","max"]}],"structured_output":true},"family":null,"id":"deepseek/deepseek-v4-flash-latest","knowledge":null,"last_updated":"2026-08-02","lifecycle":null,"limits":{"context":1048576,"output":384000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Flash Latest","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-08-02","retired":false,"tags":null},"deepseek/deepseek-v4-flash:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.014,"input":0.07,"output":0.14},"deprecated":false,"extra":{"attachment":false,"description":"Fast DeepSeek V4 lane for economical reasoning, coding, and long-context work","family":"deepseek-flash","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"deepseek/deepseek-v4-flash:thinking","knowledge":"2025-05","last_updated":"2026-04-24","lifecycle":null,"limits":{"context":1048576,"output":384000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Flash (Thinking)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-24","retired":false,"tags":null},"deepseek/deepseek-v4-pro":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.11,"input":1.1,"output":2.2},"deprecated":false,"extra":{"attachment":false,"description":"Open MoE flagship with million-token context for coding and long agent runs","family":"deepseek-thinking","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"deepseek/deepseek-v4-pro","knowledge":"2025-05","last_updated":"2026-04-24","lifecycle":null,"limits":{"context":1048576,"output":384000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Pro","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-24","retired":false,"tags":null},"deepseek/deepseek-v4-pro-cheaper":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.003625,"input":0.435,"output":0.87},"deprecated":false,"extra":{"attachment":false,"description":"Flagship DeepSeek model for coding, reasoning, and agentic work","family":"deepseek","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high","max"]}],"structured_output":true},"family":null,"id":"deepseek/deepseek-v4-pro-cheaper","knowledge":null,"last_updated":"2026-04-25","lifecycle":null,"limits":{"context":1048576,"output":384000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Pro Cheaper","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-25","retired":false,"tags":null},"deepseek/deepseek-v4-pro-cheaper:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.003625,"input":0.435,"output":0.87},"deprecated":false,"extra":{"attachment":false,"description":"Flagship DeepSeek model for coding, reasoning, and agentic work","family":"deepseek","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high","max"]}],"structured_output":true},"family":null,"id":"deepseek/deepseek-v4-pro-cheaper:thinking","knowledge":null,"last_updated":"2026-04-25","lifecycle":null,"limits":{"context":1048576,"output":384000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Pro Cheaper (Thinking)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-25","retired":false,"tags":null},"deepseek/deepseek-v4-pro:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.11,"input":1.1,"output":2.2},"deprecated":false,"extra":{"attachment":false,"description":"Open MoE flagship with million-token context for coding and long agent runs","family":"deepseek-thinking","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"deepseek/deepseek-v4-pro:thinking","knowledge":"2025-05","last_updated":"2026-04-24","lifecycle":null,"limits":{"context":1048576,"output":384000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Pro (Thinking)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-24","retired":false,"tags":null},"dmind/dmind-1-mini":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1,"input":0.2,"output":0.4},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gpt","open_weights":false,"structured_output":false},"family":null,"id":"dmind/dmind-1-mini","knowledge":null,"last_updated":"2025-06-01","lifecycle":null,"limits":{"context":32768,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DMind-1-Mini","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"doubao-1.5-pro-256k":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.3995,"input":0.799,"output":1.445},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":false,"structured_output":false},"family":null,"id":"doubao-1.5-pro-256k","knowledge":null,"last_updated":"2025-03-12","lifecycle":null,"limits":{"context":256000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Doubao 1.5 Pro 256k","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-03-12","retired":false,"tags":null},"doubao-1.5-pro-32k":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.06715,"input":0.1343,"output":0.3349},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":false,"structured_output":false},"family":null,"id":"doubao-1.5-pro-32k","knowledge":null,"last_updated":"2025-01-22","lifecycle":null,"limits":{"context":32000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Doubao 1.5 Pro 32k","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-11-20","retired":false,"tags":null},"doubao-1.5-vision-pro-32k":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2295,"input":0.459,"output":1.377},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":false,"structured_output":false},"family":null,"id":"doubao-1.5-vision-pro-32k","knowledge":null,"last_updated":"2025-01-22","lifecycle":null,"limits":{"context":32000,"output":8192},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Doubao 1.5 Vision Pro 32k","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-11-20","retired":false,"tags":null},"doubao-seed-1-6-250615":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.102,"input":0.204,"output":0.51},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"seed","open_weights":false,"structured_output":false},"family":null,"id":"doubao-seed-1-6-250615","knowledge":null,"last_updated":"2025-06-15","lifecycle":null,"limits":{"context":256000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Doubao Seed 1.6","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"doubao-seed-1-6-flash-250615":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.0187,"input":0.0374,"output":0.374},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"seed","open_weights":false,"structured_output":false},"family":null,"id":"doubao-seed-1-6-flash-250615","knowledge":null,"last_updated":"2025-06-15","lifecycle":null,"limits":{"context":256000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Doubao Seed 1.6 Flash","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"doubao-seed-1-8-251215":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.306,"input":0.612,"output":6.12},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"seed","open_weights":false,"structured_output":false},"family":null,"id":"doubao-seed-1-8-251215","knowledge":null,"last_updated":"2025-12-15","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Doubao Seed 1.8","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"doubao-seed-2-0-code-preview-260215":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.391,"input":0.782,"output":3.893},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"seed","open_weights":false,"structured_output":false},"family":null,"id":"doubao-seed-2-0-code-preview-260215","knowledge":null,"last_updated":"2026-02-14","lifecycle":null,"limits":{"context":256000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Doubao Seed 2.0 Code Preview","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-14","retired":false,"tags":null},"doubao-seed-2-0-lite-260215":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.0731,"input":0.1462,"output":0.8738},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"seed","open_weights":false,"structured_output":false},"family":null,"id":"doubao-seed-2-0-lite-260215","knowledge":null,"last_updated":"2026-02-14","lifecycle":null,"limits":{"context":256000,"output":32000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Doubao Seed 2.0 Lite","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-14","retired":false,"tags":null},"doubao-seed-2-0-mini-260215":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.02465,"input":0.0493,"output":0.4845},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"seed","open_weights":false,"structured_output":false},"family":null,"id":"doubao-seed-2-0-mini-260215","knowledge":null,"last_updated":"2026-02-14","lifecycle":null,"limits":{"context":256000,"output":32000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Doubao Seed 2.0 Mini","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-14","retired":false,"tags":null},"doubao-seed-2-0-pro-260215":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.391,"input":0.782,"output":3.876},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"seed","open_weights":false,"structured_output":false},"family":null,"id":"doubao-seed-2-0-pro-260215","knowledge":null,"last_updated":"2026-02-14","lifecycle":null,"limits":{"context":256000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Doubao Seed 2.0 Pro","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-14","retired":false,"tags":null},"ernie-5.0-thinking-preview":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.5,"input":1,"output":3.5},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"ernie","open_weights":false,"reasoning_options":[],"structured_output":false},"family":null,"id":"ernie-5.0-thinking-preview","knowledge":null,"last_updated":"2025-11-18","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Ernie 5.0 Thinking Preview","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-11-18","retired":false,"tags":null},"ernie-5.1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.75,"input":0.75,"output":3},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"ernie","open_weights":false,"structured_output":false},"family":null,"id":"ernie-5.1","knowledge":null,"last_updated":"2026-05-10","lifecycle":null,"limits":{"context":119000,"output":64000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"ERNIE 5.1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-10","retired":false,"tags":null},"ernie-5.1:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.75,"input":0.75,"output":3},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"ernie","open_weights":false,"reasoning_options":[],"structured_output":false},"family":null,"id":"ernie-5.1:thinking","knowledge":null,"last_updated":"2026-05-10","lifecycle":null,"limits":{"context":119000,"output":64000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"ERNIE 5.1 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-10","retired":false,"tags":null},"ernie-x1.1-preview":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.075,"input":0.15,"output":0.6},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"ernie","open_weights":false,"structured_output":false},"family":null,"id":"ernie-x1.1-preview","knowledge":null,"last_updated":"2025-09-10","lifecycle":null,"limits":{"context":64000,"output":8192},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"ERNIE X1.1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-10","retired":false,"tags":null},"exa-answer":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":2.5,"output":2.5},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":false,"structured_output":false},"family":null,"id":"exa-answer","knowledge":null,"last_updated":"2025-06-04","lifecycle":null,"limits":{"context":4096,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Exa (Answer)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-23","retired":false,"tags":null},"failspy/Meta-Llama-3-70B-Instruct-abliterated-v3.5":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.35,"input":0.7,"output":0.7},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"failspy/Meta-Llama-3-70B-Instruct-abliterated-v3.5","knowledge":null,"last_updated":"2025-07-26","lifecycle":null,"limits":{"context":8192,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3 70B abliterated","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-26","retired":false,"tags":null},"fastgpt":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":7.5,"output":7.5},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":false,"structured_output":false},"family":null,"id":"fastgpt","knowledge":null,"last_updated":"2024-01-01","lifecycle":null,"limits":{"context":32768,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Web Answer","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-23","retired":false,"tags":null},"featherless-ai/Qwerky-72B":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.25,"input":0.5,"output":0.5},"deprecated":false,"extra":{"attachment":false,"description":"General-purpose chat model for instruction following, writing, and analysis","family":"qwerky","open_weights":true,"structured_output":false},"family":null,"id":"featherless-ai/Qwerky-72B","knowledge":null,"last_updated":"2025-03-20","lifecycle":null,"limits":{"context":32000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwerky 72B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"gemini-2.0-pro-exp-02-05":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.49725,"input":1.989,"output":7.956},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemini","open_weights":false,"structured_output":false},"family":null,"id":"gemini-2.0-pro-exp-02-05","knowledge":null,"last_updated":"2025-02-05","lifecycle":null,"limits":{"context":2097152,"output":8192},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 2.0 Pro 0205","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-02-05","retired":false,"tags":null},"gemini-2.0-pro-reasoner":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.323,"input":1.292,"output":4.998},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemini","open_weights":false,"structured_output":false},"family":null,"id":"gemini-2.0-pro-reasoner","knowledge":null,"last_updated":"2025-02-05","lifecycle":null,"limits":{"context":128000,"output":65536},"modalities":{"input":["text","audio"],"output":["text"]},"model":null,"name":"Gemini 2.0 Pro Reasoner","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"gemini-2.5-flash":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.03,"input":0.3,"output":2.5},"deprecated":false,"extra":{"attachment":true,"description":"Fast Gemini workhorse for multimodal apps where latency and price matter","family":"gemini-flash","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false,"temperature":true},"family":null,"id":"gemini-2.5-flash","knowledge":"2025-01","last_updated":"2025-06-17","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 2.5 Flash","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-06-17","retired":false,"tags":null},"gemini-2.5-flash-lite":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.01,"input":0.1,"output":0.4},"deprecated":false,"extra":{"attachment":true,"description":"Lean Gemini 2.5 lane for cheap multimodal traffic and quick agents","family":"gemini-flash-lite","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false,"temperature":true},"family":null,"id":"gemini-2.5-flash-lite","knowledge":"2025-01","last_updated":"2025-06-17","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 2.5 Flash Lite","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-06-17","retired":false,"tags":null},"gemini-2.5-flash-lite-preview-06-17":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.015,"input":0.15,"output":0.6},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemini","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false},"family":null,"id":"gemini-2.5-flash-lite-preview-06-17","knowledge":null,"last_updated":"2025-06-17","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 2.5 Flash Lite Preview","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-06-17","retired":false,"tags":null},"gemini-2.5-flash-lite-preview-09-2025":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.01,"input":0.1,"output":0.4},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemini","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true},"family":null,"id":"gemini-2.5-flash-lite-preview-09-2025","knowledge":null,"last_updated":"2025-09-25","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio","pdf"],"output":["text"]},"model":null,"name":"Gemini 2.5 Flash Lite Preview (09/2025)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-25","retired":false,"tags":null},"gemini-2.5-flash-lite-preview-09-2025-thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.01,"input":0.1,"output":0.4},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemini","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true},"family":null,"id":"gemini-2.5-flash-lite-preview-09-2025-thinking","knowledge":null,"last_updated":"2025-09-25","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio","pdf"],"output":["text"]},"model":null,"name":"Gemini 2.5 Flash Lite Preview (09/2025) – Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-25","retired":false,"tags":null},"gemini-2.5-flash-nothinking":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.03,"input":0.3,"output":2.5},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemini","open_weights":false,"structured_output":false},"family":null,"id":"gemini-2.5-flash-nothinking","knowledge":null,"last_updated":"2025-06-05","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio","pdf"],"output":["text"]},"model":null,"name":"Gemini 2.5 Flash (No Thinking)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-06-05","retired":false,"tags":null},"gemini-2.5-flash-preview-04-17":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.015,"input":0.15,"output":0.6},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemini","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false},"family":null,"id":"gemini-2.5-flash-preview-04-17","knowledge":null,"last_updated":"2025-04-17","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 2.5 Flash Preview","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-17","retired":false,"tags":null},"gemini-2.5-flash-preview-04-17:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.015,"input":0.15,"output":3.5},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemini","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false},"family":null,"id":"gemini-2.5-flash-preview-04-17:thinking","knowledge":null,"last_updated":"2025-04-17","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 2.5 Flash Preview Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-17","retired":false,"tags":null},"gemini-2.5-flash-preview-05-20":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.015,"input":0.15,"output":0.6},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemini","open_weights":false,"structured_output":false},"family":null,"id":"gemini-2.5-flash-preview-05-20","knowledge":null,"last_updated":"2025-05-20","lifecycle":null,"limits":{"context":1048000,"output":65536},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemini 2.5 Flash 0520","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-05-20","retired":false,"tags":null},"gemini-2.5-flash-preview-05-20:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.015,"input":0.15,"output":3.5},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemini","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false},"family":null,"id":"gemini-2.5-flash-preview-05-20:thinking","knowledge":null,"last_updated":"2025-05-20","lifecycle":null,"limits":{"context":1048000,"output":65536},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemini 2.5 Flash 0520 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-05-20","retired":false,"tags":null},"gemini-2.5-flash-preview-09-2025":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.03,"input":0.3,"output":2.5},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemini","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true},"family":null,"id":"gemini-2.5-flash-preview-09-2025","knowledge":null,"last_updated":"2025-09-25","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio","pdf"],"output":["text"]},"model":null,"name":"Gemini 2.5 Flash Preview (09/2025)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-25","retired":false,"tags":null},"gemini-2.5-flash-preview-09-2025-thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.03,"input":0.3,"output":2.5},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemini","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true},"family":null,"id":"gemini-2.5-flash-preview-09-2025-thinking","knowledge":null,"last_updated":"2025-09-25","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio","pdf"],"output":["text"]},"model":null,"name":"Gemini 2.5 Flash Preview (09/2025) – Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-25","retired":false,"tags":null},"gemini-2.5-pro":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.125,"cache_write":0.375,"input":1.25,"output":10},"deprecated":false,"extra":{"attachment":true,"description":"Google's proven reasoning model for coding, math, and multimodal analysis","family":"gemini-pro","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false,"temperature":true},"family":null,"id":"gemini-2.5-pro","knowledge":"2025-01","last_updated":"2025-06-17","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 2.5 Pro","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-06-17","retired":false,"tags":null},"gemini-2.5-pro-exp-03-25":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.25,"input":2.5,"output":10},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemini","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false},"family":null,"id":"gemini-2.5-pro-exp-03-25","knowledge":null,"last_updated":"2025-03-25","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 2.5 Pro Experimental 0325","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-03-25","retired":false,"tags":null},"gemini-2.5-pro-preview-03-25":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.25,"input":2.5,"output":10},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemini","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false},"family":null,"id":"gemini-2.5-pro-preview-03-25","knowledge":null,"last_updated":"2025-03-25","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 2.5 Pro Preview 0325","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-03-25","retired":false,"tags":null},"gemini-2.5-pro-preview-05-06":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.25,"input":2.5,"output":10},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemini","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false},"family":null,"id":"gemini-2.5-pro-preview-05-06","knowledge":null,"last_updated":"2025-05-06","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 2.5 Pro Preview 0506","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-05-06","retired":false,"tags":null},"gemini-2.5-pro-preview-06-05":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.25,"input":2.5,"output":10},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemini","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false},"family":null,"id":"gemini-2.5-pro-preview-06-05","knowledge":null,"last_updated":"2025-06-05","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 2.5 Pro Preview 0605","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-06-05","retired":false,"tags":null},"gemini-3-pro-image-preview":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2,"input":2,"output":12},"deprecated":false,"extra":{"attachment":true,"description":"Nano Banana Pro for higher-fidelity image generation and design-heavy edits","family":"gemini-pro","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"gemini-3-pro-image-preview","knowledge":"2025-01","last_updated":"2025-11-20","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemini 3 Pro Image","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-11-20","retired":false,"tags":null},"gemini-exp-1206":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.629,"input":1.258,"output":4.998},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemini","open_weights":false,"structured_output":false},"family":null,"id":"gemini-exp-1206","knowledge":null,"last_updated":"2024-12-06","lifecycle":null,"limits":{"context":2097152,"output":8192},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 2.0 Pro 1206","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-12-06","retired":false,"tags":null},"gemma-4-12b-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.03,"input":0.06,"output":0.3},"deprecated":false,"extra":{"attachment":true,"description":"Google's Gemma 4 12B Instruct is an open-weight multimodal model for text, image, audio, and video understanding, with tool calling and structured output support.","family":"gemma","open_weights":true,"structured_output":true},"family":null,"id":"gemma-4-12b-it","knowledge":null,"last_updated":"2026-08-01","lifecycle":null,"limits":{"context":262144,"output":32768},"modalities":{"input":["text","image","video","audio"],"output":["text"]},"model":null,"name":"Gemma 4 12B Instruct","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-08-01","retired":false,"tags":null},"gemma-4-e2b-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.01,"input":0.02,"output":0.1},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"gemma","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"gemma-4-e2b-it","knowledge":null,"last_updated":"2026-04-02","lifecycle":null,"limits":{"context":131072,"output":16384},"modalities":{"input":["text","image","video","audio"],"output":["text"]},"model":null,"name":"Gemma 4 E2B Instruct","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-02","retired":false,"tags":null},"gemma-4-e4b-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.02,"input":0.04,"output":0.2},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"gemma","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"gemma-4-e4b-it","knowledge":null,"last_updated":"2026-04-02","lifecycle":null,"limits":{"context":131072,"output":16384},"modalities":{"input":["text","image","video","audio"],"output":["text"]},"model":null,"name":"Gemma 4 E4B Instruct","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-02","retired":false,"tags":null},"glm-4":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":7.497,"input":14.994,"output":14.994},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"glm","open_weights":false,"structured_output":false},"family":null,"id":"glm-4","knowledge":null,"last_updated":"2024-01-16","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM-4","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"glm-4-air":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1003,"input":0.2006,"output":0.2006},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"glm","open_weights":false,"structured_output":false},"family":null,"id":"glm-4-air","knowledge":null,"last_updated":"2024-06-05","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM-4 Air","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"glm-4-air-0111":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.0697,"input":0.1394,"output":0.1394},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"glm","open_weights":false,"structured_output":false},"family":null,"id":"glm-4-air-0111","knowledge":null,"last_updated":"2025-01-11","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4 Air 0111","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-01-11","retired":false,"tags":null},"glm-4-airx":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.003,"input":2.006,"output":2.006},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"glm","open_weights":false,"structured_output":false},"family":null,"id":"glm-4-airx","knowledge":null,"last_updated":"2024-06-05","lifecycle":null,"limits":{"context":8000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM-4 AirX","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"glm-4-flash":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.05015,"input":0.1003,"output":0.1003},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"glm","open_weights":false,"structured_output":false},"family":null,"id":"glm-4-flash","knowledge":null,"last_updated":"2024-08-01","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM-4 Flash","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"glm-4-long":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1003,"input":0.2006,"output":0.2006},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"glm","open_weights":false,"structured_output":false},"family":null,"id":"glm-4-long","knowledge":null,"last_updated":"2024-08-01","lifecycle":null,"limits":{"context":1000000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM-4 Long","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"glm-4-plus":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":3.7485,"input":7.497,"output":7.497},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"glm","open_weights":false,"structured_output":false},"family":null,"id":"glm-4-plus","knowledge":null,"last_updated":"2024-08-01","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM-4 Plus","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-09-20","retired":false,"tags":null},"glm-4-plus-0111":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":4.998,"input":9.996,"output":9.996},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"glm","open_weights":false,"structured_output":false},"family":null,"id":"glm-4-plus-0111","knowledge":null,"last_updated":"2025-02-19","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4 Plus 0111","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-02-19","retired":false,"tags":null},"glm-4.1v-thinking-flash":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":0.3},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"glm","open_weights":false,"structured_output":false},"family":null,"id":"glm-4.1v-thinking-flash","knowledge":null,"last_updated":"2025-07-09","lifecycle":null,"limits":{"context":64000,"output":8192},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GLM 4.1V Thinking Flash","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-09","retired":false,"tags":null},"glm-4.1v-thinking-flashx":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":0.3},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"glm","open_weights":false,"structured_output":false},"family":null,"id":"glm-4.1v-thinking-flashx","knowledge":null,"last_updated":"2025-07-09","lifecycle":null,"limits":{"context":64000,"output":8192},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GLM 4.1V Thinking FlashX","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-09","retired":false,"tags":null},"glm-z1-air":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.035,"input":0.07,"output":0.07},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"glm","open_weights":false,"structured_output":true},"family":null,"id":"glm-z1-air","knowledge":null,"last_updated":"2025-04-15","lifecycle":null,"limits":{"context":32000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM Z1 Air","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-15","retired":false,"tags":null},"glm-z1-airx":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.35,"input":0.7,"output":0.7},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"glm","open_weights":false,"structured_output":true},"family":null,"id":"glm-z1-airx","knowledge":null,"last_updated":"2025-04-15","lifecycle":null,"limits":{"context":32000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM Z1 AirX","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-15","retired":false,"tags":null},"glm-zero-preview":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.901,"input":1.802,"output":1.802},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"glm","open_weights":false,"structured_output":false},"family":null,"id":"glm-zero-preview","knowledge":null,"last_updated":"2024-12-01","lifecycle":null,"limits":{"context":8000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM Zero Preview","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-12-20","retired":false,"tags":null},"google/gemini-3-flash-preview":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.5,"output":3},"deprecated":false,"extra":{"attachment":true,"description":"New Gemini flash lane bringing frontier-style multimodal reasoning to cheaper runs","family":"gemini-flash","open_weights":false,"reasoning_options":[{"type":"effort","values":["minimal","low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"google/gemini-3-flash-preview","knowledge":"2025-01","last_updated":"2025-12-17","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 3 Flash (Preview)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-17","retired":false,"tags":null},"google/gemini-3-flash-preview-thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.5,"output":3},"deprecated":false,"extra":{"attachment":true,"description":"New Gemini flash lane bringing frontier-style multimodal reasoning to cheaper runs","family":"gemini-flash","open_weights":false,"reasoning_options":[{"type":"effort","values":["minimal","low","medium","high"]}],"structured_output":false,"temperature":true},"family":null,"id":"google/gemini-3-flash-preview-thinking","knowledge":"2025-01","last_updated":"2025-12-17","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 3 Flash Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-17","retired":false,"tags":null},"google/gemini-3.1-flash-lite":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.025,"cache_write":0.08333,"input":0.25,"output":1.5},"deprecated":false,"extra":{"attachment":true,"description":"Low-latency Gemini model for high-volume multimodal and agent workloads","family":"gemini-flash-lite","open_weights":false,"reasoning_options":[{"type":"effort","values":["minimal","low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"google/gemini-3.1-flash-lite","knowledge":"2025-01","last_updated":"2026-05-07","lifecycle":null,"limits":{"context":1048576,"output":65536},"modalities":{"input":["text","image","video","audio","pdf"],"output":["text"]},"model":null,"name":"Gemini 3.1 Flash Lite","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-07","retired":false,"tags":null},"google/gemini-3.1-pro-preview":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"cache_write":0.375,"input":2,"output":12},"deprecated":false,"extra":{"attachment":true,"description":"Reasoning-first Gemini preview for agentic coding and complex problem solving","family":"gemini-pro","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"google/gemini-3.1-pro-preview","knowledge":"2025-01","last_updated":"2026-02-19","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 3.1 Pro (Preview)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-19","retired":false,"tags":null},"google/gemini-3.1-pro-preview-customtools":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"cache_write":0.375,"input":2,"output":12},"deprecated":false,"extra":{"attachment":true,"description":"Advanced Gemini model for complex reasoning, coding, and multimodal analysis","family":"gemini-pro","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"google/gemini-3.1-pro-preview-customtools","knowledge":"2025-01","last_updated":"2026-02-19","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 3.1 Pro (Preview Custom Tools)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-19","retired":false,"tags":null},"google/gemini-3.1-pro-preview-high":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"cache_write":0.375,"input":2,"output":12},"deprecated":false,"extra":{"attachment":true,"description":"Advanced Gemini model for complex reasoning, coding, and multimodal analysis","family":"gemini","open_weights":false,"reasoning_options":[],"structured_output":true},"family":null,"id":"google/gemini-3.1-pro-preview-high","knowledge":null,"last_updated":"2026-02-21","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 3.1 Pro (Preview High)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-21","retired":false,"tags":null},"google/gemini-3.1-pro-preview-low":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"cache_write":0.375,"input":2,"output":12},"deprecated":false,"extra":{"attachment":true,"description":"Advanced Gemini model for complex reasoning, coding, and multimodal analysis","family":"gemini","open_weights":false,"reasoning_options":[],"structured_output":true},"family":null,"id":"google/gemini-3.1-pro-preview-low","knowledge":null,"last_updated":"2026-02-21","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 3.1 Pro (Preview Low)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-21","retired":false,"tags":null},"google/gemini-3.5-flash":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":1.5,"output":9},"deprecated":false,"extra":{"attachment":true,"description":"Fast Gemini model balancing multimodal reasoning, tool use, and cost","family":"gemini-flash","open_weights":false,"reasoning_options":[{"type":"effort","values":["minimal","low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"google/gemini-3.5-flash","knowledge":"2025-01","last_updated":"2026-05-19","lifecycle":null,"limits":{"context":1048576,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 3.5 Flash","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-19","retired":false,"tags":null},"google/gemini-3.5-flash-lite":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.03,"cache_write":0.08333,"input":0.3,"output":2.5},"deprecated":false,"extra":{"attachment":true,"description":"Fast Gemini model balancing multimodal reasoning, tool use, and cost","family":"gemini-flash-lite","open_weights":false,"reasoning_options":[{"type":"effort","values":["minimal","low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"google/gemini-3.5-flash-lite","knowledge":"2026-03","last_updated":"2026-07-21","lifecycle":null,"limits":{"context":1048576,"output":65536},"modalities":{"input":["text","image","video","audio","pdf"],"output":["text"]},"model":null,"name":"Gemini 3.5 Flash Lite","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-21","retired":false,"tags":null},"google/gemini-3.5-flash-thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.15,"input":1.5,"output":9},"deprecated":false,"extra":{"attachment":true,"description":"Fast Gemini model balancing multimodal reasoning, tool use, and cost","family":"gemini-flash","open_weights":false,"reasoning_options":[{"type":"effort","values":["minimal","low","medium","high"]}],"structured_output":false,"temperature":true},"family":null,"id":"google/gemini-3.5-flash-thinking","knowledge":"2025-01","last_updated":"2026-05-19","lifecycle":null,"limits":{"context":1048576,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini 3.5 Flash Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-19","retired":false,"tags":null},"google/gemini-3.6-flash":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":1.5,"output":7.5},"deprecated":false,"extra":{"attachment":true,"description":"Fast Gemini model balancing multimodal reasoning, tool use, and cost","family":"gemini-flash","open_weights":false,"reasoning_options":[{"type":"effort","values":["minimal","low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"google/gemini-3.6-flash","knowledge":"2026-03","last_updated":"2026-07-21","lifecycle":null,"limits":{"context":1048576,"output":65536},"modalities":{"input":["text","image","video","audio","pdf"],"output":["text"]},"model":null,"name":"Gemini 3.6 Flash","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-21","retired":false,"tags":null},"google/gemini-flash-latest":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.15,"input":1.5,"output":7.5},"deprecated":false,"extra":{"attachment":true,"description":"Fast Gemini model balancing multimodal reasoning, tool use, and cost","family":"gemini-flash","open_weights":false,"reasoning_options":[{"type":"effort","values":["minimal","low","medium","high"]}],"structured_output":false,"temperature":true},"family":null,"id":"google/gemini-flash-latest","knowledge":"2025-01","last_updated":"2026-05-19","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini Flash Latest","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-19","retired":false,"tags":null},"google/gemini-flash-lite-latest":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.03,"cache_write":0.08333,"input":0.3,"output":2.5},"deprecated":false,"extra":{"attachment":true,"description":"Low-latency Gemini model for high-volume multimodal and agent workloads","family":"gemini-flash-lite","open_weights":false,"reasoning_options":[{"type":"effort","values":["minimal","low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"google/gemini-flash-lite-latest","knowledge":"2025-01","last_updated":"2026-05-07","lifecycle":null,"limits":{"context":1048576,"output":65536},"modalities":{"input":["text","image","video","audio","pdf"],"output":["text"]},"model":null,"name":"Gemini Flash Lite Latest","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-07","retired":false,"tags":null},"google/gemini-pro-latest":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"cache_write":0.375,"input":2,"output":12},"deprecated":false,"extra":{"attachment":true,"description":"Advanced Gemini model for complex reasoning, coding, and multimodal analysis","family":"gemini-pro","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true},"family":null,"id":"google/gemini-pro-latest","knowledge":null,"last_updated":"2026-03-29","lifecycle":null,"limits":{"context":1048756,"output":65536},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Gemini Pro Latest","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-29","retired":false,"tags":null},"google/gemma-4-26b-a4b-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.065,"input":0.13,"output":0.4},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"gemma","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"google/gemma-4-26b-a4b-it","knowledge":null,"last_updated":"2026-04-02","lifecycle":null,"limits":{"context":262144,"output":131072},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 4 26B A4B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-02","retired":false,"tags":null},"google/gemma-4-26b-a4b-it:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.065,"input":0.13,"output":0.4},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"gemma","open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"google/gemma-4-26b-a4b-it:thinking","knowledge":null,"last_updated":"2026-04-02","lifecycle":null,"limits":{"context":262144,"output":131072},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 4 26B A4B Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-02","retired":false,"tags":null},"google/gemma-4-31b-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.1,"output":0.35},"deprecated":false,"extra":{"attachment":true,"description":"Largest Gemma 4 instruction model for open, self-hosted chat and reasoning","family":"gemma","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"google/gemma-4-31b-it","knowledge":null,"last_updated":"2026-04-02","lifecycle":null,"limits":{"context":262144,"output":131072},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 4 31B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-02","retired":false,"tags":null},"google/gemma-4-31b-it:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.1,"output":0.35},"deprecated":false,"extra":{"attachment":true,"description":"Largest Gemma 4 instruction model for open, self-hosted chat and reasoning","family":"gemma","open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"google/gemma-4-31b-it:thinking","knowledge":null,"last_updated":"2026-04-02","lifecycle":null,"limits":{"context":262144,"output":131072},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 4 31B Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-02","retired":false,"tags":null},"hermes-high":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":2.5,"input":5,"output":25},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"hermes","open_weights":false,"reasoning_options":[],"structured_output":true},"family":null,"id":"hermes-high","knowledge":null,"last_updated":"2026-05-11","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"Hermes High","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-11","retired":false,"tags":null},"hermes-low":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.025,"cache_write":0.08333,"input":0.25,"output":1.5},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"hermes","open_weights":false,"reasoning_options":[],"structured_output":true},"family":null,"id":"hermes-low","knowledge":null,"last_updated":"2026-05-11","lifecycle":null,"limits":{"context":1048576,"output":65536},"modalities":{"input":["text","image","video","pdf"],"output":["text"]},"model":null,"name":"Hermes Low","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-11","retired":false,"tags":null},"hermes-medium":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.1575,"input":0.315,"output":1.26},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"hermes","open_weights":false,"reasoning_options":[],"structured_output":true},"family":null,"id":"hermes-medium","knowledge":null,"last_updated":"2026-05-11","lifecycle":null,"limits":{"context":204800,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Hermes Medium","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-11","retired":false,"tags":null},"holo3-35b-a3b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.125,"input":0.25,"output":1.8},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true},"family":null,"id":"holo3-35b-a3b","knowledge":null,"last_updated":"2024-01-01","lifecycle":null,"limits":{"context":65536,"output":65536},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Holo3-35B-A3B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"holo3-35b-a3b:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.125,"input":0.25,"output":1.8},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":true,"reasoning_options":[],"structured_output":true},"family":null,"id":"holo3-35b-a3b:thinking","knowledge":null,"last_updated":"2024-01-01","lifecycle":null,"limits":{"context":65536,"output":65536},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Holo3-35B-A3B Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"huihui-ai/DeepSeek-R1-Distill-Llama-70B-abliterated":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.35,"input":0.7,"output":0.7},"deprecated":false,"extra":{"attachment":false,"description":"DeepSeek reasoning model for multi-step analysis, math, coding, and tools","family":"deepseek","open_weights":true,"reasoning_options":[],"structured_output":false},"family":null,"id":"huihui-ai/DeepSeek-R1-Distill-Llama-70B-abliterated","knowledge":null,"last_updated":"2025-01-20","lifecycle":null,"limits":{"context":16384,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek R1 Llama 70B Abliterated","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"huihui-ai/DeepSeek-R1-Distill-Qwen-32B-abliterated":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.7,"input":1.4,"output":1.4},"deprecated":false,"extra":{"attachment":false,"description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","llmfit":{"architecture":"qwen2","context_length":4096,"discovered":true,"gguf_sources":[{"provider":"bartowski","repo":"bartowski/DeepSeek-R1-Distill-Qwen-32B-abliterated-GGUF"},{"provider":"mradermacher","repo":"mradermacher/DeepSeek-R1-Distill-Qwen-32B-abliterated-GGUF"}],"hf_downloads":137725,"hf_likes":0,"matched_hugging_face_id":"huihui-ai/DeepSeek-R1-Distill-Qwen-32B-abliterated","memory":{"min_ram_gb":18.3,"min_vram_gb":16.8,"recommended_ram_gb":30.5},"model_id":"huihui-ai/DeepSeek-R1-Distill-Qwen-32B-abliterated","parameter_count":"32.8B","parameters_raw":32763876352,"pipeline_tag":"text-generation","provider":"huihui-ai","quantization":"Q4_K_M","source":"llmfit","use_case":"Advanced reasoning, chain-of-thought"},"open_weights":true,"reasoning_options":[],"structured_output":false},"family":null,"id":"huihui-ai/DeepSeek-R1-Distill-Qwen-32B-abliterated","knowledge":null,"last_updated":"2025-01-20","lifecycle":null,"limits":{"context":16384,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek R1 Qwen Abliterated","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"huihui-ai/Llama-3.3-70B-Instruct-abliterated":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.35,"input":0.7,"output":0.7},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"huihui-ai/Llama-3.3-70B-Instruct-abliterated","knowledge":null,"last_updated":"2025-08-08","lifecycle":null,"limits":{"context":16384,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.3 70B Instruct abliterated","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-08","retired":false,"tags":null},"huihui-ai/Qwen2.5-32B-Instruct-abliterated":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.35,"input":0.7,"output":0.7},"deprecated":false,"extra":{"attachment":false,"description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","open_weights":true,"structured_output":false},"family":null,"id":"huihui-ai/Qwen2.5-32B-Instruct-abliterated","knowledge":null,"last_updated":"2025-01-06","lifecycle":null,"limits":{"context":32768,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen 2.5 32B Abliterated","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-01-06","retired":false,"tags":null},"hunyuan-turbos-20250226":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.0935,"input":0.187,"output":0.374},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"hunyuan","open_weights":false,"structured_output":false},"family":null,"id":"hunyuan-turbos-20250226","knowledge":null,"last_updated":"2025-02-27","lifecycle":null,"limits":{"context":24000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Hunyuan Turbo S","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-02-27","retired":false,"tags":null},"ibm-granite/granite-4.1-8b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.05,"output":0.1},"deprecated":false,"extra":{"attachment":false,"description":"Tool-capable chat model for instruction following and agentic application workflows","family":"granite","llmfit":{"architecture":"granite","context_length":131072,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/granite-4.1-8b-GGUF"},{"provider":"mradermacher","repo":"mradermacher/granite-4.1-8b-GGUF"}],"hf_downloads":4085575,"hf_likes":243,"matched_hugging_face_id":"ibm-granite/granite-4.1-8b","memory":{"min_ram_gb":4.9,"min_vram_gb":4.5,"recommended_ram_gb":8.2},"model_id":"ibm-granite/granite-4.1-8b","parameter_count":"8.8B","parameters_raw":8791592960,"pipeline_tag":"text-generation","provider":"ibm-granite","quantization":"Q4_K_M","release_date":"2026-04-06","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"structured_output":true},"family":null,"id":"ibm-granite/granite-4.1-8b","knowledge":null,"last_updated":"2026-04-29","lifecycle":null,"limits":{"context":131072,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Granite 4.1 8B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-29","retired":false,"tags":null},"inclusionai/ling-2.6-1t":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.06,"input":0.3,"output":2.5},"deprecated":false,"extra":{"attachment":false,"description":"Tool-capable chat model for instruction following and agentic application workflows","family":"ling","open_weights":false,"structured_output":true},"family":null,"id":"inclusionai/ling-2.6-1t","knowledge":null,"last_updated":"2026-04-23","lifecycle":null,"limits":{"context":262144,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Ling 2.6 1T","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-23","retired":false,"tags":null},"inclusionai/ling-2.6-flash":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.02,"input":0.1,"output":0.3},"deprecated":false,"extra":{"attachment":false,"description":"Efficient model for low-latency assistance, extraction, and routine automation","family":"ling","open_weights":true,"structured_output":true},"family":null,"id":"inclusionai/ling-2.6-flash","knowledge":null,"last_updated":"2026-04-21","lifecycle":null,"limits":{"context":262144,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Ling 2.6 Flash","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-21","retired":false,"tags":null},"inclusionai/ling-3.0-flash":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.012,"input":0.06,"output":0.18},"deprecated":false,"extra":{"attachment":false,"description":"Ling-3.0-flash is a 124B-parameter Mixture-of-Experts model with approximately 5.1B parameters active per token. It prioritizes token efficiency and production-scale agentic inference, helping coding and tool-using agents complete more work within constrained latency and serving budgets.","family":"ling","open_weights":false,"structured_output":false},"family":null,"id":"inclusionai/ling-3.0-flash","knowledge":null,"last_updated":"2026-07-23","lifecycle":null,"limits":{"context":262144,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Ling 3.0 Flash","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-23","retired":false,"tags":null},"inclusionai/ling-3.0-flash:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.012,"input":0.06,"output":0.18},"deprecated":false,"extra":{"attachment":false,"description":"Ling-3.0-flash Thinking enables visible reasoning on inclusionAI's token-efficient 124B-parameter Mixture-of-Experts model for harder coding, tool use, planning, and production-scale agent workflows.","family":"ling","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","minimal","low","medium","high","xhigh"]}],"structured_output":false},"family":null,"id":"inclusionai/ling-3.0-flash:thinking","knowledge":null,"last_updated":"2026-07-23","lifecycle":null,"limits":{"context":262144,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Ling 3.0 Flash Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-23","retired":false,"tags":null},"inclusionai/ring-2.6-1t":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.06,"input":0.3,"output":2.5},"deprecated":false,"extra":{"attachment":false,"description":"Reasoning model for deliberate analysis, multi-step problem solving, and tool use","family":"ring","open_weights":false,"reasoning_options":[],"structured_output":true},"family":null,"id":"inclusionai/ring-2.6-1t","knowledge":null,"last_updated":"2026-05-08","lifecycle":null,"limits":{"context":262144,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Ring 2.6 1T","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-08","retired":false,"tags":null},"inflatebot/MN-12B-Mag-Mell-R1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2465,"input":0.493,"output":0.493},"deprecated":false,"extra":{"attachment":false,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","family":"mistral-nemo","llmfit":{"architecture":"mistral","context_length":1024000,"discovered":true,"gguf_sources":[{"provider":"bartowski","repo":"bartowski/MN-12B-Mag-Mell-R1-GGUF"},{"provider":"mradermacher","repo":"mradermacher/MN-12B-Mag-Mell-R1-GGUF"}],"hf_downloads":15768,"hf_likes":0,"matched_hugging_face_id":"inflatebot/MN-12B-Mag-Mell-R1","memory":{"min_ram_gb":6.8,"min_vram_gb":6.3,"recommended_ram_gb":11.4},"model_id":"inflatebot/MN-12B-Mag-Mell-R1","parameter_count":"12.2B","parameters_raw":12247782400,"pipeline_tag":"text-generation","provider":"inflatebot","quantization":"Q4_K_M","source":"llmfit","use_case":"Advanced reasoning, chain-of-thought"},"open_weights":true,"structured_output":false},"family":null,"id":"inflatebot/MN-12B-Mag-Mell-R1","knowledge":null,"last_updated":"2024-07-01","lifecycle":null,"limits":{"context":16384,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mag Mell R1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"inflection/inflection-3-pi":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.2495,"input":2.499,"output":9.996},"deprecated":false,"extra":{"attachment":false,"description":"GPT model for general reasoning, writing, coding, and tool-assisted tasks","family":"gpt","open_weights":false,"structured_output":false},"family":null,"id":"inflection/inflection-3-pi","knowledge":null,"last_updated":"2024-10-11","lifecycle":null,"limits":{"context":8000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Inflection 3 Pi","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-11-21","retired":false,"tags":null},"inflection/inflection-3-productivity":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.2495,"input":2.499,"output":9.996},"deprecated":false,"extra":{"attachment":false,"description":"GPT model for general reasoning, writing, coding, and tool-assisted tasks","family":"gpt","open_weights":false,"structured_output":false},"family":null,"id":"inflection/inflection-3-productivity","knowledge":null,"last_updated":"2024-10-11","lifecycle":null,"limits":{"context":8000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Inflection 3 Productivity","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-11-21","retired":false,"tags":null},"jamba-large":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.9945,"input":1.989,"output":7.99},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"jamba","open_weights":false,"structured_output":false},"family":null,"id":"jamba-large","knowledge":null,"last_updated":"2025-07-09","lifecycle":null,"limits":{"context":256000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Jamba Large","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-09","retired":false,"tags":null},"jamba-large-1.6":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.9945,"input":1.989,"output":7.99},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"jamba","open_weights":false,"structured_output":false},"family":null,"id":"jamba-large-1.6","knowledge":null,"last_updated":"2025-03-12","lifecycle":null,"limits":{"context":256000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Jamba Large 1.6","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-03-12","retired":false,"tags":null},"jamba-large-1.7":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.9945,"input":1.989,"output":7.99},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"jamba","open_weights":false,"structured_output":false},"family":null,"id":"jamba-large-1.7","knowledge":null,"last_updated":"2025-07-09","lifecycle":null,"limits":{"context":256000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Jamba Large 1.7","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-09","retired":false,"tags":null},"jamba-mini":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.09945,"input":0.1989,"output":0.408},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"jamba","open_weights":false,"structured_output":false},"family":null,"id":"jamba-mini","knowledge":null,"last_updated":"2025-07-09","lifecycle":null,"limits":{"context":256000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Jamba Mini","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-09","retired":false,"tags":null},"jamba-mini-1.6":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.09945,"input":0.1989,"output":0.408},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"jamba","open_weights":false,"structured_output":false},"family":null,"id":"jamba-mini-1.6","knowledge":null,"last_updated":"2025-03-01","lifecycle":null,"limits":{"context":256000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Jamba Mini 1.6","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"jamba-mini-1.7":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.09945,"input":0.1989,"output":0.408},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"jamba","open_weights":false,"structured_output":false},"family":null,"id":"jamba-mini-1.7","knowledge":null,"last_updated":"2025-07-09","lifecycle":null,"limits":{"context":256000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Jamba Mini 1.7","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-09","retired":false,"tags":null},"kimi-k2-instruct-fast":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2,"input":0.4,"output":1.8},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"kimi-k2","open_weights":true,"structured_output":false},"family":null,"id":"kimi-k2-instruct-fast","knowledge":null,"last_updated":"2025-07-15","lifecycle":null,"limits":{"context":131072,"output":16384},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"Kimi K2 0711 Fast","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-15","retired":false,"tags":null},"kwaipilot/kat-coder-air-v2.5":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.03,"input":0.15,"output":0.6},"deprecated":false,"extra":{"attachment":false,"description":"Fast, cost-efficient KAT Coder model for code generation, editing, debugging, and agentic software-development workflows.","family":"kat-coder","open_weights":false,"structured_output":true},"family":null,"id":"kwaipilot/kat-coder-air-v2.5","knowledge":null,"last_updated":"2026-07-14","lifecycle":null,"limits":{"context":256000,"output":80000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"KAT Coder Air V2.5","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-14","retired":false,"tags":null},"kwaipilot/kat-coder-pro-v2":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":1.2},"deprecated":false,"extra":{"attachment":false,"description":"Coding model for repository understanding, refactors, and agentic engineering tasks","family":"kat-coder","open_weights":false,"structured_output":false},"family":null,"id":"kwaipilot/kat-coder-pro-v2","knowledge":null,"last_updated":"2026-03-28","lifecycle":null,"limits":{"context":256000,"output":80000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"KAT Coder Pro V2","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-28","retired":false,"tags":null},"kwaipilot/kat-coder-pro-v2.5":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":0.74,"output":2.96},"deprecated":false,"extra":{"attachment":false,"description":"Higher-capability KAT Coder model for complex code generation, repository-scale editing, debugging, and agentic software-development workflows.","family":"kat-coder","open_weights":false,"structured_output":true},"family":null,"id":"kwaipilot/kat-coder-pro-v2.5","knowledge":null,"last_updated":"2026-07-14","lifecycle":null,"limits":{"context":256000,"output":80000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"KAT Coder Pro V2.5","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-14","retired":false,"tags":null},"learnlm-1.5-pro-experimental":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.751,"input":3.502,"output":10.506},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gemini","open_weights":false,"structured_output":false},"family":null,"id":"learnlm-1.5-pro-experimental","knowledge":null,"last_updated":"2024-05-14","lifecycle":null,"limits":{"context":32767,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Gemini LearnLM Experimental","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"longcat-2.0":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.015,"input":0.75,"output":3},"deprecated":false,"extra":{"attachment":false,"description":"Meituan LongCat-2.0, a reasoning model with tool calling and a 1M-token context window","family":"longcat","open_weights":false,"structured_output":true,"temperature":true},"family":null,"id":"longcat-2.0","knowledge":null,"last_updated":"2026-06-30","lifecycle":null,"limits":{"context":1048756,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"LongCat 2.0","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-30","retired":false,"tags":null},"longcat-2.0:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.015,"input":0.75,"output":3},"deprecated":false,"extra":{"attachment":false,"description":"Meituan LongCat-2.0, a reasoning model with tool calling and a 1M-token context window","family":"longcat","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"longcat-2.0:thinking","knowledge":null,"last_updated":"2026-06-30","lifecycle":null,"limits":{"context":1048756,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"LongCat 2.0 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-30","retired":false,"tags":null},"meganova-ai/manta-flash-1.0":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.01,"input":0.02,"output":0.16},"deprecated":false,"extra":{"attachment":false,"description":"Efficient model for low-latency assistance, extraction, and routine automation","family":"nova","open_weights":false,"structured_output":false},"family":null,"id":"meganova-ai/manta-flash-1.0","knowledge":null,"last_updated":"2025-12-20","lifecycle":null,"limits":{"context":16384,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Manta Flash 1.0","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-20","retired":false,"tags":null},"meganova-ai/manta-mini-1.0":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.01,"input":0.02,"output":0.16},"deprecated":false,"extra":{"attachment":false,"description":"Efficient model for low-latency assistance, extraction, and routine automation","family":"nova","open_weights":false,"structured_output":false},"family":null,"id":"meganova-ai/manta-mini-1.0","knowledge":null,"last_updated":"2025-12-20","lifecycle":null,"limits":{"context":8192,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Manta Mini 1.0","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-20","retired":false,"tags":null},"meganova-ai/manta-pro-1.0":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.03,"input":0.06,"output":0.5},"deprecated":false,"extra":{"attachment":false,"description":"Flagship model for demanding analysis, coding, and production agent workflows","family":"nova","open_weights":false,"structured_output":false},"family":null,"id":"meganova-ai/manta-pro-1.0","knowledge":null,"last_updated":"2025-12-20","lifecycle":null,"limits":{"context":32768,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Manta Pro 1.0","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-20","retired":false,"tags":null},"mercury-2":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.025,"input":0.25,"output":0.75},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"mercury","open_weights":false,"reasoning_options":[],"structured_output":true},"family":null,"id":"mercury-2","knowledge":null,"last_updated":"2024-01-01","lifecycle":null,"limits":{"context":128000,"output":50000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mercury 2","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"mercury-coder-small":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.125,"input":0.25,"output":1},"deprecated":false,"extra":{"attachment":false,"description":"Model by Inception AI. A diffusion large language model that runs incredibly quickly (500+ tokens/second) while matching Claude 3.5 Haiku and GPT-4o-mini. 1st in speed on Copilot arena, and matching 2nd in quality.","family":"mercury","open_weights":false,"structured_output":false},"family":null,"id":"mercury-coder-small","knowledge":null,"last_updated":"2024-01-01","lifecycle":null,"limits":{"context":32768,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mercury Coder Small","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"meta-llama/llama-3.1-8b-instruct":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.0272,"input":0.0544,"output":0.085},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"meta-llama/llama-3.1-8b-instruct","knowledge":null,"last_updated":"2024-07-23","lifecycle":null,"limits":{"context":131072,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 8b Instruct","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"meta-llama/llama-3.2-3b-instruct":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.0153,"input":0.0306,"output":0.0493},"deprecated":false,"extra":{"attachment":true,"description":"Open Llama multimodal model for image understanding and text reasoning","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"meta-llama/llama-3.2-3b-instruct","knowledge":null,"last_updated":"2024-09-25","lifecycle":null,"limits":{"context":131072,"output":8192},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"Llama 3.2 3b Instruct","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"meta-llama/llama-3.3-70b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.025,"input":0.05,"output":0.23},"deprecated":false,"extra":{"attachment":false,"description":"Popular open Llama workhorse for multilingual chat, coding, and self-hosting","family":"llama","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"meta-llama/llama-3.3-70b-instruct","knowledge":"2023-12","last_updated":"2024-12-06","lifecycle":null,"limits":{"context":131072,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.3 70b Instruct","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-12-06","retired":false,"tags":null},"meta-llama/llama-4-maverick":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.075,"input":0.15,"output":0.6},"deprecated":false,"extra":{"attachment":true,"description":"Open multimodal Llama model for strong reasoning and fast responses","family":"llama","open_weights":true,"structured_output":true},"family":null,"id":"meta-llama/llama-4-maverick","knowledge":null,"last_updated":"2025-09-05","lifecycle":null,"limits":{"context":1048576,"output":65536},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Llama 4 Maverick","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-05","retired":false,"tags":null},"meta-llama/llama-4-scout":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.0425,"input":0.085,"output":0.46},"deprecated":false,"extra":{"attachment":true,"description":"Open multimodal Llama model for long-context analysis and efficient agents","family":"llama","open_weights":true,"structured_output":true},"family":null,"id":"meta-llama/llama-4-scout","knowledge":null,"last_updated":"2025-09-05","lifecycle":null,"limits":{"context":328000,"output":65536},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Llama 4 Scout","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-05","retired":false,"tags":null},"meta/muse-spark-1.1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.15,"input":1.25,"output":4.25},"deprecated":false,"extra":{"attachment":true,"description":"Muse Spark is a natively multimodal reasoning model with support for tool-use, visual chain of thought, and multi-agent orchestration.","family":"muse","open_weights":false,"reasoning_options":[],"structured_output":false,"temperature":true},"family":null,"id":"meta/muse-spark-1.1","knowledge":null,"last_updated":"2026-07-09","lifecycle":null,"limits":{"context":1000000,"output":65536},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Muse Spark 1.1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-08","retired":false,"tags":null},"microsoft/wizardlm-2-8x22b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2465,"input":0.493,"output":0.493},"deprecated":false,"extra":{"attachment":true,"description":"GPT model for general reasoning, writing, coding, and tool-assisted tasks","family":"gpt","open_weights":true,"structured_output":false},"family":null,"id":"microsoft/wizardlm-2-8x22b","knowledge":null,"last_updated":"2025-04-15","lifecycle":null,"limits":{"context":65536,"output":8192},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"WizardLM-2 8x22B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-15","retired":false,"tags":null},"minimax/minimax-01":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.0697,"input":0.1394,"output":1.122},"deprecated":false,"extra":{"attachment":true,"description":"MiniMax multimodal coding model for long-context reasoning and agent tasks","family":"minimax","open_weights":false,"structured_output":false},"family":null,"id":"minimax/minimax-01","knowledge":null,"last_updated":"2025-01-15","lifecycle":null,"limits":{"context":1000192,"output":16384},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"MiniMax 01","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"minimax/minimax-latest":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.06,"input":0.3,"output":1.2},"deprecated":false,"extra":{"attachment":true,"description":"MiniMax multimodal coding model for long-context reasoning and agent tasks","family":"minimax","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true},"family":null,"id":"minimax/minimax-latest","knowledge":null,"last_updated":"2026-05-03","lifecycle":null,"limits":{"context":512000,"output":80000},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"MiniMax Latest","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-03","retired":false,"tags":null},"minimax/minimax-m2-her":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.151,"input":0.302,"output":1.207},"deprecated":false,"extra":{"attachment":false,"description":"MiniMax model for chat, coding, office work, and agentic tasks","family":"minimax","open_weights":false,"structured_output":false},"family":null,"id":"minimax/minimax-m2-her","knowledge":null,"last_updated":"2026-01-24","lifecycle":null,"limits":{"context":65532,"output":2048},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MiniMax M2-her","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-01-12","retired":false,"tags":null},"minimax/minimax-m2.1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.165,"input":0.33,"output":1.32},"deprecated":false,"extra":{"attachment":false,"description":"Earlier MiniMax agent model for practical coding and productivity tasks","family":"minimax","open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"minimax/minimax-m2.1","knowledge":null,"last_updated":"2025-12-23","lifecycle":null,"limits":{"context":200000,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MiniMax M2.1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-23","retired":false,"tags":null},"minimax/minimax-m2.5":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":1.2},"deprecated":false,"extra":{"attachment":false,"description":"Prior MiniMax coding model for agent workflows, office edits, and automation","family":"minimax","open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"minimax/minimax-m2.5","knowledge":null,"last_updated":"2026-02-12","lifecycle":null,"limits":{"context":204800,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MiniMax M2.5","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-12","retired":false,"tags":null},"minimax/minimax-m2.7":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.1575,"input":0.315,"output":1.26},"deprecated":false,"extra":{"attachment":false,"description":"Open MiniMax flagship for coding agents, office automation, and complex environments","family":"minimax","open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"minimax/minimax-m2.7","knowledge":null,"last_updated":"2026-03-18","lifecycle":null,"limits":{"context":204800,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MiniMax M2.7","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-18","retired":false,"tags":null},"minimax/minimax-m2.7-turbo":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.3,"input":0.6,"output":2.4},"deprecated":false,"extra":{"attachment":false,"description":"Efficient MiniMax model for quick assistance, coding, and routine automation","family":"minimax-m2.7","open_weights":true,"reasoning_options":[],"structured_output":true},"family":null,"id":"minimax/minimax-m2.7-turbo","knowledge":null,"last_updated":"2026-03-18","lifecycle":null,"limits":{"context":204800,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MiniMax M2.7 Turbo","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-18","retired":false,"tags":null},"minimax/minimax-m3":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.06,"input":0.3,"output":1.2},"deprecated":false,"extra":{"attachment":true,"description":"MiniMax multimodal model for long-context coding, perception, and agent planning","family":"minimax","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"minimax/minimax-m3","knowledge":null,"last_updated":"2026-06-01","lifecycle":null,"limits":{"context":512000,"output":80000},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"MiniMax M3","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-01","retired":false,"tags":null},"minimax/minimax-m3:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.06,"input":0.3,"output":1.2},"deprecated":false,"extra":{"attachment":true,"description":"MiniMax multimodal model for long-context coding, perception, and agent planning","family":"minimax","open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"minimax/minimax-m3:thinking","knowledge":null,"last_updated":"2026-06-01","lifecycle":null,"limits":{"context":512000,"output":80000},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"MiniMax M3 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-01","retired":false,"tags":null},"mirothinker-1-7-deepresearch":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":2,"input":4,"output":25},"deprecated":false,"extra":{"attachment":false,"description":"Research model for long-horizon investigation, synthesis, and analytical reports","open_weights":false,"reasoning_options":[],"structured_output":false},"family":null,"id":"mirothinker-1-7-deepresearch","knowledge":null,"last_updated":"2026-05-11","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MiroThinker 1.7 Deep Research","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-11","retired":false,"tags":null},"mirothinker-1-7-deepresearch-mini":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.625,"input":1.25,"output":10},"deprecated":false,"extra":{"attachment":false,"description":"Research model for long-horizon investigation, synthesis, and analytical reports","open_weights":false,"reasoning_options":[],"structured_output":false},"family":null,"id":"mirothinker-1-7-deepresearch-mini","knowledge":null,"last_updated":"2026-05-11","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MiroThinker 1.7 Deep Research Mini","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-11","retired":false,"tags":null},"mistral-code-agent-latest":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"input":0.4,"output":2},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"mistral","open_weights":true,"structured_output":true},"family":null,"id":"mistral-code-agent-latest","knowledge":null,"last_updated":"2026-06-02","lifecycle":null,"limits":{"context":262144,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mistral Code Agent Latest","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-02","retired":false,"tags":null},"mistral-code-latest":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":0.9},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"mistral","open_weights":false,"structured_output":true},"family":null,"id":"mistral-code-latest","knowledge":null,"last_updated":"2026-06-02","lifecycle":null,"limits":{"context":256000,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mistral Code Latest","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-02","retired":false,"tags":null},"mistral-small-31-24b-instruct":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.05,"input":0.1,"output":0.3},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"mistral-small","open_weights":true,"structured_output":false},"family":null,"id":"mistral-small-31-24b-instruct","knowledge":null,"last_updated":"2025-04-15","lifecycle":null,"limits":{"context":128000,"output":131072},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Mistral Small 31 24b Instruct","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-15","retired":false,"tags":null},"mistral/mistral-medium-3.5":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.75,"input":1.5,"output":7.5},"deprecated":false,"extra":{"attachment":true,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","family":"mistral-medium","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":true},"family":null,"id":"mistral/mistral-medium-3.5","knowledge":null,"last_updated":"2026-04-29","lifecycle":null,"limits":{"context":256000,"output":32768},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Mistral Medium 3.5","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-29","retired":false,"tags":null},"mistral/mistral-medium-3.5:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.75,"input":1.5,"output":7.5},"deprecated":false,"extra":{"attachment":true,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","family":"mistral-medium","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":true},"family":null,"id":"mistral/mistral-medium-3.5:thinking","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":256000,"output":32768},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Mistral Medium 3.5 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-30","retired":false,"tags":null},"mistralai/Devstral-Small-2505":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.03,"input":0.06,"output":0.06},"deprecated":false,"extra":{"attachment":false,"description":"Mistral coding agent model for repository tasks and software engineering workflows","family":"devstral","open_weights":true,"structured_output":false},"family":null,"id":"mistralai/Devstral-Small-2505","knowledge":null,"last_updated":"2025-08-02","lifecycle":null,"limits":{"context":32768,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mistral Devstral Small 2505","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-02","retired":false,"tags":null},"mistralai/Mistral-Nemo-Instruct-2407":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.05015,"input":0.1003,"output":0.1207},"deprecated":false,"extra":{"attachment":false,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","family":"mistral-nemo","open_weights":true,"structured_output":false},"family":null,"id":"mistralai/Mistral-Nemo-Instruct-2407","knowledge":null,"last_updated":"2024-07-18","lifecycle":null,"limits":{"context":16384,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mistral Nemo","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"mistralai/codestral-2508":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":0.9},"deprecated":false,"extra":{"attachment":false,"description":"Mistral coding model for code completion, generation, and developer workflows","family":"codestral","open_weights":false,"structured_output":false},"family":null,"id":"mistralai/codestral-2508","knowledge":null,"last_updated":"2025-08-01","lifecycle":null,"limits":{"context":256000,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Codestral 2508","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-01","retired":false,"tags":null},"mistralai/devstral-2-123b-instruct-2512":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2,"input":0.4,"output":1.4},"deprecated":false,"extra":{"attachment":false,"description":"Mistral coding agent model for repository tasks and software engineering workflows","family":"devstral","open_weights":true,"structured_output":false},"family":null,"id":"mistralai/devstral-2-123b-instruct-2512","knowledge":null,"last_updated":"2025-12-09","lifecycle":null,"limits":{"context":262144,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Devstral 2 123B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-09","retired":false,"tags":null},"mistralai/ministral-14b-2512":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1,"input":0.2,"output":0.2},"deprecated":false,"extra":{"attachment":false,"description":"Compact Mistral model for edge, latency-sensitive, and cost-efficient workloads","family":"ministral","open_weights":true,"structured_output":false},"family":null,"id":"mistralai/ministral-14b-2512","knowledge":null,"last_updated":"2025-12-04","lifecycle":null,"limits":{"context":262144,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Ministral 14B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-04","retired":false,"tags":null},"mistralai/ministral-14b-instruct-2512":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.05,"input":0.1,"output":0.4},"deprecated":false,"extra":{"attachment":true,"description":"Compact Mistral model for edge, latency-sensitive, and cost-efficient workloads","family":"ministral","open_weights":true,"structured_output":false},"family":null,"id":"mistralai/ministral-14b-instruct-2512","knowledge":null,"last_updated":"2025-12-02","lifecycle":null,"limits":{"context":262144,"output":32768},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Ministral 3 14B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-02","retired":false,"tags":null},"mistralai/ministral-3b-2512":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.05,"input":0.1,"output":0.1},"deprecated":false,"extra":{"attachment":false,"description":"Compact Mistral model for edge, latency-sensitive, and cost-efficient workloads","family":"ministral","open_weights":true,"structured_output":false},"family":null,"id":"mistralai/ministral-3b-2512","knowledge":null,"last_updated":"2025-12-04","lifecycle":null,"limits":{"context":131072,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Ministral 3B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-04","retired":false,"tags":null},"mistralai/ministral-8b-2512":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.075,"input":0.15,"output":0.15},"deprecated":false,"extra":{"attachment":false,"description":"Compact Mistral model for edge, latency-sensitive, and cost-efficient workloads","family":"ministral","open_weights":true,"structured_output":false},"family":null,"id":"mistralai/ministral-8b-2512","knowledge":null,"last_updated":"2025-12-04","lifecycle":null,"limits":{"context":262144,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Ministral 8B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-04","retired":false,"tags":null},"mistralai/mistral-large":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2,"input":2.006,"output":6.001},"deprecated":false,"extra":{"attachment":false,"description":"Flagship Mistral model for advanced reasoning, coding, and multilingual work","family":"mistral-large","open_weights":false,"structured_output":false},"family":null,"id":"mistralai/mistral-large","knowledge":null,"last_updated":"2024-02-26","lifecycle":null,"limits":{"context":128000,"output":256000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mistral Large 2411","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"mistralai/mistral-large-3-675b-instruct-2512":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.5,"input":1,"output":3},"deprecated":false,"extra":{"attachment":true,"description":"Flagship Mistral model for advanced reasoning, coding, and multilingual work","family":"mistral-large","open_weights":true,"structured_output":false},"family":null,"id":"mistralai/mistral-large-3-675b-instruct-2512","knowledge":null,"last_updated":"2025-12-02","lifecycle":null,"limits":{"context":262144,"output":256000},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Mistral Large 3 675B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-25","retired":false,"tags":null},"mistralai/mistral-medium-3":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2,"input":0.4,"output":2},"deprecated":false,"extra":{"attachment":true,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","family":"mistral-medium","open_weights":false,"structured_output":false},"family":null,"id":"mistralai/mistral-medium-3","knowledge":null,"last_updated":"2025-09-25","lifecycle":null,"limits":{"context":131072,"output":32768},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Mistral Medium 3","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-25","retired":false,"tags":null},"mistralai/mistral-medium-3.1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2,"input":0.4,"output":2},"deprecated":false,"extra":{"attachment":false,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","family":"mistral-medium","open_weights":false,"structured_output":false},"family":null,"id":"mistralai/mistral-medium-3.1","knowledge":null,"last_updated":"2025-09-05","lifecycle":null,"limits":{"context":131072,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mistral Medium 3.1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-05","retired":false,"tags":null},"mistralai/mistral-saba":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.09945,"input":0.1989,"output":0.595},"deprecated":false,"extra":{"attachment":false,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","family":"mistral","open_weights":true,"structured_output":false},"family":null,"id":"mistralai/mistral-saba","knowledge":null,"last_updated":"2025-02-17","lifecycle":null,"limits":{"context":32000,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mistral Saba","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"mistralai/mistral-small-4-119b-2603":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"input":0.4,"output":1.4},"deprecated":false,"extra":{"attachment":true,"description":"Efficient Mistral model for fast chat, extraction, and production assistants","family":"mistral-small","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true},"family":null,"id":"mistralai/mistral-small-4-119b-2603","knowledge":null,"last_updated":"2026-03-16","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Mistral Small 4 119B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-16","retired":false,"tags":null},"mistralai/mistral-small-4-119b-2603:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"input":0.4,"output":1.4},"deprecated":false,"extra":{"attachment":true,"description":"Efficient Mistral model for fast chat, extraction, and production assistants","family":"mistral-small","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":true},"family":null,"id":"mistralai/mistral-small-4-119b-2603:thinking","knowledge":null,"last_updated":"2026-03-17","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Mistral Small 4 119B Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-17","retired":false,"tags":null},"mistralai/mixtral-8x22b-instruct-v0.1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2,"input":2,"output":6},"deprecated":false,"extra":{"attachment":false,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","family":"mixtral","open_weights":true,"structured_output":false},"family":null,"id":"mistralai/mixtral-8x22b-instruct-v0.1","knowledge":null,"last_updated":"2025-12-11","lifecycle":null,"limits":{"context":65536,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mixtral 8x22B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-11","retired":false,"tags":null},"mlabonne/NeuralDaredevil-8B-abliterated":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.22,"input":0.44,"output":0.44},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","llmfit":{"architecture":"llama","context_length":8192,"discovered":true,"gguf_sources":[],"hf_downloads":17547,"hf_likes":0,"matched_hugging_face_id":"mlabonne/NeuralDaredevil-8B-abliterated","memory":{"min_ram_gb":4.5,"min_vram_gb":4.1,"recommended_ram_gb":7.5},"model_id":"mlabonne/NeuralDaredevil-8B-abliterated","parameter_count":"8.0B","parameters_raw":8030261248,"pipeline_tag":"text-generation","provider":"mlabonne","quantization":"Q4_K_M","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"structured_output":false},"family":null,"id":"mlabonne/NeuralDaredevil-8B-abliterated","knowledge":null,"last_updated":"2024-12-01","lifecycle":null,"limits":{"context":8192,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Neural Daredevil 8B abliterated","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"moonshotai/Kimi-K2-Instruct-0905":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"input":0.4,"output":1.8},"deprecated":false,"extra":{"attachment":false,"description":"Kimi model for long-context chat, coding, and agentic reasoning","family":"kimi-k2","llmfit":{"architecture":"kimi_k2","context_length":16777216,"discovered":true,"gguf_sources":[],"hf_downloads":66851,"hf_likes":787,"matched_hugging_face_id":"moonshotai/Kimi-K2-Instruct-0905","memory":{"min_ram_gb":573.6,"min_vram_gb":525.8,"recommended_ram_gb":956.0},"model_id":"moonshotai/Kimi-K2-Instruct-0905","moe":{"active_experts":8,"active_parameters":71639103404,"is_moe":true,"num_experts":384},"parameter_count":"1026.5B","parameters_raw":1026470735448,"pipeline_tag":"text-generation","provider":"moonshotai","quantization":"Q4_K_M","release_date":"2025-09-03","source":"llmfit","use_case":"Instruction following, chat"},"open_weights":true,"structured_output":true},"family":null,"id":"moonshotai/Kimi-K2-Instruct-0905","knowledge":null,"last_updated":"2025-09-25","lifecycle":null,"limits":{"context":256000,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Kimi K2 0905","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-25","retired":false,"tags":null},"moonshotai/kimi-k2-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"input":0.4,"output":1.8},"deprecated":false,"extra":{"attachment":false,"description":"Kimi model for long-context chat, coding, and agentic reasoning","family":"kimi-k2","open_weights":true,"structured_output":true},"family":null,"id":"moonshotai/kimi-k2-instruct","knowledge":null,"last_updated":"2025-07-01","lifecycle":null,"limits":{"context":256000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Kimi K2 Instruct","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"moonshotai/kimi-k2-instruct-0711":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"input":0.4,"output":1.8},"deprecated":false,"extra":{"attachment":false,"description":"Kimi model for long-context chat, coding, and agentic reasoning","family":"kimi-k2","open_weights":true,"structured_output":true},"family":null,"id":"moonshotai/kimi-k2-instruct-0711","knowledge":null,"last_updated":"2025-07-11","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Kimi K2 0711","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"moonshotai/kimi-k2-thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":0.6,"output":2.5},"deprecated":false,"extra":{"attachment":false,"description":"Thinking Kimi model for slower research passes, planning, and hard technical questions","family":"kimi-thinking","open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"moonshotai/kimi-k2-thinking","knowledge":"2024-08","last_updated":"2025-11-06","lifecycle":null,"limits":{"context":262144,"output":98304},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Kimi K2 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-11-06","retired":false,"tags":null},"moonshotai/kimi-k2.5":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":1.9},"deprecated":false,"extra":{"attachment":true,"description":"Earlier Kimi frontier model for long-context agents, coding, and multimodal work","family":"kimi-k2","open_weights":true,"structured_output":false,"temperature":false},"family":null,"id":"moonshotai/kimi-k2.5","knowledge":"2025-01","last_updated":"2026-01","lifecycle":null,"limits":{"context":256000,"output":65536},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Kimi K2.5","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-01","retired":false,"tags":null},"moonshotai/kimi-k2.5:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":1.9},"deprecated":false,"extra":{"attachment":true,"description":"Earlier Kimi frontier model for long-context agents, coding, and multimodal work","family":"kimi-k2","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":false},"family":null,"id":"moonshotai/kimi-k2.5:thinking","knowledge":"2025-01","last_updated":"2026-01","lifecycle":null,"limits":{"context":256000,"output":65536},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Kimi K2.5 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-01","retired":false,"tags":null},"moonshotai/kimi-k2.6":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.125,"input":0.5,"output":2.6},"deprecated":false,"extra":{"attachment":true,"description":"Multimodal Kimi workhorse for agent loops, coding tasks, and visual context","family":"kimi-k2","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"moonshotai/kimi-k2.6","knowledge":"2025-01","last_updated":"2026-04-21","lifecycle":null,"limits":{"context":256000,"output":65536},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Kimi K2.6","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-21","retired":false,"tags":null},"moonshotai/kimi-k2.6:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.125,"input":0.5,"output":2.6},"deprecated":false,"extra":{"attachment":true,"description":"Multimodal Kimi workhorse for agent loops, coding tasks, and visual context","family":"kimi-k2","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":true},"family":null,"id":"moonshotai/kimi-k2.6:thinking","knowledge":"2025-01","last_updated":"2026-04-21","lifecycle":null,"limits":{"context":256000,"output":65536},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Kimi K2.6 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-21","retired":false,"tags":null},"moonshotai/kimi-k2.7-code":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.19,"input":0.95,"output":4},"deprecated":false,"extra":{"attachment":true,"description":"Coding-focused Kimi model, stronger on long-horizon repo work with less overthinking","family":"kimi-k2","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":false},"family":null,"id":"moonshotai/kimi-k2.7-code","knowledge":"2025-01","last_updated":"2026-06-12","lifecycle":null,"limits":{"context":262144,"output":65536},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Kimi K2.7 Code","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-12","retired":false,"tags":null},"moonshotai/kimi-k2.7-code-highspeed":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.32,"input":1.9,"output":8},"deprecated":false,"extra":{"attachment":true,"description":"Lower-latency Kimi Code variant for interactive edits and coding-agent loops","family":"kimi-k2","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":false},"family":null,"id":"moonshotai/kimi-k2.7-code-highspeed","knowledge":"2025-01","last_updated":"2026-06-12","lifecycle":null,"limits":{"context":262144,"output":65536},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Kimi K2.7 Code High-Speed","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-12","retired":false,"tags":null},"moonshotai/kimi-k3":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.25,"input":2.5,"output":13.5},"deprecated":false,"extra":{"attachment":true,"description":"Multimodal Kimi model with 1M context and toggleable max-effort thinking for long-horizon agent work","family":"kimi-k3","open_weights":true,"reasoning_options":[{"type":"effort","values":["low","high","max"]}],"structured_output":true,"temperature":false},"family":null,"id":"moonshotai/kimi-k3","knowledge":null,"last_updated":"2026-07-16","lifecycle":null,"limits":{"context":1048576,"output":1048576},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Kimi K3","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-16","retired":false,"tags":null},"moonshotai/kimi-latest":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.25,"input":2.5,"output":13.5},"deprecated":false,"extra":{"attachment":true,"description":"Kimi multimodal agent model for visual understanding, coding, and planning","family":"kimi","open_weights":true,"reasoning_options":[{"type":"effort","values":["low","high","max"]}],"structured_output":true},"family":null,"id":"moonshotai/kimi-latest","knowledge":null,"last_updated":"2026-05-03","lifecycle":null,"limits":{"context":1048576,"output":1048576},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Kimi Latest","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-03","retired":false,"tags":null},"nano-gpt-help":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Text-only NanoGPT support assistant. Questions are processed by the Help inference provider; do not paste secrets or account credentials. Covers the website, models, API, pricing, memory, media generation, and support.","family":"gpt","open_weights":false,"structured_output":false},"family":null,"id":"nano-gpt-help","knowledge":null,"last_updated":"2026-06-06","lifecycle":null,"limits":{"context":6000,"output":512},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"NanoGPT Help","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-06","retired":false,"tags":null},"nanogpt/coding-router":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.11,"input":1.1,"output":2.2},"deprecated":false,"extra":{"attachment":false,"description":"Automatic model router for matching prompts to suitable backends and budgets","open_weights":false,"reasoning_options":[],"structured_output":true},"family":null,"id":"nanogpt/coding-router","knowledge":null,"last_updated":"2026-05-12","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Coding Router","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-12","retired":false,"tags":null},"nanogpt/coding-router:high":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.11,"input":1.1,"output":2.2},"deprecated":false,"extra":{"attachment":false,"description":"Automatic model router for matching prompts to suitable backends and budgets","open_weights":false,"reasoning_options":[],"structured_output":true},"family":null,"id":"nanogpt/coding-router:high","knowledge":null,"last_updated":"2026-05-12","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Coding Router High","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-12","retired":false,"tags":null},"nanogpt/coding-router:low":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.028,"input":0.14,"output":0.28},"deprecated":false,"extra":{"attachment":false,"description":"Automatic model router for matching prompts to suitable backends and budgets","open_weights":false,"reasoning_options":[],"structured_output":true},"family":null,"id":"nanogpt/coding-router:low","knowledge":null,"last_updated":"2026-05-12","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Coding Router Low","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-12","retired":false,"tags":null},"nanogpt/coding-router:max":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"input":5,"output":30},"deprecated":false,"extra":{"attachment":false,"description":"Automatic model router for matching prompts to suitable backends and budgets","open_weights":false,"reasoning_options":[],"structured_output":true},"family":null,"id":"nanogpt/coding-router:max","knowledge":null,"last_updated":"2026-05-12","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Coding Router Max","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-12","retired":false,"tags":null},"nanogpt/coding-router:medium":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.028,"input":0.14,"output":0.28},"deprecated":false,"extra":{"attachment":false,"description":"Automatic model router for matching prompts to suitable backends and budgets","open_weights":false,"reasoning_options":[],"structured_output":true},"family":null,"id":"nanogpt/coding-router:medium","knowledge":null,"last_updated":"2026-05-12","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Coding Router Medium","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-12","retired":false,"tags":null},"nex-agi/nex-n2-mini":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.0025,"input":0.025,"output":0.1},"deprecated":false,"extra":{"attachment":true,"description":"Nex AGI's open-source agentic mixture-of-experts model in the Nex N2 family. It accepts text and image input and is built for coding, tool use, structured outputs, and optional reasoning with a 256K context window.","family":"agi","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","minimal","low","medium","high","xhigh"]}],"structured_output":true},"family":null,"id":"nex-agi/nex-n2-mini","knowledge":null,"last_updated":"2026-06-24","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Nex N2 Mini","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-24","retired":false,"tags":null},"nex-agi/nex-n2-pro":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.25,"input":0.5,"output":2.5},"deprecated":false,"extra":{"attachment":true,"description":"Nex AGI's open-source agentic reasoning model, post-trained on Qwen3.5-397B-A17B. It is built for agentic coding, software engineering, deep research, tool use, and long-horizon tasks with a 256K context window.","family":"agi","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","minimal","low","medium","high","xhigh"]}],"structured_output":true},"family":null,"id":"nex-agi/nex-n2-pro","knowledge":null,"last_updated":"2026-06-04","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Nex N2 Pro","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-04","retired":false,"tags":null},"nothingiisreal/L3.1-70B-Celeste-V0.1-BF16":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2465,"input":0.493,"output":0.493},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"nothingiisreal/L3.1-70B-Celeste-V0.1-BF16","knowledge":null,"last_updated":"2024-07-23","lifecycle":null,"limits":{"context":16384,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 70B Celeste v0.1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"nvidia/Llama-3.1-Nemotron-70B-Instruct-HF":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1785,"input":0.357,"output":0.408},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","family":"nemotron","llmfit":{"architecture":"llama","context_length":1048576,"discovered":true,"gguf_sources":[{"provider":"bartowski","repo":"bartowski/Llama-3.1-Nemotron-70B-Instruct-HF-GGUF"},{"provider":"mradermacher","repo":"mradermacher/Llama-3.1-Nemotron-70B-Instruct-HF-GGUF"}],"hf_downloads":28376,"hf_likes":2071,"matched_hugging_face_id":"nvidia/Llama-3.1-Nemotron-70B-Instruct-HF","memory":{"min_ram_gb":39.4,"min_vram_gb":36.1,"recommended_ram_gb":65.7},"model_id":"nvidia/Llama-3.1-Nemotron-70B-Instruct-HF","parameter_count":"70.6B","parameters_raw":70553706496,"pipeline_tag":"text-generation","provider":"nvidia","quantization":"Q4_K_M","release_date":"2024-10-12","source":"llmfit","use_case":"Instruction following, chat"},"open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"nvidia/Llama-3.1-Nemotron-70B-Instruct-HF","knowledge":null,"last_updated":"2025-04-15","lifecycle":null,"limits":{"context":16384,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Nvidia Nemotron 70b","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-15","retired":false,"tags":null},"nvidia/Llama-3.3-Nemotron-Super-49B-v1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.075,"input":0.15,"output":0.15},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","family":"nemotron","llmfit":{"architecture":"nemotron-nas","context_length":1048576,"discovered":false,"gguf_sources":[],"hf_downloads":182671,"hf_likes":325,"matched_hugging_face_id":"nvidia/Llama-3.3-Nemotron-Super-49B-v1","memory":{"min_ram_gb":27.9,"min_vram_gb":25.5,"recommended_ram_gb":46.4},"model_id":"nvidia/Llama-3.3-Nemotron-Super-49B-v1","parameter_count":"49.9B","parameters_raw":49867145216,"pipeline_tag":"text-generation","provider":"nvidia","quantization":"Q4_K_M","release_date":"2025-03-16","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"nvidia/Llama-3.3-Nemotron-Super-49B-v1","knowledge":null,"last_updated":"2025-08-08","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Nvidia Nemotron Super 49B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-08","retired":false,"tags":null},"nvidia/nemotron-3-nano-30b-a3b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.085,"input":0.17,"output":0.68},"deprecated":false,"extra":{"attachment":false,"description":"Small Nemotron 3 MoE for efficient coding, math, and long-context agents","family":"nemotron","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"nvidia/nemotron-3-nano-30b-a3b","knowledge":null,"last_updated":"2025-12-15","lifecycle":null,"limits":{"context":256000,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Nvidia Nemotron 3 Nano 30B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-15","retired":false,"tags":null},"nvidia/nemotron-3-nano-omni-30b-a3b-reasoning":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.0525,"input":0.105,"output":0.42},"deprecated":false,"extra":{"attachment":true,"description":"Open Nemotron omni model combining reasoning with text, vision, and audio","family":"nemotron","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":true},"family":null,"id":"nvidia/nemotron-3-nano-omni-30b-a3b-reasoning","knowledge":null,"last_updated":"2026-04-28","lifecycle":null,"limits":{"context":256000,"output":65536},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Nvidia Nemotron 3 Nano Omni","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-28","retired":false,"tags":null},"nvidia/nemotron-3-super-120b-a12b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.025,"input":0.05,"output":0.25},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron middle tier for collaborative agents and high-volume reasoning workloads","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":false,"temperature":true},"family":null,"id":"nvidia/nemotron-3-super-120b-a12b","knowledge":null,"last_updated":"2026-03-01","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Nvidia Nemotron 3 Super 120B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-01","retired":false,"tags":null},"nvidia/nemotron-3-super-120b-a12b:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.025,"input":0.05,"output":0.25},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron middle tier for collaborative agents and high-volume reasoning workloads","family":"nemotron","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":true},"family":null,"id":"nvidia/nemotron-3-super-120b-a12b:thinking","knowledge":null,"last_updated":"2026-03-01","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Nvidia Nemotron 3 Super 120B Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-01","retired":false,"tags":null},"nvidia/nemotron-3-ultra-550b-a55b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.25,"input":0.5,"output":2.5},"deprecated":false,"extra":{"attachment":false,"description":"Largest Nemotron 3 model for maximum open-weight reasoning and agent accuracy","family":"nemotron","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":true},"family":null,"id":"nvidia/nemotron-3-ultra-550b-a55b","knowledge":null,"last_updated":"2026-06-04","lifecycle":null,"limits":{"context":1000000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Nvidia Nemotron 3 Ultra 550B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-04","retired":false,"tags":null},"nvidia/nemotron-3-ultra-550b-a55b:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.25,"input":0.5,"output":2.5},"deprecated":false,"extra":{"attachment":false,"description":"Largest Nemotron 3 model for maximum open-weight reasoning and agent accuracy","family":"nemotron","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":true},"family":null,"id":"nvidia/nemotron-3-ultra-550b-a55b:thinking","knowledge":null,"last_updated":"2026-06-04","lifecycle":null,"limits":{"context":1000000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Nvidia Nemotron 3 Ultra 550B Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-04","retired":false,"tags":null},"openai/gpt-3.5-turbo":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0.5,"output":1.5},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gpt","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"openai/gpt-3.5-turbo","knowledge":"2021-09-01","last_updated":"2023-11-06","lifecycle":null,"limits":{"context":16385,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GPT-3.5 Turbo","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2023-03-01","retired":false,"tags":null},"openai/gpt-4-turbo":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":10,"output":30},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gpt","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"openai/gpt-4-turbo","knowledge":"2023-12","last_updated":"2024-04-09","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GPT-4 Turbo","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2023-11-06","retired":false,"tags":null},"openai/gpt-4-turbo-preview":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":10,"output":30},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gpt","open_weights":false,"structured_output":false},"family":null,"id":"openai/gpt-4-turbo-preview","knowledge":null,"last_updated":"2024-01-01","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GPT-4 Turbo Preview","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"openai/gpt-4.1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"input":2,"output":8},"deprecated":false,"extra":{"attachment":true,"description":"Long-lived GPT workhorse for coding, instruction following, and production apps","family":"gpt","open_weights":false,"structured_output":true,"temperature":true},"family":null,"id":"openai/gpt-4.1","knowledge":"2024-04","last_updated":"2025-04-14","lifecycle":null,"limits":{"context":1047576,"output":32768},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT 4.1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-14","retired":false,"tags":null},"openai/gpt-4.1-mini":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1,"input":0.4,"output":1.6},"deprecated":false,"extra":{"attachment":true,"description":"Affordable GPT-4.1 lane for fast coding help and structured extraction","family":"gpt-mini","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"openai/gpt-4.1-mini","knowledge":"2024-04","last_updated":"2025-04-14","lifecycle":null,"limits":{"context":1047576,"output":32768},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GPT 4.1 Mini","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-14","retired":false,"tags":null},"openai/gpt-4.1-nano":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.025,"input":0.1,"output":0.4},"deprecated":false,"extra":{"attachment":true,"description":"Tiny GPT-4.1 option for classification, routing, and very high-volume tasks","family":"gpt-nano","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"openai/gpt-4.1-nano","knowledge":"2024-04","last_updated":"2025-04-14","lifecycle":null,"limits":{"context":1047576,"output":32768},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT 4.1 Nano","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-14","retired":false,"tags":null},"openai/gpt-4o":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.25,"input":2.5,"output":10},"deprecated":false,"extra":{"attachment":true,"description":"Omni-era GPT for multimodal chat, practical coding, and general assistants","family":"gpt","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"openai/gpt-4o","knowledge":"2023-09","last_updated":"2024-08-06","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GPT-4o","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-05-13","retired":false,"tags":null},"openai/gpt-4o-2024-08-06":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.25,"input":2.5,"output":10},"deprecated":false,"extra":{"attachment":true,"description":"GPT model for general reasoning, writing, coding, and tool-assisted tasks","family":"gpt","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"openai/gpt-4o-2024-08-06","knowledge":"2023-09","last_updated":"2024-08-06","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GPT-4o (2024-08-06)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-08-06","retired":false,"tags":null},"openai/gpt-4o-2024-11-20":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.25,"input":2.5,"output":10},"deprecated":false,"extra":{"attachment":true,"description":"GPT model for general reasoning, writing, coding, and tool-assisted tasks","family":"gpt","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"openai/gpt-4o-2024-11-20","knowledge":"2023-09","last_updated":"2024-11-20","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GPT-4o (2024-11-20)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-11-20","retired":false,"tags":null},"openai/gpt-4o-mini":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.075,"input":0.15,"output":0.6},"deprecated":false,"extra":{"attachment":true,"description":"Small omni GPT for cheap multimodal assistance and production-scale traffic","family":"gpt-mini","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"openai/gpt-4o-mini","knowledge":"2023-09","last_updated":"2024-07-18","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GPT-4o mini","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-07-18","retired":false,"tags":null},"openai/gpt-4o-mini-search-preview":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.075,"input":0.15,"output":0.6},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"gpt-mini","open_weights":false,"structured_output":false},"family":null,"id":"openai/gpt-4o-mini-search-preview","knowledge":null,"last_updated":"2024-07-18","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GPT-4o mini Search Preview","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-10","retired":false,"tags":null},"openai/gpt-4o-search-preview":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.25,"input":2.5,"output":10},"deprecated":false,"extra":{"attachment":true,"description":"GPT model for general reasoning, writing, coding, and tool-assisted tasks","family":"gpt","open_weights":false,"structured_output":false},"family":null,"id":"openai/gpt-4o-search-preview","knowledge":null,"last_updated":"2024-05-13","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GPT-4o Search Preview","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-10","retired":false,"tags":null},"openai/gpt-5":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.125,"input":1.25,"output":10},"deprecated":false,"extra":{"attachment":true,"description":"Original GPT-5 workhorse for reasoning, coding, writing, and tool workflows","family":"gpt","open_weights":false,"reasoning_options":[{"type":"effort","values":["minimal","low","medium","high"]}],"structured_output":true,"temperature":false},"family":null,"id":"openai/gpt-5","knowledge":"2024-09-30","last_updated":"2025-08-07","lifecycle":null,"limits":{"context":400000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT 5","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-07","retired":false,"tags":null},"openai/gpt-5-codex":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.125,"input":1.25,"output":10},"deprecated":false,"extra":{"attachment":false,"description":"Coding-optimized GPT model for repository edits, reviews, and agentic software work","family":"gpt-codex","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":false},"family":null,"id":"openai/gpt-5-codex","knowledge":"2024-09-30","last_updated":"2025-09-15","lifecycle":null,"limits":{"context":256000,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GPT-5 Codex","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-15","retired":false,"tags":null},"openai/gpt-5-mini":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.025,"input":0.25,"output":2},"deprecated":false,"extra":{"attachment":true,"description":"Small GPT-5 for responsive agents, coding help, and everyday automation","family":"gpt-mini","open_weights":false,"reasoning_options":[{"type":"effort","values":["minimal","low","medium","high"]}],"structured_output":false,"temperature":false},"family":null,"id":"openai/gpt-5-mini","knowledge":"2024-05-30","last_updated":"2025-08-07","lifecycle":null,"limits":{"context":400000,"output":128000},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GPT 5 Mini","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-07","retired":false,"tags":null},"openai/gpt-5-nano":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.005,"input":0.05,"output":0.4},"deprecated":false,"extra":{"attachment":true,"description":"Tiny GPT-5 lane for routing, extraction, classification, and bulk jobs","family":"gpt-nano","open_weights":false,"reasoning_options":[{"type":"effort","values":["minimal","low","medium","high"]}],"structured_output":false,"temperature":false},"family":null,"id":"openai/gpt-5-nano","knowledge":"2024-05-30","last_updated":"2025-08-07","lifecycle":null,"limits":{"context":400000,"output":128000},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GPT 5 Nano","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-07","retired":false,"tags":null},"openai/gpt-5-pro":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":1.5,"input":15,"output":120},"deprecated":false,"extra":{"attachment":true,"description":"Higher-accuracy GPT-5 tier for tough analysis, coding reviews, and planning","family":"gpt-pro","open_weights":false,"reasoning_options":[{"type":"effort","values":["high"]}],"structured_output":false,"temperature":false},"family":null,"id":"openai/gpt-5-pro","knowledge":"2024-09-30","last_updated":"2025-10-06","lifecycle":null,"limits":{"context":400000,"output":128000},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GPT 5 Pro","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-10-06","retired":false,"tags":null},"openai/gpt-5.1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.125,"input":1.25,"output":10},"deprecated":false,"extra":{"attachment":true,"description":"Sharper GPT-5 generation for coding, product work, and tool-assisted tasks","family":"gpt","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","low","medium","high"]}],"structured_output":true,"temperature":false},"family":null,"id":"openai/gpt-5.1","knowledge":"2024-09-30","last_updated":"2025-11-13","lifecycle":null,"limits":{"context":400000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT 5.1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-11-13","retired":false,"tags":null},"openai/gpt-5.1-2025-11-13":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.125,"input":1.25,"output":10},"deprecated":false,"extra":{"attachment":false,"description":"GPT model for general reasoning, writing, coding, and tool-assisted tasks","family":"gpt","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","low","medium","high"]}],"structured_output":true},"family":null,"id":"openai/gpt-5.1-2025-11-13","knowledge":null,"last_updated":"2025-11-13","lifecycle":null,"limits":{"context":1000000,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GPT-5.1 (2025-11-13)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"openai/gpt-5.1-codex":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.125,"input":1.25,"output":10},"deprecated":false,"extra":{"attachment":true,"description":"Codex GPT for repository edits, code review, and practical software agents","family":"gpt-codex","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false,"temperature":false},"family":null,"id":"openai/gpt-5.1-codex","knowledge":"2024-09-30","last_updated":"2025-11-13","lifecycle":null,"limits":{"context":400000,"output":128000},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GPT 5.1 Codex","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-11-13","retired":false,"tags":null},"openai/gpt-5.1-codex-max":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.25,"input":2.5,"output":20},"deprecated":false,"extra":{"attachment":true,"description":"Coding-optimized GPT model for repository edits, reviews, and agentic software work","family":"gpt-codex","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","minimal","low","medium","high","xhigh"]}],"structured_output":true,"temperature":false},"family":null,"id":"openai/gpt-5.1-codex-max","knowledge":"2024-09-30","last_updated":"2025-11-13","lifecycle":null,"limits":{"context":400000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT 5.1 Codex Max","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-11-13","retired":false,"tags":null},"openai/gpt-5.1-codex-mini":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.025,"input":0.25,"output":2},"deprecated":false,"extra":{"attachment":true,"description":"Coding-optimized GPT model for repository edits, reviews, and agentic software work","family":"gpt-codex","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false,"temperature":false},"family":null,"id":"openai/gpt-5.1-codex-mini","knowledge":"2024-09-30","last_updated":"2025-11-13","lifecycle":null,"limits":{"context":400000,"output":128000},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GPT 5.1 Codex Mini","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-11-13","retired":false,"tags":null},"openai/gpt-5.2":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.175,"input":1.75,"output":14},"deprecated":false,"extra":{"attachment":true,"description":"Reliable GPT generation for broad coding, writing, and tool-assisted product work","family":"gpt","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","low","medium","high","xhigh"]}],"structured_output":true,"temperature":false},"family":null,"id":"openai/gpt-5.2","knowledge":"2025-08-31","last_updated":"2025-12-11","lifecycle":null,"limits":{"context":400000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT 5.2","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-11","retired":false,"tags":null},"openai/gpt-5.2-codex":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.175,"input":1.75,"output":14},"deprecated":false,"extra":{"attachment":true,"description":"Code-specialist GPT for repository edits, reviews, and long-running software agents","family":"gpt-codex","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh"]}],"structured_output":true,"temperature":false},"family":null,"id":"openai/gpt-5.2-codex","knowledge":"2025-08-31","last_updated":"2025-12-11","lifecycle":null,"limits":{"context":400000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT 5.2 Codex","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-11","retired":false,"tags":null},"openai/gpt-5.3-codex":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.175,"input":1.75,"output":14},"deprecated":false,"extra":{"attachment":true,"description":"Coding-optimized GPT model for repository edits, reviews, and agentic software work","family":"gpt-codex","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh"]}],"structured_output":true,"temperature":false},"family":null,"id":"openai/gpt-5.3-codex","knowledge":"2025-08-31","last_updated":"2026-02-05","lifecycle":null,"limits":{"context":400000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT 5.3 Codex","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-05","retired":false,"tags":null},"openai/gpt-5.4":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.25,"input":2.5,"output":15},"deprecated":false,"extra":{"attachment":true,"description":"Agent-ready GPT for coding and computer-use workflows at a lower cost","family":"gpt","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","low","medium","high","xhigh"]}],"structured_output":true,"temperature":false},"family":null,"id":"openai/gpt-5.4","knowledge":"2025-08-31","last_updated":"2026-03-05","lifecycle":null,"limits":{"context":922000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT 5.4","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-05","retired":false,"tags":null},"openai/gpt-5.4-mini":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.075,"input":0.75,"output":4.5},"deprecated":false,"extra":{"attachment":true,"description":"Strong small GPT for coding subagents, quick tool use, and high-volume work","family":"gpt-mini","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","low","medium","high","xhigh"]}],"structured_output":true,"temperature":false},"family":null,"id":"openai/gpt-5.4-mini","knowledge":"2025-08-31","last_updated":"2026-03-17","lifecycle":null,"limits":{"context":400000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT 5.4 Mini","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-17","retired":false,"tags":null},"openai/gpt-5.4-nano":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.02,"input":0.2,"output":1.25},"deprecated":false,"extra":{"attachment":true,"description":"Cheapest GPT-5.4 lane for simple routing, extraction, and bulk automation","family":"gpt-nano","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","low","medium","high","xhigh"]}],"structured_output":true,"temperature":false},"family":null,"id":"openai/gpt-5.4-nano","knowledge":"2025-08-31","last_updated":"2026-03-17","lifecycle":null,"limits":{"context":400000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT 5.4 Nano","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-17","retired":false,"tags":null},"openai/gpt-5.5":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"input":5,"output":30},"deprecated":false,"extra":{"attachment":true,"description":"Default frontier GPT for coding, computer use, research, and knowledge work","family":"gpt","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","low","medium","high","xhigh"]}],"structured_output":true,"temperature":false},"family":null,"id":"openai/gpt-5.5","knowledge":"2025-12-01","last_updated":"2026-04-23","lifecycle":null,"limits":{"context":1000000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT 5.5","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-23","retired":false,"tags":null},"openai/gpt-5.6-luna":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.01,"cache_write":0.125,"input":0.1,"output":0.6},"deprecated":false,"extra":{"attachment":true,"description":"Cost-efficient GPT-5.6 model for fast, high-volume workloads","family":"gpt-luna","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":false},"family":null,"id":"openai/gpt-5.6-luna","knowledge":"2026-02-16","last_updated":"2026-07-09","lifecycle":null,"limits":{"context":1050000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT 5.6 Luna","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-09","retired":false,"tags":null},"openai/gpt-5.6-luna-pro":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.01,"cache_write":0.125,"input":0.1,"output":0.6},"deprecated":false,"extra":{"attachment":true,"description":"Cost-efficient GPT-5.6 model for fast, high-volume workloads","family":"gpt-luna","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":false},"family":null,"id":"openai/gpt-5.6-luna-pro","knowledge":"2026-02-16","last_updated":"2026-07-09","lifecycle":null,"limits":{"context":1050000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT 5.6 Luna Pro","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-09","retired":false,"tags":null},"openai/gpt-5.6-sol":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"cache_write":6.25,"input":5,"output":30},"deprecated":false,"extra":{"attachment":true,"description":"Frontier GPT-5.6 model for complex professional work, coding, and agentic workflows","family":"gpt-sol","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":false},"family":null,"id":"openai/gpt-5.6-sol","knowledge":"2026-02-16","last_updated":"2026-07-09","lifecycle":null,"limits":{"context":1050000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT 5.6 Sol","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-09","retired":false,"tags":null},"openai/gpt-5.6-sol-pro":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"cache_write":6.25,"input":5,"output":30},"deprecated":false,"extra":{"attachment":true,"description":"Frontier GPT-5.6 model for complex professional work, coding, and agentic workflows","family":"gpt-sol","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":false},"family":null,"id":"openai/gpt-5.6-sol-pro","knowledge":"2026-02-16","last_updated":"2026-07-09","lifecycle":null,"limits":{"context":1050000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT 5.6 Sol Pro","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-09","retired":false,"tags":null},"openai/gpt-5.6-terra":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.1,"cache_write":1.25,"input":1,"output":6},"deprecated":false,"extra":{"attachment":true,"description":"Balanced GPT-5.6 model for capable, cost-efficient everyday work","family":"gpt-terra","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":false},"family":null,"id":"openai/gpt-5.6-terra","knowledge":"2026-02-16","last_updated":"2026-07-09","lifecycle":null,"limits":{"context":1050000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT 5.6 Terra","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-09","retired":false,"tags":null},"openai/gpt-5.6-terra-pro":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.1,"cache_write":1.25,"input":1,"output":6},"deprecated":false,"extra":{"attachment":true,"description":"Balanced GPT-5.6 model for capable, cost-efficient everyday work","family":"gpt-terra","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","low","medium","high","xhigh","max"]}],"structured_output":true,"temperature":false},"family":null,"id":"openai/gpt-5.6-terra-pro","knowledge":"2026-02-16","last_updated":"2026-07-09","lifecycle":null,"limits":{"context":1050000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT 5.6 Terra Pro","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-09","retired":false,"tags":null},"openai/gpt-chat-latest":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"cache_write":6.25,"input":5,"output":30},"deprecated":false,"extra":{"attachment":true,"description":"Chat-tuned GPT model for conversational assistance, writing, and tool workflows","family":"gpt","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","low","medium","high","xhigh","max"]}],"structured_output":true},"family":null,"id":"openai/gpt-chat-latest","knowledge":null,"last_updated":"2026-05-03","lifecycle":null,"limits":{"context":1050000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT Chat Latest","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-03","retired":false,"tags":null},"openai/gpt-latest":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"cache_write":6.25,"input":5,"output":30},"deprecated":false,"extra":{"attachment":true,"description":"GPT model for general reasoning, writing, coding, and tool-assisted tasks","family":"gpt","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","low","medium","high","xhigh","max"]}],"structured_output":true},"family":null,"id":"openai/gpt-latest","knowledge":null,"last_updated":"2026-03-29","lifecycle":null,"limits":{"context":1050000,"output":128000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"GPT Latest","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-29","retired":false,"tags":null},"openai/gpt-oss-120b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0.35,"output":0.75},"deprecated":false,"extra":{"attachment":false,"description":"Open GPT reasoning model for self-hosted agents and controllable deployments","family":"gpt-oss","llmfit":{"architecture":"gpt_oss","context_length":4194304,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/gpt-oss-120b-GGUF"},{"provider":"ggml-org","repo":"ggml-org/gpt-oss-120b-GGUF"}],"hf_downloads":4197649,"hf_likes":5069,"matched_hugging_face_id":"openai/gpt-oss-120b","memory":{"min_ram_gb":67.3,"min_vram_gb":61.7,"recommended_ram_gb":112.1},"model_id":"openai/gpt-oss-120b","moe":{"active_experts":4,"active_parameters":9595358141,"is_moe":true,"num_experts":128},"parameter_count":"120.4B","parameters_raw":120412337472,"pipeline_tag":"text-generation","provider":"openai","quantization":"Q4_K_M","release_date":"2025-08-04","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"openai/gpt-oss-120b","knowledge":null,"last_updated":"2025-08-05","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GPT OSS 120B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-05","retired":false,"tags":null},"openai/gpt-oss-20b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"input":0.2,"output":0.3},"deprecated":false,"extra":{"attachment":false,"description":"Open GPT reasoning model for self-hosted agents and controllable deployments","family":"gpt-oss","llmfit":{"architecture":"gpt_oss","context_length":4194304,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/gpt-oss-20b-GGUF"},{"provider":"ggml-org","repo":"ggml-org/gpt-oss-20b-GGUF"},{"provider":"mradermacher","repo":"mradermacher/gpt-oss-20b-GGUF"}],"hf_downloads":8501701,"hf_likes":4869,"matched_hugging_face_id":"openai/gpt-oss-20b","memory":{"min_ram_gb":12.0,"min_vram_gb":11.0,"recommended_ram_gb":20.0},"model_id":"openai/gpt-oss-20b","moe":{"active_experts":4,"active_parameters":3630142231,"is_moe":true,"num_experts":32},"parameter_count":"21.5B","parameters_raw":21511953984,"pipeline_tag":"text-generation","provider":"openai","quantization":"Q4_K_M","release_date":"2025-08-04","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false,"temperature":true},"family":null,"id":"openai/gpt-oss-20b","knowledge":null,"last_updated":"2025-08-05","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GPT OSS 20B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-05","retired":false,"tags":null},"openai/gpt-oss-safeguard-20b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"input":0.075,"output":0.3},"deprecated":false,"extra":{"attachment":false,"description":"Safety model for policy screening, moderation, and risk-aware routing workflows","family":"gpt-oss","llmfit":{"architecture":"gpt_oss","context_length":4194304,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/gpt-oss-safeguard-20b-GGUF"},{"provider":"mradermacher","repo":"mradermacher/gpt-oss-safeguard-20b-GGUF"}],"hf_downloads":101805,"hf_likes":243,"matched_hugging_face_id":"openai/gpt-oss-safeguard-20b","memory":{"min_ram_gb":12.0,"min_vram_gb":11.0,"recommended_ram_gb":20.0},"model_id":"openai/gpt-oss-safeguard-20b","moe":{"active_experts":4,"active_parameters":3630142231,"is_moe":true,"num_experts":32},"parameter_count":"21.5B","parameters_raw":21511953984,"pipeline_tag":"text-generation","provider":"openai","quantization":"Q4_K_M","release_date":"2025-09-18","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false},"family":null,"id":"openai/gpt-oss-safeguard-20b","knowledge":null,"last_updated":"2025-10-29","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GPT OSS Safeguard 20B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-23","retired":false,"tags":null},"openai/o1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":7.5,"input":15,"output":60},"deprecated":false,"extra":{"attachment":false,"description":"O-series reasoning model for hard analysis, math, coding, and planning","family":"o","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false,"temperature":false},"family":null,"id":"openai/o1","knowledge":"2023-09","last_updated":"2024-12-05","lifecycle":null,"limits":{"context":200000,"output":100000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"OpenAI o1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-12-05","retired":false,"tags":null},"openai/o1-preview":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":7.5,"input":15,"output":60},"deprecated":false,"extra":{"attachment":false,"description":"O-series reasoning model for hard analysis, math, coding, and planning","family":"o","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false},"family":null,"id":"openai/o1-preview","knowledge":null,"last_updated":"2024-09-12","lifecycle":null,"limits":{"context":128000,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"OpenAI o1-preview","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"openai/o1-pro":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":75,"input":150,"output":600},"deprecated":false,"extra":{"attachment":true,"description":"O-series reasoning model for hard analysis, math, coding, and planning","family":"o-pro","open_weights":false,"structured_output":false,"temperature":false},"family":null,"id":"openai/o1-pro","knowledge":"2023-09","last_updated":"2025-03-19","lifecycle":null,"limits":{"context":200000,"output":100000},"modalities":{"input":["text","image","pdf"],"output":["text"]},"model":null,"name":"OpenAI o1 Pro","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-03-19","retired":false,"tags":null},"openai/o3":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":1,"input":2,"output":8},"deprecated":false,"extra":{"attachment":false,"description":"Deliberate o-series reasoner for hard math, coding, and multi-step analysis","family":"o","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false,"temperature":false},"family":null,"id":"openai/o3","knowledge":"2024-05","last_updated":"2025-04-16","lifecycle":null,"limits":{"context":200000,"output":100000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"OpenAI o3","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-16","retired":false,"tags":null},"openai/o3-deep-research":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":5.5,"input":11,"output":44},"deprecated":false,"extra":{"attachment":false,"description":"Research model for long-horizon investigation, synthesis, and analytical reports","family":"o","open_weights":false,"reasoning_options":[{"type":"effort","values":["medium"]}],"structured_output":false,"temperature":false},"family":null,"id":"openai/o3-deep-research","knowledge":"2024-05","last_updated":"2024-06-26","lifecycle":null,"limits":{"context":200000,"output":100000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"OpenAI o3 Deep Research","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-06-26","retired":false,"tags":null},"openai/o3-mini":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.55,"input":1.1,"output":4.4},"deprecated":false,"extra":{"attachment":false,"description":"Smaller o-series reasoner for economical coding, math, and planning tasks","family":"o-mini","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true,"temperature":false},"family":null,"id":"openai/o3-mini","knowledge":"2024-05","last_updated":"2025-01-29","lifecycle":null,"limits":{"context":200000,"output":100000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"OpenAI o3-mini","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-12-20","retired":false,"tags":null},"openai/o3-mini-high":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.55,"input":1.1,"output":4.4},"deprecated":false,"extra":{"attachment":false,"description":"O-series reasoning model for hard analysis, math, coding, and planning","family":"o-mini","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true},"family":null,"id":"openai/o3-mini-high","knowledge":null,"last_updated":"2025-01-31","lifecycle":null,"limits":{"context":200000,"output":100000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"OpenAI o3-mini (High)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"openai/o3-mini-low":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.55,"input":1.1,"output":4.4},"deprecated":false,"extra":{"attachment":false,"description":"O-series reasoning model for hard analysis, math, coding, and planning","family":"o-mini","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true},"family":null,"id":"openai/o3-mini-low","knowledge":null,"last_updated":"2025-01-31","lifecycle":null,"limits":{"context":200000,"output":100000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"OpenAI o3-mini (Low)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-01-31","retired":false,"tags":null},"openai/o3-pro-2025-06-10":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":11,"input":22,"output":88},"deprecated":false,"extra":{"attachment":false,"description":"O-series reasoning model for hard analysis, math, coding, and planning","family":"o-pro","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true},"family":null,"id":"openai/o3-pro-2025-06-10","knowledge":null,"last_updated":"2025-06-10","lifecycle":null,"limits":{"context":200000,"output":100000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"OpenAI o3-pro (2025-06-10)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"openai/o4-mini":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.55,"input":1.1,"output":4.4},"deprecated":false,"extra":{"attachment":false,"description":"Fast o-series model for compact reasoning, coding, and tool use","family":"o-mini","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true,"temperature":false},"family":null,"id":"openai/o4-mini","knowledge":"2024-05","last_updated":"2025-04-16","lifecycle":null,"limits":{"context":200000,"output":100000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"OpenAI o4-mini","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-16","retired":false,"tags":null},"openai/o4-mini-deep-research":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":1.1,"input":2.2,"output":8.8},"deprecated":false,"extra":{"attachment":false,"description":"Research model for long-horizon investigation, synthesis, and analytical reports","family":"o-mini","open_weights":false,"reasoning_options":[{"type":"effort","values":["medium"]}],"structured_output":false,"temperature":false},"family":null,"id":"openai/o4-mini-deep-research","knowledge":"2024-05","last_updated":"2024-06-26","lifecycle":null,"limits":{"context":200000,"output":100000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"OpenAI o4-mini Deep Research","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-06-26","retired":false,"tags":null},"openai/o4-mini-high":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.55,"input":1.1,"output":4.4},"deprecated":false,"extra":{"attachment":false,"description":"O-series reasoning model for hard analysis, math, coding, and planning","family":"o-mini","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true},"family":null,"id":"openai/o4-mini-high","knowledge":null,"last_updated":"2025-04-16","lifecycle":null,"limits":{"context":200000,"output":100000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"OpenAI o4-mini high","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-04","retired":false,"tags":null},"pamanseau/OpenReasoning-Nemotron-32B":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.1,"output":0.4},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","family":"nemotron","open_weights":true,"reasoning_options":[],"structured_output":false},"family":null,"id":"pamanseau/OpenReasoning-Nemotron-32B","knowledge":null,"last_updated":"2025-08-21","lifecycle":null,"limits":{"context":32768,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"OpenReasoning Nemotron 32B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-21","retired":false,"tags":null},"perceptron/perceptron-mk1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.075,"input":0.15,"output":1.5},"deprecated":false,"extra":{"attachment":true,"description":"Multimodal reasoning model for visual analysis, planning, and tool use","open_weights":false,"reasoning_options":[],"structured_output":true},"family":null,"id":"perceptron/perceptron-mk1","knowledge":null,"last_updated":"2026-05-12","lifecycle":null,"limits":{"context":32768,"output":8192},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Perceptron Mk1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-12","retired":false,"tags":null},"perplexity-academic-researcher":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":1,"input":2,"output":8},"deprecated":false,"extra":{"attachment":false,"description":"Sonar Reasoning Pro with Perplexity's academic search mode. Prioritizes scholarly and peer-reviewed sources from academic repositories and returns cited research synthesis.","open_weights":false,"reasoning_options":[],"structured_output":false},"family":null,"id":"perplexity-academic-researcher","knowledge":null,"last_updated":"2026-07-10","lifecycle":null,"limits":{"context":127000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Perplexity Academic Researcher","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-10","retired":false,"tags":null},"phi-4-mini-instruct":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.085,"input":0.17,"output":0.68},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"phi","open_weights":true,"structured_output":false},"family":null,"id":"phi-4-mini-instruct","knowledge":null,"last_updated":"2025-07-26","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Phi 4 Mini","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-26","retired":false,"tags":null},"phi-4-multimodal-instruct":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.035,"input":0.07,"output":0.11},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"phi","open_weights":true,"structured_output":false},"family":null,"id":"phi-4-multimodal-instruct","knowledge":null,"last_updated":"2025-07-26","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Phi 4 Multimodal","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-26","retired":false,"tags":null},"poolside/laguna-m.1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1,"input":0.2,"output":0.4},"deprecated":false,"extra":{"attachment":false,"description":"Poolside's open-weight model for agentic coding and long-horizon work","family":"laguna","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"poolside/laguna-m.1","knowledge":null,"last_updated":"2026-06-13","lifecycle":null,"limits":{"context":262144,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Laguna M.1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-28","retired":false,"tags":null},"poolside/laguna-s-2.1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.01,"input":0.1,"output":0.2},"deprecated":false,"extra":{"attachment":false,"description":"Agentic coding model from Poolside in the XS size class for local deployment","family":"laguna","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":true},"family":null,"id":"poolside/laguna-s-2.1","knowledge":null,"last_updated":"2026-07-21","lifecycle":null,"limits":{"context":1048576,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Laguna S 2.1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-21","retired":false,"tags":null},"poolside/laguna-s-2.1:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.01,"input":0.1,"output":0.2},"deprecated":false,"extra":{"attachment":false,"description":"Agentic coding model from Poolside in the XS size class for local deployment","family":"laguna","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":true},"family":null,"id":"poolside/laguna-s-2.1:thinking","knowledge":null,"last_updated":"2026-07-21","lifecycle":null,"limits":{"context":1048576,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Laguna S 2.1 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-21","retired":false,"tags":null},"qvq-max":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.6,"input":1.2,"output":4.8},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen","open_weights":true,"structured_output":false},"family":null,"id":"qvq-max","knowledge":null,"last_updated":"2025-03-28","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen: QvQ Max","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-03-28","retired":false,"tags":null},"qwen-3.6-plus":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.0325,"cache_write":0.40625,"input":0.325,"output":1.95},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.6","open_weights":false,"structured_output":false},"family":null,"id":"qwen-3.6-plus","knowledge":null,"last_updated":"2026-04-02","lifecycle":null,"limits":{"context":991808,"output":65536},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen 3.6 Plus","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-02","retired":false,"tags":null},"qwen-long":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.05015,"input":0.1003,"output":0.408},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen","open_weights":false,"structured_output":false},"family":null,"id":"qwen-long","knowledge":null,"last_updated":"2025-01-25","lifecycle":null,"limits":{"context":10000000,"output":8192},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"Qwen Long 10M","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-08-01","retired":false,"tags":null},"qwen-max":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.79985,"input":1.5997,"output":6.392},"deprecated":false,"extra":{"attachment":false,"description":"Flagship Qwen model for complex reasoning, coding, and agentic workflows","family":"qwen","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"qwen-max","knowledge":"2024-04","last_updated":"2025-01-25","lifecycle":null,"limits":{"context":32000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen 2.5 Max","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-04-03","retired":false,"tags":null},"qwen-plus":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.19975,"input":0.3995,"output":1.2002},"deprecated":false,"extra":{"attachment":false,"description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","open_weights":false,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false,"temperature":true},"family":null,"id":"qwen-plus","knowledge":"2024-04","last_updated":"2025-09-11","lifecycle":null,"limits":{"context":995904,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen Plus","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-25","retired":false,"tags":null},"qwen-turbo":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.02499,"input":0.04998,"output":0.2006},"deprecated":false,"extra":{"attachment":false,"description":"Efficient Qwen model for fast chat, extraction, and high-volume workloads","family":"qwen","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"qwen-turbo","knowledge":"2024-04","last_updated":"2025-04-28","lifecycle":null,"limits":{"context":1000000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen Turbo","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-11-01","retired":false,"tags":null},"qwen/Qwen2.5-Coder-32B-Instruct":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1003,"input":0.2006,"output":0.2006},"deprecated":false,"extra":{"attachment":false,"description":"Qwen coding model for software agents, repository edits, and code reasoning","family":"qwen","open_weights":true,"structured_output":false},"family":null,"id":"qwen/Qwen2.5-Coder-32B-Instruct","knowledge":null,"last_updated":"2025-07-03","lifecycle":null,"limits":{"context":32000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen 2.5 Coder 32b","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-03","retired":false,"tags":null},"qwen/Qwen3-235B-A22B-Instruct-2507":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.065,"input":0.13,"output":0.5},"deprecated":false,"extra":{"attachment":false,"description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","open_weights":true,"structured_output":true},"family":null,"id":"qwen/Qwen3-235B-A22B-Instruct-2507","knowledge":null,"last_updated":"2025-07-25","lifecycle":null,"limits":{"context":256000,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen 3 235b A22B 2507","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-25","retired":false,"tags":null},"qwen/Qwen3-235B-A22B-Instruct-2507-TEE":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.065,"input":0.13,"output":0.5},"deprecated":false,"extra":{"attachment":false,"description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","open_weights":true,"structured_output":true},"family":null,"id":"qwen/Qwen3-235B-A22B-Instruct-2507-TEE","knowledge":null,"last_updated":"2025-07-25","lifecycle":null,"limits":{"context":256000,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen 3 235b A22B 2507 (TEE)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-25","retired":false,"tags":null},"qwen/Qwen3-235B-A22B-Thinking-2507":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":0.5},"deprecated":false,"extra":{"attachment":false,"description":"Qwen reasoning model for deliberate problem solving, math, and coding","family":"qwen","open_weights":true,"structured_output":false},"family":null,"id":"qwen/Qwen3-235B-A22B-Thinking-2507","knowledge":null,"last_updated":"2025-09-11","lifecycle":null,"limits":{"context":256000,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen 3 235b A22B 2507 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-11","retired":false,"tags":null},"qwen/Qwen3-8B":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.235,"input":0.47,"output":0.47},"deprecated":false,"extra":{"attachment":false,"description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","open_weights":true,"structured_output":false},"family":null,"id":"qwen/Qwen3-8B","knowledge":null,"last_updated":"2024-01-01","lifecycle":null,"limits":{"context":41000,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen 3 8B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"qwen/Qwen3-Next-80B-A3B-Instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.075,"input":0.15,"output":0.65},"deprecated":false,"extra":{"attachment":false,"description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"qwen/Qwen3-Next-80B-A3B-Instruct","knowledge":"2025-04","last_updated":"2025-09","lifecycle":null,"limits":{"context":256000,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3 Next 80B A3B (Instruct)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09","retired":false,"tags":null},"qwen/Qwen3-VL-235B-A22B-Instruct":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":1.2},"deprecated":false,"extra":{"attachment":true,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","open_weights":true,"structured_output":false},"family":null,"id":"qwen/Qwen3-VL-235B-A22B-Instruct","knowledge":null,"last_updated":"2024-01-01","lifecycle":null,"limits":{"context":128000,"output":262144},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3 VL 235B A22B Instruct","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"qwen/Qwen3.6-35B-A3B":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.056,"input":0.112,"output":0.8},"deprecated":false,"extra":{"attachment":true,"description":"Open multimodal Qwen MoE for local agents that need vision, audio, and code","family":"qwen","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"qwen/Qwen3.6-35B-A3B","knowledge":null,"last_updated":"2026-04-17","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.6 35B A3B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-17","retired":false,"tags":null},"qwen/Qwen3.6-35B-A3B:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.056,"input":0.112,"output":0.8},"deprecated":false,"extra":{"attachment":true,"description":"Open multimodal Qwen MoE for local agents that need vision, audio, and code","family":"qwen","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":true},"family":null,"id":"qwen/Qwen3.6-35B-A3B:thinking","knowledge":null,"last_updated":"2026-04-17","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.6 35B A3B Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-17","retired":false,"tags":null},"qwen/qwen-2.5-72b-instruct":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1785,"input":0.357,"output":0.408},"deprecated":false,"extra":{"attachment":false,"description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","open_weights":true,"structured_output":false},"family":null,"id":"qwen/qwen-2.5-72b-instruct","knowledge":null,"last_updated":"2025-07-03","lifecycle":null,"limits":{"context":131072,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen2.5 72B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-03","retired":false,"tags":null},"qwen/qwen3-14b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.04,"input":0.08,"output":0.24},"deprecated":false,"extra":{"attachment":false,"description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","open_weights":true,"structured_output":false},"family":null,"id":"qwen/qwen3-14b","knowledge":null,"last_updated":"2024-01-01","lifecycle":null,"limits":{"context":41000,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen 3 14b","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"qwen/qwen3-235b-a22b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":0.5},"deprecated":false,"extra":{"attachment":true,"description":"Large open Qwen MoE for multilingual reasoning, coding, and tool use","family":"qwen","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"qwen/qwen3-235b-a22b","knowledge":"2025-04","last_updated":"2025-04","lifecycle":null,"limits":{"context":41000,"output":32768},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"Qwen 3 235b A22B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04","retired":false,"tags":null},"qwen/qwen3-30b-a3b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.05,"input":0.1,"output":0.3},"deprecated":false,"extra":{"attachment":false,"description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","open_weights":true,"structured_output":false},"family":null,"id":"qwen/qwen3-30b-a3b","knowledge":null,"last_updated":"2025-02-27","lifecycle":null,"limits":{"context":41000,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3 30B A3B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-02-27","retired":false,"tags":null},"qwen/qwen3-32b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.05,"input":0.1,"output":0.3},"deprecated":false,"extra":{"attachment":true,"description":"Dense open Qwen model for self-hosted chat, reasoning, and coding","family":"qwen","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"qwen/qwen3-32b","knowledge":"2025-04","last_updated":"2025-04","lifecycle":null,"limits":{"context":41000,"output":32768},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"Qwen 3 32b","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04","retired":false,"tags":null},"qwen/qwen3-coder":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.065,"input":0.13,"output":0.5},"deprecated":false,"extra":{"attachment":false,"description":"Qwen coding model for software agents, repository edits, and code reasoning","family":"qwen","open_weights":true,"structured_output":true},"family":null,"id":"qwen/qwen3-coder","knowledge":null,"last_updated":"2026-03-17","lifecycle":null,"limits":{"context":262000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen 3 Coder 480B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-17","retired":false,"tags":null},"qwen/qwen3-coder-flash":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":1.5},"deprecated":false,"extra":{"attachment":false,"description":"Qwen coding model for software agents, repository edits, and code reasoning","family":"qwen","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"qwen/qwen3-coder-flash","knowledge":"2025-04","last_updated":"2025-07-28","lifecycle":null,"limits":{"context":128000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3 Coder Flash","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-28","retired":false,"tags":null},"qwen/qwen3-coder-next":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.1,"input":0.2,"output":1.5},"deprecated":false,"extra":{"attachment":false,"description":"Qwen coding model for software agents, repository edits, and code reasoning","family":"qwen","open_weights":true,"structured_output":true},"family":null,"id":"qwen/qwen3-coder-next","knowledge":null,"last_updated":"2025-12-08","lifecycle":null,"limits":{"context":262144,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3 Coder Next","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-08","retired":false,"tags":null},"qwen/qwen3-coder-plus":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.5,"input":1,"output":5},"deprecated":false,"extra":{"attachment":false,"description":"Hosted Qwen coder for software agents, repo edits, and long-context code","family":"qwen","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"qwen/qwen3-coder-plus","knowledge":"2025-04","last_updated":"2025-07-23","lifecycle":null,"limits":{"context":128000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3 Coder Plus","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-23","retired":false,"tags":null},"qwen/qwen3-max":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.6001,"input":1.2002,"output":6.001},"deprecated":false,"extra":{"attachment":false,"description":"Flagship Qwen3 model for coding agents, complex reasoning, and tool use","family":"qwen","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"qwen/qwen3-max","knowledge":"2025-04","last_updated":"2025-09-23","lifecycle":null,"limits":{"context":256000,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3 Max","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-23","retired":false,"tags":null},"qwen/qwen3-next-80b-a3b-thinking":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.075,"input":0.15,"output":0.65},"deprecated":false,"extra":{"attachment":false,"description":"Efficient Qwen thinking model for local reasoning, math, and coding agents","family":"qwen","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"qwen/qwen3-next-80b-a3b-thinking","knowledge":"2025-04","last_updated":"2025-09","lifecycle":null,"limits":{"context":256000,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3 Next 80B A3B (Thinking)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09","retired":false,"tags":null},"qwen/qwen3.5-397b-a17b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.3,"input":0.6,"output":3.6},"deprecated":false,"extra":{"attachment":true,"description":"Large open Qwen multimodal MoE for visual agents and long technical tasks","family":"qwen","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"qwen/qwen3.5-397b-a17b","knowledge":null,"last_updated":"2026-02-15","lifecycle":null,"limits":{"context":258048,"output":65536},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.5 397B A17B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-15","retired":false,"tags":null},"qwen/qwen3.5-397b-a17b-thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.3,"input":0.6,"output":3.6},"deprecated":false,"extra":{"attachment":true,"description":"Large open Qwen multimodal MoE for visual agents and long technical tasks","family":"qwen","open_weights":true,"reasoning_options":[{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false,"temperature":true},"family":null,"id":"qwen/qwen3.5-397b-a17b-thinking","knowledge":null,"last_updated":"2026-02-15","lifecycle":null,"limits":{"context":258048,"output":65536},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.5 397B A17B Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-15","retired":false,"tags":null},"qwen/qwen3.5-9b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.025,"input":0.05,"output":0.15},"deprecated":false,"extra":{"attachment":true,"description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false,"temperature":true},"family":null,"id":"qwen/qwen3.5-9b","knowledge":null,"last_updated":"2026-02-23","lifecycle":null,"limits":{"context":256000,"output":65536},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5 9B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-23","retired":false,"tags":null},"qwen/qwen3.5-plus":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.04,"input":0.4,"output":2.4},"deprecated":false,"extra":{"attachment":true,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"qwen/qwen3.5-plus","knowledge":"2025-04","last_updated":"2026-02-16","lifecycle":null,"limits":{"context":983616,"output":65536},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.5 Plus","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-16","retired":false,"tags":null},"qwen/qwen3.5-plus-thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.04,"input":0.4,"output":2.4},"deprecated":false,"extra":{"attachment":true,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","open_weights":false,"reasoning_options":[{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false,"temperature":true},"family":null,"id":"qwen/qwen3.5-plus-thinking","knowledge":"2025-04","last_updated":"2026-02-16","lifecycle":null,"limits":{"context":983616,"output":65536},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.5 Plus Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-16","retired":false,"tags":null},"qwen25-vl-72b-instruct":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.349945,"input":0.69989,"output":0.69989},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":true,"structured_output":false},"family":null,"id":"qwen25-vl-72b-instruct","knowledge":null,"last_updated":"2025-05-10","lifecycle":null,"limits":{"context":32000,"output":32768},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen25 VL 72b","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-05-10","retired":false,"tags":null},"qwen3-30b-a3b-instruct-2507":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1,"input":0.2,"output":0.5},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":true,"structured_output":false},"family":null,"id":"qwen3-30b-a3b-instruct-2507","knowledge":null,"last_updated":"2025-02-20","lifecycle":null,"limits":{"context":256000,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3 30B A3B Instruct 2507","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-02-20","retired":false,"tags":null},"qwen3-coder-30b-a3b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.1,"output":0.4},"deprecated":false,"extra":{"attachment":false,"description":"Smaller Qwen coder for efficient local agents and repo-level fixes","family":"qwen","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"qwen3-coder-30b-a3b-instruct","knowledge":"2025-04","last_updated":"2025-04","lifecycle":null,"limits":{"context":128000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3 Coder 30B A3B Instruct","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04","retired":false,"tags":null},"qwen3-max-2026-01-23":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.6001,"input":1.2002,"output":6.001},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":false,"structured_output":false},"family":null,"id":"qwen3-max-2026-01-23","knowledge":null,"last_updated":"2026-01-26","lifecycle":null,"limits":{"context":256000,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3 Max 2026-01-23","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-01-26","retired":false,"tags":null},"qwen3-vl-235b-a22b-instruct-original":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.25,"input":0.5,"output":1.2},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":false,"structured_output":false},"family":null,"id":"qwen3-vl-235b-a22b-instruct-original","knowledge":null,"last_updated":"2025-09-25","lifecycle":null,"limits":{"context":32768,"output":32768},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3 VL 235B A22B Instruct Original","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-25","retired":false,"tags":null},"qwen3-vl-235b-a22b-thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.25,"input":0.5,"output":6},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":true,"reasoning_options":[{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"qwen3-vl-235b-a22b-thinking","knowledge":null,"last_updated":"2025-08-26","lifecycle":null,"limits":{"context":32768,"output":32768},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3 VL 235B A22B Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-26","retired":false,"tags":null},"qwen3.5-122b-a10b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.103788,"input":0.437,"output":3.496},"deprecated":false,"extra":{"attachment":false,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"qwen3.5-122b-a10b","knowledge":null,"last_updated":"2026-02-23","lifecycle":null,"limits":{"context":131072,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3.5 122B A10B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-23","retired":false,"tags":null},"qwen3.5-122b-a10b:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.103788,"input":0.437,"output":3.496},"deprecated":false,"extra":{"attachment":false,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","open_weights":true,"reasoning_options":[{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":true,"temperature":true},"family":null,"id":"qwen3.5-122b-a10b:thinking","knowledge":null,"last_updated":"2026-02-23","lifecycle":null,"limits":{"context":131072,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3.5 122B A10B Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-23","retired":false,"tags":null},"qwen3.5-27b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.135,"input":0.27,"output":2.16},"deprecated":false,"extra":{"attachment":true,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"qwen3.5-27b","knowledge":null,"last_updated":"2026-02-23","lifecycle":null,"limits":{"context":260096,"output":65536},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.5 27B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-23","retired":false,"tags":null},"qwen3.5-27b:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.135,"input":0.27,"output":2.16},"deprecated":false,"extra":{"attachment":true,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","open_weights":true,"reasoning_options":[{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false,"temperature":true},"family":null,"id":"qwen3.5-27b:thinking","knowledge":null,"last_updated":"2026-02-23","lifecycle":null,"limits":{"context":260096,"output":65536},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.5 27B Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-23","retired":false,"tags":null},"qwen3.5-35b-a3b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1125,"input":0.225,"output":1.8},"deprecated":false,"extra":{"attachment":true,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"qwen3.5-35b-a3b","knowledge":null,"last_updated":"2026-02-23","lifecycle":null,"limits":{"context":260096,"output":65536},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.5 35B A3B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-23","retired":false,"tags":null},"qwen3.5-35b-a3b:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.1125,"input":0.225,"output":1.8},"deprecated":false,"extra":{"attachment":true,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","open_weights":true,"reasoning_options":[{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false,"temperature":true},"family":null,"id":"qwen3.5-35b-a3b:thinking","knowledge":null,"last_updated":"2026-02-23","lifecycle":null,"limits":{"context":260096,"output":65536},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.5 35B A3B Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-23","retired":false,"tags":null},"qwen3.5-flash":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.05,"input":0.1,"output":0.4},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":false,"structured_output":false},"family":null,"id":"qwen3.5-flash","knowledge":null,"last_updated":"2026-02-24","lifecycle":null,"limits":{"context":991808,"output":65536},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.5 Flash","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-24","retired":false,"tags":null},"qwen3.5-flash:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.1,"output":0.4},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"qwen3.5","open_weights":false,"reasoning_options":[{"max":81920,"min":1024,"type":"budget_tokens"}],"structured_output":false},"family":null,"id":"qwen3.5-flash:thinking","knowledge":null,"last_updated":"2026-02-24","lifecycle":null,"limits":{"context":991808,"output":65536},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.5 Flash Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-24","retired":false,"tags":null},"qwen3.5-omni-flash":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Omni-modal model for text, vision, audio, and multimodal agent tasks","family":"qwen3.5","open_weights":false,"structured_output":false},"family":null,"id":"qwen3.5-omni-flash","knowledge":null,"last_updated":"2026-03-30","lifecycle":null,"limits":{"context":49152,"output":16384},"modalities":{"input":["text","image","video","audio"],"output":["text"]},"model":null,"name":"Qwen3.5 Omni Flash","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-30","retired":false,"tags":null},"qwen3.5-omni-plus":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Omni-modal model for text, vision, audio, and multimodal agent tasks","family":"qwen3.5","open_weights":false,"structured_output":false},"family":null,"id":"qwen3.5-omni-plus","knowledge":null,"last_updated":"2026-03-30","lifecycle":null,"limits":{"context":983616,"output":65536},"modalities":{"input":["text","image","video","audio"],"output":["text"]},"model":null,"name":"Qwen3.5 Omni Plus","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-30","retired":false,"tags":null},"qwen3.6-max-preview":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.52,"input":1.04,"output":6.24},"deprecated":false,"extra":{"attachment":false,"description":"Flagship Qwen model for complex reasoning, coding, and agentic workflows","family":"qwen","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"qwen3.6-max-preview","knowledge":"2025-04","last_updated":"2026-04-20","lifecycle":null,"limits":{"context":245760,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3.6 Max Preview","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-20","retired":false,"tags":null},"qwen3.7-flash":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.006,"cache_write":0.038,"input":0.03,"output":0.13},"deprecated":false,"extra":{"attachment":true,"description":"Lightweight multimodal Qwen model for high-throughput text, image, and video tasks","family":"qwen","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"qwen3.7-flash","knowledge":null,"last_updated":"2026-07-15","lifecycle":null,"limits":{"context":991808,"output":65536},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.7 Flash","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-15","retired":false,"tags":null},"qwen3.7-flash:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.006,"cache_write":0.038,"input":0.03,"output":0.13},"deprecated":false,"extra":{"attachment":true,"description":"Lightweight multimodal Qwen model for high-throughput text, image, and video tasks","family":"qwen","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"qwen3.7-flash:thinking","knowledge":null,"last_updated":"2026-07-15","lifecycle":null,"limits":{"context":983616,"output":65536},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.7 Flash Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-15","retired":false,"tags":null},"qwen3.7-max":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.5,"cache_write":3.125,"input":2.5,"output":7.5},"deprecated":false,"extra":{"attachment":false,"description":"Qwen frontier model tuned for agent frameworks, coding assistants, and long tasks","family":"qwen","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":false,"temperature":true},"family":null,"id":"qwen3.7-max","knowledge":null,"last_updated":"2026-05-21","lifecycle":null,"limits":{"context":1000000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3.7 Max","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-21","retired":false,"tags":null},"qwen3.7-max:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.5,"cache_write":3.125,"input":2.5,"output":7.5},"deprecated":false,"extra":{"attachment":false,"description":"Qwen frontier model tuned for agent frameworks, coding assistants, and long tasks","family":"qwen","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":false,"temperature":true},"family":null,"id":"qwen3.7-max:thinking","knowledge":null,"last_updated":"2026-05-21","lifecycle":null,"limits":{"context":1000000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3.7 Max Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-21","retired":false,"tags":null},"qwen3.7-plus":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.08,"cache_write":0.5,"input":0.4,"output":1.6},"deprecated":false,"extra":{"attachment":true,"description":"Multimodal Qwen workhorse for long-context agents, visual inputs, and coding","family":"qwen","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":false,"temperature":true},"family":null,"id":"qwen3.7-plus","knowledge":"2025-04","last_updated":"2026-06-02","lifecycle":null,"limits":{"context":991808,"output":65536},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.7 Plus","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-02","retired":false,"tags":null},"qwen3.7-plus:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.08,"cache_write":0.5,"input":0.4,"output":1.6},"deprecated":false,"extra":{"attachment":true,"description":"Multimodal Qwen workhorse for long-context agents, visual inputs, and coding","family":"qwen","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":false,"temperature":true},"family":null,"id":"qwen3.7-plus:thinking","knowledge":"2025-04","last_updated":"2026-06-02","lifecycle":null,"limits":{"context":983616,"output":65536},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.7 Plus Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-02","retired":false,"tags":null},"qwen3.8-max":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.25,"cache_write":2.5,"input":2,"output":6},"deprecated":false,"extra":{"attachment":true,"description":"2.4-trillion-parameter MoE flagship for coding, professional work, multimodal understanding, and long-horizon agentic workflows","family":"qwen","open_weights":false,"reasoning_options":[{"type":"effort","values":["none","low","medium","high","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"qwen3.8-max","knowledge":null,"last_updated":"2026-08-03","lifecycle":null,"limits":{"context":991000,"output":131072},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Qwen3.8 Max","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-08-03","retired":false,"tags":null},"qwen3.8-max-preview":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"cache_write":2,"input":1.5,"output":5},"deprecated":false,"extra":{"attachment":false,"description":"Preview Qwen flagship for million-token multimodal reasoning and long-horizon agentic workflows","family":"qwen","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"qwen3.8-max-preview","knowledge":null,"last_updated":"2026-07-19","lifecycle":null,"limits":{"context":991000,"output":64000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3.8 Max Preview","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-19","retired":false,"tags":null},"sakana/fugu-ultra":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.525,"input":5.25,"output":31.5},"deprecated":false,"extra":{"attachment":true,"description":"Quality-first multi-agent model for hard research, analysis, and competitions","family":"fugu","open_weights":false,"reasoning_options":[{"type":"effort","values":["high","xhigh","max"]}],"structured_output":true,"temperature":false},"family":null,"id":"sakana/fugu-ultra","knowledge":null,"last_updated":"2026-06-15","lifecycle":null,"limits":{"context":1000000,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Fugu Ultra","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-15","retired":false,"tags":null},"sakana/fugu-ultra-v1.1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.525,"input":5.25,"output":31.5},"deprecated":false,"extra":{"attachment":true,"description":"Sakana AI's upgraded Fugu Ultra release with stronger coding, agentic task execution, and advanced reasoning through dynamic orchestration of frontier models.","family":"fugu","open_weights":false,"reasoning_options":[{"type":"effort","values":["high","xhigh","max"]}],"structured_output":true},"family":null,"id":"sakana/fugu-ultra-v1.1","knowledge":null,"last_updated":"2026-07-24","lifecycle":null,"limits":{"context":1000000,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Fugu Ultra v1.1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-24","retired":false,"tags":null},"sarvam-105b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.028,"input":0.045,"output":0.177},"deprecated":false,"extra":{"attachment":false,"description":"Flagship Indian-language reasoning model for enterprise multilingual applications","family":"sarvam","open_weights":true,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false,"temperature":true},"family":null,"id":"sarvam-105b","knowledge":null,"last_updated":"2025-09-01","lifecycle":null,"limits":{"context":131072,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Sarvam 105B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-01","retired":false,"tags":null},"sarvam-30b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.017,"input":0.028,"output":0.111},"deprecated":false,"extra":{"attachment":false,"description":"Efficient Indian-language reasoning model for chat, coding, and multilingual work","family":"sarvam","open_weights":true,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false,"temperature":true},"family":null,"id":"sarvam-30b","knowledge":null,"last_updated":"2026-02-18","lifecycle":null,"limits":{"context":65536,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Sarvam 30B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-18","retired":false,"tags":null},"shisa-ai/shisa-v2-llama3.3-70b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.25,"input":0.5,"output":0.5},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"shisa-ai/shisa-v2-llama3.3-70b","knowledge":null,"last_updated":"2025-07-26","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Shisa V2 Llama 3.3 70B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-26","retired":false,"tags":null},"shisa-ai/shisa-v2.1-llama3.3-70b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.25,"input":0.5,"output":0.5},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"shisa-ai/shisa-v2.1-llama3.3-70b","knowledge":null,"last_updated":"2024-12-06","lifecycle":null,"limits":{"context":32768,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Shisa V2.1 Llama 3.3 70B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"sonar":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.5,"input":1,"output":1},"deprecated":false,"extra":{"attachment":false,"description":"Fast web-grounded Sonar for current answers, citations, and lightweight retrieval","family":"sonar","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"sonar","knowledge":"2025-09-01","last_updated":"2025-09-01","lifecycle":null,"limits":{"context":127000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Perplexity Simple","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"sonar-deep-research":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.7,"input":3.4,"output":13.6},"deprecated":false,"extra":{"attachment":false,"description":"Research model for long-horizon investigation, synthesis, and analytical reports","family":"sonar-deep-research","open_weights":false,"structured_output":false},"family":null,"id":"sonar-deep-research","knowledge":null,"last_updated":"2025-02-25","lifecycle":null,"limits":{"context":60000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Perplexity Deep Research","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-02-25","retired":false,"tags":null},"sonar-pro":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.5,"input":3,"output":15},"deprecated":false,"extra":{"attachment":false,"description":"Deeper Sonar search model with broader retrieval and stronger synthesis","family":"sonar-pro","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"sonar-pro","knowledge":"2025-09-01","last_updated":"2025-09-01","lifecycle":null,"limits":{"context":200000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Perplexity Pro","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"sonar-reasoning-pro":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":1,"input":2,"output":8},"deprecated":false,"extra":{"attachment":false,"description":"Web-grounded Sonar for multi-step research questions that need cited reasoning","family":"sonar-reasoning","open_weights":false,"reasoning_options":[],"structured_output":false,"temperature":true},"family":null,"id":"sonar-reasoning-pro","knowledge":"2025-09-01","last_updated":"2025-09-01","lifecycle":null,"limits":{"context":127000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Perplexity Reasoning Pro","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"soob3123/GrayLine-Qwen3-8B":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":0.3},"deprecated":false,"extra":{"attachment":false,"description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","open_weights":true,"structured_output":false},"family":null,"id":"soob3123/GrayLine-Qwen3-8B","knowledge":null,"last_updated":"2025-09-25","lifecycle":null,"limits":{"context":16384,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Grayline Qwen3 8B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-25","retired":false,"tags":null},"soob3123/Veiled-Calla-12B":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":0.3},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"soob3123/Veiled-Calla-12B","knowledge":null,"last_updated":"2025-04-13","lifecycle":null,"limits":{"context":32768,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Veiled Calla 12B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-04-13","retired":false,"tags":null},"soob3123/amoral-gemma3-27B-v2":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":0.3},"deprecated":false,"extra":{"attachment":false,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"gemma","open_weights":true,"structured_output":false},"family":null,"id":"soob3123/amoral-gemma3-27B-v2","knowledge":null,"last_updated":"2025-05-23","lifecycle":null,"limits":{"context":32768,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Amoral Gemma3 27B v2","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-05-23","retired":false,"tags":null},"step-2-16k-exp":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":3.502,"input":7.004,"output":19.992},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"step","open_weights":false,"structured_output":false},"family":null,"id":"step-2-16k-exp","knowledge":null,"last_updated":"2024-07-05","lifecycle":null,"limits":{"context":16000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Step-2 16k Exp","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-10-15","retired":false,"tags":null},"step-2-mini":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1003,"input":0.2006,"output":0.408},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"step","open_weights":false,"structured_output":false},"family":null,"id":"step-2-mini","knowledge":null,"last_updated":"2024-07-05","lifecycle":null,"limits":{"context":8000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Step-2 Mini","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-10-15","retired":false,"tags":null},"step-3":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.12495,"input":0.2499,"output":0.6494},"deprecated":false,"extra":{"attachment":true,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"step","open_weights":true,"structured_output":false},"family":null,"id":"step-3","knowledge":null,"last_updated":"2025-07-31","lifecycle":null,"limits":{"context":65536,"output":8192},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Step-3","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-31","retired":false,"tags":null},"step-r1-v-mini":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.25,"input":2.5,"output":11},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"step","open_weights":false,"structured_output":false},"family":null,"id":"step-r1-v-mini","knowledge":null,"last_updated":"2025-04-08","lifecycle":null,"limits":{"context":128000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Step R1 V Mini","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"stepfun-ai/step-3.5-flash":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.1,"output":0.3},"deprecated":false,"extra":{"attachment":false,"description":"StepFun flash lane for quick multimodal reasoning and coding assistance","open_weights":true,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false,"temperature":true},"family":null,"id":"stepfun-ai/step-3.5-flash","knowledge":"2025-01","last_updated":"2026-02-13","lifecycle":null,"limits":{"context":256000,"output":256000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Step 3.5 Flash","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-01-29","retired":false,"tags":null},"stepfun-ai/step-3.5-flash-2603":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.05,"input":0.1,"output":0.3},"deprecated":false,"extra":{"attachment":false,"description":"StepFun flash model for efficient multimodal reasoning, coding, and tool use","open_weights":true,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":false,"temperature":true},"family":null,"id":"stepfun-ai/step-3.5-flash-2603","knowledge":"2025-01","last_updated":"2026-04-02","lifecycle":null,"limits":{"context":256000,"output":256000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Step 3.5 Flash 2603","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-02","retired":false,"tags":null},"stepfun/step-3.7-flash:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.04,"input":0.2,"output":1.15},"deprecated":false,"extra":{"attachment":true,"description":"Newer StepFun flash model for faster agents, coding, and multimodal prompts","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"stepfun/step-3.7-flash:thinking","knowledge":"2026-03-01","last_updated":"2026-05-29","lifecycle":null,"limits":{"context":262144,"output":256000},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Step 3.7 Flash Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-29","retired":false,"tags":null},"tencent/Hunyuan-MT-7B":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":5,"input":10,"output":20},"deprecated":false,"extra":{"attachment":false,"description":"Translation model for multilingual conversion, localization, and cross-language workflows","family":"hunyuan","open_weights":false,"structured_output":false},"family":null,"id":"tencent/Hunyuan-MT-7B","knowledge":null,"last_updated":"2025-09-18","lifecycle":null,"limits":{"context":8192,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Hunyuan MT 7B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-15","retired":false,"tags":null},"tencent/hy3":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.029,"input":0.066,"output":0.26},"deprecated":false,"extra":{"attachment":false,"description":"Tencent Hy reasoning model for coding, instruction following, and agent tasks","family":"Hy","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","low","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"tencent/hy3","knowledge":null,"last_updated":"2026-07-06","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Tencent Hy3","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-06","retired":false,"tags":null},"thinkingmachines/Inkling-Small":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.1,"input":0.5,"output":1.2},"deprecated":false,"extra":{"attachment":true,"description":"Multimodal MoE reasoning model (276B total, 12B active) for text, image, and audio","family":"ling","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"thinkingmachines/Inkling-Small","knowledge":null,"last_updated":"2026-07-30","lifecycle":null,"limits":{"context":524288,"output":32768},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Inkling Small","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-30","retired":false,"tags":null},"thinkingmachines/Inkling-Small:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.1,"input":0.5,"output":1.2},"deprecated":false,"extra":{"attachment":true,"description":"Multimodal MoE reasoning model (276B total, 12B active) for text, image, and audio","family":"ling","open_weights":true,"reasoning_options":[{"type":"effort","values":["minimal","low","medium","high","max"]}],"structured_output":false,"temperature":true},"family":null,"id":"thinkingmachines/Inkling-Small:thinking","knowledge":null,"last_updated":"2026-07-30","lifecycle":null,"limits":{"context":524288,"output":32768},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Inkling Small Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-30","retired":false,"tags":null},"thinkingmachines/inkling":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.17,"input":1,"output":4.05},"deprecated":false,"extra":{"attachment":true,"description":"Multimodal MoE reasoning model (975B total, 41B active) for text, image, and audio","family":"ling","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"thinkingmachines/inkling","knowledge":null,"last_updated":"2026-07-15","lifecycle":null,"limits":{"context":1048000,"output":32768},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Inkling","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-15","retired":false,"tags":null},"thinkingmachines/inkling:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.17,"input":1,"output":4.05},"deprecated":false,"extra":{"attachment":true,"description":"Multimodal MoE reasoning model (975B total, 41B active) for text, image, and audio","family":"ling","open_weights":true,"reasoning_options":[{"type":"effort","values":["minimal","low","medium","high","xhigh"]}],"structured_output":true,"temperature":true},"family":null,"id":"thinkingmachines/inkling:thinking","knowledge":null,"last_updated":"2026-07-15","lifecycle":null,"limits":{"context":1048000,"output":32768},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Inkling Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-15","retired":false,"tags":null},"undi95/remm-slerp-l2-13b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.3995,"input":0.799,"output":1.207},"deprecated":false,"extra":{"attachment":true,"description":"Open Llama multimodal model for image understanding and text reasoning","family":"llama","open_weights":true,"structured_output":false},"family":null,"id":"undi95/remm-slerp-l2-13b","knowledge":null,"last_updated":"2025-01-01","lifecycle":null,"limits":{"context":6144,"output":4096},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"ReMM SLERP 13B","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"universal-summarizer":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":30,"output":30},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","open_weights":false,"structured_output":false},"family":null,"id":"universal-summarizer","knowledge":null,"last_updated":"2024-01-01","lifecycle":null,"limits":{"context":32768,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Universal Summarizer","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-23","retired":false,"tags":null},"unsloth/gemma-3-12b-it":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.136,"input":0.272,"output":0.272},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"unsloth","llmfit":{"architecture":"gemma3","context_length":1048576,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/gemma-3-12b-it-GGUF"},{"provider":"ggml-org","repo":"ggml-org/gemma-3-12b-it-GGUF"},{"provider":"mradermacher","repo":"mradermacher/gemma-3-12b-it-GGUF"}],"hf_downloads":26270,"hf_likes":0,"matched_hugging_face_id":"unsloth/gemma-3-12b-it","memory":{"min_ram_gb":6.8,"min_vram_gb":6.2,"recommended_ram_gb":11.4},"model_id":"unsloth/gemma-3-12b-it","parameter_count":"12.2B","parameters_raw":12187325040,"pipeline_tag":"image-text-to-text","provider":"unsloth","quantization":"Q4_K_M","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"structured_output":false},"family":null,"id":"unsloth/gemma-3-12b-it","knowledge":null,"last_updated":"2025-03-10","lifecycle":null,"limits":{"context":128000,"output":131072},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"Gemma 3 12B IT","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"unsloth/gemma-3-27b-it":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1496,"input":0.2992,"output":0.2992},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"unsloth","llmfit":{"architecture":"gemma3","context_length":1048576,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/gemma-3-27b-it-GGUF"},{"provider":"ggml-org","repo":"ggml-org/gemma-3-27b-it-GGUF"},{"provider":"mradermacher","repo":"mradermacher/gemma-3-27b-it-GGUF"}],"hf_downloads":48998,"hf_likes":0,"matched_hugging_face_id":"unsloth/gemma-3-27b-it","memory":{"min_ram_gb":15.3,"min_vram_gb":14.1,"recommended_ram_gb":25.5},"model_id":"unsloth/gemma-3-27b-it","parameter_count":"27.4B","parameters_raw":27432406640,"pipeline_tag":"image-text-to-text","provider":"unsloth","quantization":"Q4_K_M","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"structured_output":false},"family":null,"id":"unsloth/gemma-3-27b-it","knowledge":null,"last_updated":"2025-03-10","lifecycle":null,"limits":{"context":128000,"output":96000},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"Gemma 3 27B IT","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"unsloth/gemma-3-4b-it":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1003,"input":0.2006,"output":0.2006},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"unsloth","llmfit":{"architecture":"gemma3","context_length":1048576,"discovered":true,"gguf_sources":[],"hf_downloads":109629,"hf_likes":0,"matched_hugging_face_id":"unsloth/gemma-3-4b-it","memory":{"min_ram_gb":2.4,"min_vram_gb":2.2,"recommended_ram_gb":4.0},"model_id":"unsloth/gemma-3-4b-it","parameter_count":"4.3B","parameters_raw":4300079472,"pipeline_tag":"image-text-to-text","provider":"unsloth","quantization":"Q4_K_M","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"structured_output":false},"family":null,"id":"unsloth/gemma-3-4b-it","knowledge":null,"last_updated":"2025-03-10","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text","pdf"],"output":["text"]},"model":null,"name":"Gemma 3 4B IT","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"upstage/solar-pro-3":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.015,"input":0.15,"output":0.6},"deprecated":false,"extra":{"attachment":false,"description":"Flagship model for demanding analysis, coding, and production agent workflows","family":"solar-pro","open_weights":false,"structured_output":false},"family":null,"id":"upstage/solar-pro-3","knowledge":null,"last_updated":"2026-03-03","lifecycle":null,"limits":{"context":128000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Solar Pro 3","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-03","retired":false,"tags":null},"venice-uncensored":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.2,"input":0.4,"output":0.4},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"venice","open_weights":true,"structured_output":false},"family":null,"id":"venice-uncensored","knowledge":null,"last_updated":"2025-02-24","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Venice Uncensored","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-10-01","retired":false,"tags":null},"x-ai/grok-4.20":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":1,"input":2,"output":6},"deprecated":false,"extra":{"attachment":true,"description":"Grok model for agentic tool use, reasoning, coding, and live assistance","family":"grok","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true},"family":null,"id":"x-ai/grok-4.20","knowledge":null,"last_updated":"2026-03-31","lifecycle":null,"limits":{"context":2000000,"output":131072},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Grok 4.20","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-31","retired":false,"tags":null},"x-ai/grok-4.20-multi-agent":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":1,"input":2,"output":6},"deprecated":false,"extra":{"attachment":true,"description":"Grok model for agentic tool use, reasoning, coding, and live assistance","family":"grok","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high","xhigh"]}],"structured_output":true},"family":null,"id":"x-ai/grok-4.20-multi-agent","knowledge":null,"last_updated":"2026-03-31","lifecycle":null,"limits":{"context":2000000,"output":131072},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Grok 4.20 Multi-Agent","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-31","retired":false,"tags":null},"x-ai/grok-4.3":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"input":1.25,"output":2.5},"deprecated":false,"extra":{"attachment":true,"description":"xAI's default Grok for chat, coding, agentic tools, and lower hallucination risk","family":"grok","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"x-ai/grok-4.3","knowledge":null,"last_updated":"2026-04-17","lifecycle":null,"limits":{"context":1000000,"output":1000000},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Grok 4.3","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-17","retired":false,"tags":null},"x-ai/grok-4.5":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"input":2,"output":6},"deprecated":false,"extra":{"attachment":true,"description":"xAI's latest Grok for chat, coding, agentic tools, and lower hallucination risk","family":"grok","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"x-ai/grok-4.5","knowledge":null,"last_updated":"2026-07-08","lifecycle":null,"limits":{"context":500000,"output":500000},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Grok 4.5","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-08","retired":false,"tags":null},"x-ai/grok-build-0.1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"input":1,"output":2},"deprecated":false,"extra":{"attachment":true,"description":"Fast Grok coding model tuned for agentic engineering and iterative edits","family":"grok-build","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"x-ai/grok-build-0.1","knowledge":null,"last_updated":"2026-04-16","lifecycle":null,"limits":{"context":256000,"output":256000},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Grok Build 0.1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-16","retired":false,"tags":null},"x-ai/grok-latest":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.5,"input":2,"output":6},"deprecated":false,"extra":{"attachment":true,"description":"Grok model for agentic tool use, reasoning, coding, and live assistance","family":"grok","open_weights":false,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true},"family":null,"id":"x-ai/grok-latest","knowledge":null,"last_updated":"2026-05-03","lifecycle":null,"limits":{"context":500000,"output":500000},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Grok Latest","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-03","retired":false,"tags":null},"xiaomi/mimo-v2.5":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.0028,"cache_write":0,"input":0.14,"output":0.28},"deprecated":false,"extra":{"attachment":true,"description":"Open MiMo model for multimodal coding agents and long-context automation","family":"mimo","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"xiaomi/mimo-v2.5","knowledge":"2024-12","last_updated":"2026-04-22","lifecycle":null,"limits":{"context":1048576,"output":131072},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"MiMo V2.5","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-22","retired":false,"tags":null},"xiaomi/mimo-v2.5-pro":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.0036,"cache_write":0,"input":0.435,"output":0.87},"deprecated":false,"extra":{"attachment":false,"description":"Stronger MiMo Pro tier for multimodal reasoning and coding-agent execution","family":"mimo","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"xiaomi/mimo-v2.5-pro","knowledge":"2024-12","last_updated":"2026-04-22","lifecycle":null,"limits":{"context":1048576,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MiMo V2.5 Pro","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-22","retired":false,"tags":null},"xiaomi/mimo-v2.5-pro-crof":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.003,"input":0.4,"output":0.8},"deprecated":false,"extra":{"attachment":false,"description":"MiMo V2.5 Pro is Xiaomi's long-context flagship general model for coding and agentic orchestration. This separately served variant is intended for users concerned about censorship on the regular Xiaomi MiMo V2.5 Pro, and it is included in the NanoGPT subscription.","family":"mimo-v2.5-pro","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","low","medium","high"]}],"structured_output":true},"family":null,"id":"xiaomi/mimo-v2.5-pro-crof","knowledge":null,"last_updated":"2026-07-23","lifecycle":null,"limits":{"context":1000000,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MiMo V2.5 Pro (Crof)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-23","retired":false,"tags":null},"xiaomi/mimo-v2.5-pro-crof:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.003,"input":0.4,"output":0.8},"deprecated":false,"extra":{"attachment":false,"description":"MiMo V2.5 Pro with Xiaomi thinking enabled for coding, long-context reasoning, and agentic orchestration. This separately served thinking variant is intended for users concerned about censorship on the regular Xiaomi MiMo V2.5 Pro, and it is included in the NanoGPT subscription.","family":"mimo-v2.5-pro","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","low","medium","high"]}],"structured_output":true},"family":null,"id":"xiaomi/mimo-v2.5-pro-crof:thinking","knowledge":null,"last_updated":"2026-07-23","lifecycle":null,"limits":{"context":1000000,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MiMo V2.5 Pro Thinking (Crof)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-07-23","retired":false,"tags":null},"xiaomi/mimo-v2.5-pro:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.0036,"cache_write":0,"input":0.435,"output":0.87},"deprecated":false,"extra":{"attachment":false,"description":"Stronger MiMo Pro tier for multimodal reasoning and coding-agent execution","family":"mimo","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"xiaomi/mimo-v2.5-pro:thinking","knowledge":"2024-12","last_updated":"2026-04-22","lifecycle":null,"limits":{"context":1048576,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MiMo V2.5 Pro Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-22","retired":false,"tags":null},"xiaomi/mimo-v2.5:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.0028,"cache_write":0,"input":0.14,"output":0.28},"deprecated":false,"extra":{"attachment":true,"description":"Open MiMo model for multimodal coding agents and long-context automation","family":"mimo","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"xiaomi/mimo-v2.5:thinking","knowledge":"2024-12","last_updated":"2026-04-22","lifecycle":null,"limits":{"context":1048576,"output":131072},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"MiMo V2.5 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-22","retired":false,"tags":null},"yi-large":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.598,"input":3.196,"output":3.196},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"yi","open_weights":false,"structured_output":false},"family":null,"id":"yi-large","knowledge":null,"last_updated":"2024-05-13","lifecycle":null,"limits":{"context":32000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Yi Large","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"yi-lightning":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.1003,"input":0.2006,"output":0.2006},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"yi","open_weights":false,"structured_output":false},"family":null,"id":"yi-lightning","knowledge":null,"last_updated":"2024-10-16","lifecycle":null,"limits":{"context":12000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Yi Lightning","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-06-15","retired":false,"tags":null},"yi-medium-200k":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":1.2495,"input":2.499,"output":2.499},"deprecated":false,"extra":{"attachment":false,"description":"Compact GPT model for low-latency assistance and high-volume workloads","family":"yi","open_weights":false,"structured_output":false},"family":null,"id":"yi-medium-200k","knowledge":null,"last_updated":"2024-03-01","lifecycle":null,"limits":{"context":200000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Yi Medium 200k","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2024-01-01","retired":false,"tags":null},"z-ai/glm-4.5v":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.3,"input":0.6,"output":1.8},"deprecated":false,"extra":{"attachment":true,"description":"GLM vision model for visual reasoning, documents, and multimodal agents","family":"glm","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":false,"temperature":true},"family":null,"id":"z-ai/glm-4.5v","knowledge":"2025-04","last_updated":"2025-08-11","lifecycle":null,"limits":{"context":64000,"output":96000},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GLM 4.5V","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-11","retired":false,"tags":null},"z-ai/glm-4.5v:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.3,"input":0.6,"output":1.8},"deprecated":false,"extra":{"attachment":true,"description":"GLM vision model for visual reasoning, documents, and multimodal agents","family":"glm","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":true},"family":null,"id":"z-ai/glm-4.5v:thinking","knowledge":"2025-04","last_updated":"2025-08-11","lifecycle":null,"limits":{"context":64000,"output":96000},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GLM 4.5V Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-08-11","retired":false,"tags":null},"z-ai/glm-4.6":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.175,"input":0.35,"output":1.4},"deprecated":false,"extra":{"attachment":false,"description":"Late GLM-4 workhorse for coding agents, reasoning, and structured tasks","family":"glm","open_weights":true,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"z-ai/glm-4.6","knowledge":"2025-04","last_updated":"2025-09-30","lifecycle":null,"limits":{"context":200000,"output":65535},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4.6","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-30","retired":false,"tags":null},"z-ai/glm-4.6:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.175,"input":0.35,"output":1.4},"deprecated":false,"extra":{"attachment":false,"description":"Late GLM-4 workhorse for coding agents, reasoning, and structured tasks","family":"glm","open_weights":true,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"z-ai/glm-4.6:thinking","knowledge":"2025-04","last_updated":"2025-09-30","lifecycle":null,"limits":{"context":200000,"output":65535},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4.6 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-09-30","retired":false,"tags":null},"z-ai/glm-5-turbo":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.24,"input":1.2,"output":4},"deprecated":false,"extra":{"attachment":false,"description":"Faster GLM-5 lane for coding agents that need lower latency","family":"glm","open_weights":false,"structured_output":true,"temperature":true},"family":null,"id":"z-ai/glm-5-turbo","knowledge":null,"last_updated":"2026-03-16","lifecycle":null,"limits":{"context":202800,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 5 Turbo","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-03-16","retired":false,"tags":null},"z-ai/glm-5v-turbo":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.24,"input":1.2,"output":4},"deprecated":false,"extra":{"attachment":true,"description":"Fast GLM vision model for screenshots, documents, and multimodal agent tasks","family":"glm","open_weights":false,"structured_output":true,"temperature":true},"family":null,"id":"z-ai/glm-5v-turbo","knowledge":null,"last_updated":"2026-04-01","lifecycle":null,"limits":{"context":202800,"output":131072},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GLM 5V Turbo","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-01","retired":false,"tags":null},"z-ai/glm-5v-turbo:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.24,"input":1.2,"output":4},"deprecated":false,"extra":{"attachment":true,"description":"Fast GLM vision model for screenshots, documents, and multimodal agent tasks","family":"glm","open_weights":false,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"z-ai/glm-5v-turbo:thinking","knowledge":null,"last_updated":"2026-04-01","lifecycle":null,"limits":{"context":202800,"output":131072},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GLM 5V Turbo Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-01","retired":false,"tags":null},"zai-org/GLM-4.5-Air":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.06,"input":0.12,"output":0.8},"deprecated":false,"extra":{"attachment":false,"description":"Lighter GLM-4.5 variant for fast coding assistance and cheaper agents","family":"glm-air","llmfit":{"architecture":"glm4_moe","context_length":131072,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/GLM-4.5-Air-GGUF"},{"provider":"mradermacher","repo":"mradermacher/GLM-4.5-Air-GGUF"}],"hf_downloads":441341,"hf_likes":625,"matched_hugging_face_id":"zai-org/GLM-4.5-Air","memory":{"min_ram_gb":61.7,"min_vram_gb":56.6,"recommended_ram_gb":102.9},"model_id":"zai-org/GLM-4.5-Air","moe":{"active_experts":8,"active_parameters":12082527713,"is_moe":true,"num_experts":128},"parameter_count":"110.5B","parameters_raw":110468824832,"pipeline_tag":"text-generation","provider":"zai-org","quantization":"Q4_K_M","release_date":"2025-07-20","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"zai-org/GLM-4.5-Air","knowledge":"2025-04","last_updated":"2025-07-28","lifecycle":null,"limits":{"context":128000,"output":98304},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4.5 Air","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-28","retired":false,"tags":null},"zai-org/GLM-4.5-Air:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.06,"input":0.12,"output":0.8},"deprecated":false,"extra":{"attachment":false,"description":"Lighter GLM-4.5 variant for fast coding assistance and cheaper agents","family":"glm-air","open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"zai-org/GLM-4.5-Air:thinking","knowledge":"2025-04","last_updated":"2025-07-28","lifecycle":null,"limits":{"context":128000,"output":98304},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4.5 Air (Thinking)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-28","retired":false,"tags":null},"zai-org/GLM-4.5:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":1.3},"deprecated":false,"extra":{"attachment":false,"description":"Hybrid-reasoning GLM release that made the 4.5 line broadly useful","family":"glm","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":true},"family":null,"id":"zai-org/GLM-4.5:thinking","knowledge":"2025-04","last_updated":"2025-07-28","lifecycle":null,"limits":{"context":128000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4.5 (Thinking)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-28","retired":false,"tags":null},"zai-org/GLM-4.6-turbo":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.5,"input":1,"output":3},"deprecated":false,"extra":{"attachment":false,"description":"Efficient GLM model for fast reasoning, coding, and agent workflows","family":"glm","open_weights":true,"structured_output":false},"family":null,"id":"zai-org/GLM-4.6-turbo","knowledge":null,"last_updated":"2025-10-02","lifecycle":null,"limits":{"context":200000,"output":204800},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4.6 Turbo","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-10-02","retired":false,"tags":null},"zai-org/GLM-4.6-turbo:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.5,"input":1,"output":3},"deprecated":false,"extra":{"attachment":false,"description":"Efficient GLM model for fast reasoning, coding, and agent workflows","family":"glm","open_weights":true,"reasoning_options":[],"structured_output":false},"family":null,"id":"zai-org/GLM-4.6-turbo:thinking","knowledge":null,"last_updated":"2025-10-02","lifecycle":null,"limits":{"context":200000,"output":204800},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4.6 Turbo (Thinking)","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-10-02","retired":false,"tags":null},"zai-org/glm-4.5":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":1.3},"deprecated":false,"extra":{"attachment":false,"description":"Hybrid-reasoning GLM release that made the 4.5 line broadly useful","family":"glm","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"zai-org/glm-4.5","knowledge":"2025-04","last_updated":"2025-07-28","lifecycle":null,"limits":{"context":128000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4.5","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-07-28","retired":false,"tags":null},"zai-org/glm-4.6-original":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.175,"input":0.35,"output":1.4},"deprecated":false,"extra":{"attachment":false,"description":"Flagship GLM model for hybrid reasoning, coding, and agentic engineering","family":"glm","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":false},"family":null,"id":"zai-org/glm-4.6-original","knowledge":null,"last_updated":"2025-12-11","lifecycle":null,"limits":{"context":256000,"output":65535},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4.6 Original","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-11","retired":false,"tags":null},"zai-org/glm-4.6v":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.15,"input":0.3,"output":0.9},"deprecated":false,"extra":{"attachment":true,"description":"GLM vision model for visual reasoning, documents, and multimodal agents","family":"glm","open_weights":true,"structured_output":false,"temperature":true},"family":null,"id":"zai-org/glm-4.6v","knowledge":"2025-04","last_updated":"2025-12-08","lifecycle":null,"limits":{"context":128000,"output":24000},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GLM 4.6V","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-08","retired":false,"tags":null},"zai-org/glm-4.6v-flash-original":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.05,"input":0.1,"output":0.4},"deprecated":false,"extra":{"attachment":true,"description":"GLM vision model for visual reasoning, documents, and multimodal agents","family":"glm","open_weights":true,"structured_output":false},"family":null,"id":"zai-org/glm-4.6v-flash-original","knowledge":null,"last_updated":"2025-12-08","lifecycle":null,"limits":{"context":128000,"output":24000},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"GLM 4.6V Flash","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-08","retired":false,"tags":null},"zai-org/glm-4.6v-original":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"cache_read":0.3,"input":0.6,"output":0.9},"deprecated":false,"extra":{"attachment":true,"description":"GLM vision model for visual reasoning, documents, and multimodal agents","family":"glm","open_weights":true,"structured_output":false},"family":null,"id":"zai-org/glm-4.6v-original","knowledge":null,"last_updated":"2025-12-08","lifecycle":null,"limits":{"context":128000,"output":24000},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"GLM 4.6V Original","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-08","retired":false,"tags":null},"zai-org/glm-4.7":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.1,"input":0.2,"output":0.8},"deprecated":false,"extra":{"attachment":false,"description":"Mature GLM model for dependable coding, reasoning, and structured agent tasks","family":"glm","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"zai-org/glm-4.7","knowledge":"2025-04","last_updated":"2025-12-22","lifecycle":null,"limits":{"context":200000,"output":65535},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4.7","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-22","retired":false,"tags":null},"zai-org/glm-4.7-flash":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.035,"input":0.07,"output":0.4},"deprecated":false,"extra":{"attachment":false,"description":"Budget GLM lane for fast coding help, routing, and everyday automation","family":"glm-flash","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"zai-org/glm-4.7-flash","knowledge":"2025-04","last_updated":"2026-01-19","lifecycle":null,"limits":{"context":200000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4.7 Flash","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-01-19","retired":false,"tags":null},"zai-org/glm-4.7-flash-original":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.035,"input":0.07,"output":0.4},"deprecated":false,"extra":{"attachment":false,"description":"Efficient GLM model for fast reasoning, coding, and agent workflows","family":"glm","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true},"family":null,"id":"zai-org/glm-4.7-flash-original","knowledge":null,"last_updated":"2026-01-19","lifecycle":null,"limits":{"context":200000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4.7 Flash Original","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-01-19","retired":false,"tags":null},"zai-org/glm-4.7-flash-original:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.035,"input":0.07,"output":0.4},"deprecated":false,"extra":{"attachment":false,"description":"Efficient GLM model for fast reasoning, coding, and agent workflows","family":"glm","open_weights":true,"reasoning_options":[],"structured_output":false},"family":null,"id":"zai-org/glm-4.7-flash-original:thinking","knowledge":null,"last_updated":"2026-01-19","lifecycle":null,"limits":{"context":200000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4.7 Flash Original Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-01-19","retired":false,"tags":null},"zai-org/glm-4.7-flash:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"cache_read":0.035,"input":0.07,"output":0.4},"deprecated":false,"extra":{"attachment":false,"description":"Budget GLM lane for fast coding help, routing, and everyday automation","family":"glm-flash","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":true},"family":null,"id":"zai-org/glm-4.7-flash:thinking","knowledge":"2025-04","last_updated":"2026-01-19","lifecycle":null,"limits":{"context":200000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4.7 Flash Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-01-19","retired":false,"tags":null},"zai-org/glm-4.7-original":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.11,"input":0.6,"output":2.2},"deprecated":false,"extra":{"attachment":false,"description":"Flagship GLM model for hybrid reasoning, coding, and agentic engineering","family":"glm","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true},"family":null,"id":"zai-org/glm-4.7-original","knowledge":null,"last_updated":"2025-12-22","lifecycle":null,"limits":{"context":200000,"output":65535},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4.7 Original","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-22","retired":false,"tags":null},"zai-org/glm-4.7-original:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.11,"input":0.6,"output":2.2},"deprecated":false,"extra":{"attachment":false,"description":"Flagship GLM model for hybrid reasoning, coding, and agentic engineering","family":"glm","open_weights":true,"reasoning_options":[],"structured_output":true},"family":null,"id":"zai-org/glm-4.7-original:thinking","knowledge":null,"last_updated":"2025-12-22","lifecycle":null,"limits":{"context":200000,"output":65535},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4.7 Original Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-22","retired":false,"tags":null},"zai-org/glm-4.7:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.1,"input":0.2,"output":0.8},"deprecated":false,"extra":{"attachment":false,"description":"Mature GLM model for dependable coding, reasoning, and structured agent tasks","family":"glm","open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"zai-org/glm-4.7:thinking","knowledge":"2025-04","last_updated":"2025-12-22","lifecycle":null,"limits":{"context":200000,"output":65535},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 4.7 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2025-12-22","retired":false,"tags":null},"zai-org/glm-5":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.13,"input":0.5,"output":2.55},"deprecated":false,"extra":{"attachment":false,"description":"General GLM flagship for coding, analysis, and tool-heavy engineering workflows","family":"glm","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"zai-org/glm-5","knowledge":null,"last_updated":"2026-02-12","lifecycle":null,"limits":{"context":200000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 5","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-12","retired":false,"tags":null},"zai-org/glm-5-original":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"input":1,"output":3.2},"deprecated":false,"extra":{"attachment":false,"description":"Flagship GLM model for hybrid reasoning, coding, and agentic engineering","family":"glm","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true},"family":null,"id":"zai-org/glm-5-original","knowledge":null,"last_updated":"2026-02-11","lifecycle":null,"limits":{"context":200000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 5 Original","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-11","retired":false,"tags":null},"zai-org/glm-5-original:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.2,"input":1,"output":3.2},"deprecated":false,"extra":{"attachment":false,"description":"Flagship GLM model for hybrid reasoning, coding, and agentic engineering","family":"glm","open_weights":true,"reasoning_options":[],"structured_output":true},"family":null,"id":"zai-org/glm-5-original:thinking","knowledge":null,"last_updated":"2026-02-11","lifecycle":null,"limits":{"context":200000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 5 Original Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-11","retired":false,"tags":null},"zai-org/glm-5.1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":0.75,"output":2.6},"deprecated":false,"extra":{"attachment":false,"description":"Strong GLM coding model for agentic engineering, terminals, and repository generation","family":"glm","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"zai-org/glm-5.1","knowledge":null,"last_updated":"2026-04-07","lifecycle":null,"limits":{"context":200000,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 5.1","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-07","retired":false,"tags":null},"zai-org/glm-5.1:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":0.75,"output":2.6},"deprecated":false,"extra":{"attachment":false,"description":"Strong GLM coding model for agentic engineering, terminals, and repository generation","family":"glm","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"zai-org/glm-5.1:thinking","knowledge":null,"last_updated":"2026-04-07","lifecycle":null,"limits":{"context":200000,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 5.1 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-04-07","retired":false,"tags":null},"zai-org/glm-5.2":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.078,"input":0.42,"output":1.32},"deprecated":false,"extra":{"attachment":false,"description":"Open flagship GLM for long-horizon coding agents and million-token context work","family":"glm","open_weights":true,"reasoning_options":[{"type":"effort","values":["high","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"zai-org/glm-5.2","knowledge":null,"last_updated":"2026-06-13","lifecycle":null,"limits":{"context":1048576,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 5.2","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-13","retired":false,"tags":null},"zai-org/glm-5.2:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.078,"input":0.42,"output":1.32},"deprecated":false,"extra":{"attachment":false,"description":"Open flagship GLM for long-horizon coding agents and million-token context work","family":"glm","open_weights":true,"reasoning_options":[{"type":"effort","values":["high","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"zai-org/glm-5.2:thinking","knowledge":null,"last_updated":"2026-06-13","lifecycle":null,"limits":{"context":1048576,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 5.2 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-06-13","retired":false,"tags":null},"zai-org/glm-5:thinking":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.13,"input":0.5,"output":2.55},"deprecated":false,"extra":{"attachment":false,"description":"General GLM flagship for coding, analysis, and tool-heavy engineering workflows","family":"glm","open_weights":true,"reasoning_options":[],"structured_output":true,"temperature":true},"family":null,"id":"zai-org/glm-5:thinking","knowledge":null,"last_updated":"2026-02-12","lifecycle":null,"limits":{"context":200000,"output":128000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM 5 Thinking","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-02-12","retired":false,"tags":null},"zai-org/glm-latest":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.078,"input":0.42,"output":1.32},"deprecated":false,"extra":{"attachment":false,"description":"Flagship GLM model for hybrid reasoning, coding, and agentic engineering","family":"glm","open_weights":true,"reasoning_options":[{"type":"effort","values":["high","xhigh"]}],"structured_output":true},"family":null,"id":"zai-org/glm-latest","knowledge":null,"last_updated":"2026-05-03","lifecycle":null,"limits":{"context":1048576,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM Latest","pricing":null,"provider":"nano_gpt","provider_model_id":null,"release_date":"2026-05-03","retired":false,"tags":null}},"name":"NanoGPT","pricing_defaults":null};
|
|
4
|
+
const provider = /* @__PURE__ */ createProviderCatalog(data);
|
|
5
|
+
export default provider;
|