@agentjido/llmdb 2026.8.2 → 2026.8.3

This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
Files changed (180) hide show
  1. package/dist/full.js +177 -169
  2. package/dist/generated/manifest.d.ts +1 -1
  3. package/dist/generated/manifest.js +1 -1
  4. package/dist/generated/provider-loaders.js +8 -0
  5. package/dist/providers/abacus.d.ts +1 -1
  6. package/dist/providers/abacus.js +1 -1
  7. package/dist/providers/aiand.d.ts +1 -1
  8. package/dist/providers/aiand.js +1 -1
  9. package/dist/providers/aihubmix.d.ts +1 -1
  10. package/dist/providers/aihubmix.js +1 -1
  11. package/dist/providers/alibaba.d.ts +1 -1
  12. package/dist/providers/alibaba.js +1 -1
  13. package/dist/providers/alibaba_cn.js +1 -1
  14. package/dist/providers/alibaba_token_plan.d.ts +1 -1
  15. package/dist/providers/alibaba_token_plan.js +1 -1
  16. package/dist/providers/alibaba_token_plan_cn.d.ts +1 -1
  17. package/dist/providers/alibaba_token_plan_cn.js +1 -1
  18. package/dist/providers/amazon_bedrock.d.ts +1 -1
  19. package/dist/providers/amazon_bedrock.js +1 -1
  20. package/dist/providers/ambient.js +1 -1
  21. package/dist/providers/amd.d.ts +11 -0
  22. package/dist/providers/amd.js +5 -0
  23. package/dist/providers/anthropic.js +1 -1
  24. package/dist/providers/azure.d.ts +1 -1
  25. package/dist/providers/azure.js +1 -1
  26. package/dist/providers/azure_cognitive_services.d.ts +1 -1
  27. package/dist/providers/azure_cognitive_services.js +1 -1
  28. package/dist/providers/baseten.d.ts +1 -1
  29. package/dist/providers/baseten.js +1 -1
  30. package/dist/providers/berget.js +1 -1
  31. package/dist/providers/blueclaw.js +1 -1
  32. package/dist/providers/chutes.d.ts +1 -1
  33. package/dist/providers/chutes.js +1 -1
  34. package/dist/providers/clarifai.js +1 -1
  35. package/dist/providers/cloudferro_sherlock.js +1 -1
  36. package/dist/providers/cloudflare_ai_gateway.d.ts +1 -1
  37. package/dist/providers/cloudflare_ai_gateway.js +1 -1
  38. package/dist/providers/cloudflare_workers_ai.d.ts +1 -1
  39. package/dist/providers/cloudflare_workers_ai.js +1 -1
  40. package/dist/providers/coralbricks.d.ts +11 -0
  41. package/dist/providers/coralbricks.js +5 -0
  42. package/dist/providers/cortecs.d.ts +1 -1
  43. package/dist/providers/cortecs.js +1 -1
  44. package/dist/providers/crof.js +1 -1
  45. package/dist/providers/crossmodel.d.ts +1 -1
  46. package/dist/providers/crossmodel.js +1 -1
  47. package/dist/providers/crusoe.d.ts +11 -0
  48. package/dist/providers/crusoe.js +5 -0
  49. package/dist/providers/daoxe.js +1 -1
  50. package/dist/providers/deepinfra.d.ts +1 -1
  51. package/dist/providers/deepinfra.js +1 -1
  52. package/dist/providers/deepseek.js +1 -1
  53. package/dist/providers/digitalocean.d.ts +1 -1
  54. package/dist/providers/digitalocean.js +1 -1
  55. package/dist/providers/edenai.d.ts +11 -0
  56. package/dist/providers/edenai.js +5 -0
  57. package/dist/providers/empiriolabs.d.ts +1 -1
  58. package/dist/providers/empiriolabs.js +1 -1
  59. package/dist/providers/evroc.d.ts +1 -1
  60. package/dist/providers/evroc.js +1 -1
  61. package/dist/providers/fastrouter.js +1 -1
  62. package/dist/providers/fireworks_ai.d.ts +1 -1
  63. package/dist/providers/fireworks_ai.js +1 -1
  64. package/dist/providers/friendli.d.ts +1 -1
  65. package/dist/providers/friendli.js +1 -1
  66. package/dist/providers/github_copilot.d.ts +1 -1
  67. package/dist/providers/github_copilot.js +1 -1
  68. package/dist/providers/gmicloud.js +1 -1
  69. package/dist/providers/google.d.ts +1 -1
  70. package/dist/providers/google.js +1 -1
  71. package/dist/providers/google_vertex.d.ts +1 -1
  72. package/dist/providers/google_vertex.js +1 -1
  73. package/dist/providers/greenpt.js +1 -1
  74. package/dist/providers/groq.js +1 -1
  75. package/dist/providers/hetzner.d.ts +1 -1
  76. package/dist/providers/hetzner.js +1 -1
  77. package/dist/providers/huggingface.d.ts +1 -1
  78. package/dist/providers/huggingface.js +1 -1
  79. package/dist/providers/hyper.d.ts +1 -1
  80. package/dist/providers/hyper.js +1 -1
  81. package/dist/providers/impossibl.js +1 -1
  82. package/dist/providers/inceptron.d.ts +1 -1
  83. package/dist/providers/inceptron.js +1 -1
  84. package/dist/providers/inferx.d.ts +1 -1
  85. package/dist/providers/inferx.js +1 -1
  86. package/dist/providers/infomaniak.js +1 -1
  87. package/dist/providers/io_net.js +1 -1
  88. package/dist/providers/kenari.js +1 -1
  89. package/dist/providers/kilo.d.ts +1 -1
  90. package/dist/providers/kilo.js +1 -1
  91. package/dist/providers/llmgateway.d.ts +1 -1
  92. package/dist/providers/llmgateway.js +1 -1
  93. package/dist/providers/llmtr.d.ts +1 -1
  94. package/dist/providers/llmtr.js +1 -1
  95. package/dist/providers/lmstudio.js +1 -1
  96. package/dist/providers/meganova.js +1 -1
  97. package/dist/providers/merge_gateway.d.ts +1 -1
  98. package/dist/providers/merge_gateway.js +1 -1
  99. package/dist/providers/meta.d.ts +1 -1
  100. package/dist/providers/meta.js +1 -1
  101. package/dist/providers/modal.js +1 -1
  102. package/dist/providers/modelscope.js +1 -1
  103. package/dist/providers/nano_gpt.d.ts +1 -1
  104. package/dist/providers/nano_gpt.js +1 -1
  105. package/dist/providers/nearai.js +1 -1
  106. package/dist/providers/nebius.d.ts +1 -1
  107. package/dist/providers/nebius.js +1 -1
  108. package/dist/providers/neon.d.ts +1 -1
  109. package/dist/providers/neon.js +1 -1
  110. package/dist/providers/neuralwatt.d.ts +1 -1
  111. package/dist/providers/neuralwatt.js +1 -1
  112. package/dist/providers/novita_ai.js +1 -1
  113. package/dist/providers/nvidia.d.ts +1 -1
  114. package/dist/providers/nvidia.js +1 -1
  115. package/dist/providers/ofox.d.ts +1 -1
  116. package/dist/providers/ofox.js +1 -1
  117. package/dist/providers/opencode.d.ts +1 -1
  118. package/dist/providers/opencode.js +1 -1
  119. package/dist/providers/opencode_go.d.ts +1 -1
  120. package/dist/providers/opencode_go.js +1 -1
  121. package/dist/providers/openrouter.d.ts +1 -1
  122. package/dist/providers/openrouter.js +1 -1
  123. package/dist/providers/perplexity_agent.d.ts +1 -1
  124. package/dist/providers/perplexity_agent.js +1 -1
  125. package/dist/providers/pioneer.d.ts +1 -1
  126. package/dist/providers/pioneer.js +1 -1
  127. package/dist/providers/privatemode_ai.d.ts +1 -1
  128. package/dist/providers/privatemode_ai.js +1 -1
  129. package/dist/providers/regolo_ai.d.ts +1 -1
  130. package/dist/providers/regolo_ai.js +1 -1
  131. package/dist/providers/requesty.d.ts +1 -1
  132. package/dist/providers/requesty.js +1 -1
  133. package/dist/providers/runinfra.d.ts +11 -0
  134. package/dist/providers/runinfra.js +5 -0
  135. package/dist/providers/salad_cloud.d.ts +11 -0
  136. package/dist/providers/salad_cloud.js +5 -0
  137. package/dist/providers/scnet_token_plan.d.ts +11 -0
  138. package/dist/providers/scnet_token_plan.js +5 -0
  139. package/dist/providers/siliconflow.js +1 -1
  140. package/dist/providers/siliconflow_cn.js +1 -1
  141. package/dist/providers/snowflake_cortex.d.ts +1 -1
  142. package/dist/providers/snowflake_cortex.js +1 -1
  143. package/dist/providers/stackit.js +1 -1
  144. package/dist/providers/submodel.js +1 -1
  145. package/dist/providers/synthetic.js +1 -1
  146. package/dist/providers/tensorx.js +1 -1
  147. package/dist/providers/thinkingmachines.js +1 -1
  148. package/dist/providers/tinfoil.d.ts +1 -1
  149. package/dist/providers/tinfoil.js +1 -1
  150. package/dist/providers/togetherai.d.ts +1 -1
  151. package/dist/providers/togetherai.js +1 -1
  152. package/dist/providers/umans_ai.d.ts +1 -1
  153. package/dist/providers/umans_ai.js +1 -1
  154. package/dist/providers/umans_ai_coding_plan.d.ts +1 -1
  155. package/dist/providers/umans_ai_coding_plan.js +1 -1
  156. package/dist/providers/upstage.d.ts +1 -1
  157. package/dist/providers/upstage.js +1 -1
  158. package/dist/providers/venice.d.ts +1 -1
  159. package/dist/providers/venice.js +1 -1
  160. package/dist/providers/vercel.d.ts +1 -1
  161. package/dist/providers/vercel.js +1 -1
  162. package/dist/providers/vivgrid.d.ts +1 -1
  163. package/dist/providers/vivgrid.js +1 -1
  164. package/dist/providers/vultr.js +1 -1
  165. package/dist/providers/wandb.d.ts +1 -1
  166. package/dist/providers/wandb.js +1 -1
  167. package/dist/providers/watsonx.d.ts +11 -0
  168. package/dist/providers/watsonx.js +5 -0
  169. package/dist/providers/xai.d.ts +1 -1
  170. package/dist/providers/xai.js +1 -1
  171. package/dist/providers/zai_coding_plan.d.ts +1 -1
  172. package/dist/providers/zai_coding_plan.js +1 -1
  173. package/dist/providers/zeldoc.d.ts +1 -1
  174. package/dist/providers/zeldoc.js +1 -1
  175. package/dist/providers/zenmux.d.ts +1 -1
  176. package/dist/providers/zenmux.js +1 -1
  177. package/dist/providers/zhipuai_coding_plan.d.ts +1 -1
  178. package/dist/providers/zhipuai_coding_plan.js +1 -1
  179. package/dist/snapshot.js +352 -336
  180. package/package.json +2 -2
@@ -1,5 +1,5 @@
1
1
  import { createProviderCatalog } from "../provider.js";
2
2
 
3
- export const data = {"alias_of":null,"base_url":"https://integrate.api.nvidia.com/v1","catalog_only":true,"config_schema":null,"doc":"https://docs.api.nvidia.com/nim/","env":["NVIDIA_API_KEY"],"exclude_models":null,"extra":null,"id":"nvidia","models":{"abacusai/dracarys-llama-3.1-70b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","open_weights":true,"temperature":true},"family":null,"id":"abacusai/dracarys-llama-3.1-70b-instruct","knowledge":null,"last_updated":"2025-05-22","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"dracarys-llama-3.1-70b-instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-09-11","retired":false,"tags":null},"baai/bge-m3":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Flagship model for demanding analysis, coding, and production agent workflows","family":"bge","open_weights":true,"temperature":false},"family":null,"id":"baai/bge-m3","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":8192,"output":1024},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"BGE M3","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-01-30","retired":false,"tags":null},"black-forest-labs/flux.1-dev":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Image model for prompt-driven generation, editing, and visual design workflows","family":"flux","open_weights":false,"temperature":true},"family":null,"id":"black-forest-labs/flux.1-dev","knowledge":"2024-08","last_updated":"2025-09-05","lifecycle":null,"limits":{"context":4096},"modalities":{"input":["text"],"output":["image"]},"model":null,"name":"FLUX.1-dev","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-08-01","retired":false,"tags":null},"black-forest-labs/flux_1-kontext-dev":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Image model for prompt-driven generation, editing, and visual design workflows","open_weights":true,"temperature":false},"family":null,"id":"black-forest-labs/flux_1-kontext-dev","knowledge":null,"last_updated":"2025-08-12","lifecycle":null,"limits":{"context":40960,"output":40960},"modalities":{"input":["text","image"],"output":["image"]},"model":null,"name":"FLUX.1-Kontext-dev","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-08-12","retired":false,"tags":null},"black-forest-labs/flux_1-schnell":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Image model for prompt-driven generation, editing, and visual design workflows","open_weights":true,"structured_output":false,"temperature":false},"family":null,"id":"black-forest-labs/flux_1-schnell","knowledge":"2024-07","last_updated":"2026-02-04","lifecycle":null,"limits":{"context":77},"modalities":{"input":["text"],"output":["image"]},"model":null,"name":"FLUX.1-schnell","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-08-01","retired":false,"tags":null},"black-forest-labs/flux_2-klein-4b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Image model for prompt-driven generation, editing, and visual design workflows","family":"flux","open_weights":true,"temperature":true},"family":null,"id":"black-forest-labs/flux_2-klein-4b","knowledge":"2025-06","last_updated":"2026-01-31","lifecycle":null,"limits":{"context":40960,"output":40960},"modalities":{"input":["image","text"],"output":["image"]},"model":null,"name":"FLUX.2 Klein 4B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-01-14","retired":false,"tags":null},"bytedance/seed-oss-36b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Tool-capable chat model for instruction following and agentic application workflows","family":"seed","open_weights":false,"structured_output":true,"temperature":true},"family":null,"id":"bytedance/seed-oss-36b-instruct","knowledge":null,"last_updated":"2025-11-25","lifecycle":null,"limits":{"context":262000,"output":262000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"ByteDance-Seed/Seed-OSS-36B-Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-09-04","retired":false,"tags":null},"deepseek-ai/deepseek-v4-flash":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.0028,"input":0.14,"output":0.28},"deprecated":false,"extra":{"attachment":false,"description":"Fast DeepSeek V4 lane for economical reasoning, coding, and long-context work","family":"deepseek-flash","interleaved":{"field":"reasoning_content"},"open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"deepseek-ai/deepseek-v4-flash","knowledge":"2025-05","last_updated":"2026-04-24","lifecycle":null,"limits":{"context":1048576,"output":393216},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Flash","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-04-24","retired":false,"tags":null},"deepseek-ai/deepseek-v4-pro":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.003625,"input":0.435,"output":0.87},"deprecated":false,"extra":{"attachment":false,"description":"Open MoE flagship with million-token context for coding and long agent runs","family":"deepseek-thinking","interleaved":{"field":"reasoning_content"},"open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"deepseek-ai/deepseek-v4-pro","knowledge":"2025-05","last_updated":"2026-04-24","lifecycle":null,"limits":{"context":1048576,"output":393216},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Pro","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-04-24","retired":false,"tags":null},"google/gemma-2-2b-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","llmfit":{"architecture":"gemma2","context_length":4096,"discovered":false,"gguf_sources":[{"provider":"bartowski","repo":"bartowski/gemma-2-2b-it-GGUF"},{"provider":"mradermacher","repo":"mradermacher/gemma-2-2b-it-GGUF"}],"hf_downloads":556769,"hf_likes":1438,"matched_hugging_face_id":"google/gemma-2-2b-it","memory":{"min_ram_gb":1.5,"min_vram_gb":1.3,"recommended_ram_gb":2.4},"model_id":"google/gemma-2-2b-it","parameter_count":"2.6B","parameters_raw":2614341888,"pipeline_tag":"text-generation","provider":"Google","quantization":"Q4_K_M","release_date":"2024-07-16","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"google/gemma-2-2b-it","knowledge":null,"last_updated":"2024-07-16","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Gemma 2 2b It","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-07-16","retired":false,"tags":null},"google/gemma-3-12b-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"gemma","llmfit":{"architecture":"gemma3","context_length":4096,"discovered":false,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/gemma-3-12b-it-GGUF"},{"provider":"ggml-org","repo":"ggml-org/gemma-3-12b-it-GGUF"},{"provider":"mradermacher","repo":"mradermacher/gemma-3-12b-it-GGUF"}],"hf_downloads":1281955,"hf_likes":797,"matched_hugging_face_id":"google/gemma-3-12b-it","memory":{"min_ram_gb":6.8,"min_vram_gb":6.2,"recommended_ram_gb":11.4},"model_id":"google/gemma-3-12b-it","parameter_count":"12.2B","parameters_raw":12187325040,"pipeline_tag":"image-text-to-text","provider":"Google","quantization":"Q4_K_M","release_date":"2025-03-01","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"temperature":true},"family":null,"id":"google/gemma-3-12b-it","knowledge":null,"last_updated":"2025-03-12","lifecycle":null,"limits":{"context":131072,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 3 12B IT","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-03-12","retired":false,"tags":null},"google/gemma-3-4b-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"gemma","llmfit":{"architecture":"gemma3","context_length":4096,"discovered":false,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/gemma-3-4b-it-GGUF"},{"provider":"ggml-org","repo":"ggml-org/gemma-3-4b-it-GGUF"},{"provider":"mradermacher","repo":"mradermacher/gemma-3-4b-it-GGUF"}],"hf_downloads":1869741,"hf_likes":1441,"matched_hugging_face_id":"google/gemma-3-4b-it","memory":{"min_ram_gb":2.4,"min_vram_gb":2.2,"recommended_ram_gb":4.0},"model_id":"google/gemma-3-4b-it","parameter_count":"4.3B","parameters_raw":4300079472,"pipeline_tag":"image-text-to-text","provider":"Google","quantization":"Q4_K_M","release_date":"2025-02-20","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"temperature":true},"family":null,"id":"google/gemma-3-4b-it","knowledge":null,"last_updated":"2025-03-12","lifecycle":null,"limits":{"context":131072,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 3 4B IT","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-03-12","retired":false,"tags":null},"google/gemma-3n-e2b-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"google/gemma-3n-e2b-it","knowledge":"2024-06","last_updated":"2025-06-12","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 3n E2b It","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-06-12","retired":false,"tags":null},"google/gemma-3n-e4b-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"google/gemma-3n-e4b-it","knowledge":"2024-06","last_updated":"2025-06-03","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 3n E4b It","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-06-03","retired":false,"tags":null},"google/gemma-4-31b-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"gemma","open_weights":true,"reasoning_options":[{"type":"toggle"}],"temperature":true},"family":null,"id":"google/gemma-4-31b-it","knowledge":"2025-01","last_updated":"2026-04-02","lifecycle":null,"limits":{"context":256000,"output":16384},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Gemma-4-31B-IT","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-04-02","retired":false,"tags":null},"google/google-paligemma":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Gemini multimodal model for text, image, audio, video, and document tasks","open_weights":true,"temperature":true},"family":null,"id":"google/google-paligemma","knowledge":null,"last_updated":"2024-08-26","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"paligemma","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-05-14","retired":false,"tags":null},"meta/esm2-650m":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","open_weights":true,"temperature":true},"family":null,"id":"meta/esm2-650m","knowledge":null,"last_updated":"2025-03-10","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"esm2-650m","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-08-29","retired":false,"tags":null},"meta/esmfold":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","open_weights":true,"temperature":true},"family":null,"id":"meta/esmfold","knowledge":null,"last_updated":"2025-06-12","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"esmfold","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-03-15","retired":false,"tags":null},"meta/llama-3.1-70b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"meta/llama-3.1-70b-instruct","knowledge":null,"last_updated":"2024-07-16","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 70b Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-07-16","retired":false,"tags":null},"meta/llama-3.1-8b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"temperature":true},"family":null,"id":"meta/llama-3.1-8b-instruct","knowledge":"2023-12","last_updated":"2025-01-01","lifecycle":null,"limits":{"context":16000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 8B Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-01-01","retired":false,"tags":null},"meta/llama-3.2-11b-vision-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Open Llama multimodal model for image understanding and text reasoning","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"meta/llama-3.2-11b-vision-instruct","knowledge":"2023-12","last_updated":"2024-09-18","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Llama 3.2 11b Vision Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-09-18","retired":false,"tags":null},"meta/llama-3.2-1b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"meta/llama-3.2-1b-instruct","knowledge":"2023-12","last_updated":"2024-09-18","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.2 1b Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-09-18","retired":false,"tags":null},"meta/llama-3.2-3b-instruct":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"meta/llama-3.2-3b-instruct","knowledge":null,"last_updated":"2024-09-18","lifecycle":null,"limits":{"context":32768,"output":32000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.2 3B Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-09-18","retired":false,"tags":null},"meta/llama-3.2-90b-vision-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Open Llama multimodal model for image understanding and text reasoning","family":"llama","open_weights":true,"temperature":true},"family":null,"id":"meta/llama-3.2-90b-vision-instruct","knowledge":"2023-12","last_updated":"2024-09-25","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Llama-3.2-90B-Vision-Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-09-25","retired":false,"tags":null},"meta/llama-3.3-70b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"meta/llama-3.3-70b-instruct","knowledge":null,"last_updated":"2024-11-26","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.3 70b Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-11-26","retired":false,"tags":null},"meta/llama-4-maverick-17b-128e-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Open multimodal Llama model for strong reasoning and fast responses","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"meta/llama-4-maverick-17b-128e-instruct","knowledge":"2024-02","last_updated":"2025-04-01","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Llama 4 Maverick 17b 128e Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-04-01","retired":false,"tags":null},"meta/llama-guard-4-12b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Safety model for policy screening, moderation, and risk-aware routing workflows","family":"llama","open_weights":true,"temperature":true},"family":null,"id":"meta/llama-guard-4-12b","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Llama Guard 4 12B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-04-05","retired":false,"tags":null},"microsoft/phi-4-mini-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Efficient model for low-latency assistance, extraction, and routine automation","family":"phi","open_weights":true,"temperature":true},"family":null,"id":"microsoft/phi-4-mini-instruct","knowledge":"2024-12","last_updated":"2025-09-05","lifecycle":null,"limits":{"context":131072,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Phi-4-Mini","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-12-01","retired":false,"tags":null},"microsoft/phi-4-multimodal-instruct":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"General-purpose chat model for instruction following, writing, and analysis","open_weights":false,"structured_output":false},"family":null,"id":"microsoft/phi-4-multimodal-instruct","knowledge":null,"last_updated":"2025-07-26","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Phi 4 Multimodal","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-07-26","retired":false,"tags":null},"minimaxai/minimax-m2.7":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"MiniMax model for chat, coding, office work, and agentic tasks","family":"minimax","open_weights":true,"reasoning_options":[],"temperature":true},"family":null,"id":"minimaxai/minimax-m2.7","knowledge":null,"last_updated":"2026-04-11","lifecycle":null,"limits":{"context":204800,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MiniMax-M2.7","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-03-18","retired":false,"tags":null},"minimaxai/minimax-m3":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"MiniMax multimodal model for long-context coding, perception, and agent planning","family":"minimax","open_weights":true,"reasoning_options":[{"type":"toggle"}],"temperature":true},"family":null,"id":"minimaxai/minimax-m3","knowledge":null,"last_updated":"2026-06-01","lifecycle":null,"limits":{"context":1000000,"output":16384},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"MiniMax-M3","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-06-01","retired":false,"tags":null},"mistralai/magistral-small-2506":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Mistral reasoning model for transparent analysis, math, and complex decisions","open_weights":false,"structured_output":false},"family":null,"id":"mistralai/magistral-small-2506","knowledge":null,"last_updated":"2025-09-25","lifecycle":null,"limits":{"context":32768,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Magistral Small 2506","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-09-25","retired":false,"tags":null},"mistralai/ministral-14b-instruct-2512":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Compact Mistral VLM for chat and instruction-based workloads","family":"ministral","open_weights":true,"temperature":true},"family":null,"id":"mistralai/ministral-14b-instruct-2512","knowledge":null,"last_updated":"2025-12-02","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Ministral 3 14B Instruct 2512","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-12-02","retired":false,"tags":null},"mistralai/mistral-7b-instruct-v0.3":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"mistralai/mistral-7b-instruct-v0.3","knowledge":null,"last_updated":"2025-04-01","lifecycle":null,"limits":{"context":65536,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mistral-7B-Instruct-v0.3","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-04-01","retired":false,"tags":null},"mistralai/mistral-large-3-675b-instruct-2512":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Flagship Mistral model for advanced reasoning, coding, and multilingual work","family":"mistral-large","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"mistralai/mistral-large-3-675b-instruct-2512","knowledge":"2025-01","last_updated":"2025-12-02","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Mistral Large 3 675B Instruct 2512","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-12-02","retired":false,"tags":null},"mistralai/mistral-medium-3-instruct":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","family":"mistral-medium","open_weights":false,"structured_output":false},"family":null,"id":"mistralai/mistral-medium-3-instruct","knowledge":null,"last_updated":"2025-09-25","lifecycle":null,"limits":{"context":131072,"output":32768},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Mistral Medium 3","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-09-25","retired":false,"tags":null},"mistralai/mistral-medium-3.5-128b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Balanced Mistral model for enterprise assistants, multilingual work, and tools","family":"mistral-medium","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"mistralai/mistral-medium-3.5-128b","knowledge":null,"last_updated":"2026-04-29","lifecycle":null,"limits":{"context":262144,"output":32768},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Mistral Medium 3.5","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-04-29","retired":false,"tags":null},"mistralai/mistral-nemotron":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","family":"nemotron","open_weights":true,"temperature":true},"family":null,"id":"mistralai/mistral-nemotron","knowledge":null,"last_updated":"2025-06-12","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"mistral-nemotron","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-06-11","retired":false,"tags":null},"mistralai/mistral-small-4-119b-2603":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Efficient Mistral model for fast chat, extraction, and production assistants","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"mistralai/mistral-small-4-119b-2603","knowledge":null,"last_updated":"2026-03-16","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"mistral-small-4-119b-2603","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-03-16","retired":false,"tags":null},"mistralai/mixtral-8x22b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","open_weights":true,"temperature":true},"family":null,"id":"mistralai/mixtral-8x22b-instruct","knowledge":null,"last_updated":"2024-04-17","lifecycle":null,"limits":{"context":65536,"output":13108},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mistral: Mixtral 8x22B Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-04-17","retired":false,"tags":null},"mistralai/mixtral-8x7b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","open_weights":true,"temperature":true},"family":null,"id":"mistralai/mixtral-8x7b-instruct","knowledge":null,"last_updated":"2026-03-15","lifecycle":null,"limits":{"context":32768,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mistral: Mixtral 8x7B Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2023-12-10","retired":false,"tags":null},"moonshotai/kimi-k2-instruct-0905":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Kimi model for long-context chat, coding, and agentic reasoning","family":"kimi-k2","open_weights":true,"status":"deprecated","temperature":true},"family":null,"id":"moonshotai/kimi-k2-instruct-0905","knowledge":"2024-10","last_updated":"2025-09-05","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Kimi K2 0905","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-09-05","retired":false,"tags":null},"moonshotai/kimi-k2.6":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Kimi multimodal agent model for visual understanding, coding, and planning","family":"kimi-k2","interleaved":{"field":"reasoning_content"},"open_weights":true,"reasoning_options":[{"type":"effort","values":["none","minimal","low","medium","high","xhigh","max"]}],"status":"deprecated","structured_output":true,"temperature":true},"family":null,"id":"moonshotai/kimi-k2.6","knowledge":"2025-01","last_updated":"2026-04-21","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Kimi K2.6","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-04-21","retired":false,"tags":null},"nvidia/active-speaker-detection":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Nemotron multimodal model for visual reasoning and agentic AI workflows","open_weights":true,"temperature":false},"family":null,"id":"nvidia/active-speaker-detection","knowledge":null,"last_updated":"2026-04-16","lifecycle":null,"limits":{"output":4096},"modalities":{"input":["video"],"output":["text"]},"model":null,"name":"Active Speaker Detection","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-04-16","retired":false,"tags":null},"nvidia/bevformer":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Nemotron multimodal model for visual reasoning and agentic AI workflows","open_weights":true,"temperature":true},"family":null,"id":"nvidia/bevformer","knowledge":null,"last_updated":"2025-07-20","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["video"],"output":["text"]},"model":null,"name":"bevformer","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-03-18","retired":false,"tags":null},"nvidia/cosmos-predict1-5b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Video model for prompt-guided generation, editing, and motion workflows","open_weights":true,"temperature":false},"family":null,"id":"nvidia/cosmos-predict1-5b","knowledge":null,"last_updated":"2025-03-18","lifecycle":null,"limits":{"output":4096},"modalities":{"input":["text","image","video"],"output":["video"]},"model":null,"name":"cosmos-predict1-5b","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-03-18","retired":false,"tags":null},"nvidia/cosmos-reason2-8b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Vision language model for physical-world understanding with structured reasoning on video and images","open_weights":true,"reasoning_options":[],"temperature":true},"family":null,"id":"nvidia/cosmos-reason2-8b","knowledge":null,"last_updated":"2025-12-01","lifecycle":null,"limits":{"context":131072,"output":16384},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Cosmos Reason2 8B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-12-01","retired":false,"tags":null},"nvidia/cosmos-transfer1-7b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Video model for prompt-guided generation, editing, and motion workflows","open_weights":true,"temperature":false},"family":null,"id":"nvidia/cosmos-transfer1-7b","knowledge":null,"last_updated":"2025-06-30","lifecycle":null,"limits":{"output":4096},"modalities":{"input":["text","image","video"],"output":["video"]},"model":null,"name":"cosmos-transfer1-7b","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-06-13","retired":false,"tags":null},"nvidia/cosmos-transfer2_5-2b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Video model for prompt-guided generation, editing, and motion workflows","open_weights":true,"temperature":false},"family":null,"id":"nvidia/cosmos-transfer2_5-2b","knowledge":null,"last_updated":"2026-02-26","lifecycle":null,"limits":{"output":4096},"modalities":{"input":["text","image","video"],"output":["video"]},"model":null,"name":"cosmos-transfer2.5-2b","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-02-26","retired":false,"tags":null},"nvidia/gliner-pii":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","open_weights":true,"temperature":true},"family":null,"id":"nvidia/gliner-pii","knowledge":null,"last_updated":"2026-03-03","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"gliner-pii","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-03-03","retired":false,"tags":null},"nvidia/llama-3.1-nemotron-70b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","family":"nemotron","open_weights":true,"temperature":true},"family":null,"id":"nvidia/llama-3.1-nemotron-70b-instruct","knowledge":null,"last_updated":"2025-04-15","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 Nemotron 70B Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-04-15","retired":false,"tags":null},"nvidia/llama-3.1-nemotron-nano-8b-v1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"temperature":true},"family":null,"id":"nvidia/llama-3.1-nemotron-nano-8b-v1","knowledge":null,"last_updated":"2025-03-18","lifecycle":null,"limits":{"context":131072,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 Nemotron Nano 8B v1","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-03-18","retired":false,"tags":null},"nvidia/llama-3.1-nemotron-nano-vl-8b-v1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Nemotron multimodal model for visual reasoning and agentic AI workflows","family":"nemotron","open_weights":true,"reasoning_options":[],"temperature":true},"family":null,"id":"nvidia/llama-3.1-nemotron-nano-vl-8b-v1","knowledge":null,"last_updated":"2025-04-10","lifecycle":null,"limits":{"context":32768,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Llama 3.1 Nemotron Nano VL 8B v1","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-04-10","retired":false,"tags":null},"nvidia/llama-3.1-nemotron-safety-guard-8b-v3":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Safety model for policy screening, moderation, and risk-aware routing workflows","family":"nemotron","open_weights":true,"temperature":false},"family":null,"id":"nvidia/llama-3.1-nemotron-safety-guard-8b-v3","knowledge":null,"last_updated":"2025-10-28","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"llama-3.1-nemotron-safety-guard-8b-v3","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-10-28","retired":false,"tags":null},"nvidia/llama-3.1-nemotron-ultra-253b-v1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Flagship Nemotron model for high-throughput reasoning and complex agents","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"temperature":true},"family":null,"id":"nvidia/llama-3.1-nemotron-ultra-253b-v1","knowledge":null,"last_updated":"2025-04-07","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 Nemotron Ultra 253B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-04-07","retired":false,"tags":null},"nvidia/llama-3.3-nemotron-super-49b-v1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"temperature":true},"family":null,"id":"nvidia/llama-3.3-nemotron-super-49b-v1","knowledge":null,"last_updated":"2025-04-07","lifecycle":null,"limits":{"context":131072,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.3 Nemotron Super 49B v1","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-04-07","retired":false,"tags":null},"nvidia/llama-3.3-nemotron-super-49b-v1.5":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"temperature":true},"family":null,"id":"nvidia/llama-3.3-nemotron-super-49b-v1.5","knowledge":null,"last_updated":"2025-07-25","lifecycle":null,"limits":{"context":131072,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.3 Nemotron Super 49B v1.5","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-07-25","retired":false,"tags":null},"nvidia/llama-3_2-nemoretriever-300m-embed-v1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Embedding model for semantic search, retrieval, clustering, and ranking pipelines","open_weights":true,"temperature":false},"family":null,"id":"nvidia/llama-3_2-nemoretriever-300m-embed-v1","knowledge":null,"last_updated":"2025-07-24","lifecycle":null,"limits":{"context":32768,"output":2048},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"llama-3_2-nemoretriever-300m-embed-v1","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-07-24","retired":false,"tags":null},"nvidia/llama-nemotron-embed-vl-1b-v2":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Embedding model for semantic search, retrieval, clustering, and ranking pipelines","family":"nemotron","open_weights":true,"temperature":false},"family":null,"id":"nvidia/llama-nemotron-embed-vl-1b-v2","knowledge":null,"last_updated":"2026-02-10","lifecycle":null,"limits":{"context":32768,"output":2048},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"llama-nemotron-embed-vl-1b-v2","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-02-10","retired":false,"tags":null},"nvidia/llama-nemotron-rerank-vl-1b-v2":{"aliases":[],"base_url":null,"capabilities":{"chat":false,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":true,"streaming":{"text":false,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Reranking model for improving retrieval quality in search and recommendation systems","family":"nemotron","open_weights":true,"temperature":false},"family":null,"id":"nvidia/llama-nemotron-rerank-vl-1b-v2","knowledge":null,"last_updated":"2026-03-31","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"llama-nemotron-rerank-vl-1b-v2","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-03-31","retired":false,"tags":null},"nvidia/magpie-tts-zeroshot":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Speech generation model for controllable voice, narration, and audio delivery","open_weights":true,"temperature":false},"family":null,"id":"nvidia/magpie-tts-zeroshot","knowledge":null,"last_updated":"2025-06-12","lifecycle":null,"limits":{"output":4096},"modalities":{"input":["text","audio"],"output":["audio"]},"model":null,"name":"magpie-tts-zeroshot","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-05-22","retired":false,"tags":null},"nvidia/nemotron-3-content-safety":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Safety model for policy screening, moderation, and risk-aware routing workflows","family":"nemotron","open_weights":true,"temperature":false},"family":null,"id":"nvidia/nemotron-3-content-safety","knowledge":null,"last_updated":"2026-04-16","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"nemotron-3-content-safety","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-04-16","retired":false,"tags":null},"nvidia/nemotron-3-nano-30b-a3b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Small Nemotron 3 MoE for efficient coding, math, and long-context agents","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"temperature":true},"family":null,"id":"nvidia/nemotron-3-nano-30b-a3b","knowledge":"2024-09","last_updated":"2024-12","lifecycle":null,"limits":{"context":131072,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"nemotron-3-nano-30b-a3b","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-12","retired":false,"tags":null},"nvidia/nemotron-3-nano-omni-30b-a3b-reasoning":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Open Nemotron omni model combining reasoning with text, vision, and audio","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":32768,"min":-1,"type":"budget_tokens"}],"structured_output":true,"temperature":true},"family":null,"id":"nvidia/nemotron-3-nano-omni-30b-a3b-reasoning","knowledge":null,"last_updated":"2026-04-28","lifecycle":null,"limits":{"context":256000,"output":65536},"modalities":{"input":["text","image","video","audio"],"output":["text"]},"model":null,"name":"Nemotron 3 Nano Omni","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-04-28","retired":false,"tags":null},"nvidia/nemotron-3-super-120b-a12b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0.2,"output":0.8},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron middle tier for collaborative agents and high-volume reasoning workloads","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"temperature":true},"family":null,"id":"nvidia/nemotron-3-super-120b-a12b","knowledge":"2024-04","last_updated":"2026-03-11","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Nemotron 3 Super","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-03-11","retired":false,"tags":null},"nvidia/nemotron-3-ultra-550b-a55b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":0.5,"output":2.5},"deprecated":false,"extra":{"attachment":false,"description":"Largest Nemotron 3 model for maximum open-weight reasoning and agent accuracy","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"nvidia/nemotron-3-ultra-550b-a55b","knowledge":null,"last_updated":"2026-06-04","lifecycle":null,"limits":{"context":1000000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Nemotron 3 Ultra 550B A55B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-06-04","retired":false,"tags":null},"nvidia/nemotron-content-safety-reasoning-4b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Safety model for policy screening, moderation, and risk-aware routing workflows","family":"nemotron","open_weights":true,"reasoning_options":[],"temperature":false},"family":null,"id":"nvidia/nemotron-content-safety-reasoning-4b","knowledge":null,"last_updated":"2026-01-22","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"nemotron-content-safety-reasoning-4b","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-01-22","retired":false,"tags":null},"nvidia/nemotron-mini-4b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Compact Nemotron model for efficient reasoning and deployable AI agents","family":"nemotron","open_weights":true,"temperature":true},"family":null,"id":"nvidia/nemotron-mini-4b-instruct","knowledge":null,"last_updated":"2024-08-26","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"nemotron-mini-4b-instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-08-21","retired":false,"tags":null},"nvidia/nemotron-nano-12b-v2-vl":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Nemotron multimodal model for visual reasoning and agentic AI workflows","family":"nemotron","open_weights":true,"reasoning_options":[],"temperature":true},"family":null,"id":"nvidia/nemotron-nano-12b-v2-vl","knowledge":null,"last_updated":"2025-10-28","lifecycle":null,"limits":{"context":128000,"output":128000},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Nemotron Nano 12B v2 VL","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-10-28","retired":false,"tags":null},"nvidia/nemotron-voicechat":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Nemotron multimodal model for visual reasoning and agentic AI workflows","family":"nemotron","open_weights":true,"temperature":true},"family":null,"id":"nvidia/nemotron-voicechat","knowledge":null,"last_updated":"2026-03-16","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text","audio"],"output":["text"]},"model":null,"name":"nemotron-voicechat","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-03-16","retired":false,"tags":null},"nvidia/nv-embed-v1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Embedding model for semantic search, retrieval, clustering, and ranking pipelines","open_weights":true,"temperature":false},"family":null,"id":"nvidia/nv-embed-v1","knowledge":null,"last_updated":"2025-07-22","lifecycle":null,"limits":{"context":32768,"output":2048},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"nv-embed-v1","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-06-07","retired":false,"tags":null},"nvidia/nv-embedcode-7b-v1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","open_weights":true,"temperature":false},"family":null,"id":"nvidia/nv-embedcode-7b-v1","knowledge":null,"last_updated":"2025-05-29","lifecycle":null,"limits":{"context":32768,"output":2048},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"nv-embedcode-7b-v1","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-03-17","retired":false,"tags":null},"nvidia/nvidia-nemotron-nano-9b-v2":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Compact Nemotron model for efficient reasoning and deployable AI agents","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"temperature":true},"family":null,"id":"nvidia/nvidia-nemotron-nano-9b-v2","knowledge":"2024-09","last_updated":"2025-08-18","lifecycle":null,"limits":{"context":131072,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"nvidia-nemotron-nano-9b-v2","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-08-18","retired":false,"tags":null},"nvidia/rerank-qa-mistral-4b":{"aliases":[],"base_url":null,"capabilities":{"chat":false,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":true,"streaming":{"text":false,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Reranking model for improving retrieval quality in search and recommendation systems","open_weights":true,"temperature":false},"family":null,"id":"nvidia/rerank-qa-mistral-4b","knowledge":null,"last_updated":"2025-01-17","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"rerank-qa-mistral-4b","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-03-17","retired":false,"tags":null},"nvidia/riva-translate-4b-instruct-v1.1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Translation model for multilingual conversion, localization, and cross-language workflows","open_weights":true,"temperature":false},"family":null,"id":"nvidia/riva-translate-4b-instruct-v1.1","knowledge":null,"last_updated":"2025-12-12","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"riva-translate-4b-instruct-v1_1","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-12-12","retired":false,"tags":null},"nvidia/sparsedrive":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Nemotron multimodal model for visual reasoning and agentic AI workflows","open_weights":true,"temperature":true},"family":null,"id":"nvidia/sparsedrive","knowledge":null,"last_updated":"2025-07-20","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["video"],"output":["text"]},"model":null,"name":"sparsedrive","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-03-18","retired":false,"tags":null},"nvidia/streampetr":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Nemotron multimodal model for visual reasoning and agentic AI workflows","open_weights":true,"temperature":true},"family":null,"id":"nvidia/streampetr","knowledge":null,"last_updated":"2025-11-13","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["video"],"output":["text"]},"model":null,"name":"streampetr","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-11-13","retired":false,"tags":null},"nvidia/studiovoice":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","open_weights":true,"temperature":true},"family":null,"id":"nvidia/studiovoice","knowledge":null,"last_updated":"2025-06-13","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"studiovoice","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-10-03","retired":false,"tags":null},"nvidia/synthetic-video-detector":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Video model for prompt-guided generation, editing, and motion workflows","open_weights":true,"temperature":true},"family":null,"id":"nvidia/synthetic-video-detector","knowledge":null,"last_updated":"2026-04-16","lifecycle":null,"limits":{"output":4096},"modalities":{"input":["video"],"output":["text"]},"model":null,"name":"synthetic-video-detector","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-04-16","retired":false,"tags":null},"nvidia/usdcode":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","open_weights":false,"temperature":true},"family":null,"id":"nvidia/usdcode","knowledge":null,"last_updated":"2026-01-01","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"usdcode","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-01-01","retired":false,"tags":null},"nvidia/usdvalidate":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","open_weights":true,"temperature":false},"family":null,"id":"nvidia/usdvalidate","knowledge":null,"last_updated":"2025-01-08","lifecycle":null,"limits":{"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"usdvalidate","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-07-24","retired":false,"tags":null},"openai/gpt-oss-120b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open GPT reasoning model for self-hosted agents and controllable deployments","family":"gpt-oss","llmfit":{"architecture":"gpt_oss","context_length":4194304,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/gpt-oss-120b-GGUF"},{"provider":"ggml-org","repo":"ggml-org/gpt-oss-120b-GGUF"}],"hf_downloads":4197649,"hf_likes":5069,"matched_hugging_face_id":"openai/gpt-oss-120b","memory":{"min_ram_gb":67.3,"min_vram_gb":61.7,"recommended_ram_gb":112.1},"model_id":"openai/gpt-oss-120b","moe":{"active_experts":4,"active_parameters":9595358141,"is_moe":true,"num_experts":128},"parameter_count":"120.4B","parameters_raw":120412337472,"pipeline_tag":"text-generation","provider":"openai","quantization":"Q4_K_M","release_date":"2025-08-04","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"openai/gpt-oss-120b","knowledge":"2025-08","last_updated":"2025-08-14","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GPT-OSS-120B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-08-04","retired":false,"tags":null},"openai/gpt-oss-20b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open-weight GPT model for self-hosted reasoning and instruction-following workloads","family":"gpt-oss","llmfit":{"architecture":"gpt_oss","context_length":4194304,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/gpt-oss-20b-GGUF"},{"provider":"ggml-org","repo":"ggml-org/gpt-oss-20b-GGUF"},{"provider":"mradermacher","repo":"mradermacher/gpt-oss-20b-GGUF"}],"hf_downloads":8501701,"hf_likes":4869,"matched_hugging_face_id":"openai/gpt-oss-20b","memory":{"min_ram_gb":12.0,"min_vram_gb":11.0,"recommended_ram_gb":20.0},"model_id":"openai/gpt-oss-20b","moe":{"active_experts":4,"active_parameters":3630142231,"is_moe":true,"num_experts":32},"parameter_count":"21.5B","parameters_raw":21511953984,"pipeline_tag":"text-generation","provider":"openai","quantization":"Q4_K_M","release_date":"2025-08-04","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"openai/gpt-oss-20b","knowledge":null,"last_updated":"2025-08-05","lifecycle":null,"limits":{"context":131072,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GPT OSS 20B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-08-05","retired":false,"tags":null},"openai/whisper-large-v3":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Speech transcription model for accurate audio-to-text and captioning workflows","family":"whisper","open_weights":true,"temperature":false},"family":null,"id":"openai/whisper-large-v3","knowledge":"2023-09","last_updated":"2025-09-05","lifecycle":null,"limits":{"output":4096},"modalities":{"input":["audio"],"output":["text"]},"model":null,"name":"Whisper Large v3","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2023-09-01","retired":false,"tags":null},"poolside/laguna-xs-2.1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Agentic coding model from Poolside in the XS size class for local deployment","family":"laguna","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":true},"family":null,"id":"poolside/laguna-xs-2.1","knowledge":null,"last_updated":"2026-07-02","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Laguna XS 2.1","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-07-02","retired":false,"tags":null},"qwen/qwen-image":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Image model for prompt-driven generation, editing, and visual design workflows","family":"qwen","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"qwen/qwen-image","knowledge":null,"last_updated":"2025-08-07","lifecycle":null,"limits":null,"modalities":{"input":["text","image"],"output":["image"]},"model":null,"name":"Qwen Image","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-08-07","retired":false,"tags":null},"qwen/qwen-image-edit":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Image model for prompt-driven generation, editing, and visual design workflows","family":"qwen","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"qwen/qwen-image-edit","knowledge":null,"last_updated":"2025-08-19","lifecycle":null,"limits":null,"modalities":{"input":["text","image"],"output":["image"]},"model":null,"name":"Qwen Image Edit","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-08-19","retired":false,"tags":null},"qwen/qwen2.5-coder-32b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Qwen coding model for software agents, repository edits, and code reasoning","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"qwen/qwen2.5-coder-32b-instruct","knowledge":null,"last_updated":"2024-11-06","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen2.5 Coder 32b Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-11-06","retired":false,"tags":null},"qwen/qwen3-coder-480b-a35b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Qwen coding model for software agents, repository edits, and code reasoning","family":"qwen","open_weights":false,"temperature":true},"family":null,"id":"qwen/qwen3-coder-480b-a35b-instruct","knowledge":"2025-04","last_updated":"2025-07-23","lifecycle":null,"limits":{"context":262144,"output":66536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3 Coder 480B A35B Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-07-23","retired":false,"tags":null},"qwen/qwen3-next-80b-a3b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","open_weights":false,"temperature":true},"family":null,"id":"qwen/qwen3-next-80b-a3b-instruct","knowledge":"2024-12","last_updated":"2025-09-05","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3-Next-80B-A3B-Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-12-01","retired":false,"tags":null},"qwen/qwen3.5-122b-a10b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"qwen/qwen3.5-122b-a10b","knowledge":null,"last_updated":"2026-02-23","lifecycle":null,"limits":{"context":262144,"output":65536},"modalities":{"input":["text","image","video","audio"],"output":["text"]},"model":null,"name":"Qwen3.5 122B-A10B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-02-23","retired":false,"tags":null},"qwen/qwen3.5-397b-a17b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"qwen/qwen3.5-397b-a17b","knowledge":"2026-01","last_updated":"2026-02-16","lifecycle":null,"limits":{"context":262144,"output":8192},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5-397B-A17B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-02-16","retired":false,"tags":null},"sarvamai/sarvam-m":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Efficient Indian-language reasoning model for chat, coding, and multilingual work","open_weights":true,"temperature":true},"family":null,"id":"sarvamai/sarvam-m","knowledge":null,"last_updated":"2025-07-25","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"sarvam-m","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-07-25","retired":false,"tags":null},"stepfun-ai/step-3.5-flash":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"StepFun flash model for efficient multimodal reasoning, coding, and tool use","open_weights":true,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"temperature":true},"family":null,"id":"stepfun-ai/step-3.5-flash","knowledge":null,"last_updated":"2026-02-02","lifecycle":null,"limits":{"context":256000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Step 3.5 Flash","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-02-02","retired":false,"tags":null},"stepfun-ai/step-3.7-flash":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"StepFun flash model for efficient multimodal reasoning, coding, and tool use","open_weights":true,"reasoning_options":[{"type":"effort","values":["minimal","low","medium","high","xhigh","max"]}],"temperature":true},"family":null,"id":"stepfun-ai/step-3.7-flash","knowledge":null,"last_updated":"2026-05-28","lifecycle":null,"limits":{"context":256000,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Step 3.7 Flash","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-05-28","retired":false,"tags":null},"thinkingmachines/inkling":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Multimodal MoE reasoning model (975B total, 41B active) for text, image, and audio","family":"ling","open_weights":true,"reasoning_options":[],"temperature":true},"family":null,"id":"thinkingmachines/inkling","knowledge":null,"last_updated":"2026-07-15","lifecycle":null,"limits":{"context":1048576,"output":16384},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Inkling","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-07-15","retired":false,"tags":null},"upstage/solar-10.7b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open-weight instruction model for adaptable chat and self-hosted production workloads","open_weights":true,"temperature":true},"family":null,"id":"upstage/solar-10.7b-instruct","knowledge":null,"last_updated":"2025-04-10","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"solar-10.7b-instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-06-05","retired":false,"tags":null},"z-ai/glm-5.2":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open flagship GLM for long-horizon coding agents and million-token context work","family":"glm","interleaved":{"field":"reasoning_content"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"z-ai/glm-5.2","knowledge":null,"last_updated":"2026-06-13","lifecycle":null,"limits":{"context":1000000,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM-5.2","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-06-13","retired":false,"tags":null}},"name":"Nvidia","pricing_defaults":null};
3
+ export const data = {"alias_of":null,"base_url":"https://integrate.api.nvidia.com/v1","catalog_only":true,"config_schema":null,"doc":"https://docs.api.nvidia.com/nim/","env":["NVIDIA_API_KEY"],"exclude_models":null,"extra":null,"id":"nvidia","models":{"abacusai/dracarys-llama-3.1-70b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","open_weights":true,"temperature":true},"family":null,"id":"abacusai/dracarys-llama-3.1-70b-instruct","knowledge":null,"last_updated":"2025-05-22","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"dracarys-llama-3.1-70b-instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-09-11","retired":false,"tags":null},"baai/bge-m3":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Flagship model for demanding analysis, coding, and production agent workflows","family":"bge","open_weights":true,"temperature":false},"family":null,"id":"baai/bge-m3","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":8192,"output":1024},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"BGE M3","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-01-30","retired":false,"tags":null},"black-forest-labs/flux.1-dev":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Image model for prompt-driven generation, editing, and visual design workflows","family":"flux","open_weights":false,"temperature":true},"family":null,"id":"black-forest-labs/flux.1-dev","knowledge":"2024-08","last_updated":"2025-09-05","lifecycle":null,"limits":{"context":4096},"modalities":{"input":["text"],"output":["image"]},"model":null,"name":"FLUX.1-dev","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-08-01","retired":false,"tags":null},"black-forest-labs/flux_1-kontext-dev":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Image model for prompt-driven generation, editing, and visual design workflows","open_weights":true,"temperature":false},"family":null,"id":"black-forest-labs/flux_1-kontext-dev","knowledge":null,"last_updated":"2025-08-12","lifecycle":null,"limits":{"context":40960,"output":40960},"modalities":{"input":["text","image"],"output":["image"]},"model":null,"name":"FLUX.1-Kontext-dev","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-08-12","retired":false,"tags":null},"black-forest-labs/flux_1-schnell":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Image model for prompt-driven generation, editing, and visual design workflows","open_weights":true,"structured_output":false,"temperature":false},"family":null,"id":"black-forest-labs/flux_1-schnell","knowledge":"2024-07","last_updated":"2026-02-04","lifecycle":null,"limits":{"context":77},"modalities":{"input":["text"],"output":["image"]},"model":null,"name":"FLUX.1-schnell","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-08-01","retired":false,"tags":null},"black-forest-labs/flux_2-klein-4b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Image model for prompt-driven generation, editing, and visual design workflows","family":"flux","open_weights":true,"temperature":true},"family":null,"id":"black-forest-labs/flux_2-klein-4b","knowledge":"2025-06","last_updated":"2026-01-31","lifecycle":null,"limits":{"context":40960,"output":40960},"modalities":{"input":["image","text"],"output":["image"]},"model":null,"name":"FLUX.2 Klein 4B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-01-14","retired":false,"tags":null},"bytedance/seed-oss-36b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Tool-capable chat model for instruction following and agentic application workflows","family":"seed","open_weights":false,"structured_output":true,"temperature":true},"family":null,"id":"bytedance/seed-oss-36b-instruct","knowledge":null,"last_updated":"2025-11-25","lifecycle":null,"limits":{"context":262000,"output":262000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"ByteDance-Seed/Seed-OSS-36B-Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-09-04","retired":false,"tags":null},"deepseek-ai/deepseek-v4-flash":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.0028,"input":0.14,"output":0.28},"deprecated":false,"extra":{"attachment":false,"description":"Fast DeepSeek V4 lane for economical reasoning, coding, and long-context work","family":"deepseek-flash","interleaved":{"field":"reasoning_content"},"open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"deepseek-ai/deepseek-v4-flash","knowledge":"2025-05","last_updated":"2026-04-24","lifecycle":null,"limits":{"context":1048576,"output":393216},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Flash","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-04-24","retired":false,"tags":null},"deepseek-ai/deepseek-v4-pro":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.003625,"input":0.435,"output":0.87},"deprecated":false,"extra":{"attachment":false,"description":"Open MoE flagship with million-token context for coding and long agent runs","family":"deepseek-thinking","interleaved":{"field":"reasoning_content"},"open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"deepseek-ai/deepseek-v4-pro","knowledge":"2025-05","last_updated":"2026-04-24","lifecycle":null,"limits":{"context":1048576,"output":393216},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"DeepSeek V4 Pro","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-04-24","retired":false,"tags":null},"google/gemma-2-2b-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","llmfit":{"architecture":"gemma2","context_length":4096,"discovered":false,"gguf_sources":[{"provider":"bartowski","repo":"bartowski/gemma-2-2b-it-GGUF"},{"provider":"mradermacher","repo":"mradermacher/gemma-2-2b-it-GGUF"}],"hf_downloads":740546,"hf_likes":1446,"matched_hugging_face_id":"google/gemma-2-2b-it","memory":{"min_ram_gb":1.5,"min_vram_gb":1.3,"recommended_ram_gb":2.4},"model_id":"google/gemma-2-2b-it","parameter_count":"2.6B","parameters_raw":2614341888,"pipeline_tag":"text-generation","provider":"Google","quantization":"Q4_K_M","release_date":"2024-07-16","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"google/gemma-2-2b-it","knowledge":null,"last_updated":"2024-07-16","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Gemma 2 2b It","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-07-16","retired":false,"tags":null},"google/gemma-3-12b-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"gemma","llmfit":{"architecture":"gemma3","context_length":4096,"discovered":false,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/gemma-3-12b-it-GGUF"},{"provider":"ggml-org","repo":"ggml-org/gemma-3-12b-it-GGUF"},{"provider":"mradermacher","repo":"mradermacher/gemma-3-12b-it-GGUF"}],"hf_downloads":1223665,"hf_likes":806,"matched_hugging_face_id":"google/gemma-3-12b-it","memory":{"min_ram_gb":6.8,"min_vram_gb":6.2,"recommended_ram_gb":11.4},"model_id":"google/gemma-3-12b-it","parameter_count":"12.2B","parameters_raw":12187325040,"pipeline_tag":"image-text-to-text","provider":"Google","quantization":"Q4_K_M","release_date":"2025-03-01","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"temperature":true},"family":null,"id":"google/gemma-3-12b-it","knowledge":null,"last_updated":"2025-03-12","lifecycle":null,"limits":{"context":131072,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 3 12B IT","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-03-12","retired":false,"tags":null},"google/gemma-3-4b-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"gemma","llmfit":{"architecture":"gemma3","context_length":4096,"discovered":false,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/gemma-3-4b-it-GGUF"},{"provider":"ggml-org","repo":"ggml-org/gemma-3-4b-it-GGUF"},{"provider":"mradermacher","repo":"mradermacher/gemma-3-4b-it-GGUF"}],"hf_downloads":1307159,"hf_likes":1455,"matched_hugging_face_id":"google/gemma-3-4b-it","memory":{"min_ram_gb":2.4,"min_vram_gb":2.2,"recommended_ram_gb":4.0},"model_id":"google/gemma-3-4b-it","parameter_count":"4.3B","parameters_raw":4300079472,"pipeline_tag":"image-text-to-text","provider":"Google","quantization":"Q4_K_M","release_date":"2025-02-20","source":"llmfit","use_case":"Multimodal, vision and text"},"open_weights":true,"temperature":true},"family":null,"id":"google/gemma-3-4b-it","knowledge":null,"last_updated":"2025-03-12","lifecycle":null,"limits":{"context":131072,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 3 4B IT","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-03-12","retired":false,"tags":null},"google/gemma-3n-e2b-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"google/gemma-3n-e2b-it","knowledge":"2024-06","last_updated":"2025-06-12","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 3n E2b It","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-06-12","retired":false,"tags":null},"google/gemma-3n-e4b-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"google/gemma-3n-e4b-it","knowledge":"2024-06","last_updated":"2025-06-03","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Gemma 3n E4b It","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-06-03","retired":false,"tags":null},"google/gemma-4-31b-it":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Open Gemma instruction model for efficient chat and self-hosted deployments","family":"gemma","open_weights":true,"reasoning_options":[{"type":"toggle"}],"temperature":true},"family":null,"id":"google/gemma-4-31b-it","knowledge":"2025-01","last_updated":"2026-04-02","lifecycle":null,"limits":{"context":256000,"output":16384},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Gemma-4-31B-IT","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-04-02","retired":false,"tags":null},"google/google-paligemma":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Gemini multimodal model for text, image, audio, video, and document tasks","open_weights":true,"temperature":true},"family":null,"id":"google/google-paligemma","knowledge":null,"last_updated":"2024-08-26","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"paligemma","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-05-14","retired":false,"tags":null},"meta/esm2-650m":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","open_weights":true,"temperature":true},"family":null,"id":"meta/esm2-650m","knowledge":null,"last_updated":"2025-03-10","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"esm2-650m","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-08-29","retired":false,"tags":null},"meta/esmfold":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","open_weights":true,"temperature":true},"family":null,"id":"meta/esmfold","knowledge":null,"last_updated":"2025-06-12","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"esmfold","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-03-15","retired":false,"tags":null},"meta/llama-3.1-70b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"meta/llama-3.1-70b-instruct","knowledge":null,"last_updated":"2024-07-16","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 70b Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-07-16","retired":false,"tags":null},"meta/llama-3.1-8b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"temperature":true},"family":null,"id":"meta/llama-3.1-8b-instruct","knowledge":"2023-12","last_updated":"2025-01-01","lifecycle":null,"limits":{"context":16000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 8B Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-01-01","retired":false,"tags":null},"meta/llama-3.2-11b-vision-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Open Llama multimodal model for image understanding and text reasoning","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"meta/llama-3.2-11b-vision-instruct","knowledge":"2023-12","last_updated":"2024-09-18","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Llama 3.2 11b Vision Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-09-18","retired":false,"tags":null},"meta/llama-3.2-1b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"meta/llama-3.2-1b-instruct","knowledge":"2023-12","last_updated":"2024-09-18","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.2 1b Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-09-18","retired":false,"tags":null},"meta/llama-3.2-3b-instruct":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","family":"llama","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"meta/llama-3.2-3b-instruct","knowledge":null,"last_updated":"2024-09-18","lifecycle":null,"limits":{"context":32768,"output":32000},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.2 3B Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-09-18","retired":false,"tags":null},"meta/llama-3.2-90b-vision-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Open Llama multimodal model for image understanding and text reasoning","family":"llama","open_weights":true,"temperature":true},"family":null,"id":"meta/llama-3.2-90b-vision-instruct","knowledge":"2023-12","last_updated":"2024-09-25","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Llama-3.2-90B-Vision-Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-09-25","retired":false,"tags":null},"meta/llama-3.3-70b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open Llama instruction model for multilingual chat, reasoning, and coding","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"meta/llama-3.3-70b-instruct","knowledge":null,"last_updated":"2024-11-26","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.3 70b Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-11-26","retired":false,"tags":null},"meta/llama-4-maverick-17b-128e-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Open multimodal Llama model for strong reasoning and fast responses","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"meta/llama-4-maverick-17b-128e-instruct","knowledge":"2024-02","last_updated":"2025-04-01","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Llama 4 Maverick 17b 128e Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-04-01","retired":false,"tags":null},"meta/llama-guard-4-12b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Safety model for policy screening, moderation, and risk-aware routing workflows","family":"llama","open_weights":true,"temperature":true},"family":null,"id":"meta/llama-guard-4-12b","knowledge":null,"last_updated":"2026-04-30","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Llama Guard 4 12B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-04-05","retired":false,"tags":null},"meta/muse-glimmer-30b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Muse Glimmer is a 30-billion-parameter open-weight multimodal model from Meta Superintelligence Labs, distilled from Muse Spark for always-on local agents, tool use, coding, and image understanding.","family":"muse","interleaved":{"field":"reasoning_content"},"open_weights":true,"reasoning_options":[{"type":"effort","values":["none","minimal","low","medium","high","max"]}],"structured_output":true,"temperature":true},"family":null,"id":"meta/muse-glimmer-30b","knowledge":"2026-01-04","last_updated":"2026-08-10","lifecycle":null,"limits":{"context":131072,"output":131072},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Muse Glimmer 30B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-08-10","retired":false,"tags":null},"microsoft/phi-4-mini-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Efficient model for low-latency assistance, extraction, and routine automation","family":"phi","open_weights":true,"temperature":true},"family":null,"id":"microsoft/phi-4-mini-instruct","knowledge":"2024-12","last_updated":"2025-09-05","lifecycle":null,"limits":{"context":131072,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Phi-4-Mini","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-12-01","retired":false,"tags":null},"microsoft/phi-4-multimodal-instruct":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"General-purpose chat model for instruction following, writing, and analysis","open_weights":false,"structured_output":false},"family":null,"id":"microsoft/phi-4-multimodal-instruct","knowledge":null,"last_updated":"2025-07-26","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Phi 4 Multimodal","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-07-26","retired":false,"tags":null},"minimaxai/minimax-m2.7":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"MiniMax model for chat, coding, office work, and agentic tasks","family":"minimax","open_weights":true,"reasoning_options":[],"temperature":true},"family":null,"id":"minimaxai/minimax-m2.7","knowledge":null,"last_updated":"2026-04-11","lifecycle":null,"limits":{"context":204800,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"MiniMax-M2.7","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-03-18","retired":false,"tags":null},"minimaxai/minimax-m3":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"MiniMax multimodal model for long-context coding, perception, and agent planning","family":"minimax","open_weights":true,"reasoning_options":[{"type":"toggle"}],"temperature":true},"family":null,"id":"minimaxai/minimax-m3","knowledge":null,"last_updated":"2026-06-01","lifecycle":null,"limits":{"context":1000000,"output":16384},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"MiniMax-M3","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-06-01","retired":false,"tags":null},"mistralai/magistral-small-2506":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Mistral reasoning model for transparent analysis, math, and complex decisions","open_weights":false,"structured_output":false},"family":null,"id":"mistralai/magistral-small-2506","knowledge":null,"last_updated":"2025-09-25","lifecycle":null,"limits":{"context":32768,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Magistral Small 2506","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-09-25","retired":false,"tags":null},"mistralai/ministral-14b-instruct-2512":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Compact Mistral VLM for chat and instruction-based workloads","family":"ministral","open_weights":true,"temperature":true},"family":null,"id":"mistralai/ministral-14b-instruct-2512","knowledge":null,"last_updated":"2025-12-02","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Ministral 3 14B Instruct 2512","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-12-02","retired":false,"tags":null},"mistralai/mistral-7b-instruct-v0.3":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"mistralai/mistral-7b-instruct-v0.3","knowledge":null,"last_updated":"2025-04-01","lifecycle":null,"limits":{"context":65536,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mistral-7B-Instruct-v0.3","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-04-01","retired":false,"tags":null},"mistralai/mistral-large-3-675b-instruct-2512":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Flagship Mistral model for advanced reasoning, coding, and multilingual work","family":"mistral-large","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"mistralai/mistral-large-3-675b-instruct-2512","knowledge":"2025-01","last_updated":"2025-12-02","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Mistral Large 3 675B Instruct 2512","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-12-02","retired":false,"tags":null},"mistralai/mistral-medium-3-instruct":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","family":"mistral-medium","open_weights":false,"structured_output":false},"family":null,"id":"mistralai/mistral-medium-3-instruct","knowledge":null,"last_updated":"2025-09-25","lifecycle":null,"limits":{"context":131072,"output":32768},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Mistral Medium 3","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-09-25","retired":false,"tags":null},"mistralai/mistral-medium-3.5-128b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Balanced Mistral model for enterprise assistants, multilingual work, and tools","family":"mistral-medium","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"mistralai/mistral-medium-3.5-128b","knowledge":null,"last_updated":"2026-04-29","lifecycle":null,"limits":{"context":262144,"output":32768},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Mistral Medium 3.5","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-04-29","retired":false,"tags":null},"mistralai/mistral-nemotron":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","family":"nemotron","open_weights":true,"temperature":true},"family":null,"id":"mistralai/mistral-nemotron","knowledge":null,"last_updated":"2025-06-12","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"mistral-nemotron","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-06-11","retired":false,"tags":null},"mistralai/mistral-small-4-119b-2603":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Efficient Mistral model for fast chat, extraction, and production assistants","open_weights":true,"reasoning_options":[{"type":"effort","values":["none","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"mistralai/mistral-small-4-119b-2603","knowledge":null,"last_updated":"2026-03-16","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"mistral-small-4-119b-2603","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-03-16","retired":false,"tags":null},"mistralai/mixtral-8x22b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","open_weights":true,"temperature":true},"family":null,"id":"mistralai/mixtral-8x22b-instruct","knowledge":null,"last_updated":"2024-04-17","lifecycle":null,"limits":{"context":65536,"output":13108},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mistral: Mixtral 8x22B Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-04-17","retired":false,"tags":null},"mistralai/mixtral-8x7b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Mistral model for multilingual chat, reasoning, and tool-assisted workflows","open_weights":true,"temperature":true},"family":null,"id":"mistralai/mixtral-8x7b-instruct","knowledge":null,"last_updated":"2026-03-15","lifecycle":null,"limits":{"context":32768,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Mistral: Mixtral 8x7B Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2023-12-10","retired":false,"tags":null},"moonshotai/kimi-k2-instruct-0905":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Kimi model for long-context chat, coding, and agentic reasoning","family":"kimi-k2","open_weights":true,"status":"deprecated","temperature":true},"family":null,"id":"moonshotai/kimi-k2-instruct-0905","knowledge":"2024-10","last_updated":"2025-09-05","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Kimi K2 0905","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-09-05","retired":false,"tags":null},"moonshotai/kimi-k2.6":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Kimi multimodal agent model for visual understanding, coding, and planning","family":"kimi-k2","interleaved":{"field":"reasoning_content"},"open_weights":true,"reasoning_options":[{"type":"effort","values":["none","minimal","low","medium","high","xhigh","max"]}],"status":"deprecated","structured_output":true,"temperature":true},"family":null,"id":"moonshotai/kimi-k2.6","knowledge":"2025-01","last_updated":"2026-04-21","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Kimi K2.6","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-04-21","retired":false,"tags":null},"nvidia/active-speaker-detection":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Nemotron multimodal model for visual reasoning and agentic AI workflows","open_weights":true,"temperature":false},"family":null,"id":"nvidia/active-speaker-detection","knowledge":null,"last_updated":"2026-04-16","lifecycle":null,"limits":{"output":4096},"modalities":{"input":["video"],"output":["text"]},"model":null,"name":"Active Speaker Detection","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-04-16","retired":false,"tags":null},"nvidia/bevformer":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Nemotron multimodal model for visual reasoning and agentic AI workflows","open_weights":true,"temperature":true},"family":null,"id":"nvidia/bevformer","knowledge":null,"last_updated":"2025-07-20","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["video"],"output":["text"]},"model":null,"name":"bevformer","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-03-18","retired":false,"tags":null},"nvidia/cosmos-predict1-5b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Video model for prompt-guided generation, editing, and motion workflows","open_weights":true,"temperature":false},"family":null,"id":"nvidia/cosmos-predict1-5b","knowledge":null,"last_updated":"2025-03-18","lifecycle":null,"limits":{"output":4096},"modalities":{"input":["text","image","video"],"output":["video"]},"model":null,"name":"cosmos-predict1-5b","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-03-18","retired":false,"tags":null},"nvidia/cosmos-reason2-8b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Vision language model for physical-world understanding with structured reasoning on video and images","open_weights":true,"reasoning_options":[],"temperature":true},"family":null,"id":"nvidia/cosmos-reason2-8b","knowledge":null,"last_updated":"2025-12-01","lifecycle":null,"limits":{"context":131072,"output":16384},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Cosmos Reason2 8B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-12-01","retired":false,"tags":null},"nvidia/cosmos-transfer1-7b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Video model for prompt-guided generation, editing, and motion workflows","open_weights":true,"temperature":false},"family":null,"id":"nvidia/cosmos-transfer1-7b","knowledge":null,"last_updated":"2025-06-30","lifecycle":null,"limits":{"output":4096},"modalities":{"input":["text","image","video"],"output":["video"]},"model":null,"name":"cosmos-transfer1-7b","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-06-13","retired":false,"tags":null},"nvidia/cosmos-transfer2_5-2b":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Video model for prompt-guided generation, editing, and motion workflows","open_weights":true,"temperature":false},"family":null,"id":"nvidia/cosmos-transfer2_5-2b","knowledge":null,"last_updated":"2026-02-26","lifecycle":null,"limits":{"output":4096},"modalities":{"input":["text","image","video"],"output":["video"]},"model":null,"name":"cosmos-transfer2.5-2b","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-02-26","retired":false,"tags":null},"nvidia/gliner-pii":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","open_weights":true,"temperature":true},"family":null,"id":"nvidia/gliner-pii","knowledge":null,"last_updated":"2026-03-03","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"gliner-pii","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-03-03","retired":false,"tags":null},"nvidia/llama-3.1-nemotron-70b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","family":"nemotron","open_weights":true,"temperature":true},"family":null,"id":"nvidia/llama-3.1-nemotron-70b-instruct","knowledge":null,"last_updated":"2025-04-15","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 Nemotron 70B Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-04-15","retired":false,"tags":null},"nvidia/llama-3.1-nemotron-nano-8b-v1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"temperature":true},"family":null,"id":"nvidia/llama-3.1-nemotron-nano-8b-v1","knowledge":null,"last_updated":"2025-03-18","lifecycle":null,"limits":{"context":131072,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 Nemotron Nano 8B v1","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-03-18","retired":false,"tags":null},"nvidia/llama-3.1-nemotron-nano-vl-8b-v1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Nemotron multimodal model for visual reasoning and agentic AI workflows","family":"nemotron","open_weights":true,"reasoning_options":[],"temperature":true},"family":null,"id":"nvidia/llama-3.1-nemotron-nano-vl-8b-v1","knowledge":null,"last_updated":"2025-04-10","lifecycle":null,"limits":{"context":32768,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Llama 3.1 Nemotron Nano VL 8B v1","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-04-10","retired":false,"tags":null},"nvidia/llama-3.1-nemotron-safety-guard-8b-v3":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Safety model for policy screening, moderation, and risk-aware routing workflows","family":"nemotron","open_weights":true,"temperature":false},"family":null,"id":"nvidia/llama-3.1-nemotron-safety-guard-8b-v3","knowledge":null,"last_updated":"2025-10-28","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"llama-3.1-nemotron-safety-guard-8b-v3","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-10-28","retired":false,"tags":null},"nvidia/llama-3.1-nemotron-ultra-253b-v1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Flagship Nemotron model for high-throughput reasoning and complex agents","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"temperature":true},"family":null,"id":"nvidia/llama-3.1-nemotron-ultra-253b-v1","knowledge":null,"last_updated":"2025-04-07","lifecycle":null,"limits":{"context":128000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.1 Nemotron Ultra 253B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-04-07","retired":false,"tags":null},"nvidia/llama-3.3-nemotron-super-49b-v1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"temperature":true},"family":null,"id":"nvidia/llama-3.3-nemotron-super-49b-v1","knowledge":null,"last_updated":"2025-04-07","lifecycle":null,"limits":{"context":131072,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.3 Nemotron Super 49B v1","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-04-07","retired":false,"tags":null},"nvidia/llama-3.3-nemotron-super-49b-v1.5":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"temperature":true},"family":null,"id":"nvidia/llama-3.3-nemotron-super-49b-v1.5","knowledge":null,"last_updated":"2025-07-25","lifecycle":null,"limits":{"context":131072,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Llama 3.3 Nemotron Super 49B v1.5","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-07-25","retired":false,"tags":null},"nvidia/llama-3_2-nemoretriever-300m-embed-v1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Embedding model for semantic search, retrieval, clustering, and ranking pipelines","open_weights":true,"temperature":false},"family":null,"id":"nvidia/llama-3_2-nemoretriever-300m-embed-v1","knowledge":null,"last_updated":"2025-07-24","lifecycle":null,"limits":{"context":32768,"output":2048},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"llama-3_2-nemoretriever-300m-embed-v1","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-07-24","retired":false,"tags":null},"nvidia/llama-nemotron-embed-vl-1b-v2":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Embedding model for semantic search, retrieval, clustering, and ranking pipelines","family":"nemotron","open_weights":true,"temperature":false},"family":null,"id":"nvidia/llama-nemotron-embed-vl-1b-v2","knowledge":null,"last_updated":"2026-02-10","lifecycle":null,"limits":{"context":32768,"output":2048},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"llama-nemotron-embed-vl-1b-v2","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-02-10","retired":false,"tags":null},"nvidia/llama-nemotron-rerank-vl-1b-v2":{"aliases":[],"base_url":null,"capabilities":{"chat":false,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":true,"streaming":{"text":false,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Reranking model for improving retrieval quality in search and recommendation systems","family":"nemotron","open_weights":true,"temperature":false},"family":null,"id":"nvidia/llama-nemotron-rerank-vl-1b-v2","knowledge":null,"last_updated":"2026-03-31","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"llama-nemotron-rerank-vl-1b-v2","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-03-31","retired":false,"tags":null},"nvidia/magpie-tts-zeroshot":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Speech generation model for controllable voice, narration, and audio delivery","open_weights":true,"temperature":false},"family":null,"id":"nvidia/magpie-tts-zeroshot","knowledge":null,"last_updated":"2025-06-12","lifecycle":null,"limits":{"output":4096},"modalities":{"input":["text","audio"],"output":["audio"]},"model":null,"name":"magpie-tts-zeroshot","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-05-22","retired":false,"tags":null},"nvidia/nemotron-3-content-safety":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Safety model for policy screening, moderation, and risk-aware routing workflows","family":"nemotron","open_weights":true,"temperature":false},"family":null,"id":"nvidia/nemotron-3-content-safety","knowledge":null,"last_updated":"2026-04-16","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"nemotron-3-content-safety","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-04-16","retired":false,"tags":null},"nvidia/nemotron-3-nano-30b-a3b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Small Nemotron 3 MoE for efficient coding, math, and long-context agents","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"temperature":true},"family":null,"id":"nvidia/nemotron-3-nano-30b-a3b","knowledge":"2024-09","last_updated":"2024-12","lifecycle":null,"limits":{"context":131072,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"nemotron-3-nano-30b-a3b","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-12","retired":false,"tags":null},"nvidia/nemotron-3-nano-omni-30b-a3b-reasoning":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Open Nemotron omni model combining reasoning with text, vision, and audio","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"},{"max":32768,"min":-1,"type":"budget_tokens"}],"structured_output":true,"temperature":true},"family":null,"id":"nvidia/nemotron-3-nano-omni-30b-a3b-reasoning","knowledge":null,"last_updated":"2026-04-28","lifecycle":null,"limits":{"context":256000,"output":65536},"modalities":{"input":["text","image","video","audio"],"output":["text"]},"model":null,"name":"Nemotron 3 Nano Omni","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-04-28","retired":false,"tags":null},"nvidia/nemotron-3-super-120b-a12b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0.2,"output":0.8},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron middle tier for collaborative agents and high-volume reasoning workloads","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"temperature":true},"family":null,"id":"nvidia/nemotron-3-super-120b-a12b","knowledge":"2024-04","last_updated":"2026-03-11","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Nemotron 3 Super","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-03-11","retired":false,"tags":null},"nvidia/nemotron-3-ultra-550b-a55b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"cache_read":0.15,"input":0.5,"output":2.5},"deprecated":false,"extra":{"attachment":false,"description":"Largest Nemotron 3 model for maximum open-weight reasoning and agent accuracy","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"nvidia/nemotron-3-ultra-550b-a55b","knowledge":null,"last_updated":"2026-06-04","lifecycle":null,"limits":{"context":1000000,"output":65536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Nemotron 3 Ultra 550B A55B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-06-04","retired":false,"tags":null},"nvidia/nemotron-3.5-lightning-30b-a3b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Fast NVIDIA Nemotron MoE for reliable agentic tasks across enterprise workloads","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"nvidia/nemotron-3.5-lightning-30b-a3b","knowledge":null,"last_updated":"2026-08-11","lifecycle":null,"limits":{"context":262144,"output":262144},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Nemotron 3.5 Lightning 30B A3B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-08-11","retired":false,"tags":null},"nvidia/nemotron-content-safety-reasoning-4b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"text":true,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Safety model for policy screening, moderation, and risk-aware routing workflows","family":"nemotron","open_weights":true,"reasoning_options":[],"temperature":false},"family":null,"id":"nvidia/nemotron-content-safety-reasoning-4b","knowledge":null,"last_updated":"2026-01-22","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"nemotron-content-safety-reasoning-4b","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-01-22","retired":false,"tags":null},"nvidia/nemotron-mini-4b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Compact Nemotron model for efficient reasoning and deployable AI agents","family":"nemotron","open_weights":true,"temperature":true},"family":null,"id":"nvidia/nemotron-mini-4b-instruct","knowledge":null,"last_updated":"2024-08-26","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"nemotron-mini-4b-instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-08-21","retired":false,"tags":null},"nvidia/nemotron-nano-12b-v2-vl":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Nemotron multimodal model for visual reasoning and agentic AI workflows","family":"nemotron","open_weights":true,"reasoning_options":[],"temperature":true},"family":null,"id":"nvidia/nemotron-nano-12b-v2-vl","knowledge":null,"last_updated":"2025-10-28","lifecycle":null,"limits":{"context":128000,"output":128000},"modalities":{"input":["text","image","video"],"output":["text"]},"model":null,"name":"Nemotron Nano 12B v2 VL","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-10-28","retired":false,"tags":null},"nvidia/nemotron-voicechat":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Nemotron multimodal model for visual reasoning and agentic AI workflows","family":"nemotron","open_weights":true,"temperature":true},"family":null,"id":"nvidia/nemotron-voicechat","knowledge":null,"last_updated":"2026-03-16","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text","audio"],"output":["text"]},"model":null,"name":"nemotron-voicechat","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-03-16","retired":false,"tags":null},"nvidia/nv-embed-v1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Embedding model for semantic search, retrieval, clustering, and ranking pipelines","open_weights":true,"temperature":false},"family":null,"id":"nvidia/nv-embed-v1","knowledge":null,"last_updated":"2025-07-22","lifecycle":null,"limits":{"context":32768,"output":2048},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"nv-embed-v1","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-06-07","retired":false,"tags":null},"nvidia/nv-embedcode-7b-v1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","open_weights":true,"temperature":false},"family":null,"id":"nvidia/nv-embedcode-7b-v1","knowledge":null,"last_updated":"2025-05-29","lifecycle":null,"limits":{"context":32768,"output":2048},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"nv-embedcode-7b-v1","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-03-17","retired":false,"tags":null},"nvidia/nvidia-nemotron-nano-9b-v2":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Compact Nemotron model for efficient reasoning and deployable AI agents","family":"nemotron","open_weights":true,"reasoning_options":[{"type":"toggle"}],"temperature":true},"family":null,"id":"nvidia/nvidia-nemotron-nano-9b-v2","knowledge":"2024-09","last_updated":"2025-08-18","lifecycle":null,"limits":{"context":131072,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"nvidia-nemotron-nano-9b-v2","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-08-18","retired":false,"tags":null},"nvidia/rerank-qa-mistral-4b":{"aliases":[],"base_url":null,"capabilities":{"chat":false,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":true,"streaming":{"text":false,"tool_calls":false},"tools":{"enabled":false,"parallel":false,"streaming":false,"strict":false}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Reranking model for improving retrieval quality in search and recommendation systems","open_weights":true,"temperature":false},"family":null,"id":"nvidia/rerank-qa-mistral-4b","knowledge":null,"last_updated":"2025-01-17","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"rerank-qa-mistral-4b","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-03-17","retired":false,"tags":null},"nvidia/riva-translate-4b-instruct-v1.1":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Translation model for multilingual conversion, localization, and cross-language workflows","open_weights":true,"temperature":false},"family":null,"id":"nvidia/riva-translate-4b-instruct-v1.1","knowledge":null,"last_updated":"2025-12-12","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"riva-translate-4b-instruct-v1_1","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-12-12","retired":false,"tags":null},"nvidia/sparsedrive":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Nemotron multimodal model for visual reasoning and agentic AI workflows","open_weights":true,"temperature":true},"family":null,"id":"nvidia/sparsedrive","knowledge":null,"last_updated":"2025-07-20","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["video"],"output":["text"]},"model":null,"name":"sparsedrive","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-03-18","retired":false,"tags":null},"nvidia/streampetr":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Nemotron multimodal model for visual reasoning and agentic AI workflows","open_weights":true,"temperature":true},"family":null,"id":"nvidia/streampetr","knowledge":null,"last_updated":"2025-11-13","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["video"],"output":["text"]},"model":null,"name":"streampetr","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-11-13","retired":false,"tags":null},"nvidia/studiovoice":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","open_weights":true,"temperature":true},"family":null,"id":"nvidia/studiovoice","knowledge":null,"last_updated":"2025-06-13","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"studiovoice","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-10-03","retired":false,"tags":null},"nvidia/synthetic-video-detector":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Video model for prompt-guided generation, editing, and motion workflows","open_weights":true,"temperature":true},"family":null,"id":"nvidia/synthetic-video-detector","knowledge":null,"last_updated":"2026-04-16","lifecycle":null,"limits":{"output":4096},"modalities":{"input":["video"],"output":["text"]},"model":null,"name":"synthetic-video-detector","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-04-16","retired":false,"tags":null},"nvidia/usdcode":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","open_weights":false,"temperature":true},"family":null,"id":"nvidia/usdcode","knowledge":null,"last_updated":"2026-01-01","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"usdcode","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-01-01","retired":false,"tags":null},"nvidia/usdvalidate":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Nemotron model for efficient reasoning, coding, and specialized AI agents","open_weights":true,"temperature":false},"family":null,"id":"nvidia/usdvalidate","knowledge":null,"last_updated":"2025-01-08","lifecycle":null,"limits":{"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"usdvalidate","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-07-24","retired":false,"tags":null},"openai/gpt-oss-120b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open GPT reasoning model for self-hosted agents and controllable deployments","family":"gpt-oss","llmfit":{"architecture":"gpt_oss","context_length":4194304,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/gpt-oss-120b-GGUF"},{"provider":"ggml-org","repo":"ggml-org/gpt-oss-120b-GGUF"}],"hf_downloads":4479205,"hf_likes":5106,"matched_hugging_face_id":"openai/gpt-oss-120b","memory":{"min_ram_gb":65.3,"min_vram_gb":59.8,"recommended_ram_gb":108.8},"model_id":"openai/gpt-oss-120b","moe":{"active_experts":4,"active_parameters":9309823421,"is_moe":true,"num_experts":128},"parameter_count":"116.8B","parameters_raw":116829156672,"pipeline_tag":"text-generation","provider":"openai","quantization":"Q4_K_M","release_date":"2025-08-04","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"openai/gpt-oss-120b","knowledge":"2025-08","last_updated":"2025-08-14","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GPT-OSS-120B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-08-04","retired":false,"tags":null},"openai/gpt-oss-20b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open-weight GPT model for self-hosted reasoning and instruction-following workloads","family":"gpt-oss","llmfit":{"architecture":"gpt_oss","context_length":4194304,"discovered":true,"gguf_sources":[{"provider":"unsloth","repo":"unsloth/gpt-oss-20b-GGUF"},{"provider":"ggml-org","repo":"ggml-org/gpt-oss-20b-GGUF"},{"provider":"mradermacher","repo":"mradermacher/gpt-oss-20b-GGUF"}],"hf_downloads":7966494,"hf_likes":4923,"matched_hugging_face_id":"openai/gpt-oss-20b","memory":{"min_ram_gb":12.0,"min_vram_gb":11.0,"recommended_ram_gb":20.0},"model_id":"openai/gpt-oss-20b","moe":{"active_experts":4,"active_parameters":3630142231,"is_moe":true,"num_experts":32},"parameter_count":"21.5B","parameters_raw":21511953984,"pipeline_tag":"text-generation","provider":"openai","quantization":"Q4_K_M","release_date":"2025-08-04","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"structured_output":true,"temperature":true},"family":null,"id":"openai/gpt-oss-20b","knowledge":null,"last_updated":"2025-08-05","lifecycle":null,"limits":{"context":131072,"output":32768},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GPT OSS 20B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-08-05","retired":false,"tags":null},"openai/whisper-large-v3":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Speech transcription model for accurate audio-to-text and captioning workflows","family":"whisper","open_weights":true,"temperature":false},"family":null,"id":"openai/whisper-large-v3","knowledge":"2023-09","last_updated":"2025-09-05","lifecycle":null,"limits":{"output":4096},"modalities":{"input":["audio"],"output":["text"]},"model":null,"name":"Whisper Large v3","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2023-09-01","retired":false,"tags":null},"poolside/laguna-xs-2.1":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Agentic coding model from Poolside in the XS size class for local deployment","family":"laguna","open_weights":true,"reasoning_options":[],"structured_output":false,"temperature":true},"family":null,"id":"poolside/laguna-xs-2.1","knowledge":null,"last_updated":"2026-07-02","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Laguna XS 2.1","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-07-02","retired":false,"tags":null},"qwen/qwen-image":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Image model for prompt-driven generation, editing, and visual design workflows","family":"qwen","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"qwen/qwen-image","knowledge":null,"last_updated":"2025-08-07","lifecycle":null,"limits":null,"modalities":{"input":["text","image"],"output":["image"]},"model":null,"name":"Qwen Image","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-08-07","retired":false,"tags":null},"qwen/qwen-image-edit":{"aliases":[],"base_url":null,"capabilities":null,"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Image model for prompt-driven generation, editing, and visual design workflows","family":"qwen","open_weights":false,"structured_output":false,"temperature":true},"family":null,"id":"qwen/qwen-image-edit","knowledge":null,"last_updated":"2025-08-19","lifecycle":null,"limits":null,"modalities":{"input":["text","image"],"output":["image"]},"model":null,"name":"Qwen Image Edit","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-08-19","retired":false,"tags":null},"qwen/qwen2.5-coder-32b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Qwen coding model for software agents, repository edits, and code reasoning","open_weights":true,"structured_output":true,"temperature":true},"family":null,"id":"qwen/qwen2.5-coder-32b-instruct","knowledge":null,"last_updated":"2024-11-06","lifecycle":null,"limits":{"context":128000,"output":4096},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen2.5 Coder 32b Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-11-06","retired":false,"tags":null},"qwen/qwen3-coder-480b-a35b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Qwen coding model for software agents, repository edits, and code reasoning","family":"qwen","open_weights":false,"temperature":true},"family":null,"id":"qwen/qwen3-coder-480b-a35b-instruct","knowledge":"2025-04","last_updated":"2025-07-23","lifecycle":null,"limits":{"context":262144,"output":66536},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3 Coder 480B A35B Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-07-23","retired":false,"tags":null},"qwen/qwen3-next-80b-a3b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Qwen instruction model for multilingual chat, reasoning, and tool use","family":"qwen","open_weights":false,"temperature":true},"family":null,"id":"qwen/qwen3-next-80b-a3b-instruct","knowledge":"2024-12","last_updated":"2025-09-05","lifecycle":null,"limits":{"context":262144,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Qwen3-Next-80B-A3B-Instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-12-01","retired":false,"tags":null},"qwen/qwen3.5-122b-a10b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"qwen/qwen3.5-122b-a10b","knowledge":null,"last_updated":"2026-02-23","lifecycle":null,"limits":{"context":262144,"output":65536},"modalities":{"input":["text","image","video","audio"],"output":["text"]},"model":null,"name":"Qwen3.5 122B-A10B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-02-23","retired":false,"tags":null},"qwen/qwen3.5-397b-a17b":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Qwen vision-language model for visual reasoning, documents, and agent tasks","family":"qwen","open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"qwen/qwen3.5-397b-a17b","knowledge":"2026-01","last_updated":"2026-02-16","lifecycle":null,"limits":{"context":262144,"output":8192},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Qwen3.5-397B-A17B","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-02-16","retired":false,"tags":null},"sarvamai/sarvam-m":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Efficient Indian-language reasoning model for chat, coding, and multilingual work","llmfit":{"architecture":"mistral","context_length":4096,"discovered":true,"gguf_sources":[],"hf_downloads":0,"hf_likes":0,"matched_hugging_face_id":"sarvamai/sarvam-m","memory":{"min_ram_gb":13.2,"min_vram_gb":12.1,"recommended_ram_gb":22.0},"model_id":"sarvamai/sarvam-m","parameter_count":"23.6B","parameters_raw":23572403200,"pipeline_tag":"text-generation","provider":"sarvamai","quantization":"Q4_K_M","source":"llmfit","use_case":"General purpose text generation"},"open_weights":true,"temperature":true},"family":null,"id":"sarvamai/sarvam-m","knowledge":null,"last_updated":"2025-07-25","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"sarvam-m","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2025-07-25","retired":false,"tags":null},"stepfun-ai/step-3.5-flash":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"StepFun flash model for efficient multimodal reasoning, coding, and tool use","open_weights":true,"reasoning_options":[{"type":"effort","values":["low","medium","high"]}],"temperature":true},"family":null,"id":"stepfun-ai/step-3.5-flash","knowledge":null,"last_updated":"2026-02-02","lifecycle":null,"limits":{"context":256000,"output":16384},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"Step 3.5 Flash","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-02-02","retired":false,"tags":null},"stepfun-ai/step-3.7-flash":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"StepFun flash model for efficient multimodal reasoning, coding, and tool use","open_weights":true,"reasoning_options":[{"type":"effort","values":["minimal","low","medium","high","xhigh","max"]}],"temperature":true},"family":null,"id":"stepfun-ai/step-3.7-flash","knowledge":null,"last_updated":"2026-05-28","lifecycle":null,"limits":{"context":256000,"output":16384},"modalities":{"input":["text","image"],"output":["text"]},"model":null,"name":"Step 3.7 Flash","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-05-28","retired":false,"tags":null},"thinkingmachines/inkling":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":true,"description":"Multimodal MoE reasoning model (975B total, 41B active) for text, image, and audio","family":"ling","open_weights":true,"reasoning_options":[],"temperature":true},"family":null,"id":"thinkingmachines/inkling","knowledge":null,"last_updated":"2026-07-15","lifecycle":null,"limits":{"context":1048576,"output":16384},"modalities":{"input":["text","image","audio"],"output":["text"]},"model":null,"name":"Inkling","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-07-15","retired":false,"tags":null},"upstage/solar-10.7b-instruct":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":false},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open-weight instruction model for adaptable chat and self-hosted production workloads","open_weights":true,"temperature":true},"family":null,"id":"upstage/solar-10.7b-instruct","knowledge":null,"last_updated":"2025-04-10","lifecycle":null,"limits":{"context":128000,"output":8192},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"solar-10.7b-instruct","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2024-06-05","retired":false,"tags":null},"z-ai/glm-5.2":{"aliases":[],"base_url":null,"capabilities":{"chat":true,"embeddings":false,"json":{"native":false,"schema":false,"strict":false},"reasoning":{"enabled":true},"rerank":false,"streaming":{"tool_calls":true},"tools":{"enabled":true}},"catalog_only":true,"cost":{"input":0,"output":0},"deprecated":false,"extra":{"attachment":false,"description":"Open flagship GLM for long-horizon coding agents and million-token context work","family":"glm","interleaved":{"field":"reasoning_content"},"open_weights":true,"reasoning_options":[{"type":"toggle"}],"structured_output":true,"temperature":true},"family":null,"id":"z-ai/glm-5.2","knowledge":null,"last_updated":"2026-06-13","lifecycle":null,"limits":{"context":1000000,"output":131072},"modalities":{"input":["text"],"output":["text"]},"model":null,"name":"GLM-5.2","pricing":null,"provider":"nvidia","provider_model_id":null,"release_date":"2026-06-13","retired":false,"tags":null}},"name":"Nvidia","pricing_defaults":null};
4
4
  const provider = /* @__PURE__ */ createProviderCatalog(data);
5
5
  export default provider;