Kostenlose Modelle und APIs bei NVIDIA Build 2026
NVIDIA Build bietet kostenlose serverlose Inferenz für die Entwicklung. Dieser Katalog wird direkt über die authentifizierte NIM Models API aktualisiert.

NVIDIA Build
Kostenlose serverlose Inferenz für Entwicklung und Prototyping mit Entwicklerkonto; nicht für Produktionstraffic gedacht.
- Base URL
https://integrate.api.nvidia.com/v1- Kompatibilität
- OpenAI Chat Completions
- Karte
- Nicht erforderlich
- Limits
- Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern.
| # | Modell ↕ | AA Index ↕ | Kontext ↕ | Größe ↕ | Limit | |
|---|---|---|---|---|---|---|
| 1 |
GLM 5.3
z-ai/glm-5.3 |
44.8 | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 2 |
Kimi K3
moonshotai/kimi-k3 |
43.6 | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 3 |
GLM 5.3 Flash
z-ai/glm-5.3-flash |
41.8 | — | Mittelgroß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 4 |
DeepSeek V4.1 Flash
deepseek-ai/deepseek-v4.1-flash |
39.5 | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 5 |
Nemotron 3 Ultra
nvidia/nemotron-3-ultra-550b-a55b |
22.9 | 1M | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 6 |
Kimi K2.6
moonshotai/kimi-k2.6 |
27.0 | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 7 |
Gemma 4 31B
google/gemma-4-31b-it |
19.0 | — | Mittelgroß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 8 |
Nemotron 3.5 Lightning
nvidia/nemotron-3.5-lightning-30b-a3b |
12.9 | — | Mittelgroß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 9 |
Nemotron 3 Super
nvidia/nemotron-3-super-120b-a12b |
12.8 | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 10 |
Nemotron 3 Nano Omni
nvidia/nemotron-3-nano-omni-30b-a3b-reasoning |
10.3 | — | Mittelgroß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 11 |
Palmyra Creative 122B
writer/palmyra-creative-122b |
— | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 12 |
gpt-oss-20b
openai/gpt-oss-20b |
10.0 | — | Mittelgroß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 13 |
Mistral Nemo
nv-mistralai/mistral-nemo-12b-instruct |
— | — | Mittelgroß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 14 |
Laguna XS 2.1
poolside/laguna-xs-2.1 |
— | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 15 |
Mistral Nemotron
mistralai/mistral-nemotron |
— | — | Mittelgroß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 16 |
Muse Glimmer 30B
meta/muse-glimmer-30b |
— | — | Mittelgroß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 17 |
Nemotron 3 Nano
nvidia/nemotron-nano-3-30b-a3b |
8.9 | — | Mittelgroß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 18 |
Llama 3.2 11B Vision
meta/llama-3.2-11b-vision-instruct |
5.4 | — | Mittelgroß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 19 |
Llama 3.2 90B Vision
meta/llama-3.2-90b-vision-instruct |
6.4 | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 20 |
Llama 3.1 Nemotron Ultra 253B
nvidia/llama-3.1-nemotron-ultra-253b-v1 |
7.5 | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 21 |
Mixtral 8x22b
mistralai/mixtral-8x22b-v0.1 |
— | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 22 |
Gemma 3 4B
google/gemma-3-4b-it |
4.8 | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 23 |
CodeLlama 70B
meta/codellama-70b |
— | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 24 |
Llama 2 70B
meta/llama2-70b |
— | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 25 |
Llama 3 ChatQA 1.5 70B
nvidia/llama3-chatqa-1.5-70b |
— | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 26 |
Nemotron 4 340B
nvidia/nemotron-4-340b-instruct |
— | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 27 |
Palmyra Fin 70B 32K
writer/palmyra-fin-70b-32k |
— | 33K | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 28 |
Palmyra Med 70B
writer/palmyra-med-70b |
— | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 29 |
Palmyra Med 70B 32K
writer/palmyra-med-70b-32k |
— | 33K | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 30 |
Yi Large
01-ai/yi-large |
— | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 31 |
Cosmos Reason2 8B
nvidia/cosmos-reason2-8b |
— | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 32 |
Mistral Nemo Minitron 8B 8K
nvidia/mistral-nemo-minitron-8b-8k-instruct |
— | 8K | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 33 |
Gemma 3 12B
google/gemma-3-12b-it |
3.8 | — | Mittelgroß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 34 |
Mistral 7B
mistralai/mistral-7b-instruct-v0.3 |
5.0 | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 35 |
Codestral 22B
mistralai/codestral-22b-instruct-v0.1 |
— | — | Mittelgroß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 36 |
Granite 34B Code
ibm/granite-34b-code-instruct |
— | — | Mittelgroß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 37 |
Llama 3.1 Nemotron 51B
nvidia/llama-3.1-nemotron-51b-instruct |
— | — | Mittelgroß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 38 |
Neva 22B
nvidia/neva-22b |
— | — | Mittelgroß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 39 |
Phi 3.5 MoE
microsoft/phi-3.5-moe-instruct |
— | — | Mittelgroß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 40 |
StarCoder2 15B
bigcode/starcoder2-15b |
— | — | Mittelgroß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 41 |
Llama 3.1 Nemotron 70B
nvidia/llama-3.1-nemotron-70b-instruct |
6.9 | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 42 |
Mistral Large 2
mistralai/mistral-large-2-instruct |
7.6 | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 43 |
Gemma 2B
google/gemma-2b |
— | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 44 |
Jamba 1.5 Large
ai21labs/jamba-1.5-large-instruct |
6.0 | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 45 |
Mistral Large
mistralai/mistral-large |
5.8 | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 46 |
DBRX Instruct
databricks/dbrx-instruct |
5.3 | — | Sehr groß | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 47 |
CodeGemma 1.1 7B
google/codegemma-1.1-7b |
— | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 48 |
CodeGemma 7B
google/codegemma-7b |
— | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 49 |
DeepSeek Coder 6 7B
deepseek-ai/deepseek-coder-6.7b-instruct |
— | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 50 |
Fuyu 8B
adept/fuyu-8b |
— | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 51 |
Granite 3.0 3B A800M
ibm/granite-3.0-3b-a800m-instruct |
— | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 52 |
Granite 3.0 8B
ibm/granite-3.0-8b-instruct |
— | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 53 |
Granite 8B Code
ibm/granite-8b-code-instruct |
— | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 54 |
Kosmos 2
microsoft/kosmos-2 |
— | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 55 |
Phi 3 Vision 128K
microsoft/phi-3-vision-128k-instruct |
— | 131K | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 56 |
RecurrentGemma 2B
google/recurrentgemma-2b |
— | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 57 |
SEA-LION 7B
aisingapore/sea-lion-7b-instruct |
— | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 58 |
Vila
nvidia/vila |
— | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 59 |
Zamba2 7B Instruct
zyphra/zamba2-7b-instruct |
— | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 60 |
Riva Translate 4B Instruct V2
nvidia/riva-translate-4b-instruct-v2 |
— | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 61 |
Riva Translate 4B Instruct
nvidia/riva-translate-4b-instruct |
— | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
| 62 |
Riva Translate 4B Instruct V1.1
nvidia/riva-translate-4b-instruct-v1.1 |
— | — | Klein | Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. | Öffnen |
Benchmarks: Artificial Analysis (24. September 2026). Ein Strich bedeutet, dass das Modell nicht in deren Rangliste steht; wir schätzen Werte nie selbst.
FAQ
Ist NVIDIA Build kostenlos?
Kostenlose serverlose Inferenz für Entwicklung und Prototyping mit Entwicklerkonto; nicht für Produktionstraffic gedacht. 62 Modelle sind derzeit kostenlos.
Ist NVIDIA Build mit der OpenAI API kompatibel?
Ja — nutzen Sie die base URL https://integrate.api.nvidia.com/v1 mit einem beliebigen OpenAI-kompatiblen Client oder SDK.
Verlangt NVIDIA Build eine Karte?
Nein, kostenlose Modelle funktionieren ohne Karte.