LLM Perks

Kostenlose Modelle und APIs bei NVIDIA Build 2026

NVIDIA Build bietet kostenlose serverlose Inferenz für die Entwicklung. Dieser Katalog wird direkt über die authentifizierte NIM Models API aktualisiert.

62 Modellebis zu 1M Kontextbeste: GLM 5.3Aktualisiert:

NVIDIA Build

Online bei der letzten Prüfung

Kostenlose serverlose Inferenz für Entwicklung und Prototyping mit Entwicklerkonto; nicht für Produktionstraffic gedacht.

Base URL
https://integrate.api.nvidia.com/v1
Kompatibilität
OpenAI Chat Completions
Karte
Nicht erforderlich
Limits
Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern.
62 gefunden
# Modell ↕ AA Index ↕ Kontext ↕ Größe ↕ Limit
1
GLM 5.3
z-ai/glm-5.3
44.8 — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
2
Kimi K3
moonshotai/kimi-k3
43.6 — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
3
GLM 5.3 Flash
z-ai/glm-5.3-flash
41.8 — Mittelgroß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
4
DeepSeek V4.1 Flash
deepseek-ai/deepseek-v4.1-flash
39.5 — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
5
Nemotron 3 Ultra
nvidia/nemotron-3-ultra-550b-a55b
22.9 1M Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
6
Kimi K2.6
moonshotai/kimi-k2.6
27.0 — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
7
Gemma 4 31B
google/gemma-4-31b-it
19.0 — Mittelgroß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
8
Nemotron 3.5 Lightning
nvidia/nemotron-3.5-lightning-30b-a3b
12.9 — Mittelgroß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
9
Nemotron 3 Super
nvidia/nemotron-3-super-120b-a12b
12.8 — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
10
Nemotron 3 Nano Omni
nvidia/nemotron-3-nano-omni-30b-a3b-reasoning
10.3 — Mittelgroß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
11
Palmyra Creative 122B
writer/palmyra-creative-122b
— — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
12
gpt-oss-20b
openai/gpt-oss-20b
10.0 — Mittelgroß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
13
Mistral Nemo
nv-mistralai/mistral-nemo-12b-instruct
— — Mittelgroß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
14
Laguna XS 2.1
poolside/laguna-xs-2.1
— — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
15
Mistral Nemotron
mistralai/mistral-nemotron
— — Mittelgroß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
16
Muse Glimmer 30B
meta/muse-glimmer-30b
— — Mittelgroß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
17
Nemotron 3 Nano
nvidia/nemotron-nano-3-30b-a3b
8.9 — Mittelgroß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
18
Llama 3.2 11B Vision
meta/llama-3.2-11b-vision-instruct
5.4 — Mittelgroß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
19
Llama 3.2 90B Vision
meta/llama-3.2-90b-vision-instruct
6.4 — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
20
Llama 3.1 Nemotron Ultra 253B
nvidia/llama-3.1-nemotron-ultra-253b-v1
7.5 — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
21
Mixtral 8x22b
mistralai/mixtral-8x22b-v0.1
— — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
22
Gemma 3 4B
google/gemma-3-4b-it
4.8 — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
23
CodeLlama 70B
meta/codellama-70b
— — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
24
Llama 2 70B
meta/llama2-70b
— — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
25
Llama 3 ChatQA 1.5 70B
nvidia/llama3-chatqa-1.5-70b
— — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
26
Nemotron 4 340B
nvidia/nemotron-4-340b-instruct
— — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
27
Palmyra Fin 70B 32K
writer/palmyra-fin-70b-32k
— 33K Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
28
Palmyra Med 70B
writer/palmyra-med-70b
— — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
29
Palmyra Med 70B 32K
writer/palmyra-med-70b-32k
— 33K Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
30
Yi Large
01-ai/yi-large
— — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
31
Cosmos Reason2 8B
nvidia/cosmos-reason2-8b
— — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
32
Mistral Nemo Minitron 8B 8K
nvidia/mistral-nemo-minitron-8b-8k-instruct
— 8K Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
33
Gemma 3 12B
google/gemma-3-12b-it
3.8 — Mittelgroß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
34
Mistral 7B
mistralai/mistral-7b-instruct-v0.3
5.0 — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
35
Codestral 22B
mistralai/codestral-22b-instruct-v0.1
— — Mittelgroß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
36
Granite 34B Code
ibm/granite-34b-code-instruct
— — Mittelgroß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
37
Llama 3.1 Nemotron 51B
nvidia/llama-3.1-nemotron-51b-instruct
— — Mittelgroß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
38
Neva 22B
nvidia/neva-22b
— — Mittelgroß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
39
Phi 3.5 MoE
microsoft/phi-3.5-moe-instruct
— — Mittelgroß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
40
StarCoder2 15B
bigcode/starcoder2-15b
— — Mittelgroß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
41
Llama 3.1 Nemotron 70B
nvidia/llama-3.1-nemotron-70b-instruct
6.9 — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
42
Mistral Large 2
mistralai/mistral-large-2-instruct
7.6 — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
43
Gemma 2B
google/gemma-2b
— — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
44
Jamba 1.5 Large
ai21labs/jamba-1.5-large-instruct
6.0 — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
45
Mistral Large
mistralai/mistral-large
5.8 — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
46
DBRX Instruct
databricks/dbrx-instruct
5.3 — Sehr groß Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
47
CodeGemma 1.1 7B
google/codegemma-1.1-7b
— — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
48
CodeGemma 7B
google/codegemma-7b
— — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
49
DeepSeek Coder 6 7B
deepseek-ai/deepseek-coder-6.7b-instruct
— — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
50
Fuyu 8B
adept/fuyu-8b
— — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
51
Granite 3.0 3B A800M
ibm/granite-3.0-3b-a800m-instruct
— — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
52
Granite 3.0 8B
ibm/granite-3.0-8b-instruct
— — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
53
Granite 8B Code
ibm/granite-8b-code-instruct
— — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
54
Kosmos 2
microsoft/kosmos-2
— — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
55
Phi 3 Vision 128K
microsoft/phi-3-vision-128k-instruct
— 131K Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
56
RecurrentGemma 2B
google/recurrentgemma-2b
— — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
57
SEA-LION 7B
aisingapore/sea-lion-7b-instruct
— — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
58
Vila
nvidia/vila
— — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
59
Zamba2 7B Instruct
zyphra/zamba2-7b-instruct
— — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
60
Riva Translate 4B Instruct V2
nvidia/riva-translate-4b-instruct-v2
— — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
61
Riva Translate 4B Instruct
nvidia/riva-translate-4b-instruct
— — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen
62
Riva Translate 4B Instruct V1.1
nvidia/riva-translate-4b-instruct-v1.1
— — Klein Kostenlose serverlose Inferenz für die Entwicklung; Limits und Modellverfügbarkeit können sich ändern. Öffnen

Benchmarks: Artificial Analysis (24. September 2026). Ein Strich bedeutet, dass das Modell nicht in deren Rangliste steht; wir schätzen Werte nie selbst.

FAQ

Ist NVIDIA Build kostenlos?

Kostenlose serverlose Inferenz für Entwicklung und Prototyping mit Entwicklerkonto; nicht für Produktionstraffic gedacht. 62 Modelle sind derzeit kostenlos.

Ist NVIDIA Build mit der OpenAI API kompatibel?

Ja — nutzen Sie die base URL https://integrate.api.nvidia.com/v1 mit einem beliebigen OpenAI-kompatiblen Client oder SDK.

Verlangt NVIDIA Build eine Karte?

Nein, kostenlose Modelle funktionieren ohne Karte.

Siehe auch