LLM Perks

Modèles et API gratuits sur NVIDIA Build en 2026

NVIDIA Build fournit une inférence serverless gratuite pour le développement. Ce catalogue est actualisé directement depuis la NIM Models API authentifiée.

62 modèlesjusqu'à 1M contextemeilleur : GLM 5.3Mis à jour:

NVIDIA Build

En ligne lors de la dernière vérification

Inférence serverless gratuite pour le développement et le prototypage avec un compte développeur ; non destinée au trafic de production.

Base URL
https://integrate.api.nvidia.com/v1
Compatibilité
OpenAI Chat Completions
Carte
Non requise
Limites
Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer.
62 trouvé(s)
# Modèle ↕ Indice AA ↕ Contexte ↕ Taille ↕ Limite
1
GLM 5.3
z-ai/glm-5.3
44.8 — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
2
Kimi K3
moonshotai/kimi-k3
43.6 — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
3
GLM 5.3 Flash
z-ai/glm-5.3-flash
41.8 — Taille moyenne Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
4
DeepSeek V4.1 Flash
deepseek-ai/deepseek-v4.1-flash
39.5 — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
5
Nemotron 3 Ultra
nvidia/nemotron-3-ultra-550b-a55b
22.9 1M Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
6
Kimi K2.6
moonshotai/kimi-k2.6
27.0 — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
7
Gemma 4 31B
google/gemma-4-31b-it
19.0 — Taille moyenne Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
8
Nemotron 3.5 Lightning
nvidia/nemotron-3.5-lightning-30b-a3b
12.9 — Taille moyenne Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
9
Nemotron 3 Super
nvidia/nemotron-3-super-120b-a12b
12.8 — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
10
Nemotron 3 Nano Omni
nvidia/nemotron-3-nano-omni-30b-a3b-reasoning
10.3 — Taille moyenne Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
11
Palmyra Creative 122B
writer/palmyra-creative-122b
— — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
12
gpt-oss-20b
openai/gpt-oss-20b
10.0 — Taille moyenne Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
13
Mistral Nemo
nv-mistralai/mistral-nemo-12b-instruct
— — Taille moyenne Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
14
Laguna XS 2.1
poolside/laguna-xs-2.1
— — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
15
Mistral Nemotron
mistralai/mistral-nemotron
— — Taille moyenne Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
16
Muse Glimmer 30B
meta/muse-glimmer-30b
— — Taille moyenne Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
17
Nemotron 3 Nano
nvidia/nemotron-nano-3-30b-a3b
8.9 — Taille moyenne Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
18
Llama 3.2 11B Vision
meta/llama-3.2-11b-vision-instruct
5.4 — Taille moyenne Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
19
Llama 3.2 90B Vision
meta/llama-3.2-90b-vision-instruct
6.4 — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
20
Llama 3.1 Nemotron Ultra 253B
nvidia/llama-3.1-nemotron-ultra-253b-v1
7.5 — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
21
Mixtral 8x22b
mistralai/mixtral-8x22b-v0.1
— — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
22
Gemma 3 4B
google/gemma-3-4b-it
4.8 — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
23
CodeLlama 70B
meta/codellama-70b
— — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
24
Llama 2 70B
meta/llama2-70b
— — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
25
Llama 3 ChatQA 1.5 70B
nvidia/llama3-chatqa-1.5-70b
— — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
26
Nemotron 4 340B
nvidia/nemotron-4-340b-instruct
— — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
27
Palmyra Fin 70B 32K
writer/palmyra-fin-70b-32k
— 33K Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
28
Palmyra Med 70B
writer/palmyra-med-70b
— — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
29
Palmyra Med 70B 32K
writer/palmyra-med-70b-32k
— 33K Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
30
Yi Large
01-ai/yi-large
— — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
31
Cosmos Reason2 8B
nvidia/cosmos-reason2-8b
— — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
32
Mistral Nemo Minitron 8B 8K
nvidia/mistral-nemo-minitron-8b-8k-instruct
— 8K Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
33
Gemma 3 12B
google/gemma-3-12b-it
3.8 — Taille moyenne Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
34
Mistral 7B
mistralai/mistral-7b-instruct-v0.3
5.0 — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
35
Codestral 22B
mistralai/codestral-22b-instruct-v0.1
— — Taille moyenne Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
36
Granite 34B Code
ibm/granite-34b-code-instruct
— — Taille moyenne Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
37
Llama 3.1 Nemotron 51B
nvidia/llama-3.1-nemotron-51b-instruct
— — Taille moyenne Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
38
Neva 22B
nvidia/neva-22b
— — Taille moyenne Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
39
Phi 3.5 MoE
microsoft/phi-3.5-moe-instruct
— — Taille moyenne Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
40
StarCoder2 15B
bigcode/starcoder2-15b
— — Taille moyenne Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
41
Llama 3.1 Nemotron 70B
nvidia/llama-3.1-nemotron-70b-instruct
6.9 — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
42
Mistral Large 2
mistralai/mistral-large-2-instruct
7.6 — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
43
Gemma 2B
google/gemma-2b
— — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
44
Jamba 1.5 Large
ai21labs/jamba-1.5-large-instruct
6.0 — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
45
Mistral Large
mistralai/mistral-large
5.8 — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
46
DBRX Instruct
databricks/dbrx-instruct
5.3 — Très grand Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
47
CodeGemma 1.1 7B
google/codegemma-1.1-7b
— — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
48
CodeGemma 7B
google/codegemma-7b
— — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
49
DeepSeek Coder 6 7B
deepseek-ai/deepseek-coder-6.7b-instruct
— — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
50
Fuyu 8B
adept/fuyu-8b
— — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
51
Granite 3.0 3B A800M
ibm/granite-3.0-3b-a800m-instruct
— — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
52
Granite 3.0 8B
ibm/granite-3.0-8b-instruct
— — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
53
Granite 8B Code
ibm/granite-8b-code-instruct
— — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
54
Kosmos 2
microsoft/kosmos-2
— — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
55
Phi 3 Vision 128K
microsoft/phi-3-vision-128k-instruct
— 131K Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
56
RecurrentGemma 2B
google/recurrentgemma-2b
— — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
57
SEA-LION 7B
aisingapore/sea-lion-7b-instruct
— — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
58
Vila
nvidia/vila
— — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
59
Zamba2 7B Instruct
zyphra/zamba2-7b-instruct
— — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
60
Riva Translate 4B Instruct V2
nvidia/riva-translate-4b-instruct-v2
— — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
61
Riva Translate 4B Instruct
nvidia/riva-translate-4b-instruct
— — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir
62
Riva Translate 4B Instruct V1.1
nvidia/riva-translate-4b-instruct-v1.1
— — Petit Inférence serverless gratuite pour le développement ; les limites et la disponibilité des modèles peuvent changer. Ouvrir

Benchmarks : Artificial Analysis (24 septembre 2026). Un tiret signifie que le modèle ne figure pas dans leur classement ; nous n'estimons jamais les scores nous-mêmes.

FAQ

NVIDIA Build est-il gratuit ?

Inférence serverless gratuite pour le développement et le prototypage avec un compte développeur ; non destinée au trafic de production. 62 modèles sont actuellement gratuits.

NVIDIA Build est-il compatible avec l'API OpenAI ?

Oui — utilisez la base URL https://integrate.api.nvidia.com/v1 avec n'importe quel client ou SDK compatible OpenAI.

NVIDIA Build exige-t-il une carte ?

Non, les modèles gratuits fonctionnent sans carte.

Voir aussi