En 2026, vous pouvez construire un vrai produit sur des grands modèles de langage sans payer les tokens. Des dizaines de fournisseurs offrent un accès API gratuit à de solides modèles ouverts — DeepSeek, Qwen, GLM, Kimi, Nemotron, Gemma — et Google propose toujours une offre gratuite pour Gemini Flash. Le hic, c'est que chaque fournisseur a ses propres règles : certains vous limitent à 50 requêtes par jour, d'autres exigent une carte bancaire, d'autres encore enregistrent vos prompts, et des routes gratuites apparaissent et disparaissent chaque semaine.
Ce guide explique comment fonctionnent réellement les API LLM gratuites, quels fournisseurs méritent votre temps, comment choisir un modèle selon votre tâche et comment cumuler plusieurs offres gratuites pour atteindre rarement une limite. Les chiffres proviennent de notre catalogue en direct, qui interroge 15 fournisseurs toutes les heures.
Trois sortes de « gratuit »
Quand un fournisseur annonce qu'une API LLM est gratuite, cela signifie l'une de ces trois choses :
- Routes à prix zéro. Le modèle est listé avec un prix d'entrée et de sortie de 0 $. OpenRouter les signale par le suffixe
:free; UnoRouter, Nous Portal, TokenRouter et Vercel AI Gateway font de même. Vous ne payez rien par token, mais le nombre de requêtes est limité. - Offres gratuites pour développeurs. Le fournisseur accorde un quota mensuel ou quotidien permanent : Google AI Studio pour Gemini, Groq, Cloudflare Workers AI (10 000 Neurons par jour), NVIDIA Build pour le prototypage, les clés d'essai Cohere (1 000 appels par mois).
- Crédits d'essai. Un solde unique pour les nouveaux comptes — Cerebras, AI21, Fireworks et les grands clouds. Utile pour expérimenter, pas pour un produit. Nous les suivons séparément sur la page crédits IA.
Les fournisseurs à connaître
| Fournisseur | Ce qui est gratuit | Carte | Idéal pour |
|---|---|---|---|
| OpenRouter | Modèles :free : 50 requêtes/jour, ou 1 000/jour après une recharge unique de 10 $ ; 20 requêtes/min | Non | Une seule clé pour de nombreux modèles |
| UnoRouter | Le plus grand catalogue de routes :free, capacité partagée et limites par modèle | Non | Essayer beaucoup de nouveaux modèles |
| NVIDIA Build | Inférence serverless gratuite pour le développement | Non | Modèles ouverts récents (GLM, Kimi, DeepSeek, Nemotron) |
| Google AI Studio | Gemini Flash et Flash-Lite avec limites de débit | Non | Entrées multimodales, contexte long |
| Groq | Limites de requêtes et de tokens par modèle, par minute et par jour | Non | Réponses très rapides |
| Cerebras | Essai gratuit avec limites quotidiennes de tokens | Oui | Vitesse |
| Cloudflare Workers AI | 10 000 Neurons par jour | Non | Applications edge, petits modèles |
| Nous Portal | Modèles :free sur le forfait à 0 $ | Non | Charges de travail d'agents (Hermes Agent) |
| Vercel AI Gateway | Modèles promotionnels à prix zéro | Oui | Applications déjà hébergées sur Vercel |
La comparaison complète, avec les URL de base de chaque fournisseur, se trouve sur la page des fournisseurs.
Les modèles gratuits les plus performants en ce moment
Nous associons chaque modèle gratuit au classement public d'Artificial Analysis. Son Intelligence Index combine dix benchmarks couvrant le raisonnement, les connaissances, le code et les tâches agentiques. Les meilleurs modèles gratuits aujourd'hui :
| Modèle | AA Intelligence Index | Contexte | Gratuit chez |
|---|---|---|---|
| GLM 5.3 | 44,8 | 1M | NVIDIA Build, UnoRouter |
| Kimi K3 | 43,6 | 1M | NVIDIA Build, UnoRouter |
| GLM 5.3 Flash | 41,8 | 1M | NVIDIA Build, OrcaRouter, UnoRouter |
| Qwen 3.8 Flash Next | 39,8 | 1M | UnoRouter |
| DeepSeek V4.1 Flash | 39,5 | — | NVIDIA Build |
| DeepSeek V4 Pro | 36,0 | 1M | UnoRouter |
Deux constats s'imposent. D'abord, les meilleurs modèles gratuits sont des modèles MoE chinois à poids ouverts, dotés de fenêtres de contexte d'un million de tokens. Ensuite, un même modèle est souvent gratuit chez plusieurs fournisseurs, chacun avec ses propres limites — et c'est précisément ce qui permet de les cumuler.
Choisir un modèle selon la tâche
- Code et agents d'IDE : GLM 5.3, Kimi K3, DeepSeek V4, Qwen 3.8. Voir les modèles gratuits pour le code et notre classement pour le code.
- Agents autonomes : des modèles fiables en appel d'outils — modèles gratuits pour les agents.
- Gros documents et dépôts : modèles à contexte long de 256K à 1M tokens.
- Captures d'écran, OCR, images en entrée : modèles de vision comme Gemini Flash, Gemma 4 et Kimi K3.
- Faible latence : petits modèles sur Groq ou Cerebras.
Votre première requête
Presque tous les fournisseurs parlent le protocole OpenAI Chat Completions, donc un seul extrait de code fonctionne partout — seuls l'URL de base, la clé et l'identifiant du modèle changent. Voici l'exemple avec OpenRouter :
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-5.2:free",
"messages": [{"role": "user", "content": "Explique le MoE en deux phrases."}]
}'
Chaque fiche de modèle du catalogue propose un extrait prêt à copier en cURL, Python et JavaScript pour le meilleur fournisseur disponible.
Les pièges
- Limites de débit. Les routes gratuites reposent sur une capacité partagée. Attendez-vous à des erreurs HTTP 429 aux heures de pointe et prévoyez des nouvelles tentatives.
- Confidentialité. Certaines routes gratuites peuvent utiliser vos prompts pour améliorer les modèles. Google indique que le contenu de l'offre gratuite de Gemini peut servir à améliorer ses produits. N'envoyez pas de données clients via des endpoints gratuits sans avoir lu la politique du fournisseur.
- Instabilité. Les modèles promotionnels disparaissent sans préavis. Notre flux des nouveaux modèles et le flux RSS montrent ce qui est apparu et ce qui a disparu ces dernières semaines.
- Carte exigée en coulisses. Cerebras et Vercel AI Gateway demandent une carte de paiement même pour les modèles à prix zéro.
- Contexte plafonné. Un routeur peut servir un modèle à contexte de 1M avec une fenêtre plus petite. Le catalogue indique la valeur propre à chaque fournisseur.
Une pile gratuite qui s'épuise rarement
- Créez des clés chez OpenRouter, UnoRouter, NVIDIA Build et Google AI Studio — aucun d'eux n'exige de carte.
- Placez-les derrière un seul client compatible OpenAI : la plupart des outils (Cline, OpenCode, Open WebUI, LiteLLM) permettent de définir plusieurs fournisseurs et de basculer en cas d'erreur.
- Utilisez un modèle puissant (GLM 5.3 ou Kimi K3) pour la planification et un modèle rapide (Gemini Flash ou un modèle hébergé sur Groq) pour les appels courants.
- Pour les travaux sensibles en matière de confidentialité, exécutez un modèle en local avec Ollama ou LM Studio.
Si vous n'avez besoin de grosse puissance qu'occasionnellement, comparez ces offres gratuites aux forfaits payants dans notre tableau de rentabilité des abonnements — parfois, un forfait à 10 $ couvre ce qu'une semaine de jonglage entre clés gratuites vous apporterait.
Suivre les changements
Le catalogue est mis à jour toutes les heures, et chaque famille de modèles dispose de sa propre page avec fournisseurs, limites et benchmarks. Pour les outils qui se branchent sur ces API, consultez les logiciels IA gratuits ; pour les crédits ponctuels et les programmes pour startups, consultez les crédits IA.