LLM Perks

API LLM gratuites en 2026 : le guide complet

15 fournisseurs, leurs limites et leurs pièges — et comment assembler une stack gratuite pour votre usage.

Guide
API LLM gratuites 2026

En 2026, vous pouvez construire un vrai produit sur des grands modèles de langage sans payer les tokens. Des dizaines de fournisseurs offrent un accès API gratuit à de solides modèles ouverts — DeepSeek, Qwen, GLM, Kimi, Nemotron, Gemma — et Google propose toujours une offre gratuite pour Gemini Flash. Le hic, c'est que chaque fournisseur a ses propres règles : certains vous limitent à 50 requêtes par jour, d'autres exigent une carte bancaire, d'autres encore enregistrent vos prompts, et des routes gratuites apparaissent et disparaissent chaque semaine.

Ce guide explique comment fonctionnent réellement les API LLM gratuites, quels fournisseurs méritent votre temps, comment choisir un modèle selon votre tâche et comment cumuler plusieurs offres gratuites pour atteindre rarement une limite. Les chiffres proviennent de notre catalogue en direct, qui interroge 15 fournisseurs toutes les heures.

💡
Tout ce qui suit reflète la situation au 24 septembre 2026. Les offres gratuites changent en permanence — consultez le catalogue ou le flux des nouveaux modèles gratuits pour la liste du jour.

Trois sortes de « gratuit »

Quand un fournisseur annonce qu'une API LLM est gratuite, cela signifie l'une de ces trois choses :

  • Routes à prix zéro. Le modèle est listé avec un prix d'entrée et de sortie de 0 $. OpenRouter les signale par le suffixe :free ; UnoRouter, Nous Portal, TokenRouter et Vercel AI Gateway font de même. Vous ne payez rien par token, mais le nombre de requêtes est limité.
  • Offres gratuites pour développeurs. Le fournisseur accorde un quota mensuel ou quotidien permanent : Google AI Studio pour Gemini, Groq, Cloudflare Workers AI (10 000 Neurons par jour), NVIDIA Build pour le prototypage, les clés d'essai Cohere (1 000 appels par mois).
  • Crédits d'essai. Un solde unique pour les nouveaux comptes — Cerebras, AI21, Fireworks et les grands clouds. Utile pour expérimenter, pas pour un produit. Nous les suivons séparément sur la page crédits IA.

Les fournisseurs à connaître

FournisseurCe qui est gratuitCarteIdéal pour
OpenRouterModèles :free : 50 requêtes/jour, ou 1 000/jour après une recharge unique de 10 $ ; 20 requêtes/minNonUne seule clé pour de nombreux modèles
UnoRouterLe plus grand catalogue de routes :free, capacité partagée et limites par modèleNonEssayer beaucoup de nouveaux modèles
NVIDIA BuildInférence serverless gratuite pour le développementNonModèles ouverts récents (GLM, Kimi, DeepSeek, Nemotron)
Google AI StudioGemini Flash et Flash-Lite avec limites de débitNonEntrées multimodales, contexte long
GroqLimites de requêtes et de tokens par modèle, par minute et par jourNonRéponses très rapides
CerebrasEssai gratuit avec limites quotidiennes de tokensOuiVitesse
Cloudflare Workers AI10 000 Neurons par jourNonApplications edge, petits modèles
Nous PortalModèles :free sur le forfait à 0 $NonCharges de travail d'agents (Hermes Agent)
Vercel AI GatewayModèles promotionnels à prix zéroOuiApplications déjà hébergées sur Vercel

La comparaison complète, avec les URL de base de chaque fournisseur, se trouve sur la page des fournisseurs.

Les modèles gratuits les plus performants en ce moment

Nous associons chaque modèle gratuit au classement public d'Artificial Analysis. Son Intelligence Index combine dix benchmarks couvrant le raisonnement, les connaissances, le code et les tâches agentiques. Les meilleurs modèles gratuits aujourd'hui :

ModèleAA Intelligence IndexContexteGratuit chez
GLM 5.344,81MNVIDIA Build, UnoRouter
Kimi K343,61MNVIDIA Build, UnoRouter
GLM 5.3 Flash41,81MNVIDIA Build, OrcaRouter, UnoRouter
Qwen 3.8 Flash Next39,81MUnoRouter
DeepSeek V4.1 Flash39,5—NVIDIA Build
DeepSeek V4 Pro36,01MUnoRouter

Deux constats s'imposent. D'abord, les meilleurs modèles gratuits sont des modèles MoE chinois à poids ouverts, dotés de fenêtres de contexte d'un million de tokens. Ensuite, un même modèle est souvent gratuit chez plusieurs fournisseurs, chacun avec ses propres limites — et c'est précisément ce qui permet de les cumuler.

Choisir un modèle selon la tâche

Votre première requête

Presque tous les fournisseurs parlent le protocole OpenAI Chat Completions, donc un seul extrait de code fonctionne partout — seuls l'URL de base, la clé et l'identifiant du modèle changent. Voici l'exemple avec OpenRouter :

curl https://openrouter.ai/api/v1/chat/completions \
  -H "Authorization: Bearer $OPENROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "z-ai/glm-5.2:free",
    "messages": [{"role": "user", "content": "Explique le MoE en deux phrases."}]
  }'

Chaque fiche de modèle du catalogue propose un extrait prêt à copier en cURL, Python et JavaScript pour le meilleur fournisseur disponible.

Les pièges

  • Limites de débit. Les routes gratuites reposent sur une capacité partagée. Attendez-vous à des erreurs HTTP 429 aux heures de pointe et prévoyez des nouvelles tentatives.
  • Confidentialité. Certaines routes gratuites peuvent utiliser vos prompts pour améliorer les modèles. Google indique que le contenu de l'offre gratuite de Gemini peut servir à améliorer ses produits. N'envoyez pas de données clients via des endpoints gratuits sans avoir lu la politique du fournisseur.
  • Instabilité. Les modèles promotionnels disparaissent sans préavis. Notre flux des nouveaux modèles et le flux RSS montrent ce qui est apparu et ce qui a disparu ces dernières semaines.
  • Carte exigée en coulisses. Cerebras et Vercel AI Gateway demandent une carte de paiement même pour les modèles à prix zéro.
  • Contexte plafonné. Un routeur peut servir un modèle à contexte de 1M avec une fenêtre plus petite. Le catalogue indique la valeur propre à chaque fournisseur.

Une pile gratuite qui s'épuise rarement

  1. Créez des clés chez OpenRouter, UnoRouter, NVIDIA Build et Google AI Studio — aucun d'eux n'exige de carte.
  2. Placez-les derrière un seul client compatible OpenAI : la plupart des outils (Cline, OpenCode, Open WebUI, LiteLLM) permettent de définir plusieurs fournisseurs et de basculer en cas d'erreur.
  3. Utilisez un modèle puissant (GLM 5.3 ou Kimi K3) pour la planification et un modèle rapide (Gemini Flash ou un modèle hébergé sur Groq) pour les appels courants.
  4. Pour les travaux sensibles en matière de confidentialité, exécutez un modèle en local avec Ollama ou LM Studio.

Si vous n'avez besoin de grosse puissance qu'occasionnellement, comparez ces offres gratuites aux forfaits payants dans notre tableau de rentabilité des abonnements — parfois, un forfait à 10 $ couvre ce qu'une semaine de jonglage entre clés gratuites vous apporterait.

Suivre les changements

Le catalogue est mis à jour toutes les heures, et chaque famille de modèles dispose de sa propre page avec fournisseurs, limites et benchmarks. Pour les outils qui se branchent sur ces API, consultez les logiciels IA gratuits ; pour les crédits ponctuels et les programmes pour startups, consultez les crédits IA.

LP
Rédaction LLM PerksL’équipe derrière l’index des API LLM gratuites. Nous vérifions les limites des fournisseurs et testons modèles et outils.

À lire aussi