En 2026 puedes construir un producto real sobre grandes modelos de lenguaje sin pagar por tokens. Decenas de proveedores regalan acceso por API a modelos abiertos potentes — DeepSeek, Qwen, GLM, Kimi, Nemotron, Gemma — y Google sigue ofreciendo un plan gratuito para Gemini Flash. El problema es que cada proveedor tiene sus propias reglas: algunos te limitan a 50 solicitudes al día, otros piden tarjeta de crédito, otros registran tus prompts, y las rutas gratuitas aparecen y desaparecen cada semana.
Esta guía explica cómo funcionan realmente las API de LLM gratuitas, qué proveedores merecen tu tiempo, cómo elegir un modelo para tu tarea y cómo combinar varios planes gratuitos para que casi nunca llegues a un límite. Las cifras provienen de nuestro catálogo en vivo, que consulta 15 proveedores cada hora.
Tres tipos de «gratis»
Cuando un proveedor dice que una API de LLM es gratuita, se refiere a una de estas tres cosas:
- Rutas a precio cero. El modelo aparece con un precio de entrada y de salida de 0 $. OpenRouter las marca con el sufijo
:free; UnoRouter, Nous Portal, TokenRouter y Vercel AI Gateway hacen lo mismo. No pagas nada por token, pero hay un límite de solicitudes. - Planes gratuitos para desarrolladores. El proveedor ofrece una cuota mensual o diaria permanente: Google AI Studio para Gemini, Groq, Cloudflare Workers AI (10.000 Neurons al día), NVIDIA Build para prototipos, claves de prueba de Cohere (1.000 llamadas al mes).
- Créditos de prueba. Un saldo único para cuentas nuevas — Cerebras, AI21, Fireworks y las grandes nubes. Útil para experimentar, no para un producto. Los seguimos por separado en la página de créditos de IA.
Los proveedores que vale la pena conocer
| Proveedor | Qué es gratis | Tarjeta | Ideal para |
|---|---|---|---|
| OpenRouter | Modelos :free: 50 solicitudes/día, o 1.000/día tras una recarga única de 10 $; 20 solicitudes/min | No | Una sola clave para muchos modelos |
| UnoRouter | El mayor catálogo de rutas :free, capacidad compartida y límites por modelo | No | Probar muchos modelos nuevos |
| NVIDIA Build | Inferencia serverless gratuita para desarrollo | No | Modelos abiertos recientes (GLM, Kimi, DeepSeek, Nemotron) |
| Google AI Studio | Gemini Flash y Flash-Lite con límites de uso | No | Entrada multimodal, contexto largo |
| Groq | Límites de solicitudes y tokens por modelo, por minuto y por día | No | Respuestas muy rápidas |
| Cerebras | Prueba gratuita con límites diarios de tokens | Sí | Velocidad |
| Cloudflare Workers AI | 10.000 Neurons al día | No | Apps en el edge, modelos pequeños |
| Nous Portal | Modelos :free en el plan de 0 $ | No | Cargas de trabajo de agentes (Hermes Agent) |
| Vercel AI Gateway | Modelos promocionales a precio cero | Sí | Apps que ya están en Vercel |
La comparativa completa, con las URL base de cada proveedor, está en la página de proveedores.
Los modelos gratuitos más potentes ahora mismo
Cruzamos cada modelo gratuito con la clasificación pública de Artificial Analysis. Su Intelligence Index combina diez benchmarks que cubren razonamiento, conocimiento, programación y tareas agénticas. Los mejores modelos gratuitos hoy:
| Modelo | AA Intelligence Index | Contexto | Gratis en |
|---|---|---|---|
| GLM 5.3 | 44,8 | 1M | NVIDIA Build, UnoRouter |
| Kimi K3 | 43,6 | 1M | NVIDIA Build, UnoRouter |
| GLM 5.3 Flash | 41,8 | 1M | NVIDIA Build, OrcaRouter, UnoRouter |
| Qwen 3.8 Flash Next | 39,8 | 1M | UnoRouter |
| DeepSeek V4.1 Flash | 39,5 | — | NVIDIA Build |
| DeepSeek V4 Pro | 36,0 | 1M | UnoRouter |
Destacan dos cosas. Primero, los mejores modelos gratuitos son modelos MoE chinos de pesos abiertos con ventanas de contexto de un millón de tokens. Segundo, el mismo modelo suele ser gratuito en varios proveedores, cada uno con sus propios límites — y eso es precisamente lo que permite combinarlos.
Elige un modelo según la tarea
- Programación y agentes de IDE: GLM 5.3, Kimi K3, DeepSeek V4, Qwen 3.8. Consulta los modelos gratuitos para programar y nuestro ranking de programación.
- Agentes autónomos: modelos con llamadas a herramientas fiables — modelos gratuitos para agentes.
- Documentos y repositorios grandes: modelos de contexto largo de 256K a 1M tokens.
- Capturas de pantalla, OCR, imágenes como entrada: modelos de visión como Gemini Flash, Gemma 4 y Kimi K3.
- Baja latencia: modelos pequeños en Groq o Cerebras.
Tu primera solicitud
Casi todos los proveedores hablan el protocolo OpenAI Chat Completions, así que un mismo fragmento de código funciona en todas partes — solo cambian la URL base, la clave y el ID del modelo. Este es el ejemplo con OpenRouter:
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-5.2:free",
"messages": [{"role": "user", "content": "Explica MoE en dos frases."}]
}'
Cada ficha de modelo del catálogo incluye un fragmento listo para copiar en cURL, Python y JavaScript para el mejor proveedor disponible.
Las trampas
- Límites de uso. Las rutas gratuitas funcionan con capacidad compartida. Espera errores HTTP 429 en horas punta y diseña tu código con reintentos.
- Privacidad. Algunas rutas gratuitas pueden usar tus prompts para mejorar los modelos. Google indica que el contenido del plan gratuito de Gemini puede usarse para mejorar sus productos. No envíes datos de clientes a través de endpoints gratuitos sin leer la política del proveedor.
- Rotación. Los modelos promocionales desaparecen sin aviso. Nuestro feed de nuevos modelos y el RSS muestran qué apareció y qué desapareció en las últimas semanas.
- Tarjeta obligatoria oculta. Cerebras y Vercel AI Gateway piden una tarjeta de pago incluso para modelos a precio cero.
- Contexto recortado. Un router puede servir un modelo de 1M de contexto con una ventana más pequeña. El catálogo muestra el valor específico de cada proveedor.
Un stack gratuito que casi nunca se agota
- Crea claves en OpenRouter, UnoRouter, NVIDIA Build y Google AI Studio — ninguno pide tarjeta.
- Ponlas detrás de un único cliente compatible con OpenAI: la mayoría de herramientas (Cline, OpenCode, Open WebUI, LiteLLM) te permiten definir varios proveedores y cambiar de uno a otro ante errores.
- Usa un modelo potente (GLM 5.3 o Kimi K3) para planificar y uno rápido (Gemini Flash o un modelo alojado en Groq) para las llamadas rutinarias.
- Para trabajo sensible en cuanto a privacidad, ejecuta un modelo en local con Ollama o LM Studio.
Si solo necesitas mucha potencia de vez en cuando, compara estos planes gratuitos con los de pago en nuestra tabla de rentabilidad de suscripciones: a veces un plan de 10 $ cubre lo que te daría una semana haciendo malabares con claves gratuitas.
Mantente al día
El catálogo se actualiza cada hora, y cada familia de modelos tiene su propia página con proveedores, límites y benchmarks. Para herramientas que se conectan a estas API, consulta software de IA gratuito; para créditos únicos y programas para startups, consulta créditos de IA.