Im Jahr 2026 können Sie ein echtes Produkt auf Basis großer Sprachmodelle entwickeln, ohne für Token zu bezahlen. Dutzende Anbieter stellen API-Zugang zu starken offenen Modellen kostenlos bereit — DeepSeek, Qwen, GLM, Kimi, Nemotron, Gemma — und Google bietet weiterhin einen kostenlosen Tarif für Gemini Flash an. Der Haken: Jeder Anbieter spielt nach eigenen Regeln. Manche begrenzen Sie auf 50 Anfragen pro Tag, manche verlangen eine Kreditkarte, manche protokollieren Ihre Prompts, und kostenlose Routen tauchen jede Woche auf und verschwinden wieder.
Dieser Leitfaden erklärt, wie kostenlose LLM-APIs tatsächlich funktionieren, welche Anbieter Ihre Zeit wert sind, wie Sie ein Modell für Ihre Aufgabe auswählen und wie Sie mehrere kostenlose Tarife kombinieren, sodass Sie nur selten an ein Limit stoßen. Die Zahlen stammen aus unserem Live-Katalog, der 15 Anbieter stündlich abfragt.
Drei Arten von „kostenlos“
Wenn ein Anbieter sagt, eine LLM-API sei kostenlos, meint er eines von drei Dingen:
- Routen zum Nulltarif. Das Modell ist mit einem Eingabe- und Ausgabepreis von 0 $ gelistet. OpenRouter kennzeichnet solche Modelle mit dem Suffix
:free; UnoRouter, Nous Portal, TokenRouter und Vercel AI Gateway handhaben es genauso. Sie zahlen nichts pro Token, aber es gibt ein Anfragelimit. - Kostenlose Entwicklertarife. Der Anbieter gewährt ein dauerhaftes monatliches oder tägliches Kontingent: Google AI Studio für Gemini, Groq, Cloudflare Workers AI (10.000 Neurons pro Tag), NVIDIA Build für das Prototyping, Cohere-Trial-Keys (1.000 Aufrufe pro Monat).
- Testguthaben. Ein einmaliges Guthaben für neue Konten — Cerebras, AI21, Fireworks und die großen Clouds. Nützlich für Experimente, nicht für ein Produkt. Diese Angebote erfassen wir separat auf der Seite KI-Guthaben.
Anbieter, die Sie kennen sollten
| Anbieter | Was kostenlos ist | Karte | Am besten für |
|---|---|---|---|
| OpenRouter | :free-Modelle: 50 Anfragen/Tag oder 1.000/Tag nach einer einmaligen Aufladung von 10 $; 20 Anfragen/Min. | Nein | Ein Key für viele Modelle |
| UnoRouter | Der größte Katalog an :free-Routen, geteilte Kapazität und Limits pro Modell | Nein | Viele neue Modelle ausprobieren |
| NVIDIA Build | Kostenlose Serverless-Inferenz für die Entwicklung | Nein | Neue offene Modelle (GLM, Kimi, DeepSeek, Nemotron) |
| Google AI Studio | Gemini Flash und Flash-Lite mit Ratenlimits | Nein | Multimodale Eingaben, langer Kontext |
| Groq | Anfrage- und Token-Limits pro Modell, pro Minute und pro Tag | Nein | Sehr schnelle Antworten |
| Cerebras | Kostenlose Testphase mit täglichen Token-Limits | Ja | Geschwindigkeit |
| Cloudflare Workers AI | 10.000 Neurons pro Tag | Nein | Edge-Apps, kleine Modelle |
| Nous Portal | :free-Modelle im 0-$-Tarif | Nein | Agenten-Workloads (Hermes Agent) |
| Vercel AI Gateway | Aktionsmodelle zum Nulltarif | Ja | Apps, die bereits auf Vercel laufen |
Den vollständigen Vergleich inklusive der Basis-URLs aller Anbieter finden Sie auf der Anbieterseite.
Die derzeit stärksten kostenlosen Modelle
Wir gleichen jedes kostenlose Modell mit der öffentlichen Rangliste von Artificial Analysis ab. Deren Intelligence Index fasst zehn Benchmarks zu Reasoning, Wissen, Programmierung und agentischen Aufgaben zusammen. Die aktuell besten kostenlosen Modelle:
| Modell | AA Intelligence Index | Kontext | Kostenlos bei |
|---|---|---|---|
| GLM 5.3 | 44,8 | 1M | NVIDIA Build, UnoRouter |
| Kimi K3 | 43,6 | 1M | NVIDIA Build, UnoRouter |
| GLM 5.3 Flash | 41,8 | 1M | NVIDIA Build, OrcaRouter, UnoRouter |
| Qwen 3.8 Flash Next | 39,8 | 1M | UnoRouter |
| DeepSeek V4.1 Flash | 39,5 | — | NVIDIA Build |
| DeepSeek V4 Pro | 36,0 | 1M | UnoRouter |
Zwei Dinge fallen auf. Erstens sind die besten kostenlosen Modelle chinesische MoE-Modelle mit offenen Gewichten und Kontextfenstern von einer Million Token. Zweitens ist dasselbe Modell oft bei mehreren Anbietern kostenlos, jeweils mit eigenen Limits — und genau das macht das Kombinieren möglich.
Das Modell nach Aufgabe wählen
- Programmierung und IDE-Agenten: GLM 5.3, Kimi K3, DeepSeek V4, Qwen 3.8. Siehe kostenlose Coding-Modelle und unser Coding-Ranking.
- Autonome Agenten: Modelle mit zuverlässigem Tool Calling — kostenlose Modelle für Agenten.
- Große Dokumente und Repositories: Modelle mit langem Kontext von 256K bis 1M Token.
- Screenshots, OCR, Bilder als Eingabe: Vision-Modelle wie Gemini Flash, Gemma 4 und Kimi K3.
- Niedrige Latenz: kleine Modelle auf Groq oder Cerebras.
Ihre erste Anfrage
Fast jeder Anbieter spricht das OpenAI-Chat-Completions-Protokoll, sodass ein einziges Snippet überall funktioniert — nur Basis-URL, Key und Modell-ID ändern sich. Hier das Beispiel für OpenRouter:
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer $OPENROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "z-ai/glm-5.2:free",
"messages": [{"role": "user", "content": "Erkläre MoE in zwei Sätzen."}]
}'
Jede Modellkarte im Katalog enthält ein kopierfertiges Snippet in cURL, Python und JavaScript für den besten verfügbaren Anbieter.
Die Haken
- Ratenlimits. Kostenlose Routen laufen auf geteilter Kapazität. Rechnen Sie zu Spitzenzeiten mit HTTP-429-Fehlern und planen Sie Wiederholungsversuche ein.
- Datenschutz. Manche kostenlosen Routen verwenden Ihre Prompts möglicherweise zur Verbesserung von Modellen. Google gibt an, dass Inhalte aus dem kostenlosen Gemini-Tarif zur Verbesserung seiner Produkte genutzt werden können. Senden Sie keine Kundendaten über kostenlose Endpunkte, ohne die Richtlinien des Anbieters gelesen zu haben.
- Fluktuation. Aktionsmodelle verschwinden ohne Vorankündigung. Unser Feed neuer Modelle und der RSS-Feed zeigen, was in den letzten Wochen hinzugekommen und was weggefallen ist.
- Versteckte Kartenpflicht. Cerebras und Vercel AI Gateway verlangen selbst für Modelle zum Nulltarif eine Zahlungskarte.
- Kontextgrenzen. Ein Router kann ein Modell mit 1M Kontext mit einem kleineren Fenster ausliefern. Der Katalog zeigt den anbieterspezifischen Wert.
Ein kostenloser Stack, der selten versiegt
- Erstellen Sie Keys bei OpenRouter, UnoRouter, NVIDIA Build und Google AI Studio — keiner dieser Anbieter verlangt eine Karte.
- Binden Sie sie hinter einem einzigen OpenAI-kompatiblen Client ein: Die meisten Tools (Cline, OpenCode, Open WebUI, LiteLLM) erlauben es, mehrere Anbieter zu definieren und bei Fehlern umzuschalten.
- Nutzen Sie ein starkes Modell (GLM 5.3 oder Kimi K3) für die Planung und ein schnelles (Gemini Flash oder ein auf Groq gehostetes Modell) für Routineaufrufe.
- Für datenschutzsensible Arbeit betreiben Sie ein Modell lokal mit Ollama oder LM Studio.
Wenn Sie nur gelegentlich viel Rechenleistung brauchen, vergleichen Sie diese kostenlosen Tarife in unserer ROI-Tabelle für Abonnements mit bezahlten Plänen — manchmal deckt ein Plan für 10 $ ab, wofür Sie sonst eine Woche lang kostenlose Keys jonglieren müssten.
Auf dem Laufenden bleiben
Der Katalog wird stündlich aktualisiert, und jede Modellfamilie hat eine eigene Seite mit Anbietern, Limits und Benchmarks. Tools, die sich an diese APIs anbinden lassen, finden Sie unter kostenlose KI-Software; einmalige Guthaben und Startup-Programme unter KI-Guthaben.