llama.cpp
Referenz-Engine in C/C++ für GGUF-Modelle; llama-server stellt eine OpenAI-kompatible API und Web-UI auf CPU, CUDA, Metal, Vulkan und ROCm bereit.
- Lizenz
- MIT
- Plattformen
- Windows, macOS, Linux, Docker, CLI
- Eigene API-Schlüssel
- Ja
- Geprüft
- 2026-09-24
llama.cpp funktioniert mit OpenAI-kompatiblen APIs. Holen Sie sich einen kostenlosen Schlüssel und ein Modell aus dem Katalog: für Coding · für Agenten · Anbieter und base URLs
Alternativen zu llama.cpp
Beliebte Laufzeitumgebung, um offene LLMs lokal herunterzuladen und auszuführen, über CLI, Desktop-App und eine REST-/OpenAI-kompatible API.
Desktop-App zum Entdecken, Herunterladen und Ausführen lokaler LLMs (llama.cpp, MLX) mit Chat-UI und OpenAI-kompatiblem lokalem Server.
Offline-Alternative zu ChatGPT: führt lokale LLMs aus, verbindet sich mit Cloud-APIs, unterstützt MCP und stellt eine OpenAI-kompatible API auf localhost bereit.
LLM-Inferenz- und Serving-Engine mit hohem Durchsatz und OpenAI-kompatiblem Server für NVIDIA, AMD, Intel, TPU und CPU.
Selbst gehosteter Drop-in-Ersatz für die OpenAI-/Anthropic-API für LLMs, Bilder, Audio, Video und Embeddings auf CPU oder GPU.
Runner als Einzeldatei auf Basis von llama.cpp mit KoboldAI-Lite-UI; OpenAI-/Ollama-kompatible APIs plus Bildgenerierung, Whisper und TTS.
FAQ
Ist llama.cpp kostenlos?
Komplett kostenlos und Open Source, ohne Konten, API-Schlüssel oder Nutzungslimits.
Funktioniert llama.cpp mit kostenlosen Modellen?
Ja. Es unterstützt eigene Schlüssel und OpenAI-kompatible APIs, sodass Sie kostenlose Modelle von OpenRouter, Groq, NVIDIA Build oder ein lokales Ollama anbinden können.
Welche Lizenz nutzt llama.cpp?
MIT. Der Quellcode ist offen.