vLLM
Moteur d'inférence et de service de LLM à haut débit, avec un serveur compatible OpenAI pour NVIDIA, AMD, Intel, TPU et CPU.
- Licence
- Apache-2.0
- Plateformes
- Linux, Docker, CLI
- Vos propres clés API
- Oui
- Vérifié
- 2026-09-24
vLLM fonctionne avec les API compatibles OpenAI. Récupérez une clé gratuite et un modèle dans le catalogue : pour le code · pour les agents · fournisseurs et base URL
Alternatives à vLLM
Runtime populaire pour télécharger et exécuter des LLM ouverts en local via CLI, application desktop et API REST compatible OpenAI.
Application desktop pour découvrir, télécharger et exécuter des LLM locaux (llama.cpp, MLX), avec une interface de chat et un serveur local compatible OpenAI.
Alternative hors ligne à ChatGPT : exécute des LLM locaux, se connecte aux API cloud, prend en charge MCP et expose une API compatible OpenAI sur localhost.
Moteur C/C++ de référence pour les modèles GGUF ; llama-server fournit une API compatible OpenAI et une interface web sur CPU, CUDA, Metal, Vulkan et ROCm.
Remplacement auto-hébergé et transparent des API OpenAI/Anthropic pour LLM, images, audio, vidéo et embeddings sur CPU ou GPU.
Exécuteur en un seul fichier basé sur llama.cpp, avec l'interface KoboldAI Lite ; API compatibles OpenAI/Ollama, génération d'images, Whisper et TTS.
FAQ
vLLM est-il gratuit ?
Entièrement gratuit et open source, mais nécessite votre propre matériel, généralement un GPU serveur.
vLLM fonctionne-t-il avec des modèles gratuits ?
Oui. Il prend en charge vos propres clés et les API compatibles OpenAI : vous pouvez donc brancher des modèles gratuits d'OpenRouter, Groq, NVIDIA Build ou un Ollama local.
Quelle est la licence de vLLM ?
Apache-2.0. Le code source est ouvert.