vLLM konfigurieren

Voraussetzungen
Sie benötigen einen laufenden vLLM-Server, seine erreichbare Basisadresse, den dort geladenen Modellnamen und bei aktivierter Authentifizierung dessen API-Schlüssel. Ein Administrationsbeispiel für einen Modellserver:Angaben in Novaplan AI
Eine Administration kann die angebotenen IDs am
/v1/models-Endpoint des vLLM-Servers abfragen. Multimodal aktivieren Sie nur bei einem Modell mit Bildeingabe, Reasoning nur bei einem entsprechenden Reasoning-Modell. Das oben als Serverbeispiel verwendete Qwen/Qwen3-8B ist ein Textmodell; aktivieren Sie für dieses Beispiel Multimodal nicht allein aufgrund des Modellnamens. Prüfen Sie die Modellkarte und die Liste der von vLLM unterstützten Modelle.
Modell hinzufügen
- Wählen Sie OpenAI API Compatible als Provider Type.
- Geben Sie Endpoint URL, API Key und Model Name ein.
- Aktivieren Sie Multimodal und Reasoning nur passend zum Modell.
- Klicken Sie auf Add Model.
Leistung und Fehlerbehebung
Die Leistung hängt vom gewählten Modell, der verfügbaren GPU-Hardware und den Einstellungen des vLLM-Servers ab. vLLM verarbeitet Anfragen unter anderem mit kontinuierlichem Batching. Bei größeren Modellen kann die Modellserver-Administration Tensor-Parallelität über mehrere GPUs prüfen. Quantisierte Modellvarianten können Speicher sparen; das unterstützte Format hängt vom Modell und der installierten vLLM-Version ab. Ein zu großes Kontextlimit (--max-model-len) kann Speicherfehler auslösen. Ändern Sie diese Servereinstellungen nur nach einem Test mit Ihrer Modellserver-Administration.
Die Befehle und Optionen finden Sie in der aktuellen vLLM-CLI-Referenz. Novaplan Support hilft bei der Verbindung zum verwalteten Workspace; den Betrieb des Modellservers stimmen Sie mit dessen Administration ab.