Skip to main content

vLLM konfigurieren

Konfigurationsansicht für OpenAI-kompatible APIs vLLM kann Sprachmodelle über eine OpenAI-kompatible API bereitstellen. Novaplan AI verbindet sich mit einem vorhandenen, aus seiner Umgebung erreichbaren vLLM-Server. Ihre Modellserver-Administration betreibt diesen Dienst; Novaplan unterstützt Sie bei der Anbindung.

Voraussetzungen

Sie benötigen einen laufenden vLLM-Server, seine erreichbare Basisadresse, den dort geladenen Modellnamen und bei aktivierter Authentifizierung dessen API-Schlüssel. Ein Administrationsbeispiel für einen Modellserver:
Die genaue Installation und die Modellkompatibilität hängen von Ihrer vLLM-Version und Ihrer Hardware ab. Prüfen Sie die vLLM-Dokumentation und stimmen Sie Betrieb, GPU-Ressourcen und Netzfreigaben mit der zuständigen Administration ab.

Angaben in Novaplan AI

Eine Administration kann die angebotenen IDs am /v1/models-Endpoint des vLLM-Servers abfragen. Multimodal aktivieren Sie nur bei einem Modell mit Bildeingabe, Reasoning nur bei einem entsprechenden Reasoning-Modell. Das oben als Serverbeispiel verwendete Qwen/Qwen3-8B ist ein Textmodell; aktivieren Sie für dieses Beispiel Multimodal nicht allein aufgrund des Modellnamens. Prüfen Sie die Modellkarte und die Liste der von vLLM unterstützten Modelle.
Schützen Sie den Modellserver zusätzlich über den freigegebenen Netzwerkzugang. Laut vLLM-CLI-Referenz schützt --api-key nur bestimmte API-Pfade und nicht alle Endpunkte desselben Servers, beispielsweise nicht /invocations. Stimmen Sie zusätzliche Zugriffskontrollen mit Ihrer Modellserver-Administration und Novaplan ab.

Modell hinzufügen

  1. Wählen Sie OpenAI API Compatible als Provider Type.
  2. Geben Sie Endpoint URL, API Key und Model Name ein.
  3. Aktivieren Sie Multimodal und Reasoning nur passend zum Modell.
  4. Klicken Sie auf Add Model.

Leistung und Fehlerbehebung

Die Leistung hängt vom gewählten Modell, der verfügbaren GPU-Hardware und den Einstellungen des vLLM-Servers ab. vLLM verarbeitet Anfragen unter anderem mit kontinuierlichem Batching. Bei größeren Modellen kann die Modellserver-Administration Tensor-Parallelität über mehrere GPUs prüfen. Quantisierte Modellvarianten können Speicher sparen; das unterstützte Format hängt vom Modell und der installierten vLLM-Version ab. Ein zu großes Kontextlimit (--max-model-len) kann Speicherfehler auslösen. Ändern Sie diese Servereinstellungen nur nach einem Test mit Ihrer Modellserver-Administration. Die Befehle und Optionen finden Sie in der aktuellen vLLM-CLI-Referenz. Novaplan Support hilft bei der Verbindung zum verwalteten Workspace; den Betrieb des Modellservers stimmen Sie mit dessen Administration ab.