2026-08-16 · 4 Min. Lesezeit

Qwen 3.8 27B: 4-Bit-Quantisierung, vLLM-Tensorparallelität und VRAM/Kontext-Analyse

Qwen 3.8 27B: Bereitstellungsleitfaden mit vLLM und Tensorparallelität

Qwen 3.8 27B ist ein dichtes Transformer-Modell mit 27 Milliarden Parametern, 64 Schichten und einer versteckten Dimension von 5120. Es verwendet Grouped-Query Attention (GQA), um den KV-Cache-Speicher zu reduzieren, was es für lange Kontexte auf Multi-GPU-Setups geeignet macht. In diesem Artikel erklären wir, wie man eine 4-Bit-quantisierte Version des Modells mit vLLM und Tensorparallelität lädt, den VRAM-Bedarf für Gewichte und KV-Cache berechnet und die maximale Kontextlänge auf zwei RTX 3090 und zwei RTX 5090 schätzt.

Laden von Qwen 3.8 27B auf vLLM mit Tensorparallelität

vLLM unterstützt Tensorparallelität (TP), um das Modell auf mehrere GPUs zu verteilen. Mit TP-Größe 2 hält jede GPU die Hälfte der Modellgewichte und berechnet die Hälfte der Operationen pro Schicht, synchronisiert über NCCL. Der folgende Befehl startet einen OpenAI-kompatiblen Server mit einem 4-Bit-quantisierten Modell (z. B. AWQ oder GPTQ) und TP=2:

python -m vllm.entrypoints.openai.api_server --model Qwen/Qwen3.8-27B --tensor-parallel-size 2 --gpu-memory-utilization 0.90 --kv-cache-dtype fp8

Das Flag --gpu-memory-utilization steuert den Anteil des VRAM, der für Gewichte, KV-Cache und CUDA-Kontext verwendet wird. Wählen Sie immer die kleinste TP-Größe, die das Modell aufnimmt, um den Kommunikationsaufwand zu minimieren. Wenn das Modell auf eine einzelne GPU passt, vermeiden Sie TP und führen Sie separate Instanzen für höheren Durchsatz aus.

VRAM-Nutzung: Modellgewichte und KV-Cache

Der VRAM wird von zwei Hauptkomponenten verbraucht: Modellgewichte und KV-Cache. Bei einem 4-Bit-quantisierten Modell belegt jeder Parameter etwa 0,5 Byte (plus einen kleinen Overhead für Skalen und Nullen). Der Gewichts-Fußabdruck wird wie folgt berechnet:

VRAM-Berechnung der Modellgewichte
KomponenteWert
Parameter27 Milliarden
Bytes pro Parameter (4-Bit)0,5
Gewichts-VRAM (roh)13,5 GB
CUDA-Kontext und Puffer1-2 GB
Gesamter Gewichts-Fußabdruck~15 GB
← Nach rechts scrollen für mehr →

Die Größe des KV-Caches hängt von der Kontextlänge, der Präzision und der Modellarchitektur ab. Für Qwen 3.8 27B mit GQA lautet die Formel: 2 * num_layers * num_kv_heads * head_dim * seq_len * bytes_per_element. Mit 64 Schichten, 8 KV-Köpfen und head_dim 128 können wir den KV-Cache für einen 32k-Kontext berechnen.

KV-Cache-Größe für 32k-Kontext (Batch-Größe 1)
PräzisionBytes/ElementKV-Cache-Größe
BF162~6,8 GB
FP81~3,4 GB
← Nach rechts scrollen für mehr →

Maximale Kontextberechnung auf 2x RTX 3090 und 2x RTX 5090

Angenommen, der gesamte VRAM beträgt 48 GB für zwei RTX 3090 (je 24 GB) und 64 GB für zwei RTX 5090 (je 32 GB). Wir subtrahieren den Gewichts-Fußabdruck (~15 GB) und den CUDA-Overhead, um den für den KV-Cache verfügbaren VRAM zu ermitteln. Der maximale Kontext wird geschätzt, indem der verfügbare VRAM durch die KV-Cache-Größe pro Token geteilt wird.

Hardware-Vergleich mit FP8-KV-Cache
HardwareGesamt-VRAMGewichteVerfügbar für KVMax. Kontext (FP8)
2x RTX 309048 GB15 GB33 GB~300k Tokens
2x RTX 509064 GB15 GB49 GB~460k Tokens
← Nach rechts scrollen für mehr →

Für BF16-KV-Cache wäre der maximale Kontext ungefähr die Hälfte der FP8-Werte, d. h. ~150k Tokens auf 2x 3090 und ~230k Tokens auf 2x 5090. Diese Zahlen gehen von Batch-Größe 1 und keinem anderen Speicher-Overhead aus. In der Praxis reserviert vLLM Speicher für CUDA-Graphen und Planung, sodass der tatsächliche Kontext etwas niedriger sein kann.

FP8 vs. BF16 für KV-Cache und FP8-Speichertypen

BF16 bietet höhere Präzision, verbraucht aber doppelt so viel Speicher wie FP8. Für die Inferenz ist FP8 die bevorzugte Wahl, da es die KV-Cache-Kapazität verdoppelt und die Genauigkeitsverluste vernachlässigbar sind. Innerhalb von FP8 gibt es zwei Speicherformate: E4M3 und E5M2. E4M3 bietet eine bessere Balance zwischen Bereich und Präzision und wird für KV-Cache und Gewichte empfohlen. E5M2 hat weniger Präzision und wird typischerweise für Gradienten im Training verwendet. In vLLM können Sie den FP8-KV-Cache mit --kv-cache-dtype fp8 aktivieren.

FP8-Speicherformate
FormatExponentenbitsMantissenbitsVerwendung
E4M343KV-Cache und Gewichte (empfohlen)
E5M252Gradienten im Training (für Inferenz vermeiden)
← Nach rechts scrollen für mehr →

Zusammenfassend lässt sich sagen, dass Qwen 3.8 27B mit 4-Bit-Quantisierung effizient auf Dual-GPU-Systemen bereitgestellt werden kann. Die Verwendung von FP8-KV-Cache maximiert die Kontextlänge und den Durchsatz. Auf 2x RTX 3090 können Sie ~300k Tokens Kontext verarbeiten, während 2x RTX 5090 ~460k Tokens bietet, was beide Konfigurationen hervorragend für die Verarbeitung langer Dokumente und Hochkonkurrenz-Serving macht.

Lassen Sie uns zusammenarbeiten

Benötigen Sie weitere Informationen, Hilfe bei Ihrem Projekt oder zur Entwicklung einer Idee?

Ob einfache Frage, kurzer Zweifel oder ein 5-Minuten-Chat, schreib mir einfach—es kostet nichts und ich helfe immer gerne. Ich liebe es, Probleme zu verstehen, kreative Lösungen zu finden und mich auf einfache, zuverlässige und unkomplizierte Ideen zu konzentrieren, die sich schnell umsetzen lassen.

Kontaktiere mich

Thema wechseln

Wählen Sie ein spezielles Thema zum Erkunden: