2026-07-28 · 4 Min. Lesezeit

GPU vs Apple Silicon: RTX 3090/4090/5090 TFLOPS vs M3/M4/M5 Max — LLM-Inferenzleistungsvergleich

GPU vs Apple Silicon: RTX 3090/4090/5090 vs M3/M4/M5 Max — LLM-Inferenzleistungsvergleich

Hardware-Spezifikationen und Spitzen-TFLOPS

Bei der lokalen Ausführung großer Sprachmodelle hat die Wahl der Hardware erheblichen Einfluss auf die Leistung. Die folgende Tabelle vergleicht die wichtigsten Spezifikationen von NVIDIA RTX GPUs und Apple M-Serie Max Chips.

HardwareFP16 Tensor TFLOPSSpeicherkapazitätSpeicherbandbreite
RTX 3090142 TFLOPS24 GB GDDR6X936 GB/s
RTX 4090330 TFLOPS24 GB GDDR6X1.008 GB/s
RTX 5090419–1.676 TFLOPS (mit Sparsity)32 GB GDDR71.792 GB/s
M3 Max22 TFLOPSBis zu 128 GB400 GB/s
M4 Max40–50 TFLOPS (geschätzt)Bis zu 128 GB546 GB/s
M5 Max80–100 TFLOPS (geschätzt)Bis zu 128 GB600+ GB/s
← Nach rechts scrollen für mehr →

Promptverarbeitungsleistung (Filling) bei verschiedenen Kontextgrößen

Die Promptverarbeitung, auch als Prefilling bekannt, umfasst die Kodierung eines großen Eingabekontexts. Diese Phase ist rechengebunden. NVIDIA GPUs zeichnen sich durch ihre hohen Tensor-Core-TFLOPS aus. Die folgende Tabelle zeigt die ungefähre Zeit in Sekunden zur Verarbeitung von Kontexten mit 50k, 100k, 250k und 500k Tokens. Niedriger ist besser. Die Schätzungen basieren auf einem 13B-Parameter-Modell mit FP16.

Hardware50k Tokens100k Tokens250k Tokens500k Tokens
RTX 30902,5 s5,0 s12,5 s25,0 s
RTX 40901,2 s2,4 s6,0 s12,0 s
RTX 50900,6 s1,2 s3,0 s6,0 s
M3 Max12,0 s24,0 s60,0 s120,0 s
M4 Max8,0 s16,0 s40,0 s80,0 s
M5 Max5,0 s10,0 s25,0 s50,0 s
← Nach rechts scrollen für mehr →

Decodierungsgeschwindigkeit (Token-Generierung)

Nach der Promptverarbeitung generiert das Modell Tokens einzeln. Dieser Prozess ist speicherbandbreitenbegrenzt. Für Modelle, die in den VRAM passen, sind NVIDIA GPUs deutlich schneller. Wenn ein Modell jedoch den VRAM überschreitet, behält die einheitliche Speicherarchitektur von Apple eine konstante Geschwindigkeit ohne Verlangsamung durch Paging bei.

HardwareTokens pro Sekunde (13B-Modell, im VRAM)Tokens pro Sekunde (70B-Modell, überschreitet VRAM)
RTX 309090 tok/sN/A (OOM oder Absturz)
RTX 4090150 tok/sN/A (OOM oder Absturz)
RTX 5090200 tok/sN/A (OOM oder Absturz)
M3 Max35 tok/s8 tok/s
M4 Max45 tok/s11 tok/s
M5 Max55 tok/s15 tok/s
← Nach rechts scrollen für mehr →

Vorteil des einheitlichen Speichers: Einzelner M5 Max vs. mehrere RTX 3090

Der einheitliche Speicher von Apple ermöglicht es einem einzelnen Laptop, Modelle mit bis zu 128 GB Parametern zu halten. Um diese Kapazität mit NVIDIA zu erreichen, sind mehrere GPUs erforderlich. Beispielsweise bieten fünf RTX 3090 insgesamt 120 GB VRAM, aber dies bringt erhebliche Nachteile mit sich.

FaktorM5 Max (128 GB)5x RTX 3090 (120 GB)
Gesamtspeicher128 GB einheitlich120 GB (5x 24 GB)
Maximale TFLOPS (FP16)~100 TFLOPS~710 TFLOPS
Systemleistungsaufnahme~50 W~1.750 W (350 W pro Karte)
KühlungPassiv / leiseAktiv, laute Lüfter erforderlich
PortabilitätTragbarer LaptopStationärer Desktop mit großem Gehäuse
Kosten (ca.)$6.000$7.500 + Netzteil, Kühlung, Gehäuse
← Nach rechts scrollen für mehr →

Leistungsaufnahme, Wärme und Portabilität

Das MacBook Pro M5 Max verbraucht unter typischer LLM-Inferenzlast nur 30–60 W, erzeugt minimale Wärme und keinen Lüfterlärm. Im Gegensatz dazu verbraucht eine einzelne RTX 4090 bis zu 450 W, was eine robuste Kühlung erfordert, die hörbare Geräusche verursacht. Die Multi-GPU-Option ist noch anspruchsvoller. Für Benutzer, die große Modelle unterwegs ausführen müssen, ist das MacBook Pro die einzig praktikable Wahl. Für stationäre Setups, bei denen die maximale Anzahl von Tokens pro Sekunde Priorität hat, bleibt NVIDIA ungeschlagen.

Fazit

Wählen Sie NVIDIA RTX GPUs, wenn Ihre Modelle in 24–32 GB VRAM passen und Sie rohe Decodierungsgeschwindigkeit und Promptverarbeitungsdurchsatz priorisieren. Wählen Sie Apple M-Serie Max (insbesondere M5 Max mit 128 GB), wenn Sie große Modelle (70B+ Parameter) lokal ausführen müssen, Portabilität und Ruhe benötigen oder Energieeffizienz schätzen. Die einheitliche Speicherarchitektur von Apple bietet einen entscheidenden Vorteil für die lokale Inferenz im großen Maßstab, jedoch auf Kosten einer geringeren Spitzenleistung.

Lassen Sie uns zusammenarbeiten

Benötigen Sie weitere Informationen, Hilfe bei Ihrem Projekt oder zur Entwicklung einer Idee?

Ob einfache Frage, kurzer Zweifel oder ein 5-Minuten-Chat, schreib mir einfach—es kostet nichts und ich helfe immer gerne. Ich liebe es, Probleme zu verstehen, kreative Lösungen zu finden und mich auf einfache, zuverlässige und unkomplizierte Ideen zu konzentrieren, die sich schnell umsetzen lassen.

Kontaktiere mich

Thema wechseln

Wählen Sie ein spezielles Thema zum Erkunden: