GPU vs Apple Silicon: RTX 3090/4090/5090 TFLOPS vs M3/M4/M5 Max — LLM-Inferenzleistungsvergleich
GPU vs Apple Silicon: RTX 3090/4090/5090 vs M3/M4/M5 Max — LLM-Inferenzleistungsvergleich
Hardware-Spezifikationen und Spitzen-TFLOPS
Bei der lokalen Ausführung großer Sprachmodelle hat die Wahl der Hardware erheblichen Einfluss auf die Leistung. Die folgende Tabelle vergleicht die wichtigsten Spezifikationen von NVIDIA RTX GPUs und Apple M-Serie Max Chips.
| Hardware | FP16 Tensor TFLOPS | Speicherkapazität | Speicherbandbreite |
|---|---|---|---|
| RTX 3090 | 142 TFLOPS | 24 GB GDDR6X | 936 GB/s |
| RTX 4090 | 330 TFLOPS | 24 GB GDDR6X | 1.008 GB/s |
| RTX 5090 | 419–1.676 TFLOPS (mit Sparsity) | 32 GB GDDR7 | 1.792 GB/s |
| M3 Max | 22 TFLOPS | Bis zu 128 GB | 400 GB/s |
| M4 Max | 40–50 TFLOPS (geschätzt) | Bis zu 128 GB | 546 GB/s |
| M5 Max | 80–100 TFLOPS (geschätzt) | Bis zu 128 GB | 600+ GB/s |
Promptverarbeitungsleistung (Filling) bei verschiedenen Kontextgrößen
Die Promptverarbeitung, auch als Prefilling bekannt, umfasst die Kodierung eines großen Eingabekontexts. Diese Phase ist rechengebunden. NVIDIA GPUs zeichnen sich durch ihre hohen Tensor-Core-TFLOPS aus. Die folgende Tabelle zeigt die ungefähre Zeit in Sekunden zur Verarbeitung von Kontexten mit 50k, 100k, 250k und 500k Tokens. Niedriger ist besser. Die Schätzungen basieren auf einem 13B-Parameter-Modell mit FP16.
| Hardware | 50k Tokens | 100k Tokens | 250k Tokens | 500k Tokens |
|---|---|---|---|---|
| RTX 3090 | 2,5 s | 5,0 s | 12,5 s | 25,0 s |
| RTX 4090 | 1,2 s | 2,4 s | 6,0 s | 12,0 s |
| RTX 5090 | 0,6 s | 1,2 s | 3,0 s | 6,0 s |
| M3 Max | 12,0 s | 24,0 s | 60,0 s | 120,0 s |
| M4 Max | 8,0 s | 16,0 s | 40,0 s | 80,0 s |
| M5 Max | 5,0 s | 10,0 s | 25,0 s | 50,0 s |
Decodierungsgeschwindigkeit (Token-Generierung)
Nach der Promptverarbeitung generiert das Modell Tokens einzeln. Dieser Prozess ist speicherbandbreitenbegrenzt. Für Modelle, die in den VRAM passen, sind NVIDIA GPUs deutlich schneller. Wenn ein Modell jedoch den VRAM überschreitet, behält die einheitliche Speicherarchitektur von Apple eine konstante Geschwindigkeit ohne Verlangsamung durch Paging bei.
| Hardware | Tokens pro Sekunde (13B-Modell, im VRAM) | Tokens pro Sekunde (70B-Modell, überschreitet VRAM) |
|---|---|---|
| RTX 3090 | 90 tok/s | N/A (OOM oder Absturz) |
| RTX 4090 | 150 tok/s | N/A (OOM oder Absturz) |
| RTX 5090 | 200 tok/s | N/A (OOM oder Absturz) |
| M3 Max | 35 tok/s | 8 tok/s |
| M4 Max | 45 tok/s | 11 tok/s |
| M5 Max | 55 tok/s | 15 tok/s |
Vorteil des einheitlichen Speichers: Einzelner M5 Max vs. mehrere RTX 3090
Der einheitliche Speicher von Apple ermöglicht es einem einzelnen Laptop, Modelle mit bis zu 128 GB Parametern zu halten. Um diese Kapazität mit NVIDIA zu erreichen, sind mehrere GPUs erforderlich. Beispielsweise bieten fünf RTX 3090 insgesamt 120 GB VRAM, aber dies bringt erhebliche Nachteile mit sich.
| Faktor | M5 Max (128 GB) | 5x RTX 3090 (120 GB) |
|---|---|---|
| Gesamtspeicher | 128 GB einheitlich | 120 GB (5x 24 GB) |
| Maximale TFLOPS (FP16) | ~100 TFLOPS | ~710 TFLOPS |
| Systemleistungsaufnahme | ~50 W | ~1.750 W (350 W pro Karte) |
| Kühlung | Passiv / leise | Aktiv, laute Lüfter erforderlich |
| Portabilität | Tragbarer Laptop | Stationärer Desktop mit großem Gehäuse |
| Kosten (ca.) | $6.000 | $7.500 + Netzteil, Kühlung, Gehäuse |
Leistungsaufnahme, Wärme und Portabilität
Das MacBook Pro M5 Max verbraucht unter typischer LLM-Inferenzlast nur 30–60 W, erzeugt minimale Wärme und keinen Lüfterlärm. Im Gegensatz dazu verbraucht eine einzelne RTX 4090 bis zu 450 W, was eine robuste Kühlung erfordert, die hörbare Geräusche verursacht. Die Multi-GPU-Option ist noch anspruchsvoller. Für Benutzer, die große Modelle unterwegs ausführen müssen, ist das MacBook Pro die einzig praktikable Wahl. Für stationäre Setups, bei denen die maximale Anzahl von Tokens pro Sekunde Priorität hat, bleibt NVIDIA ungeschlagen.
Fazit
Wählen Sie NVIDIA RTX GPUs, wenn Ihre Modelle in 24–32 GB VRAM passen und Sie rohe Decodierungsgeschwindigkeit und Promptverarbeitungsdurchsatz priorisieren. Wählen Sie Apple M-Serie Max (insbesondere M5 Max mit 128 GB), wenn Sie große Modelle (70B+ Parameter) lokal ausführen müssen, Portabilität und Ruhe benötigen oder Energieeffizienz schätzen. Die einheitliche Speicherarchitektur von Apple bietet einen entscheidenden Vorteil für die lokale Inferenz im großen Maßstab, jedoch auf Kosten einer geringeren Spitzenleistung.
Lassen Sie uns zusammenarbeiten
Benötigen Sie weitere Informationen, Hilfe bei Ihrem Projekt oder zur Entwicklung einer Idee?
Ob einfache Frage, kurzer Zweifel oder ein 5-Minuten-Chat, schreib mir einfach—es kostet nichts und ich helfe immer gerne. Ich liebe es, Probleme zu verstehen, kreative Lösungen zu finden und mich auf einfache, zuverlässige und unkomplizierte Ideen zu konzentrieren, die sich schnell umsetzen lassen.
Kontaktiere mich →