GPU vs Apple Silicon:RTX 3090/4090/5090 TFLOPS 对比 M3/M4/M5 Max — LLM 推理性能比较
GPU vs Apple Silicon:RTX 3090/4090/5090 对比 M3/M4/M5 Max — LLM 推理性能比较
硬件规格与峰值 TFLOPS
在本地运行大型语言模型时,硬件的选择会显著影响性能。下表比较了 NVIDIA RTX GPU 和 Apple M 系列 Max 芯片的关键规格。
| 硬件 | FP16 Tensor TFLOPS | 内存容量 | 内存带宽 |
|---|---|---|---|
| RTX 3090 | 142 TFLOPS | 24 GB GDDR6X | 936 GB/s |
| RTX 4090 | 330 TFLOPS | 24 GB GDDR6X | 1,008 GB/s |
| RTX 5090 | 419–1,676 TFLOPS(利用稀疏性) | 32 GB GDDR7 | 1,792 GB/s |
| M3 Max | 22 TFLOPS | 最高 128 GB | 400 GB/s |
| M4 Max | 40–50 TFLOPS(估计) | 最高 128 GB | 546 GB/s |
| M5 Max | 80–100 TFLOPS(估计) | 最高 128 GB | 600+ GB/s |
不同上下文大小下的提示处理(填充)性能
提示处理(也称为预填充)涉及编码大型输入上下文。此阶段受计算限制,NVIDIA GPU 凭借其高张量核心 TFLOPS 表现出色。下表显示了处理 50k、100k、250k 和 500k 令牌上下文的大致时间(秒)。数值越低越好。估计基于 13B 参数模型,使用 FP16。
| 硬件 | 50k 令牌 | 100k 令牌 | 250k 令牌 | 500k 令牌 |
|---|---|---|---|---|
| RTX 3090 | 2.5 秒 | 5.0 秒 | 12.5 秒 | 25.0 秒 |
| RTX 4090 | 1.2 秒 | 2.4 秒 | 6.0 秒 | 12.0 秒 |
| RTX 5090 | 0.6 秒 | 1.2 秒 | 3.0 秒 | 6.0 秒 |
| M3 Max | 12.0 秒 | 24.0 秒 | 60.0 秒 | 120.0 秒 |
| M4 Max | 8.0 秒 | 16.0 秒 | 40.0 秒 | 80.0 秒 |
| M5 Max | 5.0 秒 | 10.0 秒 | 25.0 秒 | 50.0 秒 |
解码速度(令牌生成)
提示处理后,模型逐个生成令牌。此过程受内存带宽限制。对于适合 VRAM 的模型,NVIDIA GPU 速度明显更快。然而,当模型超出 VRAM 时,Apple 的统一内存架构能够保持稳定速度,不会因分页而减慢。
| 硬件 | 每秒令牌数(13B 模型,在 VRAM 内) | 每秒令牌数(70B 模型,超出 VRAM) |
|---|---|---|
| RTX 3090 | 90 tok/s | 不适用(OOM 或崩溃) |
| RTX 4090 | 150 tok/s | 不适用(OOM 或崩溃) |
| RTX 5090 | 200 tok/s | 不适用(OOM 或崩溃) |
| M3 Max | 35 tok/s | 8 tok/s |
| M4 Max | 45 tok/s | 11 tok/s |
| M5 Max | 55 tok/s | 15 tok/s |
统一内存的优势:单个 M5 Max 对比多个 RTX 3090
Apple 的统一内存允许一台笔记本电脑容纳高达 128 GB 参数量的模型。要使用 NVIDIA 实现相同的容量,需要多块 GPU。例如,五块 RTX 3090 可提供总计 120 GB 的 VRAM,但这会带来重大的权衡。
| 因素 | M5 Max (128 GB) | 5x RTX 3090 (120 GB) |
|---|---|---|
| 总内存 | 128 GB 统一内存 | 120 GB (5x 24 GB) |
| 最大 TFLOPS (FP16) | ~100 TFLOPS | ~710 TFLOPS |
| 系统功耗 | ~50 W | ~1,750 W (每卡 350 W) |
| 散热 | 被动/静音 | 主动散热,需要噪音风扇 |
| 便携性 | 便携式笔记本电脑 | 固定台式机,大机箱 |
| 成本(约) | 约 $6,000 | 约 $7,500 + 电源、散热、机箱 |
功耗、热量与便携性
MacBook Pro M5 Max 在典型 LLM 推理负载下仅消耗 30–60 W,产生极少热量且无风扇噪音。相比之下,单块 RTX 4090 功耗高达 450 W,需要强力散热,产生明显噪音。多 GPU 选项要求更高。对于需要在移动中运行大型模型的用户,MacBook Pro 是唯一可行的选择。对于固定配置,以最大化每秒令牌数为目标,NVIDIA 仍然无可匹敌。
结论
如果您的模型适合 24–32 GB 的 VRAM,并且您优先考虑原始解码速度和提示处理吞吐量,请选择 NVIDIA RTX GPU。如果您需要在本地运行大型模型(70B+ 参数)、需要便携性和静音性,或者重视能效,请选择 Apple M 系列 Max(尤其是 128 GB 的 M5 Max)。Apple 的统一内存架构在牺牲峰值性能的前提下,为大规模本地推理提供了决定性的优势。
