2026-07-28 · 2 分钟阅读

GPU vs Apple Silicon:RTX 3090/4090/5090 TFLOPS 对比 M3/M4/M5 Max — LLM 推理性能比较

GPU vs Apple Silicon:RTX 3090/4090/5090 对比 M3/M4/M5 Max — LLM 推理性能比较

硬件规格与峰值 TFLOPS

在本地运行大型语言模型时,硬件的选择会显著影响性能。下表比较了 NVIDIA RTX GPU 和 Apple M 系列 Max 芯片的关键规格。

硬件FP16 Tensor TFLOPS内存容量内存带宽
RTX 3090142 TFLOPS24 GB GDDR6X936 GB/s
RTX 4090330 TFLOPS24 GB GDDR6X1,008 GB/s
RTX 5090419–1,676 TFLOPS(利用稀疏性)32 GB GDDR71,792 GB/s
M3 Max22 TFLOPS最高 128 GB400 GB/s
M4 Max40–50 TFLOPS(估计)最高 128 GB546 GB/s
M5 Max80–100 TFLOPS(估计)最高 128 GB600+ GB/s
← 向右滚动查看更多 →

不同上下文大小下的提示处理(填充)性能

提示处理(也称为预填充)涉及编码大型输入上下文。此阶段受计算限制,NVIDIA GPU 凭借其高张量核心 TFLOPS 表现出色。下表显示了处理 50k、100k、250k 和 500k 令牌上下文的大致时间(秒)。数值越低越好。估计基于 13B 参数模型,使用 FP16。

硬件50k 令牌100k 令牌250k 令牌500k 令牌
RTX 30902.5 秒5.0 秒12.5 秒25.0 秒
RTX 40901.2 秒2.4 秒6.0 秒12.0 秒
RTX 50900.6 秒1.2 秒3.0 秒6.0 秒
M3 Max12.0 秒24.0 秒60.0 秒120.0 秒
M4 Max8.0 秒16.0 秒40.0 秒80.0 秒
M5 Max5.0 秒10.0 秒25.0 秒50.0 秒
← 向右滚动查看更多 →

解码速度(令牌生成)

提示处理后,模型逐个生成令牌。此过程受内存带宽限制。对于适合 VRAM 的模型,NVIDIA GPU 速度明显更快。然而,当模型超出 VRAM 时,Apple 的统一内存架构能够保持稳定速度,不会因分页而减慢。

硬件每秒令牌数(13B 模型,在 VRAM 内)每秒令牌数(70B 模型,超出 VRAM)
RTX 309090 tok/s不适用(OOM 或崩溃)
RTX 4090150 tok/s不适用(OOM 或崩溃)
RTX 5090200 tok/s不适用(OOM 或崩溃)
M3 Max35 tok/s8 tok/s
M4 Max45 tok/s11 tok/s
M5 Max55 tok/s15 tok/s
← 向右滚动查看更多 →

统一内存的优势:单个 M5 Max 对比多个 RTX 3090

Apple 的统一内存允许一台笔记本电脑容纳高达 128 GB 参数量的模型。要使用 NVIDIA 实现相同的容量,需要多块 GPU。例如,五块 RTX 3090 可提供总计 120 GB 的 VRAM,但这会带来重大的权衡。

因素M5 Max (128 GB)5x RTX 3090 (120 GB)
总内存128 GB 统一内存120 GB (5x 24 GB)
最大 TFLOPS (FP16)~100 TFLOPS~710 TFLOPS
系统功耗~50 W~1,750 W (每卡 350 W)
散热被动/静音主动散热,需要噪音风扇
便携性便携式笔记本电脑固定台式机,大机箱
成本(约)约 $6,000约 $7,500 + 电源、散热、机箱
← 向右滚动查看更多 →

功耗、热量与便携性

MacBook Pro M5 Max 在典型 LLM 推理负载下仅消耗 30–60 W,产生极少热量且无风扇噪音。相比之下,单块 RTX 4090 功耗高达 450 W,需要强力散热,产生明显噪音。多 GPU 选项要求更高。对于需要在移动中运行大型模型的用户,MacBook Pro 是唯一可行的选择。对于固定配置,以最大化每秒令牌数为目标,NVIDIA 仍然无可匹敌。

结论

如果您的模型适合 24–32 GB 的 VRAM,并且您优先考虑原始解码速度和提示处理吞吐量,请选择 NVIDIA RTX GPU。如果您需要在本地运行大型模型(70B+ 参数)、需要便携性和静音性,或者重视能效,请选择 Apple M 系列 Max(尤其是 128 GB 的 M5 Max)。Apple 的统一内存架构在牺牲峰值性能的前提下,为大规模本地推理提供了决定性的优势。

让我们合作吧

您需要更多信息、项目帮助或开发构想吗?

无论是简单的问题还是完整的项目,我都在这里。联系我,让我们将您的想法变为现实。

联系我

切换主题

选择一个专业主题进行探索: