2026-07-28 · 2 分で読めます

GPU vs Apple Silicon: RTX 3090/4090/5090 TFLOPS vs M3/M4/M5 Max — LLM推論性能比較

GPU vs Apple Silicon: RTX 3090/4090/5090 vs M3/M4/M5 Max — LLM推論性能比較

ハードウェア仕様とピークTFLOPS

大規模言語モデルをローカルで実行する場合、ハードウェアの選択が性能に大きく影響します。以下の表は、NVIDIA RTX GPUとApple MシリーズMaxチップの主要仕様を比較したものです。

ハードウェアFP16 Tensor TFLOPSメモリ容量メモリ帯域幅
RTX 3090142 TFLOPS24 GB GDDR6X936 GB/s
RTX 4090330 TFLOPS24 GB GDDR6X1,008 GB/s
RTX 5090419–1,676 TFLOPS(スパース性利用時)32 GB GDDR71,792 GB/s
M3 Max22 TFLOPS最大128 GB400 GB/s
M4 Max40–50 TFLOPS(推定)最大128 GB546 GB/s
M5 Max80–100 TFLOPS(推定)最大128 GB600+ GB/s
← 右にスクロールして続きを見る →

異なるコンテキストサイズにおけるプロンプト処理(フィリング)性能

プロンプト処理(プリフィリングとも呼ばれる)は、大きな入力コンテキストをエンコードするフェーズです。このフェーズは計算律速であり、NVIDIA GPUは高いテンソルコアTFLOPSにより優れています。以下の表は、50k、100k、250k、500kトークンのコンテキストを処理するおおよその時間(秒)を示しています。値が小さいほど良いです。推定は13BパラメータのFP16モデルを前提としています。

ハードウェア50kトークン100kトークン250kトークン500kトークン
RTX 30902.5 秒5.0 秒12.5 秒25.0 秒
RTX 40901.2 秒2.4 秒6.0 秒12.0 秒
RTX 50900.6 秒1.2 秒3.0 秒6.0 秒
M3 Max12.0 秒24.0 秒60.0 秒120.0 秒
M4 Max8.0 秒16.0 秒40.0 秒80.0 秒
M5 Max5.0 秒10.0 秒25.0 秒50.0 秒
← 右にスクロールして続きを見る →

復号速度(トークン生成)

プロンプト処理後、モデルはトークンを1つずつ生成します。このプロセスはメモリ帯域幅律速です。VRAMに収まるモデルでは、NVIDIA GPUが大幅に高速です。しかし、モデルがVRAMを超える場合、Appleのユニファイドメモリアーキテクチャはページングによる速度低下なしに一定の速度を維持します。

ハードウェア1秒あたりのトークン数(13Bモデル、VRAM内)1秒あたりのトークン数(70Bモデル、VRAM超過)
RTX 309090 tok/s該当なし(OOMまたはクラッシュ)
RTX 4090150 tok/s該当なし(OOMまたはクラッシュ)
RTX 5090200 tok/s該当なし(OOMまたはクラッシュ)
M3 Max35 tok/s8 tok/s
M4 Max45 tok/s11 tok/s
M5 Max55 tok/s15 tok/s
← 右にスクロールして続きを見る →

ユニファイドメモリの利点:単一M5 Max vs 複数RTX 3090

Appleのユニファイドメモリにより、1台のラップトップで最大128GBのパラメータを持つモデルを保持できます。NVIDIAでこの容量を実現するには複数のGPUが必要です。例えば、5枚のRTX 3090で合計120GBのVRAMを提供できますが、これには大きなトレードオフが伴います。

要素M5 Max (128 GB)5x RTX 3090 (120 GB)
総メモリ128 GB ユニファイド120 GB (5x 24 GB)
最大TFLOPS (FP16)~100 TFLOPS~710 TFLOPS
システム消費電力~50 W~1,750 W (カードあたり350 W)
冷却パッシブ/静音アクティブ、騒音のあるファンが必要
可搬性ポータブルラップトップ大型筐体の据え置きデスクトップ
コスト(概算)約 $6,000約 $7,500 + 電源、冷却、筐体
← 右にスクロールして続きを見る →

消費電力、発熱、可搬性

MacBook Pro M5 Maxは、典型的なLLM推論負荷で30~60Wしか消費せず、発熱は最小限でファンノイズもありません。対照的に、RTX 4090単体で最大450Wを消費し、堅牢な冷却が必要で、顕著なノイズが発生します。マルチGPUオプションはさらに要求が厳しくなります。移動中に大規模モデルを実行する必要があるユーザーにとって、MacBook Proが唯一の実用的な選択肢です。固定構成でトークン毎秒の最大値を優先する場合、NVIDIAは依然として無敵です。

結論

モデルが24~32GBのVRAMに収まり、生の復号速度とプロンプト処理スループットを優先する場合はNVIDIA RTX GPUを選択してください。大規模モデル(70B+パラメータ)をローカルで実行する必要があり、可搬性や静音性が求められる場合、または電力効率を重視する場合は、Apple MシリーズMax(特に128GBのM5 Max)を選択してください。Appleのユニファイドメモリアーキテクチャは、ピーク性能を犠牲にする代わりに、大規模ローカル推論において決定的な優位性を提供します。

一緒に取り組みましょう

さらに詳しい情報やプロジェクトのヘルプ、またはアイデアの構築が必要ですか?

簡単な質問でもフルプロジェクトでも、お気軽にどうぞ。お問い合わせいただき、あなたのアイデアを一緒に実現しましょう。

お問い合わせ

トピックを切り替える

探索する専門トピックを選択してください: