NVIDIA RTX 5090 の Flash Attention 性能、ハードウェアの進歩にもかかわらず期待を下回る

BigGo コミュニティ部
NVIDIA RTX 5090 の Flash Attention 性能、ハードウェアの進歩にもかかわらず期待を下回る

ゲーミング GPU 市場は興味深い変化を見せており、 NVIDIA の最新 RTX 5090 が機械学習ワークロード、特に Flash Attention の実装において予期しない課題に直面している。このカードは仕様上では印象的な性能を誇るが、実際の性能は開発者や研究者の注目を集める異なる結果を示している。

RTX 5090 における機械学習ワークロードの潜在的なボトルネックを強調するメモリアクセスパターンの分析
RTX 5090 における機械学習ワークロードの潜在的なボトルネックを強調するメモリアクセスパターンの分析

先進的なハードウェアにもかかわらず性能に制限

RTX 5090 の理論上の BF16 性能は209.5 TFLOPsに達するが、これは2,250 TFLOPsを提供する B200 などのサーバーグレード Blackwell カードの10%未満にすぎない。開発者にとってより懸念すべきは、5090の Flash Attention 性能が、より新しい Blackwell テクノロジーで構築されているにもかかわらず、前世代の Hopper アーキテクチャカードよりも悪化しているように見えることだ。

この性能ギャップは、 NVIDIA がゲーミングカードに意図的に制限を設けていることに起因する。 RTX 4090 以降、同社は機械学習トレーニング操作に特化したテンサーコア性能を制限している。FP8およびFP16行列乗算は FP16 で累積する場合のみフルスピードで動作するが、 FP32 累積では半分の速度に低下する。この制限はワークステーションクラスのカードには存在しない。

TFLOPs: 1秒間に1兆回の浮動小数点演算を行う計算性能の指標 テンサーコア: AI と機械学習計算用に設計された専用処理ユニット

パフォーマンス比較: RTX 5090 vs B200

仕様 RTX 5090 B200
BF16 TFLOPs 209.5 2,250
価格(USD) ~$2,000 $30,000-40,000
$1K あたりの TFLOPs 105 56
メモリ帯域幅 ~2TB/s 未指定
NVLink サポート なし あり
FP32 アキュムレーション 半速 フル速度

コストパフォーマンス分析で驚きの結果が判明

1ドルあたりの性能を検証すると、経済性はより複雑になる。 RTX 5090 は1,000米ドルあたり約105 TFLOPsを提供し、一方 B200 は30,000-40,000米ドルの価格帯に基づいて1,000米ドルあたり56 TFLOPsを提供する。しかし、この見かけ上の優位性は実際の展開における課題を考慮すると消失する。

「1ドルあたり2倍の FLOP しか得られないのであれば、 NVLink なしで10倍の数の GPU をラックに収める手間を考えると、おそらく価値がない。」

コンシューマーカードでの NVLink 接続の欠如は、マルチ GPU セットアップにおいて重大なボトルネックを生み出す。さらに、同等の計算能力に必要な1台の B200 と10台の RTX 5090 を比較する際、消費電力が主要な要因となる。

NVLink: GPU 間通信用の NVIDIA 高速インターコネクト技術

GPU アーキテクチャにおけるパフォーマンス停滞の視覚的表現、マルチ GPU セットアップにおける潜在的な効率性の課題を強調
GPU アーキテクチャにおけるパフォーマンス停滞の視覚的表現、マルチ GPU セットアップにおける潜在的な効率性の課題を強調

実装上の課題と回避策

RTX 5090 カードで Flash Attention を実装しようとする開発者は、様々な互換性の問題に遭遇している。新しい Blackwell アーキテクチャは tcgen05 サポートなしの偽 Blackwell 実装を使用しており、テンサーコアを通じた行列乗算のサイズとスループットを制限している。これにより、コードが正常にコンパイルされても予期しない性能ボトルネックが発生する。

低精度演算では状況がやや改善される。 MXFP4 計算は RTX 5090 でフルスループットで実行できるが、トレーニングの安定性を維持するためにより洗練された技術が必要となる。低精度トレーニングへの現在のトレンドは一部の性能制限を軽減するのに役立つかもしれないが、多くのアプリケーションでは FP32 累積が重要であり続ける。

RTX 5090 の主要な技術的制限

  • Tensor Core の制限: FP16/FP8 演算は FP32 アキュムレーションで半分の速度で動作
  • ハードウェア機能の欠如: tcgen05 サポートなしにより行列乗算機能が制限される
  • NVLink なし: 効率的なマルチ GPU 通信を妨げる
  • Flash Attention の問題: 前世代の Hopper アーキテクチャより性能が劣る
  • Blackwell 実装: 完全な機能セットを持たない「偽の」 Blackwell を使用

市場への影響と将来の展望

これらの性能特性は、ゲーミング製品とデータセンター製品を差別化する NVIDIA の戦略がより顕著になっていることを示唆している。ゲーミングカードが機械学習ワークロードにコスト効率的な代替手段を提供していた時代は終わりを迎えているようだ。 RTX 5090 は2TB/s近くの豊富なメモリ帯域幅を提供するが、その計算上の制限により本格的な AI 開発にはあまり魅力的ではない。

この状況は、単純な FLOP カウントを超えた GPU 性能評価の複雑さの増大を浮き彫りにしている。現代の高性能コンピューティングでは、メモリ階層、命令ディスパッチ機能、および製品ライン間で大きく異なる専用ハードウェア機能の考慮が必要である。

Flash Attention や類似のワークロードに取り組む開発者にとって、コンシューマー向けハードウェアとプロフェッショナル向けハードウェアの選択は、単純なコスト per FLOP 計算が示唆するよりもはるかに微妙なトレードオフを伴うようになった。

参考: Writing: Speed-of-Light Flash Attention for SD90 in CUDA C++