大規模言語モデルを複数のGPUで実行する際、単にカードを追加するだけでは不十分で、適切な並列化戦略を選ぶことが重要です。この分析では、モデルのレイヤーをGPU全体に分散しカード数にほぼ影響されないレイヤー分割と、個々のテンソルを分割し相互接続帯域幅に非常に敏感なテンソル並列という2つの主要なアプローチを解説します。3〜4枚のGPUを持つチームにとって、決定はハードウェアトポロジに依存します。高速NVLinkがあればテンソル並列で低レイテンシを実現できますが、PCIeの場合はレイヤー分割が通信ボトルネックを回避できます。また、vLLM、llama.cpp、TensorSharpの実装を比較し、ソフトウェアの成熟度とカーネル最適化がGPUの数よりも重要であることを示しています。大規模クラスタを持たない小規模推論インフラを構築する人にとって必読の内容です。
マルチGPU LLM推論におけるレイヤー分割とテンソル並列の選択ガイド。相互接続の感度とカード数のトレードオフに焦点を当てています。