Disaggregated Inference のボトルネック
Disaggregated Inference のボトルネック Disaggregated LLM inference—prefill と decode の操作が別々の GPU プール上で実行されるアーキテクチャパターン—は、ある制約を別の制約と交換します。アーキテクチャ上の利点は明確です。prefill GPU はスループットとバッチサイズに最適化され、decode GPU はレイテンシを優先します。この分離は、標準的なデータセンターインフラストラクチャが対応す...