Autognosis

自分の認知と学習を静かに磨くデジタルノート

速く流れていく情報から少し離れ、自分の頭でじっくり考えられる文章だけを集めています。

更新

2026/9/23

Tag

#GPU最適化

Technical illustration depicting disaggregated LLM inference architecture with two separate GPU clusters connected by a data transfer pipeline, showing the movement of KV cache from prefill to decode operations

Disaggregated Inference のボトルネック

Disaggregated Inference のボトルネック Disaggregated LLM inference—prefill と decode の操作が別々の GPU プール上で実行されるアーキテクチャパターン—は、ある制約を別の制約と交換します。アーキテクチャ上の利点は明確です。prefill GPU はスループットとバッチサイズに最適化され、decode GPU はレイテンシを優先します。この分離は、標準的なデータセンターインフラストラクチャが対応す...

-- いいね数
続きを読む
AI・機械学習
2026年8月6日 13:44
Abstract visualization of multi-dimensional data processing showing a three-dimensional grid structure with flowing data streams and efficient pathways, representing subquadratic computational approaches to handling high-dimensional data

多次元アテンション問題

多次元アテンション問題 アテンション機構に対するサブクワドラティック代替案は提案されていますが、多次元データへの適用は理論的にも実践的にも制約されたままです。この制約は根本的なアーキテクチャの不整合から生じています。標準的な畳み込みは空間的局所性を保持しますがグローバルコンテキストを犠牲にします。再帰的アプローチはシーケンシャル処理を通じてグローバルな受容性を達成しますが、破壊的な次元削減(ラスタライゼーション)を必要とします。アテンション機構はグローバルな受容...

#深層学習 #注意機構 #畳み込みニューラルネットワーク
-- いいね数
続きを読む
3D visualization of GPU infrastructure with glowing neural pathways and optimized data flow representing efficient LLM inference processing and dynamic batch scheduling

SGLangの研究から商用推論プラットフォームへの移行

SGLangの研究から商用推論プラットフォームへの移行 SGLangは、UC BerkeleyのIon Stoica研究室から生まれたオープンソース研究プロジェクトとして始まり、大規模言語モデル(LLM)推論サービングにおける文書化された非効率性に対処するために設計されました。このプロジェクトは、本番推論システムにおける2つの確立された制約を特に対象としていました:(1)異種リクエストパターン下でのレイテンシの変動、(2)可変プロンプト長と出力トークン要件を持つ同...

-- いいね数
続きを読む
TOPへ