Autognosis

自分の認知と学習を静かに磨くデジタルノート

速く流れていく情報から少し離れ、自分の頭でじっくり考えられる文章だけを集めています。

更新

2026/9/9

Tag

#注意機構

AI・機械学習
2026年8月28日 11:08
Technical visualization of a neural network architecture showing locality-aware attention patterns with dense local connections in the foreground and a separate organized knowledge memory structure in the background, rendered in blue and purple tones with glowing cyan accents

現代的言語モデルアーキテクチャにおける効率性のパラドックス

現代的言語モデルアーキテクチャにおける効率性のパラドックス 標準的なトランスフォーマーアーキテクチャは、局所性構造を明示的にエンコードせず、知識表現と計算ルーティングを混同することで、計算上の非効率性を招いています。 大規模言語モデルは実質的な能力向上を示していますが、その基礎的な設計は、モデルがトークン列を大規模に処理して言語能力を発展させるプリトレーニング段階において、体系的な非効率性を示しています。この非効率性は、能力向上の単位あたりの計算コストを...

-- いいね数
続きを読む
AI・機械学習
2026年8月6日 13:44
Abstract visualization of multi-dimensional data processing showing a three-dimensional grid structure with flowing data streams and efficient pathways, representing subquadratic computational approaches to handling high-dimensional data

多次元アテンション問題

多次元アテンション問題 アテンション機構に対するサブクワドラティック代替案は提案されていますが、多次元データへの適用は理論的にも実践的にも制約されたままです。この制約は根本的なアーキテクチャの不整合から生じています。標準的な畳み込みは空間的局所性を保持しますがグローバルコンテキストを犠牲にします。再帰的アプローチはシーケンシャル処理を通じてグローバルな受容性を達成しますが、破壊的な次元削減(ラスタライゼーション)を必要とします。アテンション機構はグローバルな受容...

#深層学習 #注意機構 #畳み込みニューラルネットワーク
-- いいね数
続きを読む
AI・機械学習
2026年7月2日 11:34
Abstract visualization of efficient attention mechanism showing data streams being routed through clusters, representing the transformation from quadratic to linear computational complexity in transformer models

ガウス混合注意機構:確率的潜在ルーティングによる線形時間シーケンス混合

ガウス混合注意機構:確率的潜在ルーティングによる線形時間シーケンス混合 ボトルネック:スケール時の密集注意機構 標準的なTransformer注意機構は、すべてのクエリとキー間のペアワイズ類似度スコアを計算するため、長さNのシーケンスに対してO(N²)の演算とO(N²)のメモリが必要です。32,768トークンのシーケンスでは、10.7億要素の注意行列が生成されます。この二次複雑性は、本番システムにおいて2つの異なる障害モードを引き起こします。 1. メ...

-- いいね数
続きを読む
AI・機械学習
2026年4月28日 09:55
Abstract visualization of three mathematical concepts—transformer attention, diffusion maps, and magnetic Laplacians—converging into a single unified geometric structure represented by a glowing manifold with flowing gradients and interconnected patterns

ディフュージョンとアテンションの接続

ディフュージョンとアテンションの接続 トランスフォーマーとディフュージョンの背後にある統一的な幾何学 トランスフォーマー、ディフュージョンマップ、磁気ラプラシアンは、従来、異なる数学的対象として、独立した理論的基礎を持つものとして扱われてきました。しかし最近の理論的研究——特に最適輸送と幾何学的深層学習の領域で——これらが共通の基礎構造から生じることを示唆しています。その構造とは、ソフトマックス前のクエリ・キースコアから構成されたマルコフ幾何学です。この接...

-- いいね数
続きを読む
AI・機械学習
2026年4月3日 15:07
Abstract 3D visualization of rotating geometric structures and spiral patterns in blue and purple, representing rotational positional embeddings in high-dimensional space

フレイドRoPEと長入力:幾何学的視点

フレイドRoPEと長入力:幾何学的視点 回転の幾何学:RoPEが位置をエンコードする仕組み 回転位置埋め込み(RoPE)は、高次元空間のトークン表現に回転行列を適用することで動作します。回転角は位置インデックスに比例します(Su et al., 2021)。形式的には、位置mにあるトークンについて、次元ペア(2i, 2i+1)は角度θi·mだけ回転します。ここでθi = 10,000^(-2i/d)であり、dはモデルの次元です。この構成により、トークン...

-- いいね数
続きを読む
TOPへ