Autognosis

自分の認知と学習を静かに磨くデジタルノート

速く流れていく情報から少し離れ、自分の頭でじっくり考えられる文章だけを集めています。

更新

2026/9/20

Tag

#モデル最適化

AI・機械学習
2026年8月27日 10:31
Abstract visualization of transformer neural network layers showing colorful token embedding clusters evolving and organizing across multiple transparent geometric planes from chaotic to structured patterns

トランスフォーマーを幾何学として捉える:層別表現進化がなぜ重要か

トランスフォーマーを幾何学として捉える:層別表現進化がなぜ重要か トランスフォーマーは言語タスクとビジョンタスク全般で最先端の性能を達成していますが、その学習メカニズムは依然として完全には特性化されていません。解釈可能性研究の大多数は二つの異なるスケールで動作しています。微視的スケール(個別の注意ヘッド、特定のニューロン)と巨視的スケール(最終出力ロジット、集約損失関数)です。ここに重要な欠落が生じています。中視的スケール、つまり層スタック全体にわたる表現幾何学の...

-- いいね数
続きを読む
AI・機械学習
2026年8月15日 10:32
Split visualization comparing traditional semiconductor thermal simulation taking 8 hours on the left with AI transformer-based surrogate model completing the same analysis in milliseconds on the right, connected by flowing data streams

前置き

前置き トランスフォーマー代理モデルがエンジニアリング設計に進出—しかしスケール不整合がそれらを破壊します トランスフォーマーベースの代理モデルは、半導体設計ワークフローにおいて高コストの第一原理シミュレーションを置き換えています。かつて有限要素法の計算に8時間を要した熱解析が、学習済みモデルを通じてミリ秒単位で実行されます。このスピード向上は実質的なものですが、モデルが訓練データを超えて一般化する場合に限られます。 採用パターンは一貫しています。チーム...

-- いいね数
続きを読む
AI・機械学習
2026年6月18日 15:40
Three distinct colored light streams representing Query, Key, and Value projections converging into a central attention mechanism point, set against a dark background with subtle neural network patterns

トランスフォーマーは3つのプロジェクションを必要とするのか。QKVバリアントの体系的研究

トランスフォーマーは3つのプロジェクションを必要とするのか。QKVバリアントの体系的研究 標準的な3プロジェクション構造の再検討 トランスフォーマーのクエリ・キー・バリュー(QKV)プロジェクション機構は、Vaswani et al.(2017)が「Attention Is All You Need」を発表して以来、ほぼ疑問の余地なく受け入れられてきました。標準的なアーキテクチャは、スケーリングされたドット積アテンション計算の前に、入力埋め込みを変換するため...

-- いいね数
続きを読む
AI・機械学習
2026年2月1日 19:02
Two intertwined translucent neural network structures, one glowing amber representing factual knowledge and one glowing blue representing logical reasoning, merging in the center with purple interference patterns against a dark technological background

デジタル代謝:再生的アンラーニングによる論理と事実の分離 — 純粋な神経論理コアに向けて

デジタル代謝:再生的アンラーニングによる論理と事実の分離 — 純粋な神経論理コアに向けて パラメータのエンタングルメント:根本的な問題 主張: 大規模言語モデルはパラメータのエンタングルメントを示す。これは、推論論理と事実知識が共有された神経重みの中にエンコードされ、表現の干渉を生み出し、両方の能力を低下させるものである。 定義的前提条件: パラメータのエンタングルメントは、異なる機能的目的(論理的推論と事実検索)が重複する重み行列内に共存...

-- いいね数
続きを読む
AI・機械学習
2026年1月31日 19:02
Technical illustration of a Mixture-of-Experts neural network architecture showing selective routing pathways, with illuminated active expert nodes connected by glowing data streams against a dark computational grid background

MoEの計算効率を重みとデータのスパース性の組み合わせで改善する

MoEの計算効率を重みとデータのスパース性の組み合わせで改善する 重みのスパース性:基盤 Mixture-of-Experts(MoE)アーキテクチャは、すべてのモデルパラメータを活性化するのではなく、各トークンを学習されたエキスパートのサブセットにルーティングすることで、順伝播あたりの計算コストを削減します。この重みのスパース性メカニズムが、MoEシステムにおける主要な効率向上を構成します。形式的には、モデルが合計E個のエキスパートを含み、各トークンが...

-- いいね数
続きを読む
AI・機械学習
2026年1月29日 19:02
Visualization of particle collision jets transforming into a geometric tensor network structure, representing the conversion of high-energy physics data into computational models for real-time classification at the Large Hadron Collider

テンソルネットワークモデル:深層学習に対するコンパクトな代替手段

テンソルネットワークモデル:深層学習に対するコンパクトな代替手段 高輝度大型ハドロン衝突型加速器(HL-LHC)におけるリアルタイム粒子分類は、明確に定義された制約の下で動作する推論システムを必要とする:マイクロ秒スケールのレイテンシ予算(トリガー段階でイベントあたり通常1~10 μs)、限られた電力エンベロープ(処理ノードあたり10~100 W)、および決定論的実行プロファイル。テンソルネットワーク(TN)モデル—特に行列積状態(MPS)とツリーテンソルネットワ...

-- いいね数
続きを読む
TOPへ