前置き

トランスフォーマー代理モデルがエンジニアリング設計に進出—しかしスケール不整合がそれらを破壊します

トランスフォーマーベースの代理モデルは、半導体設計ワークフローにおいて高コストの第一原理シミュレーションを置き換えています。かつて有限要素法の計算に8時間を要した熱解析が、学習済みモデルを通じてミリ秒単位で実行されます。このスピード向上は実質的なものですが、モデルが訓練データを超えて一般化する場合に限られます。

採用パターンは一貫しています。チームは500~5,000個のラベル付きシミュレーションを収集し、トランスフォーマーを訓練して設計パラメータを熱的または機械的出力にマッピングし、その後、迅速な反復のためにデプロイします。初期結果は有望です。問題はデプロイ直後に表面化します。言語またはビジョンタスク向けに設計された標準的なトランスフォーマーアーキテクチャは、小規模なエンジニアリングデータセットが支えられるよりもはるかに多くのパラメータを保有しています。

半導体信頼性のための典型的なトランスフォーマー代理モデルは、約2,000個のサンプルで訓練された1,000~5,000万個のパラメータを含みます。このパラメータ対サンプル比は、言語モデルと比較して逆転しています。言語モデルでは数十億のパラメータが数兆個のトークンで訓練されます。これらの条件下では、モデルは一般化するのではなく記憶します。検証損失は数エポック以内にプラトーに達します。未見の設計に対するテスト性能は急激に低下します。

経済的な帰結は直接的です。チームは追加のシミュレーションデータを収集するか—代理モデルの価値提案を無効にします—、新しいジオメトリ、材料組み合わせ、または動作条件で失敗するモデルを受け入れるかのいずれかです。どちらのオプションも半導体設計では実行可能ではありません。単一の製造決定が数百万個のチップ全体に伝播するためです。

再帰的トランスフォーマーアーキテクチャは、パラメータ成長を制約することでこの不整合に対処します。独立した注意層をスタックするのではなく、再帰的設計は計算ステップ全体で重みを再利用し、総パラメータを70~90%削減しながら、層幅ではなく再帰深度を通じて表現力を維持します。熱機械結合問題に関する初期結果は、標準的なトランスフォーマーの10分の1のパラメータを使用して、検証精度が2~3%以内であることを示しています。

このシフトは実現可能性フロンティアを変えます。チームは、望んでいるデータセットではなく、保有しているデータセットで信頼できる代理モデルを訓練できるようになります。デプロイメントフットプリントはギガバイトからメガバイトに縮小し、クラウド依存なしに設計ワークステーション上でのエッジ推論を可能にします。パラメータが少ないほど、隠れた障害モードも少なくなり、本番環境でのモデルの監査可能性と信頼性が向上します。

従来のオーバーパラメータ化がエンジニアリングデータで失敗する理由

エンジニアリング設計データセットは、標準的なトランスフォーマーアーキテクチャの基礎となる仮定と根本的に不整合な構造的特性を示します。代表的なケースを考えます。12個の設計パラメータ全体で3,000個のラベル付きシミュレーションで構成される半導体熱機械信頼性研究です。各シミュレーションには200~500ドルの計算リソースと専門家による検証が必要です。このデータセットは3つの重大な制約によって特徴付けられます。(1)パラメータ次元性に対する限定的なサンプルサイズ、(2)サンプルあたりの高い取得コスト、(3)特徴空間の低い内在次元性です。

標準的なトランスフォーマーアーキテクチャはデータ豊富な領域に最適化されています。それらの設計は、数百万の訓練サンプル、高次元の特徴空間、および最小限の一般化ペナルティでパラメータ数を増加させる能力を想定しています。この仮定は言語およびビジョンドメインで経験的に成立します。データ取得コストがモデルパラメータに対して無視できるためです。サンプル対パラメータの比は通常100:1を超えます。エンジニアリング代理性では、この比は劇的に逆転します。3,000個のサンプルと従来の2,000万パラメータトランスフォーマーでは、比は1:6,000未満に低下し、モデル容量と利用可能な教師信号の間に根本的な不整合を生じさせます。

そのような条件下では、過学習は予測可能な特性で現れます。訓練損失はゼロに向かって収束します。

言語モデルと半導体サロゲートの規模差を示す比較チャート。言語モデルは数十億パラメータと数兆トークンを持つ一方、半導体サロゲートは1000-5000万パラメータと約2000サンプルという逆転した関係を棒グラフで表現。両者の対数スケールでの大きな差異が視覚化されている。

  • 図2:言語モデルと工学用サロゲートのパラメータ・サンプル比率の比較(出典:記事本文)*

工学データセットにおける従来的過度パラメータ化の失敗メカニズムを示すフロー図。3,000個のラベル付きシミュレーションデータから始まり、限定的なデータサイズ、12個の高次元設計パラメータ、複雑な非線形物理シミュレーションという3つの構造的制約が、過学習リスク、計算コスト増加、専門家検証負荷の増加を引き起こし、従来手法の失敗につながることを示しています。最終的には帰納バイアスと物理制約の組込が必要な対策として提示されています。

  • 図4:工学データセットにおける従来的過度パラメータ化の失敗メカニズム*