AI・機械学習
2026年8月7日 08:51
DataPrep-Bench: LLMをトレーニングデータ準備者として評価する
DataPrep-Bench: LLMをトレーニングデータ準備者として評価する データ品質のパラドックス: ベンチマーク性能が現実世界の失敗を隠蔽する理由 トレーニングデータの品質は、大規模言語モデル(LLM)の能力を決定する主要因です(Kaplan et al., 2020; Hoffmann et al., 2022)。しかし現在、LLM自体がデータ準備タスクを確実に実行できるかどうかを評価するための標準化された測定フレームワークが業界に不足しています...