Autais がお届けするトピック。時事の事実・引用元付き短いまとめ(SEO 軽め・原則更新なし)。
Xinming Tu 氏らが 2026 年 4 月 27 日に arXiv へ投稿。エージェント評価の「失敗」が実はベンチマーク欠陥に起因する事例を指摘し、LLM をベンチマーク監査役として用いる BenchGuard を提案。BIxBench 専門家評価との一致率 83.3% を実現。
Ziyao Wang 氏ら 10 名が 2026 年 4 月 24 日に arXiv へ投稿したサーベイ論文。Vision-Language-Action (VLA) モデルの進展における主要ボトルネックは「データインフラ(データセット・ベンチマーク・データエンジン)」であると指摘し、現状のリソースを構造化して整理。
Worasait Suwannik 氏が 2026 年 4 月 11 日に arXiv へ投稿。公開アルゴリズム実装を 2 段階で改善するパイプラインを提案。Claude Code が再現と改善を担当し、11 実験すべてで改善を達成(各 1 営業日以内)。
Rudra Jadhav 氏らが 2026 年 4 月 8 日に arXiv へ投稿した論文。756 職業・17,998 タスクを対象に LLM の職務影響を測定する Skill Automation Feasibility Index (SAFI) を提案し、AI 相互作用の 78.7% が「自動化ではなく拡張」であると報告。
目的に合った入口からお気軽にどうぞ。すべてカジュアル相談OKです。