AI論文 2026-09-06
★ 自己生成ツールアクションによるAndroid GUIエージェントの精度と効率の向上
AndroidのGUI操作エージェントに、APIを呼ぶPython関数ツールを自動生成・検証して追加し性能を上げる手法の論文
Android向けGUIエージェントにおいて、GUI操作とAPIによるツール操作を組み合わせたハイブリッド行動空間は、ツール作成の手間から十分に検討されていないとし、著者らはアプリ状態(データベース等)を操作するPython関数を、提案・実装・テスト生成/実行・修正の工程で自動生成するフレームワークDroidToolを提案している。個別でなく関連ツール間の関係テストで前提条件とカバレッジを高めたとしている。AndroidWorld、B-MoCA、MobileSafetyBenchの平均で、ツール併用エージェントはGUIのみのエージェントより性能が約4.47ポイント高く、対話回数は約20.05%少なかったと報告している。
arXiv で読む★ エージェンティックWebのための型付き連合アーティファクト:凍結・異種LLMエージェント間でツールルーティング知識を共有する
重みを変えずに複数のLLMエージェント間で「どのツールを使うべきか」の知識を安全に共有する仕組みSYNAPSEの提案
著者らは、凍結された多様なLLMエージェント間でツール呼び出し知識を共有する手法として、フィールド単位のプライバシーや紛争解決に対応するスキーマ検証済みの型付き連合アーティファクトを提案し、共通知識基盤SYNAPSE1として具体化したとしている。StableToolBench(ツール3,180件)では、連合方式のルーティング精度が集中管理方式に対し1.1ポイント差にとどまり、経験を平坦なテキストでなく型付きフィールドで提示すると精度が清浄データで8.5ポイント、矛盾60%混入下で7.4ポイント向上したとしている。一方でτ-bench小売でのGPT-4oの精度向上(6.7ポイント以上)はフォーマット由来としており、同じ経験を用いたTF-IDF分類器がLLMのルーティングを48/26ポイント上回った点から、ベンチマークにラベル漏洩がある可能性を指摘している。
arXiv で読む★ XYBench:LLMは誤解を含む質問に実用的に応答できるか
利用者の質問に潜む誤った前提(XY問題)をLLMが見抜き本来の目的解決を促せるか評価するベンチマーク論文
非専門家の質問には誤解に基づくもの(XY問題、例:XML解析に正規表現を使う方法を尋ねる質問)が含まれるとし、著者らはLLMが誤解を認識し本質的な解決策へ誘導できるかを検証するベンチマークXYBenchを構築したとしている。StackOverflow/StackExchangeやWikiHow等から集めた8,115件の質問を用い、実用的解決策の提示・強調と誤解特定の3観点で評価した結果、最上位のLLMでも文字通りの要求への回答率が0.75〜0.92である一方、意図に沿った回答は0.33〜0.71にとどまり、誤解の特定率も人間の79〜90%に対し最大63%と下回ったとしている。選択式では実用的回答を好む一方、生成時には一貫して生成できず、意図を明示すると改善するが差は残るとしている。
arXiv で読む