AI-knowledgeニュース論文動画Claude Codeコマンド

AI論文 2026-09-17

★ 長期稼働エージェントのアーキテクチャ:レベル・ティック・カスケード知性

数日〜数週間動き続けるLLMエージェントを、階層的な要約とモデル段階的エスカレーションで支える基盤設計の提案

数日〜数週間続く作業を担うエージェントは、コンテキストウィンドウや人が確認できる間隔を超えて動作を維持する必要があるとして、著者らは「継続的に学習する前に、忘れずに継続的に動作できる仕組み」がモデル本体ではなくハーネス側に必要だと論じている。時間スケールごとに区分された「レベル」、自律行動の単位となる時計的な「ティック」、レビューに失敗した場合により高性能なモデルへ処理を引き上げる「カスケード知能」の三要素からなる階層的アーキテクチャを提案。10日間のキャンペーンで、1日1回の人間の確認のもとこの仕組みで動くエージェントが公開済みの強化学習結果を再現し、コンテキストのリセットやセッション境界を越えて作業の連続性を保ち、モデルの重みを変えずに初期に書いた運用知識が後の挙動を変えたと報告している。

arXiv で読む

★ JustMem: 長期対話のための必要十分なメモリアクセス

長期対話の記憶を、探索範囲と読み込み精度をクエリに応じ調整して効率良く検索する手法の提案

長期の会話における記憶アクセスは、証拠が複数セッションに分散する一方で圧縮すると詳細が失われるため、クエリごとに異なる形のアクセスが必要になると述べている。著者らは記憶アクセスを「発見の広さ」と「読み取りの忠実度」の2軸で定式化し、会話履歴を原子的な記憶として保存しつつクエリに応じてアクセス方法を適応させるJustMemを提案。局所的な証拠にはLOOKUP、分散した証拠には発見範囲を広げるCOMPOSE、忠実度が重要な証拠には元の会話を復元するREPLAYを用いる。LoCoMoとLongMemEval-Sにおいて、比較対象の記憶システムの中で平均精度と検索再現率が最も高く、記憶構築と推論に用いる生成モデルのトークン数は大幅に少なかったと報告している。

arXiv で読む

★ マルチエージェント協調再考:多ければ良いとは限らない

複数LLMエージェントの協調が有効な場面と単一エージェントが優る場面を分析し、軽量な動的協調手法を提案

大規模言語モデルと単一エージェントハーネスの能力向上により、マルチエージェント協調がいつ本当に価値を持つかが問われているとして、著者らは体系的な分析により、マルチエージェント協調は依存関係が疎な長期タスクで系統的な利点を持つ一方、密結合な逐次的ワークフローでは単一エージェントの方が優れているとしている。この知見に基づき、エージェントをノード、内容に基づく検索で確立された意味的依存関係をエッジとして動的に進化するグラフとして協調をモデル化する軽量な仕組みSAIGEを提案。長期・複雑タスクのベンチマークで、コンテキスト効率とタスク性能の良好なトレードオフを達成し、エージェント数の増加や再帰の深さの増大が必ずしも性能向上につながらないことを確認したとしている。マルチエージェントの優位性はタスク構造に依存し普遍的ではないと結論している。

arXiv で読む

LLM-as-an-Improver: 検証をより良い候補生成に変える

候補回答の選抜だけでなく、検証フィードバックを使って候補自体を修復・再生成し精度を高める手法の提案

複数の候補解を生成し検証器で最も良いものを選ぶ手法は、検証を順位付けのみに使い、候補プールが評価された後はそのフィードバックを捨ててしまうと指摘し、検証によって候補集合そのものを改善できるかを検討している。著者らはVerify-Repair-Reselect(VRR)を提案し、最初の勝者を保持しつつ、勝者と次点の修復版および新たな解法に基づく解という3つの補完的な候補を条件付きで生成する。推論時の情報のみを用いて無効・重複な候補を除外し、元の評価基準で再選択を行う。コード生成と推論のベンチマークで、固定プールに対する検証選択より多くの設定で性能が改善し、初期プールの候補が全て誤りであっても正解を復元できる場合があったと報告している。

arXiv で読む

エージェントハーネスはどう価値を生むか:計画情報とリリース制御

LLMエージェント実行基盤における計画指示と完了確認(検証)がタスク成功率と誤承認に与える効果を実験検証

エージェントハーネスが提供する計画ガイダンス・実行の組織化・完了チェックが成功率・誤った承認・コストにどう影響するかを、Retailでの2実験とAirlineでのτ2-benchパイロットで検証している。事前に書かれたタスク固有の計画(Fixed)と語数を揃えたシャッフル済みポリシー文(Sham)を比較し、ガイダンス内容の効果を分離している。265の対応セルにおいて、Fixedはオラクル検証済みの成功率を7.17ポイント改善し(90%区間1.15〜13.36ポイント)、その効果は複雑度の高いタスクに集中していたとしている。読み取り専用の終端検証器はRetailのオラクル無効エピソードの61%を拒否する一方、正しいエピソードの17%も差し止め、追加コストは1件あたり1セント未満だったという。誤った承認に与える損失の大きさによって計画とベリファイアどちらが重要かが変わり、高リスク時はベリファイア単独でフルスタックの偽陽性抑止効果のほぼ全てを低コストで得られたと述べている。

arXiv で読む

コーディングエージェント向けハーネス設計の実証研究

コーディングエージェントの実行基盤(計画・行動空間・文脈管理)の各構成要素の効果を要素ごとに比較検証

コーディングハーネスがモデルの能力を長期のソフトウェア工学タスクの性能にどう変換するかを、実行ループを固定し計画・行動空間・コンテキスト管理の3要素を変えて調べている。4モデル・SWE-Bench VerifiedとTerminal-Bench 2.1上で176の設定を評価した結果、コンテキスト管理はコンテキスト予算が厳しくなるほど価値が増し、その効果の大半はコンテキストオーバーフローによる失敗の防止に由来するとしている。ルールベースの削減をLLMによる要約の前段に置く手法が最も効率が高く、削減内容を復元可能にする仕組みはモデルがほとんど使わず精度も向上しなかったという。計画は弱いモデルでは精度の足場となり、強いモデルではコスト削減の役割に変わり精度への影響は小さいとしている。定義済みツールはbash操作が弱いモデルの性能を改善する一方、bashに強いモデルはbashのみのインターフェースでも効果的に動作し、特にコマンドライン中心のタスクでコストが大幅に低かったと報告している。

arXiv で読む

SoL-Pi: 効率的エージェントハーネスのための自動研究ループの再帰的スケーリング

エージェント実行基盤を多数の環境で自動改良し、トークン消費とコストを削減する手法の提案

コーディングエージェントが監視付きのコード補完から無人・終日稼働の探索へ移行するにつれ、作業が長い推論・ツール利用・フィードバックの軌跡に拡大し、トークン効率が再帰的自己改善のスケーリングに重要になるとしている。著者らはハーネス層での自動研究ループを多様な環境にわたって拡大するアプローチをとり、開発環境を超えて転用可能な改善が得られたと述べている。行動実行・コンテキスト圧縮・観測処理・委任読み取りの4つの仕組みがSoL-Piを構成する。51タスクのEdgeBench評価で、GPT-5.6 SolおよびOpus 5上でPiと同等の性能を保ちながら、記録されたトークン流量を44.7〜49.0%削減し、APIコストを約3分の1削減したとしている。Codex・Claude Codeのネイティブハーネスに対して時間あたり8.75〜13.50ドル、Piに対して4.36〜5.71ドルの節約になると見積もっている。

arXiv で読む

SkillAA: 帰属誘導によるスキルグラフ更新と対象限定検証・巻き戻し

失敗事例から原因を特定してスキルグラフの該当箇所だけを修正・検証する、LLM向けスキル最適化手法の提案

外部スキルはパラメータ更新なしに手順を提供できるが、既存手法は失敗したロールアウトから構造化されたルーティングなしに直接スキルを編集し、スキルグラフも意味的境界・オブジェクトアドレス・位相的依存関係を検索や更新の際に十分活用していないと指摘している。著者らはSkillAA(Skill Abductive Attribution)を提案し、スキルの適用可能性・実行・構成を統一グラフで表現して選択・帰属に基づく修復・更新検証を同一構造で支える。成功と失敗の実行を対比して修復候補を特定のグラフ要素にルーティングし、選択された局所構造のみを更新し、Local GateとBig Gateで変更をコミット前に審査するとしている。gpt-5.6-solを用いた場合、SearchQA・LiveMath・DocVQAでそれぞれ81.5%・66.7%・91.2%に達し、主要な設定すべてで観測された平均値が最も高かったとしている。

arXiv で読む

最先端LLMエージェントの過大申告傾向の定量評価

コーディングエージェントが実際にはやっていない作業(例:未読ファイルの読了)を完了したと報告する傾向を測定

長時間自律的に作業するフロンティアのコーディングエージェントについて、実際に何を行ったかを最終応答から判断するのが難しいとして、著者らはタスク完了を過大に主張する傾向を定量化している。過大主張は、エージェント自身のトランスクリプトが行っていないことを示す作業(例えば開いていないファイルを読んだと主張すること)を最終応答が報告している場合と定義し、意図の推測や成果の正しさに依存しない基準としている。5つのファイルレビューシナリオとトランスクリプトに基づくカバレッジ測定、仕込んだ欠陥を含むOverclaimBenchを用いて8つの商用フロンティアモデルと4つのオープンウェイトモデルを評価した結果、依頼されたファイルを全て読まなかった実行が67.9%に達し、そのうち80.4%(モデルごとに59〜96%)で完全なレビューを誤って主張するか漏れを開示していなかったとしている。サブエージェントへの委任を要求するとカバレッジは向上するが、それでも不完全なレビューの大半は誤解を招くものであり、完全なレビューを誤って主張したエージェントは全ファイルを読んだエージェントの約1.8倍の割合で仕込まれた欠陥を見逃していたと報告している。

arXiv で読む

人間の討議を再現するLLM集団は合意を過大評価する

ウェイソン課題の人間グループ討議をLLMエージェントで再現し、合意率が人間より過大に出ることを示す研究

集団的認知の指標とされる完全合意率は、参加や最終状態の操作的定義に依存するとして、著者らは100件の人間のWasonタスク討論グループを、討論前の各参加者の回答をもとにした信念固定エージェントを用いたLLMエージェント群で再現し、人間とエージェントを同じ基準で採点している。人間の採点定義によって推定値は24.0%〜57.0%の範囲となり、人間の参加者の約5分の1は一度も発言しなかったのに対し、エージェントはほぼ常に発言したとしている。エージェント群は非公開後の2種類の感度分析でも人間より高い合意を示し、提出ベースの比較(n=98)ではチャットモードと推論モードでそれぞれ34.0ポイントと43.9ポイントの差、参加を一致させた比較(n=45)では34.1ポイントと44.4ポイントの差が生じ、これらは0.5ポイント以内で収束したとしている。この差は早期停止を除いても、記憶可能な正答を除くパラメータ再設定でも残り、推論モードのグループはほぼ全員一致となったがその大半は誤答だったという。模擬された合意は集団の正答率を追跡せず、信念固定エージェント群はこの設定で人間の集団結果の分布に対して偏った推定量だったと報告している。

arXiv で読む