最近話題の「ループエンジニアリング」「グラフエンジニアリング」とは?Claude Codeでの実践例を含めて解説
概要
AI活用の精度を高めるための概念を整理する回。プロンプト→コンテキスト→ハーネスエンジニアリングという従来の階層に加え、AIの「動かし方」を設計する新しい概念としてループエンジニアリング(時間軸)とグラフエンジニアリング(構造軸)を解説する。後半ではClaude Codeのサブエージェントを使った実践的な検証ループの組み方と、その効果を裏付ける論文を紹介している。
主なポイント
- 用語整理:プロンプトエンジニアリング(指示の設計)→コンテキストエンジニアリング(何をいつどれだけ読ませるか)→ハーネスエンジニアリング(AIが動く環境・権限管理まで含めた全体設計)という発展の流れがある
- ループエンジニアリングは「実行→検証→改善」を時間軸で繰り返す設計。Andrej Karpathy氏の自律的にMLモデルを改善するプロジェクトが有名な例
- グラフエンジニアリングは複数のAI(エージェント)をどう構造的に配置してタスクをこなすかという設計で、Anthropicが2024年に提唱した「ワークフロー」概念とほぼ同義
- Claude DesktopアプリやChatGPTアプリでエフォート/推論レベルを最大にすると、AIが自動でワークフロー(グラフ)を組んでくれる仕組みが既に組み込まれている
- Claude Codeの
/loopコマンドは単なる定期実行であり、検証・改善のループを組みたい場合は/goalコマンドの方が正しい選択(内部でClaudeの既定モデルが評価に使われる) - より自由度高くループを組むには、メインエージェントに成果物を作らせ、サブエージェントにチェックさせて修正する構成が有効。メインとサブで異なるモデルを使いコストを調整することも可能
- KAIST・CMU・NVIDIAの共同研究によると、フィードバックなしの自己修正(セルフリファインメント)はほぼ精度が向上しないが、評価基準を与えた外部フィードバックによる修正は精度が大きく向上する(Opus 4.1で5回の修正後98.4%まで到達した例あり)
- 検証ループの弱点として、コスト増加と局所最適解に陥りやすい点があり、複数プロンプトを並列に進化させるなどの対策が必要だが、確立した手法はまだない
実践に使えること
- Claude Codeで品質を上げたいタスクは、メインエージェントに作らせた後、別途サブエージェントを呼び出して評価・指摘させ、それを元に修正する流れを手動で組む
- 「最後に確認して」という指示だけでは精度向上に繋がりにくいため、検証エージェントには具体的な評価基準・採点ポイントを与える
- コスト重視の場合は、成果物作成は軽量モデル、検証は高性能モデル(あるいはその逆)と役割ごとにモデルを使い分ける
- 定期実行ではなく条件達成までのループを組みたい場合は
/loopではなく/goalコマンドを使う - 精度が頭打ちになったら、1つのループを回し続けるのではなく複数のプロンプトを並列に走らせて局所最適解を避ける