100体のAIエージェントを同時に動かしてみた結果(Evo X Agent検証)
概要
Evo Map社の新しいAIコーディング/生産性エージェント「Evo X Agent」(Mac/Windows対応)を、セットアップからデモまで検証した動画。同じモデル・同じ563問で、単独エージェントの正答率26%に対し、スウォーム(群)方式では71%に達したというベンチマークが紹介される。スウォーム協調、自己進化スキル、難易度に応じたマルチモデル自動切替が3つの特徴。
主なポイント
- スウォーム協調: 各タスクを独立したクリーンなコンテキストのエージェントに分離し、結果の統合をLLMではなくコードで行う。サブエージェント方式では正解373件のうち217件しか最終結果に残らなかったが、この統合時の取りこぼしを防げる。
- 自己進化スキル: タスク完了ごとに成功した手順を再利用可能な資産として保存する。観察→発見→再利用/改善→検証→定着の5段階で、最小単位が「gene」、タスク全体をまとめたものが「capsule」、変更履歴が改変不可の「events」。公式主張ではトークンが約31%減るが、動画内では検証されていない。
- グローバル共有(任意): Evo Mapネットワークで他のエージェントが検証済みのgene/capsuleを取り込める。高評価の資産を公開するとボーナスのクレジットが得られる。
- マルチモデル自動切替: 設定の「model strategy」で、難易度別(economy/balance/長い会話など)にモデルを割り当てられる。例として、economyに安価なDeepSeek、balanceにKimi K3などを設定する。
- 3つのモード: Chat(相談・質問)、Co-work(PDFレポートやスライドなど成果物の作成)、Code(プロジェクト内のコード変更、テスト、Vercelへのデプロイまで)。権限は confirm / smart / full auto から選べる。
- カスタムモデル対応: OpenAI・Anthropic・Geminiの各APIに加え、LM Studioや自宅のDGX Sparkなどのローカルモデルをカスタムプロバイダとして追加できる。
- スウォーム実測: 7ファイル分程度の改善タスクで、スウォームは約84Kトークンで完了した。逐次実行は約129Kトークンで、所要時間は約2.5倍かかった。
- 100並列の実験: 100体のエージェントに生存ゲーム用の「種」を書かせ、約20分で完了(逐次なら数時間)。上位の戦略を踏まえて2世代目を作ると、生存数が64/100から99/100に改善した。
- 外部連携: Discord、Slack、LINE、Messengerなどのチャンネルや、QRコードでのスマホ接続に対応。Codex/Claude Codeの設定、スキル、コネクタ、フック、サブエージェントをインポートできる。
- 無料枠: アカウント作成で1,500クレジットが無料(カード登録不要)。
実践に使えること
- 並列化できる独立タスク(ドキュメント整備、型/lint修正、単体テスト追加、アクセシビリティ改善など)は、スウォームをオンにして一括投入すると速度とトークン効率が上がる。
- 設定のmodel strategyで、簡単な作業は安価なモデル、難しい作業は高性能モデルに自動で振り分け、コストを抑える。
- 既存のClaude CodeやCodexの設定・スキルをインポートして、現在のワークフローと並行して試す。
- 多数の候補を生成して上位を選び、次の世代の入力に使うやり方(進化的な反復)は、スウォームの活用例として応用できる。
- 自己進化ダッシュボードのeventsログで、エージェントが何を学習・変更したかを監査する。
- なお、一部の数値(26%対71%、31%削減)はスポンサーのEvo Map側の主張である。自分のタスクで比較検証してから採用を判断する。