Gemini新機能「Computer Use」がヤバい?AIが自分でPCを操作する仕組みを解説
概要
GoogleのGemini 3.5 Flashで強化された「Computer Use」機能を解説する動画。従来のテキスト・画像生成中心だった生成AIの使われ方から一歩進み、AIがブラウザやPC画面を自ら認識・操作できるようになった仕組みとデモを紹介している。
主なポイント
- Computer Useは、画面をスクリーンショットとして理解し、クリックや入力などの操作を自律的に行うGeminiの新機能
- 2.5 Flash時代から存在していたが、3.5 Flashで商用利用フェーズに進化
- 3.5では処理速度が向上し、トークン効率も最大68%改善
- 「インテントトレース」により、AIがなぜその操作をしたかという思考プロセスが可視化され、誤操作の原因分析がしやすくなった
- ブラウザ・コンピュータ操作系ベンチマークで78.4のスコアを記録(Gemini 3.1 Proや旧Flashを上回る水準)
- 内部では「観察→思考→実行」を繰り返す「エージェンティックループ」という仕組みで動作
- Browserbase社が提供するデモ環境で、検索→サイト訪問→問い合わせフォーム入力までを自然言語指示だけで実行するデモを実演
- RPA(定型業務の自動化)とは補完関係にあり、正確性・再現性が必須な単純作業はRPAが依然有利、柔軟な自然言語理解が必要な場面はAIが強みを発揮
実践に使えること
- Browserbase社のデモページからGemini Computer Useを無料で体験し、AIによるブラウザ自動操作の実力を確認できる
- 業務でのRPA導入を検討する際、「変化に弱く判断ができない定型作業」はRPA、「柔軟な判断が必要な操作」はAI(Computer Use)と使い分ける視点を持てる
- フォーム入力などの自動化タスクを自然言語指示だけでAIに委任できるか、自社サイトで小規模に試してみる