【速報】Opus5とGPT-5.6を超えるGeminiの新機能を徹底解説
概要
Geminiが直近で「動画生成」「音声会話エージェント」「文字起こし」の3分野を立て続けにアップデートした内容を解説する動画。特に動画生成は市場トップクラスの品質に達し、音声まわりの機能強化も業務効率化に直結すると紹介している。
主なポイント
- Gemini Omni 1.1 Flashが登場し、動画編集(video-to-video)の精度が業界トップレベルに向上。既存動画をプロンプトで別物に加工できる
- 10秒単位の動画を継ぎ足して最大40秒までストーリーを一貫性を保ったまま延長生成可能に
- 360pの低解像度・低コスト下書きを先に作ってから1080p/4Kへ本生成する2段階フローに対応、コストは従来と同水準
- Gemini Live(旧Bard系の音声会話機能)にエージェント機能が追加され、声だけでGoogleカレンダー予約やメール整理、動画修正指示などが可能に。世界中で無料利用可
- Gemini 3.5 Transcribeが最高精度の音声認識モデルとして登場。フィラー除去・自己修正・最大3話者の識別・85言語以上に対応
- 動画生成はGoogle AI Pro/Ultraプランのユーザーのみ利用可能(最安の課金プランからでも使用可)
- macOSのGeminiアプリでは音声だけで画像生成・情報検索・ファイル分析などの指示が行える
実践に使えること
- LPやウェブサイトに動画を掲載する際、素材動画をGemini Omni 1.1 Flashで加工・編集してから使う
- 会議の議事録作成にGemini 3.5 Transcribeを使い、話者分離とフィラー除去済みのクリーンな文字起こしを得る
- Gemini Liveで日々のカレンダー登録やメール整理を音声指示だけで完結させる
- Zoom/Google Meet代替の自社アプリなどをClaude Codeで自作し、そこにGeminiのTranscribe APIを組み込んで音声処理を強化する