OpenAI最新モデル『GPT-6 Astra』登場!ベンチマーク結果からプロンプトのコツまで解説
概要
OpenAIが新モデル「GPT-6 Astra」を発表。コンピューター操作や未知の問題解決に強みを持つとされ、ベンチマーク結果や実際の使用感、Anthropicのフェイブル5.1との比較、公式が示すプロンプト設計のベストプラクティスを紹介する内容。
主なポイント
- GPT-6 Astraはコンピューター操作・ブラウジング・ソフトウェアエンジニアリング・サイバーセキュリティなどに強く、ChatGPT Plus(月額20ドル)ユーザーが利用可能。
- ARC-AGI(未知の問題を解く力を測るベンチマーク)で99.9%を記録したが、これはOpenAI独自ハーネス使用時の数値で、一般的なハーネスでは62.7%程度になる点に注意が必要。
- API価格は入力100万トークン10ドル・出力50ドルとフェイブル5.1と同水準だが、同性能をより少ない計算量で達成できるため処理速度が速い可能性がある。
- ユーザーへの過剰な迎合(お世辞)を抑える傾向が強まっており、悪いアイデアには明確に低評価を出すなど、仕事での壁打ち相手として使いやすくなった。ただし2択で意見を求めると相手の意見に引っ張られる傾向はまだ残る。
- 第三者評価(Artificial Analysis)では、コーディングや実務系タスクでは依然フェイブル5.1の方が高スコアの分野があり、GPTは初見タスクやレビュー的な精査に強い傾向。
- 公式ベストプラクティスとして、①指示が曖昧だと最後まで実行せず聞き返してくる、②指示に矛盾があると処理が停止する、③箇条書きや表を多用しがち、④サブエージェントを自発的に使わなくなった、⑤コーディング後のテストを必要以上に広くやりがち、という5つの癖が挙げられている。
- チャットGPTデスクトップアプリでブラウザ操作(コンピュータユース)をさせ、会社の登記申請作業を代行させた実例が紹介されている。
実践に使えること
- GPT-6を業務で使う際は、AGENTS.mdやスキルファイルの指示内容に矛盾がないか事前に見直す。
- 「最後まで実行してほしい」「ユーザーの意図を汲んで進めてほしい」など、自律的にタスクを完了させたい場合は明示的に指示に含める。
- コード修正など小さなタスクでは、検証範囲を指示で明確に限定し、過剰なテストを防ぐ。
- アイデアの評価や壁打ちにGPT-6を使うと、率直なフィードバックが得やすい(ただし2択問題では相手の意向に引っ張られやすい点は要検証)。
- コーディングや実務タスクではフェイブル5.1、初見の複雑タスクやレビューではGPT-6、と用途に応じてモデルを使い分ける。