OpenAIの最上位モデル「GPT-6 Astra」が、AIモデル評価機関Artificial Analysisの最新ベンチマークでトップクラスの性能を記録しました。2026年9月9日に公開された評価では、Codex上で動作させたGPT-6 Astraが「Artificial Analysis Coding Agent Index」で62点を獲得し、Claude Code上のClaude Fable 5.1と同率首位に到達。総合的な知的能力を測るIntelligence Indexでも53点を記録し、こちらもFable 5.1と並びました。注目すべきなのはスコアだけではありません。Astraは競合モデルや前世代と比較して大幅に少ないトークンでタスクを処理しており、AI競争が「どれだけ賢いか」だけでなく、同じ仕事をどれだけ少ない計算量とコストで終えられるかという段階へ移りつつあることを示しています。
💻 Codex+GPT-6 Astraがコーディング性能で同率首位
Coding Agent Indexは単純なコード生成問題ではなく、ターミナル操作やソフトウェア開発に必要な知識などを組み合わせ、AIエージェントとして実際に開発作業を遂行する能力を測る指標です。最大推論設定のGPT-6 Astraは62点で、Claude Fable 5.1と同率首位。Claude Opus 5の60点、GPT-5.6 Solの55点、Muse Spark 1.3の54点を上回りました。内訳を見るとTerminal-Bench 4.0では56%、SWE-Atlas-QnAでは62%を記録する一方、DeepSWEでは68%でGPT-5.6 Solの72%を下回っており、すべてのコーディング能力が一律に向上したのではなく、エージェントとして複数の操作を組み合わせる能力が大きく伸びたことが分かります。

主要な結果を整理すると、次のようになります。
- 🥇 Coding Agent Index:62点 ― Claude Fable 5.1と同率首位
- 🧠 Intelligence Index:53点 ― Fable 5.1と同率首位
- 🖥️ Terminal-Bench 4.0:56% ― GPT-5.6 Solの37%から大幅向上
- 📚 SWE-Atlas-QnA:62% ― GPT-5.6 Solの54%を上回る
- 🛠️ DeepSWE:68% ― GPT-5.6 Solの72%からは低下
- 💵 Coding Agentの1タスク:約7.09ドル ― Fable 5.1より約40%低コスト
ここで重要なのは、モデル単体だけでなく「GPT-6 Astra+Codex」と「Fable 5.1+Claude Code」のように、モデルとエージェント実行環境を組み合わせたシステムとして評価されている点です。実際のAIコーディングではモデルの知識だけでなく、ファイル検索、コード編集、ターミナル操作、テスト、失敗からの修正といった一連のループが性能を左右するためです。

⚡ 最大の進化は「トークン効率」、前世代の約3分の1で処理
GPT-6 Astraで特に目立つのがトークン効率です。Coding Agent Indexの最大推論設定では、AstraはGPT-5.6 Solのおよそ3分の1のトークン量でタスクを処理しながら、スコアを55点から62点へ7ポイント伸ばしました。Artificial Analysisは、AstraをCoding Agent Indexの「コスト対性能のパレートフロンティア」に位置するモデルと評価しています。つまり、より高性能なモデルを選ぼうとすればコストも高くなる、あるいは同等以下のコストを選べば性能が下がるという境界線上に位置しているという意味です。
これはAPI料金だけを比較する場合には見えにくい変化です。GPT-6 AstraのStandard API価格は100万入力トークン当たり10ドル、出力50ドルで、GPT-5.6 Solの4ドル/20ドルと比較すると2.5倍です。それでもCoding Agent Indexでは、Astraの1タスク当たりコストは約7.09ドルで、GPT-5.6 Solより約15%高いだけに収まっています。さらに同等スコアのFable 5.1より約40%安く、Claude Opus 5よりも約30%低コストでした。「1トークンが安いモデル=実際の仕事も安い」とは限らず、問題を解決するまでに何トークン必要なのかが重要になっているわけです。

🧠 コーディング以外でも首位級、ハルシネーション率は92%→51%へ
総合能力を評価するIntelligence Indexでも、最大推論のGPT-6 Astraは53点を記録し、Claude Fable 5.1と同率首位になりました。最大推論では1タスク当たり約2万7000出力トークンを使用するのに対し、Fable 5.1は約7万8000トークンとされ、Astraは約3分の1の出力で同等スコアに到達しています。Intelligence Indexの1タスク当たりコストもAstraが約3.26ドル、Fable 5.1が約7.63ドルとなっており、高いトークン単価を処理効率で打ち消す設計がAstraの特徴として浮かび上がります。
知識とハルシネーションを評価する「AA-Omniscience」でも大きな変化があり、最大推論時のハルシネーション率はGPT-5.6 Solの92%からAstraでは51%へ低下しました。同時に正答率も4ポイント上昇しているため、単に「分からない」と回答して誤答を回避した結果ではないとArtificial Analysisは分析しています。また長期間にわたる複雑な知識労働を再現するAA-Briefcaseでは約90 Eloポイント改善し、Terminal-Bench 4.0では59%、業務自動化を測るAutomationBench-AAでは69%を記録。一方、44職種の経済的価値を持つ作業を評価するGDPval-AA v2ではGPT-5.6 Solから約45 Elo低下しており、新世代だからあらゆる仕事で前世代を上回るわけではないことも示されています。

🔍 ベンチマークを見るときに重要な「スコア・トークン・料金」の3軸
今回の結果は、AIモデルを単一のベンチマーク順位だけで比較することの難しさも浮き彫りにしています。Astraにはlow、medium、high、xhigh、maxという複数の推論強度があり、Artificial AnalysisではIntelligence Indexがlowの46点からmaxの53点まで上昇する一方、1タスク当たりコストも約0.82ドルから3.26ドルへ増加しています。つまり実運用では常にmaxを使用するのではなく、日常的なコード修正には低~中推論、難しいデバッグや設計では高~最大推論といったタスクに応じた計算量の配分がコスト削減につながります。

さらにOpenAI公式仕様では、GPT-6 Astraは最大約105万トークンのコンテキストと12万8000トークンの最大出力に対応し、コーディングだけでなくコンピューター操作、研究、複雑な文書作成などを想定したモデルとなっています。大量のコードベースを読み、必要な部分を探し、ツールを操作しながら修正するエージェント型開発では、単発のコード生成能力よりも長い文脈を維持しながら不要な推論を減らし、少ないトークンで正しい操作へ到達する能力が重要になります。今回のArtificial Analysisの結果は、その方向にモデル開発が進んでいることを示すデータといえます。
🔎 まとめ:AI競争は「最高スコア」から「仕事を終える効率」へ
GPT-6 AstraはArtificial Analysisの最新評価で、Coding Agent IndexとIntelligence Indexの両方でClaude Fable 5.1と並ぶトップスコアを記録しました。しかし、より重要なのは前世代より高いAPI単価にもかかわらず、大幅なトークン削減によって実際のタスクコストを抑えていることです。特にコーディングではGPT-5.6 Solの約3分の1のトークンでより高いスコアへ到達しており、「巨大な推論を大量に回せば高性能」という方向から、必要な推論だけを効率的に行う方向への変化が見え始めています。一方でGDPval-AAなど前世代より低下した評価もあるため、モデル選択では最高スコアだけを見るのではなく、用途ごとの性能、1タスク当たりのコスト、トークン消費量まで含めて比較することがますます重要になりそうです。
参考・出典
Artificial Analysis「Benchmarking GPT-6 Astra」https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra
Artificial Analysis「Claude Code vs Codex: Coding Agent Comparison」https://artificialanalysis.ai/agents/coding-agents/comparisons/claude-code-vs-codex
Artificial Analysis「Changelog」https://artificialanalysis.ai/changelog
OpenAI「GPT-6 Astra: A new generation of intelligence」https://openai.com/index/gpt-6-astra/
OpenAI API「GPT-6 Astra Model」https://developers.openai.com/api/docs/models/gpt-6-astra
OpenAI API「Pricing」https://developers.openai.com/api/docs/pricing
