🖥️ GPT-6 Astraは「回答するAI」から「PCで仕事を完遂するAI」へ
OpenAIは2026年9月3日、新たなフロンティアモデル「GPT-6 Astra」を発表しました。最大の特徴は、文章生成やプログラミングだけでなく、画面を見ながらマウスやキーボードを使うようにPCアプリを操作し、複数工程にまたがる仕事を最後まで進める能力が大幅に強化されたことです。実際の業務に近いPC操作を評価する「Agents’ Last Exam」では59.3%を記録し、GPT-5.6 Solの53.6%を上回りました。OSWorld 2.0でも72.6%、画面上の操作対象を認識するScreenSpot-Proでは92.7%に達しています。さらにCAD操作を含むBenchCADでは95.9%を記録しており、Astraの進化は単なる「賢いチャットAI」ではなく、人間が普段使っているソフトウェアそのものを操作できる汎用エージェントという方向にあります。
この違いは実用上かなり大きな意味を持ちます。従来のAIエージェントは「コードを書く」「操作方法を説明する」ことは得意でも、実際にGUIを開き、途中結果を目で確認し、失敗したら修正し、別のアプリへデータを渡すような長時間作業ではミスが積み重なりがちでした。Astraではフォーム入力、調査、表計算、Webサイト制作、ソフトウェアのインストール・テストなどに加え、長時間の作業で失われやすかった過去の情報を保持する仕組みも強化されています。Codexではコンテキストウィンドウをまたいで作業メモを維持し、過去のコンテキストから必要な情報を検索できる実験機能も導入されました。これはAIエージェントにとって「一度の操作が上手になった」だけでなく、何十分・何時間という作業を継続する能力が改善したことを意味します。

🎮 Blenderで家を作り、UE5へ移して「歩ける世界」にする
Astraの進化が分かりやすいのがクリエイティブ分野です。OpenAIは、AstraがBlenderを操作して3Dモデルを制作するだけでなく、作った住宅をUnreal Engine 5へ持ち込み、実際にプレイヤーが歩き回れる空間へ仕上げるデモを公開しています。重要なのは、これは「3Dモデル生成AIが完成画像を出した」という話ではないことです。Blenderやゲームエンジンという既存の制作環境の中へAIが入り、オブジェクトを配置し、視覚的な結果を確認しながら制作工程を進めています。AIの役割がコンテンツ生成からDCCツールやゲームエンジンを扱う“AIオペレーター”へ広がったと考えると、この変化の大きさが分かります。
ゲーム開発企業PlaycoもAstraを試験し、従来モデルと比べて手作業による修正が50%減少したと報告しています。同社のAI開発環境「Playbot」ではUnityやGodotと直接接続し、AIがシーンを編集するだけでなく、ゲームを実際にプレイしてテストし、変更が機能したかを検証して再修正できます。1つの簡素なグレーボックスからテーマの異なる3種類のゲームプロトタイプを作る実験では、多くが最初の生成から動作したとされています。ここで必要なのはコード生成能力だけではなく、「このオブジェクトはここに置くべき」「UIが画面内に収まっているか」「操作したときにゲームとして成立しているか」といった空間認識・視覚理解・操作・検証を循環させる能力です。
Astraが想定するPC作業を整理すると、用途の広さが見えてきます。
- 🧑💻 開発:コード作成 → アプリ起動 → テスト → バグ修正
- 🎨 3D制作:Blenderなどを操作してモデルやシーンを構築
- 🎮 ゲーム制作:ゲームエンジン上で編集 → プレイ → 動作確認
- 📊 オフィス業務:Excelなどを使ったデータ処理や資料作成
- 🌐 Web作業:ブラウジング、フォーム入力、調査、サイト制作
- 🔬 研究:専門ソフトを操作しながらデータを調査・分析

🧩 ARC-AGI-3で99.9%、ただし「AGIを達成した」という意味ではない
特に衝撃的なのが、未知の環境へ適応する能力を測る「ARC-AGI-3」の結果です。ARC-AGI-3ではAIにルールを事前説明せず、初めて見る抽象的なターン制環境を操作させます。AIは試行錯誤しながら「何をすれば状態が変わるのか」「何がゴールなのか」を推測し、世界のルールをモデル化して攻略しなければなりません。AstraはOpenAI独自のコンテキスト管理を利用できる「Provider Adapter harness」のHigh設定で**99.95%(丸めて99.9%)**を記録しました。さらにMax設定では、クリアしたステージの96%で人間の中央値より少ない操作数を実現し、平均操作回数も人間基準より51.7%少なかったとARC Prize Foundationは報告しています。
ただし、「AstraがARC-AGI-3で99.9%=人間並みの汎用知能が完成した」と解釈するのは早計です。各社を同じ条件で比較するProvider-neutralな「Standard harness」では最高**62.7%**で、99.9%はOpenAI側のコンテキスト管理によって推論状態をリクエスト間で保持できる別条件です。ARC Prize自身も、ARC-AGI-3を飽和させてもAGI達成の証明にはならないと明記しています。一方で興味深いのは、Astraが未知のゲームを単純な総当たりで攻略するのではなく、ルールを記号化して内部的な「世界モデル」を構築したことです。外部ツールを許可した別実験では、迷路解析や戦闘、移動する敵を予測する専用プログラムまで自ら作成しました。未知の問題を観察 → 仮説を立てる → 道具を作る → 検証するという行動が強くなっている点こそ、99.9%という数字以上に注目すべき部分です。

🛡️ ExploitBenchは100%、サイバー能力は初の「Critical」水準へ
能力向上の裏側で、Astraは新しい安全上の問題も生み出しています。既知の脆弱性から実際に攻撃可能なコードを構築できるかを評価するExploitBenchでは100%を記録し、OpenAIはAstraをPreparedness Framework上でサイバー能力が初めて「Critical」水準に達したモデルと認定しました。さらに既知問題を暗記していた可能性を排除するため、2026年6~8月に公開された比較的新しい脆弱性を使った評価も実施。そこでAstraはGPT-5.6 Solを大幅に上回り、評価中にはそれまで知られていなかった2件のゼロデイ脆弱性を発見し、実際のエクスプロイトチェーンに利用したとOpenAIは報告しています。強化されたAIエージェントは、守る側にとって脆弱性発見を自動化する強力な道具になる一方、同じ能力が悪用される可能性もあるため、OpenAIは高リスクなサイバー要求への制限や内部モデルの隔離、監視などを強化しています。

さらに実用面では、Astraは105万トークンのコンテキストウィンドウと最大12万8000トークンの出力に対応し、API価格はStandardで入力100万トークン当たり10ドル、出力50ドルです。2026年9月19日時点では、GPT-6 Astraを基盤とする「GPT-6 Pro」がPro、Business、Enterprise向けに提供され、PlusユーザーもChatGPT WorkとCodexでAstraを利用できます。APIでもgpt-6-astraとして提供されており、Microsoft AzureとAmazon Bedrockへの展開も発表されています。つまりAstraは研究用デモにとどまらず、すでに「AIにPC上の仕事を委任する」ための実製品として展開段階に入っています。

🔎 まとめ:GPT-6 Astraで重要なのは「99.9%」よりPC上で仕事を完結できること
GPT-6 AstraのARC-AGI-3での99.9%やExploitBenchの100%は目を引く数字ですが、実用面でより大きな変化は、推論能力・視覚認識・プログラミング・PC操作を1つのエージェントとして結合したことにあります。Blenderで3Dモデルを作り、ゲームエンジンへ移し、実際に動かして問題を発見し、再び修正する――このような「複数アプリをまたいだ試行錯誤」が安定すれば、人間がAIへ依頼する単位は「文章を書いて」「コードを書いて」から「この仕事を完成させて」へ変わっていきます。一方で、ARC-AGI-3の99.9%は特定のProvider Adapter条件による結果であり、現実世界のあらゆる仕事を99.9%成功させられるという意味ではありません。AstraはAGI達成の証明というより、AIがソフトウェアそのものを使って長時間働く“コンピューターエージェント時代”が本格化したことを示すモデルと見るのが適切でしょう。
📚 参考・出典
OpenAI「GPT-6 Astra: A new generation of intelligence」
OpenAI「Safety overview: GPT-6 Astra」
OpenAI「Path to Astra: critical capabilities and frontier safeguards」
OpenAI「Playco cut manual fixes 50% prototyping games with GPT-6 Astra」
ARC Prize「OpenAI’s GPT-6 Astra on ARC-AGI-3」
ARC Prize「GPT-6 Astra – ARC-AGI Results」
