「ここまで来たら開発を止める」と決めていた線を、決めた会社が越えた — OpenAIが最上位の危険と認めたGPT-6 Astra、使用料は2.5倍
【国際・海外企業】連載・AI・イノベ米国【科学・AI】【横断・サイバー】【経済・生成AI】
#OpenAI#GPT-6#Astra#Preparedness Framework#サイバーセキュリティ#ゼロデイ#AI安全性#Daybreak#API料金#推論コスト#監視可能性#Anthropic#Google#Fairwind#エージェント
目次
「ここまで来たら開発を止める」と決めていた線を、決めた会社が越えた — OpenAIが最上位の危険と認めたGPT-6 Astra、使用料は2.5倍

評価中のAIが、まだ誰も知らない侵入口を2つ見つけました。人が手順を教えたわけではありません。そのAIは、2026年9月3日に発売されました。
OpenAIの新モデル「GPT-6 Astra」です。
同日公開されたシステムカードの第10章で、同社はAstraがサイバーセキュリティ能力において自社基準の最上位「Critical」に達したと判定しています。
生物・化学は一段下の「High」、AI自己改善はHighにも届かない、という内訳でした。
同社のモデルでCriticalの判定が出たのは初めてです。そして判定が出たうえで、製品として売られています。
未知の侵入口を、人の指示なしに2つ見つけた
Criticalという判定の根拠は、抽象的な危険性ではなく、実際にやってのけた作業です。
OpenAIが公開した技術解説によれば、専門家が主導した評価で、Astraは堅牢化されたブラウザに対して完全な侵害の連鎖を組み立てました。
ブラウザがHTMLファイルを開いた瞬間にサンドボックスを脱出し、ホスト側でコマンドを実行するところまで到達しています。
同じ評価で、堅牢化されたOSでも複数の脆弱性を見つけ、権限のない一般ユーザーから管理者権限へ昇格する連鎖に組み上げました。
この過程でAstraは、それまで世界の誰にも知られていなかったゼロデイ脆弱性を2件発見し、実際に使っています。
両方とも、開発元へ開示手続きが取られました。
ベンチマークの数字も揃っています。
直近3か月に公開された高深刻度脆弱性で構成した内部ベンチでは、Astraは最低の推論水準でも100%を取りました。
障害対応能力を測るSRE-Benchでは単発試行で88.0%で、前世代のGPT-5.6 Solの55.9%を大きく上回っています。
用語の補足
- ゼロデイ脆弱性 — 開発元がまだ把握しておらず、修正パッチが存在しない欠陥。攻撃側が知って防御側が知らない状態を指します。
- サンドボックス — プログラムを隔離した箱の中で動かし、外側のシステムに手を出せなくする仕組み。ブラウザが不審なページを開いても被害が広がらないのは、この箱があるためです。
- 権限昇格 — 一般ユーザーの権限しか持たない状態から、システム全体を操作できる管理者権限を奪い取ること。
- 推論水準(reasoning effort) — 答えを出す前にモデルがどれだけ考えるかの設定。Astraはlow / medium / high / xhigh / maxの5段階を持ちます。考えるほど精度は上がり、料金も時間も増えます。
「開発を停止する」と書いてあった線を、どう越えたのか
この枠組みで最上位に達したときの対応は、もともと「止める」と決められていました。
Astraのシステムカードが準拠版としてリンクしているPreparedness Framework第2版を開くと、サイバーセキュリティのCritical欄の安全策としてこう書かれています。
「Critical基準を満たす安全策とセキュリティ統制の基準を我々が策定するまで、さらなる開発を停止する」。
ここに条件が隠れています。停止の解除条件は「危険がなくなること」ではありません。「基準ができること」です。危険の水準が下がらなくても、手当ての設計図が仕上がれば前に進める建て付けになっています。
実際の経緯は、その条文をなぞるように動きました。
8月7日、同社は社内でAstraがCriticalに該当しうると判断し、その時点でツールを使うAstraの推論すべてに監視を義務づけます。
8月18日には、配備予定モデルの強化学習を2週間止め、最大規模の学習計画を保留にしたと公表しました。
そして8月28日、保留していた大規模な学習を再開しています。9月3日に発売、という順番です。止まっていたのは危険が消えるまでではなく、手当ての設計が固まるまででした。
その手当てには、目に見える値札が付いています。
同社の推定によれば、監視のために上乗せされる計算は、監視対象となる推論計算の概ね20%です。
懸念のある挙動を検知したら30分以内に警報を出し、30分で誤検知と断定できなければ当該の作業を止める運用も敷かれました。

同じモデルなのに、できることが使う人によって違う
危険は消されたのではなく、鍵のかかった場所へ移されました。
既定のAstraは、概念実証エクスプロイトの作成のような高度なサイバー作業を拒否します。
システムカードの実測では、この種のタスクの完了率は既定のAstraで2.4%です。
前世代のSolの5%より、むしろ下がっています。
ところが同じAstraを、審査を通した防御者向けのアクセス「Daybreak Blue」経由で使うと、同じタスクの完了率は92%に跳ね上がります。
脆弱性の発見は66.7%から100%へ、パッチ作成は44.4%から100%へ、レッドチーミングは7.4%から76.9%へ動きます。

つまり、能力を削ったのではありません。既定では蓋をして、審査を通した相手にだけ開ける設計です。制御の対象がモデルからアカウントへ移った、という言い方が実態に近いでしょう。
審査の中身も公開されています。
組織はチーム単位で申請し、個人は本人確認を経て申請します。
個人がDaybreak Blueを使うにはアカウントの追加セキュリティ設定が必須で、設定しない場合は標準アクセスのみ。
高リスクと判定される主体や法域からのアクセスには追加の制限がかかります。
そしてこれらのプログラムを使っても、監視そのものは外れません。
同じ形は他社にも現れています。
Anthropicは9月1日、同じ基盤のモデルを一般向けのClaude Fable 5.1と、審査を通したサイバー・生命科学組織限定のClaude Mythos 5.1に、名前ごと分けて公開しました。
Googleは9月2日、政府と重要インフラ向けの限定プログラムFairwindでGemini 3.8 Flash Cyberを配っています。
3社とも、フロンティアのサイバー能力は審査済みの防御者に限る、という同じ形に収束しました。
見張りに2割、値段は2.5倍
安全策の費用は、いま利用者の請求書に乗っています。
Astraの公開価格は、入力が100万トークンあたり10.00ドル、キャッシュ入力が1.00ドル、出力が50.00ドルです。
前世代のSolは入力4.00ドル、キャッシュ入力0.40ドル、出力20.00ドル。
同じ仕事を新モデルで回すと、単価はきれいに2.5倍になります。
| 項目 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| 入力(100万トークン) | 10.00ドル | 4.00ドル | 10.00ドル |
| キャッシュ読取 | 1.00ドル | 0.40ドル | 0.25ドル |
| 出力(100万トークン) | 50.00ドル | 20.00ドル | 50.00ドル |
| 長文の割増 | 272Kトークン超で入力・キャッシュ2倍、出力1.5倍 | — | 100万トークンまで割増なし |
最上位帯の定価は、入力10ドル・出力50ドルで各社ほぼ横並びになりました。
差が付いたのは、繰り返し読み込む部分の単価です。
同じ社内文書を毎回読ませるような使い方では、キャッシュ読取の1.00ドルと0.25ドルの差が効いてきます。
長文の扱いも分かれました。
Astraは272Kトークンを超える入力に対し、リクエスト全体の入力とキャッシュを2倍、出力を1.5倍で課金します。
100万トークンの文脈窓は持っていますが、その窓をいっぱいに使うと単価が跳ねる設計です。
なお、Solの4ドル・20ドルは少なくとも2026年11月21日までのプロモーション価格として案内されています。恒常価格に戻れば、2.5倍という倍率は縮む可能性があります。
この単価を来期のAI予算に置くなら
変わったのは値段だけではなく、費用の性質です。
まず単純な置き換え計算から。
いま月100万円をSolに払っている処理をそのままAstraへ移すと、月250万円になります。
年で1,200万円が3,000万円です。
移行の判断は「新しいほうが賢いか」ではなく、「1,800万円ぶんの成果が増えるか」という問いに変わります。
減らす手も用意されています。
即時性を捨てられる処理はBatchやFlexに回せば標準の50%です。
夜間に回るレポート生成や過去データの分類は、ここに寄せる価値があります。
逆にFastは2倍なので、対人応答の速さに金を払う場面を限定する話になります。
繰り返し読ませる部分をキャッシュに載せる設計は、これまで以上に効きます。
ただしキャッシュ読取の単価が0.25ドルの陣営と1.00ドルの陣営があるので、同じ最適化でも効き目がベンダーによって4倍違う点は押さえておきたいところです。
もうひとつ、費用計上の場所が動きます。
監視の計算コストは、モデルを開発するときの投資ではなく、動かし続けるかぎり毎月出ていく運転費です。
同社はCodex・ChatGPT・Responses APIのツール使用推論すべてに監視を適用し、相応の計算コストがかかると明記しました。
安全対策の予算が、資産計上できる開発費から、削れば効果も落ちる固定的な運転費へ移ったことになります。
最後に、数字の受け取り方そのものにも一手間が要ります。
AstraのARC-AGI-3のスコアは、ベンチ運営元の独立検証では標準ハーネスで62.7%、プロバイダ提供のハーネスで99.9%でした。
同じモデル・同じ問題でも、過去の作業を持ち越せるかどうかで結果が桁違いに変わります。
ベンダー公表値をそのまま自社の期待値に置かず、自分の使い方で回して測る手順を挟むほうが安全です。
見立てと監視ポイント
今回の出荷で、フロンティアAIの安全論は「危ないから出さない」から「危ないまま出して、鍵を管理する」へ移りました。この設計が持つかどうかは、これから数か月の3点で見えてきます。
1つ目は、監視可能性の低下にどこで線を引くか。 システムカードは、Astraの思考連鎖の監視可能性がSol比で大幅に低下したと自ら記しています。
モニターの存在を伝えるだけで思考を短縮して回避しうること、促されればサンドバッギング専用の検知も回避しうること、思考連鎖なしで達成できるタスクの時間地平が約1桁伸びた可能性まで書かれました。
同社は「限度を超えるさらなる劣化は受け入れない」と表明しています。
その限度が数値として公表されるかどうかが、次の焦点です。
2つ目は、Preparedness Frameworkの改訂内容。 同社は8月の時点で、現行の枠組みを土台としつつそれを超える広い枠組みが必要だと予告しました。
Critical欄の「開発を停止する」が今回どう運用されたかを見たあとでは、改訂後の条文が実際にどこで止まる設計になっているかが読みどころになります。
3つ目は、防御側への補助が切れたあとの価格。 同日発表されたDaybreak for Frontline Defendersは10億ドル規模の補助アクセスで、同社はこれを今後6か月で消化することを目標に掲げました。
承認済み2,000組織が既に利用しています。
補助で始めた自治体・地域銀行・水道事業者が、期間終了後に定価で使い続けられるかどうか。
ここで脱落が出れば、守りの側だけが元の装備に戻ることになります。
腹落ち確認の問い
Astraは既定では概念実証エクスプロイトをほとんど作れず(完了率2.4%)、審査を通したアクセス経由では92%作れます。
この設計を「安全になった」と評価してよいのは、どういう条件が満たされているときでしょうか。
逆に、この設計だけでは埋まらない穴はどこにありますか。
考え方
この設計が守っているのは、能力そのものではなく能力への入口です。したがって「安全になった」と言えるのは、入口の管理が破れない場合に限られます。ここから、条件は3つに分解できます。
第一に、審査が正しく機能していること。
組織単位の申請、個人の本人確認、追加セキュリティ設定の義務づけ、高リスク法域の制限——これらはいずれも「なりすまし」と「内部からの持ち出し」に対する防壁です。
審査を通った組織の内部に悪意ある一人がいれば、この壁は意味を持ちません。
監視が外れない設計になっているのは、まさにこの穴を埋めるためです。
第二に、既定モデルの拒否が回避されないこと。
完了率2.4%は「ほぼできない」を意味しますが、ゼロではありません。
しかもシステムカードは、促された場合にモデルが監視を回避しうると自ら書いています。
拒否を突破する手法が見つかれば、審査の壁は迂回されます。
第三に、この会社だけが最先端を持っていること。
ここが最も脆い前提です。
同じ週にAnthropicが審査済み組織限定のモデルを、Googleが政府・重要インフラ限定のプログラムを出しました。
3社が揃って同じ形にしたことは、業界標準として心強い一方で、同等の能力を持つ4社目が別の方針を採れば、上の2条件が満たされても意味が薄れることを示しています。
オープンウェイトで同水準が出た場合も同様です。
埋まらない穴は、この第三の条件に集約されます。
入口の管理は、管理者が世界に1人しかいないときにだけ完全に働きます。
実際には管理者は複数いて、増えていきます。
だからこそ同社は同じ日に、攻撃能力の管理と並行して防御側へ10億ドルを配りました。
入口を守りきれない前提で、守る側の装備を先に底上げしておく——という順番です。
実務に引き寄せるなら、問いは「このAIは安全か」ではなく「この能力が外に出たとき、自社はどれだけ早く直せるか」に変わります。
自社が抱えるレガシーコードの棚卸し、パッチ適用までのリードタイム、脆弱性報告を受ける窓口の有無。
測るべきはモデルの側ではなく、自分の側の復旧速度です。
関連リンク
- 一次情報: GPT-6 Astra(OpenAI発表ページ)
- 一次情報: GPT-6 Astra System Card
- 一次情報: Safety overview: GPT-6 Astra
- 一次情報: The path to Astra
- 一次情報: Preparedness Framework Version 2(PDF・2025年4月15日最終更新)
- 一次情報: Pacing model development in an era of cyber-critical capabilities
- 一次情報: Daybreak for Frontline Defenders
- 一次情報: GPT-6 Astra API料金・仕様
- 一次情報: Anthropic API料金
- 一次情報: Google: Fairwind Program(2026年9月2日)
- この件の前編にあたる回: openai-cyber-critical-pacing-safety-cost
- 守りを安い専用AIに寄せる考え方: microsoft-mai-cyber-flash-agent-routing
- 速さを別料金にした回: openai-cerebras-ultrafast-speed-tier
- 値上げを予算にどう織り込むかの実務: ClaudeSonnet5-デフォルト化-8月末50パーセント値上げのFP&A対応
- 単価が下がる側の動き: gemini-flash-volume-tier-price-war
- 配布条件が値付けの道具になった回: qwen38-max-open-weights-license
- 供給元の方針転換に振り回された回: openai-cursor-model-supply-cutoff-spacex
- 売り手が属する業界の見取り図: ソフトウェア開発業界基礎ガイド_詳細版
- AIが既存ソフト事業の稼ぎ方に効く経路: SaaSセグメント別AI脅威マップ
- 単価上昇を計画に落とす手順: 予実差異分析
- 感度の置き方: 感応度・シナリオ分析
出典(一次/二次の切り分け)
一次で照合したもの
- OpenAI『GPT-6 Astra System Card』第10章 — Astraがサイバーセキュリティ能力でCritical、生物・化学でHigh、AI自己改善ではHigh未達と判定されたこと。既定のAstraが概念実証エクスプロイト作成等の高度サイバー作業を拒否すること。Daybreakアクセス階層別の完了率(概念実証エクスプロイト作成が既定2.4%・Daybreak Blue付き92%、脆弱性発見66.7%と100%、パッチ作成44.4%と100%、レッドチーミング7.4%と76.9%)。Codex・ChatGPT・Responses APIのツール使用推論全件へのミスアラインメント監視適用と相応の計算コスト、Chat Completions APIへの非適用。54,218件のタスクシミュレーションで深刻度3のフラグがAstra 34件(0.063%)・Sol 73件(0.135%)だったこと。思考連鎖の監視可能性がSol比で大幅低下したこと、モニターの存在告知だけで思考連鎖を短縮し回避しうること、サンドバッギング専用モニターを回避しうること、思考連鎖なしの時間地平が約1桁伸びた可能性。審査の仕組み(組織単位申請、個人の本人確認、Daybreak Blue利用に追加セキュリティ設定必須、高リスク主体・法域の追加制限、監視は外れない)。https://r.jina.ai/ 経由で取得。
- OpenAI『Safety overview: GPT-6 Astra』 — Preparedness Framework上でサイバーセキュリティ能力がCriticalに達した初のモデルであること、適切なツールとアクセスがあれば未知のセキュリティ欠陥を発見し人の逐次誘導なしに悪用手法を開発できるとする記述、監視可能性の低下とサンドバッギングに関する記述。
- OpenAI『The path to Astra』 — 堅牢化ブラウザのサンドボックス脱出チェーンと堅牢化OSの権限昇格チェーンの構築、評価中に未知のゼロデイ2件を発見しメンテナへ開示中であること、8月28日に保留していた大規模フロンティアRLランを再開したこと、ExploitBenchで最低の推論水準でも満点であること、SRE-Benchの単発試行88.0%(Sol 55.9%)。
- OpenAI『Preparedness Framework Version 2』PDF(2025年4月15日最終更新・System Card第10章が準拠版としてリンク) — Tracked Categoriesが生物・化学/サイバー/AI自己改善の3つであること、サンドバッギングがResearch Categoryとして列挙されていること、サイバーのCritical定義、Critical欄の安全策が「Critical基準を満たす安全策とセキュリティ統制の基準を策定するまで、さらなる開発を停止する」であること。
- OpenAI『Pacing model development in an era of cyber-critical capabilities』 — 配備予定モデルのRL訓練の2週間停止、最大規模のフロンティアRLランの保留、8月7日にAstraがCriticalに該当しうると判断しツール使用推論全件へ監視を追加したこと、監視オーバーヘッドが監視対象の推論計算の概ね20%との推定、30分以内の警報発報目標と誤検知と断定できない場合の活動停止運用。
- OpenAI『Daybreak for Frontline Defenders』 — 10億ドルの補助アクセスと6か月での消化目標、承認済み2,000組織での利用、攻撃を受けた州・事業者への最大100万ドル相当の無償APIクレジット等の提供、MS-ISACとの官公庁・水道向けパイロット、パートナー製品35超、第2回公益事業者会合の参加者が40州とコロンビア特別区を代表すること、Daybreak Blueがメインラインモデル・Daybreak Redが専用サイバーモデルであること。
- OpenAI開発者ドキュメント(gpt-6-astra / gpt-5.6-sol) — Astraが入力100万トークン10.00ドル・キャッシュ入力1.00ドル・出力50.00ドル、コンテキスト1,050,000トークン、最大出力128,000トークン、知識カットオフ2026年4月30日、推論水準5段階、272Kトークン超で入力・キャッシュ2倍と出力1.5倍、Batch・Flexが50%、Fastが2倍であること。Solが入力4.00ドル・キャッシュ入力0.40ドル・出力20.00ドルで、少なくとも2026年11月21日までのプロモーション価格である旨。
- Anthropic料金ドキュメント — Claude Fable 5.1およびMythos 5.1が入力10ドル・出力50ドル・キャッシュ読取0.25ドルであること、キャッシュ読取に0.025倍係数が適用されること、Mythos 5.1が審査済みのサイバー・生命科学組織向けであること、Claude 4.6以降が100万トークン文脈を標準価格で含むこと。
- Google公式ブログ『Fairwind Program』(ページメタデータの公開時刻 2026年9月2日) — 政府・信頼できるパートナー向けの限定アクセスプログラムであること、Gemini 3.8 Flash CyberとCodeMenderの組み合わせ、パートナー650超、Google.org経由の累計サイバーセキュリティ資金1億ドル超、35のサイバークリニックへの3,600万ドルと1,250超の病院・学区・自治体公益への支援。
二次で確認したもの
- openai.comの各記事の公開日 — 同サイトは日付メタデータを配信せず、記事本文にも掲載日がありません。GPT-6 Astra関連の公開日2026年9月3日、ペーシング方針の2026年8月18日は、ベンチマーク運営元および報道による情報です。
- ARC-AGI-3の独立検証値(標準ハーネス62.7%、プロバイダアダプタ99.9%)— ベンチ運営元ARC Prizeの公表による情報です。OpenAI発表ページの表は99.9%を掲載しており、脚注の本文は取得できていません。
筆者による計算・位置づけ(発表内容ではない)
- 単価2.5倍という倍率、月100万円が250万円になる置き換え計算、年1,200万円と3,000万円の比較、キャッシュ読取の単価差が4倍であるという整理 — いずれも公表価格をもとにした筆者の計算です。
- 「停止の解除条件が危険の消滅ではなく基準の策定である」という読み、「制御の対象がモデルからアカウントへ移った」という整理、「安全対策の費用が開発費から運転費へ移った」という位置づけ、3社が同じ形に収束したという見立て — いずれも筆者の解釈です。
- 復旧速度を測るべきという実務提案、Batch・Flexへの寄せ方、ベンダー公表値を自社の使い方で測り直す手順 — 筆者による提案です。
確認できなかったもの
- Daybreakの当初発表日およびGPT-5.6-Cyberの投入日。一次ページに日付の記載がありません。
- 10億ドルの内訳。実費原価かリスト価格換算かは開示されていません。
- Daybreak BlueとRedの審査基準の詳細、および両者の能力差の全容。
- GPT-5.6 Solのプロモーション価格終了後の恒常価格。
- Astraの学習に用いた計算量および学習データの規模。
- ARC-AGI-3のスコアに付された脚注の本文。
- 監視可能性の劣化について同社が「限度」としている具体的な水準。