📚 業界ノート

「AIが4割安くなります」には但し書きがある — 同じ日に値下げしたAnthropicとOpenAI、請求書を決めるのは「読み返し」の料金

深堀AI・イノベ2026-09-23

【国際・海外企業】連載・AI・イノベ米国【科学・AI】【経済・生成AI】

#Anthropic#OpenAI#ClaudeOpus55#GPT-6#プロンプトキャッシュ#API価格#推論コスト#AI予算

目次
  1. 同じ日に、2社が値段を下げた
  2. 「4割」と「2割」が同居する理由
  3. 半分がキャッシュでなければ、4割には届かない
  4. 上位モデルの値段は、3週間で逆方向へ動いた
  5. 見立てと監視ポイント
  6. 腹落ち確認の問い
  7. もっと詳しく知りたい人へ

「AIが4割安くなります」には但し書きがある — 同じ日に値下げしたAnthropicとOpenAI、請求書を決めるのは「読み返し」の料金

値下げが4割効く条件と2割しか効かない条件を、料金の内訳から示した概要図

AIの使用料が下がるという発表が、2026年9月22日に2つ重なりました。
片方には「典型的な使い方なら4割安くなる」と書いてあります。
ただし、同じページに載っている価格表をそのまま並べると、下がっているのはほとんどの項目で2割です。
この2つの数字は矛盾していません。
そして、どちらが自分の請求書に当てはまるかは、使い方で決まります。

同じ日に、2社が値段を下げた

Anthropicは2026年9月22日、新しい上位モデル「Claude Opus 5.5」を公開しました。
同社の説明では、新しいClaude 5.5ファミリーの最初のモデルで、AWS・Google Cloud・Microsoft Azureと自社のプラットフォームで使えます。

価格は100万トークン単位で示されます(トークンは、AIが文章を扱うときの最小の単位です。おおまかに言えば、英語なら単語1つが1〜2個、日本語なら文字1つが1〜2個にあたります)。
旧モデルからの変化は次のとおりです。

料金の項目 旧 Claude Opus 5 新 Claude Opus 5.5 下げ幅
入力 5ドル 4ドル 20%
出力 25ドル 20ドル 20%
キャッシュ読み込み 0.50ドル 0.20ドル 60%
キャッシュ書き込み 6.25ドル 5ドル 20%

そのうえで同社は、典型的なワークロード(仕事のひとまとまり)なら40%低いコストで動くと書いています。出力が出てくる速さも30%以上上がったとしています。

同じ日、OpenAIも新しいモデルを2つ出しました。
複雑な作業向けの「GPT-6 Sol」と、量の多い定型作業向けの「GPT-6 Luna」です。
価格は100万トークンあたり、Solが入力2ドル・出力10ドル、Lunaが入力0.10ドル・出力0.50ドル。
前の世代の同じ位置づけのモデルからおおむね半額になりました。

値下げの理由としてOpenAIが挙げた一文が、この日の性格をよく表しています。
「キャッシュと推論の改善によって、これらのモデルをより低いコストで提供できるようになった。その分をそのまま利用者と顧客に還元する」。
2社が同じ日に、同じ理由を挙げています。

「4割」と「2割」が同居する理由

キャッシュという言葉が、この話の中心にあります。

AIに仕事を頼むとき、毎回ほぼ同じ前置きを送ることになります。
社内規程の全文、設計書、長い会話の履歴、ツールの説明書。
AIは記憶を持たないので、こうした前置きを毎回まるごと読み直します。
そのたびに、入力トークンとして料金が発生します。

プロンプトキャッシュは、この無駄をなくす仕組みです。
一度送った前置きを提供者側に預けておき、次からは「あれをもう一度読んで」と指示するだけで済ませます。
預けるときに少し割高な料金(キャッシュ書き込み)を払い、読み返すときは大幅に安い料金(キャッシュ読み込み)で済みます。

Claude Opus 5.5では、その読み返しの料金が0.50ドルから0.20ドルへ、60%下がりました。
いっぽう、ふつうの入力・出力・書き込みはそろって20%です。
値下げが均等ではなく、読み返しの部分に大きく偏っている——これが「4割」と「2割」が同居する理由です。

半分がキャッシュでなければ、4割には届かない

では、どういう使い方なら4割になるのでしょうか。公表価格から計算できます。

旧料金での請求額を、「キャッシュ読み込み」と「それ以外」の2つに分けます。
読み込みは6割引き、それ以外は2割引きです。
全体の下げ幅が4割になるには、旧請求額のうち読み込みがちょうど半分を占めている必要があります(0.2×0.5+0.6×0.5=0.4)。

この割合が変われば、結果も変わります。

つまり「40%安くなる」という表現は、請求書の半分がキャッシュの読み返しで占められているような使い方——長い前置きを何度も読み返す、エージェント型の連続作業——を前提にした数字です。
1回きりの質問応答や、毎回内容の違う短い文章の処理を中心にしている場合、実際に減るのは2割前後にとどまります。

来期のAI費用を計画に置くなら、順番はこうなります。
まず自社の請求明細を、入力・出力・キャッシュ書き込み・キャッシュ読み込みの4つに割ってみる。
読み込みの割合が半分に届いていなければ、削減幅は2割台で見込む。
そのうえで、前置きを固定してキャッシュに載せられる作業がどれだけあるかを洗い出す。
値下げの恩恵は自動的には来ず、呼び出し方の設計を変えた分だけ入ってくるからです。

料金の内訳しだいで値下げの効き目が20%から40%まで変わることを示す図

上位モデルの値段は、3週間で逆方向へ動いた

もうひとつ、価格の水準そのものが動いています。

OpenAIの最上位モデルGPT-6 Astraは、2026年9月上旬の公開時点で入力10ドル・出力50ドルという値付けでした。
前の世代の主力(GPT-5.6 Sol。当時の販促価格で入力4ドル・出力20ドル、定価は5ドル・30ドル)と比べると、販促価格を基準にして2.5倍です。
最先端の能力には、それに見合う値段がつく——そういう方向の発表でした。

それから3週間足らずで、同じ土俵を争うClaude Opus 5.5が入力4ドル・出力20ドルで出てきました。
上位モデル同士で、入力の単価が10ドルと4ドルに開いたことになります。
読み返しの料金はさらに差が大きく、Astraのキャッシュ入力が1.00ドル、Opus 5.5のキャッシュ読み込みが0.20ドルです。

性能の比較は、慎重に読む必要があります。
Anthropicが公表した表では、Opus 5.5のTerminal-Bench 4.0(端末での自律作業)が66.4%で、Astraの57.9%を上回っています。
知識労働を測るGDPval-AA v2.1でも1846対1542です。
ただし同じ表の中で、業務ワークフローのAutomationBenchはOpus 5.5の40.0%に対しAstraが41.4%、科学研究の自律作業を測るTerminal-Bench-Science 0.1ではOpus 5.5の58.7%に対しAstraが64.6%と、逆転している項目もあります。

そして、この表を作ったのは比較される片方の当事者です。
第三者が独立に測り直した結果ではありません。
自社に有利な項目が選ばれやすい構造は残るので、「どの作業を測った数字か」を見て、自分の用途に近いものだけを拾うのが現実的な読み方になります。

見立てと監視ポイント

この日に起きたのは、モデルの世代交代というより、値下げの出どころが移ったことです。
以前の値下げは、小さくて安いモデルを新しく出すという形を取っていました。
今回は、上位モデルの料金表そのものが下がり、しかも下げ幅が読み返しの部分に集中しています。
提供する側の原価が、生の計算量よりも「同じ文脈を何度も出し入れする処理」に寄ってきていて、そこが改善したぶんを価格に回している、という読み方ができます。

腹落ち確認の問い

ある会社のAI費用は、旧料金のもとで月100万円でした。
内訳は、キャッシュ読み込みが10万円、それ以外(入力・出力・キャッシュ書き込み)が90万円です。
この会社が同じ使い方のまま新料金に切り替えた場合、請求額はいくらになり、発表された「40%安くなる」との差はどこから生まれるでしょうか。

考え方

項目ごとに計算します。
キャッシュ読み込みの10万円は60%引きで4万円。
それ以外の90万円は20%引きで72万円。
合計76万円です。
下がったのは24万円で、率にすると24%にとどまります。
発表の「40%」との差16ポイントは、この会社の請求書に占めるキャッシュ読み込みの割合が10%しかないところから生まれています。
40%が成立するのは読み込みが請求額の半分を占める場合で、そこまで寄っているのは、長い前置きを何度も読み返す連続作業を大量に回している利用者です。
ここから分かることは2つあります。
1つは、値下げの発表を見たら率ではなく自社の内訳に当てはめ直す必要があること。
もう1つは、削減幅が呼び出し方の設計で変わるということです。
同じ仕事でも、前置きを毎回組み直して送れば値下げの恩恵は2割で止まり、前置きを固定してキャッシュに載せれば、単価が下がった部分の比重が上がって恩恵が大きくなります。
価格表は交渉できませんが、請求書の内訳は自分で動かせます。

出典(一次/二次の切り分け)
  • 一次・Anthropic 公式発表(2026年9月22日) — Claude Opus 5.5 の価格(入力100万トークン4ドル・出力20ドル・キャッシュ読み込み0.20ドル・キャッシュ書き込み5ドル)と旧Opus 5の価格(5ドル・25ドル・0.50ドル・6.25ドル)、典型的なワークロードで40%低コスト、出力が30%以上高速、fast modeの8ドル/40ドルと最大2.5倍速、提供チャネル、およびベンチマーク比較表の全スコアを原文で照合しました。
  • 一次・OpenAI 開発者向けドキュメント — GPT-6 Astra の価格(入力10ドル・キャッシュ入力1.00ドル・出力50ドル)、コンテキスト1,050,000トークン、最大出力128,000トークン、知識カットオフ2026年4月30日を確認しました(r.jina.ai 経由で取得)。
  • 二次・TechCrunch(2026年9月22日) — GPT-6 Sol・GPT-6 Luna の投入、5.6世代のSol・Lunaの半額という位置づけ、値下げ理由としてキャッシュと推論の改善が挙げられたこと、GPT-6 Solのミスが前世代比で約半分という主張を確認しました。
  • 二次・The New Stack(2026年9月22日14:00) — GPT-6 Sol が入力2ドル・出力10ドル、GPT-6 Luna が入力0.10ドル・出力0.50ドルであること、OpenAIの「キャッシュと推論の改善で低コストに提供できるようになり、その分をそのまま還元する」という説明を確認しました(r.jina.ai 経由で取得)。
  • 反証1パス — 「40%安い」は全項目が一律に4割下がる意味ではありません。入力・出力・キャッシュ書き込みは20%、キャッシュ読み込みのみ60%で、旧請求額に占める読み込みの割合が約半分でなければ4割には届かないことを公表価格から計算で確かめました(本文の28%・24%などの試算はいずれも公表価格をもとにした筆者の計算です)。ベンチマーク比較表はAnthropic自身が公表・測定したもので第三者検証ではなく、同表内でもAutomationBenchとTerminal-Bench-Science 0.1ではGPT-6 Astraが上回ります。GPT-5.6 Solの価格は定価(入力5ドル・出力30ドル)と販促価格(4ドル・20ドル)の2系統が二次情報に併存するため、本文は比較の起点を4ドル・20ドルとしたうえでその旨を断っています。GPT-6 Lunaは出力が1.20ドルから0.50ドルへ半額を超えて下がっており、「一律半額」という要約は正確ではありません。OpenAIの公式発表ページはURLを特定できず(openai.com/index 配下は403、r.jina.ai 経由でも当該ページに到達できず)、独立二次2媒体で代替しています。

もっと詳しく知りたい人へ