本文へ移動
技術を、自社の仕事に。
判断と実行を助けるメディア

記事を検索

安い新モデルが出ても、請求額は自動では下がらない

目次 · 6項目

去年組み込んだAI機能の利用料が、毎月ほぼ同じ額で請求されてくる。その間にも、OpenAIやAnthropicは前の世代より単価の安いモデルを出しています。

ただ、安くなったのが新しいモデルの単価なら、使うモデルを切り替えない限り、請求額は変わりません。動いているものを触りたくない事情はあっても、触らない限り金額は動きません。

9月22日、2社が単価の安い新モデルを出した

2026年9月22日、OpenAIはGPT-6 SolとGPT-6 LunaをAPIで公開しました。Solは複雑なコーディングやエージェント型の処理向け、Lunaは量の多い処理向けの、同社で最も効率のよいモデルと説明されています。同じ日にAnthropicはClaude Opus 5.5を公開し、Opus 5より出力が30%以上速いとしています。

APIの標準料金(100万トークンあたり、米ドル)を、名前が対応する従来のモデルと並べると次のとおりです。

新しいモデル入力/出力従来のモデル
GPT-6 Sol$2 / $10GPT-5.6 Sol: $4 / $20
GPT-6 Luna$0.10 / $0.50GPT-5.6 Luna: $0.20 / $1.20
Claude Opus 5.5$4 / $20Claude Opus 5: $5 / $25

GPT-6 SolはGPT-5.6 Solの半額、GPT-6 Lunaは入力が半額で、出力は約58%安くなります。Opus 5.5は入力・出力ともOpus 5より20%安く、キャッシュからの読み出しは$0.50から$0.20へ60%下がりました。なお、GPT-5.6 Solの$4・$20はプロモーション価格で、OpenAIは少なくとも2026年11月21日まで提供するとしています。両社とも、結果を急がないバッチ処理は標準料金の半額です。

OpenAIは同じ日に、GPT-6でのプロンプトキャッシュの改善を紹介する記事も公開しました。概要では、キャッシュが当たる割合の向上、診断の仕組み、区切り位置の明示的な指定などを挙げています。開発者向けの資料では、区切り位置の指定と診断の仕組みは、GPT-5.6以降のモデルで使えると案内されています。

ここで押さえたいのは、安くなったのが新しいモデルの単価だという点です。9月22日に、GPT-5.6 SolやOpus 5の単価は変わっていません。既存のモデルそのものが値下げされた場合(OpenAIの7月30日のGPT-5.6 Luna・Terra、8月21日のGPT-5.6 Sol)は、そのモデルを従量課金で使っていれば請求に反映されます。契約の形によって反映されないことがある点は、AI機能の見積もりは半年で古くなるで扱いました。今回のような新しいモデルは、自社のシステムが指定を切り替えるまで、請求に届きません。

下がった分が届かない3つの理由

請求額が変わらないとき、まず確かめたいのは次の3つです。

状態起きていること
モデル名を固定している動作確認をしたモデルを指定し続けている。新しいモデルが出ても、指定を変えるまで切り替わらない
キャッシュが効いていない毎回同じ前置きを送っているのに、キャッシュの対象になる形で送っていない
すべての処理を大きいモデルで回している分類や整形のような軽い処理まで、高性能なモデルが処理している

1行目は、動作確認を通したモデル名をコードや設定ファイルに書いたまま、触っていない状態です。新しいモデルに替えるには指定を書き換える必要があり、しかも書き換えだけで済むとは限りません(後述)。

2行目は、社内文書や指示文を毎回先頭に付けている処理で効いてきます。先頭から同じ内容が続く部分をキャッシュから読み出すと、単価は通常の入力の1割以下になります(GPT-6 Solは$2に対して$0.20、Opus 5.5は$4に対して$0.20)。ただし、日時や利用者名のように毎回変わる内容を先頭に置くと一致しません。また、キャッシュへの書き込みは通常の入力より高く(OpenAIのGPT-5.6以降と、Opus 5.5の5分間のキャッシュで1.25倍)、再利用されない前置きまで保存すると、かえって高くつきます。効いているかどうかは、実際の利用状況の明細で確認します。

3行目は、設計時に「とりあえず一番いいモデルで」と決めたままの構成です。処理の種類ごとにモデルを分けられるかは、作りによります。

見直す順番

安い順ではなく、戻しやすい順に手を付けます。

AI機能の費用を見直す順番を、請求明細を処理の種類ごとに割る、量の多い処理を1つ選ぶ、その処理だけモデルを切り替えて比較する、キャッシュの効き方を明細で確認する、の4段で示した編集部の概念図。実際の請求データではない

  1. 直近3か月の請求の明細を、処理の種類ごとに割る。 どの機能がいくら使っているかが出ないと、どこを直せばいいかが決まりません。「全部まとめて1行」しか出ないなら、まず計測を足す作業が先です。OpenAIの利用状況の画面は、2026年8月からAPIキーごとに絞り込めるようになりました。機能ごとにキーを分けておくと、この作業が楽になります。
  2. 量の多い処理を1つ選ぶ。 全体の金額ではなく、回数の多いものから見ます。1回あたりが安くても、回数が多い処理のほうが効きます。
  3. その処理だけ、モデルを切り替えて比較する。 出力の質が落ちないかを、本番で流れている種類の入力で確認します。新しいモデルは、指定を書き換えるだけで同じように動くとは限りません。Opus 5.5では、Opus 5で使えた思考(thinking)の無効化や、特定のツールを必ず呼ばせる指定がエラーになります。GPT-6 SolとLunaは、Chat Completions APIで関数呼び出しを使うには、推論の設定を「none」にする必要があります。
  4. キャッシュの効き方を明細で確認する。 設定したつもりでも効いていないことがあります。OpenAIには、キャッシュが当たった割合と、読み出し・書き込み・キャッシュなしの内訳を見られる画面があります。

単価の比率が、そのまま請求の比率になるわけでもありません。Anthropicは、Opus 5.5の「Opus 5より40%安い」は、1つの作業に使うトークンが減る分も含めた典型的な作業での見積もりで、トークン単価が40%下がったわけではないと説明しています。Opus 5.5は必ず考えてから答えるため、作業によっては使うトークンが増えることもあり、自分の作業で測るよう勧めています。3番目の比較で、1件あたりの費用まで見ておく理由です。

モデルを選び直すときの考え方は、開発でどのモデルに任せるかの決め方に整理しています。用途に対して過剰な性能を選んでいないかを、ここで見ます。

切り替えられる作りになっているか

見直しを始めると、別の問題が見えることがあります。モデル名がコードの複数箇所に散らばっていて、切り替えるだけで改修になる状態です。

こうなっていると、次に安いモデルが出たときも同じ作業が発生します。接続の窓口を1か所にまとめて差し替えやすくするかどうかの判断は、社内AIにゲートウェイを1枚挟むかで扱いました。

使いすぎたときに止まる仕組みも、切り替えとあわせて確認しておく価値があります。上限を設ける考え方はAIの利用料に上限を設けるにまとめています。単価が下がると、同じ予算でより多く動かせてしまうため、上限の意味はむしろ増えます。

今月やること

まず、いま動いているAI機能で、どのモデル名を指定しているかを一覧にしてください。作った本人がいない機能ほど、ここで時間がかかります。時間がかかること自体が、切り替えにくい作りになっているという情報です。

一覧が出たら、そのうち回数がいちばん多い処理を1つだけ選んで、比較を試します。全部を一度に見直すより、1つの処理から始めるほうが、結果を確かめやすくなります。

2026年9月28日に、OpenAIの開発者向けドキュメント(変更履歴、料金、各モデルのページ、プロンプトキャッシュのガイド)と、Anthropicの発表ページ、料金ページ、Opus 5.5の変更点の文書、費用の解説記事を直接開き、単価・公開日・キャッシュとバッチの料金・切り替え時の変更点を確認しました。OpenAIの発表記事2本(GPT-6 Sol・Luna、GPT-6のプロンプトキャッシュ)は、この環境から本文を開けず、タイトルと概要だけを確認しています。モデルを切り替えた場合の費用と品質の比較は実施していません。料金は変わるため、見積もりの前に各社の料金ページで確認してください。本記事は見直しの順番の整理です。

AI機能の運用費の見直しや、モデルを差し替えられる構成への作り替えは、グリームハブへご相談ください。

Sources

この記事を共有XFacebook
鈴木 翔

技術の可能性に魅了され、学生時代からプログラミングとデジタルアートの分野に深い関心を持つ

この記事のテーマを、自社の次の一歩へ

AIを任せる仕事から、一緒に考える。

いまの業務と使うデータを整理し、AIに任せる範囲、人が確認すること、試し方を考えます。

  • 対象にする業務
  • 利用するデータ
  • 効果の確かめ方
業務でのAI活用を相談する

構想段階からご相談いただけます。この記事の情報を相談フォームに引き継ぎます。

最新記事をメールで受け取る