株式会社Elcamy(エルカミー)のロゴ
コラム一覧に戻る
#ビジネス2026.08.10

【2026年8月最新】API課金・料金早見表 ─ OpenAI・Claude・Geminiの最新価格と割引の仕組みが一目でわかる

2026年8月時点の最新価格表や割引メカニズムを整理。トークンの概念やAPIの基本、料金計算の方法、割引の仕組みを解説し、見積精度を高めるためのコツも紹介。


API料金は入力トークンと出力トークンの合計で決まる仕組みと、OpenAI・Anthropic・Googleの3社で単価が異なることを示したデータフロー図 API料金は「入力トークン+出力トークン」の合計で決まり、プロバイダーによって単価が異なる

はじめに

営業の現場では――

「API 料金をその場でざっくり出したい」

「モデルを変えるとコストがどれくらい動くのかイメージできない」

といった声が聞かれることがあります。本記事では、API料金の基本的な仕組みから 最新価格の整理、そして 料金を大幅に下げられる割引メカニズム までまとめます。

この記事でわかること
  • API 料金の基本式(入力+出力)
  • トークンとは? ― 文字数 ≠ トークン数
  • 主要モデルの最新価格表 & 簡易比較(2026年8月時点)
  • 単価が変わる 3 つの仕組み(キャッシュ再利用/長文脈しきい値/バッチ API)
  • 見積精度を高めるコツ & FAQ

APIとは何か

“窓口”としての役割

API(Application Programming Interface)は、サービス同士をつなぐ通信の窓口です。RESTやgRPCなど複数のプロトコルがありますが、本記事の主役はHTTP経由のテキストAPI。リクエストを送れば、モデルが推論しレスポンスとしてテキスト(または画像・JSONなど)を返します。

まず基本:料金は「入力トークン+出力トークン」

合計料金 =(入力トークン数 × 入力単価)+(出力トークン数 × 出力単価)

課金対象説明
入力プロンプトやシステムメッセージなど、モデルに渡すテキスト
出力モデルが生成するレスポンス

⚠️ 単価は固定ではありません。後述の「キャッシュ再利用 / バッチ API」に該当すると最大 90 %引きになるケースもある一方、「長文脈しきい値」を超えると単価が上がるケースもあります。


トークンとは?

文字数とトークン数は異なるという解説と、OpenAI Tokenizer・Google AI Studio・ClaudeのAPIによるトークン数確認方法の違いを示した図 文字数とトークン数の違い、およびOpenAI・Google・Anthropicのトークナイザー確認方法の比較

文字数ではない課金単位

OpenAIやAnthropicの言語モデルは、テキストを細かい断片=トークンで扱います。1トークンは英単語なら≒4文字、日本語では語彙や句読点でばらつきが大きく、同じ100文字でもトークン数は言語で変動します。詳しくはOpenAIのトークナイザー解説が参考になりますOpenAI公式ドキュメント

ざっくり換算

  • 日本語:1トークン ≒ 1.3〜2文字(AIサービスによって差があり、Geminiが最も効率的な傾向)
  • 英語:1トークン ≒ 0.75単語(100トークンで英単語75語程度)

トークナイザー

以下のツールを使用すると、テキストが言語モデルによってどのようにトークン化されるか、およびそのテキスト内のトークンの合計数を把握できます。プロバイダーごとにトークナイザーが異なるため、確認したいモデルに対応するツールを使ってください。

  • OpenAIOpenAI Tokenizerにプロンプトを貼り付けるだけで確認可能
  • Google(Gemini)Google AI Studioのプロンプト入力欄に貼り付けると、入力トークン数が自動表示される
  • Anthropic(Claude):貼り付けるだけの公式Webツールはなく、APIのcount_tokensエンドポイントを呼び出して確認する必要があるAnthropic公式ドキュメント

主要モデルの最新API単価・特徴一覧(2026年8月時点)

プロバイダーモデル入力(100万トークン)出力(100万トークン)最大文脈長特徴(かんたん概要)
OpenAIGPT-5.6 Sol$5.00$30.001.05 Mフラッグシップ
フロンティア級の推論・長時間稼働のエージェントタスク向け
GPT-5.6 Terra$2.00$12.001.05 Mバランス型
上位モデル相当の性能を低コストで提供する主力モデル
GPT-5.6 Luna$0.20$1.201.05 M最軽量・最速
要約・分類など大量リクエスト向け
AnthropicClaude Fable 5$10.00$50.001 MAnthropic最上位
長時間稼働エージェント向けの次世代モデル
Claude Opus 5$5.00$25.001 M高性能
複雑なエージェント型コーディング・エンタープライズ用途向け
Claude Sonnet 5$2.00$10.001 Mバランス型
速度と知能のバランスが良い主力モデル
Claude Haiku 4.5$1.00$5.00200 K超高速
フロンティア級に迫る性能を持つ最速モデル
Google CloudGemini 3.6 Flash$1.50$7.501 M現行の主力モデル
速度と知能のバランスに優れたマルチモーダル対応モデル
Gemini 3.1 Pro Preview$2.00〜$4.00$12.00〜$18.001 Mプレビュー版最上位
200 Kトークン超で単価が上がる段階課金
Gemini 3.1 Flash-Lite$0.25$1.501 M最高コスパ
大規模バッチ・高頻度処理向け

📍出典:OpenAI公式ドキュメント(Pricing)OpenAI公式ドキュメント(Models)Anthropic公式ドキュメント(Pricing)Anthropic公式ドキュメント(Models)Google公式ドキュメント(Pricing)Google公式ドキュメント(Models)

※Claude Sonnet 5は当初2026年8月31日までの導入価格(入力 $2 / 出力 $10)とされていましたが、2026年8月にAnthropicが同価格を恒久化すると発表し、9月1日以降に予定されていた入力 $3 / 出力 $15 への値上げは実施されないことになりました(出典:上記Anthropic公式ドキュメント)。 ※Gemini 3.1 Pro Previewでは200 Kトークンを超えると入力 $4.00 / 出力 $18.00に切り替わります(出典:上記Google公式ドキュメント)。 ※GPT-5.6 Sol/Terra/Lunaも、入力272 Kトークンを超えるとリクエスト全体の入力単価が2倍・出力単価が1.5倍に切り替わります(例:Terraは入力 $2.00→$4.00 / 出力 $12.00→$18.00)OpenAI公式ドキュメント


単価が変わるケース

単価は固定ではなく、リクエストの送り方や量によって “最大 90% OFF” になることもあれば、一定のしきい値を超えて単価が上がることもあります。 「同じ入力が多いか」「長文かどうか」「リアルタイム性が要るか」 の 3 つを軸にワークロードを整理すると、コストを最適化しやすくなります。

キャッシュ再利用で入力料金最大90%OFF、バッチAPIで最大50%OFF、長文脈しきい値超過で単価アップという3つの割引・課金メカニズムを示した図 API料金の単価が変わる3つの仕組み(キャッシュ再利用・長文脈しきい値・バッチAPI)

キャッシュ再利用・長文脈しきい値・バッチ APIとは?

用語どういう仕組み?料金への影響代表的な条件向いているケース
キャッシュ再利用(Prompt / Context Caching)同じ入力をもう一度送ったときに、前回の結果を流用。
モデルには“差分”だけ渡すので入力分がほぼタダ。
【割引】入力料金が最大 90 %OFF- OpenAI Cached Input(GPT-5.6 系)
- Anthropic Prompt Caching
- Google Context Caching
FAQ・ABテスト・リトライ処理
長文脈しきい値モデルごとに設定されたトークン数の境界を超えると、自動的に“高いレーン”へ切り替わる段階課金。
超過分だけでなく、リクエスト全体が高い単価になる点に注意。
【割増】境界を超えるとリクエスト全体の 単価アップ例:Gemini 3.1 Pro Preview は200k超で入力$4.00/出力$18.00
例:GPT-5.6シリーズは272K超で入力2倍/出力1.5倍
会議録・大型レポートの解析
バッチ API / Batch Modeリアルタイム性が要らない大量リクエストを、まとめて夜間などに処理。
サーバーの空き時間を活用できる。
【割引】入力も出力も最大 50 %OFF- OpenAI Batch API
- Claude Batch Processing
- Gemini Batch Mode
ログの一括要約・夜間ジョブ

📍割引率・単価アップの条件は、いずれも上記「主要モデルの最新API単価・特徴一覧」と同じ各社公式ドキュメントの記載に基づきます。


見積精度を上げる 4 つのコツ

やることひとことで言うと具体例・なぜ大事?
① 公式トークナイザーで数えるまずは正しいトークン数を確認OpenAI・Geminiは公式Webツールにプロンプトを貼り付けるだけで確認可能。
Claudeは公式Webツールがなく、API(count_tokensエンドポイント)経由でのみ確認できます。
可能な範囲で確認すれば見積もり誤差を大きく減らせます。
② キャッシュ再利用を設計に組む同じ入力は“使い回し”FAQ や AB テストのように同じプロンプトを何度も送るなら「キャッシュ再利用」を ON。
入力料金が 最大 90 %OFF になります。
③ 長文しきい値をまたがない一定のトークン数を超えると単価急騰するモデルもある例:Gemini 3.1 Pro Preview は 200 K 超から入力単価が2倍・出力単価が1.5倍。
例:GPT-5.6シリーズも272 K超から入力2倍・出力1.5倍。
大きな文書は章ごとに分割して送ると安く済みます。
④ バッチ API を夜に流す“急がない大量処理”はまとめ送り昼間は見積もりだけ、深夜にバッチ API で一括実行。
入出力とも 最大 50 %OFF。
ログ集計や大量分類と相性抜群。

FAQ

QA
Dify・GPTs 経由だと請求先は?呼び出し API キーの所有者へ課金されます。
社内ツールに組み込む場合は管理キーと個人キーを分ける運用が安全です。
日本語だと誤差が大きい?文字数÷1.3〜2(プロバイダーにより変動)が目安。
業務で厳密に積算する場合は公式トークナイザーでの確認が必須。
モデル自動切替は有効?FAQ・チャット → Flash-Lite/Luna
精密レポート → GPT-5.6 Sol/Claude Fable 5
など、品質・速度・コストの三軸最適化が可能。

まとめ ― 4 つだけ押さえれば OK

  1. 覚える公式は 1 行だけ
    • 料金 = 入力トークン料 + 出力トークン料
  2. 単価が変わるポイントは 3 つ
    • キャッシュ再利用:入力料金が 最大 90 %OFF(OpenAI・Anthropic・Google共通)
    • バッチ API:急がない大量処理は 最大 50 %OFF
    • 長文しきい値:Gemini 3.1 Pro Preview(200 K超)やGPT-5.6シリーズ(272 K超)など、境界を超えるとリクエスト全体の単価アップ(唯一、割引ではなく増額)
  3. タスク別にモデルを自動切替
    • 例)FAQ → Flash-Lite/Luna、精密レポート → GPT-5.6 Sol/Claude Fable 5
    • 品質とコストのベストバランスが取れる
  4. 最後は公式ドキュメントで再確認
    • 価格・モデルラインアップは数週間〜数か月単位で更新される(発売直後の値下げ・価格改定も珍しくない)
    • キャッシュ/バッチ/しきい値を組み合わせて “最小コスト・最大効果” を狙おう

出典一覧

  1. 「API Pricing」 — OpenAI公式ドキュメント
  2. 「Models」
  3. 「Key concepts」
  4. 「Pricing」 — Anthropic公式ドキュメント
  5. 「Models overview」
  6. 「Gemini Developer API Pricing」 — Google公式ドキュメント
  7. 「Gemini models」
  8. 「トークンカウント」 — Anthropic公式ドキュメント
  9. 「GPT-5.6 Terra モデルページ」 — OpenAI公式ドキュメント

関連サイト

  • OpenAI Tokenizer — プロンプトのトークン数を確認できる公式ツール
  • Google AI Studio — Geminiモデルのプロンプト入力トークン数を確認できる公式ツール

この記事をシェアXLINE
えだまめ

執筆者:えだまめ

Elcamyでバックオフィスとブログ執筆を担当。AI未経験の状態からAI活用を学び、Claude CodeをはじめとするAIエージェントの実務活用法を発信している。

更新情報はElcamy公式Xでも発信中。

無料相談受付中

AIの導入、まずはご相談から

貴社の課題に合わせた最適なソリューションをご提案します。
初回相談は無料、お気軽にお問い合わせください。

ElcamyGoogle Cloud Partner