GPT-6 Astraの費用、長い入力の倍率と見えない推論量に注意
GPT-6 Astraの費用は、回答の見た目の長さだけでは決まらない。長い入力にかかる料金倍率、キャッシュの区分、推論トークンの課金を公式資料で確認し、日本語文書を扱う業務で事前の入力計数と実行後の使用量を照合する意味を整理した。

GPT-6 AstraのAPI費用は、画面に表示された回答の長さだけでは見積もれない。OpenAIの公式資料は、長い入力に適用する料金倍率と、利用者に見えない推論トークンの課金を別々に説明している。日本語の文書を大量に扱う業務では、文字数と請求単位を同じものとして扱わないことが重要になる。
モデルページの標準料金は100万トークン当たり入力10ドル、出力50ドル。キャッシュ済み入力は1ドル、キャッシュへの書き込みは12.50ドルと表示される。同じ入力でも処理区分によって単価が異なり、保存した内容を再利用する場合と、新しく保存する場合を分ける必要がある。
さらに入力が27万2000トークンを超える要求では、要求全体について入力とキャッシュの料金が2倍、出力が1.5倍になる。境界を超えた部分だけに高い料金を付ける説明ではない。大きな資料を一度に送る設計では、文脈に収まるかという容量の確認と、この料金条件の確認を別に行う必要がある。
入力を調べる手段として、公式文書は送信前のトークン計数機能を案内する。文章だけでなく、メッセージ、画像、ファイル、ツールなどを含む要求を対象とし、役割や区切りを表す構造上のトークンも数える。日本語の文字数を一定の数で割る簡易計算だけでは、こうした入力全体を把握できない。
一方、入力の計数だけでは最終的な総額は決まらない。推論に使ったトークンはAPIで本文として見えなくても出力として課金される。OpenAIは応答の使用量情報に推論トークン数を記録すると説明する。回答が短いことと、モデルの処理量が少ないことは同じではない。
出力上限の設定も、表示される文章だけに作用するわけではない。推論と可視の出力などを含む生成量を制限するため、上限に達すると文章が出る前に未完了の応答となる場合がある。費用を抑えるつもりで上限を下げた際には、作業が完了したかも合わせて確認する必要がある。
本稿の金額は提供元が示す米ドル建ての単価で、日本円の請求額や個別契約の見積もりではない。実際の業務では、入力の事前計数と、実行後の使用量、完了状態を照合することが、費用と成果を結びつける基本になる。
また、高速モードは適用料金の2倍とされる。標準単価で作った試算をそのまま流用せず、入力長やキャッシュ区分とともに実行モードを記録すれば、料金差の原因を追いやすくなる。
프리즘코리아 편집국 > 水野遼



