
生成AIのトークンとは、AIが文章を読み書きするときに使う区切りの単位で、料金と一度に読める量を決める物差しです。会社として押さえたいのは細かな仕組みよりも、使った量がどの形で請求や利用の停止につながるかという点になります。APIは使った分だけ米ドルで請求され、月額制のチャットでは主に利用上限として効いてきます。日本語の換算に公式の数字がないことも含め、総務・情シスの方が判断に使える材料を、各社の公式ページの記載をもとに整理しています。
生成AIのトークンとは|文章を区切る最小単位
トークンとは、生成AIが文章を処理するときの最小の単位で、文字数とも単語数とも一致しません。OpenAIの公式ヘルプによれば、1つのトークンは1文字のことも、単語の一部や単語全体、句読点のこともあります。同じ文章でも、モデルや言語が違えばトークン数は変わると書かれています。
AIは受け取った文章をまずトークンに分け、その並びをもとに処理して、答えもトークンを1つずつ生み出す形で作ります。料金の計算も、一度に読める量の上限も、このトークンの数で決まる仕組みです。LLM(大規模言語モデル)の仕組みそのものはLLMとはの記事で紹介しているので、ここでは会社の費用と上限に関わる部分に絞ってお話しします。
日本語の文を実際に分割してみる
実際に、OpenAIが公開しているTokenizer(トークナイザー)という画面に日本語の文を入れると、区切られ方が色分けで表示されます。2026年9月27日に、最新モデル向けの設定(GPT-5.x & O1/3)で3つの文を数えた結果は次のとおりです。
- 「来週の会議資料を要約してください。」は17文字で11トークン。区切りは「来|週|の|会|議|資料|を|要|約|してください|。」
- 「請求書の支払期限は月末です。」は14文字で12トークン。区切りは「請|求|書|の|支|払|期限|は|月|末|です|。」
- 「Please summarize the meeting materials for next week.」は53文字で9トークン。ほぼ単語ごとに1トークン
よく使われる「資料」「期限」「してください」は1つのトークンにまとまり、「会議」「要約」は1文字ずつに分かれました。同じ日本語でも、1文字あたりのトークン数は1文目で約0.65、2文目で約0.86と開きがあります。文字数からトークン数を1つの係数で割り出すのは難しい、と考えておくのが安全です。会社で見積もるときは、自社の実際の文書で数えてみてください。
トークン化の手法(単語・文字・サブワード)
文章をどこで区切るかの決め方には、大きく単語ごと・文字ごと・サブワードごとの3通りがあります。単語ごとに区切る方法は、英語のように空白で単語が分かれる言語では分かりやすい反面、辞書にない語に弱くなります。文字ごとに区切る方法はどんな語でも扱えるものの、トークン数が膨らみやすくなってしまいます。
その中間にあるのがサブワードという考え方で、よく現れる文字の並びは1つにまとめ、まれな語は細かく分けて扱います。代表的な手法にはBPE(バイト対符号化)があり、OpenAIのTokenizerの画面もトークンを文章によく現れる文字の並びと説明しています。上の例で「資料」や「してください」が1つにまとまったのは、この考え方に沿った動きと見られます。Anthropicの用語集でも、トークンは単語・サブワード・文字、場合によってはバイトに当たるという説明があります。
3社の公式ページにあるトークンの定義
OpenAI・Anthropic・Googleの3社とも、トークンの定義と英語での目安を公式ページに載せています。
- OpenAI:モデルが文章を処理するための単位。英語では1トークンが約4文字、100トークンが約75語という目安で、推定値であり他の言語では関係が異なり得ると注記
- Anthropic:言語モデルの最小の単位で、単語・サブワード・文字・バイトに当たる。Claudeでは1トークンが英語で約3.5文字で、使う言語によって変わると注記
- Google:Geminiでは1トークンが約4文字で、100トークンが英語で約60〜80語に当たると説明
※2026年9月27日時点で、OpenAIのヘルプ記事「Understanding and counting tokens」、Anthropicの用語集(Glossary)、Gemini API のトークンの解説ページで確認した記載です。
トークンで決まる3つのこと|API料金・一度に読める量・チャットの上限
トークンの数で決まるのは、APIの料金、一度に読める量、チャット画面の利用上限の3つになります。どれも同じ物差しで測られていますが、会社の出費への響き方はそれぞれ違います。
API料金はトークン数で決まる
APIとは、社内のシステムや自作のツールから生成AIを呼び出す窓口のことで、料金は使ったトークン数に単価を掛けて計算されます。各社の料金表は100万トークンあたりの米ドルで書かれており、たとえばOpenAIのGPT-5.6 Terraは入力100万トークンあたり2ドルです。Googleも、課金が有効な場合のGemini APIの費用は、入力トークンと出力トークンの数で決まると説明しています。APIの料金は、ChatGPTやClaudeの月額プランとは別に請求されます。
入力と出力は別々に数え、出力の単価が高い
トークンは、AIに渡す側の入力と、AIが返す側の出力に分けて数えられます。単価は出力のほうが高く、2026年9月27日時点の公式料金表では、OpenAIのGPT-5.6 Terraが入力2ドルに対して出力12ドル、AnthropicのClaude Sonnet 5が入力2ドルに対して出力10ドルです。長い資料を読ませて短く答えさせる使い方は入力が中心になり、長文を書かせる使い方ほど出力の単価が効いてきます。
推論型のモデルが答えの前に内部で考える分のトークンも、画面には出ないまま出力として課金されます。OpenAIのヘルプには、表示された答えが短くても、見えている文章以上にトークンを使うことがあると書かれています。入力の中でも、同じ前置きを繰り返し送る部分にはキャッシュ(再利用)の安い単価が適用される場合があり、GPT-5.6 Terraのキャッシュ済み入力は100万トークンあたり0.20ドルです。
月額制のチャット画面では、利用上限として効く
月額制のチャット画面では、基本の料金はトークンの量で増減せず、使った量は利用上限や一度に読める量として効いてきます。ChatGPT BusinessやClaudeの個人向け有料プラン(Pro・Max)には、上限を超えて使うための追加のクレジットを別料金で購入する仕組みもあります。ChatGPT Businessの料金ページには、GPT Instantで一度に扱える量の上限が54K(入力の目安は約40ページ)、推論モデルでは256K(入力の目安は約320ページ)と書かれています。Claudeの有料プランでは、チャットで使うモデルによって100万トークンまたは50万トークンの上限が示され、それ以外のモデルは20万トークン、約500ページ以上とされます。
長い会話や大きな添付を続けると、この上限や利用上限に早く近づく仕組みです。プラン別の上限と長い資料の読ませ方はChatGPTの文字数制限の記事で詳しく紹介しています。
※ChatGPT Businessの数値は2026年9月27日時点のOpenAIのビジネス向け料金ページ、Claudeの数値は同日時点のClaudeヘルプ「How large is the context window on paid Claude plans?」の記載です。
日本語は何文字で1トークン?公式の換算は見当たりません
日本語の文字数とトークン数の換算を公式に示した資料は、2026年9月27日時点で確認できていない状態です。解説記事には「1文字でおよそ1トークン」「英語の1.5〜3倍」「1文字で0.25トークン」など様々な数字が並びますが、互いに食い違っており、各社の公式ページにその根拠は見当たりません。
各社の目安はすべて英語が前提
OpenAIの約4文字とAnthropicの約3.5文字は英語と明記された目安で、Googleの約4文字も英語の単語数と並べて示された目安です。OpenAIは他の言語では文字・単語・トークンの関係が異なり得ると注記し、Anthropicも正確な数は使う言語によって変わると書いています。Googleの日本語版ページにある約4文字も、日本語1文字を0.25トークンと読み替える根拠にはなりません。
Anthropicは、Claude Opus 4.7から採用した新しいトークナイザーで、100万トークンが約250万Unicode文字に当たると示しているものの、言語ごとの内訳は載っていない形です。
日本語は英語よりトークンが多いのか
日本語は英語よりトークンを多く使うとよく言われますが、各社の公式資料が書いているのは、言語によって文字とトークンの関係が違うというところまでになります。先ほどのTokenizerの例では、英語の1文が53文字で9トークン、日本語の2文が17文字で11トークン、14文字で12トークンという結果でした。同じ意味の文で比べると、この例では英語の9トークンに対し日本語は11トークンでしたが、2文だけの結果を一般化することは出来ません。社内で試算に使う係数は、公式の数字ではなく自社の文書で測った値にしましょう。
自社の文書でトークン数を数える方法
トークン数は、各社が用意している道具で実際に数えることが出来ます。
- OpenAIのTokenizerに文章を貼り付けると、トークン数と区切られ方がその場で表示される
- プログラムで数えるなら、OpenAIはtiktokenというライブラリと、送る前に入力のトークン数を数えるAPIを案内している
- Gemini APIでは、count_tokensで送る前の入力トークン数を数えられ、応答には入力・出力・思考・キャッシュなどの内訳が返る
- 実際に使った量は、OpenAIならAPIの応答に含まれる使用量(Responses APIの場合はinput_tokens・output_tokens、Chat Completionsではprompt_tokens・completion_tokens)と管理画面の使用状況のページで確かめられる
社外秘の文書をそのまま貼り付けるのは避け、公開済みの規程や過去の案内文など、外に出ても困らない文書で測ってみてください。業務でよく使う文書を5〜10種類ほど測り、1文字あたりのトークン数の幅を控えておけば、後の予算づくりにそのまま使えます。入力してはいけない情報の線引きはAIに入れてはいけない情報の記事に一覧があります。
契約や請求が社員ごとに分かれるなら、使う環境を会社で1つにまとめる方法もあります。UPGEAR AI(アップギアAI)は、ChatGPT・Claude・Gemini・Perplexityを1つの契約で使える法人向けサービスです(人数無制限)。
100万トークンはどれくらい?主要モデルの上限と単価
100万トークンは、Anthropicの説明では英語でおよそ55万5千語、Unicode文字で約250万文字に当たる量になります。日本語で何文字になるかは公式に示されていないので、ここでは各社の上限と単価をトークンのまま並べます。
コンテキストウィンドウとは、一度に扱える量の上限
コンテキストウィンドウとは、AIが1回のやり取りで扱えるトークンの上限のことで、会話の履歴、添付した資料、AIの答えまでを含めた作業机の広さに当たります。Anthropicは、答えも含めてAIが参照できる文章全体をコンテキストウィンドウと呼び、学習に使ったデータとは別の作業用の記憶だと説明しています。Googleの説明でも、コンテキストウィンドウは入力と出力を合わせた上限とされます。チャットで会話を続けると、それまでのやり取りもこの机の上に載るため、長い会話ほど1回あたりのトークンが増えていきます。プランごとの上限と、会社の書類がどこまで入るかの目安はコンテキストウィンドウとはの記事をご覧ください。
上限を超えたとき・長い資料の中ほどを見落とす問題
上限を超えたときの動きは、サービスによって違います。AnthropicのAPIでは、入力だけで上限を超えると「prompt is too long」というエラーが返ります。Claudeの有料プランのチャットでは、コード実行が有効な場合、上限に近づくと古いやり取りを自動で要約して場所を空ける仕組みがあります。OpenAIは、入力が大きすぎるときの対処として、指示を短くする、不要な繰り返しを削る、大きな入力を分ける、先に要約してから送る、といった方法を挙げています。
枠に収まっていれば正しく読めるとも限らないのが、長い入力の難しいところになります。Anthropicは、トークン数が増えるほど正確さや思い出す力が落ちる現象をcontext rotと呼び、何を入れるかの選び方が広さと同じくらい大切だと書いています。長い資料の中ほどにある情報を見落としやすい傾向は、2023年の論文「Lost in the Middle」(arXiv 2307.03172)で報告され、多くの解説記事でも取り上げられる話題です。決算書や規程集を丸ごと渡すより、必要なページだけを渡すほうが、費用も答えの確かさも安定しやすくなります。
主要モデルのAPI単価とコンテキスト上限
2026年9月27日時点で、各社の公式ページに載っている代表的なモデルの単価と上限は次のとおりです。
- OpenAI GPT-6 Astra:入力10ドル/出力50ドル。同社が複雑な推論やコーディング向けの主力と位置づけるモデル
- OpenAI GPT-5.6 Terra:入力2ドル/出力12ドル。性能と費用の釣り合いを取る位置づけ
- OpenAI GPT-5.6 Luna:入力0.20ドル/出力1.20ドル。費用を重視する大量処理向け
- OpenAI GPT-6 Sol:入力2ドル/出力10ドル。コンテキストは1,050,000トークン(入力は最大922,000、出力は最大128,000)。入力が27万2千トークンを超えるリクエストは、そのリクエスト全体が入力2倍・出力1.5倍の単価
- Anthropic Claude Opus 5.5:入力4ドル/出力20ドル。コンテキストは100万トークン
- Anthropic Claude Sonnet 5:入力2ドル/出力10ドル。コンテキストは100万トークン
- Anthropic Claude Haiku 4.5:入力1ドル/出力5ドル。コンテキストは20万トークン
- Google Gemini 3.8 Flash:入力0.75ドル/出力3.75ドル(出力は思考トークンを含む)。2027年1月1日からは入力1.50ドル・出力7.50ドルと記載。入力の上限は1,048,576トークン、出力の上限は65,536トークン
- Google Gemini 3.1 Pro プレビュー版:プロンプトが20万トークン以下なら入力2ドル/出力12ドル、超えると入力4ドル/出力18ドル
※単価は100万トークンあたり・米ドル・標準の処理の値です(バッチ処理などの割引や長いコンテキストの割増は除きます)。OpenAIとGoogleの料金ページに税の記載はなく、Anthropicの料金ページは米ドル建てと明記しています。2026年9月27日時点で各社の公式の料金ページ・モデル説明ページに表示されている値で、変更されることがあります。
OpenAIとGoogleは、結果を急がないバッチ処理をおよそ半額としており、急がない集計や一括の要約はこちらに回す方法もあります。API料金の人数別の試算はChatGPT API料金とGemini API料金の記事でも扱っています。
資料の要約1回はいくらか
日本語の文字数からは換算できないので、ここではTokenizerなどで測った結果、入力が1万トークン・出力が1,000トークンになった要約を1回と置いて計算します。1ドル=155円で計算した場合、GPT-5.6 Terraでは入力0.02ドルと出力0.012ドルで約5円、GPT-6 Astraでは約23円、GPT-5.6 Lunaでは約0.5円となります。これを部署全体で月2,000回行うと、Terraで月約9,900円、Astraで月約4万6,500円、Lunaで月約990円と、同じ作業でもモデルの選び方で40倍以上の差が出ます。為替と推論の分の出力によって実際の請求はこの計算から動くため、試算はあくまで目安として使ってください。
単価が安いモデルほど総額が安いとは限らない
モデルを選ぶとき、100万トークンあたりの単価だけで比べるのは危うい面があります。OpenAIの公式ヘルプは、100万トークンあたりの単価が安くても、総額が安くなるとは限らないと明記しています。モデルによって同じ文章の区切り方が違い、書く量や考える量も変わるためで、見えている答えの長さではなく代表的な作業で実際に試すことが勧められます。Anthropicも、Claude 4.7以降のモデルが使う新しいトークナイザーは、以前のトークナイザー(Claude Sonnet 4.6以前)より同じ文章で約30%多くトークンを数え、増え方は内容によって変わると料金ページに書いています。モデルを替えるときは、社内でよくある作業を3〜5種類選び、同じ入力で使ったトークン数と金額を並べて確かめてみましょう。
会社の出費で比べる|従量課金・席課金・会社定額
会社が生成AIに払うお金の形は、使ったトークンに応じて払うAPIの従量課金、1人ごとに席を買う月額課金、会社単位の定額の3つに分けられます。同じ人数が同じように使っても、請求の動き方と、上限に達したときの止まり方はそれぞれ違ってきます。下の表は、社員10人・30人・50人の場合を、2026年9月27日時点の公式ページの金額で並べたものです。
| 項目 | APIの従量課金(GPT-5.6 Terra) | 1人ごとの席課金(ChatGPT Business 標準シート) | 会社定額(UPGEAR AI) |
|---|---|---|---|
| 請求の決まり方 | 使ったトークン×単価(米ドル) | 席の数×月額 | 利用量に応じたプランの月額(どのプランも利用人数は無制限) |
| 10人 | 約9,700円(62.4ドル) | 30,500円 | 50,000円(税抜・スタンダード) |
| 30人 | 約29,000円(187.2ドル) | 91,500円 | 100,000円(税抜・プレミアム) |
| 50人 | 約48,400円(312ドル) | 152,500円 | 100,000円(税抜・プレミアム) |
| 為替の影響 | 受ける(米ドル建て) | 料金ページは円と米ドルを併記 | 円建て |
| 使った量が多いとき | 請求が増える。止めるには支出上限の設定が必要 | 通常のテキストチャットは無制限と表示(不正利用防止の安全対策あり) | 上限に達した時点で利用を停止 |
| 別にかかるもの | チャット画面・ログ・権限管理を自社で作り保守する費用 | 上位のプレミアムシートに替える場合の差額、追加クレジットを購入する場合の費用 | 初期費用100,000円(税抜)、上限到達後に続けて使う場合の追加ポイント(料金は別途協議) |
※APIは、1人が月に400回(1日20回×20日)使い、1回あたり入力3,000トークン・出力800トークンと仮定して、1ドル=155円で計算した場合の金額です(推論の分の出力やツールの料金は含みません)。仮定は説明のための値で、実際の利用量ではありません。ChatGPT Businessは日本から表示したビジネス向け料金ページの標準シートの年額課金の表示(1席3,050円から、米ドルでは年額課金20ドル・月額課金25ドル)で計算しており、ページに税の記載はありません。会社定額の人数の目安はライト1〜5名、スタンダード6〜20名、プレミアム21〜50名です。
APIの従量課金は、この前提では3つの中でいちばん安く見えますが、モデルをGPT-6 Astraに替えるだけで30人の月額は約13万円まで上がります。しかもAPIはAIを呼び出す窓口にすぎず、社員が使うチャット画面、ログの保管、アカウントの管理は自社で作って保守する必要があります。席課金は人数に比例して増えるので、全員に配るか一部の方だけに配るかという判断がついて回ります。配られなかった社員が個人のアカウントで業務に使い始めると、会社から見えない利用が生まれてしまいます。
見えない利用の広がり方はシャドーAI(野良AI)の記事で紹介しています。会社定額は人数で月額が変わらない代わりに、利用量に応じてプランが決まり、上限に達すると使えなくなる点を理解しておく必要があります。個人プランと法人プランの人数別の総額は生成AIの料金比較でも計算しているので、人数と使い方の両方を置いて、3つの型を自社の数字で比べてみてください。
請求と利用を止める仕組みの違い
使いすぎを防ぐ仕組みは、APIでは自分で設定する必要があり、設定しても即座に止まるとは限りません。
OpenAI APIの支出上限と前払い残高
OpenAIのAPIには、使用額が決めた金額に届いたときに知らせるだけの支出アラートと、APIの要求を止めるハード上限の2種類があります。ハード上限は組織全体またはプロジェクトごとに月額で設定でき、管理画面で「Enforce a hard limit」をオンにすると、上限に届いた後の要求は429というエラーで断られるようになります。ただし公式ドキュメントは、止まるまでに時間差があり、記録上の支出が設定額をわずかに超えることがあると書いています。
新しいAPIアカウントは前払い制で、残高を使い切ってもすぐには止まらない場合があり、その間の利用はマイナスの残高として次の購入から差し引かれます。OpenAIは、前払いの残高を即時の支出の歯止めとして頼らないよう明記しています。残高が減ると自動で買い足す自動チャージは設定時に初めからオンになっているため、使いすぎを避けたい会社は、まずこの設定を確かめましょう。
Gemini APIの月間の利用額の上限
Gemini APIは、支払いの実績に応じた階層(Tier)ごとに、月間の利用額の上限が決まっています。上限はTier 1で250ドル、Tier 2で2,000ドル、Tier 3で2万〜10万ドルとされ、上限に達すると次の請求期間が始まる毎月1日まで、その請求先アカウントにつながるすべてのプロジェクトが一時停止となります。上限の引き上げを申請することも出来ます。プロジェクトごとの費用上限も設定できますが、試験運用版の扱いで、課金データの反映が最大10分ほど遅れて上限を超えることがあると書かれています。社内の業務システムにGeminiを組み込んでいる場合、月末近くに上限へ達すると、翌月1日まで業務が止まってしまいます。
※OpenAIの記載は2026年9月27日時点の公式ドキュメント「Spend limits」とヘルプ記事「Setting up and managing prepaid API billing」、Geminiの記載は同日時点のGemini APIの課金のページ(最終更新 2026年9月20日 UTC)によるものです。
定額制・席課金は、上限で止まる前提で考える
月額制のチャットや会社定額のサービスでは、請求が膨らむ代わりに、上限に達した時点で使えなくなるのが基本で、追加のクレジットやポイントを購入して続ける仕組みを持つものもあります。会社定額型のサービスの中には、上限に近づくと管理者に知らせ、上限に達した時点で利用を停止する設計のものが見られます。この形なら知らないうちに請求が増える心配は小さい一方、月末に業務が止まる可能性を考えて、通知を受け取る人と止まったときの判断を先に決めておくことが大切です。どの形を選んでも、止め方と知らせ方をセットで設計することが、トークンの管理の中身となります。
社員の使い方で消費が膨らむ場面と対処
トークンの消費は、社員1人ひとりの使い方の癖で大きく変わります。
長い会話ほど利用上限を多く消費する
Claudeのヘルプには、有料プランで長い会話が自動の要約を起こすと、その分だけ利用上限を多く使うと明記されています。チャットでは、会話が続くほど過去のやり取りも入力に含まれていきます。1つのチャットを何日も使い回すと、同じ質問でも消費が大きくなってしまいます。社員から急に使えなくなったと相談されたときは、まず長く続いた会話がないかを見てみてください。Claudeの上限の種類と戻り方はClaudeの制限の記事にまとめました。
判断表:消費が膨らむ場面と、総務・情シスとしての対処
総務・情シスの方が社員の使い方を見直すときの目安を、場面ごとに並べると次のようになります。
| 場面 | 消費が増える理由 | 総務・情シスとしての対処 |
|---|---|---|
| 1つのチャットを何日も続ける | 過去のやり取りも入力に含まれ、長い会話は利用上限を多く使う(Claudeヘルプ) | 話題が変わったら新しいチャットを開くよう案内する |
| 決算書や規程集のPDFを丸ごと添付する | 必要のないページも入力として数えられる | 必要なページだけを抜き出して渡すルールにする |
| スキャンしたPDFや画像を読ませる | Geminiでは縦横とも384ピクセル以下の画像は1枚258トークン(大きい画像はより多い) | 文字データのある元のファイルを使う、解像度を必要以上に上げない |
| 会議の録音や動画を読ませる | Geminiでは音声1秒で32トークン、動画1秒で263トークン(通常の処理の場合) | 必要な部分だけを切り出す、文字起こしを使い回す |
| 推論型のモデルやディープリサーチを多用する | 画面に出ない思考の分も出力として課金される(OpenAIヘルプ) | 定型の作業は軽いモデルを既定にする |
| 同じ資料を部署の全員がそれぞれ読み込ませる | 同じ内容のトークンが人数分だけ消費される | 共有のプロジェクトや社内資料の検索(RAG)にまとめる |
| 長文の答えを毎回全文で求める | 出力の単価は入力より高い | 文字数や箇条書きの数を指定する |
※画像・音声・動画のトークン数は2026年9月27日時点のGemini APIのトークンの解説ページ、推論トークンの扱いは同日時点のOpenAIのヘルプ記事の記載です。数え方はサービスやモデルごとに異なります。
表の中のRAGは、社内資料から関係する部分だけを探してAIに渡す仕組みのことで、考え方はRAGとはの記事で紹介しています。
トークンの消費を抑えるコツと、軽量モデルとの使い分け
トークンの節約は、我慢して使う回数を減らすことではなく、AIに渡す量と返させる量を必要な分に絞ることで進みます。
トークンの消費を抑えるコツ
- 指示は目的・対象・形式を短く書き、前置きのあいさつや同じ説明の繰り返しを削る
- 答えの長さを、300字以内や箇条書き5つのように指定する
- 話題が変わったら、新しいチャットを開く
- 資料は必要なページや章だけを渡し、長い資料は先に要約してから使う
- 関連する指示は1回にまとめ、細切れの追加の質問を減らす
どれも特別な技術は要らず、明日から社員に案内できる内容になります。指示の書き方そのものは、プロンプトエンジニアリングとはの記事で4つの要素に分けて紹介しています。
用途に応じて軽量モデルと使い分ける
定型の要約や分類、言い換えのような作業は、上位のモデルでなくても十分なことがあります。OpenAIもGPT-5.6 Lunaを費用重視の大量処理向け、GPT-6 Astraを複雑な推論やコーディング向けと位置づけており、出力の単価は約40倍違います。まずは軽いモデルを既定にし、答えが足りない作業だけ上位のモデルに切り替える運用にすると、費用と待ち時間の両方を抑えやすくなります。どの作業にどのモデルを使うかを決めないままだと、迷ったときに上位のモデルを選ぶ社員が増えやすいでしょう。
予算の立て方と社内ルールに入れる3行
生成AIの予算は、トークン数の予想から入るより、部署と用途ごとの件数から積み上げるほうが立てやすいでしょう。
予算を立てる手順
- 部署ごとに、生成AIを使う用途を書き出す(議事録の要約、問い合わせへの回答の下書き、契約書の読み込みなど)
- 用途ごとに、月の件数と1件あたりの入力・出力の量を見積もる
- 各用途の代表的な文書をTokenizerやAPIの使用量で測り、1件あたりのトークン数に置き換える
- 使うモデルの単価を当てて月額を出し、1ドル=何円で計算したかを書き添える
- APIなら支出アラートとハード上限、定額制なら上限に近づいたときの通知先と、止まったときに判断する人を決める
- 3か月ほど実際の使用量と比べ、見積もりの係数を直す
たとえば総務部で、規程に関する問い合わせへの回答案を月200件作り、1件が入力4,000トークン・出力600トークンだった場合を考えてみます。GPT-5.6 Terraでは入力1.6ドルと出力1.44ドルで月3.04ドル、1ドル=155円で計算すると約470円となります。契約書の読み込みのように1件の入力が大きい用途は、件数が少なくても金額を押し上げるので、別の行に分けて見積もってみてください。予算の数字には、為替の前提と、上限に達したときに誰が判断するかを必ず書き添えましょう。
部署ごとの費用を見える形にする進め方は、生成AIの利用コスト管理の記事で4つの手順に分けて紹介しています。
社内ルールに入れる3行
トークンの節約を社員に守ってもらうには、長い説明より、ルールの紙に3行だけ足す形が伝わりやすくなります。
- 話題が変わったら、新しいチャットを開く
- 資料は、必要なページだけを添付する
- 答えの長さを、文字数か箇条書きの数で指定する
この3行は、入力してはいけない情報のルールと同じ紙に載せられる短さにしてあります。新しいチャットのほうが消費が少ない、といった理由まで添えると、社員が自分で判断できる場面が増えていきます。社内ルール全体の作り方は生成AIの社内ガイドラインの作り方をご覧ください。
会社で安全に使うには|学習の設定・ログ・配布・上限
会社として生成AIを使わせるときは、トークンの量と費用の管理を、学習の設定・利用ログ・社員への配布とまとめて1つの仕組みで扱うのが近道になります。
入力した内容を学習させない設定
業務の情報を入れる以上、入力が提供元のAIの学習に使われない状態を、会社として確かめておく必要があります。OpenAIはAPIに送られたデータを、利用者が明示的に同意しない限り学習に使わないと公式ドキュメントに書いており、Geminiも有料のサービスではプロンプトや回答をプロダクトの改善に使わないとしています。一方で個人向けのプランは、利用者本人の設定で学習の扱いが変わるため、社員任せにすると漏れが出やすくなってしまいます。
誰がどれだけ使ったかを見る
トークンの管理で管理者が見るべきは、全体の合計よりも、誰がどの用途でどれだけ使ったかという偏りになります。消費が特定の社員や用途に偏っているとわかれば、長い会話の使い回しやPDFの丸ごと添付を、その方に個別に伝えて直してもらうことが出来ます。利用ログを部署や利用者の単位で書き出せるかは、サービスを選ぶときの確認項目に入れておきましょう。
社員への配布と利用量の上限の決め方
一部の社員にだけ配ると、残りの社員が個人のアカウントで使い始める余地が残ります。全員に同じ環境を渡したうえで、会社全体の月の上限と、上限に近づいたときの通知先を決めれば、費用と見えない利用の両方を抑えやすくなります。上限の値は、手順で出した見積もりに2〜3割の余裕を足して始め、3か月の実績で見直す進め方が無理のない形です。使い放題をうたうプランの上限の実際は、生成AIの使い放題は本当かの記事で確かめられます。
使った量と費用を、会社の定額で見える形に
UPGEAR AIは、ChatGPT・Claude・Gemini・Perplexityを1画面で切り替えて使える法人向けAI基盤です。全モデルで学習非利用を標準適用し、管理画面では利用状況を利用者・日時・利用モデル単位まで把握でき、CSVでの書き出しにも対応します。料金は月額30,000円(税抜)から。どのプランも利用人数は無制限で、料金は利用量に応じたプラン設計です(人数の目安はライト1〜5名、スタンダード6〜20名、プレミアム21〜50名)。初期費用100,000円(税抜)が別途かかります。上限に近づくと、管理者宛に複数回メールでお知らせします。上限に達した時点で利用を停止する安全設計のため、知らないうちに超過して追加の請求が発生することはありません。
UPGEAR AIの詳細を見るよくある質問
生成AIのトークンとは何ですか?
日本語1文字は何トークンですか?
100万トークンはどれくらいの量ですか?
トークンや利用上限を使い切ると、どうなりますか?
ChatGPTやClaudeの月額プランでも、トークンの料金はかかりますか?
まとめ
生成AIのトークンは、AIが文章を区切って処理する単位で、APIの料金、一度に読める量、チャットの利用上限をまとめて決める物差しになります。日本語の文字数との換算に公式の数字は見当たらないため、自社の文書を測って係数を持つことが出発点です。会社の出費は、従量課金・席課金・会社定額のどの形を選ぶかで動き方が変わり、止め方もそれぞれ違います。社員の使い方の癖で消費は膨らむので、話題が変わったら新しいチャット、添付は必要なページだけ、答えの長さは指定、の3行をルールに加えてみてください。法人のAI活用に関するほかの記事はAI活用コラム一覧にまとめています。
