Azure OpenAIの料金

Azure OpenAIの料金とは、MicrosoftのクラウドであるAzure上でOpenAIのモデルを使うときに、主に送った文章と返ってきた文章の量(トークン数)に応じて支払う利用料です。結論から言うと、社員10〜200名の会社が社内で使う場合のモデル利用料は、GPT-5-miniなら月約800円〜約4万円、GPT-5.5で文書の要約を多用すると月数十万円に届く幅があり、選ぶモデルと使い方で数十倍変わります。さらに、画面や検索の仕組みを動かすAzureの費用、会話や推論で見えないうちに増えるトークン、予算を超えても止まらない請求の仕組みを知らないと、見積もりと実際の請求がずれます。この記事では、2026年9月17日時点の公式の単価をもとに、社員数別の月額を円で試算し、見積もりの手順、費用の抑え方、使いすぎの止め方までを整理します。

※料金は2026年9月17日時点で、Microsoftの公式料金ページ(米ドル表示)と、Azure Retail Prices API(通貨を日本円、リージョンを東日本 japaneast に指定し、同日13時46分に取得)に表示されている金額です。円の金額はMicrosoftが公開している円建て単価で、米ドル表示との比は1ドル=159.32円相当です。Azureの料金ページには税の記載がないため、この記事の金額に消費税の扱いは足していません。実際の請求額は契約の種類や購入時期で変わることがあります。

Azure OpenAIの料金の仕組み|何に対して払うのか

Azure OpenAIの料金は、使った量に応じて払うStandard、処理能力を時間単位で借りるProvisioned、急がない処理をまとめて安く流すBatchの3つの払い方から選ぶ形です。社員が日々の業務で使う程度の規模なら、まずStandardで考えるのが基本になります。サービスそのものの概要や、ChatGPTとの違い、データの扱いについてはAzure OpenAIとはで解説しているので、この記事では料金に絞って説明します。

従量課金の基本:入力トークンと出力トークンは別単価で、出力の方が高い

Standardでは、AIに送る文章(入力)と、AIが返す文章(出力)を、それぞれトークンという単位で数えて課金します。単価は入力と出力で別々に決まっていて、主要なモデルではどれも出力の単価の方が高く設定されています。たとえばGPT-5.5のGlobalでは、100万トークンあたり入力が5ドル、出力が30ドルで、出力は入力の6倍です。GPT-5-miniでも入力0.25ドルに対して出力2ドルで、8倍の開きがあります。

この差があるため、同じ回数使っても、短い質問に長い回答を返させる使い方は、長い資料を読ませて短く答えさせる使い方より出力の比率が高くなり、1トークンあたりの平均単価が上がります。見積もりでは、1回あたりの入力と出力を分けて考えることが出発点です。

トークンの考え方と日本語の目安

トークンは、モデルが文章を処理するときに区切る単位です。英単語1語が1トークンになることもあれば、日本語では1文字が複数のトークンに分かれることもあります。日本語の文字数とトークン数の比率について、MicrosoftのLearnや料金ページには数値での説明が見当たりません。このため、この記事では日本語が何倍になるといった換算は置かず、試算ではトークン数そのものを前提として示します。

自社の使い方でのトークン数を知る確かな方法は、実際に使う文章でAPIを呼び出し、応答に含まれる使用量を読むことです。Chat Completions APIの応答には入力と出力のトークン数が返り、推論モデルでは出力のうち推論に使った分の内訳も返ります。社内でよく使う質問や資料を10件ほど選んで測れば、見積もりの前提をかなり現実に近づけられます。

3つの課金方式:Standard・Provisioned・Batch

公式料金ページは、課金方式を次の3つに分けて案内しています。

  • Standard(オンデマンド):入力と出力のトークン量に応じた従量課金。使わない月はモデル利用料がかからない一方、使った分だけ青天井に増えます。
  • Provisioned(PTU):PTU(プロビジョニング済みスループット ユニット)という処理能力の単位を確保し、時間単位で払う方式。月間・年間の予約で割り引かれます。
  • Batch:すぐに結果が要らない処理をまとめて送り、24時間以内に返してもらう代わりに安くなる方式。

Batchは24時間以内の返却と引き換えに50%割引

Batch APIは、公式料金ページで、Global Standardの料金から50%割引になる代わりに、結果を24時間以内に返す方式と説明されています。GPT-5.4 miniなら、Standardの入力0.75ドル・出力4.50ドルに対して、Batchでは入力0.38ドル・出力2.25ドル(いずれも100万トークンあたり)です。社員とのチャットのように即答が必要な使い方には向きませんが、過去の問い合わせ履歴の分類、大量の文書の要約、翌朝までに終わればよい集計といった処理なら、同じモデルで費用を半分にできます。

Provisioned(PTU)は使用量にかかわらず時間課金

Provisionedについて、Microsoft Learnは、使用されたトークンの数に関係なく、デプロイされたPTUの数に基づく時間単位の料金で課金されると説明しています。メーターはデプロイを作った時点で動き始め、削除すると止まります。つまり、夜間や休日に誰も使っていなくても課金は続きます。

割引の手段として、1か月または1年のAzure予約があります。ただし予約は料金上の割引で、デプロイとは別に管理されます。Learnには、予約をしても処理能力が保証されるわけではないとも書かれています。予約を買ったあとに、そのリージョンで必要な数のPTUを実際に確保できるかは別に確認が必要です。最小構成の金額は、この記事のProvisionedの最小構成はいくらかで円に換算しています。

モデル別の単価と、同じモデルでも単価が変わる理由

単価は、モデルの種類に加えて、データをどこで処理するか(デプロイ種別)と、入力の長さによっても変わります。社内の規程で国内処理を求める場合は、Globalの単価で見積もると低く出すぎます。

主要モデル別の単価表(2026年9月17日確認・Global・100万トークンあたり)

モデル入力キャッシュ入力出力
GPT-5.55ドル(796.6円)0.50ドル(79.66円)30ドル(4,779.6円)
GPT-5.4 mini0.75ドル(119.49円)0.08ドル(11.949円)4.50ドル(716.94円)
GPT-5-mini0.25ドル(39.83円)0.03ドル(3.983円)2ドル(318.64円)
GPT-5-nano0.05ドル(7.966円)0.01ドル(0.7966円)0.40ドル(63.728円)
GPT-4.12ドル(318.6円)0.50ドル(79.7円)8ドル(1,274.6円)
GPT-4.1 mini0.40ドル(63.7円)0.10ドル(15.9円)1.60ドル(254.9円)

※ドルは公式料金ページの表示、括弧内の円はAzure Retail Prices API(currencyCode=JPY、armRegionName=japaneast、2026年9月17日13時46分取得)の円建て単価です。GPT-4.1系はAPIが1,000トークンあたりで返すため、1,000倍して小数第1位までにしています。キャッシュ入力のドル表示はページ上で丸められているため、円からの逆算と一致しないものがあります。GPT-5.4 miniとGPT-5.5には、ほかに優先処理(Priority Processing)の割高な単価もあります。

表のとおり、GPT-5.5とGPT-5-miniでは入力で20倍、出力で15倍の差があります。社内の問い合わせ対応や文章の下書きなど、多くの業務は軽量モデルで足りる場合があり、どのモデルを標準にするかが月額を大きく左右します。モデルごとの得意分野の違いは主要4AIの違いと使い分けも参考になります。

デプロイ種別(Global・Data Zone・Regional)で同じモデルでも単価が変わる

Azure OpenAIでは、モデルを使える状態にすることをデプロイと呼び、デプロイの種別でデータを処理する場所が決まります。Globalは任意のAzureリージョンで処理、Data Zoneは米国・EU・アジア太平洋といったMicrosoftが指定した範囲の中で処理、Regional(Standard)は指定した1つのリージョンの中で処理する形です。

MicrosoftのFAQは価格差を「グローバル(最低)→ データ ゾーン(最大 10% premium)→ リージョン(グローバルに対する 10〜25% premium、リージョンによって異なる)」と説明しています。実際に、公式料金ページの既定の表示ではGPT-5.5のData Zoneは入力5.50ドル・出力33ドルで、Globalの1.1倍です。一方、東日本を指定してRetail Prices APIから取得した円建て単価では、GPT-5.4 miniのData Zoneが入力143.388円・出力860.328円で、Globalの1.2倍と、FAQの最大10%を上回っていました。どの地域の範囲で処理するかによってData Zoneの単価も違うので、見積もりは実際に使うリージョンを選んで確認してください。

リージョンによる単価と提供モデルの違い|国内で処理したい場合

社内規程で「データは国内で処理する」と決めている場合、対象になるのはRegionalのデプロイです。東日本(japaneast)のRegionalの円建て単価は、GPT-4.1 miniで入力77.1円・出力308.4円(100万トークンあたり)と、Globalの約1.21倍でした。GPT-4o(2024-11-20版)も入力481.9円・出力1,927.8円で、Globalの約1.21倍です。

注意したいのは、新しいモデルほど国内のRegionalで使えるとは限らない点です。Microsoft Learnのモデルのライフサイクルの説明では、新しいモデルはGlobal Standard、Global Provisioned、Data Zone、リージョン指定の順に提供され、Global Standard以外での提供は保証されないとされています。2026年9月17日に取得した東日本の円建て単価の一覧では、GPT-5系の従量課金(Standard)のトークン単価はGlobalとData Zoneの行だけで、Regionalの行は見当たりませんでした(Provisionedの価格表にはGPT-5.5のRegionalの単価があります)。使いたいモデルを国内のRegionalで実際に使えるかは、Microsoft Learnのリージョン別の提供状況のページで確認し、Globalより単価が上がる前提で見積もってください。

キャッシュ入力の割引と、割引が効く条件

キャッシュ入力は、以前の要求と先頭が同じ入力を送るときに適用される割引です。GPT-5.5では入力5ドルに対してキャッシュ入力0.50ドルで、10分の1になります。ただし、どんな入力でも割り引かれるわけではありません。Microsoft Learnのプロンプトキャッシュの説明では、次の条件が示されています。

  • 入力が1,024トークン以上であること
  • 入力の先頭1,024トークンが、以前の要求と完全に同じであること
  • Standardでは入力単価の割引、Provisionedでは入力トークンが最大100%割引

つまり、社内規程やマニュアルなど毎回同じ長い前置き(システムプロンプト)を先頭に置き、質問ごとに変わる部分を後ろに回す作りにすると、割引が効きやすくなります。逆に、先頭に日時や利用者名など毎回変わる情報を入れると、先頭が一致せず割引が効きません。なお、Learnには、GPT-5.6以降のモデルではキャッシュの書き込みに料金がかかる場合があると記載されています。

長い入力には別の単価がある

一部のモデルは、入力が長くなると別の単価に切り替わります。公式料金ページでは、GPT-5.4は272kトークン未満と272kトークン超で行が分かれていて、272k超のGlobalでは入力5ドル・出力22.50ドル(272k未満は入力2.50ドル・出力15ドル)です。GPT-5.5にもLong Contextの行があり、Globalで入力10ドル・出力45ドルと、通常の入力5ドル・出力30ドルより高く設定されています。長い契約書や議事録を何本もまとめて読ませる使い方を想定している場合は、この単価で見積もってください。

社員数別の月額試算|10名から200名まで

試算すると、GPT-5-miniで軽い質問中心なら社員200名でもモデル利用料は月2万円未満に収まる一方、GPT-5.5で文書の要約を多用すると50名で月17万円を超えます。人数よりも、モデルと1回あたりのトークン量のほうが月額を大きく動かします。

試算の前提

  • 対象の社員全員が、1人1日10回使う
  • 1か月の営業日は20日
  • 使い方A(軽い質問中心):1回の入力2,000トークン、出力1,000トークン。1人あたり月に入力40万トークン、出力20万トークン
  • 使い方B(文書の要約中心):1回の入力10,000トークン、出力2,000トークン。1人あたり月に入力200万トークン、出力40万トークン
  • 出力のトークン数は、推論モデルが内部で使う推論トークンを含めた数と仮定する
  • Standard・Globalの円建て単価(前述の表)で計算し、キャッシュ入力の割引は使わない
  • モデル利用料だけを計算し、App ServiceやAI Searchなどの費用は含まない

1人あたりの月額は、GPT-5-miniの使い方Aなら、入力0.4×39.83円+出力0.2×318.64円=79.66円です。これに人数を掛けて表にしています。

月額の試算例:使い方A(軽い質問中心)

社員数GPT-5-miniGPT-5.4 miniGPT-5.5
10名約797円約1,912円約12,746円
30名約2,390円約5,736円約38,237円
50名約3,983円約9,559円約63,728円
100名約7,966円約19,118円約127,456円
200名約15,932円約38,237円約254,912円

※1人あたり月額はGPT-5-mini 79.66円、GPT-5.4 mini 191.184円、GPT-5.5 1,274.56円。人数を掛けて円未満を四捨五入しています。

月額の試算例:使い方B(文書の要約中心)

社員数GPT-5-miniGPT-5.4 miniGPT-5.5
10名約2,071円約5,258円約35,050円
30名約6,213円約15,773円約105,151円
50名約10,356円約26,288円約175,252円
100名約20,712円約52,576円約350,504円
200名約41,423円約105,151円約701,008円

※1人あたり月額はGPT-5-mini 207.116円、GPT-5.4 mini 525.756円、GPT-5.5 3,505.04円。人数を掛けて円未満を四捨五入しています。

試算を読むときの注意

この表は、見積もりの桁をつかむための目安です。実際の請求では、次の点でずれが出ます。

  • 使う人と使わない人の差:全員が毎日10回使うことは少なく、実際には一部の人に利用が偏りがちです。一方で、よく使う人は1日数十回使うこともあります。
  • 会話の長さ:1回ごとに新しい会話を始める前提で計算しています。同じ会話を続けると、次の章で説明するとおり入力が積み上がります。
  • 推論の量:推論モデルは、難しい質問ほど内部で多くのトークンを使います。出力1,000トークンの仮定を大きく超える回もあります。
  • 為替:円建て単価は米ドル基準で毎月見直されるため、翌月以降は同じ使用量でも円の金額が変わることがあります。

見積もりを社内の稟議に出すときは、表の金額に加え、使い方Bに近い利用が増えた場合の上振れ幅と、次に説明するモデル以外の費用を並べておくと、予算の枠を決めやすくなります。生成AI全般の費用の管理の考え方は生成AIのコスト管理で整理しています。

請求が想定より膨らむ4つの仕組み

Azure OpenAIの請求が見積もりより膨らむ原因の多くは、利用者の画面には表示されないトークンです。会話の履歴、添付した資料、推論、エラー時の処理の4つを知っておくと、ずれの理由を説明できます。

会話を続けると入力トークンが積み上がる

チャット型の画面では、AIに前の会話を踏まえて答えさせるため、過去のやり取りをまとめて毎回送る作りにすることが一般的です。この場合、会話が続くほど1回あたりの入力が増えます。

たとえば、毎回送る前置き(システムプロンプト)が1,000トークン、利用者の質問が1回200トークン、AIの回答が1回800トークンの会話を考えます。1往復目の入力は1,200トークンですが、5往復目には過去4往復分(4,000トークン)が加わって5,200トークン、10往復目には10,200トークンになります。10往復の入力の合計は57,000トークンで、毎回新しい会話で同じ質問をした場合の12,000トークンの約4.75倍です。

GPT-5.5で計算すると、10往復を1つの会話で続けた場合は入力約45.4円+出力約38.2円で約83.6円、1往復ごとに会話を新しくした場合は入力約9.6円+出力約38.2円で約47.8円です。社員が1つの会話を1日中使い続ける使い方が広がると、試算表の前提より入力が増えます。話題が変わったら新しい会話を始めるよう社内で案内するか、アプリ側で送る履歴の長さを区切る設計にすると抑えられます。

長い資料を添付して何度も質問する場合

資料を読ませて質問する使い方では、資料の内容が質問のたびに入力として送られます。仮に20,000トークンの資料について5回質問すると、資料だけで入力は10万トークンで、GPT-5.5では約79.7円です。

ここでキャッシュ入力の割引が効くと、金額は大きく変わります。資料を入力の先頭に置いて5回とも同じ形で送り、2回目以降の20,000トークンがキャッシュ入力の単価(79.66円/100万トークン)で計算された場合、1回目の約15.9円と2〜5回目の約6.4円を足して約22.3円になり、約7割減ります。ただし、キャッシュが常に当たる保証はないため、見積もりでは割引なしの金額を上限として置き、割引は下振れ要因として扱うのが安全です。

推論トークンは画面に出ないが出力として課金される

GPT-5系やo系列などの推論モデルは、回答を返す前に内部で考えるためのトークン(推論トークン)を使います。Microsoft Learnの推論モデルの説明には、推論トークンはメッセージの内容には表示されないものの、コンテキストの枠を使い、出力トークンとして課金されると書かれています。1回の要求で使われる推論トークンは、問題の難しさによって数百から数万トークンまで幅があるとも説明されています。

たとえば、画面に表示される回答は300トークンでも、内部で2,000トークン考えていれば、出力として課金されるのは2,300トークンです。GPT-5.5なら、表示分だけなら約1.4円のところ、約11.0円になります。Learnには、出力の上限に達すると、目に見える回答が出る前に止まり、入力と推論トークンの料金だけがかかって回答が得られない場合があるとも書かれています。

推論の量は、reasoning_effortという設定で調整できます。モデルによって指定できる値は異なり、none、minimal、low、medium、high などがあります。単純な言い換えや要約なら推論を軽くし、複雑な分析だけ重くする使い分けが、出力の課金を抑える実務的な方法です。

エラーでも課金される場合とされない場合

MicrosoftのFAQでは、コンテンツフィルター(不適切な内容を検知して止める安全機能)で400エラーが返った場合でも、処理が行われていれば課金されるとされています。一方、認証エラーの401と、上限超過の429は課金されません。社内で使うアプリを作る場合は、フィルターに止められた要求を自動で何度も送り直す作りにすると、回答が得られないまま料金だけが増えることがあります。

モデル利用料以外にかかる費用

社員向けに使える形にすると、モデル利用料より、画面・検索・閉域接続などAzureの周辺の費用のほうが大きくなることがあります。見積もりでは、モデル以外の費用を最初から行を分けて積み上げておく必要があります。

テキスト以外のメーター:埋め込み・画像・音声・組み込みツール

文章の生成以外にも、用途ごとに別の料金があります。公式料金ページとRetail Prices API(2026年9月17日確認・米ドル換算)で確認した主なものは次のとおりです。

  • 埋め込み(文章を検索用の数値に変換する処理):Globalでtext-embedding-3-smallは1,000トークンあたり0.00002ドル、text-embedding-3-largeは0.00013ドル。社内文書を検索させる仕組み(RAG)を作ると、文書を取り込むときと検索のたびにかかります。
  • 画像:GPT-Image-1.5のGlobalは100万トークンあたり、入力テキスト5ドル、入力画像8ドル、出力画像32ドル。画像もトークンで課金されます。
  • 音声:GPT-Transcribe(文字起こし)のGlobalは1時間あたり0.27ドル、GPT-4o-mini-TTS(読み上げ)は音声出力が100万トークンあたり12ドル。
  • 組み込みツール:Globalで、File Search(ファイル検索)はベクトル保存1GBあたり1日0.10ドル(料金ページの表示では1GBまで無料)、Code Interpreter(コードの実行)は1セッションあたり0.03ドルで、1セッションは既定で1時間有効です。

社内文書を読ませて答えさせる仕組みの全体像は、RAGとはで解説しています。

ファインチューニングの費用|使っていなくてもホスティング料金がかかる

ファインチューニング(自社のデータで追加学習させたモデルを作ること)は、学習の料金と、作ったモデルを置いておく料金の2段階でかかります。公式料金ページでは、GPT-4.1のGlobalで学習が100万トークンあたり25ドル、ホスティングが1時間あたり1.7ドルです。

ホスティングについて、Microsoft Learnのコスト管理の説明は、デプロイしたモデルごとの時間課金で、モデルを使っていなくてもかかると明記しています。東日本の円建て単価ではgpt-4.1のファインチューニング済みモデルのホスティングが1時間あたり270.844円で、1か月を730時間とすると約197,716円です。試しに作ったモデルを置いたままにすると、誰も使わなくても毎月この金額がかかります。なお、Learnには、15日を超えて使われないファインチューニング済みモデルのデプロイは自動で削除されるとも書かれています(モデル自体は残り、再デプロイできます)。社内のQ&A程度なら、ファインチューニングより、前述のRAGやシステムプロンプトの工夫で足りることが多く、先にそちらを検討するのが費用面では無理がありません。

モデル利用料以外のAzure費用(AI Search・App Service・閉域接続・ログ)

社員がブラウザから使える社内向けのAIを作る場合、次のようなAzureのサービスを組み合わせることになります。Microsoft Learnのコスト管理の説明も、見積もりの際はAI Searchなど一緒に使うサービスを料金計算ツールに加えるよう案内しています。円の金額は、東日本の円建て単価(プライベートエンドポイントはリージョン共通の単価)を1か月730時間で換算したものです。

  • Azure AI Search(社内文書の検索):Freeの価格レベルがあり、有料はBasicが1時間21.1896円で月約15,468円、Standard S1が1時間70.7381円で月約51,639円。
  • App Service(画面を動かすサーバー):Linuxの場合、Basic B1が1時間3.0271円で月約2,210円、Premium v3のP1 v3が1時間29.9522円で月約21,865円。
  • プライベートエンドポイント(インターネットを通らずにAzure OpenAIへつなぐ入口):1つあたり1時間1.5932円で月約1,163円。加えて、通過するデータ1GBあたり1.5932円(受信・送信それぞれ)。
  • VPN Gateway(社内ネットワークとAzureを暗号化してつなぐ装置):VpnGw1が1時間30.2708円で月約22,098円。接続ごとの料金が別にかかります。
  • Log Analytics(ログの保存と分析):Analytics Logsの取り込みは1GBあたり532.1288円。価格データでは最初の5GBまでが0円の段になっています。

Microsoft Learnによると、Azure OpenAIのリソースは初期状態ではすべてのネットワークからの接続を受け付けます。社内規程でインターネット経由の接続を認めない場合は、プライベートエンドポイントと、社内からつなぐためのVPN GatewayまたはExpressRouteが必要になり、その分の費用が加わります。これに、ストレージや認証の設定、監視の仕組みが続きます。どの規程を満たす必要があるかは、生成AIのセキュリティチェックリストで先に整理しておくと、見積もりの項目の漏れを防げます。

Provisionedの最小構成はいくらか

Provisionedには、モデルとデプロイ種別ごとに最小のPTU数があります。公式料金ページでは、GPT-5.5やGPT-5-miniなどのGlobalとData Zoneは最小15PTU、Regionalは最小50PTU(GPT-4.1 miniやo4-miniなど一部は25PTU)です。東日本の円建て単価で、1か月730時間として最小構成を計算すると次のようになります。

  • Global・15PTU:時間課金なら1PTU 1時間159.32円×15×730時間=約174万円/月。1か月予約なら1PTUあたり41,423.2円×15=約62万円/月。1年予約なら1PTUあたり422,516.64円×15=約634万円/年。
  • Data Zone・15PTU(東日本):時間課金なら191.184円×15×730時間=約209万円/月。1か月予約なら49,707.84円×15=約75万円/月。
  • Regional・50PTU(東日本):時間課金なら391.9272円×50×730時間=約1,431万円/月。1か月予約なら56,080.64円×50=約280万円/月。

※公式料金ページの既定の表示(米ドル)では、Globalは1PTUあたり時間1ドル・月間予約260ドル・年間予約2,652ドル、Data Zoneは時間1.10ドル・月間予約286ドル、Regionalは時間2ドルです。東日本を指定したRetail Prices APIの円建て単価は、Data ZoneとRegionalでこの表示より高い値でした。

社員200名以下の社内利用で、最小でも月数十万円からの固定費になるProvisionedが合うケースは限られます。応答の速さを保証したい顧客向けのサービスや、Standardの上限に何度も当たるほど大量に処理する場合の選択肢と考えるのが現実的です。

見積もりの手順と、無料で試せる範囲

見積もりは、Azure料金計算ツールでモデル利用料の行を作り、同じ見積もりにAI SearchやApp Serviceの行を足していく形で作ります。無料クレジットで実際のトークン量を測ってから数字を入れると、前提のずれを小さくできます。

Azure料金計算ツールでの見積もり手順

料金計算ツール(https://azure.microsoft.com/ja-jp/pricing/calculator/)の画面は、2026年9月17日時点で次の流れで使えます。画面の表記は変わることがあります。

  1. 製品の検索欄でAzure OpenAIを検索し、Azure OpenAI Serviceを見積もりに追加する
  2. リージョンを選ぶ(国内で処理したい場合はJapan EastやJapan Westを選び、使いたいモデルが選択肢にあるかを確認する)
  3. モデルの種類(言語モデル、埋め込み、画像、音声、微調整モデルなど)とモデルを選ぶ
  4. 価格戦略(Standard、バッチ、プロビジョニング済みスループット ユニット)と、デプロイの種類(グローバル、データ ゾーン、地域)を選ぶ
  5. 入力・キャッシュされた入力・出力のトークン数を、1,000トークン単位で入れる
  6. 画面下部の通貨を日本円に切り替え、AI Search、App Service、Virtual Network、Log Analyticsなど一緒に使うサービスを同じ見積もりに追加する
  7. サインインしてエクスポートや保存をし、社内の稟議資料に添付する

トークン数の欄には、前章の試算と同じく、1人1日の回数×1回のトークン数×営業日数×人数で出した月間の合計を入れます。使い方Aの社員50名なら、入力は2,000万トークン(1,000トークン単位で20,000)、出力は1,000万トークン(同10,000)です。計算ツールは価格の見積もりで、実際の価格は契約の種類や購入日、為替で変わることがあると公式ページにも注記されています。

無料で試せる範囲(USD200分のクレジット・30日)

Azureの無料アカウントでは、30日間使えるUSD200分のクレジットが案内されています。公式の購入オプションの説明では、期間が終わっても自動で有料には移行せず、本人が従量課金への切り替えを選ぶ仕組みで、切り替えない場合はアカウントとサービスが無効になります。

このクレジットは、前述のトークン数の実測に向いています。GPT-5-miniなら入力100万トークンが39.83円なので、社内の代表的な質問や資料で数百回試しても、クレジットの一部で収まる計算です。ただし、無料アカウントで使えるモデルやクォータは有料のサブスクリプションより限られる場合があるため、作成後にクォータの画面で確認してください。実測で得た1回あたりの入力・出力・推論トークンを試算の前提に置き換えると、稟議に出す数字の説得力が上がります。

利用開始の流れと、料金が発生し始めるタイミング

利用開始の流れは、Azureサブスクリプションの作成、Azure OpenAIのリソース作成、モデルのデプロイ、PlaygroundやAPIでの利用の順です。手順の詳細はAzure OpenAIとはで説明しています。

料金の面で押さえておきたいのは、どの時点で課金が始まるかです。Standardのデプロイは、作っただけではトークンの料金はかからず、要求を送った分から課金されます。一方、Provisionedはデプロイを作った時点からメーターが動き、ファインチューニング済みモデルはデプロイしている間ホスティング料金がかかります。AI SearchやApp ServiceやVPN Gatewayも、作った時点から時間単位の料金が発生します。検証が終わったら、使わないリソースを削除するところまでを手順に入れておくと、試しに作ったものの請求が続く事態を防げます。

使いすぎを止める方法の比較

Azure OpenAIには、予算額に達したら自動で利用を止める機能がありません。月の合計を止めるには、アプリ側の上限やAPI Managementのトークン上限など追加の仕組みが必要で、クォータや出力の上限はそれぞれ止められるものが違います。

予算設定・アラート・コスト分析での監視|通知は利用を止めない

Azureには、Cost Managementのコスト分析で費用の推移を見る機能と、予算を設定してしきい値でアラートを送る機能があります。ただし、Microsoft Learnの予算のチュートリアルは、しきい値を超えてもリソースは影響を受けず、利用は止まらないと説明しています。さらに、費用データの反映には通常8〜24時間かかり、予算の評価は24時間ごとです。

Microsoft Learnのコスト管理の説明にも、OpenAIには予算を超えないようにするハードリミットの選択肢があるが、Azure OpenAIには現時点でその機能がない、という趣旨の記載があります。同じ箇所には、予算通知のアクショングループから自動処理を起動してより高度な対応をとることはできるが、そのためには追加の独自開発が必要だとも書かれています。この場合も、費用データの反映が8〜24時間遅れる点は変わりません。予算アラートそのものは、使いすぎに気づくための仕組みで、止めるための仕組みではありません。アラートの宛先は、請求を見る経理だけでなく、デプロイを操作できる担当者にも届くようにしておく必要があります。

止める手段1:TPMクォータを絞る

クォータは、リージョン・モデル・デプロイ種別ごとに決まる、1分あたりに処理できるトークン数(TPM)の上限で、デプロイごとに割り当てます。割り当てを小さくすると、上限を超えた要求は429エラーで断られ、429には課金されません。

ただし、TPMはあくまで1分あたりの速さの上限で、月の合計の上限ではありません。仮に10,000 TPMに絞っても、24時間30日上限いっぱいに使い続けた場合の理論上の量は4億3,200万トークンです。一部の人やプログラムが大量に使い続ける事態を和らげる効果はあっても、月額を一定以下に抑える保証にはなりません。なお、クォータはサブスクリプション単位で、Free Tierと Tier1〜6の段階があり、利用量に応じて自動で上の段階に上がる仕組みです(自動昇格は止めることもできます)。

止める手段2:出力の上限を設ける

1回の要求で使われる出力を抑えるには、Responses APIのmax_output_tokens、Chat Completions APIのmax_completion_tokensで上限を指定します。Microsoft Learnによると、この上限は推論トークンと表示される出力の両方を含みます。1回の請求額の天井を決められる一方、上限が小さすぎると回答が途中で切れたり、前述のとおり回答が出る前に止まって料金だけかかったりします。用途ごとに実測して、足りる範囲で設定するのが前提です。

止める手段3:月単位のトークン上限を設ける(アプリ側またはAPI Management)

月の合計を一定以下に抑えたい場合は、Azure OpenAIの前段に上限の仕組みを置きます。方法は主に2つです。

  • アプリ側で利用者ごとの上限を持つ:社員が使う画面(アプリ)の側で、利用者ごと・部署ごとの月間トークン数を記録し、上限に達したら要求を送らない仕組みです。Azure OpenAIの応答には使用トークン数が返るので、それを集計すれば実装できますが、開発と保守の手間がかかります。
  • API Managementのトークン上限を前に置く:AzureのAPI Management(APIの入口をまとめて管理するサービス)には、llm-token-limitというポリシーがあります。Microsoft Learnによると、キーごとに1分あたりのトークン数の上限と、期間あたりのトークン数の上限を設定でき、期間にはHourly・Daily・Weekly・Monthly・Yearlyを指定できます。期間の上限を超えると403エラーを返します。数えるのは入力と出力のトークンで、同時に届いた要求では一時的に上限を超えることがあるとも説明されています。API Management自体の利用料が別にかかります(このポリシーはConsumptionの価格レベルでは使えません)。

手段ごとの違い:予算アラートは気づくための通知で、利用は止めない(反映は8〜24時間遅れる)。TPMクォータは1分あたりの速さを止めるが、月の合計は止めない。出力の上限は1回あたりの金額を止めるが、回数は止めない。月の合計を止めるには、アプリ側で利用者ごとの上限を持つか、API Managementのトークン上限(月単位を設定できる)を前に置くなど、追加の仕組みが要る。予算通知から自動処理を起動する方法もあるが、追加の開発が必要で、費用データの反映も8〜24時間遅れる。

社員が個人で契約した生成AIを業務に使う、いわゆる野良AIの対策として社内向けのAIを用意する場合は、上限の設計まで含めて計画しておかないと、会社で用意した環境のほうで費用の管理が難しくなることがあります。

使いすぎは、上限で止まる環境なら自分で作らずに済む

従量課金では、止める仕組みを自分たちで作らない限り、使った分だけ請求が増え続けます。UPGEAR AI(アップギアAI)は、ChatGPT・Claude・Gemini・Perplexityを1つの契約で使える法人向けサービスです(人数無制限)。

費用を抑える方法|軽量モデル・出力の長さ・Batch・キャッシュ

費用を抑える主な方法は、標準のモデルを軽量モデルにする、出力と推論を必要な長さに絞る、急がない処理をBatchに回す、キャッシュが効く入力の形にする、などです。

  • 軽量モデルを標準にし、上位モデルは用途を限るGPT-5-miniとGPT-5.5の単価差は入力20倍・出力15倍です。社内の質問対応や下書きは軽量モデル、複雑な分析だけ上位モデルというように、デプロイを分けて使い分けます。
  • 出力の長さと推論の重さを制御する出力は入力より単価が高いため、回答の長さの指示、max_output_tokensの上限、reasoning_effortの調整で、課金の大きい出力側を絞ります。
  • 急がない処理はBatchに回す24時間以内の返却でよい大量の要約や分類は、Batchで50%割引になります。
  • キャッシュが効く入力の形にする毎回同じ長い前置きを先頭に置き、1,024トークン以上の一致を作ります。GPT-5.5ならキャッシュ入力は通常の入力の10分の1の単価です。
  • 会話の履歴を区切る話題が変わったら新しい会話にする、送る履歴の長さに上限を設けるなど、入力の積み上がりを抑えます。
  • 使っていないリソースを削除するProvisioned、ファインチューニング済みモデル、AI Search、VPN Gatewayなど時間課金のリソースは、使わなくなったら削除します。

もう一つ見落としやすいのが、モデルの世代交代です。Microsoft Learnによると、一般提供のモデルは提供開始から12か月で新規の利用ができなくなり、18か月で提供が終了します。終了の通知は少なくとも60日前で、Standard系のデプロイは自動でアップグレードされ、Provisionedはされません。新しいモデルの単価が今と同じとは限らないため、1年先の予算を組むときは、使っているモデルの提供終了時期と、後継モデルの単価を確認しておく必要があります。

OpenAIのAPIとの違いと、円で払うときの注意

Globalで使う限り、Azure OpenAIとOpenAIのAPIのトークン単価は、確認した範囲では同じです。違いは、処理する地域を選べることと、その分の単価差、請求と契約がAzureにまとまることにあります。

OpenAI APIを直接使う場合との違い

2026年9月17日にOpenAIのAPI料金ページで確認したところ、GPT-5.5は入力5.00ドル・出力30.00ドル、GPT-5-miniは入力0.25ドル・出力2.00ドル、GPT-4.1は入力2.00ドル・出力8.00ドル(いずれも100万トークンあたり)で、Azure OpenAIのGlobalの単価と同じでした。

料金面で異なるのは次の点です。

  • Azureでは、Data ZoneやRegionalを選んで処理する地域を絞れる。その代わりGlobalより単価が上がる
  • Microsoftは、OpenAIには予算を超えないハードリミットの選択肢があるが、Azure OpenAIには現時点でないと説明している
  • Azureでは、AI SearchやApp Service、閉域接続など他のAzureサービスと同じ請求にまとまる
  • Azureのモデルは、OpenAIが運営するサービス(ChatGPTやOpenAIのAPI)とやり取りしないとMicrosoftは説明している

API全体の料金の考え方は、ChatGPT APIの料金でも解説しています。

円で払うときの請求の実務

Microsoft顧客契約(MCA)のFAQにある通貨表では、日本の請求通貨は日本円です。ただし、公式料金ページの注記によると、価格は米ドルに基づいて計算され、前月末の2営業日前に取得されたロンドン市場の終値レートで換算され、そのレートが翌1か月の取引に適用されます。このため、使用量が同じでも、為替が動けば翌月の円の請求額は変わります。

稟議で年間の予算を取るときは、円建て単価を確認した日と、そのときの換算の水準(2026年9月17日時点では1ドル=159.32円相当)を資料に書いておき、為替が動いた場合の幅を持たせておくと、後から説明がしやすくなります。購入はAzureのWebサイト、Microsoftの担当者、Azureパートナーのいずれかを通じて行う形で、支払い方法や請求の形は契約の種類によって異なるため、購入経路ごとに確認してください。

社内向けAIを自作する見積もりと既製サービスの比べ方

Azure OpenAIで社内向けのチャットAIを自作する費用は、モデル利用料だけでは決まりません。周辺のAzure費用と、作って動かし続ける人手を足した総額で、法人向けの既製サービスと比べる必要があります。

自作で積み上がる費用の項目

  • モデル利用料:この記事の試算表の金額。モデルと使い方で数十倍変わる
  • Azureの周辺費用:App Service、AI Search、ストレージ、プライベートエンドポイント、VPN Gateway、Log Analyticsなど。構成によっては月数万円からの固定費になる
  • 画面と機能の開発:チャット画面、会話履歴の保存、資料の取り込み、利用者ごとの上限、管理画面
  • 運用の人手:社員のアカウント追加と削除、問い合わせ対応、モデルの提供終了に合わせた切り替えと動作確認、費用の監視

開発と運用の人手は、社内の担当者の工数でまかなうか、開発会社への委託費になるかで金額が大きく変わり、一律の相場を示すことはできません。ただ、モデルが12〜18か月で入れ替わる前提では、作って終わりではなく、年に1回以上は切り替えと検証の作業が発生すると見込んでおく必要があります。

会社で安全に使うために必要な仕組み

社員に配るAIとして使うには、料金以外に次の仕組みも必要です。

  • 入力したデータがモデルの学習に使われない環境であること(Azure OpenAIでは、プロンプトや出力がOpenAIに提供されず、許可なくモデルの学習に使われないとMicrosoftは説明しています)
  • 誰がいつ何を入力したかを後から確認できる、利用ログの保存と閲覧の仕組み
  • 社員へのアカウント配布と、退職時の停止、部署ごとの権限
  • ChatGPT系以外のAIも用途に応じて使い分けられること(複数のAIをまとめて使う方法を参照)
  • 社内ルールの整備と周知(生成AIガイドラインを参照)

これらを自社で組み上げるか、最初から備えた法人向けのサービスを契約するかは、社内に開発と運用を担える人がいるか、どこまで自社の業務に合わせて作り込みたいかで判断が分かれます。法人向け生成AIサービスの料金は法人向け生成AI 38サービスの料金比較で、ChatGPTの法人プランはChatGPT法人プランの料金で比べられます。比べるときは、自作側の見積もりにモデル利用料だけでなく、周辺費用と人手を入れたうえで、同じ月額の単位にそろえることが大切です。

よくある質問

Azure OpenAIは月額いくらから使えますか?

Standardで使う場合、決まった月額はなく、送ったトークン(入力)と返ってきたトークン(出力)の量に応じて課金されます。2026年9月17日時点のMicrosoft公開の円建て単価で、GPT-5-miniを社員10名が軽い質問中心に使う前提(1人1日10回、1回の入力2,000トークン・出力1,000トークン、月20営業日)では、モデル利用料は月約797円です。画面を作るためのApp ServiceやAI Searchなどの費用は別にかかります。

社員50名で使うと月にいくらかかりますか?

モデルと使い方で大きく変わります。1人1日10回、月20営業日の前提で、軽い質問中心(入力2,000・出力1,000トークン)ならGPT-5-miniで月約3,983円、GPT-5.5で月約63,728円です。文書の要約中心(入力10,000・出力2,000トークン)ならGPT-5-miniで月約10,356円、GPT-5.5で月約175,252円です。いずれもモデル利用料だけの金額です。

Azure OpenAIは無料で試せますか?

Azureの無料アカウントでは、30日間使えるUSD200分のクレジットが案内されています。期間が終わると自動では有料に切り替わらず、本人が従量課金への切り替えを選ぶ仕組みで、切り替えない場合はアカウントとサービスが無効になります。

予算を超えたらAzure OpenAIは自動で止まりますか?

止まりません。Azureの予算機能はしきい値を超えたときに通知を送るだけで、リソースは影響を受けず利用も止まらないとMicrosoftは説明しています。費用データの反映には通常8〜24時間かかります。TPMクォータや出力の上限は速さや1回あたりの量を抑える手段で、月の合計は止めません。月の合計を止めるには、アプリ側で利用者ごとの上限を持つか、API Managementのトークン上限(月単位を設定できる)を前に置くなど、追加の仕組みが必要です。予算通知から自動処理を起動する方法もありますが、追加の開発が必要で、費用データの反映の遅れも残ります。

OpenAIのAPIを直接使うより高いですか?

2026年9月17日に確認した範囲では、GPT-5.5、GPT-5-mini、GPT-4.1のGlobalの単価はOpenAIのAPI料金ページと同じでした。データを処理する地域を絞るData ZoneやRegionalを選ぶと、Globalより単価が上がります。

Azure OpenAIの料金は円で払えますか?

Microsoft顧客契約の通貨表では、日本の請求通貨は日本円です。ただし価格は米ドルを基準に計算され、ロンドン市場の終値レートで換算した値が翌1か月に適用されると料金ページに記載されています。同じ使用量でも月によって円の請求額が変わることがあります。

まとめ

Azure OpenAIの料金は、モデルと使い方で数十倍変わる従量課金が基本で、社員数より、どのモデルを標準にし、1回にどれだけのトークンを使うかが月額を決めます。2026年9月17日時点の円建て単価で、社員50名が1人1日10回、軽い質問中心に使う前提なら、モデル利用料はGPT-5-miniで月約3,983円、GPT-5.5で月約63,728円でした。

  • 入力と出力は別単価で、出力のほうが高い。推論トークンは画面に出ないが出力として課金される
  • 国内で処理したい場合はRegionalになり、単価が上がり、使えるモデルが限られることがある
  • 会話の履歴や添付資料は毎回入力として送られ、請求を押し上げる。キャッシュの割引は先頭1,024トークン以上の一致が条件
  • 画面、検索、閉域接続、ログなどAzureの周辺費用は、モデル利用料と行を分けて見積もる
  • 予算アラートは利用を止めない。月の合計を止めるには、アプリ側の上限やAPI Managementのトークン上限など追加の仕組みが要る

見積もりの前に、無料クレジットで自社の質問と資料のトークン数を実測し、料金計算ツールでモデル以外の費用も含めた総額を作ることから始めてください。ほかの料金記事やAI活用の解説はAI活用コラム一覧にまとめています。

社内向けAIを作る前に、既製の法人向けサービスと総額で比べてみませんか

UPGEAR AIは、ChatGPT・Claude・Gemini・Perplexityを1画面で使える法人向けの生成AIサービスです。管理者ダッシュボードで利用ログ・権限・モデルのON/OFFを管理でき、データの保管とログ管理は国内サーバー(AWSの日本リージョン)で行います。UPGEAR AIの料金は月額30,000円(税抜)からで、ユーザーごとの課金はありません(人数の目安はライト1〜5名、スタンダード6〜20名、プレミアム21〜50名)。初期費用100,000円(税抜)が別途かかります。上限に近づくと、管理者宛に複数回メールでお知らせします。上限に達した時点で利用を停止する安全設計のため、知らないうちに超過して追加の請求が発生することはありません。

UPGEAR AIの詳細を見る