
ローカルLLMサーバーとは、社内に置いた1台のサーバーでAIのモデルを動かし、複数の社員がブラウザや社内のツールから共有して使う仕組みのことです。積むGPUのメモリは「モデル本体の大きさ」に「同時に処理する会話の数×会話の長さ」の分を足して決まり、何人まで使えるかも、社員数ではなくこの同時に処理する会話の数で考えることになります。運用では、使う人の確認(認証)・記録・更新・障害時の対応・退職者の停止を受け持つ担当者が要り、この担当を社内に置けるかどうかが、自前で持つかどうかの分かれ目になるでしょう。仕組みそのものはローカルLLMとは、1台のPCの選び方はローカルLLMに必要なPCで詳しくまとめています。
ローカルLLMサーバーとは|クラウドのAIや1台のPCとの違い
ローカルLLMサーバーは、クラウドのAIのように社外の事業者へ文章を送らず、社内の機械の上でモデルを動かして答えを返す点が特徴になります。1台のPCで動かす形とは、使う人が1人か複数かという点で違いが出てきます。自分のPCで試すだけなら実行ソフトの初期設定のままで足りますが、複数人で共有すると、同時に届いた質問をさばく仕組み、使う人の確認、記録の残し方まで考えることになってしまいます。クラウドのAIとの費用や使い勝手の違いはローカルLLMとクラウドのAIの比較で整理していますので、あわせてご覧ください。
| 比べる点 | 1台のPCで動かす | 社内サーバーで共有する |
|---|---|---|
| 使う人 | 本人だけ | 部署や全社の複数人 |
| 実行ソフトの初期設定 | そのままで使える(Ollamaは既定で自分のPCの中からの要求だけを受け付ける) | 社内のネットワークに公開する設定が要る |
| 同時に届く質問 | ほぼ1件ずつ | 重なる。同時に処理する数の設定と、その分のメモリが要る |
| 使う人の確認 | なくても困りにくい | 必須。LM Studioのように既定では認証を求めないソフトもある |
| 止まったときの影響 | 本人だけ | 使っている全員 |
| 面倒を見る人 | 本人 | 運用の担当者を決める |
データを社外に出さない利点と、その前提
社内サーバーで動かす大きな利点は、入力した文章や社内の資料を、社外の事業者に渡さずに済むことです。Ollamaは公式のFAQで、手元で動かしている間は質問やデータを同社が見ることはないと説明しています。ただしこれは提供元の説明で、同じソフトでもクラウドのモデルやWeb検索を使うと、その分の文章は社外へ出ることになります。Ollamaには、設定ファイルか環境変数(OLLAMA_NO_CLOUD=1)でクラウドの機能を切る方法が用意されており、切った状態はログで確かめることが出来ます。共有サーバーとして使うなら、最初にこの設定を入れておきましょう。
最初に決める3つ|使う人数・扱うデータ・担当者
社内サーバーの検討は、GPUの機種より先に、使う人数・扱うデータ・担当者の3つを決めるところから始まります。この3つが決まると、必要なメモリ、置き場所と公開の範囲、運用の手間がおおむね連動して決まってきます。
| 決めること | 書き出す中身の例 | 後で何に効くか |
|---|---|---|
| 使う人数と使い方 | 何人が使うか。1日に何回くらい質問するか。長い契約書や議事録を丸ごと読ませるか | 同時に処理する会話の数と、1本の会話の長さ。そこから必要なGPUのメモリ |
| 扱うデータ | 顧客情報・人事情報・契約書など、社外に出せない資料を入れるか。部署ごとに見せてはいけない資料があるか | 社内に置く理由の強さ。社内文書を読ませるときの閲覧範囲。記録の保存期間 |
| 担当者 | 設定・更新・障害対応・アカウントの停止を誰が受け持つか。休みの日の代わりは誰か | 自前で持てるか、既製のサービスにするか |
3つのうち、最初の見積もりに入りにくいのは担当者の時間になります。機械の代金は見積書に載りますが、設定や更新、問い合わせへの対応にかかる時間は、誰かの本来の仕事から差し引かれる形で発生してしまいます。担当者の候補と、その方が月にどのくらいの時間を割けるかを、この段階で書き出してみてください。
GPUのメモリは何で決まるか|モデル本体と会話の作業領域
GPUに載せるメモリ(VRAM)は、モデル本体の大きさに、会話ごとに使う作業領域を足した量が目安になります。作業領域はKVキャッシュと呼ばれ、それまでの会話の中身を覚えておくためのメモリで、会話が長いほど大きくなっていきます。Hugging Faceの公式ブログは、Llama 3.1 8B(16ビットの精度)の例として、モデル本体が16GB、作業領域が会話1本あたり1Kトークン(トークンは文章をAIが扱う単位に区切ったもの)で0.125GB、16Kトークンで1.95GB、128Kトークンで15.62GBと示しています。
この作業領域は、同時に処理する会話の数だけ積み上がります。同じモデルで16Kトークンの会話を10本同時に処理すると1.95GB×10で19.5GB、128Kトークンの会話を4本なら62.48GBとなり、どちらもモデル本体の16GBとは別に必要になってきます。Ollamaの公式FAQも、必要なメモリは同時に処理する数と会話の長さの設定に比例して増えると説明しています。人数が増えて重くなるのはモデル本体ではなく作業領域の側だと押さえておけば、見積もりの考え方がすっきりするでしょう。
※数値はHugging Face公式ブログが示すLlama 3.1 8Bの例です。作業領域の大きさはモデルの構造によって変わるため、他のモデルにはそのまま当てはまりません。
量子化でモデル本体を小さくする
モデル本体の側は、量子化と呼ばれる方法で小さくすることが出来ます。量子化は、モデルの重みを16ビットから8ビットや4ビットのような低い精度で保存し、必要なメモリを減らす方法で、Hugging Faceの公式ドキュメントにも説明があります。llama.cppの資料では、同じLlama 3.1 8Bが16ビットのままなら約14.96GiB、4ビット系の形式の一つ(Q4_K_M)なら約4.58GiBと示されています。ただし重みの量子化で小さくなるのはモデル本体の側で、会話ごとの作業領域は別に見積もらなければなりません。質問ごとにモデルの一部だけを動かすMoE(専門家混合)という作りのモデルも、メモリにはすべてのパラメータを載せる必要があると、Hugging Faceの公式ブログは説明しています。モデルごとの必要メモリの計算はローカルLLMのモデル比較と必要メモリの計算で詳しく扱っていますので、機種を絞る前に一度目を通してみてください。
同時に使う人数から必要なメモリを見積もる|社員10〜200名の判断表
社員が何人いても、まったく同じ瞬間に回答を待っているのはその一部なので、見積もりは社員数ではなく、同時に処理する会話の数から始めましょう。どのくらいの割合が重なるかを示す公式の換算表は、vLLM・Ollama・NVIDIAのいずれの資料にも見当たりません。そこで次の表は、読者の仮定として、社員全員が使い、同時に回答を待っている会話は社員数の1割、1本の会話の長さは16Kトークン、モデルはLlama 3.1 8B(16ビット)という条件を置いて計算しています。
| 社員数 | 同時に処理する会話(1割と仮定) | 作業領域(1本1.95GB×本数) | モデル本体16GBを足した合計 | 容量の上で収まるGPUメモリの例 |
|---|---|---|---|---|
| 10名 | 1本 | 1.95GB | 17.95GB | 32GB(GeForce RTX 5090) |
| 30名 | 3本 | 5.85GB | 21.85GB | 32GB(GeForce RTX 5090) |
| 50名 | 5本 | 9.75GB | 25.75GB | 32GB(余裕は少ない) |
| 100名 | 10本 | 19.5GB | 35.5GB | 48GB(L40S) |
| 200名 | 20本 | 39GB | 55GB | 80GB(H100 SXM)、96GB(RTX PRO 6000 Blackwell) |
※1割・16Kトークン・Llama 3.1 8Bは、いずれも計算のために置いた仮定です。合計はモデル本体と作業領域だけで、実行ソフトが使う分や余裕は含みません。速度(1秒あたりに返せる量)はGPUの性能と設定で変わるため、この表は容量の目安にとどまります。GPUのメモリ容量はNVIDIAの日本語公式サイトの仕様(2026年10月3日〜6日に確認)です。
同じ表でも、仮定を変えると結果は大きく動きます。同時に重なる割合を2割と置けば作業領域は2倍になり、契約書のような長い文書を丸ごと読ませる使い方で1本の会話が128Kトークンになると、10本で156.2GBと、この記事で挙げたどのGPUも1枚では収まらない量になってしまいます。モデルを大きくすると、今度は本体の側が増えます。OpenAIはgpt-oss-120bを80GBのGPU 1枚に収まる設計と説明しており(同社の説明)、Ollamaでのダウンロードサイズは65GBと表示されています。この組み合わせでは、80GBのうち残りは単純計算で15GBほどで、そこに会話ごとの作業領域を収めることになります。表の数字はそのまま発注に使うものではなく、自社の割合と会話の長さに置き換えて試算し直すための型として使ってみてください。
1人用の実行ソフトと複数人向けの推論サーバー|Ollama・LM Studio・vLLM
同じGPUでも、実行ソフトの選び方と設定で、同時にさばける会話の数は変わってきます。
| 比べる点 | Ollama | LM Studio | vLLM |
|---|---|---|---|
| 主な使われ方 | 手元のPCで動かす。設定で社内に公開できる | 手元のPCで動かす。公式ドキュメントの用途例に、1つのLM Studioを複数人で使う形がある | 複数人で使う推論サーバー |
| 同時に処理する数 | 既定は1。OLLAMA_NUM_PARALLELで変える | (この記事では扱わない) | 届いた要求をまとめて処理する。上限はmax_num_seqsで決める |
| 使う人の確認 | 自分のPCのAPIは認証が要らない。公開手順に、使う人を確かめる設定の説明はない | 既定は認証なし。Require Authenticationでトークンを必須にできる | APIキーで守られるのは一部の入口だけ。前段にリバースプロキシを置くよう案内 |
| ライセンス・料金 | MIT License。手元で動かす分は無料 | 職場での利用も無料(2025年7月発表) | Apache License 2.0 |
OllamaやLM Studioは手元のPCで動かす用途を中心にしたソフトで、Ollamaの場合、1つのモデルが同時に処理する要求の数(OLLAMA_NUM_PARALLEL)は既定で1になっています。上限を超えた要求は順番待ちに回り、待たせられる数の既定は512件で、それを超えると過負荷のエラーが返ります。設定で同時に処理する数を増やすことは出来ますが、その分だけ作業領域のメモリも増えていきます。
さらに、OllamaはGPUのメモリが48GiB以上あると、会話の長さの既定値を256Kトークンまで広げる仕様になっています。大きなGPUを積んだサーバーほど既定のままでは1本あたりの作業領域が大きく取られるため、会話の長さ(OLLAMA_CONTEXT_LENGTH)を用途に合わせて決め直しておきましょう。LM Studioにも同じネットワークの他の機器から使える「Serve on Local Network」という設定があり、公式ドキュメントは用途の例に、1つのLM Studioを複数人で使う形を挙げています。ただし既定ではAPIへの要求に認証を求めないため、社内に開くときは「Require Authentication」をオンにし、トークンを発行して配る運用になります。
複数人向けの推論サーバーvLLMの仕組み
複数人での利用を前提に作られた推論サーバーの例が、Apache 2.0ライセンスで公開されているvLLMです。vLLMは、届いた要求を1件ずつ順に処理するのではなく、途中から加わる要求もまとめて計算する「continuous batching(連続バッチ処理)」と、作業領域を細かく区切って無駄なく割り当てる「PagedAttention」を特徴に挙げています。開発チームは2023年の発表で、従来の仕組みではメモリの60〜80%が断片化や確保しすぎで無駄になっていたのに対し、vLLMでは無駄を4%未満に抑えたと説明しました。いずれも開発チーム自身の発表で、第三者が検証した数字ではない点は押さえておいてください。
vLLMの公式ドキュメントには、混雑して作業領域が足りなくなると一部の要求をいったん後回しにして計算し直すため、応答が遅くなるとも書かれています。対処として案内されているのは、同時に処理する数の上限(max_num_seqs)を下げる方法と、GPUを増やしてモデルを複数のGPUに分けて載せる方法になります。構築の手順はローカルLLMの構築手順、Ollamaの設定はOllamaの使い方で解説しています。
自前のサーバーで負担になること|初期費用・運用・人材
自前のサーバーで負担になるのは、機械の代金そのものより、買った後に続く作業のほうです。GPUのドライバと実行ソフトの更新、新しいモデルが出たときの入れ替えと試験、社員からの「遅い」「答えがおかしい」という問い合わせへの対応が、利用が続く限り続いていきます。サーバー向けのGPUは公式に日本円の価格が表示されておらず、見積もりを取らないと予算を組めない点も手間となってしまいます。加えて、止まったときの影響が大きいのも共有サーバーならではの点になります。1台のPCなら困るのは本人だけですが、社員全員が使うサーバーが止まると、その間は全員のAIを使う作業が止まってしまいます。
担当者に求められる知識と、社内に広げる手間
担当者が扱うのは、サーバーの管理、ネットワークとファイアウォールの設定、GPUのドライバ、推論サーバーの設定値までの幅広い範囲です。社内にこうした経験のある方が1人しかいなければ、その方の休みや異動のたびに運用が止まりやすくなるでしょう。機械を置いたあとも、使い方の説明や、入力してよい情報の決まりづくりなど、社内に広げる仕事が別に残ります。ここまでの作業を、専任ではない担当者が本来の仕事と並行して受け持てるかどうか、一度具体的に思い浮かべてみましょう。
更新や障害対応を社内で抱えずに、AIを使う環境を会社で1つにまとめる方法もあります。UPGEAR AI(アップギアAI)は、ChatGPT・Claude・Gemini・Perplexityを1つの契約で使える法人向けサービスです(人数無制限)。
サーバー向けGPUの選び方|冷却・電源・置き場所
サーバーに積むGPUは、メモリの容量に加えて、冷やし方と消費電力まで見て選ぶ必要があります。
| 製品 | メモリ | 消費電力・冷却(公式仕様) |
|---|---|---|
| GeForce RTX 5090 | 32GB GDDR7 | GPUの電力575W、PC全体で必要な電源1000W |
| NVIDIA L40S | 48GB GDDR6(ECC搭載) | 最大350W。冷却はパッシブ(ファンなし) |
| NVIDIA H100 | 80GB(SXM)/94GB(NVL) | 最大700W(SXM)/350〜400W(NVL) |
| RTX PRO 6000 Blackwell Workstation Edition | 96GB GDDR7(ECC) | (この記事では扱わない) |
| Mac Studio(M5 Ultra) | ユニファイドメモリ96GB(256GBに変更可) | 本体の最大消費電力480W(連続使用時) |
※メモリ容量・消費電力・冷却方式は、NVIDIAとAppleの日本語公式サイトの仕様(2026年10月3日〜6日に確認)です。GPUは日本円の価格が公式に表示されていないため、価格は載せていません。
L40Sの冷却は公式の仕様で「パッシブ」とされ、カード自体にファンを持たず、サーバー本体の送風で冷やす前提の製品になります。そのため、サーバー用の筐体と、熱を逃がせる置き場所を用意することになってしまいます。GeForce RTX 5090はGPUだけで575Wを使い、NVIDIAはPC全体で1000Wの電源を目安として示しています。メモリの誤りを訂正するECCは、L40SとRTX PRO 6000 Blackwellの仕様に記載があり、長く動かし続ける共有サーバーではこの有無も確かめておきたい点です。モデルを置く記憶装置にも余裕が要り、Ollamaの公式ドキュメントはモデルの保存に数十〜数百GBの空きが必要になると案内しています。
電気代の上限を見ておく
24時間動かす共有サーバーでは、電気代も毎月の費用として見ておきましょう。L40S 1枚が最大の350Wで1か月(24時間×30日)動き続けた場合は252kWhとなり、家電の電気代表示に使われる目安単価31円/kWh(税込)で計算すると、月7,812円が上限の目安になります。Mac Studio(M5 Ultra)を最大の480Wで同じように動かした場合は、月約10,714円と計算できます。どちらもGPUや本体の最大値で計算した上限で、サーバーの他の部品や空調の電気は含まず、会社の契約単価でも変わるため、自社の請求書の単価に置き換えてみてください。
社員が使う画面と社内文書の連携|Open WebUIとRAG
推論サーバーに社員が使う画面をつなぐには、チャット画面のソフトを別に用意します。例として挙げられるOpen WebUIは、自分ではモデルを持たず、Ollamaなどにつないで、ブラウザからAIと会話できるようにするソフトです。最初に作ったアカウントが管理者になり、管理者ができた後は新規登録が自動で止まる仕組みになっています。社員を加えるときは管理画面で新規登録の受け付けをオンにし、登録した方は管理者が承認するまで保留の状態に置かれます。ライセンスには利用者が合計50人を超える場合にブランド表示の決まりがかかる条項があるため、社員50人を超えて使う会社は、導入前にライセンス本文を確かめましょう。
社内文書を読ませる(RAG)ときの閲覧範囲
RAGは、質問に関係する社内の資料を探し出し、その中身をもとにAIに答えさせる仕組みのことです。共有サーバーでRAGを組むと、登録した資料はそのサーバーを使う全員の検索対象になりやすくなります。IPAのサイトに掲載された「テキスト生成AIの導入・運用ガイドライン」も、ベクトルDB(資料を検索用に変換して保管する場所)に機密情報を入れると全ユーザーが参照できる点を挙げ、情報の重要度ごとに参照できる人を設定する対策を示しています。人事や給与の資料を入れる予定があるなら、部署ごとに検索できる範囲を分けられるかを、ソフト選びの段階で確かめておいてください。作り方はローカルLLMで社内文書RAGを作る方法でまとめています。
※IPAのサイトに掲載されたガイドライン(2024年7月31日公開)は、掲載ページで、IPAの意見を代表するものではなく中核人材育成プログラム卒業プロジェクトメンバーの見解であると明記されています。
共有サーバーで使う日本語のモデルとライセンス
社内で共有するモデルは、日本語の出来と同じくらい、会社で使ってよい条件かどうかで選ぶ必要があります。国内の研究機関が公開しているモデルには、国立情報学研究所のLLM-jpが2026年9月28日に公開したLLM-jp-4.1シリーズや、東京科学大学と産業技術総合研究所のQwen3 Swallowがあり、どちらもApache 2.0で公開されています。Qwen3 Swallowのモデルカードには、主にvLLMで不具合の確認と評価をしたと書かれており、複数人向けの推論サーバーと組み合わせる場合の手がかりになるでしょう。
注意したいのは、社内での利用も商用目的に数えるライセンスがある点です。Preferred NetworksのPLaMo Community Licenseは、利用者の組織の中での利用も商用目的に含めており、商用で使えるのは公式ページで事前に登録し、年間の売上が10億円以下の場合で、超えるとPFNの別ライセンスが要ります。MetaのLlama 4 Scoutは独自のライセンスで、公式に対応する12言語に日本語が入っていません。日本語の出来を比べる材料には、Weights & Biases Japanが運営するNejumi LLMリーダーボードなどの公開指標がありますが、点数だけで自社の業務に合うとは決められないため、実際の業務の文書で試して比べるのが確実です。候補の絞り方はローカルLLMのおすすめモデルで紹介しています。
社内サーバーの運用チェックリスト|認証・記録・更新・障害・退職者
共有サーバーを社員に開く前には、外から届かないようにすること、使う人の確認、記録、更新、障害時の対応、退職者の停止まで、担当と手順を決めておく必要があります。認証をかけずに外から届く状態のサーバーは、実際に見つかっています。Ciscoの研究者が2025年9月に公表した調査では、Ollamaを手がかりにインターネット上を調べ、1,139件の無防備なサーバーを確認し、そのうち214件(約18.8%)はモデルを載せて要求に応えている状態だったと報告しました。件数は同社の調査結果で、第三者が検証したものではありませんが、設定を一つ誤ると社外から使える状態になり得ることが分かります。
vLLMの公式ドキュメントでも、APIキーで守られるのは一部の入口だけなので、それだけに頼らないよう注意書きがあります。推奨の形としては、前段にリバースプロキシ(要求を中継する仕組み)を置いて公開する入口を絞り、そこで認証・回数の制限・記録をまとめて扱う方法と、ファイアウォールで必要な通信だけを通す方法が挙げられています。チェックリストにまとめると、次の8項目になります。
- 外から届かないことファイアウォールで推論サーバーの入口を社内だけに絞ります。Ollamaの公式FAQにはインターネットへ出すトンネルの手順も載っていますが、会社のサーバーでは使いません。
- 使う人の確認(認証)社員が使う画面でログインを求め、推論サーバーにはその画面と中継の仕組みからだけ届くようにします。トークンを配る場合は、保管と作り直しの手順も決めます。
- 記録(ログ)誰がいつ使ったかを残す場所、保存期間、記録を見られる人を決めます。質問の中身まで残すかどうかも、扱うデータに合わせて決めておきます。
- クラウド機能の停止Ollamaならクラウドのモデルと Web検索を切る設定(OLLAMA_NO_CLOUD=1 など)を入れ、ログで切れていることを確かめます。
- 更新実行ソフト・GPUのドライバ・モデルの更新を、誰が、いつ、どこで試してから入れるかを決めます。OllamaはWindowsとMacでは更新を自動でダウンロードし、適用は再起動のときです。
- 障害と混雑止まったときの連絡先と、その間に使う代わりの手段を決めます。混雑で遅いときに同時処理の数を下げるか、GPUを足すかを判断する人も決めておきます。停電に備えた電源と、設定やアカウント情報の控えも用意します。
- 退職・異動アカウントの停止と、発行したトークンの無効化を、人事の手続きと同じ日に済ませる流れを作ります。共有のトークンを使っている場合は作り直します。
- 入力してよい情報社内サーバーでも、入れてよい資料と入れない資料を決めて社員に伝えます。社内文書を読ませる場合の閲覧範囲もここで決めます。
どの項目も一度決めれば終わりではなく、人の出入りやソフトの更新のたびに見直しが必要になってきます。生成AI全般の点検項目は生成AIのセキュリティ対策チェックリスト、入力してよい情報の決め方は生成AIの社内ガイドラインの作り方も参考にしてください。
費用の考え方|機材・電気代・担当者の時間を3年で並べる
費用は、機材の購入費に、電気代と担当者の時間を3年分足して比べると判断しやすくなります。公式に価格が表示されている例では、Mac Studio(M5 Ultra)がユニファイドメモリ96GBの構成で949,800円(税込)からとなっており、Ollamaなどを動かす共有機の候補の一つです。GPUを積むサーバーの金額は、販売店の見積もりで確かめてください。担当者の時間は、運用にかかる時間を示した一次資料がないため、読者の仮定として割合で置いてみます。厚生労働省の令和7年賃金構造基本統計調査では、一般労働者の賃金(男女計)が月340,600円で、担当者が勤務時間の1割を運用に充てると月34,060円分、2割なら月68,120円分にあたります。
| 項目(機材の購入費は除く) | 月額の目安 | 3年分(36か月) |
|---|---|---|
| 電気代:L40S 1枚が最大350Wで24時間動いた場合の上限 | 7,812円 | 281,232円 |
| 電気代:Mac Studio(M5 Ultra)が最大480Wで24時間動いた場合の上限 | 約10,714円 | 約385,690円 |
| 担当者の時間:賃金340,600円の1割と仮定 | 34,060円 | 1,226,160円 |
| 担当者の時間:賃金340,600円の2割と仮定 | 68,120円 | 2,452,320円 |
※賃金は厚生労働省「令和7年賃金構造基本統計調査 結果の概況」の一般労働者(男女計)で、毎年6月分の所定内給与額です。賞与や社会保険料の会社負担は含みません。電気代は全国家庭電気製品公正取引協議会の目安単価31円/kWh(税込)で計算した上限です。1割・2割は計算のための仮定で、運用に実際にかかる時間を示すものではありません。Mac Studioの価格は2026年10月3日時点のApple日本の公式表示です。
この仮定では、3年分の担当者の時間は、どちらの電気代と比べても3倍を超えています。機材の代金だけで比べると、自前のサーバーは実際より安く見えてしまいます。比べる相手のサービスの料金も、人数ではなく3年の総額で並べてみましょう。
会社で安全に使うには|自前のサーバーと既製の法人向けサービスを比べる
会社でAIを安全に使うために整えたいのは、入力した内容を学習に使わせない設定、利用の記録、社員へのアカウントの配布と停止、用途に応じたモデルの使い分けの4つになります。自前のサーバーはこれらを自社の手で組み立てる形で、既製の法人向けサービスは提供元が用意した仕組みを契約して使う形です。
| 比べる点 | 自前のローカルLLMサーバー | 既製の法人向けサービス |
|---|---|---|
| 入力した内容の扱い | 社内で処理する。クラウド機能を切れば社外に出ない | 提供元のサーバーで処理する。学習に使わない設定が標準かを契約で確かめる |
| データの置き場所 | 社内のサーバー | 提供元のサーバー。保管する国や地域はサービスごとに確かめる |
| 使えるモデル | 公開されているモデルから自社で選んで入れる。大きなモデルほどGPUのメモリが要る | 提供元が対応するモデル。複数のAIを切り替えて使えるサービスもある |
| 同時に使える人数 | GPUのメモリと同時処理の設定で上限が決まる | 契約するプランの条件で決まる |
| 利用の記録 | 前段の中継の仕組みなどで自社が取る | 管理画面で見られるかをサービスごとに確かめる |
| アカウントの配布と停止 | 画面のソフトで管理者が扱う | 管理画面で扱う |
| 更新・障害対応 | 自社の担当者 | 提供元 |
| 最初にかかる費用 | 機材の購入費(GPUは見積もり) | サービスによる |
| 毎月かかる費用 | 電気代と担当者の時間 | 月額の利用料 |
| 向いている会社 | 社外に出せない資料を扱い、サーバーの担当者を置ける会社 | 担当者を置きにくく、早く全社で使い始めたい会社 |
どちらか一方に決める必要はなく、社外に出せない資料だけを社内のサーバーで扱い、普段の文書作成や調べものは既製のサービスで、という分け方もあります。検討するときは、表の各行に自社の答えを書き込み、担当者の欄が埋まらない方式は避けておきましょう。会社が使える環境を用意しないままだと、社員が個人のアカウントでAIを使い始めることがあり、いわゆるシャドーAI(野良AI)につながってしまいます。複数のAIを1つの環境でまとめて使う形はマルチAIとはで詳しく紹介しています。
サーバーを持たずに、4つのAIを会社で安全に
UPGEAR AIは、ChatGPT・Claude・Gemini・Perplexityを1画面で切り替えて使える法人向けAI基盤です。全モデルで学習非利用を標準適用し、会話履歴・利用ログ・アカウントは国内サーバー(AWSの日本リージョン)で管理します。管理者ダッシュボードで利用ログ・権限・モデルのON/OFFを扱え、自社資料を読み込ませて回答させる社内文書RAGも備えています。料金は月額30,000円(税抜)から。どのプランも利用人数は無制限で、料金は利用量に応じたプラン設計です(人数の目安はライト1〜5名、スタンダード6〜20名、プレミアム21〜50名)。初期費用100,000円(税抜)が別途かかります。
UPGEAR AIの詳細を見るよくある質問
ローカルLLMサーバーは社員何人まで同時に使えますか?
Ollamaのままで複数人の共有サーバーにできますか?
GPUは1枚で足りますか、複数枚必要ですか?
社内サーバーなら情報漏洩の心配はありませんか?
運用の担当者にはどのくらいの時間が必要ですか?
自前のサーバーと既製の法人向けサービスは、どちらを選べばよいですか?
まとめ
ローカルLLMサーバーを社内で共有するときの見積もりは、社員数ではなく、同時に処理する会話の数から始まります。GPUのメモリはモデル本体に会話ごとの作業領域を足した量で決まり、作業領域は会話の長さと同時に処理する数に比例して増えていきます。実行ソフトには、OllamaやLM Studioの設定を変えて共有する方法と、vLLMのような複数人向けの推論サーバーを使う方法があり、どちらも認証と公開範囲の設定は自社で整えることになります。
費用を比べるときは、機材の代金に加えて、電気代と担当者の時間を3年分並べてみてください。担当者を置けるか、社外に出せない資料をどれだけ扱うかで、自前のサーバーと既製の法人向けサービスのどちらが合うかが見えてくるでしょう。法人のAI活用についてのほかの記事はAI活用コラム一覧をご覧ください。
