OllamaでローカルLLMを動かす。インストールから社内で使うまでの手順

Ollama(オラマ)とは、自分のPCやサーバーの上で、生成AIの言語モデルを動かすための無料のソフトです。1台のPCで試すだけなら、インストールしてコマンドを1行打てば、会話を始めることが出来ます。ただし社内の複数人で使う段階では、自分のPCのAPIは認証が要らないと公式ドキュメントに書かれている点を前提に、使う人を確かめる仕組みを別に用意する必要が出てきます。

ローカルLLMの仕組みそのものや、クラウドのAIとの向き不向きはローカルLLMとは何か、会社で使うときの考え方の記事にまとめています。ここではOllamaというソフトに絞り、入れ方から社内で共有するときの設定、判断の材料までを順に見ていきましょう。

Ollamaとは|自分のPCでモデルを動かす無料のソフト

Ollamaは、公開されている言語モデルをダウンロードし、自分の機械の上で会話やAPIとして使えるようにする実行ソフトになります。本体はオープンソースで、ライセンスはMIT Licenseです。自分の機械でモデルを動かす分は無料で、公式の料金ページには、自分のハードウェアで動かす分は常に無制限という趣旨の記載があります。有料なのはOllama社のクラウドでモデルを動かすプランで、Proが月20ドル、Maxが月100ドルなどと表示されています。

2026年10月6日時点の最新版は0.35.1で、2026年9月30日(日本時間)に公開されました。更新の頻度は高く、画面の名前や設定の項目も版によって変わってしまいます。社内の手順書に書き写すときは、版数と確認した日を一緒に残しておきましょう。

※料金・版数・コマンド・設定名は、2026年10月6日時点でOllamaの公式サイト・公式ドキュメント・GitHubのリリース情報を確認した内容です。ソフトの更新で変わることがあります。

LLMとローカルLLMの違い

LLM(大規模言語モデル)は、ChatGPTやClaudeの中で動いている、文章を読み書きするAIの本体を指す言葉です。ふだん使うChatGPTなどは、提供する会社のサーバーでモデルが動き、入力した文章はインターネットを通ってそのサーバーへ届きます。ローカルLLMは、そのモデルを自分のPCや社内のサーバーの上で動かす使い方のことで、Ollamaはそのための道具の1つという位置づけになります。

ローカルとクラウドの2通りの動かし方

見落としやすいのは、いまのOllamaが自分の機械の中だけで動くソフトではない点です。公式のダウンロードページでは、自分のコンピューターで動かす方法と、Ollama社のクラウドで動かす方法の2通りが並んでいます。クラウドで動くモデルは名前の末尾が「:cloud」になっていて、例として挙がっているのは、gemma4:cloudという名前になります。

公式のFAQは、自分の機械で動かしている間はプロンプトもデータも同社からは見えないと説明しています。一方でクラウドのモデルを使えば、プロンプトと応答は同社のサーバーで処理されることになります。保存や学習には使わないと同社は記載していますが、これは同社の自己申告です。社外に出したくない情報を扱う前提で入れるなら、クラウド側の機能を切る設定を最初に済ませてください。切り方は次の節で紹介します。

Ollamaで出来ること

Ollamaで出来ることは、大きく分けて4つになります。1つ目はターミナルの画面でモデルと会話する使い方で、ollama run のあとにモデル名を書くだけで始められます。2つ目は、11434番ポートのAPIを通して、社内のツールやプログラムからモデルを呼び出す使い方です。3つ目として、文章を数値の並びに変える埋め込み用のモデルを動かし、社内文書を読ませる仕組みの部品に使うことも出来ます。4つ目は、Modelfileで指示を持たせた独自のモデルを作ったり、ollama launch で開発ツールとつないだりする使い方になります。

Ollamaのインストール手順(Windows・Mac・Linux)

インストールは、公式サイトのダウンロードページから行います。macOSとLinuxはコマンド1行、Windowsはコマンド1行か、インストーラーを手でダウンロードする方法のどちらかを選ぶ形です。どの方法でも、入れ終わるとOllamaは裏で動き続け、http://localhost:11434 でAPIを受け付ける状態になっています。

curl -fsSL https://ollama.com/install.sh | sh    # macOS・Linuxのターミナルで
irm https://ollama.com/install.ps1 | iex    # WindowsのPowerShellで

会社のPCでは、インターネットから取ってきたスクリプトをそのまま実行する操作を禁じている場合もあるでしょう。その場合は、ダウンロードページの手動ダウンロードからインストーラーを取得する方法に切り替えられます。

Windowsに入れる場合

対応するのはWindows 10の22H2以降で、HomeとProのどちらでも動きます。公式ドキュメントには、インストールに管理者権限は要らず、既定ではユーザーのホームフォルダに入ると書かれています。管理者権限のない社員のPCにも入ってしまうため、情シスの把握していない場所でOllamaが動き出す可能性がある、という見方も出来ます。

入れたあとは、コマンドプロンプトやPowerShellで ollama コマンドが使えるようになります。NVIDIAのGPUで速く動かしたい場合は、ドライバを551.61以降にそろえておきましょう。容量は本体だけで4GB以上、モデルの保存には別に数十GBから数百GBの空きが要ると案内されています。

Macに入れる場合

要件はmacOS Sonoma(v14)以降で、AppleのMシリーズならCPUとGPUの両方、Intel(x86)のMacではCPUだけで動く形になります。推奨されているのは、ollama.dmg を開いてアプリケーションフォルダへドラッグする入れ方です。初めて起動したときに、/usr/local/bin へ ollama コマンドのリンクを作ってよいかを尋ねられるので、許可するとターミナルからコマンドが使えるようになります。

Mac特有の設定や、LM Studioと比べたときの選び方はMacでローカルLLMを動かす方法で詳しく扱っています。

Linuxに入れる場合

Linuxは、先ほどのインストール用スクリプトを流す方法が基本になります。systemdを使う環境では、ollama.service というサービスとして動かし、設定の変更もこのサービスに対して行います。社内のサーバーに置いて複数人で使う構成では、このLinux版を選ぶ場面が多くなるでしょう。

更新のかかり方

macOSとWindowsでは、新しい版を自動でダウンロードし、タスクバーやメニューバーの「Restart to update」を押すと切り替わる仕組みになっています。Linuxには自動の更新はなく、インストール用スクリプトを流し直して上げる運用です。社員のPCに入れる場合は、更新ボタンを各自に任せるのか、情シスがまとめて上げるのかを先に決めておくと、版がばらばらになる事態を避けられます。

入ったかどうかの確かめ方

インストールが済んだら、ターミナルかPowerShellで ollama ls と打ってみてください。まだモデルを入れていなければ、中身のない一覧が表示されるだけです。続けて ollama run gemma4 と打つと、モデルのダウンロードが始まり、終わるとそのまま会話の入力待ちになります。モデルは十数GBになることもあるので、社内の回線が混む時間帯を避けて取るのがよいでしょう。別の画面で ollama ps を打てば、いま動いているモデルと、GPUとCPUのどちらに載っているかを確かめることが出来ます。

最初の起動とクラウド機能の切り方

公式のクイックスタートでは、起動するとクラウドのモデルを使うためにサインインするか、ローカルのモデルを選ぶかの案内が出ると説明されています。社外へ出したくない情報を扱う会社では、ここでローカルのモデルを選ぶだけでなく、クラウド機能そのものを止めておくほうが安心でしょう。

止め方は2つあります。1つはホームフォルダの .ollama フォルダにある server.json で disable_ollama_cloud を true にする方法で、もう1つは環境変数 OLLAMA_NO_CLOUD を 1 にする方法です。止めるとクラウドのモデルとWeb検索の機能は使えなくなり、ログに「Ollama cloud disabled: true」と1行出るので、そこで効いているかを確かめられます。

環境変数で止める場合は、OLLAMA_NO_CLOUD を値1で設定します。設定の仕方は、後で出てくるOLLAMA_HOSTと同じOSごとの手順になります。そのあとOllamaを起動し直し、ログ(Macなら ~/.ollama/logs)に Ollama cloud disabled: true と出ているかで確かめることが出来ます。

構築の全体の流れや、PCを選ぶところから社内公開までをまとめて追いたい場合は、ローカルLLMの構築手順も合わせてご覧ください。

Ollamaの基本コマンド早見表

日々の操作で使うコマンドは10個ほどに収まります。次の表は公式のCLIドキュメントにある書き方を、用途ごとに並べたものです。例のモデル名には、公式の説明と同じ gemma4 を使っています。

やりたいことコマンド補足
モデルを動かして会話するollama run gemma4手元に無ければ先にダウンロードしてから起動
モデルをダウンロードだけするollama pull gemma4社員のPCへ配る前に、共有の機械で取っておく使い方も
手元のモデルを一覧で見るollama ls容量の大きいものから整理するときに
いま動いているモデルを見るollama psPROCESSOR欄でGPUとCPUのどちらに載っているかが分かる
動いているモデルを止めるollama stop gemma4メモリを空けたいときに
モデルを削除するollama rm gemma4保存先の容量を空ける
サーバーとして起動するollama serve使える環境変数の一覧は ollama serve --help で表示
独自の設定のモデルを作るollama create 名前 -f Modelfile社内向けの指示を持たせる(後述)
外部アプリをOllamaのモデルで起動するollama launchOpenCode・Claude Code・Codex・VS Code・Droidが対象
Ollamaのアカウントに出入りするollama signin/ollama signoutクラウドのモデルを使うときだけ必要

会話の画面で複数行の文章を入れたいときは、ダブルクォートを3つ並べた記号で文章の前後を挟みます。メールの文面や議事録のように、改行を含む文章を貼り付けるときに使う書き方です。

ollama ps の PROCESSOR 欄には「100% GPU」「100% CPU」「48%/52% CPU/GPU」のような表示が出ます。CPUの割合が出ているときは、モデルがGPUのメモリに収まりきっていない状態です。公式ドキュメントもCPUへのはみ出しを避けるよう案内しているので、遅いと感じたらまずこの欄を見てみてください。

Modelfileで社内向けの指示を持たせる

Modelfileは、元にするモデルと、最初に読ませる指示などを書いておく設定ファイルです。会社の決まりや答え方の型を毎回打ち込まなくても、作ったモデルを呼び出すだけで同じ前提から会話を始められるようになります。たとえば次のように書きます。

# Modelfile(ファイル名は Modelfile)
FROM gemma4
SYSTEM あなたは社内の総務担当の補助です。回答は日本語で、結論を先に3行以内で書いてください。社外秘と書かれた資料の内容は外部向けの文章に入れないでください。
# 作って動かす
ollama create soumu-assist -f Modelfile
ollama run soumu-assist

SYSTEMの指示を複数行に分けたいときは、先ほどと同じくダブルクォート3つの記号で前後を挟む書き方になります。ただし、ここに書いた指示はモデルへのお願いであって、情報の持ち出しを技術的に止める仕組みではありません。守らせたい決まりは、社内のルールと画面の側の権限で別に固めておきましょう。

どのモデルを入れるか|代表的なモデルと選び方

モデル選びは、手元のPCのメモリに収まる大きさから逆算するのが近道になります。次の表は、Ollamaの公式ライブラリに表示されている主なモデルのダウンロードサイズと、提供元が示すライセンスを並べたものです。

モデル(提供元)ライブラリの表示サイズライセンス補足
gpt-oss(OpenAI)20b:14GB/120b:65GBApache 2.020bは16GBのメモリで動くよう設計とOpenAIが記載
qwen3.5(アリババ)9b:6.6GB/27b:17GB/35b:24GBApache 2.0201の言語・方言に対応と記載
qwen3.6(アリババ)27b:約18〜19GB/35b:約23〜24GBApache 2.02026年4月のモデル
gemma4(Google)26b:約16〜19GB/31b:約19〜20GBApache 2.0140以上の言語で学習と記載
llama4(Meta)16x17b(Scout):67GBLlama 4 Community License公式の対応12言語に日本語は含まれない

※サイズは2026年10月3日にOllamaの公式ライブラリで表示されていたダウンロードサイズです。実際に動かすときは、会話の長さ(コンテキスト)の分だけ追加のメモリが要ります。「16GBで動く」などの記載は提供元の自己申告で、第三者の検証ではありません。

用途別のおすすめや、日本語での比べ方はローカルLLMのおすすめモデルで詳しく比べています。この記事では、Ollamaで動かす前に確かめたい3つの点に絞って見ていきましょう。

必要なPCの目安とGPUなしで動かす場合

目安になるのは、モデルのサイズがGPUのメモリ(VRAM)か、Macのユニファイドメモリに収まるかどうかです。OllamaはNVIDIAならcompute capability 5.0以上のGPU、AMDならRadeon RXやRadeon PROなど(ROCm経由)、AppleならMetalでGPUを使う仕組みに対応しています。

GPUが無いPCでも、CPUだけでモデルを動かすこと自体は出来ます。Intelの載ったMacがCPUだけで動く扱いになっているのも、その一例です。ただし ollama ps でCPUの割合が出る状態は、公式が避けるよう案内している状態でもあります。業務で毎日使う前提なら、小さいモデルで試してから機器を決める順番が無難でしょう。

会話の長さの既定値も、GPUのメモリ量で変わります。公式ドキュメントでは、VRAMが24GiB未満なら4k、24〜48GiBなら32k、48GiB以上なら256kが既定とされていて、長くするほど必要なメモリも増えてしまいます。値はアプリの設定のスライダーか、環境変数 OLLAMA_CONTEXT_LENGTH で変えられます。機種ごとのメモリと価格の比べ方はローカルLLMに必要なPCのスペックをご覧ください。

日本語で使うときのモデル

海外の大手のモデルは多言語に対応していても、日本語を名指しした公式の記載がないものが目立ちます。たとえばGemma 4は140以上の言語で学習したとされていますが、その中に日本語と明記された記載は確認できません。Llama 4 Scoutについては、公式の対応12言語に日本語が入っていない状態です。

日本語を重く見るなら、国内の組織が公開しているモデルも候補に入ります。ELYZAの推論モデル、東京科学大学と産総研のQwen3 Swallow、国立情報学研究所のLLM-jp、SB IntuitionsのSarashinaなどがHugging Faceで公開されています。日本語での性能を比べる指標としては、Weights & Biases Japanが運営するNejumi LLMリーダーボードが知られていて、確認できた最新版は2025年8月27日公開の第4版になります。

ライセンスと商用利用

Ollama本体はMIT Licenseなので、会社の業務に使うこと自体に本体側の制約はほとんどありません。気をつけたいのは、動かすモデルごとにライセンスが別々に決まっている点です。gpt-oss・Qwen・Gemma 4はApache 2.0ですが、LlamaはMeta独自のLlama 4 Community Licenseで、表示の義務や利用ポリシーの順守などの条件が付きます。

国産モデルの中にも独自の条件を持つものがあります。PLaMo Community Licenseは組織内での利用も商用目的に含めていて、年商10億円を超える会社は別のライセンスが要るとしています。モデルを社内の標準に決める前に、各リポジトリのLICENSEの本文を一度読んでおいてください。

OllamaのAPIを使う|11434番ポートとOpenAI互換の入口

Ollamaは起動している間、11434番ポートでAPIを受け付けていて、社内の業務ツールから呼び出す使い方が出来ます。入口は大きく3つあり、Ollama独自のもの、OpenAIのAPIと同じ形のもの、Anthropicの形に合わせたものが用意されています。

入口アドレスの例向いている使い方
Ollama独自のAPIhttp://localhost:11434/api/chat / /api/generateOllamaの機能をそのまま使う社内ツール
OpenAI互換のAPIhttp://localhost:11434/v1/chat/completions などOpenAI向けに作った既存のプログラムの接続先を差し替える
Anthropic互換の入口(公式ドキュメントに記載あり)Anthropic向けに作ったツールからつなぐ

OpenAI互換の入口を使うと、OpenAIのライブラリで書いたプログラムの接続先を差し替えるだけで、手元のモデルを呼び出せます。Pythonなら次のような書き方になります。

from openai import OpenAI

# 接続先を手元のOllamaに向ける
client = OpenAI(base_url='http://localhost:11434/v1/', api_key='ollama')

res = client.chat.completions.create(
    model='gemma4',
    messages=[{'role': 'user', 'content': '来週の部内会議の議題案を5つ挙げてください'}],
)
print(res.choices[0].message.content)

ここで api_key に ollama と入れているのは、ライブラリの都合で何か値を入れないと動かないためです。公式ドキュメントの例には、必要だが無視されるという注記が添えられていて、Ollamaの側はこの値を見ていないことになります。APIは厳密な版の管理はしていないものの、後方互換を保つ方針だと記載されています。

社内文書を読ませる仕組み(RAG)を作る場合は、文章を数値の並びに変える埋め込み用のモデルもOllamaで動かせます。公式はembeddinggemma・qwen3-embedding・all-minilmを推奨モデルとして挙げていて、文書を登録するときと質問するときで同じモデルを使うよう案内があります。組み立て方の全体はローカルLLMで社内文書を読ませる方法で解説しています。

自分のPCのAPIは認証が要らないと公式に記載

APIの説明でいちばん気にかけておきたいのが、認証の扱いです。公式の認証のページには、http://localhost:11434 のローカルのAPIは認証を必要としない、という一文がはっきり書かれています。API入門のページにも、クラウドへの要求にはAPIキーが要り、ローカルへの要求には要らないという説明があります。

自分のPCの中だけで使うなら、これで困ることはほとんどありません。既定ではOllamaは自分のPCの中(127.0.0.1)からの接続しか受け付けないため、外の機械からは届かないようになっています。問題になるのは、社内の他の人も使えるように待ち受けの範囲を広げたときです。その時点から、同じネットワークの誰もがキーなしで呼び出せる状態になりえます。

社員が1人で試している段階なら大きな問題にはなりにくいものの、部署やフロア単位で共有を始めると、だれがどのくらい使ったのかを後から追う手立ても自前で考えなければなりません。複数人で使う設定に進む前に、この前提を関係者でそろえておくことが出来れば、後の手戻りはぐっと減ります。

使う人の確認とログまで自前でそろえるのは手間がかかります

認証やログを自前で組むより、会社で使うAIの環境を1つに決めて管理する方法もあります。UPGEAR AI(アップギアAI)は、ChatGPT・Claude・Gemini・Perplexityを1つの契約で使える法人向けサービスです(人数無制限)。

社内の複数人で使う設定|OLLAMA_HOSTと同時処理

社内の他のPCから使えるようにするには、待ち受けるアドレスを環境変数 OLLAMA_HOST で変えます。公式のFAQによると、Ollamaは既定で127.0.0.1の11434番ポートで待ち受けていて、この値を 0.0.0.0:11434 にすると、ネットワーク上の他の機械からの接続も受け付けるようになります。OSごとの変え方は次のとおりです。

Windowsで変える場合

  1. タスクバーのOllamaのアイコンから、Ollamaを終了します。
  2. Windowsの設定で「環境変数」と検索し、「アカウントの環境変数を編集」を開きます。
  3. 新しい変数として OLLAMA_HOST を作り、値に 0.0.0.0:11434 を入れて保存します。同じ画面で OLLAMA_MODELS や OLLAMA_NUM_PARALLEL などもまとめて作れます。
  4. スタートメニューからOllamaを起動し直します。

Macで変える場合

launchctl setenv OLLAMA_HOST 0.0.0.0:11434
# このあとOllamaのアプリを終了して起動し直す

Linux(systemd)で変える場合

まず次のコマンドで、サービスの設定を編集する画面を開きます。

systemctl edit ollama.service

開いた編集画面に、次の2行を書いて保存します。

[Service]
Environment=OLLAMA_HOST=0.0.0.0:11434

保存したら、次のコマンドで反映して再起動します。

systemctl daemon-reload
systemctl restart ollama

どのOSでも、設定したあとにアプリやサービスを起動し直さないと反映されない点は共通しています。値を入れたのに他のPCからつながらないときは、まず再起動をしたかどうかを確かめてみてください。

同時に何人まで処理できるか|環境変数と既定値

複数人で使い始めると、同時に届いた質問をどう処理するかが問題になってきます。Ollamaではこれを環境変数で調整する仕組みで、公式のFAQに既定値が載っています。

環境変数決めること既定値気をつける点
OLLAMA_NUM_PARALLEL1つのモデルが同時に処理する要求の数1必要なメモリは、この値と会話の長さ(OLLAMA_CONTEXT_LENGTH)の掛け算に比例して増える
OLLAMA_MAX_LOADED_MODELS同時にメモリへ読み込むモデルの数GPUの数×3(CPUで動かす場合は3)部署ごとに違うモデルを使うと、ここで詰まりやすい
OLLAMA_MAX_QUEUE混んでいるときに待たせる要求の上限512超えると過負荷のエラーが返る
OLLAMA_KEEP_ALIVEモデルをメモリに置いておく時間(公式FAQで変更方法を案内)短いと呼び出しのたびに読み込み直しになる

既定のままだと、1つのモデルは1件ずつ順番に答える動きになります。メモリが足りないときも、新しい要求は順番待ちに回される仕組みです。同時に使う人が増えるほど待ち時間が延びてしまうため、OLLAMA_NUM_PARALLELを上げるか、機械を増やすかの判断がいずれ必要になります。同時処理の数を上げると、その分だけメモリの必要量も膨らみます。上げる前に ollama ps でGPUに収まっているかを確かめ、少しずつ様子を見ながら調整していきましょう。

モデルの保存先と社内プロキシ

モデルの保存先は、Windowsが C:\Users\%username%\.ollama\models、macOSが ~/.ollama/models と公式に示されています。1つのモデルで十数GBから数十GBを使うことも珍しくないため、Cドライブの空きが少ないPCでは、環境変数 OLLAMA_MODELS で別のドライブへ移しておくのが現実的な手当てになります。

社内のプロキシを通してモデルを取ってくる環境では、HTTPS_PROXYを設定するよう公式は案内していて、HTTP_PROXYは設定しないよう注意書きがあります。ブラウザの拡張機能などから直接Ollamaを呼びたい場合は、OLLAMA_ORIGINSで許可する接続元を追加する形です。既定で許可されているのは、127.0.0.1と0.0.0.0からのブラウザの要求になります。

社員のPCに1台ずつ入れるか、共有の機械を置くか

社内で広げるときの形は、社員のPCに1台ずつ入れる方法と、共有の機械を1台置いて皆で呼び出す方法の2つに分かれます。1台ずつ入れる方法は、待ち受けの範囲を広げずに済むため、認証の心配は小さくなります。その代わり、モデルの保存に数十GBの空きが台数分必要になり、更新や使ってよいモデルの管理も台数分に増えてしまいます。WindowsではOllamaのインストールに管理者権限が要らないので、把握していないPCに入っていないかを確かめる手間も残ります。

共有の機械を置く方法なら、モデルや更新の管理は1か所で済みます。一方で、待ち受けの範囲を広げる以上、使う人を確かめる仕組みと、同時に使う人数に見合うメモリが必要になってきます。どちらが合うかは、使う人数と扱う情報の重さで決めることになるでしょう。

社内のツールから共有の機械を呼ぶとき

共有の機械でOllamaを動かした場合、社内のツールから呼ぶアドレスは localhost ではなく、その機械のIPアドレスやホスト名に置き換わります。先ほどのPythonの例でいえば、base_url の localhost の部分を、共有の機械のアドレスに書き換える形です。社員のPCやツールごとに設定を配ることになるため、アドレスを固定しておくと、後から機械を入れ替えたときの書き換えが少なくなります。ただし、この形のまま使うと、アドレスを知っている人なら誰でも呼び出せる状態になりえます。ログインの仕組みを持つ画面を前に置き、社員にはその画面を使ってもらう構成も検討してみてください。

社内に公開する前に|認証の扱いとネットに露出したサーバーの調査

待ち受けの範囲を広げる前に、使う人を確かめる仕組みをどこで持たせるかを決めておく必要があります。OllamaのFAQには、NginxなどのWebサーバーを前に置いて公開する方法が、proxy_pass http://localhost:11434 という設定例とともに載っています。ただ、その公開手順の説明には、利用者を確かめるための設定は含まれていません。

FAQには、ngrokやCloudflare Tunnelを使って社外から使えるようにする例も載っています。個人で試す人向けの情報としては便利でも、会社のPCや社内のサーバーでこの手順をなぞる場面はまず無いはずの設定です。インターネットへ出す手順も公式に載っていると知ったうえで、会社では使わないと決めておくほうが安全でしょう。

インターネットに露出したOllamaの調査(Cisco)

実際に、認証のないままネットに出てしまったOllamaは少なくないことが調査で示されています。Ciscoの研究者であるGiannis Tziakouris氏とElio Biasiotto氏は、2025年9月1日に同社の公式ブログで、ネットにつながった機器を探せる検索サービスShodanを使った調査を公表しました。11434番ポートなどを手がかりに探したところ、同社の調査では1,139件の脆弱なOllamaのサーバーが見つかり、最初の10分で1,000件を超えたと報告されました。

そのうち214件は、実際にモデルを載せた状態で要求に応答していて、調べた全体の約18.8%にあたるとされています。件数はあくまで同社の調査結果で、第三者が検証した数字ではありません。それでも、設定ひとつで社外から誰でも使える状態になりうることは、この調査からも読み取れます。

Ciscoはこの調査の中で、APIキーやOAuth2による認証を前に置くこと、ファイアウォールや閉じたネットワークの内側に置くこと、呼び出しの回数に上限を設けることを勧めています。モデルのアップロード機能を制限することや、定期的に監視することも対策に挙げられていました。社内だけで使うつもりでも、会社のネットワークの出入口の設定次第では外から届くこともあるので、情シスと一緒に経路を確かめておいてください。

※Ciscoの調査は、同社公式ブログ「Detecting Exposed LLM Servers: A Shodan Case Study on Ollama」(2025年9月1日)による同社の調査結果です。認証についての記載は、2026年10月6日時点のOllama公式ドキュメント(API・認証・FAQの各ページ)に基づいています。

社内のネットワークの中でも確かめたいこと

社内だけで使うつもりでも、同じネットワークに誰がつながっているかは会社によって違います。来客用のWi-Fiや、取引先と共用している回線、在宅勤務のVPNが同じネットワークにつながっていれば、その先の人もOllamaに届く可能性が出てきます。待ち受けの範囲を広げる前に、11434番ポートに届く範囲を情シスと一緒に図に描いてみると、思わぬ経路に気づきやすくなります。共有の機械は、社員のPCが置かれたネットワークの中でも、限られた機器からしか届かない場所に置くのが望ましいでしょう。

画面から使う・ほかのツールとつなぐ

社員に使ってもらうなら、コマンドではなくブラウザの画面から会話できる形にするのが現実的です。Ollama本体の外側に、ログインの仕組みを持ったチャット画面やアプリ作成ツールを置き、Ollamaはその裏でモデルを動かす係に回る構成があります。

Open WebUI・Difyなど外部ツールとつなぐ

Open WebUIは、ブラウザで使うチャット画面のソフトです。公式ドキュメントには、Open WebUI自身はモデルを持たないとあり、Ollamaなどにつないで使う前提になっています。導入はDockerかPythonが本番向けとして案内されていて、Dockerなら http://localhost:3000、Pythonなら pip install open-webui のあとに open-webui serve で起動し、http://localhost:8080 で開く形です。

社内で使ううえで役に立つのが、アカウントの扱いになります。最初に作ったアカウントが管理者となり、管理者が出来た時点で新規登録は自動で止まる仕組みです。他の社員を入れるときは、管理者の設定画面(Settings > Admin > Authentication)でNew Sign Upsをオンにします。新しく登録したアカウントは、Admin Panelで管理者が承認するまで保留(Pending)のまま待つ流れです。

Dockerで動かしたOpen WebUIから、同じ機械で動くOllamaにつなぐ場合は、Ollamaの側を0.0.0.0で待ち受ける設定にする必要があると記載されています。ライセンスは、v0.6.6(2025年4月)以降、ブランド表示を守る条項の付いた独自のものに変わりました。表示の条件がかかるのは合計50人以上の大きな導入だけと書かれているので、社員が50人以上で使うときはライセンスの本文を確認しておきましょう。

Difyは、チャットボットや社内向けのAIアプリを画面上で組み立てるツールで、オープンソースのコミュニティ版は自社のサーバーで動かせると公式の料金ページに記載があります。OllamaにはOpenAI互換の入口があるため、OpenAI形式のAPIを呼び出せるツールからは接続先として扱いやすい作りです。接続の設定画面や項目名はツールごとに違うので、つなぐ側の公式ドキュメントで確かめてください。

開発ツールから使う(ollama launch)

ollama launch は、外部のアプリをOllamaのモデルで起動したり、設定したりするコマンドです。公式ドキュメントでは、OpenCode・Claude Code・Codex・VS Code・Droidが対象として挙げられています。プログラムを書く社員が手元のモデルで補助を受ける用途に向いていて、チャット画面を社内に配る使い方とは別の場面で役立ちます。

LM Studioとの違い

ローカルLLMを動かすソフトとしてOllamaとよく比べられるのが、Element Labs社のLM Studioです。画面の操作が中心のLM Studioと、コマンドとAPIが中心のOllamaという違いが大きく、社内で共有するときの認証の扱いにも差があります。

比べる点OllamaLM Studio
主な操作コマンドとAPI(アプリの設定画面もある)画面の操作が中心(CLIの lms もある)
業務での利用本体はMIT License。自分の機械で動かす分は無料2025年7月8日の公式ブログで職場でも無料と発表
Macの対応macOS 14以降。Mシリーズに加えIntelのMacもCPUだけで動くAppleシリコンが必須でmacOS 14以降。IntelのMacは非対応
社内LANへの公開OLLAMA_HOSTで待ち受けを変えるServe on Local Networkを有効にする
認証の扱い自分のPCのAPIは認証不要と記載。公開手順に利用者を確かめる設定の説明はない既定では認証不要。Require Authenticationをオンにし、Manage Tokensでトークンを作る(0.4.0以降)
文書を読ませる埋め込み用モデルを動かし、RAGの部品として使うチャットにdocx・pdf・txtを添付できる

※LM Studioの内容は2026年10月6日時点の公式ドキュメントとダウンロードページ(表示されていた版は0.4.25)に基づいています。LM Studioのトークンは作成時に一度しか表示されません。

LM Studioは、社内LANに公開するときに認証を有効にするよう公式が勧めていて、その設定が画面の中に用意されています。1台のPCを数人で共有する小さな使い方なら、こちらのほうが設定は少なく済む場面もあるでしょう。一方、サーバーとして裏で動かし、Open WebUIなど別の画面から呼び出す構成では、Ollamaが合いやすい形です。どちらにするかは、使う人が画面で操作するのか、別のツールの裏で動かすのかで決めてみてください。

Ollamaのデメリットと向かない使い方

Ollamaは手軽に始められる反面、会社で広く使う段階になると、自前で補わなければならない部分がいくつも出てきます。始める前に知っておきたい点を、公式ドキュメントの記載から挙げてみます。

  • 使える速さと答えの質は、手元の機械のメモリとGPUで決まります。PCに収まる大きさのモデルしか動かせないため、クラウドの大きなモデルと同じ使い心地を期待するのは難しい場面があります。
  • クラウド機能を止めた状態では、Web検索の機能も使えなくなります。モデルが学習した時点より新しい出来事を調べる用途には向いていません。
  • 自分のPCのAPIは認証が要らないと公式に記載があり、公開手順にも利用者を確かめる設定の説明がないため、共有するならログインの仕組みを別に用意する必要があります。
  • だれが何を入力したかを会社として残したい場合は、前に置く画面やサーバーの側で記録の仕組みを考えることになります。
  • モデルの保存に数十GBから数百GBの空きが要り、社員のPCに1台ずつ入れると、容量と更新の管理が台数分に増えてしまいます。
  • モデルごとにライセンスが違い、新しいモデルを足すたびに条件を確かめ直す手間がかかります。

反対に、社外に出したくない文書を少人数で扱う場面や、ネットにつながらない環境で使いたい場面、手元で新しいモデルを試してみたい開発の場面では、Ollamaの手軽さがよく生きてきます。向き不向きを分けて考え、全社の標準にするかどうかは別に判断するのがよいでしょう。

1台で試す・社内で共有する・既製サービスを使うの比べ方

Ollamaを会社で使う形は、大きく3つに分けて考えると整理しやすくなります。社員1人のPCで試す形、社内のサーバーに置いて複数人で共有する形、そして最初から既製の法人向けサービスを使う形です。次の表は、作業の有無と担当で比べたもので、時間や金額は入れていません。

比べる点1台のPCで試す社内のサーバーで共有する既製の法人向けサービスを使う
始めるまでの作業インストールとモデルのダウンロード機器の用意、OLLAMA_HOSTなどの設定、画面のソフトの導入契約とアカウントの発行
使う人の確認不要(自分のPCの中だけ)Open WebUIなど前に置くソフトで自前で用意サービスのアカウント管理を使う
利用の記録個人のPCに残るだけ前に置くソフトやサーバーの設定次第管理画面で見られるかを契約前に確認
データの置き場所そのPCの中社内のサーバーの中提供元の説明と契約で確認
使えるモデルPCのメモリに収まるものサーバーのメモリに収まるもの提供元が対応しているもの
更新と保守本人情シスなど社内の担当者主に提供元
向いている場面個人の検証、開発の手元での試用社外に出せない情報を決まった部署で扱う全社員に配る、複数のAIを使い分ける

1台で試す段階なら、Ollamaは気軽に始められる道具として十分に役立ちます。迷いが出てくるのは、部署やフロアの外まで広げようとしたときです。共有に進むなら、ログインと記録の仕組みを誰が作り、誰が守り続けるのかを先に決めておく必要があります。その担当を置けない会社では、無理に自前で抱えるより、既製のサービスと並べて判断するほうが現実的かもしれません。

会社で安全に使うために決めておくこと

自前で運用する場合も、既製のサービスを使う場合も、会社として決めておきたい項目そのものは同じになります。違いは、その項目を自社で作り込むのか、サービスの機能として受け取るのかという点にあります。

1つ目は、入力した内容がモデルの学習に使われないことを、どう確かめるかです。Ollamaを自分の機械だけで動かすなら外へ送られない作りですが、クラウドのモデルを使えば同社のサーバーで処理されます。既製のサービスなら、学習に使わない扱いが契約や公式の説明に書かれているかを確認することになるでしょう。

2つ目はログの管理で、だれがいつ何に使ったかを、後から会社として追える状態にしておきたい場面も出てきます。Ollamaで共有する場合は、前に置く画面やサーバーで記録を残す設計を自前で考えなければなりません。既製のサービスでは、管理者が利用の記録を見られる画面があるかどうかが比べる点になります。

3つ目は社員への配り方で、入社や退職のたびにアカウントを足したり止めたりする作業が必ず発生します。Open WebUIなら管理者が承認と停止を担い、既製のサービスなら管理画面で同じことをする形です。人数が増えるほど、この作業の重さが効いてきます。

4つ目は、複数のAIの使い分けです。社内で動かせるモデルはメモリに収まる大きさに限られる一方、調べものや長い文書の読み込みでは、クラウドの大きなモデルが向く場面もあります。手元のモデルとクラウドのAIをどう分けて使うかは、主要4AIの違いと使い分けも参考に、業務ごとに決めてみてください。

会社で生成AIを使うときの点検項目は生成AIのセキュリティ対策チェックリストに、社内ルールの作り方は生成AIの社内ガイドラインの作り方にまとめました。社員が個人の判断で入れたOllamaが会社の把握していないAIの利用になる経路は、シャドーAI(野良AI)の記事でも取り上げています。

社内で使う前のチェックリスト

社員から使いたいと言われたときや、試しに部署で動かしてみるときに、情シスや総務が先に確かめておきたい項目を並べました。多くは公式ドキュメントに設定の方法や記載がある項目で、上から順に埋めていけば判断の材料がそろうはずです。

  • クラウド機能を止めたかOLLAMA_NO_CLOUDを1にするか、server.jsonでdisable_ollama_cloudをtrueにし、ログにOllama cloud disabled: trueと出ることを確かめる。サインインしたままのPCが無いかも見る。
  • 待ち受けの範囲を決めたか1人で使うなら既定の127.0.0.1のまま。社内に開くなら、OLLAMA_HOSTを変えるPCやサーバーを情シスが決め、それ以外のPCでは変えさせない。
  • 使う人を確かめる仕組みを前に置いたか自分のPCのAPIは認証が要らないと公式に記載がある。共有するならOpen WebUIなどのログインを前に置き、新規登録は管理者の承認制にする。
  • 社外から届かない経路になっているかngrokやCloudflare Tunnelのような外に出す手順は使わない。ファイアウォールや閉じたネットワークの内側に置き、11434番ポートが外から見えないかを確かめる。
  • 同時に使う人数と設定を見積もったかOLLAMA_NUM_PARALLELの既定は1。上げるとメモリの必要量が増えるので、ollama psで100% GPUかを見ながら調整する。待ちの上限はOLLAMA_MAX_QUEUE(既定512)。
  • 使ってよいモデルとライセンスを決めたかApache 2.0のモデルと、Llama 4 Community LicenseやPLaMo Community Licenseのような独自の条件のモデルを分け、社内で使ってよい一覧を作る。
  • 保存先の容量と更新の担当を決めたかモデルの保存先はOLLAMA_MODELSで変えられる。更新はWindowsとMacが自動ダウンロード、Linuxはスクリプトの流し直しなので、誰がいつ上げるかを決める。
  • 記録をどこに残すか決めたかだれが何を入力したかを残す必要があるなら、前に置く画面やサーバーの側で記録を設計する。
  • 社員への説明を用意したか入力してよい情報の範囲、社外に出せない資料の扱い、クラウドのモデルを使わないことを、社内ルールとして文書にして配る。

すべてに印が付かない場合でも、1台で試す段階なら始めてかまいません。共有を始める前に、上の4つ目までは必ず埋めておくようにしましょう。

自前で運用するか、既製の環境を使うか

UPGEAR AIは、ChatGPT・Claude・Gemini・Perplexityを1画面で切り替えて使える法人向けサービスです。管理者ダッシュボードで利用ログ・権限・モデルのON/OFFを管理でき、会話履歴とログは国内サーバー(AWSの日本リージョン)で管理します。料金は月額30,000円(税抜)から。どのプランも利用人数は無制限で、料金は利用量に応じたプラン設計です(人数の目安はライト1〜5名、スタンダード6〜20名、プレミアム21〜50名)。初期費用100,000円(税抜)が別途かかります。

UPGEAR AIの詳細を見る

よくある質問

Ollamaは無料で使えますか?
自分のPCやサーバーでモデルを動かす分は無料です。本体はMIT Licenseのオープンソースで、公式の料金ページでも自分のハードウェアで動かす分は無制限と案内されています。有料になるのは、Ollama社のクラウドでモデルを動かすプラン(Proが月20ドルなど)を使う場合です。料金は2026年10月時点の公式ページの表示です。
Ollamaに入力した内容は外部に送られますか?
自分の機械でモデルを動かしている間は、プロンプトもデータも同社からは見えないと公式のFAQに書かれています。ただし、名前の末尾が:cloudのクラウドのモデルを使うと、同社のサーバーで処理されます。会社で使うなら、環境変数OLLAMA_NO_CLOUDを1にするなどしてクラウド機能を止め、ログで止まっていることを確かめてください。
OllamaでおすすめのLLMはどれですか?
手元のPCのメモリに収まる大きさから選ぶのが基本です。ライセンスが扱いやすいApache 2.0のものでは、gpt-oss・Qwen3.5やQwen3.6・Gemma 4がOllamaの公式ライブラリに並んでいます。日本語を重く見るなら、ELYZA・Qwen3 Swallow・LLM-jpなど国内の組織が公開しているモデルも候補になります。どれを選ぶ場合も、モデルごとのLICENSEの本文を確認してください。
ローカルLLMを実行できるアプリはありますか?
代表的なものに、コマンドとAPIが中心のOllamaと、画面の操作が中心のLM Studioがあります。Ollamaは自分の機械で動かす分は無料、LM Studioは職場でも無料と提供元が案内しています。社員にブラウザから使ってもらうなら、Ollamaの裏で動かし、Open WebUIのようなチャット画面を前に置く構成も取れます。
LLMとローカルLLMの違いは何ですか?
LLM(大規模言語モデル)は、文章を読み書きするAIの本体を指す言葉です。ChatGPTなどは提供する会社のサーバーでLLMが動きますが、ローカルLLMは同じようなモデルを自分のPCや社内のサーバーで動かす使い方を指します。入力した内容を外に出さずに済む一方、動かせるモデルの大きさは手元の機械のメモリで決まります。
GPUが無いPCでもOllamaは動きますか?
CPUだけでも動かすことは出来ます。IntelのMacはCPUだけで動く扱いになっています。ただし、ollama psのPROCESSOR欄にCPUの割合が出る状態は、公式ドキュメントが避けるよう案内している状態です。業務で毎日使う前提なら、小さいモデルで試してから機器を決めることをおすすめします。
OllamaとLM Studioはどちらを選べばよいですか?
使う人が画面で操作するならLM Studio、サーバーとして裏で動かし別のツールから呼び出すならOllamaが合いやすい傾向があります。社内LANで共有する場合、LM StudioはRequire Authenticationで認証を有効にする設定が画面に用意されています。Ollamaで共有する場合は、Open WebUIなどログインの仕組みを持つ画面を前に置く形になります。
Ollamaを社内LANで共有しても大丈夫ですか?
共有する設定自体は環境変数OLLAMA_HOSTで出来ますが、自分のPCのAPIは認証が要らないと公式ドキュメントに記載があり、公開手順にも利用者を確かめる設定の説明はありません。共有するなら、Open WebUIなどログインの仕組みを持つ画面を前に置き、ファイアウォールの内側で使うようにしてください。Ciscoの研究者は2025年9月に、ネットに露出したOllamaのサーバーを同社の調査で1,139件見つけたと公表しています。

まとめ

Ollamaは、自分のPCやサーバーで言語モデルを動かすための無料のソフトで、インストールとコマンド1行で試し始めることが出来ます。本体はMIT Licenseで、自分の機械で動かす分には料金がかかりません。ただし、いまのOllamaにはクラウドでモデルを動かす機能もあるため、社外に出したくない情報を扱うなら、最初にクラウド機能を止めておくことが大切になります。

社内の複数人で使うときは、OLLAMA_HOSTで待ち受けの範囲を広げ、OLLAMA_NUM_PARALLELなどで同時処理を調整していきます。その際、自分のPCのAPIは認証が要らないと公式に書かれていること、公開手順に利用者を確かめる設定の説明がないことを前提に、ログインと記録の仕組みを別に用意してください。ネットに露出したOllamaのサーバーが多数見つかったというCiscoの調査も、その必要性を示しています。

1台で試す、社内で共有する、既製の法人向けサービスを使う、の3つは、作業の量と担当がそれぞれ違います。共有に進む前に、ログイン・記録・配布・モデルの更新を誰が担い続けるのかを決め、その答えをもとに自前で運用するかどうかを判断してみましょう。ローカルLLMの全体像に戻りたいときはローカルLLMとは何かの解説を、ほかの記事はAI活用コラム一覧をご覧ください。