ローカルLLMでできること。社内で使える7つの用途と、できないこと

ローカルLLMとは、インターネット上のサービスではなく、自社のPCやサーバーの中で動かす大規模言語モデル(文章を読み書きするAI)のことです。文書の要約や下書き、会議録音の文字起こし、メールからの項目の抜き出し、社内文書への質問といった作業は、小さめのモデルならメモリ16GB以上のPC1台でも試すことが出来ます。一方で、最新の情報を調べる、全社で権限を分けて使う、大きなクラウドのAI並みの品質を出す、の3つは1台のローカルLLMでは難しくなります。定義やGPU、費用の内訳はローカルLLMとは?仕組み・必要なPC・費用で扱っています。

ローカルLLMでできること|社内で使える7つの用途

ローカルLLMの使い道は、手元の文章や音声、画像を読ませて、まとめる・書く・分ける・抜き出す仕事が中心になります。社外のサービスへデータを送らずに動かせるため、まだ外に出せない社内資料を扱えるのが持ち味です。ここで挙げる機能は、無料の実行ソフトであるOllamaとLM Studio、音声用のWhisperの公式ドキュメントで確かめたものに限っています。

1. 文書の要約と議事録の整理

長い報告書や会議のメモを読ませ、要点を数行にまとめる使い方は、ローカルLLMで最初に試しやすい用途になります。LM Studioはチャットにdocx・pdf・txtのファイルを添付でき、文書が短ければ中身をそのまま会話に入れて読ませる仕組みです。要約は元の文書が手元にあるので、数字や人名が合っているかを読み比べて確かめることが出来ます。まずは公開済みの社内報や、外に出ても困らない議事録から試してみてください。

2. メールや文書の下書き・言い換え・翻訳

お知らせ文や社内向けメールの下書き、硬い文章を柔らかく言い換える作業も、ローカルLLMの得意な使い道です。Qwen3.6-27Bのモデルカードには201言語に対応、Gemma 4の公式ブログには140以上の言語で学習したと書かれており、英文メールの下訳にも使えます。ただし日本語を名指しした記載はどちらにも見当たらないため、日本語の自然さは自社の文書で確かめる必要があります。日本語に力を入れたモデルとしては、ELYZAや東京科学大学・産総研のQwen3 Swallow、国立情報学研究所のLLM-jpが公開されています。SB IntuitionsのSarashinaのように、3Bと小さくMITライセンスで公開されているモデルもあります。モデルの選び方はローカルLLMのおすすめモデルで詳しく比べていますので、あわせてご覧ください。

3. 社内文書への質問(RAG)

就業規則や社内マニュアルを読ませて質問に答えさせる使い方は、RAG(検索拡張生成。質問に関係する箇所を探してからAIに答えさせる仕組み)と呼ばれます。LM Studioは長い文書を添付すると自動でRAGに切り替わりますが、公式ドキュメントにはうまくいく場合もあれば調整と試行が要る場合もあると書かれています。答えの出典を画面に表示させたい場合は、MITライセンスで無料のAnythingLLMのような専用ソフトを組み合わせる形になります。検索には文章を数値に変える埋め込みモデルも別に要り、Ollamaはembeddinggemma・qwen3-embedding・all-minilmを推奨モデルとして挙げています。文書の分け方や検索用のモデルの選び方はローカルLLMで社内文書RAGを作る方法にまとめてあります。

4. メールの仕分けと項目の抜き出し

Ollamaの構造化出力は、答えを決まった項目の形(JSON)にそろえさせる機能で、文書から必要な項目だけを取り出す用途に向いています。たとえば請求書のメールから取引先名・金額・支払期日を同じ項目名で抜き出させれば、表に貼り付けて一覧にすることが出来ます。同じページには、Ollamaのクラウド版は構造化出力に対応していないと書かれており、手元で動かす場合の機能となります。プログラムから呼び出す形になるため、表計算のマクロや簡単なスクリプトを書ける方が社内に1人いると進めやすいでしょう。

5. 画像の読み取り

画像に対応したモデルを使えば、写真や図を見せて説明させたり、分類させたり、写っている内容について質問したりすることが出来ます。Ollamaの公式ドキュメントでは、gemma4に画像ファイルを渡して何が写っているかを尋ねる例が示されています。どのモデルでも画像を読めるわけではないので、モデルを選ぶ段階で画像対応かどうかを確かめておきましょう。Ollamaの構造化出力のドキュメントも、画像の説明を決まった項目の形で返させる使い方を挙げています。

6. 会議録音の文字起こし

音声の文字起こしは、文章用のモデルではなく、OpenAIが公開している音声認識モデルのWhisperを組み合わせる形になります。WhisperはコードとモデルがMITライセンスで公開されており、日本語を指定して文字起こしする使い方もREADMEで紹介されています。提供元の目安では、必要なGPUメモリ(VRAM)は上位版のlargeで約10GB、速度を上げたturboで約6GBとなります。READMEには言語によって性能が大きく異なるとも書かれているため、社名や人名、数字は録音と聞き比べて直す前提で使いましょう。文字起こしした文章を1.の要約に回せば、議事録の下書きまでを社内のPCの中で作ることが出来ます。

7. 社内ツールからの呼び出しとコード補助

OllamaとLM Studioは、OpenAIのAPIと同じ形で呼び出せる窓口(OpenAI互換API)を備えています。OpenAI向けに作られた社内ツールや開発用のソフトの接続先を、手元のローカルLLMに差し替えて使えるということです。LM Studioのドキュメントには、AnthropicのAPIと同じ形で呼べる窓口も載っています。Ollamaは対応しているのがAPIの一部だけだと明記しているため、差し替えた後に動くかどうかは試してみる必要があります。Ollamaのツール呼び出し機能を使うと、モデルに社内の仕組み(関数)を呼ばせ、その結果を回答に入れさせることも出来ます。どちらも作り込みにはプログラムが要るため、情報システムの担当者や開発者がいる会社向けの使い方となります。

ローカルLLMでできないこと・難しいこと

ローカルLLMが苦手なのは、外の情報を取りに行く仕事と、大勢で分け合って使う仕事、そして大きなモデル並みの品質が要る仕事の3つになります。どれもソフトを足せば近づけられますが、足した分だけ手間やデータの出口が増えてしまいます。

モデル単体は最新の情報を知らない

モデルは学習した時点の知識しか持っていないため、ローカルLLMに今週の制度改正や取引先の最新の動きを聞いても答えられません。Ollamaには検索をつなぐ機能がありますが、これはollama.comのWeb検索APIを呼び出す仕組みで、無料のOllamaアカウントとAPIキーが必要です。検索をつなぐと、問い合わせの文がollama.comという社外へ出ていくことになります。社外に出さないためにローカルLLMを選んだのであれば、調べものは会社で認めたクラウドのAIに任せるほうが筋が通るでしょう。

1台のPCを全社員で、権限を分けて使う

AnythingLLMの公式GitHubでは、複数人での利用と権限の設定はDocker版だけの機能とされています。デスクトップ版を入れたPCは、そのPCを使う方のための道具と考えたほうがよいでしょう。社内文書を読ませる場合にも注意が要り、IPAのサイトに載っているテキスト生成AIの導入・運用ガイドラインは、検索用のデータベースに機密情報を入れると全てのユーザーが参照できてしまう点を挙げています。部署や役職で見せる範囲を分けるには、サーバーを立てて利用者と権限を管理する仕組みが別に要ることになります。

大きなクラウドのAI並みの品質を、1台で出す

PCで無理なく試せるのは、ダウンロードの大きさが数GBから十数GBまでのモデルが中心です。OpenAIのgpt-oss-120bは80GBのGPU1枚に収まる設計とされており、Ollamaでのダウンロードの大きさは65GBあります。MetaのLlama 4 Scoutも、Ollamaでのダウンロードの大きさが67GBとなります。Qwen3.8には総パラメータ数2.4兆のモデルもあり、こちらは社内のPCで動かす規模ではありません。長い資料を読み比べる、込み入った判断をさせるといった仕事は、クラウドの大きなモデルと結果を並べて比べてから任せるかどうかを決めてください。

どのモデルでも同じ機能を使うこと

画像の読み取りやツール呼び出しは実行ソフト側の機能で、使えるかどうかはモデルによって変わってきます。画像は画像対応のモデル、ツール呼び出しは対応したモデルでしか動かないため、日本語の得意なモデルを選んだら画像は読めなかった、ということも起こり得ます。構造化出力もOllamaのクラウド版では使えず、手元で動かす場合に限られます。やりたい用途を先に決め、その用途に対応したモデルの中から日本語の出来を比べる順番で選んでください。

答えの正しさを保証すること

ローカルでもクラウドでも、AIの答えは間違うことがあります。WhisperのREADMEは言語によって性能が大きく違うと書き、LM StudioのドキュメントもRAGには調整が要る場合があるとしています。Llama 4 Scoutの公式対応12言語には日本語が入っておらず、Gemma 4やgpt-ossも日本語を名指しした公式の記載は確認できません。数字・金額・条文番号が出てくる答えは、ローカルかどうかに関係なく、元の資料と突き合わせる工程を残しておいてください。

1台では配れないAIを、会社の環境として用意する

権限を分けて全社員に配る部分は、使う環境を会社で1つにまとめると管理しやすくなります。UPGEAR AI(アップギアAI)は、ChatGPT・Claude・Gemini・Perplexityを1つの契約で使える法人向けサービスです(人数無制限)。

用途別の判断表|モデル・メモリの目安と人の確認

7つの用途を、始めやすさ・必要なモデルとメモリの目安・人の確認の要否で1枚にまとめると次のようになります。メモリの数字はモデル提供元の自己申告とOllamaが表示するダウンロードの大きさで、実際に動かすと読ませる文章の長さに応じてさらにメモリを使います。

用途始めやすさモデルの目安メモリの目安人の確認
1. 文書の要約・議事録の整理PC1台ですぐ試せる汎用の文章モデル(例:qwen3.5 9b、gpt-oss-20b)LM Studioの推奨は16GB以上。ダウンロードは9bで6.6GB、gpt-oss-20bで14GB要る。数字と人名を原文と照らす
2. 下書き・言い換え・翻訳PC1台ですぐ試せる汎用の文章モデル。多言語ならQwen3.6-27B(201言語と記載)汎用はqwen3.5 9bで6.6GB。27bは約18〜19GBで、24GB以上のPC向け必須。社外に出す前に人が読む
3. 社内文書への質問(RAG)少人数なら試せる。全社で使うには仕組みが要る文章モデル+埋め込みモデル(bge-m3、embeddinggemma)文章モデル分に加え、埋め込みはbge-m3で1.2GB、embeddinggemmaで622MB必須。出典の箇所を開いて確かめる
4. メールの仕分け・項目の抜き出しスクリプトを書ける方がいれば進めやすい汎用の文章モデル+Ollamaの構造化出力(手元で動かす場合のみ)文章モデル分必須。金額と期日は全件照合
5. 画像の読み取り画像対応のモデルを選べば試せる画像対応モデル(例:gemma4)gemma4 26bのダウンロードは約16〜19GB要る。読み違いを前提に照らす
6. 会議録音の文字起こしWhisperを別に入れれば試せるWhisper turbo(809M)またはlarge(1550M)VRAMの目安はturboで約6GB、largeで約10GB要る。固有名詞と数字を聞き直す
7. 社内ツールからの呼び出し・コード補助開発者がいる会社向けOpenAI互換APIで呼べる文章モデル。ツール呼び出しは対応モデルのみ文章モデル分必須。開発者が動作を試す

※モデルの大きさはOllamaライブラリの表示(2026年10月3日取得のダウンロードサイズ)、gpt-oss-20bが16GBのメモリで動く設計である点はOpenAIのモデルカードの記載、Whisperの必要VRAMはOpenAIのREADMEの目安(2026年10月6日確認)です。いずれも提供元の自己申告で、第三者が検証した値ではありません。速度と精度は機種と文書によって変わるため、この表には載せていません。

表で人の確認を「必須」とした用途は、AIの出力をそのまま社外や帳簿に使わず、担当者が元の資料と照らし合わせる前提で考えてください。始めやすさの列で「PC1台ですぐ試せる」とした要約と下書きは、ソフトを入れてモデルを1つ選べば当日から試せる用途です。社内文書への質問とメールの抜き出しは、文書の準備やプログラムが加わるため、試験の2週目以降に回しても遅くはありません。文字起こしと画像の読み取りは、対応するモデルやソフトを別に用意する分だけ手間が増えてしまいます。

必要なハードウェア(GPU・メモリ)の目安

扱えるモデルの大きさは、GPUのメモリ(VRAM)か、MacのようにCPUとGPUが共有するメモリの量で決まってきます。LM StudioはRAMを16GB以上、Windowsで専用GPUを使う場合はVRAM4GB以上を推奨しています。たとえばApple日本の公式表記では、Mac mini(M6)はメモリ16GBの構成が149,800円(税込)からとなり、NVIDIAのGeForce RTX 5060 Tiにも16GB版があります。Macのメモリは購入時の構成で決まり、後から増やせるとの記載はないため、20b級より大きなモデルを試す予定があれば最初から多めに選ぶほうが無難でしょう。Ollamaではollama psというコマンドで、モデルがGPUとCPUのどちらに載っているかを確かめることが出来ます。機種ごとの比較はローカルLLMにおすすめのPCで詳しく扱っています。

代表的なモデルとライセンス(Qwen・Gemma・gpt-oss・Llama)

会社で使いやすいのは、商用利用の条件がわかりやすいApache 2.0ライセンスのモデルです。アリババのQwen3.6、GoogleのGemma 4、OpenAIのgpt-ossはいずれもApache 2.0で公開されており、国産ではELYZAやQwen3 SwallowもApache 2.0となります。MetaのLlama 4だけは独自のライセンスで、Llamaを使って作ったモデルの名前をLlamaで始めることなどの条件が付いています。ライセンスの名称はモデルカードの表示なので、使い始める前に各リポジトリのLICENSE本文を確かめてください。モデルどうしの違いはローカルLLMのモデル比較で並べています。

実行ソフトはOllamaとLM Studioが入口

モデルを動かすソフトは、画面で操作できるLM Studioと、コマンドやプログラムから使うOllamaの2つが入口になります。Ollamaは自分の機械で動かす分は無料で、本体はMITライセンスです。LM Studioも2025年7月8日の公式ブログで、家庭でも職場でも無料で使えると発表しました。試すだけならLM Studio、社内のツールにつなぐならOllama、と分けて考えると選びやすいでしょう。

会計事務所・中小企業での使いどころ

社員10〜200名の会社や会計事務所で試しやすいのは、決まった形の書類を毎日たくさん扱う仕事になります。手元のPCで完結するため、顧問先や取引先の情報を社外のサービスに渡す前の下準備にも使えます。

就業規則への質問に答えさせる

厚生労働省はモデル就業規則(令和7年12月版)をWordとPDFで公開しており、社内の規程を読ませる前の試験用の文書にちょうどよい題材です。モデル就業規則をLM Studioに添付して休暇や休職の手続きを質問し、答えと条文が合っているかを総務の担当者が確かめてみてください。試験で手ごたえがあれば、自社の就業規則に差し替えて同じ質問を繰り返すことになります。

請求書メールの仕分けと項目の抜き出し

経理の受信箱に届く請求書メールは、構造化出力を使った抜き出しと相性のよい題材です。取引先名・請求金額・支払期日・振込先の4項目を決めておき、本文から同じ項目名で取り出させれば、支払い予定の一覧の下書きを作ることが出来ます。金額と期日は1件ずつ請求書の原本と照らし合わせ、AIの出力をそのまま振込に使わないでください。請求書ではないメールを除く仕分けも、項目に請求書かどうかを加えれば同じ仕組みで扱えます。

写真や紙の書類の内容を確かめる

画像に対応したモデルなら、紙の書類を撮った写真を見せて何の書類かを分類させたり、書かれている内容について質問したりすることが出来ます。届いた書類を請求書・見積書・納品書のどれに当たるかで分ける下準備は、間違えても人がすぐ気づける作業なので試しやすい題材です。読み取った数字を会計ソフトへ入れる段階では、必ず原本の画像と見比べる工程を挟みましょう。

総務への問い合わせに答える下書きを作る

休暇の申請方法や経費精算の締め日のように、総務に何度も届く質問への返事も、社内の規程やマニュアルを読ませておけば下書きを作らせることが出来ます。返事を送るのは担当者で、AIは該当する条文と答えの案を並べる役に留めると、間違いがあっても社内で止められます。よく届く質問を10問ほど選び、規程のどこに答えがあるかを担当者が知っているものから試してみてください。

顧問先の資料や打ち合わせの記録をまとめる

顧問先から預かった資料の説明文や、打ち合わせの録音から作った文字起こしを、要点に整理する用途も考えられます。録音はWhisperで文字にしてからローカルLLMで要約すれば、音声も文章も事務所のPCの外へ送らずに扱えます。ただし顧問先の情報を扱う前には、PCの置き場所や持ち出しのルールを事務所で決めておきましょう。

社内で試す手順|非機密の文書で1〜2週間

いきなり機密の文書を読ませるのではなく、外に出ても困らない文書で1〜2週間ほど試してから、本番で使うかどうかを決める流れをおすすめします。試すのは情報システムの担当者か総務の方1人と、実際にその作業をしている部署の方1〜2名の小さな組で十分でしょう。

  • 用意するものメモリ16GB以上のPC1台、LM StudioかOllama、Apache 2.0のモデル1つ、試験用の文書(厚生労働省のモデル就業規則、公開済みの社内報やお知らせなど)。
  • 1週目:用途を2〜3つに絞って毎日使う7つの用途から自分の仕事に近いものを選び、要約・下書き・質問のどれかを毎日の作業の中で使ってみます。
  • 比べ方:同じ質問をクラウドのAIにも投げて採点する会社で契約しているクラウドのAIにも同じ質問をして答えを並べます。デジタル庁のリスク対策ガイドブック(α版)が挙げる、質問に合った箇所を文書から引けているか、答えに出てくる固有名詞が元の文書の中にあるか、の2点を採点の軸にします。
  • 2週目:機密を載せる前の確認AnythingLLMを使うならサイドバーのPrivacyでテレメトリー(利用状況の送信)を止める、モデルのLICENSE本文を読む、PCの置き場所と持ち出しのルールを決める、読ませる文書を見てよい人の範囲を決める。
  • 判断:誰が決めるか試した部署の方が使い続けたいかを聞き、担当者が設定と更新にかかった手間を書き出し、その2つを見て経営者が続けるかどうかを決めます。

採点の表は、質問・ローカルLLMの答え・クラウドのAIの答え・正しかったか、の4列があれば足ります。ローカルLLMで足りた用途だけを残し、足りなかった用途は会社で認めたクラウドのAIに回す、という二段構えで線を引いてみてください。担当者が書き出す手間は、インストールとモデルのダウンロード、文書の準備、設定の変更、困ったときの調べものにかかった時間くらいで構いません。この記録が、後で既製のサービスと比べるときの材料になります。

クラウドのAIとの違いと使い分け

ローカルLLMとクラウドのAIの違いは、データの行き先と、手間を誰が持つかの2点にまとまります。細かな比べ方はローカルLLMとクラウドの比較に譲り、使い分けに関わる点だけを押さえておきましょう。

データを社外に出さない

モデルを手元で動かす場合、読ませた文書や質問をAIの提供元のサーバーへ送らずに済む点が、クラウドのAIとの大きな違いとなります。規程でクラウドへの入力が認められていない個人情報や顧問先の資料でも、扱える余地が生まれます。ただしAnythingLLMのように利用状況の送信(テレメトリー)が既定で有効なソフトもあるため、設定画面で送信を止めてから使ってください。

オフライン・閉域網でも使える

モデルを一度ダウンロードしてしまえば、文章を作らせるたびにインターネットへつなぐ必要はありません。社外のネットワークにつながない閉じた環境(閉域網)の中でも動かせるため、工場や研究部門の端末にも置くことが出来ます。モデルやソフトの更新を取り込むときだけ外とつながる手順を、あらかじめ決めておきましょう。

費用は機材の初期投資と電気代

ローカルLLMの費用は、使った量に応じて請求が増える形ではなく、PCやGPUを買う初期投資と、動かす間の電気代が中心になります。Ollamaの料金ページには、自分の機械で動かす分はいつでも無制限と書かれており、有料のPro(月20ドル)やMax(月100ドル)はクラウドで動かす場合のプランです。一方で、メモリを多く積んだMac Studio(M5 Max)は36GBの構成で419,800円(税込)からとなり、性能を求めるほど機材の費用は膨らんでしまいます。部署ごとに1台ずつ置く場合も、16GBのMac mini(M6)を3台そろえれば本体だけで449,400円(税込)となります。

※Ollamaの料金は2026年10月3日時点の公式料金ページ、Macの価格は同日時点のApple日本の公式表記(税込・最小構成)です。

カスタマイズ(RAG・ファインチューニング)

自社のデータに合わせる方法には、文書を検索させて答えさせるRAGと、モデルそのものを追加で学習させるファインチューニングの2つがあります。ファインチューニングは学習用のデータづくりとGPUの準備が要るため、中小企業が最初に取り組むならRAGのほうが現実的でしょう。RAGであれば、文書を入れ替えるだけで答えの元を新しく保つことが出来ます。ただし文書を登録するときと質問するときは同じ埋め込みモデルを使うようOllamaのドキュメントが勧めているため、モデルを替えると登録し直しになってしまいます。

クラウドのAIにも文書を読ませる機能がある

社内文書への質問は、ローカルLLMだけの使い道ではありません。Claudeのプロジェクト機能は有料プランで、資料が多くなると自動でRAGの方式に切り替わり、設定は要らないと提供元が説明しています。Gemini Notebook(旧NotebookLM)も読ませた資料に基づいて答え、文中に引用元を示す作りで、無料版はノートブックあたり最大50件の資料を登録できます。機密の度合いが低い文書なら、こうしたクラウドの機能のほうが準備の手間は少なくて済むでしょう。ローカルLLMで作るかどうかは、読ませる文書を社外に出せるかどうかで決めるとわかりやすくなります。

ローカルLLMが向く会社・向かない会社

向いているのは、外に出せない文書を決まった少人数で扱う会社や、ネットワークにつなげない端末で使いたい部署です。PCやモデルの面倒を見られる担当者が社内にいることも条件になります。反対に、全社員に配りたい、最新の情報を調べさせたい、担当者を置けないという会社は、クラウドのAIを会社として契約するほうが早道となるでしょう。

会社で安全に使うには|自社で構築するか、既製のサービスを使うか

ローカルLLMを業務の道具にするには、モデルを動かすことより、学習させない設定・ログの管理・社員への配布・複数のAIの使い分けを誰が担うかを決めることが先になります。この4つを自社で組み立てるか、既製の法人向けサービスに任せるかで、必要な手間が大きく変わってきます。

運用・保守・更新を自社で担う負担

自社で構築する場合、PCやサーバーの準備、モデルの入れ替え、利用者と権限の管理、利用ログの保存まで、すべてを社内で受け持つことになります。OWASPはRAGの検索の記録を書き換えられない形で残すことを対策に挙げており、こうした記録の仕組みも自分たちで用意する必要があります。モデルは数か月ごとに新しい版が出ており、Qwenのモデルカードの表記では、2026年2月に3.5、4月に3.6、8月に3.8となっています。新しい版に替えるたびに、使っている用途で答えが変わらないかを確かめ直す手間が続いてしまいます。

学習させない設定とログの管理

ローカルLLMは入力した文書をAIの提供元へ送らずに動かせるため、学習させない設定を提供元ごとに確かめる手間はかかりません。その代わり、誰がいつ何を入力したかの記録は、各PCの中に散らばってしまいます。AnythingLLMのデスクトップ版の案内にも、モデル・文書・会話の履歴は手元の機械に残ると書かれており、会社として一か所で見る仕組みは別に作る必要があります。情報漏えいの相談を受けたときに、どのPCで何が扱われたかを答えられるかどうかを、導入前に確かめておいてください。

社員への配布と複数のAIの使い分け

ローカルLLMを何人かに配る場合、PCごとに実行ソフトを入れ、十数GBあるモデルをそれぞれダウンロードすることになります。ソフトやモデルの版がPCごとにずれると、同じ質問でも答えが変わり、困ったときの問い合わせも担当者に集まってしまいます。調べものはクラウドのAI、機密の文書はローカルLLM、と使い分けるなら、どの仕事にどれを使うかを社員に示す一覧も要るでしょう。主要なAIごとの得意な仕事はChatGPT・Claude・Gemini・Perplexityの使い分けで整理していますので、社内の一覧を作るときの下書きに使ってみてください。

既製の法人向けサービスを使う場合

既製の法人向けサービスは、学習に使わない設定やアカウントの発行・停止、利用ログを提供元が用意しているため、自社で作り込む部分が少なくなります。その代わり、入力したデータは提供元のサーバーを通るので、保存場所や学習利用の条件を契約で確かめておく必要があります。Microsoft 365 Copilotのように、社員がもともと表示する権限を持つデータだけを答えに使うと公式に説明しているサービスも出てきています。点検の項目は生成AIのセキュリティ対策チェックリストに、複数のAIを1か所で使う考え方はマルチAIとはにまとめてありますので、比べるときの物差しにしてください。

どちらを選ぶかの目安

外に出せない文書を数人で扱うだけなら、ローカルLLMを1台置くのが手軽です。全社員に配り、退職者の停止やログの確認まで回したいなら、既製のサービスのほうが手間は少なくなります。機密の文書はローカルLLM、それ以外の調べものや資料作りは会社で契約したクラウドのAI、と両方を組み合わせる形も考えられるでしょう。社員が個人のアカウントで使うシャドーAI(野良AI)を減らすためにも、会社として使ってよい道具を先に示しておきましょう。ルールの書き方は生成AIの社内ガイドラインを参考にしてみてください。

ローカルLLMで足りない部分を、会社の環境で

UPGEAR AIは、ChatGPT・Claude・Gemini・Perplexityを1画面で切り替えて使える法人向けサービスです。データの保管とログ管理は国内サーバー(AWSの日本リージョン)で行い、管理者ダッシュボードで利用ログ・権限・モデルのON/OFFを扱えます。料金は月額30,000円(税抜)から。どのプランも利用人数は無制限で、料金は利用量に応じたプラン設計です(人数の目安はライト1〜5名、スタンダード6〜20名、プレミアム21〜50名)。初期費用100,000円(税抜)が別途かかります。

UPGEAR AIの詳細を見る

よくある質問

ローカルLLMでは何ができますか?
文書の要約、メールや文書の下書き・言い換え、社内文書への質問、メールの仕分けと項目の抜き出し、画像の読み取り、会議録音の文字起こし、社内ツールからの呼び出しの7つが代表的な使い道です。多くは、小さめのモデルを選べばメモリ16GB以上のPC1台で試し始めることが出来ます。最新情報の検索や、全社で権限を分けて使う用途には別の仕組みが必要になります。
ローカルLLMで最新の情報を調べられますか?
モデル単体では調べられません。Ollamaには検索をつなぐ機能がありますが、ollama.comのWeb検索APIを使うため、無料のOllamaアカウントとAPIキーが必要で、検索の文は社外へ送られます。最新情報の調べものは、会社で認めたクラウドのAIに任せる使い分けをおすすめします。
ローカルLLMを使うにはどのくらいのPCが必要ですか?
LM Studioは16GB以上のRAMを推奨しています。gpt-oss-20bは16GBのメモリで動くよう設計されているとOpenAIがモデルカードに書いており、Ollamaでのダウンロードの大きさは14GBです。音声の文字起こしに使うWhisperのturboは約6GBのVRAMが目安と提供元が示しています。いずれも提供元の自己申告で、速さは機種によって変わります。
ローカルLLMは無料で使えますか?
実行ソフトのOllamaは自分の機械で動かす分は無料で、LM Studioも職場での利用を含めて無料と発表しています。Apache 2.0ライセンスで公開されているモデルも多くあります。ただしPCやGPUを買う費用と電気代、設定や更新を担う社内の手間はかかります。
ローカルLLMを全社員で共有して使えますか?
AnythingLLMは複数人での利用と権限の設定をDocker版だけの機能としており、1台のPCに入れたデスクトップ版はそのPCを使う方のための道具になります。全社で使うには、サーバーを立てて利用者と権限を管理する仕組みが要ります。全社員に配るなら、既製の法人向けサービスと手間を比べて判断してください。
ローカルLLMの答えはそのまま業務に使えますか?
そのままではなく、人が確認する工程を残してください。Whisperの提供元は言語によって性能が大きく違うとしており、LM StudioもRAGには調整が要る場合があると書いています。金額・期日・条文番号のように間違いが損につながる項目は、元の資料と1件ずつ照らし合わせる運用が必要です。
ローカルLLMとクラウドのAIはどう使い分ければよいですか?
外に出せない文書の要約や項目の抜き出しはローカルLLM、最新の情報を調べる仕事や全社員で使う用途はクラウドのAI、と分ける考え方が始めやすいでしょう。まず非機密の文書で同じ質問を両方に投げて答えを並べ、ローカルで足りた用途だけを残す方法をおすすめします。
ローカルLLMは日本語でも使えますか?
多くのモデルは多言語に対応していますが、Gemma 4は140以上の言語、Qwen3.6-27Bは201言語と書かれているだけで、日本語を名指しした記載は確認できません。Llama 4 Scoutの公式対応12言語には日本語が入っていません。日本語に力を入れたモデルにはELYZA、Qwen3 Swallow、LLM-jp、Sarashinaなどがあり、自社の文書で読み比べて選ぶことをおすすめします。

まとめ

ローカルLLMでできることは、要約、下書きと言い換え、社内文書への質問、メールの仕分けと項目の抜き出し、画像の読み取り、会議録音の文字起こし、社内ツールからの呼び出しの7つが中心です。どれも手元のPCの中で動かせるため、外に出せない文書を扱える点が強みになります。

反対に、最新の情報を調べる、全社で権限を分けて使う、大きなクラウドのAI並みの品質を出す、の3つは1台では難しく、検索をつなげば問い合わせの文が社外へ出てしまいます。まずは非機密の文書で1〜2週間試し、クラウドのAIと答えを並べて、ローカルで足りる用途だけを残してみてください。

全社に配る段階では、学習させない設定・ログの管理・社員への配布を自社で組み立てる手間と、既製の法人向けサービスを使う場合とを並べて判断することになります。ほかの記事はAI活用コラム一覧からご覧いただけます。