
日本語で使うローカルLLMとは、社内のPCやサーバーで大規模言語モデルを動かし、日本語の文書を外部のサービスへ送らずに扱う使い方のことです。国産モデルは必須ではなく、先に見たい決め手は日本語の出来よりも、学習の出自・ライセンス・国産と説明できるかの3点となります。2026年10月6日時点で重みを入手できる国産モデルにはLLM-jp-4.1・ELYZA・Qwen3 Swallow・Sarashina2.2・CyberAgentLM3などがあり、PCで試せる大きさのものから選ぶことが出来ます。日本語の出来は、候補を2〜3に絞ったうえで自社の文書を使って確かめてみてください。
ローカルLLMとは|クラウドLLMとの違いと日本語で使うときの前提
ローカルLLMとクラウドLLMの違いは、モデルがどこで動き、入力した文書がどこを通るかにあります。定義や仕組みの全体像はローカルLLMとは何かをまとめた解説に譲り、ここでは日本語で使う場面に絞ってお伝えします。
クラウドLLMは、ChatGPTやGeminiのように提供元のサーバーで動くモデルを、ブラウザの画面やAPIを通して使う形です。社員は画面を開くだけで使い始められ、モデルの入れ替えも提供元が受け持ってくれます。ローカルLLMはその反対で、重み(モデルの中身にあたるファイル)を自分でダウンロードし、社内の機械で動かすことになります。重みを一般に公開しているモデルはオープンウェイトモデルとも呼ばれ、考え方はオープンウェイトモデルの解説で詳しく触れています。
日本語で使う前提として知っておきたいのは、海外のモデルも多言語への対応を前面に出している点です。GoogleはGemma 4を140以上の言語で学習したと案内し、アリババのQwen3.5のモデルカードには201の言語・方言に対応と書かれています。ただしGemma 4について日本語を名指しした公式の記載は確認できず、日本語の出来は使う側で確かめる形となります。国産モデルが作られ続けている理由の1つは、日本語のデータに重点を置いて学習したり、開発元を国内で説明できたりする点にあるのでしょう。
ローカルLLMのメリット・デメリット|日本語で使うときに変わる点
メリットとデメリットの中身は日本語でも変わらず、日本語で使うときに変わるのは、選べるモデルの数と、確かめる手間のほうです。メリットとして挙がるのは次の4つになります。
- 入力した文書が社外のサービスを通らず、情報が漏れる経路を減らせる
- 使うたびの利用料がかからず、費用は機械と電気代、担当者の時間が中心になる
- インターネットにつながらない環境でも動かせる
- どのモデルを使い、どう設定するかを自社で決められる
反対に、デメリットとしては次の4つが挙げられます。
- 大きなモデルほど、GPUとメモリを積んだ機械が要る
- 新しいモデルが出るたびに、探して入れ替える作業を自社で抱える
- ライセンスをモデルごと、世代ごとに確かめる必要がある
- 社員が使う画面やアカウント、権限の仕組みを自分たちで用意する
日本語で使う場合に響いてくるのは、デメリットの2つ目と3つ目でしょう。国産モデルは、LLM-jp-4.1が2026年9月28日に、LLM-jp-4のベースモデルを土台にしたELYZAの新モデルが10月2日にHugging Faceで公開されるなど、短い間隔で新しいモデルが出ています。さらに、国産と名の付くモデルでも、規約は土台にした海外モデルのものを引き継ぐ場合があるため注意が必要です。この2点は、次の一覧と出自の表を使って具体的に見ていきましょう。
国産のオープンな日本語LLM一覧(2026年10月6日確認)
2026年10月6日時点で、Hugging Faceから重みを入手できる国産の日本語LLMは、主に9つの提供元から出ています。提供元の公式ページとモデルカードで確かめた内容を、1つの表にまとめました。
※2026年10月6日に、各提供元の公式ページとHugging Faceのモデル一覧・モデルカードで確認した内容です。Hugging Faceの作成日はアップロードの日付で、公式の発表日と異なる場合があります。公開日を確認できなかったものは「未確認」としています。ライセンスはモデルカードの表示で、使う前には各リポジトリのLICENSEの本文を確認してください。性能の比較は載せていません。
| 提供元 | 最新版・主なモデル | 公開日 | 大きさ(パラメータ数) | 学習の出自 | ライセンス |
|---|---|---|---|---|---|
| LLM-jp(国立情報学研究所 大規模言語モデル研究開発センター) | LLM-jp-4.1シリーズ(8b/32b-a3b/33b のthinking) | 2026年9月28日(公式発表) | 約8.6B/総約32B(動くのは約3.8BのMoE)/約33.2B | 事前学習から自前(※1) | Apache 2.0 |
| ELYZA | ELYZA-Thinking-1.0-llm-jp-4-33b/-32b-a3b | 2026年10月2日(Hugging Faceでの公開) | 33B級/総32B級のMoE | LLM-jp-4のベースモデルに追加学習 | Apache 2.0 |
| ELYZA(前の世代) | ELYZA-Thinking-1.0-Qwen-32B/Llama-3-ELYZA-JP-8B | 2025年4月30日/2024年6月(Hugging Face) | 32B/8B | Qwen2.5-32B-Instruct/Llama 3に追加学習 | Apache 2.0/Meta Llama 3 Community License |
| Swallow(東京科学大学・産業技術総合研究所) | Qwen3-Swallow(8B/30B-A3B/32B)、GPT-OSS-Swallow(20B/120B) | 2026年2月20日(Qwen3 Swallowの公式公開日) | 8B〜120B | Qwen3・gpt-ossに追加学習 | Apache 2.0(Qwen3 Swallow) |
| PLaMo(Preferred Networks) | plamo-3-nict-31b/8b/2b-base、plamo-3-nict-2604-31b-base | 2025年10月24日(Hugging Face)、2604版は2026年6月12日(同) | 2B〜31B | 英語と日本語のデータで事前学習(NICTと共同)。チャット向けの指示調整はなし | PLaMo Community License |
| Sarashina(SB Intuitions) | sarashina2.2(0.5B/1B/3B と instruct-v0.1) | 2025年2〜3月(Hugging Face) | 0.5B〜3B | 日本語・英語・コードを含む10兆トークンで学習(土台のモデルの記載なし) | MIT |
| CyberAgentLM(サイバーエージェント) | calm3-22b-chat/CAT-Paws-8B・CAT-Thinking-8B | 未確認 | 22B/8B | calm3は一から学習、CATはQwen3-8Bに追加学習 | Apache 2.0 |
| Stockmark(ストックマーク) | Stockmark-2-100B-Instruct | 未確認 | 100B | 日本語に重点を置いて一から学習 | MIT |
| Rakuten AI(楽天グループ) | RakutenAI-3.0 | 2026年3月17日(発表) | 約7,000億(MoE) | 土台のモデルの公式記載は未確認 | Apache 2.0 |
| rinna | qwen2.5-bakeneko-32b-instruct-v2/gemma-2-baku-2b-it | 2025年3月/2024年10月(Hugging Face) | 32B/2B | Qwen2.5/Gemma 2に追加学習 | Apache 2.0/Gemma Terms of Use |
※1 LLM-jp-4.1のモデルカードには、事前学習と中間学習を合わせて11.7兆トークンで学習したと書かれています。ELYZAのモデルカードは、LLM-jp-4の33Bのベースモデル(llm-jp-4-33b-base)を、日本でLLM-jpが一から事前学習したものと記載しています。Bはパラメータ数の単位で、1Bは10億です。
表のうち、パラメータ数が10B(100億)未満と比較的小さいのは、LLM-jp-4.1の8B、Qwen3-Swallowの8B、Sarashina2.2、CyberAgentのCAT-Paws-8B、rinnaのgemma-2-baku-2b-itなどになります。提供元ごとの特徴は、次のとおりです。
LLM-jp-4.1|国立情報学研究所が公開したApache 2.0のモデル群
LLM-jpは、国立情報学研究所の大規模言語モデル研究開発センターが開発しているモデルで、2026年9月28日に最新のLLM-jp-4.1シリーズを公開しました。大きさは約8.6Bの8b、総パラメータ約32Bのうち動くのが約3.8BのMoE(入力ごとに一部の部品だけを動かす構造)の32b-a3b、約33.2Bの33bの3種類で、公開名にはいずれもthinkingが付いています。ライセンスは3つともApache 2.0と公式に書かれており、本文に利用規模の条件はありません。モデルカードによると、事前学習と中間学習を合わせて11.7兆トークンのデータで学習しています。提供元自身がGGUF(PCの実行ソフトで読み込める形式)も公開しているため、国産の中では手元で試すまでの手順が少なく済むでしょう。
ELYZA|LLM-jpやQwenを土台に、日本語の追加学習を重ねるモデル
ELYZAは、海外モデルや国産モデルを土台に日本語の追加学習を重ねてきた会社で、世代ごとに土台が変わってきました。2024年6月のLlama-3-ELYZA-JP-8BはMetaのLlama 3、2025年4月30日のELYZA-Thinking-1.0-Qwen-32BはQwen2.5-32B-Instructが土台です。2026年10月2日にHugging Faceで公開された新しい2つは、LLM-jp-4のベースモデルにELYZAが中間学習と仕上げの学習を加えたものになります。ライセンスも世代で変わり、Llama 3が土台の8BはMeta Llama 3 Community License、Qwen2.5とLLM-jp-4が土台のモデルはApache 2.0となっています。提供元が公開しているGGUFは、確認できた範囲ではLlama-3-ELYZA-JP-8B向けのものだけでした。
Swallow|QwenとGPT-OSSに日本語を追加学習したモデル
Swallowは、東京科学大学と産業技術総合研究所のプロジェクトが公開しているモデルで、2026年2月20日に公開したQwen3 Swallowが現行の中心になります。大きさは8B、30B-A3B、32Bの3種類で、ほかにOpenAIのgpt-ossを土台にしたGPT-OSS-Swallow(20B・120B)も出ています。いずれも海外モデルに日本語を追加学習したもので、一から学習したモデルではありません。Qwen3 SwallowのライセンスはApache 2.0となります。量子化版は、Qwen3 SwallowにAWQ-INT4、GPT-OSS-SwallowにMXFP4という形式が用意されていて、モデルカードには主にvLLM(サーバー向けの実行ソフト)で動作を確かめたと書かれています。PCの実行ソフトで使うGGUFについては、提供元が出しているものを確認できていません。
PLaMo|PFNとNICTのベースモデル、会社で使うなら規約に注意
PLaMoはPreferred Networks(PFN)のモデルで、現在公開されているのはplamo-3-nictの31B・8B・2Bなど、NICT(情報通信研究機構)と共同で開発したベースモデルが中心です。モデルカードにはチャット向けの指示調整をしていないと明記されており、そのまま社員の質問に答えさせる用途には向きません。さらに注意したいのは、独自のPLaMo Community Licenseが、社内での利用も商用目的に含めている点となります。商用目的で使えるのは、PFNの公式ページで事前に登録し、利用者または関連会社の年間売上が10億円を超えない場合に限られます。条件を超える会社は、PFNから別の商用ライセンスを得る必要が出てきてしまいます。
Sarashina2.2|0.5B〜3Bの小さな国産モデル
Sarashina2.2は、SB Intuitionsが公開している0.5B・1B・3Bの小さなモデルで、指示に答えるよう調整したinstruct版もあります。モデルカードによると、日本語・英語・コードを含む10兆トークンで学習しており、土台にした別のモデルの記載はありません。ライセンスはMITで、本文の条件は著作権表示と許諾表示を残すことだけになります。上位のSarashina3は重みの公開を確認できず、Sarashinaの名前を持つ法人向けのAPIやクラウドサービスとは分けて考える必要があります。
CyberAgentLM|一から学習したcalm3と、Qwen3を土台にしたCATシリーズ
サイバーエージェントのCyberAgentLM3(calm3-22b-chat)は、モデルカードに2.0兆トークンで一から事前学習したと書かれた22Bのモデルです。ライセンスはApache 2.0で、国産モデルのなかでは、LLM-jp-4.1と並んで候補にしやすい大きさになります。新しいCAT-Paws-8BとCAT-Thinking-8Bは、Qwen3-8Bを土台にした8Bのモデルで、こちらもApache 2.0となっています。同じ提供元でも、calm3とCATシリーズでは出自がまったく違うため、調達で国産と説明する場面では型番まで書き分けましょう。
Stockmark・Rakuten AI|一般のPCには載らない大きさのモデル
ストックマークのStockmark-2-100B-Instructは、日本語に重点を置いて一から学習した100Bのモデルで、ライセンスはMITです。楽天グループのRakutenAI-3.0は2026年3月17日に発表された約7,000億パラメータのMoEモデルで、Apache 2.0でHugging Faceから提供されています。どちらも一般のPCで動かす大きさではありません。RakutenAI-3.0のモデルカードは8枚のGPUでの実行を推奨しており、社内のサーバーで扱える会社は限られるでしょう。
rinna|QwenとGemmaを日本語向けに追加学習したモデル
rinnaは、海外モデルを土台に日本語向けの追加学習をしたモデルを公開している会社です。qwen2.5-bakeneko-32b-instruct-v2は2025年3月にQwen2.5を土台に作られたApache 2.0のモデルで、rinna自身がGGUFも公開しています。2024年10月のgemma-2-baku-2b-itはGemma 2の2Bを土台にしたモデルで、ライセンスは土台と同じGemma Terms of Useに従う形となります。
一から学習か、海外モデルの追加学習か|出自でライセンスが決まる
国産モデルの出自は、一から学習したもの、海外モデルに追加学習したもの、国産モデルに追加学習したものの3つに分かれ、出自がライセンスの決まり方を左右します。追加学習とは、すでに学習を終えたモデルに日本語のデータなどで学習を重ね、性質を寄せていく方法のことです。土台のモデルに独自の規約がある場合、追加学習したモデルもその規約に従う形になります。
| 出自 | 主なモデル(2026年10月6日確認・かっこ内は土台) | ライセンスの決まり方 |
|---|---|---|
| 一から学習 | LLM-jpのモデル(※1)、CyberAgentLM3(calm3-22b-chat)、Stockmark-2-100B-Instruct | 提供元が選んだライセンス(この3つはApache 2.0かMIT) |
| 海外モデルに追加学習 | Qwen3 Swallow(Qwen3)、GPT-OSS-Swallow(gpt-oss)、ELYZA-Thinking-1.0-Qwen-32B(Qwen2.5)、Llama-3-ELYZA-JP-8B(Llama 3)、CAT-Paws-8B(Qwen3)、qwen2.5-bakeneko(Qwen2.5)、gemma-2-baku(Gemma 2) | 土台の規約を引き継ぐ。Llama 3とGemma 2が土台のものは、MetaとGoogleの独自規約に従う |
| 国産モデルに追加学習 | ELYZA-Thinking-1.0-llm-jp-4(LLM-jp-4のベースモデル) | 土台と同じApache 2.0 |
| 土台の公式記載がない | Sarashina2.2、PLaMo 3(plamo-3-nict)、RakutenAI-3.0 | 提供元のライセンスに従う(PLaMoは独自規約) |
表で目を引くのは、追加学習型が数の上では多数を占める点でしょう。そのうちLlama 3やGemma 2を土台にしたモデルは、Apache 2.0やMITではなく、MetaやGoogleの独自規約に従う必要があります。旧世代のLlama 3.3 Swallow 70Bのように、Llama 3.3とGemmaの両方の規約が併記されている例も見られます。同じ提供元でも世代によってライセンスが変わるため、型番ごとにLICENSEの本文を確かめてください。
国産と説明できるかは、出自で答えが変わる
取引先や調達の要件で国内で開発されたモデルを求められたとき、海外モデルを土台にしたものを国産として扱えるかは、要件の文言次第となってしまいます。開発と追加学習を国内の会社や研究機関が担っていても、土台の学習はアリババやMeta、Googleが手がけたものだからです。説明を求められそうな場面では、一から学習したLLM-jpのモデルやCyberAgentLM3を候補に入れると話が早く進みます。PLaMo 3も英語と日本語のデータで事前学習したとモデルカードにありますが、先ほどの規約の条件があるため、会社の規模によっては候補から外れてしまうでしょう。
ライセンスの条項を規模・表示・派生モデルの名前・再配布・禁止用途に分けて並べた表は、ローカルLLMのモデル比較の記事にまとめています。モデルを決める前に、自社の使い方が社内利用だけか、社外に提供するかを書き出してから当てはめてみましょう。
モデルごとの規約確認や更新の追跡を社内で抱えきれない場合は、使う環境を会社で1つにまとめる方法もあります。UPGEAR AI(アップギアAI)は、ChatGPT・Claude・Gemini・Perplexityを1つの契約で使える法人向けサービスです(人数無制限)。
国産を選ぶ場面・海外の多言語モデルで足りる場面の判断表
国産を選ぶかどうかは、日本語の出来ではなく、会社の事情から先に決めると迷いが減ります。よくある状況ごとに、向く候補と理由を表にしました。
| 会社の状況 | 向く候補 | 理由 |
|---|---|---|
| 取引先や調達の要件で、国内で開発したモデルを求められる | 一から学習した国産(LLM-jpのモデル、CyberAgentLM3) | 開発と学習の出自を国内で説明できる |
| ライセンスの確認を軽くしたい | Apache 2.0かMITのモデル(国産・海外を問わない) | 利用規模の条件がなく、確かめる条項が少ない |
| 年間売上10億円を超える会社が社内で使う | PLaMo以外のモデル | PLaMo Community Licenseは社内利用も商用に数え、売上の条件がある |
| 手元のノートPCで試したい | 小さいモデル(Sarashina2.2、LLM-jp-4.1の8BのGGUF) | LLM-jp-4.1の8BはQ4_K_MのGGUFで5.5GBと、ファイルが小さい |
| Ollamaの公式ライブラリから手軽に始めたい | 海外の多言語モデル(Qwen・Gemma・gpt-ossなど) | 国産は公式ライブラリに見当たらず、GGUFの取り込みが要る |
| 社内サーバーでvLLMを使い、複数人で使う | Qwen3 Swallow | 提供元がvLLMで動作を確かめ、AWQ-INT4版を公開している |
| 英語など他の言語の文書も混ざる | 海外の多言語モデル、または日本語と英語で学習した国産 | 多言語への対応を案内しているモデルが多い |
| 敬語や業界の言い回しが多い社内文書を扱う | 国産1つと海外1つを並べて試す | 公開指標だけでは自社の文書での出来は分からない |
| 100B以上の大きなモデルを使いたい | 複数のGPUを持つサーバーがある会社のみ(Stockmark、RakutenAI-3.0) | 一般のPCには載らない |
表を並べてみると、国産でなければならない場面は意外と限られています。それ以外は、ライセンスや大きさ、使う実行ソフトの都合で候補を選び、最後に日本語の出来を比べる流れで十分になります。
海外の多言語モデル(Qwen・Gemma・Llama・gpt-oss)で足りる場面
社内の汎用的な質問や文書の下書きが中心なら、海外の多言語モデルで足りる場面も多いでしょう。Ollamaの公式ライブラリには、2026年10月3日の確認でQwen3.5・Qwen3.6・Gemma 4・gpt-oss・Llama 4が並んでおり、モデル名を指定して取り込むことが出来ます。ライセンスも、Gemma 4は旧世代の独自規約からApache 2.0に変わり、Qwen3は公開した重みをすべてApache 2.0にしたと公式のREADMEに書かれています。一方でLlama 4は独自のLlama 4 Community Licenseで、Scoutの公式の対応12言語に日本語は含まれていません。日本語の業務で使うなら、Llama 4は候補の最後に回すのが無難です。海外モデルの最新世代とPCで動く大きさの目安は、ローカルLLMのおすすめモデルの記事で確認日つきで整理しています。
迷ったら、国産1つと海外1つを同じ質問で比べる
国産と海外のどちらがよいか決めきれないときは、同じくらいの大きさの国産1つと海外1つを選び、同じ社内文書で答えさせてみてください。例えばLLM-jp-4.1の8BとQwen3.5の9Bのように、大きさをそろえると比べやすくなります。比べるのは、敬語の自然さ、社内の言い回しの理解、数字や固有名詞の取り違えの3点で足りるでしょう。
tsuzumi 2・cotomi・Takaneは、重みを公開している国産モデルと何が違うか
NTTのtsuzumi 2、NECのcotomi、富士通のTakaneは国産LLMとしてよく名前が挙がりますが、2026年10月6日時点でHugging Faceなどから重みを一般にダウンロードできる形は確認できませんでした。提供元が公開していないと明言しているわけではないものの、自分でダウンロードして動かすローカルLLMとは入手の仕方が違います。
| 名称(提供元) | 公式発表で確認できること | 重みの一般公開 |
|---|---|---|
| tsuzumi 2(NTT) | 2025年10月20日に提供開始。NTTがフルスクラッチで開発した純国産モデルで、1GPUで推論でき、オンプレミスやプライベートクラウドで運用できると同社が発表。2026年5月19日のアップデートで、図表を含む文書を画像として読み込めるように開発したと発表 | 確認できず |
| cotomi(NEC) | 2023年12月時点で130億パラメータクラス(同社発表)。2026年3月9日、cotomi v3がデジタル庁のガバメントAIで試用する国内LLMに選ばれたと発表 | 確認できず |
| Takane(富士通) | 2024年9月30日に提供開始。CohereのCommand R+をベースに日本語の追加学習とファインチューニングを行った、プライベート環境で使える企業向けLLM(同社発表) | 確認できず |
| Sarashina(SB Intuitions) | 4,600億パラメーター規模のSarashinaで培った知見をもとにした軽量モデルSarashina miniのAPIを、2025年11月28日に提供開始。ソフトバンクのクラウドサービスでも2026年6月から順次提供を開始すると発表(2026年4月16日) | 小型のsarashina2.2は公開。Sarashina3は確認できず |
これらは、提供元と契約して導入する製品やサービスとして案内されています。tsuzumi 2のようにオンプレミスで動かせる形態があっても、重みを自由に入手して自社だけで入れ替えるローカルLLMとは、費用の払い方も更新の仕方も変わってきます。Takaneは富士通とCohereの共同開発で、土台はCohereのCommand R+となっています。先ほどの出自の分け方に当てはめると、海外モデルに追加学習した型に入ります。日本語の性能について各社が出している世界トップレベルなどの表現は同社発表で、第三者が同じ条件で比べた結果ではない点にも気をつけましょう。
重みが公開されていない国産LLMを選ぶ場面
閉じた環境での運用と、提供元の支援の両方を求める会社では、こうした製品を検討する価値があります。ただ、社員10〜200名規模の会社がまず試す相手としては、契約の手続きが前提になるため、重く感じられることも多いでしょう。まずは重みが公開されたモデルで社内の使い方を固め、足りない点が見えてから製品の問い合わせに進む順番がおすすめになります。
実行ツール(Ollama・LM Studio・llama.cpp)で国産モデルを動かす入手経路
2026年10月6日にOllamaの公式ライブラリの一覧を確かめたところ、国産モデルは見当たらず、Hugging FaceからGGUFのファイルを取り込んで使う形になります。Ollamaでは公式ライブラリのモデル名を指定するだけで始められますが、国産モデルではこの手軽な方法が使えません。GGUFは、量子化(重みの数値の精度を下げてメモリの必要量を減らす方法)を施したモデルを配るときに使われる形式で、Q4_K_Mのような名前はllama.cppの量子化の種類を表しています。OllamaやLM Studioは、この形式のファイルを読み込んで動かすことが出来ます。
提供元がPC向けの形式を公開しているか(2026年10月6日確認)
| モデル | 提供元が公開している軽量化した形式 |
|---|---|
| LLM-jp-4.1(8b・32b-a3b・33b) | GGUF(8bはQ4_K_Mで5.5GB、量子化なしのBF16で17.2GB) |
| Llama-3-ELYZA-JP-8B | GGUF |
| qwen2.5-bakeneko-32b-instruct-v2(rinna) | GGUF |
| Qwen3 Swallow | AWQ-INT4(GGUFは確認できず) |
| GPT-OSS-Swallow | MXFP4(GGUFは確認できず) |
| ELYZA-Thinking-1.0(LLM-jp-4が土台)、Sarashina2.2、CyberAgentLM、Stockmark、RakutenAI-3.0、PLaMo | 提供元のGGUFは確認できず |
提供元がGGUFを出しているのは、確認できた範囲でLLM-jp、ELYZAの旧8B、rinnaの3つでした。それ以外のモデルを手元で動かすには、自分で変換するか、提供元以外が変換したファイルを使うことになります。提供元以外が変換したGGUFを使うときは、変換した人と元のライセンスを確かめてから社内に入れましょう。
GGUFで国産モデルを試す5つの手順
- Hugging Faceで提供元の組織のページ(例:llm-jp、elyza、rinna)を開き、目的のモデルを探す
- 名前の末尾に-ggufが付いたリポジトリがあるか確かめる
- ファイルの一覧から量子化の種類を選ぶ(迷ったらQ4_K_Mから始め、機械に余裕があれば精度の高い形式に上げる)
- OllamaやLM Studioにファイルを読み込み、日本語の質問を数問投げて動くか確かめる
- モデルカードとLICENSEの本文を保存し、取り込んだ日付と一緒に社内の記録に残す
社内の何台ものPCに配る場合や、サーバーに載せて複数人で使う場合の設定は、ローカルLLMの構築手順の記事で順に説明しています。Macで動かす場合は、MacでローカルLLMを動かす方法も参考にしてみてください。
PCで動く大きさの目安|必要スペックは量子化とMoEで変わる
必要なスペックは、パラメータ数だけでなく、量子化の種類とMoEかどうかで大きく変わります。LLM-jp-4.1の8Bを例にとると、提供元のGGUFはQ4_K_Mで5.5GB、量子化していないBF16で17.2GBと、同じモデルでも約3分の1の大きさになります。メモリにはファイルの大きさに加えて、会話の長さに応じて増える分も要るため、ファイルの大きさぴったりの機械では足りない点に注意しましょう。
MoEのモデルは、動くパラメータが少なく計算は軽い一方で、全体をメモリに載せる必要があるとHugging Faceの公式ブログで説明されています。LLM-jp-4.1の32b-a3bなら、動くのは約3.8Bでも、メモリは総パラメータの約32B分を見込む必要があります。大きさの段階で見ると、2B〜8Bはメモリの少ない機械でも試しやすく、100B以上は複数のGPUを持つサーバーの領域となります。参考までに、NTTはtsuzumi 2を40GB以下のメモリを持つGPUでの動作を想定して開発したと説明しています。
自社のPCやGPUでどの大きさまで動くかは、ローカルLLM用PCの選び方と、モデル比較の記事にある必要メモリの計算例で確かめることが出来ます。
国産モデルが合う業務の例|社内文書検索・要約・翻訳・規制のある業種
国産モデルが活きるのは、外に出せない日本語の文書を、社内の言い回しのまま扱いたい業務になります。
社内規程や手順書の検索(RAG)
就業規則や業務マニュアルを読み込ませ、社員の質問に該当箇所を示しながら答えさせる使い方は、RAG(検索して答える仕組み)と呼ばれます。社内の文書は社外秘のものが多く、文書を外に出さずに済むローカルLLMと組み合わせやすい用途です。仕組みの作り方と注意点はローカルLLMで社内文書RAGを作る方法にまとめています。
議事録や顧問先資料の要約
会議の文字起こしや、顧問先から預かった決算資料の要点をまとめる作業も、外に出したくない文書を扱う代表的な例でしょう。会計事務所であれば、顧問先ごとの資料を所内のPCだけで要約し、担当者が確認してから報告に使う流れが考えられます。要約の出来は文書の書き方に左右されやすいため、自社の資料で数件試してから範囲を広げましょう。
英語の資料の翻訳
海外の取引先から届いた英文の契約書や仕様書を、社外に出さずに日本語へ訳したい場面もあります。Swallowプロジェクトの評価項目には英日・日英の翻訳が含まれており、日本語と英語の両方で学習したモデルを候補にするとよいでしょう。訳文は必ず人が原文と突き合わせ、そのまま社外に出さない決まりにしておきましょう。
顧客情報を扱う業種
金融・医療・士業のように顧客の情報を預かる業種では、文書を外部のサービスに送ること自体を避けたいという声が出やすくなります。この場合も、モデルを動かす機械の管理や、誰が何を入力したかの記録は自社で用意する必要があります。ローカルだから安全と考えるのではなく、機械とアクセスの管理まで含めて設計するのが前提となってきます。
日本語の精度は、公開指標と社内文書10問の2段階で確かめる
日本語の精度は、まず公開されている評価の指標で候補を絞り、最後は自社の文書で作った小さなテストで決める2段階で確かめます。日本語の公開指標には、Weights & Biases Japanが運営するNejumi LLMリーダーボード(現行は2025年8月27日に公開されたNejumi LLMリーダーボード4)や、LLM-jpのllm-jp-eval、Swallowプロジェクトのリーダーボードなどがあります。どの指標も測っている力が違い、提供元自身が点数だけで優劣を決めないよう注意を促しているものも見られます。
指標が何を測るかの読み分けと、社内文書10問の小テストの作り方、採点の仕方は、ローカルLLMのモデル比較|日本語性能の見方で詳しく紹介しています。この記事の一覧から国産と海外を2〜3つ選んだら、そちらの手順で比べてみてください。
自社で構築・運用する手間と、法人向けサービスを使う場合の比べ方
国産モデルを選んだあとに残るのは、機械の用意、モデルの更新、ライセンスの確認、社員への配布という4つの手間です。既製の法人向けの生成AIサービスを使う場合と並べると、どこに手間がかかるかが見えやすいでしょう。
| 項目 | ローカルLLMを自社で動かす | 既製の法人向けサービスを使う |
|---|---|---|
| 機械 | GPUやメモリを積んだPC・サーバーを買い、置き場所と電源を用意する | 社員のPCのブラウザで使える |
| モデルの更新 | 新しい版を自分で探し、試してから入れ替える | 提供元が対応する(使えるモデルはサービス次第) |
| ライセンスの確認 | モデルごと・世代ごとに本文を確かめる | サービスの利用規約とデータの扱いを確かめる |
| 社員への配布 | 画面・アカウント・権限を自社で用意する | 管理画面でアカウントを発行する(機能はサービスによる) |
| 入力した文書の行き先 | 社内の機械の中 | 学習に使われないか、どこに保管されるかを契約と設定で確かめる |
| 費用の中心 | 機械の購入費と担当者の時間 | 月額などの利用料 |
表の右側では文書が社外のサービスを通るため、学習に使われない設定や保管場所を契約で確かめることが前提になります。反対に左側は、文書が社内に残る代わりに、上の4つを担う担当者が社内に必要となってしまいます。短い間隔で新しいモデルが出る今は、担当者が1人で追い続けるのは負担が大きいでしょう。
会社で安全に使うには|機密度で使い分ける
現実的なのは、どちらか一方に決めず、扱う文書の機密度で使い分ける形になります。社外に出せない顧客情報や未公開の数字はローカルLLMで、それ以外の日常の文書作成や調べものは法人向けサービスで、と線を引くことが出来ます。どちらを使う場合でも、入力してよい情報の決まりと、社員が個人のアカウントで使わない仕組みは別に整える必要があります。決まりの作り方は生成AIの社内ガイドラインの作り方、点検する項目は生成AIのセキュリティ対策チェックリストで確かめてみてください。会社が把握していない使い方が広がる経路は、シャドーAI(野良AI)の解説で取り上げています。
日常の業務は、会社で1つの環境にまとめる
UPGEAR AI(アップギアAI)は、ChatGPT・Claude・Gemini・Perplexityを1つの契約・1つの画面で使える法人向けサービスです。会話履歴と利用ログは国内サーバー(AWSの日本リージョン)で管理し、管理者ダッシュボードで利用ログ・権限・モデルのON/OFFを扱えます。推論まで国内で完結する「完全国内処理モデル」を選べば、処理自体を海外に出さずに済みます。料金は月額30,000円(税抜)から。どのプランも利用人数は無制限で、料金は利用量に応じたプラン設計です(人数の目安はライト1〜5名、スタンダード6〜20名、プレミアム21〜50名)。初期費用100,000円(税抜)が別途かかります。
UPGEAR AIの詳細を見るよくある質問
日本語で使うなら、国産のローカルLLMのほうが精度は高いですか?
国産のローカルLLMは、会社で無料で使えますか?
Ollamaで国産モデルを使うにはどうすればよいですか?
tsuzumi 2やcotomiは、ローカルLLMとして自社のPCで動かせますか?
海外モデルを日本語向けに追加学習したモデルは、国産と言えますか?
まずPCで試すなら、どのくらいの大きさのモデルから始めればよいですか?
まとめ
日本語で使うローカルLLMに、国産モデルは必須ではありません。2026年10月6日時点で重みを入手できる国産モデルは、LLM-jp・ELYZA・Swallow・PLaMo・Sarashina・CyberAgentLM・Stockmark・Rakuten AI・rinnaの9つの提供元から出ており、一から学習したものと海外モデルに追加学習したものが混ざっています。選ぶときは、国内で開発したと説明する必要があるか、ライセンスの条件が自社に合うか、手元の機械で動く大きさか、の順に絞ると迷いが減ります。
tsuzumi 2・cotomi・Takaneは重みの一般公開を確認できず、契約して導入する製品として別に考える必要があります。Ollamaの公式ライブラリに国産モデルは見当たらないため、試すときはHugging FaceのGGUFを取り込む形になります。日本語の出来は公開指標で絞り、最後は自社の文書で確かめてみてください。
モデルの入れ替えやライセンスの確認を社内で続けるのが難しい場合は、機密度の高い文書だけをローカルLLMで扱い、日常の業務は法人向けサービスに任せる分け方も検討してみましょう。ほかのAI活用の記事はAI活用コラム一覧から探すことが出来ます。
