
ローカルLLMのモデル比較とは、自社のPCやサーバーで動かすAIモデルの候補を、日本語性能・必要メモリ・ライセンスの3点で並べて選ぶ作業です。日本語で業務に使うなら、公開指標は何を測っているかで読み分けて候補を絞り、最後は社内文書10問の小テストで決めると迷いにくくなります。必要メモリは総パラメータ×ビット数÷8の式で見積もり、ライセンスは条項ごとに自社の使い方へ当てはめてみてください。どのモデルが一番かという順位は数か月で入れ替わるため、比べ方を持っておくほうが長く役に立つでしょう。
ローカルLLMのモデル比較は、日本語・メモリ・ライセンスの3つの数字で見る
モデルを比べるときに見る数字は、日本語性能の公開指標、必要メモリの計算値、ライセンスの条項の3つに絞れます。ローカルLLMの仕組みやクラウドのAIとの違いはローカルLLMとは何かをまとめた解説に、業務ごとにどのモデルを選ぶかはローカルLLMのおすすめモデルの記事にまとめてあります。ここで扱うのは、その手前にある「何を、どの数字で見比べるか」という問いになります。読み手として想定しているのは、社員10〜200名ほどの会社で、ローカルLLMを試すかどうかを任された情シスや総務の方です。
3つの数字には、それぞれ読み違えやすい点があります。日本語性能の指標は名前が似ていても測っている中身が違い、同じモデルでも指標によって並び方が変わってしまいます。必要メモリは、モデルの名前に付いた「35B」のような数字だけでは決まらず、量子化の方式と、一度に読ませる文章の長さで大きく変わります。ライセンスは「Apache 2.0なら自由」で片付けられがちですが、社内で使うだけでも登録や条件が付くモデルがあるため、条項ごとに読む必要があります。
比べる候補の中心はQwen3.5・Qwen3.6とGemma 4
2026年10月時点で比較の候補に入りやすいのは、アリババのQwen3.5・Qwen3.6と、GoogleのGemma 4の2系統になります。Qwen3.6には、総パラメータ35B(350億)のうち計算に使うのが3Bだけの35B-A3Bや、27Bがあり、どちらもApache 2.0で公開されています。Qwen3.5の35B-A3Bは201の言語・方言に対応するとモデルカードに書かれており、Qwen3.6-27Bにも201言語に対応と記載があります。Gemma 4は2026年4月2日の公式ブログで、E2B・E4B・26BのMoE・31BのDenseという4つのサイズが発表され、140以上の言語で学習したと説明されています。ライセンスは、それまでのGemma独自の利用規約から、Apache 2.0に変わりました。8月にはQwen3.8-27B(Apache 2.0)も出ていますが、Ollamaでの表示サイズを確かめていないため、後の計算表には入れていません。
どちらの系統も、モデルカードに日本語を名指しした記載は確認できませんでした。多言語に対応する中の一つとして日本語も扱える、という位置づけで読むのが実態に近いでしょう。日本語を前面に出したモデルには、Qwen2.5-32B-Instructをもとに日本語の推論を強めたELYZA-Thinking-1.0-Qwen-32B、東京科学大学と産総研のQwen3 Swallow(8B・30B-A3B・32B)、LLM-jpのllm-jp-4.1-8b-thinking、SB Intuitionsのsarashina2.2-3b-instruct-v0.1(3B)、サイバーエージェントのCyberAgentLM3-22B-Chat(2024年公開)があります。軽いモデルを探す場合は、OpenAIのgpt-oss-20b(総21B・活性3.6B)が、16GBのメモリで動くよう設計されているとモデルカードに書かれています。
これらの数字はすべて提供元がモデルカードで示している値で、第三者が検証した性能ではありません。サイズや日付は2026年10月3日時点の公式の表示をもとにしているため、検討の際は各モデルのページで最新の内容を確かめてみてください。
用途別のおすすめモデル表は親記事で確かめる
汎用・コード・軽量・日本語特化という用途別のおすすめと、その一覧表はローカルLLMのおすすめモデルの記事に載せています。ここでは同じ表を作り直さない代わりに、その表を自社の条件で読み直すための物差しを3つ用意しました。一覧から2〜3本の候補を選んだら、次の節からの物差しを順に当ててみましょう。機種選びと費用はローカルLLMに必要なPCスペックで扱っているので、こちらでは計算の手順だけに絞ります。
確かめる順番はライセンス、メモリ、日本語性能
3つの数字は、確かめる手間が小さい順に、ライセンス、メモリ、日本語性能の順で見ていくと無駄が出にくくなります。ライセンスはページを開いて条項を読めば済み、使えないモデルをこの段階で外すことが出来ます。メモリは計算で見当が付くので、社内の機械に載らないモデルを次に外します。日本語性能の小テストは人が採点する手間がかかるため、最後に残った2〜3本だけで試すのが現実的です。順番を逆にすると、時間をかけて試したモデルが、あとからライセンスや機械の都合で使えないと分かってしまいます。以下の節は日本語性能の読み方から始めますが、実際に試すときはこの順番で進めてみてください。
日本語性能の公開指標は、何を測っているかで読み分ける
日本語性能の公開指標は、どれも「日本語が上手か」を一つの点数で示すものではなく、知識・指示への従い方・自由な文章・安全性など、それぞれ別のものを測っています。名前が並んでいると同じ物差しに見えますが、測る中身と採点の仕方が違うため、同じモデルでも指標によって並び方が変わることがあります。どの指標が何を見ているのかを押さえると、表の読み違いを減らすことが出来ます。以下は、2026年10月6日に各指標の公開元のページで確認した内容になります。
Nejumi LLMリーダーボード4:汎用の力と安全性を2つの軸で見る
Nejumi LLMリーダーボードは、Weights & Biases Japanが運営する日本語LLMの評価表です。確認できた最新版は2025年8月27日に公開されたNejumi LLMリーダーボード4で、ASCII.jpも公開を報じています。評価は大きく2つの軸に分かれ、1つは汎用言語性能(GLP)と呼ばれ、応用スキル・推論・知識・基礎言語能力・コーディング・関数呼び出しを見ます。もう1つはアラインメント(ALT)で、制御性・倫理・安全性・バイアス・真実性・幻覚耐性・堅牢性を扱っています。
ASCII.jpの報道によると、版4では推論にARC-AGIとARC-AGI-2、知識にJMMLU-ProとHumanity's Last Exam、開発系にSWE-Bench Verified・JHumanEval・MT-Bench Coding・BFCL、アラインメントにM-IFEvalとHalluLensが加わりました。採点は、選択式の正誤や形式を守れているか、意味の近さを機械で見る自動評価と、GPT-4oなどのLLMに採点させる審査を組み合わせています。読み方として気を付けたいのは、総合の並びに、コーディングや関数呼び出しのような、文書の業務とは関わりの薄い項目も含まれる点です。社内の文書作業に使うなら、総合の並びではなく、GLPとALTを分け、知識や基礎言語能力の項目を個別に開いてみてください。
提供元の説明には、読む側に役立つ注意書きもあります。JMMLU Robustnessという項目は、本質的に同じ問題でも聞き方を変えると正答率が変わるかを見るもので、言い回しへの強さを測っています。毒性やJBBQなど一部のデータセットは非公開とされており、外から問題の中身を確かめられない項目があることも覚えておきましょう。
llm-jp-eval:自動採点の点数と、公開元が書く注意点
llm-jp-evalは、日本語LLMの開発プロジェクトであるLLM-jpが公開している評価の仕組みです。複数の分野の日本語タスクを自動で採点し、答えが完全に一致するか、文字単位でどれだけ重なるか(F1)を指標に使い、コード生成は実際に動かして評価します。多肢選択と自由記述の両方を含む点も、この評価の特徴になります。2026年10月6日時点の最新リリースは、2026年6月3日のv2.1.5でした。
この評価で読み落とせないのは、公開元のREADMEにある注意書きになります。評価データと同じ形式のデータ(jasterと呼ばれるもの)で調整したモデルは、テスト用のデータそのものを使っていなくても、非常に高い点数が出ることがあるとされます。高い点数だけを根拠に、ほかのモデルより優れていると言い切るのは適切ではない、とも添えられています。公開元自身が点数の限界を書いているのは、読む側にとって心強い材料でしょう。llm-jp-evalの点数を社内の説明に使う場合は、この注意書きも一緒に添えると、話が誤って伝わりにくくなります。
Japanese MT-Bench:自由な文章をAIが10点満点で採点する
Japanese MT-Benchは、Stability AIが公開している日本語版の評価で、FastChatという仕組みを日本語向けに分けたものです。何往復かのやり取りになる質問に答えさせ、その答えをGPT-4が10点満点で採点し、平均を出します。選択式ではなく自由に書いた文章を見るため、メールの下書きや説明文のような業務に近い力を映しやすい面があります。一方で、採点するのもAIなので、採点役のAIの好みが点数に入り込む余地も残ってしまいます。点数の差が小さいときは、その差を性能の差と読まないほうが無難でしょう。
JMMLU:4択の知識問題。翻訳した問題と日本独自の問題が混ざる
JMMLUは、早稲田大学のNLP研究室が公開している4択の問題集です。56科目・7,536問からなり、英語の知識問題集MMLUを翻訳した問題(翻訳者が確認したもの)と、日本の学校教育に由来する日本独自の問題で構成されています。測っているのは、正しい選択肢を選べるかという知識の量と理解になります。文章を書く力や、社内の書式に合わせる力は、この点数には表れません。4択で強いモデルが、そのまま報告書の下書きでも強いとは限らない点を覚えておいてください。
Swallow LLM Leaderboard:日本固有の知識・翻訳・指示への従い方
Swallow LLM Leaderboardは、東京科学大学と産総研のSwallowプロジェクトが公開している評価表で、2026年10月6日に確認した時点の直近の更新は2026年5月8日でした。指示に合わせて調整したモデル向けの日本語タスクには、日本固有の知識を問うJamC-QA、英日・日英の翻訳(WMT20を使いBLEUという指標で採点)、指示に従う力を見るM-IFEval-Ja、MMLU-ProX、GPQAの日本語版、PolyMath Ja、JHumanEvalが並んでいます。Japanese MT-Benchの審査役はGPT-5.2と書かれており、ここでもAIが採点に入る形になります。社内の文書業務に近いのは、日本固有の知識と、指示どおりの形で答えられるかを見る項目でしょう。
ELYZA-tasks-100:人が5段階で採点する100問
ELYZA-tasks-100は、ELYZAが公開した日本語の100問で、ライセンスはCC BY-SA 4.0です。公開元の説明では、採点は人の手による5段階評価で、1つのデータを3人で採点するとされています。人が読んで採点する方式は手間がかかる代わりに、自由な文章の出来を見やすいという利点があります。後の節で紹介する社内10問の小テストも、この人手で採点する考え方を下敷きにしています。
指標の項目を社内の仕事に対応づける
指標の項目名は、社内のどの仕事に近いかで読み替えると、見るべき場所がはっきりします。NejumiのGLPでは、知識の項目が規程や制度についての質問に、基礎言語能力の項目が要約や言い換え、敬語の自然さに近いと考えられます。コーディングと関数呼び出しは、開発や社内システムとの連携に使う場合にだけ重みを置けば足ります。ALTの側では、幻覚耐性が作り話の少なさに、制御性が指定した書式や字数を守る力に対応すると読むことが出来ます。
Swallowの項目も同じように読み替えられます。JamC-QAは日本の制度や慣習の知識、英日・日英の翻訳は海外とのメール、M-IFEval-Jaは書式や条件を守る力、JHumanEvalはプログラムを書く力に当たります。後の節の10問では、問9が日本固有の知識、問10が翻訳、問1と問3が指示への従い方に対応しているので、指標と小テストの結果を見比べると、どこで差が開いたかを確かめやすくなります。項目と自社の仕事の対応を一度書き出しておけば、新しい評価表が出たときにも同じ見方で読めるでしょう。
同じモデルでも指標で並び方が変わるわけ
並び方が変わる大きな要因は、問題の形と採点の方法の2つになります。4択や完全一致で採点する指標は、正解が1つに決まる問題に強いモデルを高く見せ、自由な文章をAIや人が採点する指標は、読みやすく筋の通った文章を書けるモデルを高く見せます。同じモデルが、知識の4択では上にいて、自由記述の採点では中ほどに来ることも起こり得ます。採点役がAIの指標では、どのAIが採点したかによっても点数の付き方が変わってしまいます。
指標が使う問題が公開されているかどうかも、読み方に関わります。問題が公開されていれば中身を確かめられる反面、llm-jp-evalの注意書きにあるように、同じ形式のデータで調整されたモデルが有利になり得ます。非公開の問題はそうした有利を避けやすい一方で、外から中身を確かめることが出来ません。どちらが優れているという話ではなく、点数を見るときに、その指標がどちらの作りかを頭に置いておくのが読み手の工夫です。
評価表を開いたときに確かめる4つのこと
評価表を開いたら、点数より先に、版と更新日、採点の方法、問題が公開されているか、評価したときの条件の4つを確かめてみてください。版と更新日は、比べたいモデルがそもそも載っているかに関わります。Nejumiの版4は2025年8月の公開なので、それより後に出たQwen3.6やGemma 4が載っているかは、表を開いて確かめる必要があります。
採点の方法は、自動採点か、AIの審査か、人の採点かの3つに分けて見ると整理しやすくなります。自動採点は同じ答えなら何度でも同じ点になる一方、正解の形に合わない書き方をすると、内容が正しくても点を落とすことがあります。AIの審査は自由な文章を見られる代わりに、採点役のAIの好みが入り得ます。人の採点は手間がかかるぶん、社内で使うときの感覚に近い点数になりやすいでしょう。
評価したときの条件も、自社で動かす条件とそろっているとは限りません。評価表の点数が、どの量子化の種類で、どのくらいの長さの文章で測られたかは、表によって書き方が違います。自社では4ビット台に量子化して、限られたメモリで動かすことが多いため、点数はあくまで評価表の条件で測った場合の目安と受け止めておきましょう。
指標が測らないものと、点数が高くても社内文書で外れる場面
公開指標が測っていないのは、社内の用語・書式・文書の長さといった、会社ごとに違う条件です。どの指標も、誰でも同じ条件で比べられるように、共通の問題と共通の採点基準を使います。共通であることが比べやすさの源ですが、そのぶん、自社だけの事情は点数に入ってきません。ここでは、各指標が測るものと測らないものを並べ、どこで読み違えが起きやすいかを見ていきましょう。
指標ごとに測るもの・測らないもの
前の節の内容を、測るものと測らないものの組で並べ直すと、次のようになります。
- Nejumi LLMリーダーボード4は、日本語の汎用の力(知識・推論・基礎言語能力など)と安全性を、自動採点とAIの審査で測ります。自社の書式や用語で使えるかは測りません。
- llm-jp-evalは、複数分野の日本語タスクで正解との一致を自動で測ります。同じ形式のデータで調整されたモデルは点数が上がりやすく、公開元も点数だけで優劣を決めないよう注意しています。
- Japanese MT-Benchは、何往復かのやり取りでの自由な文章の出来を、AIの採点で測ります。採点役のAIの好みが入る余地は残ります。
- JMMLUは、4択の知識問題の正答を測ります。文章を書く力や書式に合わせる力は対象外です。
- Swallow LLM Leaderboardは、日本固有の知識・翻訳・指示に従う力などを自動採点で測ります。社内の固有名詞や過去の経緯は問題に含まれません。
- ELYZA-tasks-100は、100問への自由な回答の出来を、人が5段階で採点します。公開された100問で、自社の業務の問題ではありません。
点数が高くても社内文書で外れる4つの場面
公開指標で評価の高いモデルが、社内の文書では期待どおりに動かない場面は、だいたい決まった形で現れます。1つ目は、社内でしか使わない略語や製品名が出てくる場面です。公開の問題には自社の略語が出てこないため、指標の点数がいくら高くても、略語の意味を取り違えた答えが返ってきてしまいます。
2つ目は、決まった書式で答えてほしい場面になります。稟議書の項目順や、社内の表の列名に合わせた出力は、指示への従い方を見る項目である程度は映りますが、自社の書式そのものは試されていません。3つ目は、長い規程や議事録を読ませる場面です。ローカルで動かすときは、長い文書を読ませるほど必要なメモリが増えるため、使う機械によっては読める長さを短く絞ることになり、指標を測ったときと条件が変わってしまいます。
4つ目は、同じことを別の言い方で聞いた場面でしょう。NejumiがJMMLU Robustnessで聞き方による正答率の変化を別に見ているように、言い回しが変わるだけで答えがぶれることは、評価する側も前提にしています。社員は同じ質問でも人によって違う言い方で聞くため、言い回しへの強さは、点数以上に使い心地を左右することになります。
公開指標と小テストは段階で使い分ける
公開指標と社内の小テストは、どちらか一方ではなく、役割を分けて使うと無駄がありません。公開指標は、数十本ある候補を2〜3本に絞る段階で使い、社内の小テストは、残った候補から1本を決める段階で使います。指標だけで1本に決めると社内の条件を見落とし、小テストだけで候補を探そうとすると、試す本数が多すぎて採点が追いつかなくなってしまいます。2段階に分ければ、人の手間をかけるのは最後の2〜3本だけになります。
情シス・総務が見るなら、この2つの数字から
公開指標を全部読み込む時間がない場合は、見る場所を2つに絞るのが現実的です。1つはNejumiのGLPのうち知識と基礎言語能力の項目、もう1つはSwallowの日本固有の知識(JamC-QA)と指示に従う力(M-IFEval-Ja)の項目になります。前者で日本語そのものの土台を、後者で日本の事情への詳しさと指示どおりに答える力を見る、という分担です。ただし、どちらも候補を絞る目安で、最後に決めるのは社内の文書で試した結果にしましょう。
稟議書に書くときの一文の例
候補の絞り込みには、Nejumi LLMリーダーボード4(2025年8月27日公開)のGLPのうち知識と基礎言語能力の項目と、Swallow LLM Leaderboard(2026年5月8日更新)のJamC-QAとM-IFEval-Jaの項目を参照しました。最終的な判断は、社内文書10問の小テストの結果によります。
指標の点数を稟議の根拠にするときは、上の例のように、どの指標のどの項目か、いつ確認したかを一緒に書き残すと、後から見直す人が助かります。点数そのものを書く場合も、評価表の版と確認した日付を添えておけば、半年後に読み返したときの誤解を防げるでしょう。
根拠を残すのと同じく、使うAIも会社でまとめる方法があります。UPGEAR AI(アップギアAI)は、ChatGPT・Claude・Gemini・Perplexityを1つの契約で使える法人向けサービスです(人数無制限)。
社内文書10問の小テストで日本語性能を確かめる
最後に候補を決める材料は、自社の文書から作った10問ほどの小テストで用意するのが近道になります。公開指標が測らない略語・書式・長さ・言い回しの4つを、問題の中に意図して入れておくのが作り方のこつです。10問という数は、候補が2〜3本あっても、人が全部の答えを読んで採点できる量を目安にしています。全体の進め方は、次の6段階になります。
- ライセンスとメモリの計算で、候補のモデルを2〜3本に絞る
- 社内の文書から問題10問を作り、見本の答えと必ず入れてほしい要点を用意する
- 量子化の種類、読ませる文章の長さ、実行ソフトとその版をそろえ、記録表に書く
- 全部のモデルに同じ問題を投げ、答えをモデル名を伏せて並べる
- 2〜3人で5段階に採点し、問6と問8は合計点とは別に確かめる
- 合計点・作り話の有無・答えが返るまでの時間・メモリの余裕で決め、記録表を保存する
問題の作り方:4つの外れ方を1問ずつ入れる
問題は、実際に社内で頼みたい仕事から選び、答えの見本も社内の人が先に書いておきます。そのうえで、前の節で見た外れ方が必ず1問ずつ入るように配分してみてください。構成の一例を、次のチェックリストにまとめました。
- 問1 社内規程の一部を300字以内で要約させる字数の指定を守れるかと、要約の正確さを見ます。見本の要約と並べて、抜けた要点を数えます。
- 問2 略語の多い議事録から決定事項だけを抜き出させる社内でしか使わない略語を、取り違えずに読めるかを見ます。略語の一覧は渡さずに試します。
- 問3 稟議書の書式に合わせて下書きさせる項目の順番と見出しの名前を、指定どおりに守れるかを見ます。
- 問4 取引先へのお詫びのメールを下書きさせる敬語の自然さと、言い訳がましくならない書き方ができるかを見ます。
- 問5 長い規程の中から、ある条文の内容を探して答えさせる読ませる長さは、後の節で計算する本番の設定と同じにします。
- 問6 問3と同じ依頼を、別の言い回しで頼む聞き方が変わっても、同じ水準の答えが返るかを見ます。
- 問7 表計算から貼り付けた数字を読み取り、前月との差を答えさせる数字の読み取りと簡単な計算の正しさを見ます。
- 問8 社内の文書に書かれていないことを聞く分からないと答えられるか、それらしい作り話をしてしまうかを見ます。
- 問9 日本の制度や慣習に関わる前提を問う日本固有の知識を見ます。答えの正しさは人が必ず裏取りします。
- 問10 英語のメールを日本語で要約させる翻訳と要約を同時にこなせるかを見ます。海外とのやり取りがない会社は、別の業務に差し替えます。
問題に使う文書は、実際の業務で使っているものから選ぶほど、結果が本番に近づきます。ただし個人情報や取引先の名前が入った文書は、試す前に伏せ字にしておくと安心です。社内で使う言葉の癖が出る文書を選ぶことで、指標では見えない差がはっきりしてきます。
見本の答えは、その文書を使う部署の方に書いてもらう
見本の答えは、その文書をふだん扱っている部署の方に書いてもらうのが確実です。情シスや総務だけで見本を作ると、現場で通じる言い回しや、上司が求める書き方とずれてしまうことがあります。見本には、正解の文章だけでなく、必ず入っていてほしい要点を3つほど添えておくと、採点のときに迷いにくくなります。問8のように正解がない問題では、分からないと答えることを見本として書いておきましょう。
問題づくりで避けたいこと
問題を作るときは、一般常識だけで答えられる問題を入れすぎないよう気を付けてください。公開指標でも測れる内容を繰り返すことになり、社内の文書で試す意味が薄れてしまいます。答えが時期によって変わる問題も、見直しのたびに見本を書き換える手間が増えるため、なるべく避けたほうが扱いやすいでしょう。長い文書を読ませる問5は、使う機械のメモリで読める長さに収まるかを、次の節の計算で先に確かめておいてください。
採点は2人以上で、5段階にそろえる
採点は、ELYZA-tasks-100が人手の5段階評価を3人で行っている形を参考に、2〜3人で同じ答えを採点するのがおすすめです。1人だけで採点すると、その人の好みが点数に入り込んでしまいます。5段階の目安は、5が見本どおりでそのまま使える、4が少しの手直しで使える、3が半分ほど書き直す、2が要点を外している、1が誤りや作り話を含む、くらいに決めておくと採点者の間でそろいやすくなります。モデル名を伏せて答えを並べ、どのモデルの答えか分からない状態で採点すると、思い込みを避けることが出来ます。
採点が終わったら、合計点だけでなく、問8で作り話をしなかったか、問6で答えがぶれなかったかを別に見てみましょう。合計点が少し低くても、作り話をしないモデルのほうが、社内では扱いやすい場面が多いはずです。問5の長い規程の問題は、次の節で計算するメモリの条件と同じ長さで試すと、本番に近い結果になります。
同じ条件で比べるための記録表
モデルを比べるときは、条件をそろえないと、差がモデルの差なのか条件の差なのか分からなくなってしまいます。記録表には、モデル名と版、量子化の種類(後の節で説明する4ビット・8ビットなど)、読ませる文章の長さ、使う実行ソフトとその版、試した機械のメモリ、試した日付を書き、全部のモデルで同じにしておきましょう。答えが返るまでの時間も、目安として残しておくと比べやすくなります。
問題と見本の答えは社外秘の文書から作ることになるため、試す機械はネットにつながない社内のPCにするか、社内で決めた扱いに沿って管理してください。投げ比べの具体的な操作はローカルLLMのおすすめモデルの記事で手順を紹介しています。
結果の読み方:合計点・作り話・速さ・メモリの余裕で決める
結果がそろったら、合計点、作り話の有無、答えが返るまでの時間、メモリの余裕の4つを並べて決めていきます。合計点の差が数点しかない場合は、採点のぶれの範囲と考え、ほかの3つで決めるほうが無難です。作り話をしたモデルは、合計点が高くても、社内の問い合わせ対応のように答えをそのまま渡す使い方には向きません。答えが返るまでの時間は社員が待てるかどうかで判断し、メモリの余裕は長い文書を読ませたときに足りるかで見ていきましょう。
決め方に迷う場合は、2つのモデルを残して、1か月ほど実際の業務で併用してみる方法もあります。社員に使ってもらい、どちらの答えを採用したかを数えると、小テストでは見えなかった差が分かってきます。小テストの結果と併用の結果をまとめて記録表に残しておけば、半年後の見直しでもそのまま比べる材料になります。
必要メモリは式で出す:量子化・KVキャッシュ・MoEの計算例
必要メモリの目安は、総パラメータ数×1パラメータあたりのビット数÷8で重みの大きさを出し、そこにKVキャッシュと余裕を足すと見積もることが出来ます。この式は、量子化とKVキャッシュについての公式の資料から組み立てた目安で、提供元が示している計算式ではありません。それでも、モデルの名前と量子化の種類さえ分かれば、手元の電卓で社内のPCに載るかどうかの見当が付くようになります。
重みの大きさ:総パラメータ×ビット数÷8
量子化とは、モデルの重みを低い精度で保存し、必要なメモリを減らす方法のことで、Hugging Faceの公式ドキュメントでも、fp16・bf16からint8・int4などへ精度を下げる方法として説明されています。ローカルLLMでよく使われるllama.cppでは、Q4_K_MやQ8_0のような名前で量子化の種類を表します。llama.cppの説明書きにある8Bモデルでの例では、1パラメータあたりのビット数がQ4_K_Mで約4.89、Q5_K_Mで約5.70、Q6_Kで約6.56、Q8_0で約8.50、量子化しないF16で約16.0となっています。
式に当てはめると、8BのモデルをQ4_K_Mにした場合は、8×4.89÷8で約4.9GBになります。説明書きの実測は4.58GiBで、GiBは1GBより約7%大きい単位のため、GBに直すと約4.9GBとなり、計算とほぼ一致します。ビット数が倍になれば重みも倍になるので、同じモデルでもQ8_0にすると約8.5GB、F16では約16GBまで膨らんでしまいます。量子化のビット数を下げるほど答えの質が落ちる場合もあるため、小テストは実際に使う量子化の種類で試してください。
計算例とOllamaの表示サイズの照合
計算が実物とどのくらい合うかを、Ollamaのライブラリに表示されているダウンロードサイズと並べて確かめました。Ollamaの表示は2026年10月3日に取得した値で、計算には名前の数字か、モデルカードに書かれた総パラメータを使っています。
| モデル(Ollamaでの名前) | 計算に使った総パラメータ | Q4_K_M相当(4.89ビット)の計算 | Q8_0相当(8.50ビット)の計算 | Ollamaの表示サイズ |
|---|---|---|---|---|
| qwen3.5 9b | 9B(名前の数字) | 約5.5GB | 約9.6GB | 6.6GB |
| gpt-oss 20b(MoE・活性3.6B) | 21B(モデルカード) | 約12.8GB | 約22.3GB | 14GB |
| gemma4 26b(MoE・活性3.8B) | 25.2B(モデルカード) | 約15.4GB | 約26.8GB | 約16〜19GB |
| qwen3.5 27b | 27B(名前の数字) | 約16.5GB | 約28.7GB | 17GB |
| qwen3.6 27b | 27B(モデルカード) | 約16.5GB | 約28.7GB | 約18〜19GB |
| gemma4 31b | 31B(公式ブログ) | 約19.0GB | 約32.9GB | 約19〜20GB |
| qwen3.5 35b | 35B(名前の数字) | 約21.4GB | 約37.2GB | 24GB |
| qwen3.6 35b | 35B(名前の数字) | 約21.4GB | 約37.2GB | 約23〜24GB |
| llama4 16x17b(Scout・MoE・活性17B) | 109B(モデルカード) | 約66.7GB | 約115.8GB | 67GB |
| qwen3.5 122b | 122B(名前の数字) | 約74.6GB | 約129.6GB | 81GB |
※計算は総パラメータ×ビット数÷8の目安で、GBは10億バイトとしています。ビット数はllama.cppの説明書きにある8Bモデルでの値を、ほかのモデルにも当てはめたものです。Ollamaの表示はダウンロードサイズで、実行するときは読ませる文章の長さに応じたメモリが別に要ります。パラメータ数はモデルカードなど提供元の表示によります。
Ollamaの表示は、多くのモデルでQ4_K_M相当の計算から少し大きい側にあり、Q8_0相当の計算よりはかなり小さい値に収まります。表示の量子化の内訳はライブラリの一覧からは読み取れないため、差の理由まではここでは断定しません。それでも、4ビット台で計算した値に数GBを足したあたりが、ダウンロードの大きさの見当になると分かります。gpt-oss 20bは、モデルカードでMXFP4という4ビット系の形式で量子化されていると書かれており、16GBのメモリで動くよう設計したと提供元が説明しています。
KVキャッシュは読ませる文章の長さで増える
KVキャッシュとは、それまでに読んだ文章の情報を保存しておき、次の文字を出すたびに計算し直さずに済ませる仕組みのことです。読ませる文章が長くなるほど大きくなり、Transformersの公式ドキュメントでも、メモリのかなりの部分を占め、長い文章を扱うときの足かせになり得ると説明されています。Hugging Faceの公式ブログが示すLlama 3.1 8B(FP16)の例では、KVキャッシュは1Kトークンで0.125GB、16Kトークンで1.95GB、128Kトークンでは15.62GBになります。同じ例で重みはFP16で16GBなので、128Kトークンまで読ませるとKVキャッシュだけで重みとほぼ同じ大きさが加わってしまいます。
Q4_K_Mの8Bモデルに当てはめると、重み約4.9GBに、16KトークンならKVキャッシュ約2GBを足して約6.9GB、128Kトークンなら約15.6GBを足して約20.5GBという見積もりになります。16GBのPCでも、読ませる長さを抑えれば収まる一方、長い規程を丸ごと読ませる使い方では足りなくなるわけです。KVキャッシュの大きさはモデルの構造で変わり、この数字はLlama 3.1 8Bでの例にとどまります。ほかのモデルでは、実行ソフトで実際の使用量を確かめてみてください。
この3つの数字を並べると、KVキャッシュは読ませる長さにほぼ比例して増えることが分かります。1Kトークンの0.125GBを16倍すると2.0GB、128倍すると16.0GBとなり、公式ブログの1.95GBと15.62GBに近い値になります。読ませる長さを半分にすればKVキャッシュもおおむね半分になるため、メモリが足りないときは、まず読ませる長さの設定を見直すと手軽に減らせます。
MoEは総パラメータでメモリを見積もる
MoE(Mixture of Experts)は、モデルの中に専門の部分を複数持ち、1文字を出すたびにその一部だけを使う作りのモデルです。計算に使う部分が少ないので速く動きやすい一方、Hugging Faceの公式ブログが説明しているとおり、全部の重みをメモリに載せておく必要があるため、メモリの見積もりは総パラメータで行います。同じブログでは、Mixtral 8x7Bの例として約47Bパラメータ分を載せると説明されています。
名前に「A3B」や「活性3.6B」と付くモデルで、活性の数字からメモリを見積もると大きく外れてしまいます。たとえばgpt-oss-20bは総21B・活性3.6Bで、活性の3.6Bから計算すると4ビットで約2.2GBですが、Ollamaの表示は14GBでした。Gemma 4の26B(総25.2B・活性3.8B)も表示は約16〜19GBで、総パラメータで計算した値に近くなります。速さは活性の数字、メモリは総パラメータで見る、と分けて覚えておきましょう。
社内のPCで足りるかを判定する手順
社内のPCで足りるかは、重み・KVキャッシュ・余裕の3つを足した数字を、PCのメモリと比べて判定します。余裕にはOSやほかのアプリが使う分を見込む必要があり、ここでは仮に重みの2割として計算しておきます。Gemma 4の26BをQ4_K_M相当で動かす例では、重み約15.4GBに余裕約3.1GBを足すと、KVキャッシュを足す前の時点で約18.5GBとなり、メモリ16GBのPCには収まりません。Qwen3.6の27Bなら、重み約16.5GBと余裕約3.3GBで約19.8GBとなり、24GBの機械ならKVキャッシュに数GBを回せる計算です。
Macの場合は、メモリがCPUとGPUで共有されるユニファイドメモリで、構成は購入時に選ぶ形になっています。公式の仕様ページを見る限り後から増やす前提にはなっていないため、試したいモデルの計算値に余裕を持った容量で選んでください。価格は2026年10月3日時点のApple日本の公式表記で、Mac mini(M6)は16GB構成の149,800円(税込)から、Mac mini(M5 Pro)は24GB構成の299,800円(税込)からとなっています。NVIDIAの比較表では、GeForce RTX 5090のGPUメモリ(VRAM)が32GB、RTX 5080とRTX 5070 Tiが16GBです。
同じ16GBでも、Macのユニファイドメモリと、NVIDIAのGPUのメモリでは意味が少し違ってきます。Macではその16GBをOSやほかのアプリと分け合うため、余裕を多めに見込む必要があります。NVIDIAのGPUで動かす場合は、GPUのメモリにモデルの重みとKVキャッシュを載せ、OSはPC本体のメモリを使う形になるので、おおむねGPUのメモリと計算値を比べることになります。
モデルがGPUとCPUのどちらに載っているかは、Ollamaならollama psのProcessor欄で、「100% GPU」や「48%/52% CPU/GPU」のような表示から確認出来ます。割合が分かれて表示されたら、GPUのメモリだけには収まっていないと考えて、量子化を下げるか読ませる長さを短くしてみましょう。機種ごとの選び方と費用はローカルLLMに必要なPCスペックの記事で扱っています。
社内によくあるメモリの容量に当てはめる
同じ式を、社内によくあるメモリの容量に当てはめると、候補の線引きが見えてきます。余裕は重みの2割、KVキャッシュは読ませる長さ次第として、重みと余裕だけで計算した目安を並べました。
- メモリ16GBのPCでは、qwen3.5 9bのQ4_K_M相当(重み約5.5GB、余裕込みで約6.6GB)なら、KVキャッシュに数GBを回す余地が残ります。gpt-oss-20bは提供元が16GBで動くよう設計したと説明していますが、Ollamaの表示が14GBのため、OSの分を考えると余裕はわずかです。
- メモリ24GBの構成では、27Bの2本(重み約16.5GB、余裕込みで約19.8GB)が候補に入り、KVキャッシュに回せるのは4GB前後です。
- メモリ36GBの構成では、35Bの2本(重み約21.4GB、余裕込みで約25.7GB)や、Gemma 4の31B(重み約19.0GB、余裕込みで約22.8GB)が載り、長めの文章を読ませる余地も出てきます。
- メモリ128GBの構成では、Llama 4 Scout(重み約66.7GB、余裕込みで約80GB。公式の対応言語に日本語は含まれません)やqwen3.5 122b(重み約74.6GB、余裕込みで約89.5GB)も、計算の上では収まります。
この線引きはあくまで計算上の目安で、実際に使うメモリは実行ソフトや読ませる長さで変わります。候補を絞ったら、小テストの問5を本番と同じ長さで動かし、ollama psなどで実際の載り方を確かめてみてください。128GBのメモリを持つ機械には、Mac Studio(M5 Max)の128GB構成やNVIDIAのDGX Spark、AMDのRyzen AI Max+ 395を積んだ機械があります。
ライセンスは条項ごとに並べて、自社の使い方に当てはめる
ライセンスは、モデル名で「自由」「制限あり」と分けるより、利用の規模・表示・派生モデルの名前・再配布・禁止用途という条項ごとに並べると、自社に関係する条件が見えてきます。Apache 2.0やMITは条件が少ない一方、Llama 4やPLaMo、旧Gemmaや以前のQwenには、それぞれ独自の決まりが付いています。下の表は、2026年10月6日に各ライセンスの原文や公式ページで確認した要点を並べたものです。
| 条項 | Apache 2.0 | MIT | Llama 4 Community License | 旧Gemma Terms of Use | PLaMo Community License | Qwen LICENSE AGREEMENT(Qwen2.5-72B-Instruct) |
|---|---|---|---|---|---|---|
| 利用の規模の条件 | 本文になし | なし | リリース日時点で月間アクティブユーザーが7億を超える場合はMetaに許諾を申請 | 確認した要点には含まれない | 商用目的は事前登録と、利用者か関連会社の年間売上10億円以下が条件 | 月間アクティブユーザーが1億を超える場合は許諾を申請 |
| 表示の義務 | 再配布時に元の著作権・帰属の表示とNOTICEの内容を残す | 著作権表示と許諾表示を複製に含める | 「Built with Llama」を目立つように表示 | Gemma Terms of Useの下で提供されている旨の文書を同梱 | 「Built with PLaMo」を関連サイトやUIなどに明示 | AIモデルを作る場合は「Built with Qwen」などを目立つように表示 |
| 派生モデルの名前 | 名前の定めはない(商標の使用は第6条で許諾外) | 定めなし | 名前を「Llama」で始める | 確認した要点には含まれない | 名前に「PLaMo」を含める。出力で学習したモデルも派生モデル | 確認した要点には含まれない |
| 再配布の条件 | ライセンスの写しを渡し、変更したファイルに変更を表示(第4条) | 著作権表示と許諾表示を含める | 契約書の写しと著作権表示を付ける | 利用制限を配布先との契約に入れ、写しを渡し、変更を表示 | 確認した要点には含まれない | 確認した要点には含まれない |
| 禁止用途のポリシー | 本文になし | なし | Acceptable Use Policyの順守 | 禁止用途ポリシーを契約に組み込む | 確認した要点には含まれない | 確認した要点には含まれない |
| 主なモデルの例 | Qwen3.5-35B-A3B・Qwen3.6・Gemma 4・gpt-oss・ELYZA-Thinking・Qwen3 Swallow(30B-A3B)など | sarashina2.2-3b-instruct-v0.1 | Llama 4 Scout | Gemma 1・2・3・3nなど | PLaMo 2 8B | Qwen2.5-72B-Instruct |
※ライセンスの名前は各モデルのHugging Faceのページに表示されたものです。要点は原文や公式ページを確認して言い換えたもので、条文の全部ではありません。「確認した要点には含まれない」は、その条項がないという意味ではありません。
表のライセンス名は、各モデルのページに表示されたものを使っています。同じ提供元でもモデルごとにライセンスが違うことがあるため、使う前に各リポジトリのLICENSEの本文を開き、必要に応じて法務の担当者や顧問の専門家にも確かめてもらってください。
社内で使うだけの場合
社内の業務に使うだけなら、Apache 2.0やMITのモデルで追加の手続きが要る場面は、ほとんどありません。再配布しない限り、著作権表示を残すといった条件にも触れにくいためです。Llama 4の月間アクティブユーザー7億という条件も、社員10〜200名の会社の社内利用で問題になることは考えにくいでしょう。ただし、Llama 4にもAcceptable Use Policy(利用ポリシー)の順守という条件は付いているので、禁止されている使い方に当たらないかは一度目を通しておきましょう。
PLaMoは組織内の利用も商用で、売上10億円の条件がある
社内利用だけでも条件が付く例として、Preferred Networks(PFN)のPLaMo Community Licenseがあります。PLaMo 2 8Bの公式モデルカードに載っている全文では、商用目的を個人・学術以外のすべての利用と定め、製品やサービスの開発・提供に加えて、利用者の組織内での利用も含むとしています。社内の業務に使うだけでも商用目的に当たり、PFNの公式ページでの事前登録と、利用者か関連会社の年間売上が10億円を超えないことの両方を満たす必要がある、という読み方になります。条件を満たさない場合は、PFNから別の商用ライセンスを得る必要があります。
社員10〜200名の会社でも、業種によっては年間売上が10億円を超えることは珍しくありません。売上は関連会社も含めて数える定めなので、グループ会社がある場合は特に注意が必要です。そのほか、「Built with PLaMo」の表示、作ったモデルの名前に「PLaMo」を含めること、出力を使って学習したモデルも派生モデルとして同じ条件に従うことも定められています。PFNの賠償の上限が500円(故意・重過失を除く)とされている点も、業務で使う前に知っておきたい条項でしょう。
社外に出すとき:再配布と表示の条件
モデルを組み込んだ製品やサービスを社外に出す場合は、再配布と表示の条項が関わってきます。Apache 2.0では、再配布するときにライセンスの写しを渡すこと、変更したファイルに変更した旨を目立つように示すこと、元の著作権や帰属の表示を残すこと、NOTICEファイルがあればその内容を含めることを、第4条が条件にしています。第6条では、ライセンサーの商標や製品名を使う許諾はしないと定めているため、提供元の名前を自社のサービス名に使うことは別の話として考える必要があります。第3条には特許の許諾があり、そのモデルなどが特許を侵害しているとして訴訟を起こすと、その特許の許諾が終わる定めも置かれています。MITの条件は、著作権表示と許諾表示を、すべての複製か重要な部分に含めることで、無保証という扱いになります。
Llama 4を使った製品では「Built with Llama」を目立つように示し、再配布するときは契約書の写しと著作権表示を付けることが必要です。旧Gemmaの利用規約では、再配布するときに利用制限を配布先との契約に入れること、契約書の写しを渡すこと、変更したファイルに変更を示すこと、Gemma Terms of Useの下で提供されている旨の文書を同梱することが定められています。社外に出す計画があるなら、条件が少ないモデルから候補を選ぶほうが、後の手間を減らせるでしょう。
派生モデルを作るとき:名前と表示の決まり
社内のデータで追加の学習をして派生モデルを作る場合は、名前の決まりに注意が要ります。Llama 4では、Llamaを使って作ったAIモデルの名前を「Llama」で始めることになっています。PLaMoでは作ったモデルの名前に「PLaMo」を含め、出力で学習したモデルも派生モデルとして扱われます。以前のQwenのライセンスでも、AIモデルを作る場合は「Built with Qwen」か「Improved using Qwen」を目立つように表示する決まりがあります。社内で使うだけのつもりで作った派生モデルでも、後から取引先に提供する話が出ることはあるため、作る時点で名前の決まりを確かめておくと安心です。
QwenとGemmaは世代でライセンスが違う
Qwenは、世代やサイズによってライセンスが違う例になります。Qwen2.5-72B-Instructは、Apache 2.0ではなくQwen LICENSE AGREEMENT(2024年9月19日付)という独自のライセンスで、月間アクティブユーザーが1億を超える場合は許諾の申請が必要とされています。一方で、Qwen3の公式READMEには、公開した重みのモデルはすべてApache 2.0という記載があります。Qwen3.5-35B-A3B、Qwen3.6の35B-A3Bと27B、2026年8月のQwen3.8-27Bのモデルカードも、Apache 2.0と表示されていました。Gemmaも同じで、旧Gemma Terms of Useのページには、対象がGemma 1・2・3・3nなどで、Gemma 4は別のライセンスと書かれています。名前だけで判断せず、使う世代とサイズのページで、毎回ライセンスの表示を確かめてみてください。
3つの場面で判断してみる
社内でありがちな場面に当てはめると、確かめる条項の違いがはっきりします。1つ目は、社内の規程を読ませて社員の質問に答える仕組みを、Apache 2.0のQwen3.6で作る場面です。社内で使うだけなので再配布の条件には当たらず、確かめるのは使うモデルのページのライセンス表示くらいになります。同じ仕組みをPLaMoで作るなら、組織内の利用でも商用目的に当たるため、事前登録と売上の条件を先に確かめる必要があります。
2つ目は、モデルを組み込んだチャットを取引先や顧客に提供する場面でしょう。Apache 2.0のモデルなら、ライセンスの写しや著作権表示の扱いを決め、提供元の名前や商標をサービス名に使わないよう気を付けます。Llama 4のモデルなら、「Built with Llama」の表示と、Acceptable Use Policyの順守を、サービスの利用規約や画面にどう反映するかまで決めておく必要があります。
3つ目は、社内の文書で追加の学習をして、自社向けの派生モデルを作る場面になります。Llama 4なら名前を「Llama」で始め、PLaMoなら名前に「PLaMo」を含めることになり、PLaMoでは出力を使って学習したモデルも同じ条件に従います。Apache 2.0のモデルでも、派生モデルを社外に配るときは、変更したファイルに変更の旨を示す条件がかかってきます。3つの場面のどれに当たるかを先に決めてから、表の行を読んでみてください。
自社の使い方に当てはめる5つの問い
表を読むときは、自社の使い方を次の問いに当てはめると、確かめる条項が絞れます。
- 社内の業務に使うだけかApache 2.0やMITなら追加の手続きはほぼ要りません。PLaMoは組織内の利用も商用目的に含むため、事前登録と売上の条件を確かめます。
- 年間売上は関連会社を含めて10億円を超えるかPLaMoを使う場合に関わります。超える場合はPFNの別の商用ライセンスが必要です。
- 製品やサービスとして社外に出すか再配布の条件(ライセンスの写し・変更の表示・著作権表示)と、Built with Llamaなどの表示義務を確かめます。
- 追加の学習で派生モデルを作るかLlamaやPLaMoの名前の決まり、出力で学習したモデルの扱いを確かめます。
- 禁止用途のポリシーに当たる使い方はないかLlama 4のAcceptable Use Policy、旧Gemmaの禁止用途ポリシーは、本文とは別のページにあります。
確かめた内容は記録に残す
ライセンスを確かめたら、モデル名、ライセンスの名前、確かめた日付、LICENSEの本文のURL、当てはめた場面、確かめた人の6つを記録に残しておきましょう。ライセンスは世代や時期で変わることがあり、旧Gemmaの利用規約のページにも、最終更新が2026年4月1日と表示されていました。記録があれば、半年後の見直しでは、前回の日付以降に変わった点だけを確かめれば済むようになります。小テストの記録表と同じファイルにまとめておけば、モデルを替えるときの判断材料が1か所にそろいます。
実行ソフトの比較と、モデルを見直す周期
モデルを動かす実行ソフトは、OllamaとLM Studioのどちらも、自社の機械で動かす分には無料で使うことが出来ます。違いは、ライセンスの形と、動かせる環境の条件にあります。モデルの比較とは別の話ですが、小テストの条件をそろえるうえで、どちらを使うかは最初に決めておきましょう。
実行ツールの比較:OllamaとLM Studio
Ollamaは本体がMIT Licenseで、公式の料金ページでは、自分の機械でモデルを動かす分は常に無制限と案内されています。有料のProは月20ドル、Maxは月100ドルで、これらはクラウドでの利用に向けたプランになります。対応するGPUは、NVIDIAならcompute capability 5.0以上、AMDはROCmに対応したRadeon RXやRadeon PRO、AppleはMetalによる高速化と公式ドキュメントに書かれています。Windowsで使う場合は、Windows 10 22H2以降と、NVIDIAならドライバ551.61以降が条件です。
LM Studioは、2025年7月8日の公式ブログで、家庭でも職場でも無料で使えると発表しました。それ以前は、業務で使うには別の商用ライセンスが必要でした。利用規約にも、個人と社内業務の目的での利用を許諾すると書かれています。動作の条件は、MacならApple Silicon(M1〜M4の記載)とmacOS 14.0以降が必須で、メモリは16GB以上が推奨です。Windowsはx64とARM(Snapdragon X Elite)に対応し、x64ではAVX2が必須で、メモリ16GB以上と専用VRAM 4GB以上が推奨になります。
どちらを使う場合も、小テストの記録表には実行ソフトの名前と版を書き残しておいてください。社内で複数の担当者が試すときに、使うソフトがばらばらだと、同じモデルでも結果を並べにくくなってしまいます。
社内に配る形も、最初に決めておきたい点になります。1台の機械で動かして複数の社員が使う形にするのか、各自のPCに実行ソフトを入れる形にするのかで、必要なメモリの見積もりも、記録の残し方も変わります。各自のPCに入れる形では、メモリの容量がPCごとに違うため、どの社員がどのモデルを使えるかがばらついてしまいます。小テストで選んだモデルを全員が同じ条件で使えるよう、配る形と機械の仕様をそろえてから展開してみてください。
モデルは数か月で世代交代する前提で見直す
ローカルLLMのモデルは、数か月の間隔で新しい世代が出ています。Qwenは2026年2月にQwen3.5、4月にQwen3.6、8月にQwen3.8-27Bがモデルカードの引用表記に現れ、Gemma 4は4月に公式ブログで発表されました。評価表の側も、Nejumiは2025年8月に版4が公開され、llm-jp-evalは2026年6月にv2.1.5が出ています。そのため、一度決めたモデルを何年も使い続ける前提より、半年に一度ほど見直す日を最初に決めておくほうが現実的でしょう。
見直しのときは、新しい候補に同じ10問の小テストを当て、今のモデルの記録と並べるだけで比べられます。問題と採点の基準を変えずに残しておけば、世代が替わっても比べ方は変わりません。ライセンスも世代で変わることがあるため、見直しのたびに表示を確かめ直してください。見直しの担当者と日付を記録表の先頭に書いておくと、担当が替わっても引き継ぎやすくなります。
自社で構築・運用する手間と、法人向けサービスを並べて判断する
ローカルLLMを選ぶかどうかは、モデルの比較だけでなく、自社で機械を用意して運用し続ける手間と、既製の法人向けサービスを使う場合を並べて決めるのが確実です。ここまでの3つの物差しで候補が決まっても、それを社員が毎日使える形にするまでには、別の仕事が残ってしまいます。
自社で運用するときに残る仕事
社内で使うローカルLLMを用意する場合、機械の購入と設定のほかに、モデルの見直し、小テストのやり直し、ライセンスの確認、実行ソフトの更新が定期的に発生します。社員に使ってもらうには、どのPCで誰が使えるか、入力した内容や答えの記録をどう残すかも決めることになります。社内文書を読ませて答えさせる仕組み(RAG)まで作るなら、その設計と保守も加わります。作り方はローカルLLMでRAGを作る手順で紹介しています。
これらの仕事を担える人が社内にいて、データを外に出せない事情がはっきりしている会社であれば、ローカルLLMは有力な選択肢になります。反対に、担当者が1人で兼務している会社では、モデルの見直しが後回しになり、古い世代を使い続けることになりがちです。
手間を数字にすると、見直しの重さが分かりやすくなります。候補3本に10問ずつ答えさせると答えは30件になり、3人で採点すれば採点の作業は90件に上ります。これを半年ごとに繰り返し、そのたびにライセンスと実行ソフトの版も確かめることになります。通常の業務と両立できるかを、担当者の時間で見積もってみてください。
クラウドAPI・法人向けサービスとのコストの比べ方
コストを比べるときは、機械の価格だけでなく、担当者が運用に使う時間も含めた総額で並べるのが基本になります。ローカル側は、たとえばMac Studio(M5 Max)が36GB構成で419,800円(税込)から、Mac Studio(M5 Ultra)が96GB構成で949,800円(税込)からと、2026年10月3日時点のApple日本の公式表記で示されています。表の計算で見たように、100B級のモデルを載せるには数十GBから100GBを超えるメモリが要るため、機械の選び方で初期費用の桁が変わってしまいます。一方、クラウドのAPIは使った分に応じて費用がかかる形が一般的で、法人向けのサービスは月額の契約が多く見られます。比べる期間を3年などに決め、機械の代金と運用の時間を月あたりに直してから、サービスの月額と並べてみてください。クラウドとの違いの全体はローカルLLMとクラウドAIの比較で整理しています。
ローカルLLMが向く会社・急がなくてよい会社
ローカルLLMが向いているのは、取引先との契約などで社外にデータを出せない文書が多く、運用を担う人を確保できる会社です。小テストを作る部署の協力が得られ、半年ごとの見直しを担当の仕事として決められるなら、自社で持つ意味は大きくなります。一方で、まず社員にAIを使ってもらうことが目的で、扱う文書の多くが社外のサービスに入れても差し支えない会社では、ローカルLLMの準備を急ぐ必要はないでしょう。その場合は、法人向けのサービスで使い方を広げ、社外に出せない文書だけをローカルLLMで扱う形から考えてみてください。両方を組み合わせる場合も、どの文書をどちらで扱うかを社内のルールに書いておけば、社員が迷う場面を減らせます。
会社で安全に使うには:学習させない設定・ログ管理・社員への配布・使い分け
会社で安全に使うには、どちらの形を選んでも、入力が学習に使われない状態、利用の記録、社員への配り方、複数のAIの使い分けの4つを決めておく必要があります。ローカルLLMは入力が社外に出ない点が強みですが、誰が何を入力したかの記録は、自分で仕組みを作らない限り残りません。法人向けのサービスを選ぶ場合は、入力を学習に使わない設定を会社側でまとめて適用できるか、利用ログを管理者が見られるかを確認してみてください。
ローカルLLMで記録を残す場合は、誰が、いつ、どのモデルに、何を入力し、どんな答えを受け取ったかを、どこに何か月保存するかまで決めておきましょう。記録そのものに社外秘の内容が残るため、記録を見られる人を絞る必要も出てきます。法人向けのサービスでも、管理者が見られる記録の範囲と保存の場所は、契約の前に確かめておくと安心です。
社員への配布では、一部の人だけに渡すと、渡されなかった人が個人のアカウントで使い始め、会社から見えないシャドーAI(野良AI)が生まれやすくなります。文書の要約は日本語に強いモデル、調べものは検索に強いモデルというように、用途ごとの使い分けを決めておくと、社員が迷う場面も減るでしょう。複数のAIを1つの環境で使う形はマルチAIの解説で扱っています。点検する項目は生成AIのセキュリティ対策チェックリストに、社内のルールの作り方は生成AIの社内ガイドラインの作り方にまとめました。
自社で運用しない選択肢として、4つのAIを1つの契約で
UPGEAR AIは、ChatGPT・Claude・Gemini・Perplexityを1つの契約・1つの画面で使える法人向けサービスです。管理者ダッシュボードで利用ログ・権限・モデルのON/OFFを管理でき、自社資料を読み込ませて回答させる社内文書RAGにも対応しています。基盤はAWSの日本リージョンで稼働しています。料金は月額30,000円(税抜)から。どのプランも利用人数は無制限で、料金は利用量に応じたプラン設計です(人数の目安はライト1〜5名、スタンダード6〜20名、プレミアム21〜50名)。初期費用100,000円(税抜)が別途かかります。
UPGEAR AIの詳細を見るよくある質問
ローカルLLMのモデルを比べるとき、最初に見る数字は何ですか?
日本語性能のリーダーボードで評価の高いモデルを選べば十分ですか?
必要なメモリはどう計算すればよいですか?
MoEのモデルは活性パラメータが小さいので、少ないメモリで動きますか?
Apache 2.0のモデルなら、会社で自由に使ってよいですか?
社内で使うだけなら、どのモデルでも登録や契約は不要ですか?
日本語特化のモデルと多言語のモデルは、どちらを選べばよいですか?
一度選んだモデルはどのくらいの期間使えますか?
まとめ
ローカルLLMのモデル比較は、日本語性能・必要メモリ・ライセンスの3つを、それぞれ決まった数字で見ると迷いにくくなります。日本語性能は、Nejumi・llm-jp-eval・Japanese MT-Bench・JMMLU・Swallow・ELYZA-tasks-100が何を測っているかを押さえて候補を絞り、最後は社内文書10問の小テストで決めましょう。必要メモリは、総パラメータ×ビット数÷8にKVキャッシュと余裕を足した目安で見積もり、MoEも総パラメータで計算するのが基本です。ライセンスは、社内利用・社外提供・派生モデルの場面ごとに条項を当てはめ、PLaMoのように組織内の利用も商用とするものや、Qwen・Gemmaのように世代で変わるものに気を付けてください。
モデルを選んだあとも、見直しや記録の仕組みを社内で持ち続ける必要があります。その手間と、既製の法人向けサービスを使う場合を並べて、自社に合う形を選んでみてください。法人のAI活用に関するほかの記事はAI活用コラム一覧から読むことが出来ます。
