MacでローカルLLMを動かす。アプリの選び方と設定、会社で使う注意点

MacでローカルLLMを動かすとは、AIのモデルを手元のMacに置き、外部のサーバーを通さずに文章の作成や要約をさせる使い方です。Apple シリコンのMacなら、動作要件を確かめてLM StudioかOllamaを入れ、メモリに収まる4ビット量子化のモデルを選ぶだけで動かすことが出来ます。会社で使うなら、外へ通信が出る場面と、社内のほかの端末に公開するかどうかを、入れる前に決めておきましょう。仕組みやクラウドのAIとの違いはローカルLLMとは何かをまとめた記事でご覧いただけます。

MacではLM StudioとOllamaのどちらを入れるか

画面の操作だけで始めたい方はLM Studio、ターミナルや社内のほかのツールからつなぐ使い方が中心ならOllamaが向いています。どちらもMac用のアプリがあり、手元で動かす分には料金がかかりません。違いが出るのは、操作の形と、扱えるモデルの形式、社内に公開するときの設定になります。

比べる点LM StudioOllama
操作の中心アプリの画面(検索・ダウンロード・会話まで画面で完結)ターミナルのollamaコマンドとメニューバーのアプリ
動くMacApple シリコン、macOS 14.0以降。Intel搭載のMacは非対応macOS Sonoma(v14)以降。Apple Mシリーズ(CPU・GPU)、x86のMacはCPUのみ
メモリ・空き容量16GB以上を推奨。8GBなら小さいモデルと短めのコンテキストでモデルの保存に数十〜数百GBの空きストレージが要る
モデルの形式GGUF(llama.cppで実行)とMLX通常の実行に加え、MLXでの実行を0.19のプレビューとして発表(2026年3月)
料金無料。職場での利用も無料と公式ブログで案内自分の機械で動かす分は無料。本体はMIT License
社内LANへの公開「Serve on Local Network」。認証は「Require Authentication」で有効化環境変数OLLAMA_HOSTで公開。公開手順に利用者を確かめる設定の説明はない

※動作要件・機能・設定名は、2026年10月6日時点の各社の公式ドキュメントの表記です。ソフトの更新で変わることがあります。

料金と業務での利用条件

LM Studioは2025年7月8日の公式ブログで、職場でも無料で使えると発表しました。ダウンロードページに表示されている最新版は、2026年10月6日時点で0.4.25でした。Ollamaも、自分のMacで動かす分は無料と料金ページに書かれ、本体はMIT Licenseで公開されています。ただし無料なのはアプリの話で、動かすモデルにはそれぞれ別のライセンスがあるため、後の節で確かめてみてください。

GGUFとMLXの違い

LM StudioはMacで、llama.cppで動かすGGUF形式と、Appleの機械学習研究チームが公開しているMLXの2種類のモデルを扱うことが出来ます。MLXはApple シリコン向けの仕組みで、CPUとGPUが同じメモリ上のデータを使う作りになっています。どの実行エンジンを入れているかは、LM Runtimesの管理画面で確かめられ、Macでは⌘+Shift+Rで開けます。Ollamaも2026年3月の公式ブログで、0.19からMLXでの実行をプレビューとして始めたと発表し、ユニファイドメモリが32GBを超えるMacを条件にしていました。発表の時点で対象のモデルは1つだったため、いまの段階では試してみる位置づけと考えておくのがよいでしょう。同社は以前の版より速くなったと発表していますが、同社のテストによる値のため、この記事では数字を挙げません。

この記事で前提にするMacとメモリ

LM Studioの動作要件は16GB以上を推奨としており、8GBのMacでも小さいモデルと控えめなコンテキストなら使えると書いています。gpt-oss-20bのように、16GBのメモリで動くよう設計したとOpenAIが説明しているモデルもあります。ここでは、16GB以上のApple シリコンのMacを前提に話を進めることにします。容量ごとにどの大きさのモデルが載るか、どの機種を選ぶかは、ローカルLLMに必要なPCとメモリの目安で詳しく比べています。

クラウドのAIと比べた強みと弱み

Macで動かす強みは、入力した文章がMacの外へ出ない点にあります。LM Studioはプライバシーポリシーで、手元で動かす限りメッセージや履歴、文書は外へ送られないと説明し、利用状況を集める仕組み(テレメトリ)も入れていないとしています。Ollamaの公式のFAQにも、手元で動かすときはプロンプトやデータを見ないという記載があります。どちらも提供元の説明なので、会社で使う前に、後で挙げる方法で確かめてみてください。

弱みは、動かせるモデルの大きさがMacのメモリで決まってしまう点になります。mlx-lmのREADMEも、搭載メモリに対して大きいモデルは遅くなることがあると書いています。Web検索のような機能は、LM StudioでもOllamaでもクラウド側の機能として別に用意されており、モデルだけで使う間は、手元にある知識の範囲で答えることになります。

LM Studioの入れ方とモデルの読み込み

LM Studioは、公式サイトからMac用のアプリを入れ、Discoverタブでモデルを探して読み込めば、すぐに会話を始めることが出来ます。初めての方は、次の順に進めてみてください。

  1. lmstudio.ai/download からMac版を入れる(2026年10月6日時点の表示は0.4.25)
  2. 起動したらDiscoverタブ(⌘+2)を開き、モデル名のキーワードか、Hugging FaceのURLを貼り付けて探す
  3. 同じモデルの量子化違い(Q3_K_S、Q_8など)から、Macのメモリに収まるものを選んでダウンロードする
  4. ダウンロードしたモデルを読み込み、チャットの画面で質問する

Discoverタブでモデルを探してダウンロードする

モデルの入手先はHugging Faceで、LM Studioに組み込まれたダウンローダーが取得まで受け持ちます。会社のMacで使うモデルは、検索結果から各自が選ぶより、使ってよいモデルの名前と量子化の版を先に決めて伝えるほうが、あとで確かめやすくなります。モデルを置くフォルダは、My Modelsの画面で変えることが出来ます。

量子化の読み方(Q4から始める)

量子化とは、モデルの数値を少ない桁数で持たせて、ファイルとメモリの量を減らす加工のことです。名前のQのあとの数字がビット数の目安を表し、Q4_K_Mのように4で始まるものは4ビット、Q_8は8ビットの版になります。LM Studioの案内は、Macの力が足りるなら4ビット以上を選ぶよう勧めています。迷ったときは4ビットの版から始め、答えの質に不満が出たときだけ、メモリに余裕があるかを見て大きい版に替えてみましょう。

メモリに収まらないときの対処

読み込めないときや極端に遅いときは、量子化を軽くするか、パラメータ数の小さいモデルに替えるのが近道となります。コンテキスト長(一度に読める文章の長さ)を長くするほど必要なメモリは増えるため、短くするだけで収まることもあります。8GBのMacについては、LM Studio自身が小さいモデルと控えめなコンテキストを勧めています。それでも足りない場合は、より大きなメモリのMacを検討する段階と考えてよいでしょう。

モデルごとの既定値(GPUオフロードとコンテキスト長)

My Modelsタブで各モデルの歯車アイコンを開くと、GPUオフロード・コンテキスト長・Flash Attentionの既定値を、モデルごとに保存出来ます。GPUオフロードは、モデルのうちどれだけをGPU側で計算させるかを決める設定です。社内で使う設定が決まったモデルは既定値として残しておくと、読み込むたびに調整し直す手間がなくなります。

手元の文書を読ませる

LM Studioでは、手元の文書を渡して質問する使い方(文書とのチャット、RAG)も出来ます。公式の説明では、会話・文書とのチャット・ローカルサーバーのどれも、ネットにつながずに使えるとされています。社内の規程や手順書を、Macの中だけで要約したり探したりしたい場面に向いた機能になります。

Ollamaの入れ方とコンテキスト長の設定

Ollamaは、公式サイトのollama.dmgを開いてアプリケーションフォルダへドラッグし、初回の起動で求められる許可を出せば、ターミナルからollamaコマンドを使えるようになります。この許可は、/usr/local/binにollamaコマンドへのリンクを作るためのものです。ダウンロードページには、ターミナルでインストール用のスクリプトを流す方法も載っています。

起動時の案内では、サインインしてクラウドのモデルを使うか、ローカルのモデルを選ぶかを聞かれます。会社のMacでは、ここでローカルのモデルを選ぶよう、あらかじめ社内で決めておきましょう。クラウドのモデルは名前の末尾が「:cloud」となり、Ollamaのサーバーで動くため、選ぶとMacの外で処理されることになります。

コンテキスト長の既定値と、ollama psでの確認

Ollamaは、GPUが使えるメモリの量に応じて、コンテキスト長の既定値を変えています。

GPUが使えるメモリ(公式の表記はVRAM)コンテキスト長の既定値
24GiB未満4k
24〜48GiB32k
48GiB以上256k

長くするほど必要なメモリが増えると公式の説明にもあり、変える場合はアプリの設定のスライダーか、環境変数OLLAMA_CONTEXT_LENGTHを使います。モデルを動かしたままollama psを打つと、PROCESSORの欄が「100% GPU」になっているかで、モデルがGPUに収まっているかを見ることが出来ます。公式の説明もCPUへのはみ出しを避けるよう勧めているため、100%になっていなければ、コンテキスト長を短くするか小さいモデルに替えてみてください。使い終わったモデルをメモリに置いておく時間は、OLLAMA_KEEP_ALIVEで変えられます。

外へ通信が出る場面と、その確かめ方

LM StudioもOllamaも、手元のモデルとの会話そのものは外へ送らないと説明していますが、モデルの検索やダウンロード、アプリの更新確認では通信が発生します。外に出ないというのは提供元の説明なので、会社で使う前に、次の場面を1つずつ確かめてみてください。

  • モデルの検索とダウンロードLM Studioはモデルの検索でhuggingface.coへ通信します。Discoverのカタログ表示、モデルと実行エンジン(ランタイム)のダウンロードも、ネットを使う場面です。
  • アプリの更新確認LM StudioのMac版は、起動時にアプリ内のアップデーターが更新を確かめます。Ollamaは更新を自動でダウンロードし、メニューバーの「Restart to update」で適用します。
  • Ollamaのクラウドのモデル名前の末尾が「:cloud」のモデルはOllamaのサーバーで動きます。使わないなら、社内で選ばない決まりにします。
  • LM Studioの有料のクラウド機能クラウドのモデルやWeb検索を使うと、データはその都度処理されます。同社は保存しないと説明していますが、使うかどうかは会社で決めます。
  • Ollamaのクラウド機能を切ったか~/.ollama/server.json の disable_ollama_cloud を true にするか、環境変数OLLAMA_NO_CLOUD=1を設定します。切るとクラウドのモデルとWeb検索が使えなくなります。
  • ログで確かめたかクラウド機能を切ると、Ollamaのログ(~/.ollama/logs)に「Ollama cloud disabled: true」と出ます。設定したMacごとに、この1行を見ておきます。
  • Wi-Fiを切っても動くかLM Studioは、会話・文書とのチャット・ローカルサーバーがネット不要と説明しています。ネットを切った状態で、使いたい機能が動くかを試します。

ネットから切り離して使いたい場合、LM Studioでは別の場所で入手したモデルを読み込む方法(sideload)も用意されています。社内で確かめたモデルのファイルだけを配り、各自のMacでは検索とダウンロードをしない運用にすることも出来ます。とはいえ、アプリの更新やモデルの入れ替えのたびに、どのMacで何を確かめたかを記録していく手間は、台数が増えるほど重くなってしまいます。

Macごとの通信の確認を、台数分くり返さないために

外への通信を1台ずつ確かめる代わりに、使う環境を会社で1つにまとめる方法もあります。UPGEAR AI(アップギアAI)は、ChatGPT・Claude・Gemini・Perplexityを1つの契約で使える法人向けサービスです(人数無制限)。

社内LANに公開するときの認証と、ほかのツールからのつなぎ方

1台のMacを社内の数人で使う場合は、APIサーバーを社内LANに公開することになりますが、既定のままでは使う人を確かめない点に気をつけてください。LM StudioもOllamaも、最初は自分のMacの中からだけ使える状態で動いています。

LM Studioは「Require Authentication」をオンにする

LM StudioはDeveloperタブの「Start server」でAPIサーバーを起動し、「Serve on Local Network」を有効にすると、同じネットワークのほかの機器からも使えるようになります。公式の説明は、127.0.0.1以外で待ち受けるとMacの外からも届くため、認証を有効にするよう勧めています。LM StudioのAPIは、既定では認証なしで要求を受け付けます。0.4.0以降では、Server Settingsの「Require Authentication」をオンにし、「Manage Tokens」で作ったトークンを持つ要求だけを通す設定にしましょう。トークンは作成時に一度しか表示されないため、受け取った方が保管する場所も先に決めておくと安心です。

Ollamaは公開する範囲をネットワーク側で絞る

Ollamaは既定で127.0.0.1のポート11434で待ち受け、そのMacの中からしか使えない状態になっています。Macで社内に公開するには、ターミナルでlaunchctl setenv OLLAMA_HOST 0.0.0.0:11434を実行し、アプリを再起動します。公式のFAQにある公開の手順には、使う人を確かめる設定の説明が見当たらないため、届く範囲は社内のネットワーク側で絞る前提で考えておきましょう。

ブラウザから使う(Open WebUI)

Open WebUIはブラウザで開くチャット画面で、自分ではモデルを持たず、OllamaなどにつないでLLMを呼び出します。Dockerで動かす場合はhttp://localhost:3000、Pythonで入れる場合はhttp://localhost:8080で開く形が案内されています。最初に作ったアカウントが管理者になり、その後の新規登録は自動で止まるため、ほかの方を入れるときは管理画面で「New Sign Ups」をオンにして、保留中のアカウントを承認することになります。Dockerで動かすなら、Mac側のOllamaを0.0.0.0で待ち受けさせる必要がある点にも注意が要ります。社員が50人を超えて使う場合は、ブランド表示についての条項があるため、ライセンスの本文を確かめてみてください。

社内のツールからAPIでつなぐ(OpenAI互換)

LM Studioは、OpenAIのAPIと同じ形のResponsesやChat Completionsなどの窓口を持ち、社内のツールから呼び出すことが出来ます。Ollamaも、OpenAIのAPIの一部に対応すると公式に記載しています。OpenAIのAPI向けに作った社内ツールなら、接続先をMacのアドレスに替えて試せる場合があります。Ollamaの場合、クライアント側にAPIキーの値は必要でも、Ollama自身はその値を使わないとしており、キーで利用者を分ける仕組みにはなりません。

GPUに回すメモリの上限(iogpu.wired_limit_mb)の扱い

大きめのモデルが遅いときに、macOSのGPU向けに固定できるメモリの上限を引き上げる方法がありますが、会社のMacでは自分の判断で変えないほうが安全です。この方法は、Appleの機械学習研究チームが公開するmlx-lmのREADMEに載っているもので、macOSの公式ドキュメントにある設定ではありません。

READMEによると、macOS 15以降のmlx-lmは、モデルとキャッシュのメモリを固定して速くしようとします。警告が出ても、モデルがメモリに収まるなら、sudo sysctl iogpu.wired_limit_mb=Nで上限を上げると速くなることが多いとしています。Nには、モデルの大きさ(MB)より大きく、搭載メモリより小さい値を入れる決まりです。sudoは管理者の権限で動かす命令のため、会社が貸与したMacでは情シスの判断を仰ぐ必要があります。変えた設定がいつまで続くかも含めて、試す前に情シスと一緒に確かめておきましょう。

会社で使うモデルの選び方とライセンス

モデルは、ダウンロードの大きさがMacのメモリに無理なく収まるかと、ライセンスが会社の使い方に合うかの2点で選びましょう。代表的なモデルを、Ollamaでのダウンロードの大きさとライセンスで並べると次のとおりです。

モデルライセンスダウンロードの大きさ(目安)メモ
gpt-oss-20b(OpenAI)Apache 2.014GB16GBのメモリで動くよう設計したとOpenAIが説明
Gemma 4 26b(Google)Apache 2.0約16〜19GB26BのMoE(一部の部品だけを使って答える作り)。31Bなどもある
Qwen3.5 9b/27b/35b(Alibaba)Apache 2.06.6GB/17GB/24GB大きさの違う版が揃っていて、メモリに合わせて選びやすい
Llama 4(Meta)Llama 4 Community License(独自)-独自のライセンスのため、本文の条件を確かめる
PLaMoPLaMo Community License-組織内の利用も商用目的で事前登録が要る。年商10億円超は別ライセンス

※ライセンスとダウンロードの大きさは、2026年10月3〜6日に確認した各提供元とOllamaの表記です。版の更新で変わることがあります。

メモリの見積もりは、ダウンロードの大きさだけでは足りません。コンテキスト長を長くするほど必要なメモリが増え、macOSやほかのアプリもメモリを使うため、ダウンロードの大きさに余裕を足した量がMacに収まるかを見ることになります。16GBのMacなら、24GBのqwen3.5 35bは入りきらず、6.6GBのqwen3.5 9bのような小さめのモデルが候補に入ってきます。

ライセンスの違い(Apache 2.0/Llama/PLaMo)

表の上の3つは、いずれもApache 2.0のライセンスになります。Llama 4は独自のLlama 4 Community Licenseで、PLaMoはPLaMo Community Licenseのもと、組織の中で使うことも商用の目的として事前の登録を求め、年商10億円を超える会社には別のライセンスを求めています。同じ無料のモデルでも、会社で使うときの条件はライセンスごとに違います。導入する前にモデルカードとライセンスの本文を読み、確かめた日付を社内の記録に残しておきましょう。

モデルとログの保存場所の一覧

会社のMacで使うなら、モデルのファイル、設定、ログがどこに残るかを一覧にしておくと、持ち出しや削除のルールを決めやすくなります。

アプリ置かれるもの場所変え方
Ollamaモデル~/.ollama/models環境変数OLLAMA_MODELS
Ollama設定(server.jsonなど)~/.ollama-
Ollamaログ(app.log・server.log)~/.ollama/logs-
LM StudioモデルMy Modelsで指定したフォルダMy Modelsの画面で変更
LM Studioチャットの履歴Macの中(外へ送られないと同社が説明)-

表の「~」はホームフォルダを表す記号で、Macのユーザーごとに作られます。Ollamaはモデルの保存に数十〜数百GBの空きが要るとしているため、内蔵ストレージの小さい構成では、入れるモデルの数を絞る運用も考えておきたいところです。退職や異動でMacを回収するときは、この一覧をもとに、モデルと履歴をどう扱うかを決めておきましょう。

導入前に情シスと決める項目のひな形

会社のMacにローカルLLMを入れる前に、次の表を埋めて、情シスと総務で合意しておきましょう。右の列は、そのまま社内の記入欄として使えます。

項目決めること記入欄
使うアプリLM Studio・Ollama・両方のどれか。版を上げる時期と担当 
インストールの権限社員が自分で入れてよいか。MDM(端末管理の仕組み)で配るか 
モデルの入手各自がHugging Faceから落とすか、確かめたファイルを配るか 
使ってよいモデルライセンスを確かめたモデル名・量子化の版・確認日 
外への通信Ollamaのクラウド機能を切るか。LM Studioのクラウド機能を使うか 
社内LANへの公開公開するMac、認証トークンを発行・回収する担当 
メモリの設定iogpu.wired_limit_mbを変えてよいか(sudoが要る) 
保存場所モデル・履歴・ログの置き場所。ディスクの暗号化(FileVault)を必須にするか 
入れてよい情報個人情報・顧客の情報・契約書などを入れてよいか 
回収と削除退職・異動のときに消すもの、消したことの確かめ方 

入れてよい情報の決まりは、クラウドのAIを使うときのルールとも重なる部分です。生成AIの社内ガイドラインの作り方と同じ文書にまとめておくと、社員にとっても読む場所が1つで済むようになります。

台数と機種で見たMac本体の費用

Macで全社員にローカルLLMを配る場合、費用の大半はMac本体になります。Macのメモリは購入時の構成で決まり、仕様ページにも後から増設できるとの記載はないため、最初の機種選びがそのまま使えるモデルの上限になってしまいます。

機種(最小構成)メモリ1台(税込)10台30台
Mac mini(M6)16GB149,800円1,498,000円4,494,000円
MacBook Air(M5・13インチ)16GB184,800円1,848,000円5,544,000円
Mac mini(M5 Pro)24GB299,800円2,998,000円8,994,000円
Mac Studio(M5 Max)36GB419,800円4,198,000円12,594,000円
Mac Studio(M5 Ultra)96GB949,800円--

※価格は2026年10月3日時点でApple 日本の公式サイトに表示されている税込の「から」の価格(最小構成)です。メモリを増やした構成の価格は含みません。LM StudioはM1〜M4を動作要件に挙げており、M5・M6での動作は公式の要件の記載で確かめてから選んでください。

ノートで持ち歩くMacBook Airを30人に配ると、本体だけで5,544,000円(税込)になります。全員に配る代わりに、Mac Studio(M5 Ultra・96GB)を1台置いて社内LANで共有する形なら、本体は949,800円(税込)からで済みます。1台で同時に何人が使えるかはモデルと使い方次第のため、試してから決めましょう。共有の形にすると、トークンの発行と回収、Macの更新と稼働の見守りを情シスが引き受けることになります。どちらの形でも、機種代のほかに設定と点検の手間がかかる点を、見積もりに入れておきましょう。

全社員に配るなら、既製の法人向けサービスとも比べる

ローカルLLMは入力を外に出さずに使える反面、Macごとの設定・更新・ログの管理を会社で担う形です。全社員に配る段階では、既製の法人向けサービスと、作業ごとに並べて比べてみてください。

作業Macで動かすローカルLLM既製の法人向けサービス(選ぶときの条件)
アプリの配布と更新1台ずつ入れて更新する(Ollamaは更新を自動で落とし、再起動で適用)提供元が更新する
使ってよいモデルの管理ライセンスの確認とファイルの配布を社内で行う管理画面で使うモデルを選べるか
外への通信の確認1台ずつ設定とログを点検するデータの保管場所と学習利用の条件を契約で確かめる
利用ログMacごとのログを集める仕組みを自前で用意する管理画面で誰が使ったかを見られるか
社員の追加と退職トークンの発行・回収、Macの回収と削除管理者がアカウントを止められるか
使えるモデルの大きさMacのメモリに収まるものまで提供元のクラウドで動く大きなモデル

社外に出せない資料だけをMacのローカルLLMで扱い、調べものや文書づくりはクラウドの法人向けサービスに任せる、という分け方も現実的な選択肢になります。どちらが合うかは、扱う情報の重さと、管理に割ける人手で決めてみてください。法人向けサービスの料金の横並びは、法人向け生成AIサービスの比較にまとめています。

Macごとの設定と管理を、1つの環境にまとめるなら

UPGEAR AIは、ChatGPT・Claude・Gemini・Perplexityを1画面で切り替えて使える法人向けサービスです。基盤は国内サーバー(AWSの日本リージョン)で稼働し、管理者ダッシュボードで利用ログ・権限・モデルのON/OFFを扱えます。自社資料を読み込ませて答えさせる社内文書RAGにも対応しています。料金は月額30,000円(税抜)から。どのプランも利用人数は無制限で、料金は利用量に応じたプラン設計です(人数の目安はライト1〜5名、スタンダード6〜20名、プレミアム21〜50名)。初期費用100,000円(税抜)が別途かかります。

UPGEAR AIの詳細を見る

よくある質問

Intel搭載のMacでもローカルLLMは動きますか?
LM StudioはIntel搭載のMacに対応していません。Ollamaはx86のMacでも動きますが、GPUは使わずCPUだけでの実行になります。いずれも2026年10月6日時点の公式の動作要件によるもので、会社でこれから揃えるなら、Apple シリコンのMacを前提に考えるのが無難です。
8GBのMacでもローカルLLMを使えますか?
LM Studioの動作要件は16GB以上を推奨していますが、8GBのMacでも、小さいモデルと控えめなコンテキストなら使える場合があると書いています。会社の業務で使うなら、16GB以上の構成を前提にするほうが、選べるモデルの幅が広がります。
LM Studioを会社の業務で使うのに料金はかかりますか?
LM Studioは2025年7月8日の公式ブログで、職場でも無料で使えると発表しています。ただし、動かすモデルにはそれぞれ別のライセンスがあるため、Apache 2.0のほか、Llama 4 Community LicenseやPLaMo Community Licenseのような独自の条件を、モデルごとに確かめる必要があります。
ネットを切った状態でもMacのローカルLLMは使えますか?
LM Studioの公式の説明では、会話・文書とのチャット・ローカルサーバーはネットにつながずに使えます。モデルの検索やダウンロード、アプリの更新確認にはネットが要るため、モデルを先に入れておくか、別の場所で入手したファイルを読み込む方法(sideload)を使います。
Ollamaのクラウド機能を切るにはどうすればよいですか?
~/.ollama/server.json の disable_ollama_cloud を true にするか、環境変数OLLAMA_NO_CLOUD=1を設定します。切るとクラウドのモデルとWeb検索が使えなくなり、Ollamaのログに「Ollama cloud disabled: true」と出るため、設定したMacごとに確かめてみてください。
iogpu.wired_limit_mbは変えたほうが速くなりますか?
mlx-lmのREADMEは、モデルがメモリに収まるのに警告が出る場合、上限を上げると速くなることが多いと案内しています。ただしmacOSの公式ドキュメントにある設定ではなく、sudo(管理者の権限)が要るため、会社が貸与したMacでは情シスの判断を仰いでから試してください。
1台のMacを社内の数人で共有できますか?
LM Studioの「Serve on Local Network」や、OllamaのOLLAMA_HOSTの設定で、同じネットワークのほかの機器から使えるようになります。LM StudioのAPIは既定で認証なしのため、「Require Authentication」をオンにしてトークンを配る形にしましょう。Ollamaの公開手順には利用者を確かめる設定の説明がないため、届く範囲を社内のネットワーク側で絞ってください。

まとめ

MacでローカルLLMを動かすなら、画面で使いたい方はLM Studio、コマンドや社内のツールからつなぐならOllamaを選び、メモリに収まる4ビットのモデルから始めるのが近道になります。LM StudioはGGUFとMLXの両方を扱え、Ollamaは2026年3月に0.19でMLXでの実行のプレビューを発表しています。設定は、LM Studioならモデルごとの既定値、Ollamaならコンテキスト長とollama psでの確認が要になります。

会社で使う場合は、モデルの検索・ダウンロード・更新確認・クラウド機能という外へ通信が出る場面を1台ずつ確かめ、社内LANに公開するなら認証の設定を先に決めましょう。iogpu.wired_limit_mbの変更はsudoが要るため、情シスの判断に任せるのが安全です。全社員に配る段階では、Mac本体の費用と1台ずつの管理の手間を、既製の法人向けサービスと並べて比べてみてください。

ローカルLLMの全体像はローカルLLMとは、機種とメモリの選び方はローカルLLMに必要なPC、ほかの記事はAI活用コラム一覧からお読みいただけます。