ローカルLLMとは?OllamaとLM Studioでの始め方、企業での使い分け

ローカルLLMとは、公開されているモデルの重みをダウンロードし、自社のPCやサーバーの中で動かす大規模言語モデル(LLM)の使い方です。入力した文章を社外のサービスに送らずに済むため、機密情報を扱う業務や、ネットワークが限られた環境で検討されています。一方で、精度、機器の性能、運用の手間には限りがあり、クラウドのAPIをすべて置き換えられるわけではありません。この記事では、ローカルLLMの仕組みと企業が検討する理由、Ollama・LM Studio・llama.cppの違い、メモリ・日本語・ライセンスで見るモデルの選び方、社内で試すときの進め方を説明します。
ローカルLLMとは:オープンウェイトモデルを自社の環境で動かす使い方
ChatGPTやクラウドのAPIを使う場合、入力した文章は提供元のサーバーに送られ、そこで処理されます。ローカルLLMでは、重みが公開されたモデル(オープンウェイトモデル)を手元に置き、処理も自社のPCやサーバーで行います。動かすには、OllamaやLM Studioのような実行用のツールと、モデルが収まるだけのメモリが必要です。
企業がローカルLLMを検討する理由
1つ目の理由はデータの扱いです。LM Studioの公式ドキュメントは、ダウンロード済みのモデルとの会話で入力した内容は端末の外に出ないと説明しています。Ollamaも、ローカルで動かす場合はプロンプトやデータを同社が見ることはないとしています。社外のサービスにデータを送れない規程がある場合や、閉じたネットワークで使いたい場合の選択肢になります。
2つ目は費用のかかり方です。クラウドのAPIは使った量に応じて課金されます。ローカルLLMでは機器の購入費、電気代、保守の人件費が中心になり、処理の件数が増えても1件ごとの利用料はかかりません。
3つ目はオフラインで使えることです。LM Studioは、モデルを入手した後であれば、会話、文書を添付した会話、ローカルサーバーの機能をインターネットに接続せずに使えるとしています。
ローカルLLMの限界
PCやサーバーに収まる大きさのモデルが、クラウドで提供される大規模なモデルと同じ精度になるとは限りません。知識の量や、複雑な指示をこなす力は、業務の内容によって差が出ることがあります。公式のモデルカードが示す評価結果の例は、gpt-ossとは?LM Studioでの動かし方、推論レベルの設定とAPIとの使い分けで紹介しています。
機器の制約もあります。大きなモデルほど多くのメモリが必要で、GPUのメモリに収まらない分をCPUで処理すると応答は遅くなります。さらに、モデルの更新、利用者の認証、アクセス記録、障害時の対応は自社で受け持つことになります。
ローカルLLMとクラウドAPIの使い分け
どちらを選ぶかは、扱うデータ、求める精度、利用量、ネットワークの条件、運用できる体制で決まります。条件ごとの目安を表にまとめました。
図の要点をテキストで読む
ローカルLLMとクラウドAPIのどちらが向くかを条件ごとに整理した表。扱うデータでは、社外に送れないデータならローカルLLM、契約と設定で社内規程を満たせるならクラウドAPIが向く。求める精度では、要約や分類など範囲が決まった作業ならローカルLLM、幅広い知識や複雑な判断が必要ならクラウドAPIが向く。利用量では、処理が多く常に動かすならローカルLLM、少量から始める場合や量が読めない場合はクラウドAPIが向く。ネットワークでは、閉じたネットワークやオフラインで使うならローカルLLM、インターネットに接続できるならクラウドAPIも使える。運用体制では、機器と更新を自社で管理できるならローカルLLM、運用を提供元に任せたいならクラウドAPIが向く。
データについては、まず社内の情報分類で「社外のサービスに送ってよいか」を確かめます。クラウドのAPIでも、学習に使わない設定や保存期間、保管地域を契約で調整できる場合があります。情報の区分ごとに使える方式を決めておく方法は、Q&A「AI向けのデータ分類(機密区分)は、既存の情報分類とどう揃えますか?」で整理しています。
費用は、利用量が少ないうちはクラウドのAPIの方が安く済むことがあります。ローカルLLMの費用が見合うかは、機器の購入費だけでなく、電気代、保守の工数、機器の買い替えまで含めて比べます。
精度については、幅広い知識が必要な調べものや、複雑な判断を伴う文章の作成ではクラウドの上位モデルを選びやすくなります。要約、分類、定型文の下書きのように作業の範囲が決まっている業務なら、小さめのモデルで足りるかを試す価値があります。
ローカルLLMを動かす主なツール:Ollama、LM Studio、llama.cpp
Ollama:コマンドとAPIで手軽に使う
OllamaはmacOS、Windows、Linuxで使えるツールで、MITライセンスで公開されています。インストール後、ターミナルで次のように実行すると、モデルをダウンロードしてチャットを始められます。
ollama pull gemma4:e2b
ollama run gemma4:e2b
Ollamaの公式ドキュメントによると、この例のGemma 4 E2Bはダウンロードが約7.2GBで、8GBのGPUメモリ(Macではユニファイドメモリ)が推奨されています。動かしたモデルはhttp://localhost:11434のAPIから呼び出せ、OpenAIのAPIと同じ形式の窓口(/v1/chat/completionsなど)も用意されています。既定では自分のPC(127.0.0.1)からの接続だけを受け付けます。ほかの端末から使えるようにするには、OLLAMA_HOSTという環境変数で設定を変えます。
企業で使う場合は、Ollamaにクラウドで動くモデルもある点に注意が必要です。クラウドのモデルを選ぶと、プロンプトと回答はOllamaのサーバーで処理されます。ローカルだけで使うと決めた場合は、OLLAMA_NO_CLOUD=1という環境変数などでクラウドの機能を止められます。インストールからAPIの呼び出しまでの手順は、Ollamaの使い方で詳しく解説しています。
LM Studio:画面で操作するデスクトップアプリ
LM Studioは、モデルの検索、ダウンロード、チャットを画面で操作できるデスクトップアプリです。macOS、Windows、Linuxに対応し、モデルの実行にはllama.cppを使います。Apple Silicon搭載のMacでは、AppleのMLXでも動かせます。コマンドに慣れていない担当者が試すときに向いています。
アプリの中でローカルサーバーを起動する機能もあり、OpenAIのAPIと同じ形式の窓口が用意されます。既存のプログラムの接続先をhttp://localhost:1234/v1のようなLM StudioのURLに書き換えれば、そのまま呼び出せます。利用規約では、個人の利用と社内の業務目的での利用が認められています。ダウンロードするモデルにはそれぞれのライセンスが適用されるため、モデル側の条件も別に確認します。モデルの選び方や利用条件を含む使い方は、LM Studioとは?使い方とモデルの選び方で解説しています。
llama.cpp:サーバーや組み込みに使う実行エンジン
llama.cppは、C/C++で書かれたLLMの実行エンジンで、MITライセンスで公開されています。NVIDIAのGPU、AppleのMetal、Vulkanなど多くの環境に対応し、GPUのメモリに収まらないモデルをCPUと分担して動かすこともできます。モデルはGGUFという形式のファイルで扱います。重みを1.5ビットから8ビットまでの整数に量子化(数値の精度を下げてデータを小さくすること)すれば、メモリの使用量を減らせます。
付属のllama-serverは、OpenAIのAPIと同じ形式の窓口を備え、複数の利用者からの要求を並行して処理できます。社内サーバーで複数人に提供する場合や、自社のアプリに組み込む場合の候補になります。
ツールの選び方
1人で試すなら、画面で操作できるLM Studioか、コマンドで手早く始められるOllamaが手軽です。試作のアプリから呼び出す場合も、どちらもOpenAI互換の窓口を使えます。社内の複数人で使うサーバーを組む段階では、llama.cppのように設定を細かく決められるエンジンも比べます。
ローカルLLMのモデルの選び方:必要なメモリ、日本語、ライセンス
必要なスペックはモデルの大きさと文脈の長さで決まる
ローカルLLMに必要なスペックは、主にモデルの大きさで決まります。Ollamaのモデル一覧には、モデルごとのファイルの大きさが表示されています。2026年10月6日時点では、gpt-oss:20bが14GB、gemma4:26bが16〜19GB、qwen3.8:27bが18GB、gpt-oss:120bが65GBでした。この大きさがGPUのメモリ(Macではユニファイドメモリ)に収まるかどうかが、最初の目安になります。
一度に読ませる文章の長さ(コンテキスト長)を伸ばすほど、ファイルの大きさとは別に必要なメモリが増えます。Ollamaは、GPUのメモリが24GiB未満の環境では、既定のコンテキスト長を4kトークンにしています。長い文書を読ませる用途では、設定を変えたうえでメモリが足りるかを確かめます。複数の要求を同時に処理する設定にした場合も、その数に応じて必要なメモリが増えます。
PCの目安として、LM StudioはWindowsで16GB以上のメモリと4GB以上のGPU専用メモリを推奨しています。MacではApple Silicon(M1以降)と16GB以上のメモリが推奨です。これはアプリを動かすための目安で、大きなモデルにはさらに多くのメモリが必要です。
日本語の性能を確かめる
モデルによって日本語の扱いには差があります。たとえばGoogle DeepMindのGemma 4は、140以上の言語で事前学習したとモデルカードに書かれています。国内では、国立情報学研究所の大規模言語モデル研究開発センターがLLM-jp-4.1を公開しています。tokyotech-llmが公開するGPT-OSS-Swallowは、gpt-ossに日本語の追加学習を行ったモデルです。どちらも日本語と英語を対象にしています。
ただし、モデルカードの評価結果は、自社の文書や言い回しでの精度を示すものではありません。社内の文書と質問を使って、候補のモデルを同じ条件で比べるのが確実です。モデルを比べるときに見る項目は、Q&A「LLM(大規模言語モデル)の選定で何を考慮すべきですか?」でも整理しています。
ライセンスを確認する
オープンウェイトモデルでも、ライセンスはモデルごとに違います。2026年10月6日に確認したモデルカードでは、gpt-oss、Gemma 4、Qwen3.8-27B、LLM-jp-4.1、GPT-OSS-Swallow、Metaが2026年8月に公開したMuse GlimmerはいずれもApache 2.0ライセンスでした。同じシリーズでも条件が違うことがあり、Qwen3.8のうちQwen3.8-Flash-Nextは独自のライセンスです。また、MetaのLlamaシリーズで最新のLlama 4も独自のライセンスです。モデルやそれを含むサービスを提供する場合は「Built with Llama」と表示すること、Llama 4の公開日の時点で月間の利用者数が7億人を超えていた場合はMetaから別にライセンスを受けることを定めています。社内で使うだけか、顧客向けのサービスに組み込むかで確認する条項が変わるため、法務部門と一緒に読みます。
社内でローカルLLMを試す手順
ローカルLLMは、1台のPCで試すところまでは短い期間で進められます。試した結果を判断に使えるよう、次の5つの手順で進めます。
図の要点をテキストで読む
社内でローカルLLMを試す5つの手順。1は試す業務とデータを決め、社外に出せないデータを扱い作業の範囲が決まった業務を1つ選ぶ。2は機器を確認し、PCのメモリとGPUに収まる大きさのモデルを候補にする。3はツールを入れ、LM StudioかOllamaで候補のモデルを試す。4は同じ質問でクラウドAPIのモデルと比べ、正しさと修正の手間を記録する。5は精度、費用、運用体制から、ローカルで続けるか、クラウドを使うか、両方を使い分けるかを決める。
- 対象業務を選ぶ:社外に出せないデータを扱い、作業の範囲が決まっている業務を1つ選びます。
- 機器を確認する:試すPCのメモリとGPUを確かめ、収まる大きさのモデルを候補にします。
- ツールを入れる:LM StudioかOllamaを入れ、大きさの違うモデルを2つほど試します。
- 同じ質問で比べる:同じ質問と文書でクラウドのAPIのモデルにも答えさせ、正しさと修正の手間を記録します。
- 運用の形を決める:精度、費用、運用の体制から、ローカルで続けるか、クラウドを使うか、両方を使い分けるかを決めます。
想定例:契約書の要点整理で試す場合
以下は説明のための架空の例です。法務部門で、取引先との契約書から契約期間や解約条件を抜き出す作業にAIを使いたいものの、契約書を社外のサービスに送れないという規程があったとします。
まず、メモリ32GBのPCにLM Studioを入れ、大きさの違うモデルを2つ読み込みます。過去の契約書20件で抜き出しを試し、担当者が「そのまま使える」「直せば使える」「使えない」の3段階で評価します。比較のため、取引先名などを伏せた同じ契約書をクラウドのAPIのモデルにも処理させます。ローカルのモデルで十分な結果が出れば、社内サーバーで複数人が使える形を検討します。精度の差が大きい場合は、クラウドの契約条件で規程を満たせるかを情報システム部門と確認します。
試した後に本番運用へ進めるには
1台のPCで動いても、社内の複数人で使い続けるには別の準備が必要です。利用者の認証とアクセス記録、同時に処理できる件数、モデルを更新するときの評価の手順、障害時の対応を決めます。費用を比べるときに含める項目は、Q&A「TCO(総所有コスト)をAI案件で算定するとき、何を含めればよいですか?」が参考になります。試した結果を本番運用に移すときの確認項目は、AIのPoCを本番運用に移すには?で解説しています。
inovieでは、ローカルLLMとクラウドAPIの比較や業務データでの評価から、既存システムへの組み込み、運用の設計までを支援しています。支援の範囲はAI導入・システム開発の支援をご覧ください。どちらの方式で進めるかを検討している段階でも、お問い合わせからご相談いただけます。
出典確認日:2026-10-06
この記事をシェアする



