本文へ移動

AI導入・開発

LM Studioとは?使い方とモデルの選び方、APIと商用利用の条件

LM Studioとは?使い方とモデルの選び方、APIと商用利用の条件

LM Studioは、公開されているLLM(大規模言語モデル)を自分のPCにダウンロードし、画面の操作で動かせるデスクトップアプリです。使い方は、アプリを入れてモデルを探し、読み込んでチャットするという流れが基本です。同じモデルを、OpenAIのAPIと同じ形式のローカルサーバーやCLI(lms)から呼び出すこともできます。この記事では、2026年10月7日に公式サイトで確認した情報をもとに、LM Studioの対応環境、インストールからチャットまでの手順、量子化を踏まえたモデルの選び方、APIとCLIの使い方、オフライン運用と会社で使うときの条件、Ollamaとの違いを説明します。

LM Studioとは:PCでLLMを動かすデスクトップアプリ

LM Studioは、Element Labs, Inc.が提供するアプリです。公式ドキュメントでは、次のことができると説明しています。

  • Hugging Faceにあるモデルを検索してダウンロードする
  • ダウンロードしたモデルとチャットし、文書を添付して質問する
  • OpenAIのAPIと同じ形式の窓口を持つローカルサーバーを起動する
  • MCPサーバーを登録し、モデルから外部の道具を使う
  • モデルを入手した後は、インターネットに接続せずに使う

モデルの実行には、Mac・Windows・Linuxのいずれでもllama.cppを使い、Apple Silicon搭載のMacではAppleのMLXでも動かせます。ローカルLLMという使い方そのものや、クラウドのAPIとの使い分けは、ローカルLLMとは?OllamaとLM Studioでの始め方、企業での使い分けで整理しています。

最新の版とLM Studio Bionicとの関係

2026年10月7日時点で、公式のダウンロードページに表示されていた最新版は0.4.25です。0.4.25では、M3以降のApple Silicon搭載MacとmacOS 26.4以降を対象に、Splashという実行エンジンへの対応が加わりました。サーバーの認証(APIトークン)や、画面を持たないサーバー向けの常駐版(llmster)は、0.4.0以降で使える機能です。

LM Studioの開発元は、2026年7月に「LM Studio Bionic」というAIエージェントのアプリも公開しています。公式ブログによると、BionicはLM Studioとは別のアプリです。クラウドで動くモデル(LM Studio Secure Cloud)を使う場合は、アカウントの登録と課金の設定が必要です。この記事では、モデルを手元のPCで動かすLM Studioのアプリを扱います。

対応環境とシステム要件

公式ドキュメントのシステム要件は次のとおりです。

  • Mac:Apple Silicon(M1〜M4)とmacOS 14.0以降が必要です。メモリは16GB以上を推奨し、8GBのMacでも小さなモデルなら動く場合があるとしています。Intel搭載のMacには対応していません。
  • Windows:x64とARM(Snapdragon X Elite)に対応します。x64ではAVX2命令に対応したCPUが必要です。メモリは16GB以上、GPUの専用メモリは4GB以上を推奨しています。
  • Linux:x64とARM64に対応し、AppImageの形式で配布されています。Ubuntu 20.04以降が必要で、Ubuntu 22より新しい版は十分に試されていないとしています。

これはアプリを動かすための条件で、実際に使えるモデルの大きさは、PCのメモリとGPUのメモリで決まります。目安は次の章で説明します。

LM Studioの使い方:インストールから最初のチャットまで

LM Studioの基本的な使い方は、次の5つの手順です。

LM Studioの基本的な使い方5つの手順
図の要点をテキストで読む

LM Studioの基本的な使い方を5つの手順で示した図。1はシステム要件を確かめて公式サイトからアプリをインストールする。2はDiscoverタブでモデルを検索する。3はPCのメモリに収まる量子化の候補を選んでダウンロードする。4はChatタブでモデルを読み込む。5はチャットで質問するか、ローカルサーバーを起動してAPIから呼び出す。モデルの検索とダウンロードにはインターネット接続が必要で、ダウンロード後はオフラインでも使える。

インストールと日本語表示

公式サイトのダウンロードページから、使っているOSのインストーラーを入手します。会社の業務で使う場合も、申し込みは要りません(条件は後の章で説明します)。

画面の表示は日本語にも切り替えられます。設定画面(Macはcmd + ,、WindowsとLinuxはctrl + ,)の「Preferences > Language」で選びます。公式ドキュメントによると、設定画面を開くにはPower User以上のモードにしておく必要があります。日本語の表示は、利用者が参加する翻訳で作られています。

モデルの探し方とダウンロード

モデルは「Discover」タブで探します。公式が選んだモデルから選ぶか、gemmaやqwenのような語、提供者/モデル名の形式、Hugging FaceのURLで検索します。公式のモデル一覧(lmstudio.ai/models)には、2026年10月7日時点でQwen3.8、Gemma 4、gpt-ossなどが載っていました。

同じモデルでも、ダウンロードの候補が複数表示されます。違いはファイルの形式と量子化です。

  • 形式:GGUFはllama.cppで動かす形式で、どのOSでも使えます。MLXはApple Silicon搭載のMac専用です。
  • 量子化:「Q3_K_S」「Q4_K_M」のような表記の「Q」は量子化(モデルの数値の精度を下げてファイルを小さくする処理)を表し、数字はおおよそのビット数です。数字が小さいほどファイルは小さくなりますが、回答の質は下がります。公式ドキュメントは、PCに余裕があれば4ビット以上を選ぶよう勧めています。たとえばGemma 4 E4BのGGUF版では、2026年10月7日時点でQ4_K_Mが5.34GB、Q6_Kが6.22GB、Q8_0が8.03GBでした。

必要なメモリは、モデルの大きさ(パラメータ数)とビット数でおおよそ見積もれます。たとえば200億パラメータのモデルを4ビットで保存すると、重みだけで約10GBです。実際にはこれに加えて、一度に読ませる文章の量(コンテキスト長)に応じたメモリが必要です。公式のモデルページでは、gpt-oss-20bのダウンロードが12GBで、少なくとも12GBのメモリが必要と案内しています。Gemma 4は、小さいE2BとE4Bが4GBから、31Bが約19GBからです。大きさの違う候補を2つほど試し、速さと回答の質を比べて決めると無駄がありません。

日本語の性能もモデルによって差があります。たとえばGemma 4のモデルページは、140以上の言語に対応するとしています。ただし、自社の文書や言い回しで十分な精度が出るかは、実際の質問で確かめる必要があります。モデルの比べ方とライセンスの見方は、ローカルLLMの記事で説明しています。

チャットでの使い方

ダウンロードが終わったら「Chat」タブを開き、モデルの読み込み画面(model loader)から使うモデルを選んで読み込みます。読み込むときは、モデルの重みを置くためにメモリが確保されます。必要に応じて、コンテキスト長やGPUに割り当てる量などを読み込みの設定で変えられます。

チャット画面には文書を添付できます。対応するファイルは.docx、.pdf、.txtです。短い文書は全文がそのまま会話に入り、モデルが一度に読める量を超える長い文書では、関係する部分だけを取り出して渡すRAG(検索拡張生成)の方式に切り替わります。RAGで答えさせるときは、探してほしい語や考え方を質問に具体的に書くと、関係する部分が見つかりやすくなると公式ドキュメントは説明しています。RAGの仕組みそのものは、RAGとはで解説しています。

LM Studio APIの使い方:ローカルサーバーとOpenAI互換API

LM Studioでは、読み込んだモデルを社内のアプリやスクリプトから呼び出せます。画面とAPIとCLIの3つの使い方を、場面ごとに整理しました。

LM Studioの3つの使い方
図の要点をテキストで読む

LM Studioの3つの使い方を整理した図。チャット画面では、モデルの比較や文書を添付した質問ができ、担当者が試すときに向く。ローカルサーバーでは、OpenAI互換の窓口(既定はポート1234)から社内のアプリやスクリプトがモデルを呼び出す。CLIのlmsでは、モデルのダウンロード、読み込み、サーバーの起動をコマンドで行え、画面のないLinuxサーバーでは常駐版のllmsterを使う。どの使い方でも、ネットワークに公開する前に認証と接続できる範囲を決める。

ローカルサーバーを起動する

ローカルサーバーは、「Developer」タブの「Start server」を有効にするか、ターミナルでlms server startを実行すると起動します。既定のポートは1234で、OpenAIのAPIと同じ形式の窓口として/v1/models、/v1/responses、/v1/chat/completions、/v1/embeddings、/v1/completionsの5つが用意されています。このほか、Anthropicと同じ形式のMessagesの窓口と、LM Studio独自のREST APIもあります。OpenAIの公式ライブラリを使っているプログラムなら、接続先のURLを書き換えるだけで呼び出せます。公式ドキュメントのPythonの例は次のとおりです。

from openai import OpenAI
client = OpenAI(base_url="http://localhost:1234/v1", api_key="lm-studio")

completion = client.chat.completions.create(
  model="model-identifier",
  messages=[
    {"role": "system", "content": "Always answer in rhymes."},
    {"role": "user", "content": "Introduce yourself."}
  ],
  temperature=0.7,
)
print(completion.choices[0].message)

modelには、LM Studioに表示されるモデルの識別子を指定します。

サーバーの設定で確かめること

サーバーの設定には、社内で使う前に確かめておきたい項目があります。

  • Require Authentication:有効にすると、APIを呼び出すときにAuthorizationヘッダーでAPIトークンが必要になります。初期状態では認証を求めません。
  • Serve on Local Network:有効にすると、同じネットワークにあるほかの端末からも接続できます。複数人で試す場合は、認証とあわせて設定します。
  • Just in Time Model Loading:要求が来たときにモデルを読み込み、メモリを節約します。使われなくなったモデルを自動で外す設定もあります。
  • Max Concurrent Predictions:同じモデルへの要求をまとめて並行に処理する数です。初期値は4で、llama.cppのエンジンで使えます。

APIの窓口をネットワークに公開するときは、だれが接続できるかを先に決めます。AIに社内のデータを渡すときの区分の考え方は、Q&A「AI向けのデータ分類(機密区分)は、既存の情報分類とどう揃えますか?」で整理しています。

CLI(lms)の使い方

lmsは、LM Studioに同梱されているコマンドラインのツールで、MITライセンスで公開されています。使う前に、LM Studioを一度起動しておく必要があります。主なコマンドは次のとおりです。

lms get openai/gpt-oss-20b        # モデルを検索してダウンロード
lms ls                            # ダウンロード済みのモデルを一覧
lms load openai/gpt-oss-20b --identifier="my-model"   # モデルを読み込む
lms ps                            # 読み込み中のモデルを表示
lms chat                          # ターミナルでチャット
lms server start                  # ローカルサーバーを起動
lms unload --all                  # すべてのモデルを外す

量子化を選んでダウンロードするときは、lms get google/gemma-4-e4b@q4_k_mのように、モデル名の後ろに@を付けて指定します。--mlxや--ggufで形式を絞り込むこともできます。

画面を持たないLinuxのサーバーでは、llmsterという常駐版を使います。公式ドキュメントでは、curl -fsSL https://lmstudio.ai/install.sh | bashで入れ、lms daemon upで起動する手順が示されています。

LM Studioのオフライン運用と、会社で使うときの条件

インターネットなしで使える範囲

公式ドキュメントによると、モデルを入手した後は、ダウンロード済みのモデルとのチャット、文書を添付したチャット(RAG)、ローカルサーバーをインターネットに接続せずに使えます。一方で、Discoverタブでのモデル検索とダウンロード、実行エンジン(ランタイム)のダウンロード、アプリの更新の確認には接続が必要です。閉じたネットワークで使う場合は、接続できる端末でアプリ、ランタイム、モデルを用意してから持ち込むことになります。

データの扱いについて、デスクトップアプリのプライバシーポリシーは、ローカルでモデルを動かしているときは、メッセージ、チャットの履歴、文書がPCの外に送られることはないとしています。利用状況の計測(テレメトリー)も行わないと書かれています。ただし、更新の確認ではアプリの版、OS、IPアドレスが送られ、モデルの検索語は匿名化して送られます。

社内・商用利用の条件

LM Studioのアプリは、2025年7月8日から、会社の業務で使う場合も申し込みや商用ライセンスが不要になりました。2026年10月7日に確認した利用規約(2026年8月23日版)でも、個人の利用と社内の業務目的での利用が認められています。

一方で、利用規約は次のような使い方を禁じています。

  • LM Studioのソフトウェアを再配布、販売、貸与すること
  • 他社向けのサービス(受託処理、ASP、SaaS)の提供にLM Studioのソフトウェアを使うこと
  • 公開されたインターフェース以外の方法で、ほかのソフトウェアと組み込むこと

顧客向けのサービスにLLMを組み込む場合は、LM Studio以外の実行エンジンを選ぶことも含めて、法務部門と条文を確かめます。また、ダウンロードするモデルにはモデルごとのライセンスが適用されます。たとえばgpt-ossとGemma 4はApache 2.0です。モデル側の条件も別に確認します。

MCPサーバーを登録するときにも注意が必要です。公式ドキュメントは、MCPサーバーの中にはコードの実行、PC内のファイルの読み書き、ネットワークへの接続ができるものがあるとして、信頼できない提供元のMCPサーバーを入れないよう警告しています。MCPの仕組みと社内で使うときの確認点は、MCPサーバーとはで説明しています。

LM StudioとOllamaの違い

LM Studioとよく比べられるのがOllamaです。Ollamaの導入と使い方はOllamaの使い方:インストールからモデル選び、APIの呼び出しまでで解説しています。どちらも手元のPCでモデルを動かし、OpenAIのAPIと同じ形式の窓口を用意できます。違いは、操作の中心、ライセンス、モデルの入手先にあります。

LM StudioとOllamaの違い
図の要点をテキストで読む

LM StudioとOllamaを4つの点で比べた表。操作の中心は、LM Studioが画面での操作で、CLIのlmsも使える。Ollamaはコマンドとアプリで使え、操作の中心はコマンドとAPI。ライセンスは、LM Studioのアプリが独自の利用規約で、個人と社内の業務目的での利用が認められている(CLIのlmsはMITライセンス)。OllamaはMITライセンスのオープンソース。APIは、LM Studioが既定でポート1234のOpenAI互換とAnthropic互換の窓口、Ollamaが既定でポート11434のOpenAI互換とAnthropic互換の窓口を持つ。主なモデルの入手先は、LM StudioがHugging FaceのGGUFとMLX、Ollamaが公式のモデルライブラリ。

Ollamaの本体はMITライセンスのオープンソースで、操作の中心はコマンドとAPIです(既定のポートは11434)。LM Studioのアプリは独自の利用規約で提供され、画面でモデルを比べながら試せるのが特徴です。CLIのlmsはMITライセンスです。1人で試すなら、画面で操作したい担当者にはLM Studio、コマンドやスクリプトで動かしたい開発者にはOllamaが手軽です。社内の複数人で使うサーバーや、顧客向けのサービスに組み込む段階では、ライセンス、認証、同時に処理できる数をあわせて比べます。

社内でLM Studioを試すときの進め方

LM Studioは1台のPCで試せるため、業務で使えるかを早く確かめられます。結果を判断に使うには、対象の業務、比べる相手、評価の基準を先に決めておきます。

想定例:社内文書の要約をLM Studioで試す場合

以下は説明のための架空の例です。情報システム部門が、社外のサービスに送れない社内規程の文書を要約させたいと考えたとします。

まず、メモリ32GBのPCにLM Studioを入れ、大きさの違うモデルを2つダウンロードします。規程の文書を添付して同じ質問を投げ、担当者が「そのまま使える」「直せば使える」「使えない」の3段階で評価します。結果がよければ、ローカルサーバーを起動し、社内のアプリの試作からhttp://localhost:1234/v1を呼び出して、使い勝手を確かめます。複数人で使う段階に進むときは、認証の設定、同時に使う人数、モデルを更新するときの評価の手順を決めます。

試した結果を本番運用に移すときの確認項目は、AIのPoCを本番運用に移すには?で解説しています。inovieでは、ローカルで動かすモデルとクラウドのAPIの比較、業務データでの評価、社内システムへの組み込み、運用の設計までを支援しています。支援の範囲はAI導入・システム開発の支援をご覧ください。LM Studioで試した後の進め方に迷っている段階でも、お問い合わせからご相談いただけます。

出典確認日:2026-10-07

この記事をシェアする

← ブログ一覧に戻る記事の先頭へ ↑