Ollamaの使い方:インストールからモデル選び、APIの呼び出しまで

Ollamaは、重みが公開された言語モデルを自分のPCやサーバーで動かすためのツールです。Ollamaの使い方は、アプリを入れ、ollama run でモデルを指定するところから始まります。モデルのダウンロードからチャット、APIでの呼び出しまでを同じツールで扱えます。この記事では、Windows・macOS・Linuxへのインストール手順、基本のコマンド、日本語で使うモデルの選び方とメモリの目安、APIとOpenAI互換の窓口の使い方、社内で使うときに決めておくことを、2026年10月7日に確認した公式情報をもとに説明します。ローカルLLMの全体像や、LM Studioなどほかのツールとの比較は、ローカルLLMとは?OllamaとLM Studioでの始め方、企業での使い分けで扱っています。
Ollamaとは:公開モデルを手元で動かすツール
Ollamaは、モデルの取得、実行、管理をコマンドとAPIで行うツールです。本体はGitHubの ollama/ollama で、MITライセンスで公開されています。2026年10月7日時点の最新の正式版は、9月29日に公開されたv0.35.1です。次の版の候補(v0.40.0-rc5)もプレリリースとして配布されていますが、業務で試す場合は正式版を選ぶほうが無難です。
できることは主に次の4つです。
- モデルを動かす:公式のモデル一覧(ollama.com/library)から名前を指定して取得し、ターミナルでチャットできます。
- APIで呼び出す:起動中は
http://localhost:11434でAPIを受け付けます。OpenAIやAnthropicのAPIと同じ形式の窓口もあります。 - モデルを調整する:Modelfileという設定ファイルに、元のモデルと指示文(システムプロンプト)やパラメーターを書き、自分用のモデルとして登録できます。
- ほかのツールとつなぐ:
ollama launchで、Claude Code、Codex、OpenCodeなどのコーディング支援ツールを、Ollamaのモデルを使う設定で起動できます。
注意したいのは、Ollamaにはクラウドで動くモデルもある点です。ログインすると、gpt-oss:120b-cloud や gemma4:cloud のように名前に cloud が付いたモデルを、手元のモデルと同じ操作で使えます。この場合、プロンプトと回答はOllamaのサーバーで処理されます。公式のFAQは、ローカルで動かす場合はプロンプトやデータを同社が見ることはなく、クラウドのモデルでも内容を保存・記録せず、学習にも使わないと説明しています。手元だけで使うと決めた場合の設定は、後半の「社内でOllamaを使うときの注意」で説明します。
Ollamaのインストール手順(Windows、macOS、Linux)
インストーラーは公式サイトのダウンロードページ(ollama.com/download)から入手します。OSごとの要件と手順は次のとおりです。
Windows
対応するのはWindows 10 22H2以降(HomeとPro)です。NVIDIAのGPUを使う場合は、ドライバー551.61以降が必要です。AMDのRadeonは、ROCm v7に対応したドライバーか、Vulkanに対応したドライバーで動きます。
OllamaSetup.exe を実行すると、管理者権限なしで、ユーザーのホームフォルダにインストールされます。本体には4GB以上の空きが必要で、モデルの保存には別に数十GBから数百GBの空きが要ります。インストール後はバックグラウンドで動き、PowerShellやコマンドプロンプトで ollama コマンドを使えます。モデルを別のドライブに置きたい場合は、ユーザーの環境変数 OLLAMA_MODELS に保存先を設定し、Ollamaを再起動します。
macOS
対応するのはmacOS 14 Sonoma以降です。Apple Mシリーズ搭載のMacではCPUとGPUの両方を使い、Intel搭載のMacではCPUだけで動きます。ollama.dmg を開き、アプリをアプリケーションフォルダにドラッグして入れます。初回の起動時に ollama コマンドが見つからない場合は、/usr/local/bin にリンクを作る許可を求められます。
Linux
次のコマンドでインストールします。同じコマンドを実行し直すと、最新版に更新されます。
curl -fsSL https://ollama.com/install.sh | sh
手動で入れた場合は ollama serve でサーバーを起動し、別のターミナルで ollama -v を実行して版を確かめます。サーバーで常に動かす場合、公式ドキュメントはsystemdのサービスとして登録する方法を推奨しています。サービスとして動かしたときのログは journalctl -e -u ollama で確認できます。
Ollamaの使い方:モデルの取得と実行の基本コマンド
インストールできたら、まずモデルを1つ動かします。公式のクイックスタートは、Gemma 4の小さいモデル(E2B)を例にしています。ダウンロードは約7.2GBで、8GBのGPUメモリ(Macではユニファイドメモリ)が推奨されています。
ollama run gemma4:e2b
ollama run は、モデルが手元になければダウンロードしてから対話を始めます。>>> の後に質問を入力すると回答が返り、/bye と入力すると終了します。複数行の文章を入力するときは、""" で前後を囲みます。対話を始めずに、1回だけ答えを得ることもできます。
ollama run gemma4:e2b "次の文章を3行で要約してください:..."
モデル名のコロンの後ろ(e2b や 20b)はタグと呼ばれ、大きさや量子化(数値の精度を下げてファイルを小さくする方式)の違いを表します。タグを省くと、そのモデルの latest が使われます。2026年10月7日時点で、gemma4 の latest はE4Bを指していました。
よく使うコマンドを、目的ごとにまとめました。
図の要点をテキストで読む
Ollamaの主なコマンドを目的別にまとめた表。モデルを取得するにはollama pullを使い、ダウンロードだけを済ませる。モデルを動かすにはollama runを使い、手元になければ取得してから対話を始める。状態を確かめるには、手元のモデル一覧を出すollama list(ollama ls)、読み込み中のモデルとGPUとCPUの分担を出すollama ps、ライセンスや設定を出すollama showを使う。止める・消すには、メモリから外すollama stopと、ディスクから削除するollama rmを使う。用途に合わせて作るには、Modelfileから自分用のモデルを登録するollama createを使う。
ダウンロードだけを先に済ませたいときは ollama pull、手元にあるモデルを確かめるときは ollama list(短く ollama ls とも書けます)を使います。ollama ps は、いまメモリに読み込まれているモデルと、GPUとCPUのどちらで動いているかを表示します。公式ドキュメントによると、PROCESSOR の列が「100% GPU」ならモデル全体がGPUのメモリに載っていて、「48%/52% CPU/GPU」のように分かれている場合はCPUとGPUで分担しています。CPUの割合が大きいと応答は遅くなります。
読み込んだモデルは、既定では使い終わってから5分間メモリに残ります。すぐに空けたいときは ollama stop、ディスクから消すときは ollama rm を使います。ollama show --license モデル名 でモデルのライセンス文を、ollama run に --verbose を付けると応答にかかった時間を確認できます。
Modelfileで用途に合わせたモデルを作る
同じ指示文を毎回入力するのが手間なら、Modelfileにまとめておけます。次は、要約用の指示文を設定する例です。
FROM gemma4:e4b
SYSTEM """あなたは社内文書の要約担当です。要点を3行以内の日本語でまとめてください。"""
このファイルを Modelfile という名前で保存し、ollama create 要約用の名前 -f Modelfile を実行すると、指定した名前のモデルとして ollama run で呼び出せます。
日本語で使うモデルの選び方とメモリの目安
まずファイルの大きさとメモリを比べる
Ollamaのモデル一覧には、タグごとにファイルの大きさが表示されています。このファイルがGPUのメモリ(Macではユニファイドメモリ)に収まるかが、最初の目安です。2026年10月7日に一覧で確認した主なモデルを、大きさで分けて整理しました。
図の要点をテキストで読む
2026年10月7日にOllamaのモデル一覧で確認した、主なモデルとタグごとのファイルの大きさ。5GB未満では、qwen3.5:4bが3.3GB、gemma4:e2bが4.6GBから。5〜10GBでは、gemma4:e4bが6.6GBから、qwen3.5:9bが6.6GBから、gemma4:12bが7.7GBから。10〜20GBでは、gpt-oss:20bが14GB、gemma4:26bが16GBから、qwen3.8:27bが18GB、muse-glimmer:30bが18GB。60GB以上では、gpt-oss:120bが65GB。同じタグでも形式によって大きさに幅があり、コンテキスト長を伸ばすとファイルの大きさとは別にメモリが必要になる。
ファイルの大きさとは別に、一度に読ませる文章の長さ(コンテキスト長)に応じてメモリが必要です。Ollamaの公式ドキュメントによると、既定のコンテキスト長はGPUのメモリが24GiB未満なら4kトークン、24〜48GiBなら32kトークン、48GiB以上なら256kトークンです。長い文書を読ませる用途や、エージェントやコーディング支援ツールから使う場合は、64,000トークン以上にするよう案内されています。長くするほど必要なメモリは増えるため、設定を変えたら ollama ps で CONTEXT の値とCPU・GPUの分担を確かめます。同時に処理する要求の数(OLLAMA_NUM_PARALLEL)を増やした場合も、その数に応じてメモリが増えます。
日本語の扱いはモデルカードと自社の文書で確かめる
日本語での使いやすさは、モデルカードの記載をまず確認します。Gemma 4のモデルカードには、140以上の言語で事前学習し、35以上の言語にそのまま対応していると書かれています。Qwen3.5は201の言語と方言に対応するとしており、Qwen3.8はQwen3.5の設計をもとに開発されたモデルです。Metaが公開したMuse Glimmerは、100以上の言語のデータで学習したとしています。
日本語向けに開発されたモデルを使いたい場合は、Hugging Faceで公開されているGGUF形式のファイルを ollama run hf.co/ユーザー名/リポジトリ名 の形で取得できます。たとえば国立情報学研究所の大規模言語モデル研究開発センターは、LLM-jp-4.1のGGUF版を公開しています。ただし、そのモデルカードは、現時点ではllama.cppの本家版では会話の解析に失敗するため、専用に改変した版が必要だと注意しています。Ollamaの公式一覧にないモデルは、Ollamaで正しく動くかを先に確かめます。
どのモデルでも、モデルカードの評価結果が自社の文書での精度を示すとは限りません。候補を2〜3個に絞り、社内の文書と質問を使って同じ条件で比べます。比べるときの観点は、Q&A「LLM(大規模言語モデル)の選定で何を考慮すべきですか?」でも整理しています。gpt-ossをLM Studioで動かす手順や推論レベルの設定は、gpt-ossとは?LM Studioでの動かし方、推論レベルの設定とAPIとの使い分けで紹介しています。
OllamaのAPIとOpenAI互換の窓口から呼び出す
Ollamaが起動していれば、APIは http://localhost:11434 で使えます。手元のサーバーへの要求には、APIキーも認証も要りません。Ollama独自のAPIでは、次のように /api/chat に送ります。
curl http://localhost:11434/api/chat -d '{
"model": "gemma4:e2b",
"messages": [{ "role": "user", "content": "自己紹介を1文でしてください。" }],
"stream": false
}'
回答は message.content に入ります。公式のライブラリとして、PythonとJavaScriptのものも用意されています。
OpenAI互換の窓口を使う
すでにOpenAIのSDKを使っているプログラムなら、接続先を http://localhost:11434/v1/ に変えるだけで、Ollamaのモデルを呼び出せます。SDKはAPIキーの値を求めますが、Ollamaはその値を使いません。
from openai import OpenAI
client = OpenAI(base_url="http://localhost:11434/v1/", api_key="ollama")
res = client.chat.completions.create(
model="gpt-oss:20b",
messages=[{"role": "user", "content": "この文の誤字を直してください:..."}],
)
print(res.choices[0].message.content)
/v1/chat/completions のほかに、/v1/responses と、AnthropicのAPIと同じ形式の /v1/messages も用意されています。ただし、どれも元のAPIの一部に対応したものです。たとえば /v1/chat/completions では、画像はURLでは渡せずBase64で渡す必要があり、logprobsには対応していません。/v1/responses は会話の状態を保存しないため、それまでのやり取りを毎回送ります。既存のプログラムを移すときは、使っている機能が対応表にあるかを確かめます。
応答を速くする設定
モデルは最初の要求で読み込まれるため、1回目の応答は遅くなります。APIの keep_alive に "10m" のような時間を指定すると、読み込んだモデルをその時間だけメモリに残せます。-1 を指定すると残し続け、0 を指定すると応答の後すぐに解放します。サーバー全体の既定値は、環境変数 OLLAMA_KEEP_ALIVE で変えられます。
社内でOllamaを使うときの注意
1台のPCで試すだけなら、ここまでの手順で足ります。社内の複数人で使う場合や、業務のデータを扱う場合は、少なくとも次の3点を決めておきます。
図の要点をテキストで読む
社内でOllamaを使う前に決める3つの点。ライセンスでは、Ollama本体はMITだがモデルごとに条件が違うため、ollama show --licenseで条文を確かめ、社内利用か顧客向けかで法務と確認する。ネットワークでは、既定は自分のPCだけから使え、OLLAMA_HOSTで公開範囲を広げると認証のないAPIに届くため、接続できる端末と認証の仕組みを決める。情報の扱いでは、ローカルだけで使うならOLLAMA_NO_CLOUD=1などでクラウドの機能を止め、扱ってよいデータの区分を決める。
ライセンス:Ollamaとモデルを分けて確認する
Ollama本体はMITライセンスですが、動かすモデルにはそれぞれのライセンスが適用されます。2026年10月7日に確認したモデルカードでは、Gemma 4、Qwen3.8-27B、gpt-oss、Muse Glimmer、LLM-jp-4.1はApache 2.0でした。一方、同じQwenの系統でもQwen3.8-Flash-Nextは独自のライセンス(qwen-community-1.0)です。手元のモデルのライセンス文は ollama show --license で表示できます。社内で使うだけか、顧客向けのサービスに組み込むかで確認する条項が変わるため、法務部門と一緒に読みます。
ネットワーク:既定では自分のPCからしか使えない
Ollamaは既定で 127.0.0.1 の11434番ポートで待ち受けるため、ほかの端末からは接続できません。環境変数 OLLAMA_HOST を 0.0.0.0:11434 のように変えると、ネットワーク上の端末から使えるようになります。前の節のとおり、手元のサーバーのAPIは認証を求めません。社内に公開するときは、接続できる端末をファイアウォールで限る、認証のある中継サーバーを前に置くなど、使える人を絞る仕組みを別に用意します。公式のFAQにはngrokやCloudflare Tunnelで外部に公開する例も載っていますが、業務のデータを扱う環境をインターネットから届く状態にするかどうかは、情報システム部門と決めます。
情報の扱い:クラウドの機能を止めるかを決める
ローカルのモデルだけを使うと決めた場合は、クラウドの機能を止めておきます。~/.ollama/server.json に "disable_ollama_cloud": true を書くか、環境変数 OLLAMA_NO_CLOUD=1 を設定して再起動すると、クラウドのモデルとWeb検索が使えなくなります。止まっているかは、ログに Ollama cloud disabled: true と出るかで確かめられます。
モデルのダウンロードにはインターネットへの接続が必要です。社内のプロキシを経由する場合は HTTPS_PROXY を設定します(HTTP_PROXY は設定しないよう案内されています)。社外に送ってよい情報の区分を決める方法は、Q&A「AI向けのデータ分類(機密区分)は、既存の情報分類とどう揃えますか?」で整理しています。
想定例:部署の試作アプリからOllamaを呼び出す場合
以下は説明のための架空の例です。営業部門で、日報から顧客の要望を抜き出す試作アプリを作ることになり、日報を社外のサービスに送らない方針が決まっていたとします。
情報システム部門は、GPUを積んだ社内のPC1台にOllamaを入れ、OLLAMA_NO_CLOUD=1 でクラウドの機能を止めます。候補のモデルを2つ取得し、過去の日報で抜き出しの精度を比べます。試作アプリはOpenAI互換の窓口から呼び出す形にしておき、精度が足りなければ接続先とモデル名を変えるだけでクラウドのAPIと比べられるようにします。部署の端末から使うために OLLAMA_HOST を変える段階で、接続できる端末を部署のネットワークに限ります。
試した後に業務へ組み込むには
Ollamaで動いたことと、業務で使い続けられることは別です。社内の複数人で使うには、利用者の認証とアクセスの記録、同時に処理できる件数、モデルを更新するときの評価の手順、障害時の対応を決める必要があります。社内文書を検索して答えさせたい場合は、RAG(検索拡張生成)の仕組みを組み合わせることになります。試作を本番に移すときの確認項目は、AIのPoCを本番運用に移すには?で解説しています。
inovieでは、Ollamaなどのローカル環境とクラウドAPIの比較、業務データでのモデルの評価、既存システムへの組み込みと運用の設計を支援しています。支援の範囲はAI導入・システム開発の支援をご覧ください。どのモデルや方式で進めるかを検討している段階でも、お問い合わせからご相談いただけます。
出典確認日:2026-10-07
この記事をシェアする



