gpt-ossとは?LM Studioでの動かし方、推論レベルの設定とAPIとの使い分け

gpt-ossは、OpenAIが2025年8月に公開したオープンウェイトの言語モデルです。モデルの重みをダウンロードして自社のPCやサーバーで動かせる点が、ChatGPTやOpenAIのAPIとの大きな違いです。2026年10月時点でも、汎用のモデルはgpt-oss-120bとgpt-oss-20bの2種類で、どちらもApache 2.0ライセンスで提供されています。この記事では、gpt-ossの概要と必要なメモリ、LM StudioとOllamaでの動かし方、推論の深さを決めるreasoning effortの設定方法を説明します。あわせて、企業が自社環境のgpt-ossとクラウドのAPIのどちらを使うかを決めるときの比べ方も整理します。
gpt-ossとは:OpenAIのオープンウェイトモデル
2つのサイズと必要なメモリ
gpt-ossには、規模の違う2つのモデルがあります。どちらも、処理のたびに一部の重みだけを使うMoE(Mixture of Experts)という構造です。
- gpt-oss-120b:総パラメータ数117B、1回の処理で使うパラメータは5.1B。NVIDIA H100のような80GBのGPU 1枚に収まるよう設計されています。
- gpt-oss-20b:総パラメータ数21B、1回の処理で使うパラメータは3.6B。16GBのメモリで動かせるとされ、手元のPCでの利用や応答の速さを重視する用途に向きます。
OpenAIのGitHubとHugging Faceのモデルカードによると、MoE部分の重みをMXFP4という形式で量子化した状態で学習を仕上げているため、この大きさのメモリで動かせます。OpenAIのローカル実行ガイドでは、gpt-oss-20bは16GB以上、gpt-oss-120bは60GB以上のGPUメモリ(Macではユニファイドメモリ)があると快適に使えるとしています。扱える文脈の長さ(コンテキスト長)は131,072トークンです。
ライセンスと利用条件
gpt-ossはApache 2.0ライセンスで公開されており、商用利用や改変、ファインチューニングができます。ただし、OpenAIは別に「gpt-oss usage policy」を定めており、利用者は適用される法令を守ることに同意する形になっています。社内で使う場合も、ライセンスと利用ポリシーの両方を法務や情報システム部門と確認しておくと安心です。
2026年10月時点の公開状況と注意点
OpenAIがHugging Faceで公開しているgpt-oss系のモデルは、2026年10月6日時点で、汎用の2モデルと、その派生である「gpt-oss-safeguard」(120bと20b)です。gpt-oss-safeguardは、利用者が書いた安全方針に沿って文章を分類する用途に絞ったモデルで、それ以外の用途には通常のgpt-ossを使うよう案内されています。同じ一覧では、汎用モデルの新しい版は確認できませんでした。
使う前に知っておきたい点もあります。モデルカードによると、gpt-ossは文章だけを扱うモデルで、画像は入力できません。学習データの知識は2024年6月までです。また、OpenAIが定めたharmony形式という会話の形式で学習しており、この形式で入力しないと正しく動かないと説明されています。LM StudioやOllamaのような対応ツールを使えば、この形式は自動で処理されます。
gpt-ossをローカルで動かす手順(LM Studio・Ollama)
手元のPCで試すなら、画面で操作できるLM Studioか、コマンドで操作するOllamaが手軽です。どちらもOpenAIのリポジトリで導入方法が案内されています。
図の要点をテキストで読む
gpt-ossを手元のPCで試す5つの手順。1はメモリを確認し、gpt-oss-20bなら16GB程度、gpt-oss-120bなら60GB以上のGPUメモリを目安にする。2はLM StudioかOllamaをインストールする。3はモデルを取得し、LM Studioではlms get openai/gpt-oss-20b、Ollamaではollama pull gpt-oss:20bを使う。4は推論レベル(reasoning effort)をlow、medium、highから選ぶ。5は業務で使う文書や質問で回答を確かめ、正しさと修正の手間を記録する。
LM Studioで動かす
LM StudioはWindows、macOS、Linuxで使えるデスクトップアプリです。公式サイトからインストールし、アプリ内でgpt-ossを検索してダウンロードします。コマンドで操作する場合は、LM Studioに付属するlmsというツールで次のように実行します。
lms get openai/gpt-oss-20b
lms load openai/gpt-oss-20b
lms chat openai/gpt-oss-20b
gpt-oss-20bを読み込めば、チャット画面でそのまま質問できます。LM Studioのモデルページでは、gpt-oss-20bの最小システムメモリを12GBと表示しています。メモリが足りないと読み込みに失敗したり、応答が極端に遅くなったりするため、初めはgpt-oss-20bで試すのが現実的です。
Ollamaで動かす
Ollamaを使う場合は、Ollamaをインストールしてから、ターミナルで次のコマンドを実行します。
ollama pull gpt-oss:20b
ollama run gpt-oss:20b
gpt-oss-120bを使う場合は、20bの部分を120bに置き換えます。OpenAIのガイドでは、GPUメモリが足りない場合はCPUに処理を逃がせるものの、その分だけ遅くなると説明されています。
社内のアプリから呼び出す
LM StudioとOllamaは、どちらもOpenAIのAPIと同じ形式で呼び出せる窓口(エンドポイント)をPC上に用意します。LM Studioはhttp://localhost:1234/v1、Ollamaはhttp://localhost:11434/v1が初期設定です。OpenAIのSDKで接続先のURLを書き換えれば、既存の試作コードからgpt-ossを呼び出せます。ただし、この窓口は手元での検証を想定したものです。社内の複数人で使う場合は、認証、アクセス記録、同時に処理できる件数を別に設計する必要があります。
gpt-ossのreasoning effort(推論レベル)の設定方法
gpt-ossは、回答の前に考える量を low、medium、high の3段階で切り替えられます。これがreasoning effort(推論レベル)です。モデルカードによると、レベルを上げるほど回答前の推論が長くなり、数学や専門知識の問題では正答率が上がる傾向がありました。そのぶん、回答までの時間は長くなります。
LM Studioでの設定
LM Studioがgpt-oss-20b向けに用意しているモデル定義には、「Reasoning Effort」という選択式の設定項目があり、既定値はlowです。チャット画面でgpt-oss-20bを読み込むと、この項目から low、medium、high を選べます。画面の配置はLM Studioのバージョンで変わることがあるため、見当たらない場合は読み込んだモデルの設定欄を確認してください。この項目はLM Studioのモデル定義で用意されているため、別の配布元のファイルを読み込んだ場合は表示されないことがあります。
LM StudioのAPIから呼び出す場合は、OpenAI互換のResponses API(/v1/responses)で、リクエストに"reasoning": { "effort": "high" }のように指定します。LM Studio独自のREST API(/api/v1/chat)では、reasoningという項目にlow、medium、highなどを指定できます。
システムプロンプトでの指定
OpenAIのモデルカードでは、推論レベルはシステムプロンプトに「Reasoning: high」のような一文を入れて指定すると説明されています。設定項目がないツールを使う場合や、項目が効いているか確かめたい場合は、この書き方を使います。
Ollamaでの設定
Ollamaでは、APIのリクエストにthinkという項目を入れて、"low"、"medium"、"high"のいずれかを指定します。Ollamaのドキュメントでは、gpt-ossの既定値はmediumとされています。
3つのレベルの使い分け
モデルカードは、lowを一般的な対話向けの速い応答、mediumを速さと詳しさの中間、highを深く詳しい分析向けと説明しています。業務で試すときは、要約や定型的な文書の下書きはlowから始め、計算や条件の多い判断を含む作業でmediumやhighを試す、という順番にすると、速さと正確さの関係をつかみやすくなります。
なお、gpt-ossは推論の過程(chain of thought)をそのまま出力します。モデルカードでは、この推論の過程には誤った内容や不適切な表現が含まれ得るため、利用者向けのアプリでは、絞り込みや要約をせずにそのまま見せないよう注意しています。
自社環境のgpt-ossとクラウドAPIの使い分け
gpt-ossを試した後に多い疑問は、「自社環境で動かすべきか、クラウドのAPIを使い続けるべきか」です。どちらが良いかは、扱うデータ、利用量、運用できる体制、求める精度によって変わります。
図の要点をテキストで読む
自社環境で動かすgpt-ossとクラウドAPIの比較表。データの扱いでは、gpt-ossは入力が自社環境の外に出ず、クラウドAPIは学習利用の有無や保存期間、保管地域を契約と設定で確認する。費用では、gpt-ossはモデルの利用料がかからないが機器と保守の費用がかかり、クラウドAPIは使った量に応じて課金される。運用では、gpt-ossは更新、監視、認証を自社で受け持ち、クラウドAPIは提供元が受け持つ範囲が広い。精度では、gpt-ossは知識量が大きなモデルより少なく、どちらも自社の業務データで比べて確かめる。
データの扱い
自社のPCやサーバーで動かせば、入力した文章はその環境の外に出ません。社外のサービスにデータを送れない規程がある場合や、閉じたネットワークで使いたい場合は、gpt-ossのようなオープンウェイトモデルが選択肢になります。
一方、クラウドのAPIでも、データの扱いは契約や設定で調整できます。OpenAIの公式ドキュメントによると、APIに送ったデータは、利用者が明示的に許可しない限りモデルの学習に使われません。不正利用の監視のための記録は原則30日まで保存され、一部のエンドポイントでは保存しない設定(Zero Data Retention)も申請できます。日本を含む地域でのデータ保管にも対応しています。「クラウドは使えない」と決める前に、こうした条件で社内規程を満たせるかを確かめる価値があります。
費用
gpt-ossはモデル自体の利用料がかかりません。ただし、無料で使えるのはモデルの重みであり、GPUを積んだPCやサーバー、電気代、保守の人件費は自社の負担です。利用量が少ないうちは、機器を用意するよりAPIの従量課金の方が安く済む場合があります。処理の量が増えて常に動かすようになった段階で、自社環境の費用が見合うかを改めて比べます。比べるときは、1件あたりの処理費用と月間の件数を、両方の方式で同じ前提にそろえて見積もります。
運用の負担
自社環境では、モデルの更新、サーバーの監視、障害時の対応、利用者の認証やアクセス記録をすべて自社で受け持ちます。モデルカードでも、APIで提供されるモデルには組み込まれている保護の仕組みを、オープンウェイトモデルでは開発者や企業が自ら用意する必要がある場合があると書かれています。運用を担える人がいない状態で自社環境を選ぶと、試作は動いても本番で使い続けるのが難しくなります。
精度の確かめ方
OpenAIのモデルカードでは、推論レベルをhighにしたgpt-oss-120bは、比較対象のo3-miniを上回り、o4-miniに近い正答率だったと報告されています。14言語に翻訳したMMLU(MMMLU)の日本語の結果は、推論レベルhighでgpt-oss-120bが83.5、gpt-oss-20bが78.8で、o4-mini(high)は86.9でした。一方で、事実を問う質問の評価(SimpleQA、PersonQA)では、ネット検索を使わない条件で、どちらのgpt-ossもo4-miniより正答率が低く、誤った回答の割合が高い結果でした。モデルが小さいほど持っている知識が少ないため、とモデルカードは説明しています。
公開された評価結果は、自社の業務での精度を保証するものではありません。実際に使う文書や問い合わせを数十件ほど用意し、gpt-ossと候補のAPIモデルで同じ質問に答えさせて、正しさと修正の手間を比べるのが確実です。モデルを選ぶときに比べる項目は、Q&A「LLM(大規模言語モデル)の選定で何を考慮すべきですか?」でも整理しています。
想定例:社内規程の問い合わせ対応で比べる場合
以下は説明のための架空の例です。社内規程についての問い合わせに回答案を作るAIを検討しており、規程の文書を社外に出したくないという意見があったとします。
まず、gpt-oss-20bをLM Studioで動かし、過去の問い合わせ30件で回答案を作ります。同じ30件をクラウドのAPIモデルにも答えさせ、担当者が「そのまま使える」「直せば使える」「使えない」の3段階で評価します。あわせて、クラウドを使う場合の契約条件(学習に使わないこと、保存期間、保管地域)が社内規程を満たすかを情報システム部門に確認します。精度に大きな差がなく、規程上クラウドが使えないと分かれば自社環境を本番の候補にします。精度の差が大きく、クラウドの条件で規程を満たせるなら、APIを使う方が運用の負担を抑えられます。
gpt-ossの検証を本番運用につなげるには
gpt-ossは、手元のPCで動かしてみるところまでは短時間で進められます。本番運用に進めるには、使う業務を絞り、評価の合格ラインを決め、自社環境とAPIのどちらで運用するかを費用と体制まで含めて判断する必要があります。検証から本番へ移すときの確認項目は、AIのPoCを本番運用に移すには?で詳しく解説しています。
inovieでは、モデルの比較と業務での評価から、既存システムへの組み込み、運用の設計までを支援しています。支援の範囲はAI導入・システム開発の支援、AIエージェントとして業務に組み込む場合はAIエージェント導入・改善支援をご覧ください。オープンウェイトモデルとAPIのどちらを使うかで迷っている場合も、お問い合わせからご相談いただけます。
出典確認日:2026-10-06
この記事をシェアする



