こんにちは、ローカルAI工房のコーボーです。
ChatGPTのようなAIを、自分のパソコンの中だけで動かせる「ローカルLLM」。名前は聞くけれど、「なんだか難しそう」「うちのPCで動くの?」と足踏みしている人、多いんじゃないでしょうか。分かります、私も最初は黒い画面のイメージが強くて身構えていました。
でも結論から言うと、今はツールが本当に整っていて、試すだけならLM Studio、開発や自動化に組み込むならOllamaを選べば、初心者でも今日中にAIとチャットするところまで行けますよ。この記事では、両方の導入手順を順番に解説していきます。
- ローカルLLMの仕組みとメリット・デメリット
- 手持ちのPCで動くか判断するVRAMの目安
- LM StudioとOllamaそれぞれの始め方
- 最初の1本におすすめの定番モデル

ローカルLLMとは?クラウドとの違い
まずは「ローカルLLMって結局なに?」というところから、サクッと整理しておきましょう。仕組みが分かると、この後の手順もぐっと理解しやすくなります。
手元のPCでAIが動く仕組み
LLMは「大規模言語モデル」のことで、ChatGPTやGeminiの中身になっている技術です。普段使っているこれらのAIは、遠くのデータセンターにある高性能サーバーで動いていて、私たちはネット越しに結果を受け取っているだけなんですね。
一方ローカルLLMは、無料で公開されているAIモデルのファイルを自分のPCにダウンロードして、手元のグラボ(GPU)で動かすやり方です。MetaやGoogle、最近はOpenAIまでもが「オープンウェイトモデル」と呼ばれる、誰でも使えるモデルを公開しています。
「そんな巨大なAIが家のPCで動くの?」と思いますよね。ここで効いてくるのが量子化(りょうしか)という技術です。ざっくり言うと、モデルの中身の数値を粗くして、賢さをなるべく保ったままファイルサイズを数分の1に圧縮する仕組みです。この量子化済みモデルの標準形式が「GGUF」で、LM StudioもOllamaもこの形式のモデルを扱います。
ローカルLLMでできることは、クラウドのAIとほぼ同じです。文章の要約・翻訳・アイデア出し・プログラミングの相談・長文の下書きあたりは普通にこなしますし、対応モデルなら画像を見せて質問することもできます。「手元で動く小さなChatGPT」をイメージしてもらえば、だいたい合っていますよ。
メリットと正直なデメリット
ローカルLLMのメリットは、だいたいこの4つに集約されます。
ローカルLLMの主なメリット
- 無料・無制限:API料金も月額課金もなし。何万回叩いても電気代だけ
- オフラインで動く:ネットが無くてもAIが使える
- 入力内容が外に出ない:仕事のデータや個人的な文章も安心して渡せる
- 自由にカスタマイズできる:モデルの入れ替えも表現の幅も自分の裁量
4つ目の「自由さ」は、私自身が一番恩恵を受けているところです。実は私がAIイラスト制作をローカル環境でやっている理由の1つがまさにこれで、クラウドのAIサービスは規約による生成の制限が意外と厳しく、創作の題材や表現によっては途中で断られてしまうことがあるんですね。ローカルなら、モデルのライセンスと公開先のルールを守る前提で、何をどう作るかを自分の裁量で決められます。LLMでも事情は同じで、創作の相談相手として使うとき、この自由度の差は思った以上に効いてきますよ。
ただ、いいことばかりじゃありません。正直なところも書いておきます。
先に知っておきたいデメリット
- 賢さは、クラウドの最上位モデル(ChatGPTの有料版クラス)には及ばない
- 快適に動かすには、ある程度のPCスペック(特にVRAM)が必要
- モデル選びやアップデートを自分で管理する手間がある
つまり「クラウドAIの完全な置き換え」ではなく、用途に応じた使い分けの選択肢が1つ増える、というのが実態に近いです。たとえば「社外に出せない資料の要約はローカル」「最新ニュースを踏まえた調べ物はクラウド」のように、データの性質で振り分けるのが賢い付き合い方かなと思います。あと地味なところでは、生成中はグラボがフル稼働するので、ゲーム中と同じくらいファンが回って電気も食います。このあたりは覚悟しておきましょう。
無料で無制限に使えるAIが手元にあると、失敗を気にせず実験し放題なんですよね。この気楽さが一番の価値かなと思いますよ。
始める前に確認したいPCスペック
ツールを入れる前に、手持ちのPCでどのくらいのモデルが動くのかを把握しておきましょう。ここを飛ばすと「入れたのに遅くて使い物にならない」となりがちです。

快適さはVRAM容量でほぼ決まる
ローカルLLMの快適さを決めるのは、CPUでもメモリでもなく、まずグラボのVRAM(ビデオメモリ)容量です。モデル全体がVRAMに収まっていれば返答はサクサク返ってきますが、収まりきらずメインメモリにはみ出すと、一気に数倍遅くなります。「動く・動かない」の話ではなく「快適か・苦行か」を分けるのがVRAM、と覚えておいてください。
また、AI用途ではグラボはNVIDIA製が無難です。多くのAIツールがNVIDIAのCUDAという仕組みを前提に作られているためで、ローカルLLMに限ればAMD製でも動く環境は増えていますが、情報の多さ・トラブルの少なさではまだNVIDIAに分があります。
モデルの規模は「8B」「14B」のようにパラメータ数(Bは10億個の単位)で表されます。VRAMとの関係を、一般的な目安として表にまとめました。
| VRAM容量 | 動かせるモデル規模の目安 | 快適度のイメージ |
|---|---|---|
| 8GB | 4B前後の小型モデル | お試しには十分 |
| 12GB | 8B〜12Bクラス | 実用の入り口 |
| 16GB | 14B〜20Bクラス | 日常使いが快適に |
| 24GB以上 | 27B〜32Bクラス | 本格的な作業も視野 |
※量子化(Q4クラス)を前提にした、あくまで一般的な目安です。7B〜13Bクラスのモデルを余裕をもって快適に動かすなら、VRAM 12〜16GBが現実的なラインと考えておくといいですよ。
「自分のPCのVRAMがいくつか分からない」という人は、Windowsならタスクマネージャーで確認できます。Ctrl+Shift+Escでタスクマネージャーを開き、「パフォーマンス」→「GPU」の「専用GPUメモリ」を見てください。ここに表示されている容量が、あなたのVRAMです。グラボが2つ表示される場合は、数字が大きいほう(外付けのグラボ側)を見ればOKです。
生成AI向けのスペックの考え方は生成AI向けパソコンのスペック解説で、画像生成とLLMを両立する構成はローカルAI用パソコンの選び方で詳しく書いています。
メモリとストレージの目安
VRAMの次に見ておきたいのが、メインメモリ(RAM)とストレージです。RAMは32GBあると安心です。16GBでも動きますが、VRAMからはみ出した分の受け皿になったり、ブラウザと併用したりすると、けっこうカツカツになります。
ストレージは、モデルファイル1本が5GB〜20GB程度あるので、いくつか試すとすぐ数十GBいきます。SSDの空きは100GBくらい確保しておくと気楽ですね。読み込み速度の面でも、モデルはHDDではなくSSDに置くのがおすすめです。Cドライブが手狭な場合、LM StudioもOllamaも設定でモデルの保存先を別ドライブに変えられるので、覚えておくと後で助かりますよ。
◆コーボーのワンポイント
私の環境はRAM 32GBなんですが、動画生成AIの新しいモデルを試そうとしたら「RAM 64GB推奨」で見送ったことがあります。ローカルAIの世界ではVRAMばかり注目されがちですが、大きめのモデルを扱い出すとRAMも普通にボトルネックになります。これからPCを組む・買うなら、メモリは多めに積んでおいて損はないですよ。
スペック確認は地味ですけど、ここで自分の「動かせる上限」を知っておくと、モデル選びで迷子にならずに済みますよ。
LM Studioで始める手順
それでは実際に始めていきましょう。まずは、マウス操作だけで完結するLM Studioからです。「とにかく一度ローカルLLMを体験してみたい」という人には、こちらが一番の近道です。

インストールとモデル導入
LM Studioは、ローカルLLMの「ダウンロード・実行・管理」を1つの画面でこなせる無料のデスクトップアプリです(執筆時点。出典:LM Studio公式サイト)。Windows・Mac・Linuxに対応しています。手順はこれだけです。
- 公式サイトからインストーラーをダウンロードして実行する
- 初回起動時の案内(オンボーディング)に沿って進める
- 虫めがねアイコンの検索画面でモデルを探してダウンロードする
親切なのが、モデル検索の画面で「このPCで動きそうか」の目安を表示してくれるところです。手持ちのスペックに対して大きすぎるモデルには警告が出るので、初心者が無茶なサイズを掴んでしまう事故が起きにくいんですね。まずはおすすめ表示に出てくる小さめのモデルから試すのが安全です。
インストール後に1つだけ確認しておきたいのが、グラボがちゃんと認識されているかです。設定画面のハードウェア欄でGPUが表示されていればOK。もしCPUしか出ていない場合は、グラボのドライバーを最新にしてからアプリを再起動してみてください。ここがCPU動作のままだと、せっかくのグラボが遊んでしまい、返答が何倍も遅くなります。
チャットしてみる・便利機能
モデルのダウンロードが終わったら、チャット画面の上部からモデルを読み込んで、あとはメッセージを送るだけ。ChatGPTとほぼ同じ感覚で会話できます。ネットを介さず、目の前のグラボがうなりながら文章を組み立てて返してくる。初めてこれを体験したときは、ちょっと感動しますよ。会話の履歴も普通に残せますし、返答の速度(1秒あたりの生成トークン数)が画面に表示されるので、モデルごとの快適さを比べる目安にもなります。
慣れてきたら、こんな機能も触ってみてください。
- システムプロンプト:AIの口調や役割を固定できる(「あなたは翻訳者です」など)
- 対応モデルなら画像の読み取り:画像を渡して内容を質問できる
- ローカルサーバー機能:OpenAI互換のAPIとして他のアプリから呼び出せる
特にローカルサーバー機能は、後述のOllamaの領分に近いこともGUIでできてしまう優れものです。
もう1つ、覚えておくと快適さが変わるのがコンテキスト長の設定です。これはAIが一度に覚えていられる会話の長さのことで、大きくするほど長文を扱えますが、その分VRAMを余計に消費します。長い文書を要約させたいとき以外は、初期設定のままで十分です。「モデルは収まるはずなのに動きが重い」というときは、まずここを疑ってみてください。
「ローカルLLMは難しい」というイメージ、LM Studioを一度触ると良い意味で裏切られますよ。画面の日本語対応も進んでいて、迷いにくいです。
Ollamaで始める手順
続いてOllama(オラマ)です。こちらはコマンド操作が中心のツールで、プログラムから呼び出したり、自動化の部品として組み込んだりする使い方に強いのが特徴です。

インストールとモデル実行
Ollamaは無料で使えるオープンソースのツールで、こちらもWindows・Mac・Linuxに対応しています(出典:Ollama公式サイト)。公式サイトからインストーラーを入れたら、ターミナル(WindowsならコマンドプロンプトやPowerShell)で次の1行を打つだけです。
ollama run gemma3:4b
これだけで、モデルのダウンロードから起動、チャット開始までまとめてやってくれます。モデル名の部分を変えれば別のモデルに切り替わる仕組みで、対応モデルの一覧は公式サイトのライブラリから探せます。よく使うコマンドはこの4つだけ覚えれば十分です。
| コマンド | やってくれること |
|---|---|
ollama run モデル名 |
モデルを起動してチャット開始(無ければDLも) |
ollama pull モデル名 |
モデルのダウンロードだけ先に済ませる |
ollama list |
手元にあるモデルの一覧を表示 |
ollama rm モデル名 |
使わないモデルを削除してディスクを空ける |
チャット中に終了したいときは/byeと打てば抜けられます。この「素っ気なさ」が逆に分かりやすくて、私は好きなんですよね。
「黒い画面はやっぱり苦手…」という人も安心してください。執筆時点のOllamaには公式のチャット画面(デスクトップアプリ)も付いていて、こちらならマウス操作だけで会話できます。
本領を発揮するのは、プログラムとの連携です。Ollamaは起動中、パソコンの中でAPIサーバーとして待ち受けていて、PythonなどのスクリプトからChatGPTのAPIとほぼ同じ書き方で呼び出せます。「OpenAI互換」と呼ばれる形式なので、世の中にあるChatGPT API向けのコードやツールの接続先をローカルに向けるだけで、そのまま流用できるケースが多いんです。たとえばこんな自動化が、API料金ゼロで回せるわけです。
- 毎朝たまったテキストファイルを要約させるバッチ処理
- 大量の画像生成プロンプトの英訳・言い換え
- ブログ下書きの誤字チェックを定期実行
1回あたりのコストを気にしなくていいので、「とりあえず全部AIに通す」みたいな贅沢な使い方ができるのがローカルならではですね。
API料金を気にせず何千回でも回せるのは、自動化好きにはたまらないですよ。深夜にバッチを仕込んで寝る楽しさがあります。
LM StudioとOllamaの選び方
「で、結局どっちを入れればいいの?」という疑問に答えておきます。両者の違いを表にするとこうなります。
| LM Studio | Ollama | |
|---|---|---|
| 操作方法 | GUI(マウス)で完結 | コマンド中心+公式GUIあり |
| モデル探し | アプリ内で検索・目安表示 | 公式ライブラリから選ぶ |
| プログラム連携 | サーバー機能で可能 | 得意分野。常駐APIが標準 |
| 向いている人 | まず体験したい人 | 開発・自動化に使いたい人 |
使い分けの結論はシンプルです。
- 試すだけ・チャット中心 → LM Studio。画面が分かりやすく、モデル選びの失敗も少ない
- 開発や自動化に組み込む → Ollama。スクリプトとの連携が前提の設計
ちなみに両方インストールしても干渉はしません。ただしモデルファイルはそれぞれ別に管理されるので、同じモデルを両方に入れるとディスクを二重に食う点だけ注意です。迷ったらLM Studioから始めて、自動化したくなったらOllamaを足す、の順番がおすすめですよ。
使い分けのイメージとしては、「新しいモデルの性格や日本語の自然さをじっくり確かめる作業はLM Studioの画面で」「気に入ったモデルをスクリプトに組み込んで毎日の作業を回すのはOllamaで」という分担がしっくりきます。片方だけでも困りはしませんが、両方の入り口を知っておくと、ローカルLLMの世界がぐっと広がります。
「どっちが優秀か」ではなく「入り口が違うだけ」なんですよね。私は両方入れて使い分けるのがしっくりきています。
最初の1本におすすめのモデル
ツールを入れたら、次はモデル選びです。ここが一番楽しく、そして一番迷うところ。執筆時点でよく名前が挙がる定番どころを、VRAM別に紹介します。
- VRAM 8GB:Gemma 3の4B、Qwen3の4Bなど小型モデル
- VRAM 12GB:Qwen3の8Bクラスが定番。Gemma 3の12Bも量子化次第で視野
- VRAM 16GB:Qwen3の14B、OpenAIのオープンモデルgpt-oss-20bあたりが人気
- VRAM 24GB以上:Qwen3の32B、Gemma 3の27Bなど本格クラス
日本語でのやり取りが中心なら、Qwen3系は日本語がかなり自然で扱いやすいです。日本語をさらに強化した派生モデル(Swallow系など)も国内の研究チームから公開されているので、慣れてきたら探してみてください。なお、このジャンルは数か月単位で勢力図が入れ替わります。ここに挙げた名前はあくまで執筆時点の定番なので、選ぶときはLM Studioの検索画面やOllamaのライブラリで人気順を眺めて、今の定番を確かめるのが確実です。
豆知識:モデル名の読み方
「8B」はパラメータ数80億の意味。数字が大きいほど賢い傾向ですが、その分VRAMを食います。また、同じモデルでも「Q4」「Q8」のような量子化の段階があり、迷ったら中間バランスのQ4_K_Mを選んでおけば大きな失敗はないです。
◆コーボーのワンポイント
画像生成のモデル選びでも同じことを痛感しているんですが、最初から一番大きいモデルを狙うと、遅さにうんざりして触らなくなりがちです。まず手持ちのVRAMに余裕で収まる小さめのモデルで「動いた!」の成功体験を作ってから、少しずつサイズを上げていくのが、結局いちばん長続きしますよ。
実際に動かしてみて「返答が遅いな」と感じたら、対処の順番はこうです。まず量子化の段階を1つ下げたモデル(Q4など軽いもの)に替えてみる。それでも遅ければ、パラメータ数が1段小さいモデルに落とす。体感速度は快適さに直結するので、賢さを1割譲って速さを2倍取るくらいの気持ちでちょうどいいですよ。
もし「動かしたいモデルにVRAMが全然足りない」となったら、それはPC側の見直しタイミングかもしれません。GPU重視のPC選びはAI向けパソコンの選び方で詳しく解説しています。
ローカルLLMのよくある質問
ネット接続がないと使えませんか?
モデルのダウンロード時だけネットが必要です。一度ダウンロードしてしまえば、チャットや文章生成は完全オフラインで動きます。飛行機の中でもAIが使えるのは、ローカルならではですね。
本当に無料なんですか?
執筆時点で、LM StudioもOllamaも、公開されているオープンなモデルも無料で使えます。かかるのはPCの電気代くらいです。ただしライセンス条件はモデルごとに異なるので、商用利用する場合は各モデルの規約を確認してください。
グラボなしのPCでも動きますか?
CPUだけでも一応動きますが、返答がかなり遅く、実用的とは言いにくいです。小型モデル(4B以下)をお試しで触る程度なら可能なので、まず体験してから、本格的に使うかどうかでグラボ導入を検討する流れがおすすめです。
日本語は使えますか?
使えます。Qwen3やGemma 3といった主要なオープンモデルは日本語での会話に対応しています。さらに日本語性能を高めた国産の派生モデルも公開されているので、日本語メインなら選択肢は十分ありますよ。
ChatGPTの代わりになりますか?
用途によります。要約・翻訳・下書き・アイデア出しといった日常タスクなら十分実用的ですが、最新情報の検索や高度な推論はクラウドの最上位モデルに分があります。「機密データや大量処理はローカル、難問はクラウド」という使い分けが現実的です。
まとめ:小さく始めて手元で育てる
最後に、この記事のポイントを整理しておきます。
- ローカルLLMは無料・無制限・オフラインで使えるのが最大の魅力
- 快適さはVRAM容量でほぼ決まる。12〜16GBが実用の目安
- まず体験するならLM Studio、自動化に組み込むならOllama
- モデルは手持ちVRAMに余裕で収まる小さめから始めるのが長続きのコツ
ローカルAIの世界は動きが速く、モデルもツールも数か月で様変わりします。この記事の内容は執筆時点のものなので、最新の正確な情報は公式サイトでご確認ください。
そして、ローカルLLMで手元のAI環境に味をしめたら、次は画像生成もローカルで動かしてみませんか。Stable Diffusionをローカルで始める方法で、導入手順を丁寧に解説しています。あなたのPCが「自分だけのAI工房」になっていく感覚、ぜひ味わってみてください。