ローカルLLMはRAM何GBで何が動く?2026年9月のメモリ別6選と、Ollamaで動かないモデル

コードを読まないAIエンジニア
サムネイル

ローカルLLMを試そうとしてモデル名を調べるたびに、「で、うちのPCのRAMで動くの?」で手が止まっていませんか? 2026年9月29日時点で、手元のRAMから選べる6つを公式ページの数字だけで並べました。調べてみると、Ollamaのライブラリに名前があるのに手元では動かないモデルが混ざっています。

手元のRAMで選ぶなら、2026年9月はこの6つ

RAMの目安
モデル
動かし方
重み
文脈の上限
8GB〜
Ternary Bonsai 2 27B
専用フォーク
5.95GB
262K
16GB
Gemma 4 E4B
素のOllama
9.6GB
128K
16GB
Qwen3 14B
素のOllama
9.3GB
40K
32GB
Gemma 4 26B
素のOllama
19GB
256K
32GB
Qwen3.8-27B
素のOllama
18GB
256K
64GB
Qwen3-Coder-Next
素のOllama
52GB
256K

「重み」はダウンロードするファイルの大きさで、Ollamaの既定タグとHugging Faceの公式ページの値です。RAMの目安は、重みを載せてもOSとブラウザの分が数GB残る容量として私が置いたものです。

Ollamaにあるのに、手元では動かないモデルがある

6つのうち5つは、素のOllamaで ollama run の1行で動きます。残るBonsai 2は、Ollamaでは読み込めません。

もう1つ見落としやすいのが、クラウドタグです。名前の末尾に :cloud が付いたモデルはollama.comのサーバーで動き、手元のRAMは使いません。Gemma 4にも gemma4:e4b のようなローカルのタグと並んで、gemma4:cloud と gemma4:31b-cloud があります。

128GBの枠に入れたかったDeepSeek V4 Flashは、この問題で外しました。Ollamaの deepseek-v4-flash のページには「2026年9月25日に廃止」とあり、後継のdeepseek-v4.1-flashはクラウドタグしかありません。Ollamaで名前を検索して pull しても、手元のRAMで動くわけではないんです。

どうしても手元で動かすなら、Hugging Faceで公開されている284BのDeepSeek V4 Flashを、UnslothのGGUFにしてllama.cppで動かす道があります。2bitで102GB、推奨の3bit版は103GBで、Unslothは110GB以上のRAMを勧めています。

クラウドを使う場合、Ollamaは「プロンプトと応答をモデルの学習に使わない」と明記しています。それでも完全に手元だけで使いたいなら、OLLAMA_NO_CLOUD=1 を設定するとクラウド機能を切れます。

8GBで27B級は動くか? Bonsai 2 27Bは専用フォークが前提

1. Ternary Bonsai 2 27B

PrismMLが9月17日に出したモデルで、Qwen3.8-27Bの重みを-1、0、+1の3値に縮めています。1重みあたり約1.72bitで、PTQ1_0形式なら5.95GB、PQ2_0形式なら7.21GB。元のFP16版は53.8GBなので、PTQ1_0なら9分の1以下です。PrismMLの発表では、元モデルのベンチマーク性能の98.2%を保っています。

問題は動かし方です。通常のllama.cppもOllamaもLM Studioも、この3値の形式を読み込めません。PrismMLが公開しているllama.cppのフォークのバイナリが必要で、macOS(Apple Silicon)版とCUDA版が配布されています。

メモリと文脈の関係は、Atomic Chatのガイドに目安があります。8GBならPTQ1_0で文脈は約16Kまで、12GBならPQ2_0で約56K、24GBで約240K、32GB以上で262Kをまるごと使えます。文脈が8K増えるごとに約0.5GB、画像を読ませるなら0.63GBが上乗せです。

8GBのPCで27B級、という話題の裏には、Ollamaを使わないという1手間が付いてきます。

16GBなら、Gemma 4 E4BとQwen3 14Bのどちらか?

2. Gemma 4 E4B

ollama run gemma4:e4b で入るのは9.6GBのQ4_K_M版で、文脈は128Kです。ここで数字が食い違うので注意してください。Googleの公式ドキュメントでは、E4Bの推論メモリはQ4_0で4.5GBとなっています。

同じ4bitでも、どのファイルを落とすかで倍以上変わるんです。16GBで余裕がほしいなら、6.1GBの gemma4:e4b-it-qat タグもあります。

3. Qwen3 14B

qwen3:14b は9.3GBで、E4Bとほぼ同じ重さです。違いは文脈の上限が40Kと短いことと、更新が1年前の2025年世代だということ。

私なら、16GBの1本目は新しいGemma 4 E4Bにします。Qwen3 14Bは、すでにQwen3系で組んだ手順やプロンプトがあり、40Kで足りる用途なら残す価値があります。

32GBなら、Gemma 4 26BとQwen3.8-27Bがどちらも載る

4. Gemma 4 26B

gemma4:26b は19GBで、総パラメータ25.2Bのうち1トークンごとに動くのは3.8Bだけの混合エキスパート(MoE)モデルです。文脈は256Kで、画像も入力できます。

5. Qwen3.8-27B

qwen3.8:27b は18GBで、こちらは27Bの重みを毎回すべて使う密なモデルです。Hugging Faceの公式ページでは、ネイティブの文脈が262,144トークン、ライセンスはApache 2.0。Ollama版もテキストと画像を受け付けます。

重さはほぼ同じなのに、1トークンあたりに動かす量は7倍ほど違います。どちらが自分の用途に合うかは、両方落としても37GBなので、同じ質問を投げて並べるのが早いです。

64GBあれば、コード用途のQwen3-Coder-Nextまで手元に置ける

6. Qwen3-Coder-Next

総パラメータ80Bのうち、1トークンで動くのは3B。512個のエキスパートから10個を選ぶ構成のコード特化モデルです。ライセンスはApache 2.0で、文脈は262,144トークンまで扱えます。

Ollamaの既定タグ(q4_K_M)は52GB、q8_0は85GBです。64GBに52GBを載せると、残りは12GBしかありません。Hugging Faceのモデルカードにも、メモリが足りなくなったら文脈を32,768に下げるよう書かれています。

OLLAMA_CONTEXT_LENGTH=32768 ollama serve
ollama run qwen3-coder-next

64GBのMacで試すなら、最初から文脈を32Kに絞って立ち上げるのが安全です。

モデルの容量だけで選ぶと、文脈長の分だけ足りなくなる

表の「重み」は、モデルを置くだけの容量です。Googleのドキュメントも、メモリはプロンプトと応答のトークン数に応じて増え、長い文脈にはモデル本体とは別に大きなメモリが要ると注記しています。Bonsai 2の目安でいえば、8Kごとに約0.5GBでした。

ここで効いてくるのが、Ollamaの既定の文脈長です。公式ドキュメントでは、VRAMが24GiB未満なら4K、24〜48GiBなら32K、48GiB以上なら256Kで立ち上がります。16GBのPCでGemma 4 E4Bを動かしても、何も設定しなければ128Kのうち4Kしか使っていません。

長い資料を読ませたくて OLLAMA_CONTEXT_LENGTH を上げたら、ollama ps で2つの列を見てください。CONTEXT に実際に確保された文脈の長さが、PROCESSOR にどこで動いているかが出ます。ここが「100% GPU」から「48%/52% CPU/GPU」のような表示に変わったら、メモリからあふれてCPUに逃げています。

最初の1本は、表の自分の行から選ぶ

手元のRAMが16GBなら ollama run gemma4:e4b、32GBなら gemma4:26b と qwen3.8:27b、64GBなら文脈を32Kに絞った qwen3-coder-next。8GBなら、Ollamaは使わずにBonsai 2とPrismMLのフォークです。

入れたら、まず ollama ps の2つの列を確かめてください。あなたのPCのRAMは、表のどの行でしたか?