【2026年版】ローカルLLMは何Bあれば足りる?用途別のパラメータ数と必要VRAM早見表(Qwen3で解説)
共有
ローカルLLMは、何Bあれば足りるのか。
「Qwen3を社内で動かしたい」と決めたあと、最初に詰まるのがここです。8Bなのか14Bなのか32Bなのか。答えは用途でほぼ決まり、決まればVRAMが決まり、VRAMが決まればPCの値段が決まります。この記事はその順番を、Qwen3の実際のモデルサイズをもとに整理したものです。クラウドAPIとどちらが安いかの判断軸も置きました。AI導入支援・DXコンサルタントの方が、お客様への説明にそのまま使える形にしています。
本記事について。モデルサイズ・必要VRAMの数値は、2026年9月19日時点で公開されている WillItRunAI「Qwen 3 GPU Requirements」 の量子化別モデルサイズに基づきます。実行時にはコンテキスト長ぶんのKVキャッシュとオーバーヘッドが1〜2GB上乗せされます。掲載ツール・企業との間にアフィリエイト契約・広告出稿などの利害関係はありません。Qwen は Alibaba Cloud の商標です。
目次
結論:用途 → パラメータ数 → VRAM の順で決める
結論
要約・下書きなら 4B〜8B(VRAM 12GB)。社内文書の検索・回答(RAG)なら 8B〜14B(12〜16GB)。コード生成や精度重視なら 14B〜32B(16〜32GB)。
逆に言うと、用途が決まっていないのに「とりあえず大きいモデルが動くPC」を買うのが一番の無駄です。ローカルLLMが動くかどうかはCPUでもメインメモリでもなく、GPUのVRAM容量でほぼ決まります。パラメータ数と量子化からVRAMが出て、VRAMからGPUが決まり、GPUから本体価格が決まる。この順番を守れば、買い直しは起きません。
もうひとつ先に押さえておきたいのが「量子化」です。同じ14Bのモデルでも、Q4(4ビット)で保存すれば8.3GB、Q8(8ビット)なら15.7GB。同じモデルで必要VRAMが約2倍変わります。Q4は精度がわずかに落ちる代わりに軽く、Q8は元の精度にほぼ近い代わりに重い。実務では「まずQ4で用途が成立するかを試し、精度が足りなければQ8に上げる」のが順当です。
Qwen3 のサイズ別・量子化別 必要VRAM 早見表
Qwen3 は 0.6B から 235B まで8種類のサイズが公開されています。表の数値は量子化ごとのモデルファイルの大きさで、これに実行時の上乗せ(1〜2GB)を足したものが、実際に必要なVRAMです。
| モデル | パラメータ | Q4_K_M | Q5_K_M | Q6_K | Q8_0 | F16 | 1枚で動く目安 |
|---|---|---|---|---|---|---|---|
| Qwen3 0.6B | 0.6B | 0.5GB | 0.6GB | 0.7GB | 0.9GB | 1.3GB | どのGPUでも |
| Qwen3 1.7B | 1.7B | 1.1GB | 1.3GB | 1.5GB | 1.9GB | 3.4GB | どのGPUでも |
| Qwen3 4B | 4B | 2.5GB | 3.0GB | 3.6GB | 4.6GB | 8.0GB | 8GB〜 |
| Qwen3 8B | 8B | 4.6GB | 5.6GB | 6.6GB | 8.5GB | 16.1GB | 8GB(Q4)/12GB(Q8) |
| Qwen3 14B | 14B | 8.3GB | 10.2GB | 12.0GB | 15.7GB | 28.0GB | 12GB(Q4〜Q5)/16GB(Q6〜Q8) |
| Qwen3 30B-A3B | 30B(動作 3B) | 16.8GB | 20.6GB | 24.2GB | 31.6GB | 60.0GB | 24GB(Q4)/32GB(Q8) |
| Qwen3 32B | 32B | 19.1GB | 23.5GB | 27.6GB | 36.1GB | 64.4GB | 24GB(Q4)/32GB(Q6) |
| Qwen3 235B-A22B | 235B(動作 22B) | 131.9GB | 162.2GB | 190.5GB | 249.0GB | 470.0GB | サーバー級GPU複数枚 |
出典:WillItRunAI「Qwen 3 & 3.5 GPU Requirements (2026)」。「1枚で動く目安」は実行時の上乗せ1〜2GBを見込んだ当店の判断です。
「30B-A3B」の読み方
Qwen3 30B-A3B は MoE(Mixture of Experts)型です。総パラメータは30Bですが、1回の推論で実際に動くのは3B分だけ。速さは3B並み、載せるのに必要なVRAMは30B並みという性格です。応答速度を重視する用途では魅力的ですが、VRAMが節約できるわけではないので、表の数値どおり24GB以上を見てください。
用途別:何Bが要るか
ここが本題です。「うちの用途なら何B」を、実務で使われる4つの用途に分けて置きます。
| 用途 | 推奨パラメータ | 量子化 | 必要VRAM | 判断のポイント |
|---|---|---|---|---|
| 要約・議事録・メール下書き | 4B〜8B | Q4〜Q8 | 8〜12GB | 文章の「型」が決まっている作業。4Bでも成立し、8Bで日本語の自然さが安定する。一番安く始められる用途 |
| 社内文書の検索・回答(RAG) | 8B〜14B | Q4〜Q8 | 12〜16GB | 回答の精度は「検索して渡した文書をどれだけ正確に読むか」で決まる。8Bで動くが、14Bで取り違えが目に見えて減る |
| コード生成・レビュー | 14B〜32B | Q4〜Q6 | 16〜32GB | 14Bから実用。32B(Coder系)で長いコードの整合が取れるようになる。ソースを外に出せない開発現場で効く |
| 画像・図面・帳票の読み取り(マルチモーダル) | 8B〜32B(VL系) | Q4〜Q8 | 16GB〜 | 画像を扱うぶんVRAMを多く食う。16GBを下限に、精度が要るなら2枚挿しの32GBへ |
小さいほうから試す理由
大きいモデルは「精度が高い」のではなく「難しいことができる」のです。定型の要約に32Bを使っても、8Bと見分けがつかない結果が返ってきて、待ち時間だけが長くなります。用途が成立する最小のサイズを見つけて、そこに予算を合わせるのが、ローカルLLMでいちばん費用対効果の良い進め方です。試すコストはゼロ(モデルは無料でダウンロードできます)なので、迷ったら小さいほうから順に当ててください。
VRAM別:何が動くか(8/12/16/24/32GB)
GPUの側から逆引きした表です。今あるPCで何ができるか、あるいはどのGPUを買えば目的のモデルが載るかを見るときに使ってください。
| VRAM | 代表的なGPU(中古で手に入るもの) | 快適に動く | ぎりぎり動く | 向く用途 |
|---|---|---|---|---|
| 8GB | RTX 3060 Ti/4060/5060 | 4B(Q8)、8B(Q4) | 8B(Q6) | 要約・下書きの試用 |
| 12GB | RTX 3060 12GB/4070 | 8B(Q8)、14B(Q4) | 14B(Q5) | 要約・RAGの本番。入門機の本命 |
| 16GB | RTX 4060 Ti 16GB/4070 Ti SUPER/4080/5070 Ti | 14B(Q6〜Q8) | —(30B級は載らない) | RAGの精度重視、Qwen3-VL、部署運用 |
| 24GB | RTX 3090/4090、または 12GB×2枚 | 32B(Q4)、30B-A3B(Q4) | 32B(Q5) | コード生成、高精度推論 |
| 32GB | RTX 5090、または 16GB×2枚 | 32B(Q6)、30B-A3B(Q8) | 32B(Q8)は不可(36.1GB) | 複数人同時、応答速度も要る |
境目がはっきり出るのが16GBと24GBの間です。14Bまでは16GBで完結しますが、30B〜32B級は1枚16GBでは載りません。ここを越えたいなら、24GB以上のGPUを1枚買うか、16GBを2枚挿すかの二択になります(後述)。
メインメモリ(RAM)は関係ないのか
VRAMに載りきらない分をメインメモリに逃がして動かすことはできます(CPUオフロード)。ただし速度が桁で落ちます。「動く」ことと「業務で待てる速度」は別なので、メインメモリはVRAMの代わりではなく、モデルの読み込みと前処理のための余裕と考えて、32GB以上を見ておけば十分です。2枚挿しの構成なら64GBが安心です。
クラウドAPI・ローカル・併用、どれが安いか
「ローカルのほうが安い」は条件つきです。使う量と、扱うデータで決まります。
| 観点 | クラウドAPI | ローカルLLM | 併用 |
|---|---|---|---|
| 費用の形 | 従量課金。使った分だけ増える | 本体を一括。以後は電気代のみ | 日常はローカル、難しい問いだけAPI |
| 初期費用 | ほぼゼロ | 本体一式(中古構成で約19万円〜) | 本体一式 |
| データの扱い | 外部に送る。利用規約と社内規程の確認が要る | 社外に出ない | ローカル側で完結する範囲を決める |
| モデルの性能 | 最上位モデルを使える | 手元のVRAMで載る範囲 | 両方の良いところ |
| 速度・制限 | 混雑・レート制限の影響を受ける | 手元で完結。上限なし | — |
| 運用の手間 | 少ない | 更新・バックアップは自社 | 両方 |
| 向いている | 試用、利用量が少ない、最上位の精度が要る | 毎日回す、機密データ、部署で共用 | ほとんどの会社の現実解 |
損益分岐の出し方
細かい単価は毎月変わるので、自社の数字で計算するのが確実です。式はひとつです。
回収月数
ローカルPCの本体価格 ÷ 今APIに払っている月額 = 何か月で元が取れるか
例えば、本体が約30万円で、APIに月3万円払っているなら10か月。月1万円なら30か月。12か月を切るならローカルに寄せる価値があり、24か月を超えるならAPIのままで構いません。利用量がまだ読めない段階なら、まず一番小さい構成(12GB)を1台入れて、実際の利用量を計ってから増やすのが安全です。
もうひとつ、費用と別に効いてくるのがデータの扱いです。見積り、契約書、人事の文書をAPIに投げられるかどうかは、費用計算の前に決まっている会社が多い。ここで「出せない」となるなら、金額に関係なくローカルが答えになります。
動かすためのソフトは3つ覚えればいい
ローカルLLMを動かすソフトはいずれも無料で、選択肢は事実上この3つに収れんしています。
Ollama — 動かす土台
コマンド1行でモデルをダウンロードして起動します。Windows/Mac/Linuxで動き、他のツールの「裏側」としても使われる標準的な実行環境。まずこれを入れます。
LM Studio — 画面で試す
モデルを画面から探して、ダウンロードして、そのままチャットできるGUIアプリ。量子化の違いを見比べながら試すときに便利で、非エンジニアが最初に触るのに向いています。
Open WebUI — 社内に配る
Ollamaの上に載せる、ChatGPTに近い見た目のWeb画面。部署の何人かで同じPCを使うなら、これでブラウザから使えるようにします。文書をアップロードして質問するRAG機能もあります。
導入の順番は「Ollama → 動作確認 → LM Studioで量子化を比較 → Open WebUIで配る」です。ハードが届いてから半日あれば、社内の何人かに触ってもらえる状態まで持っていけます。
24GB以上が要るときの現実解:中古GPUの2枚挿し
32B級を動かすには24GB以上のVRAMが要りますが、24GB以上のGPUを新品で1枚買うと、GPU単体で本体価格の大半を占めます。ここで使えるのが中古の16GBを2枚挿してVRAMを足し算する方法です。
| 観点 | 大容量GPUを1枚 | 中古16GBを2枚 |
|---|---|---|
| 合計VRAM | 24〜32GB | 32GB(16GB×2) |
| 費用 | GPU単体で高額 | 中古2枚で、1枚の新品より安い |
| NVLink | 不要 | 不要。GeForce RTX 40/50世代には端子自体がない。PCIe接続のままソフトが2枚に振り分ける |
| 推論の速度 | 1枚の帯域で決まる | 層を2枚に分けて動く。層をまたぐデータは小さく、カード間の帯域はほぼ効かない |
| 学習(ファインチューニング) | 向く | カード間通信が増えるため不利 |
| 注意点 | — | 2本目のスロットがx4動作でも推論なら問題なし。電源容量とケースの物理スペースは要確認 |
推論だけが目的なら、2枚挿しは実務的に十分な答えです。Ollama、llama.cpp、LM Studio、vLLM はいずれも複数GPUへの分割に対応しています。学習までやる予定があるなら、最初から大容量GPU1枚のほうが後で困りません。「学習をするか」が、この二択の分かれ目です。
導入支援・DXコンサルタントの方へ
お客様にローカルLLMを提案するとき、詰まりやすいのはソフトの話ではなくハードの話です。「結局いくらのPCを何台買えばいいのか」に数字で答えられると、提案が前に進みます。
- この記事の早見表(02・03・04)は、お客様への説明資料にそのままお使いください。出典を添えていただければ転載も構いません
- 構成と見積りは、用途と台数を伺えば当店で組みます。提案書に貼れる形(構成表・PDF)でお出しします
- 納品・請求は貴社経由でも、お客様直接でも対応します。複数台の一括納品、納期の調整も案件ごとに
- 入れ替えで出る旧PCの買取・無料回収・データ消去(証明書つき)まで、同じ窓口で引き受けます
ソフトウェアと業務設計は貴社、動く箱は当店。この分担で組める相手をお探しでしたら、ローカルLLMワークステーションのページから「導入支援・コンサル」の立場を選んでご連絡ください。
導入前チェックリスト
- 用途を1つに絞る(要約/RAG/コード/画像)。複数あるなら一番使う1つから
- 必要なパラメータ数を03の表で決める。小さいほうから
- 量子化はQ4から試す。精度が足りなければQ8へ
- 必要VRAMを02の表+1〜2GBで出す
- 16GBと24GBの境目を越えるかを確認する。越えるなら2枚挿しか大容量1枚か、「学習をするか」で決める
- APIとの損益分岐を自社の数字で出す(本体価格 ÷ 月額)
- データの扱いを先に確認する。外に出せない文書があるなら、費用に関係なくローカル
- 日本語の出力を実際の文書で人が確認する
- まず1台入れて利用量を計り、それから台数を決める
- 旧PCの行き先(買取・回収・データ消去)を同時に決めておく
まとめ
ローカルLLMの機種選びは、性能の比較ではなく用途から逆算する作業です。要約なら4B〜8B、RAGなら8B〜14B、コードや高精度なら14B〜32B。そこからVRAMが決まり、12GB/16GB/2枚挿しの32GBという3段階のどれかに落ちます。
そして、大きいモデルは「精度が高い」のではなく「難しいことができる」だけです。用途が成立する最小のサイズを見つけて、そこに予算を合わせる。試すコストはゼロなので、小さいほうから順に当ててください。
Qwen3が動く構成を、VRAMから逆算して組む
パソツクは中古ゲーミングPC専門店です。用途と台数を伺って、必要なVRAMから構成とお見積りをお出しします。中古GPUの1枚〜2枚挿しで、12GB/16GB/32GBの3段階。1年保証つき。構成例40通りと必要VRAMの早見表は、下のページにまとめています。