VRAM 8GBで動くAIモデルは?RTX 4060・3070などのおすすめローカルLLM【2026年版】
更新日:2026年10月3日
RTX 4060、RTX 3070、RTX 3060 Ti、RTX 5060など、VRAM(GPUのメモリ)が8GBのGPUはとても多く使われています。この記事では、VRAM 8GBでどのAIモデルが動くのかを紹介します。
結論:8GBなら「9Bクラス」までが快適
- Qwen3.5 9B:日本語が得意で、8GBに収まる中では最も賢い部類
- Gemma 4 E4B:軽くて速い。ノートPCにも
- gpt-oss 20B:VRAMからはみ出しますが、MoE構造のため実用的な速さで動きます(メインメモリ16GB以上)
動くモデルの一覧(RTX 4060の場合)
条件:RTX 4060(8GB)、Q4量子化、コンテキスト8K。数値はローカルAI動作チェッカーによる計算上の目安です。
| モデル | 必要メモリ | 速度の目安 | 判定 |
|---|---|---|---|
| Qwen3.5 9B | 約7.3GB | 約26トークン/秒 | 快適 |
| Gemma 4 E4B | 約7.2GB | 約44トークン/秒 | 快適 |
| Llama 3.1 8B | 約6.5GB | 約35トークン/秒 | 快適 |
| Gemma 4 E2B | 約5.3GB | 約72トークン/秒 | 快適 |
| Qwen3.5 4B | 約4.4GB | 約49トークン/秒 | 快適 |
| gpt-oss 20B | 約14GB | 約23トークン/秒 | 一部メインメモリで動く |
| Gemma 4 12B | 約8.7GB | 約17トークン/秒 | 一部メインメモリで動く |
| Gemma 4 26B-A4B | 約18GB | 約17トークン/秒 | 一部メインメモリで動く |
| Qwen3.5 27B | 約17GB | 約4トークン/秒 | 動くが遅め |
RTX 3070やRTX 3060 Ti、RTX 5060はメモリ帯域が448GB/sあり、RTX 4060(272GB/s)より速く動きます。速さの比較はチェッカーでGPUを切り替えて確認できます。
メインメモリ16GBと32GBでの違い
VRAM 8GBのPCでは、メインメモリの量が「動かせるモデルの上限」を左右します。VRAMに入りきらない分をメインメモリに置くためです。
- メインメモリ16GB:gpt-oss 20BやGemma 4 26B-A4Bまで。Qwen3.5 35B-A3Bは入りきりません。
- メインメモリ32GB:Qwen3.5 35B-A3BなどのMoEモデルも、約20トークン/秒で動かせる計算です。
VRAMを増やすにはGPUを買い替える必要がありますが、メインメモリの増設は比較的安く済みます。大きなモデルを試したい場合は、メモリ増設も選択肢です。
8GBで使うときの注意点
- ぎりぎりのモデルは動かないことがある:Windowsの画面表示やブラウザもVRAMを0.5〜1GBほど使います。Qwen3.5 9B(約7.3GB)のようにぎりぎりのモデルは、他のアプリを閉じてから使うと安定します。
- GPUで動いているか確認する:
ollama psで「100% GPU」と表示されれば、すべてGPUで動いています。 - コンテキスト長を伸ばしすぎない:長い文章を扱う設定にすると、その分メモリが必要になります。
まとめ
VRAM 8GBでも、Qwen3.5 9BやGemma 4 E4Bといった実用的なモデルが快適に動きます。メインメモリが32GBあれば、MoEモデルで35B級にも挑戦できます。
はじめての方はOllamaの始め方【Windows版】からどうぞ。
自分のPCで動くモデルを調べるなら → ローカルAI動作チェッカー