トップ › 解説記事

VRAM 8GBで動くAIモデルは?RTX 4060・3070などのおすすめローカルLLM【2026年版】

更新日:2026年10月3日

RTX 4060、RTX 3070、RTX 3060 Ti、RTX 5060など、VRAM(GPUのメモリ)が8GBのGPUはとても多く使われています。この記事では、VRAM 8GBでどのAIモデルが動くのかを紹介します。

結論:8GBなら「9Bクラス」までが快適

動くモデルの一覧(RTX 4060の場合)

条件:RTX 4060(8GB)、Q4量子化、コンテキスト8K。数値はローカルAI動作チェッカーによる計算上の目安です。

モデル必要メモリ速度の目安判定
Qwen3.5 9B約7.3GB約26トークン/秒快適
Gemma 4 E4B約7.2GB約44トークン/秒快適
Llama 3.1 8B約6.5GB約35トークン/秒快適
Gemma 4 E2B約5.3GB約72トークン/秒快適
Qwen3.5 4B約4.4GB約49トークン/秒快適
gpt-oss 20B約14GB約23トークン/秒一部メインメモリで動く
Gemma 4 12B約8.7GB約17トークン/秒一部メインメモリで動く
Gemma 4 26B-A4B約18GB約17トークン/秒一部メインメモリで動く
Qwen3.5 27B約17GB約4トークン/秒動くが遅め

RTX 3070やRTX 3060 Ti、RTX 5060はメモリ帯域が448GB/sあり、RTX 4060(272GB/s)より速く動きます。速さの比較はチェッカーでGPUを切り替えて確認できます。

メインメモリ16GBと32GBでの違い

VRAM 8GBのPCでは、メインメモリの量が「動かせるモデルの上限」を左右します。VRAMに入りきらない分をメインメモリに置くためです。

VRAMを増やすにはGPUを買い替える必要がありますが、メインメモリの増設は比較的安く済みます。大きなモデルを試したい場合は、メモリ増設も選択肢です。

8GBで使うときの注意点

まとめ

VRAM 8GBでも、Qwen3.5 9BやGemma 4 E4Bといった実用的なモデルが快適に動きます。メインメモリが32GBあれば、MoEモデルで35B級にも挑戦できます。

はじめての方はOllamaの始め方【Windows版】からどうぞ。

自分のPCで動くモデルを調べるなら → ローカルAI動作チェッカー