RTX 4060 Ti 16GBで動くAIモデルは?おすすめローカルLLMと速度の目安【2026年版】
更新日:2026年10月3日
RTX 4060 Ti 16GBは、VRAM(GPUのメモリ)が16GBあり、手ごろな価格でローカルAIを始めたい人に人気のGPUです。この記事では、このGPUでどのAIモデルが動くのかを、必要メモリと速度の目安つきで紹介します。
結論:おすすめはこの3つ
- gpt-oss 20B:VRAMにぴったり収まり、MoE構造のため速い。総合力が高い
- Qwen3.5 9B:日本語が得意で軽快。普段使いに
- Gemma 4 12B:Google製の中型モデル。余裕を持って動く
動くモデルの一覧
条件:RTX 4060 Ti 16GB、メインメモリ32GB、Q4量子化、コンテキスト8K。数値はローカルAI動作チェッカーによる計算上の目安で、実測値ではありません。
| モデル | 必要メモリ | 速度の目安 | 判定 |
|---|---|---|---|
| gpt-oss 20B | 約14GB | 約53トークン/秒 | 快適 |
| Gemma 4 12B | 約8.7GB | 約23トークン/秒 | 快適 |
| Qwen3.5 9B | 約7.3GB | 約28トークン/秒 | 快適 |
| Gemma 4 E4B | 約7.2GB | 約46トークン/秒 | 快適 |
| Llama 3.1 8B | 約6.5GB | 約37トークン/秒 | 快適 |
| Gemma 4 26B-A4B | 約18GB | 約35トークン/秒 | 一部メインメモリで動く |
| Qwen3.5 / 3.6 35B-A3B | 約24GB | 約32トークン/秒 | 一部メインメモリで動く |
| Qwen3.5 / 3.6 27B | 約17GB | 約9トークン/秒 | 一部メインメモリで動く |
| Gemma 4 31B | 約21GB | 約5.5トークン/秒 | 動くが遅め |
| Llama 3.3 70B | 約43GB | — | 動かない |
1秒あたり10トークン以上出れば、文章を読むのと同じくらいの速さで表示されます。
16GBを超えるモデルも動かせる?
VRAMに収まらないモデルでも、あふれた分をメインメモリに置けば動かせます。ただし、メインメモリはVRAMより遅いため、速度が大きく落ちるのが普通です。
例外がMoE(Mixture of Experts)モデルです。表の「35B-A3B」のように「A○B」と付いたモデルは、全体は大きくても、1回の計算で使うのは一部(35B-A3Bなら約3B分)だけです。そのため、メインメモリにはみ出しても比較的速く動きます。
反対に、Qwen3.5 27BやGemma 4 31Bのような通常のモデル(密モデル)は、はみ出すと急に遅くなります。
RTX 4060 Ti 16GBの注意点
RTX 4060 Ti 16GBは、VRAMが大きい一方で、メモリ帯域(データを読み出す速さ)が288GB/sと控えめです。ローカルAIの速度はメモリ帯域にほぼ比例するため、同じモデルでも、RTX 4070(504GB/s)やRTX 5060 Ti(448GB/s)より遅くなります。
「大きなモデルを載せられること」を重視するならRTX 4060 Ti 16GBは良い選択です。速度を重視するなら、帯域の広いGPUも比較してみてください。
Ollamaのコンテキスト長に注意
OllamaはVRAMが24GB未満のGPUでは、初期設定のコンテキスト長が4Kになっています(公式ドキュメントより)。長い文書を扱いたい場合は設定で長くできますが、その分メモリを使うので、上の表より必要メモリが増えます。
まとめ
RTX 4060 Ti 16GBなら、gpt-oss 20BやQwen3.5 9Bといった実用的なモデルが快適に動きます。MoEモデルを選べば、35B級の大きなモデルにも挑戦できます。
Ollamaの導入方法はOllamaの始め方【Windows版】で解説しています。