トップ › 解説記事

RTX 4060 Ti 16GBで動くAIモデルは?おすすめローカルLLMと速度の目安【2026年版】

更新日:2026年10月3日

RTX 4060 Ti 16GBは、VRAM(GPUのメモリ)が16GBあり、手ごろな価格でローカルAIを始めたい人に人気のGPUです。この記事では、このGPUでどのAIモデルが動くのかを、必要メモリと速度の目安つきで紹介します。

結論:おすすめはこの3つ

動くモデルの一覧

条件:RTX 4060 Ti 16GB、メインメモリ32GB、Q4量子化、コンテキスト8K。数値はローカルAI動作チェッカーによる計算上の目安で、実測値ではありません。

モデル必要メモリ速度の目安判定
gpt-oss 20B約14GB約53トークン/秒快適
Gemma 4 12B約8.7GB約23トークン/秒快適
Qwen3.5 9B約7.3GB約28トークン/秒快適
Gemma 4 E4B約7.2GB約46トークン/秒快適
Llama 3.1 8B約6.5GB約37トークン/秒快適
Gemma 4 26B-A4B約18GB約35トークン/秒一部メインメモリで動く
Qwen3.5 / 3.6 35B-A3B約24GB約32トークン/秒一部メインメモリで動く
Qwen3.5 / 3.6 27B約17GB約9トークン/秒一部メインメモリで動く
Gemma 4 31B約21GB約5.5トークン/秒動くが遅め
Llama 3.3 70B約43GB—動かない

1秒あたり10トークン以上出れば、文章を読むのと同じくらいの速さで表示されます。

16GBを超えるモデルも動かせる?

VRAMに収まらないモデルでも、あふれた分をメインメモリに置けば動かせます。ただし、メインメモリはVRAMより遅いため、速度が大きく落ちるのが普通です。

例外がMoE(Mixture of Experts)モデルです。表の「35B-A3B」のように「A○B」と付いたモデルは、全体は大きくても、1回の計算で使うのは一部(35B-A3Bなら約3B分)だけです。そのため、メインメモリにはみ出しても比較的速く動きます。

反対に、Qwen3.5 27BやGemma 4 31Bのような通常のモデル(密モデル)は、はみ出すと急に遅くなります。

RTX 4060 Ti 16GBの注意点

RTX 4060 Ti 16GBは、VRAMが大きい一方で、メモリ帯域(データを読み出す速さ)が288GB/sと控えめです。ローカルAIの速度はメモリ帯域にほぼ比例するため、同じモデルでも、RTX 4070(504GB/s)やRTX 5060 Ti(448GB/s)より遅くなります。

「大きなモデルを載せられること」を重視するならRTX 4060 Ti 16GBは良い選択です。速度を重視するなら、帯域の広いGPUも比較してみてください。

Ollamaのコンテキスト長に注意

OllamaはVRAMが24GB未満のGPUでは、初期設定のコンテキスト長が4Kになっています(公式ドキュメントより)。長い文書を扱いたい場合は設定で長くできますが、その分メモリを使うので、上の表より必要メモリが増えます。

まとめ

RTX 4060 Ti 16GBなら、gpt-oss 20BやQwen3.5 9Bといった実用的なモデルが快適に動きます。MoEモデルを選べば、35B級の大きなモデルにも挑戦できます。

Ollamaの導入方法はOllamaの始め方【Windows版】で解説しています。

自分のPCで動くモデルを調べるなら → ローカルAI動作チェッカー