トップ › 解説記事

ローカルAIが遅い・動かないときの対処法|Ollamaでよくあるトラブルと解決策

更新日:2026年10月3日

OllamaでローカルAIを動かしていると、「思ったより遅い」「GPUが使われていない気がする」といったトラブルに出会うことがあります。この記事では、よくある症状と対処法をまとめます。

まず確認:GPUで動いているか

どのトラブルでも、最初にこのコマンドで状況を確認しましょう。モデルを動かしている間に、別のターミナルで入力します。

ollama ps

「PROCESSOR」の欄の見方は次のとおりです(Ollama公式ドキュメントより)。

表示状態
100% GPUすべてGPUで動いている(理想的)
48%/52% CPU/GPU などVRAMに入りきらず、一部をメインメモリで動かしている
100% CPUGPUが使われていない

症状1:返事がとても遅い

原因A:モデルがVRAMに入りきっていない

ollama ps でCPUの割合が出ている場合は、これが原因です。次のどれかを試してください。

自分のPCに合うモデルは、ローカルAI動作チェッカーで確認できます。

原因B:コンテキスト長を長くしすぎている

一度に扱える文章の長さ(コンテキスト長)を伸ばすと、その分メモリを使います。設定で長くした場合は、元に戻すと改善することがあります。

上級者向けには、環境変数 OLLAMA_KV_CACHE_TYPE を q8_0 にすると、会話の記憶に使うメモリ(KVキャッシュ)をおよそ半分にできます。ただし、精度がわずかに下がる場合があります。

原因C:最初の1回だけ遅い

Ollamaは、使っていないモデルを5分ほどでメモリから外します。そのため、しばらく時間を空けた後の最初の返事は、モデルを読み込み直す分だけ遅くなります。これは故障ではありません。

症状2:GPUが使われない(100% CPU)

NVIDIAのGPUの場合

AMDのGPUの場合

Windowsでは、ROCm v7(HIP7)対応のドライバーが必要です。公式ドキュメントでは、RX 7000シリーズなどが対応GPUとして挙げられています。それ以外のRadeonは、Vulkan経由での対応になります。

Macの場合

Apple シリコン(M1〜M5)ならGPUが使われます。Intel MacはCPUのみの動作になるため、GPUは使われません。

症状3:メモリ不足で動かない・すぐ落ちる

モデルが、VRAMとメインメモリを合わせた量より大きいと動きません。

症状4:ダウンロードできない・容量が足りない

モデルは1つ数GB〜数十GBあります。Windowsでは標準でCドライブ(ユーザーフォルダ内の .ollama)に保存されます。容量が足りない場合は、環境変数 OLLAMA_MODELS で保存先を別のドライブに変えられます(詳しくはOllamaの始め方)。

使わなくなったモデルは、ollama rm モデル名 で削除できます。

それでも解決しないとき:ログを確認する

Ollamaは動作の記録(ログ)を残しています。エラーの内容がわかるので、検索や質問のときに役立ちます。

まとめ

参考:Ollama公式ドキュメント(トラブルシューティング)、対応GPU、FAQ

自分のPCで動くモデルを調べるなら → ローカルAI動作チェッカー