ローカルAIが遅い・動かないときの対処法|Ollamaでよくあるトラブルと解決策
更新日:2026年10月3日
OllamaでローカルAIを動かしていると、「思ったより遅い」「GPUが使われていない気がする」といったトラブルに出会うことがあります。この記事では、よくある症状と対処法をまとめます。
まず確認:GPUで動いているか
どのトラブルでも、最初にこのコマンドで状況を確認しましょう。モデルを動かしている間に、別のターミナルで入力します。
ollama ps
「PROCESSOR」の欄の見方は次のとおりです(Ollama公式ドキュメントより)。
| 表示 | 状態 |
|---|---|
| 100% GPU | すべてGPUで動いている(理想的) |
| 48%/52% CPU/GPU など | VRAMに入りきらず、一部をメインメモリで動かしている |
| 100% CPU | GPUが使われていない |
症状1:返事がとても遅い
原因A:モデルがVRAMに入りきっていない
ollama ps でCPUの割合が出ている場合は、これが原因です。次のどれかを試してください。
- ひとつ小さいモデルにする(例:27B → 9B)
- 名前に「A3B」などが付いたMoEモデルにする。はみ出しても速度が落ちにくいです。
- ブラウザやゲームなど、GPUを使う他のアプリを閉じる
自分のPCに合うモデルは、ローカルAI動作チェッカーで確認できます。
原因B:コンテキスト長を長くしすぎている
一度に扱える文章の長さ(コンテキスト長)を伸ばすと、その分メモリを使います。設定で長くした場合は、元に戻すと改善することがあります。
上級者向けには、環境変数 OLLAMA_KV_CACHE_TYPE を q8_0 にすると、会話の記憶に使うメモリ(KVキャッシュ)をおよそ半分にできます。ただし、精度がわずかに下がる場合があります。
原因C:最初の1回だけ遅い
Ollamaは、使っていないモデルを5分ほどでメモリから外します。そのため、しばらく時間を空けた後の最初の返事は、モデルを読み込み直す分だけ遅くなります。これは故障ではありません。
症状2:GPUが使われない(100% CPU)
NVIDIAのGPUの場合
- ドライバーを最新にする:Windows版のOllamaは、ドライバー551.61以降が必要です。
- 対応GPUか確認する:Ollamaは「Compute Capability 5.0以上」のNVIDIA GPUに対応しています。RTX 20・30・40・50シリーズはすべて対応しています。
AMDのGPUの場合
Windowsでは、ROCm v7(HIP7)対応のドライバーが必要です。公式ドキュメントでは、RX 7000シリーズなどが対応GPUとして挙げられています。それ以外のRadeonは、Vulkan経由での対応になります。
Macの場合
Apple シリコン(M1〜M5)ならGPUが使われます。Intel MacはCPUのみの動作になるため、GPUは使われません。
症状3:メモリ不足で動かない・すぐ落ちる
モデルが、VRAMとメインメモリを合わせた量より大きいと動きません。
- より小さいモデル、またはQ4量子化のモデルを選ぶ(量子化については量子化とは?を参照)
- メインメモリを増設する。VRAMより安く、大きなMoEモデルを動かせるようになります。
症状4:ダウンロードできない・容量が足りない
モデルは1つ数GB〜数十GBあります。Windowsでは標準でCドライブ(ユーザーフォルダ内の .ollama)に保存されます。容量が足りない場合は、環境変数 OLLAMA_MODELS で保存先を別のドライブに変えられます(詳しくはOllamaの始め方)。
使わなくなったモデルは、ollama rm モデル名 で削除できます。
それでも解決しないとき:ログを確認する
Ollamaは動作の記録(ログ)を残しています。エラーの内容がわかるので、検索や質問のときに役立ちます。
- Windows:エクスプローラーのアドレス欄に
%LOCALAPPDATA%\Ollamaと入力し、server.logを開く - Mac:ターミナルで
cat ~/.ollama/logs/server.log
まとめ
- まずは
ollama psでGPUで動いているか確認 - 遅いときは、モデルを小さくするかMoEモデルにする
- GPUが使われないときは、ドライバーと対応GPUを確認
参考:Ollama公式ドキュメント(トラブルシューティング)、対応GPU、FAQ