MacでローカルAIを動かす方法|Apple シリコンのメモリ別おすすめモデル【2026年版】
更新日:2026年10月3日
Apple シリコン(M1〜M5)を搭載したMacは、実はローカルAIにとても向いています。この記事では、MacでAIを動かす方法と、メモリ容量別のおすすめモデルを紹介します。
MacがローカルAIに向いている理由
Apple シリコンのMacは、メインメモリをCPUとGPUで共有する仕組み(ユニファイドメモリ)になっています。WindowsのPCではGPUのVRAMが8〜16GB程度のことが多いのに対し、Macならメモリ48GBや64GBの機種で、その大部分をAIに使えます。
ただし、メモリをすべてGPUに使えるわけではありません。当サイトのチェッカーでは、搭載メモリの約7割をAIに使える目安として計算しています。
必要な環境
Ollamaの公式ドキュメントによると、Mac版の動作条件は次のとおりです。
- macOS Sonoma(14)以降
- Apple シリコン(M1〜M5):CPUとGPUの両方で動作
- Intel Mac:CPUのみで動作(GPUは使われないため遅い)
インストール手順
- Ollamaの公式サイトからMac版をダウンロードします。
- ダウンロードしたファイルを開き、Ollamaのアイコンを「アプリケーション」フォルダにドラッグします。
- Ollamaを起動すると、ターミナルで
ollamaコマンドを使えるようにする設定を案内してくれます。 - 「ターミナル」を開き、
ollama run gemma4:e2bと入力すると、モデルのダウンロードと会話が始まります。
モデルは ~/.ollama に保存されます。1つ数GB〜数十GBあるので、ストレージの空きに注意してください。
メモリ別のおすすめモデル
条件:Q4量子化、コンテキスト8K。数値はローカルAI動作チェッカーによる計算上の目安です。
メモリ16GB(M4など)
| モデル | 必要メモリ | 速度の目安 |
|---|---|---|
| Qwen3.5 9B | 約7.3GB | 約12トークン/秒 |
| Gemma 4 E4B | 約7.2GB | 約20トークン/秒 |
| Gemma 4 12B | 約8.7GB | 約10トークン/秒 |
9Bクラスまでが目安です。gpt-oss 20B(約14GB)は、16GBのMacでは入りきりません。
メモリ24GB(M4 Proなど)
| モデル | 必要メモリ | 速度の目安 |
|---|---|---|
| gpt-oss 20B | 約14GB | 約51トークン/秒 |
| Gemma 4 12B | 約8.7GB | 約22トークン/秒 |
| Qwen3.5 9B | 約7.3GB | 約27トークン/秒 |
メモリ48GB(M4 Proなど)
| モデル | 必要メモリ | 速度の目安 |
|---|---|---|
| Qwen3.5 / 3.6 35B-A3B | 約24GB | 約58トークン/秒 |
| Gemma 4 26B-A4B | 約18GB | 約45トークン/秒 |
| Qwen3.5 / 3.6 27B | 約17GB | 約11トークン/秒 |
メモリ64GB(M4 Maxなど)
| モデル | 必要メモリ | 速度の目安 |
|---|---|---|
| Qwen3.5 / 3.6 35B-A3B | 約24GB | 約104トークン/秒 |
| Qwen3.5 / 3.6 27B | 約17GB | 約21トークン/秒 |
| Llama 3.3 70B | 約43GB | 約8.5トークン/秒 |
同じメモリ量でもチップで速さが変わる
ローカルAIの速度は、メモリの「帯域」(データを読み出す速さ)でほぼ決まります。無印のM4は120GB/s、M4 Proは273GB/s、M4 Max(上位版)は546GB/sです。同じモデルでも、Maxは無印の4倍以上速く動く計算になります。
これからMacを買うなら、メモリ容量(どのモデルを動かせるか)とチップの種類(どれくらい速いか)の両方を見て選ぶのがおすすめです。
まとめ
- Apple シリコンのMacは、メモリの大部分をAIに使えるためローカルAIに向いている
- 16GBなら9Bクラス、24GBならgpt-oss 20B、48GB以上なら35B級のMoEモデルが快適
- 速さはチップのメモリ帯域で決まる(無印<Pro<Max)
お使いのMacで動くモデルは、チェッカーの「Mac(Apple シリコン)」から確認できます。
自分のPCで動くモデルを調べるなら → ローカルAI動作チェッカー