判定の見方
| 表示 | 意味 |
|---|---|
| 快適 | モデル全体がGPUのメモリ(VRAM)に収まり、毎秒8トークン以上の速さで動きます。 |
| 動く(一部メインメモリ) | VRAMに収まらず一部をメインメモリに置きますが、MoEモデルなどで実用的な速さが出ます。 |
| 動くが遅め | 動きますが、毎秒8トークン未満で、文章が出るのを待つ感覚になります。 |
| 動かない | VRAMとメインメモリを合わせても足りません。 |
よくある質問
VRAMとは何ですか?
GPUに付いている専用のメモリです。ローカルAIはモデルのデータをVRAMに読み込んで計算するため、VRAMの大きさで動かせるモデルの大きさがほぼ決まります。
量子化とは何ですか?
モデルの数値を少ないビット数で表して、サイズを小さくする技術です。Q4_K_M(約4ビット)なら、元のサイズの約3分の1になり、精度の低下もわずかです。迷ったらQ4_K_Mを選んでください。
「MoE」とは何ですか?
Mixture of Experts(専門家の混合)の略で、モデル全体のうち一部だけを使って計算する仕組みです。たとえば「35B(実働3B)」なら、サイズは35B分必要ですが、速さは3Bモデルに近くなります。VRAMに収まらなくても、メインメモリを使って実用的な速度で動きやすいのが特徴です。
MacでもローカルAIは動きますか?
動きます。Apple シリコンのMacは、メインメモリをGPUと共有する仕組みのため、メモリの約7割をVRAMとして使えます。メモリの多いMacは、大きなモデルを動かすのに向いています。
GPUがなくても動きますか?
小さいモデル(数B程度)なら、CPUだけでも動きます。ただし速度はGPUよりかなり遅くなります。
どうやって始めればいいですか?
無料のソフト「Ollama」をインストールし、一覧に表示されているコマンドをターミナル(Windowsならコマンドプロンプト)に貼り付けるだけで始められます。