量子化とは?Q4とQ8の違いをわかりやすく解説【ローカルAI入門】
更新日:2026年10月3日
ローカルAIのモデルを選んでいると、「Q4_K_M」「Q8_0」「FP16」といった記号をよく見かけます。これは量子化の種類を表しています。この記事では、量子化の意味と選び方をわかりやすく説明します。
量子化とは
AIモデルの中身は、数十億個の数値の集まりです。本来、それぞれの数値は16ビットで記録されていますが、これを4ビットや8ビットのような少ないビット数で表して、サイズを小さくする技術が量子化です。
写真をJPEGで圧縮するようなイメージです。少し画質(精度)は落ちますが、ファイルはずっと小さくなります。
どれくらい小さくなる?
Ollamaで公開されているLlama 3.1 8Bを例に、量子化ごとのファイルサイズを比べてみます(Ollamaライブラリの表示より)。
| 量子化 | 1つの数値のビット数(目安) | ファイルサイズ |
|---|---|---|
| FP16 | 16ビット(無圧縮) | 16GB |
| Q8_0 | 約8ビット | 8.5GB |
| Q6_K | 約6ビット | 6.6GB |
| Q5_K_M | 約5ビット | 5.7GB |
| Q4_K_M | 約4ビット | 4.9GB |
| Q3_K_M | 約3ビット | 4.0GB |
Q4_K_Mなら、無圧縮の約3分の1のサイズになります。モデルはVRAM(GPUのメモリ)に読み込んで動かすため、サイズが小さいほど、少ないVRAMでも動かせます。
記号の読み方
- Q の後の数字:1つの数値に使うビット数の目安です。大きいほど高精度で、サイズも大きくなります。
- K:「K-quant」という方式で、重要な部分に多めのビットを割り当てて、精度の低下を抑えています。
- S / M / L:同じビット数の中での細かさです(Small・Medium・Large)。Mが標準的です。
- FP16 / BF16:量子化していない元の形式です。
- MXFP4:OpenAIのgpt-ossなどで使われている4ビット形式です。
どれを選べばいい?
迷ったらQ4_K_Mを選べば大丈夫です。サイズと精度のバランスが良く、Ollamaでも多くのモデルの標準になっています。
- VRAMに余裕がある:Q8_0にすると精度が少し上がります。ただしサイズは約1.7倍です。
- VRAMがぎりぎり:Q3系にすると小さくなりますが、精度の低下が目立ちやすくなります。小さい量子化の大きなモデルと、Q4の小さなモデルで迷ったら、両方試して比べるのがおすすめです。
速度にも影響する
ローカルAIの速度は、1文字(1トークン)を出すたびにモデル全体をメモリから読み出す速さで決まります。そのため、量子化でサイズが小さくなると、その分速度も上がります。Q4はQ8より、おおよそ1.5〜1.7倍速くなるのが目安です。
まとめ
- 量子化は、AIモデルを圧縮して小さくする技術
- 迷ったらQ4_K_M。VRAMに余裕があればQ8_0
- 小さくするほど少ないVRAMで速く動くが、精度は少しずつ下がる
量子化ごとに自分のPCで動くかどうかは、ローカルAI動作チェッカーの「量子化」を切り替えて確認できます。
自分のPCで動くモデルを調べるなら → ローカルAI動作チェッカー