トップ › 解説記事

量子化とは?Q4とQ8の違いをわかりやすく解説【ローカルAI入門】

更新日:2026年10月3日

ローカルAIのモデルを選んでいると、「Q4_K_M」「Q8_0」「FP16」といった記号をよく見かけます。これは量子化の種類を表しています。この記事では、量子化の意味と選び方をわかりやすく説明します。

量子化とは

AIモデルの中身は、数十億個の数値の集まりです。本来、それぞれの数値は16ビットで記録されていますが、これを4ビットや8ビットのような少ないビット数で表して、サイズを小さくする技術が量子化です。

写真をJPEGで圧縮するようなイメージです。少し画質(精度)は落ちますが、ファイルはずっと小さくなります。

どれくらい小さくなる?

Ollamaで公開されているLlama 3.1 8Bを例に、量子化ごとのファイルサイズを比べてみます(Ollamaライブラリの表示より)。

量子化1つの数値のビット数(目安)ファイルサイズ
FP1616ビット(無圧縮)16GB
Q8_0約8ビット8.5GB
Q6_K約6ビット6.6GB
Q5_K_M約5ビット5.7GB
Q4_K_M約4ビット4.9GB
Q3_K_M約3ビット4.0GB

Q4_K_Mなら、無圧縮の約3分の1のサイズになります。モデルはVRAM(GPUのメモリ)に読み込んで動かすため、サイズが小さいほど、少ないVRAMでも動かせます。

記号の読み方

どれを選べばいい?

迷ったらQ4_K_Mを選べば大丈夫です。サイズと精度のバランスが良く、Ollamaでも多くのモデルの標準になっています。

速度にも影響する

ローカルAIの速度は、1文字(1トークン)を出すたびにモデル全体をメモリから読み出す速さで決まります。そのため、量子化でサイズが小さくなると、その分速度も上がります。Q4はQ8より、おおよそ1.5〜1.7倍速くなるのが目安です。

まとめ

量子化ごとに自分のPCで動くかどうかは、ローカルAI動作チェッカーの「量子化」を切り替えて確認できます。

自分のPCで動くモデルを調べるなら → ローカルAI動作チェッカー