量化基础:INT8/INT4/FP8


一句话总结

量化将模型权重和/或激活值从高精度(FP16/BF16)转换为低精度(INT8/INT4/FP8)表示,以减少显存占用和加速计算。

核心概念

量化分类:按时机分——训练后量化(PTQ)直接转换已训练模型,量化感知训练(QAT)在训练中模拟量化误差。按对象分——仅权重量化(Weight-only)和权重+激活量化(W+A)。常见精度:INT8(8位整数)将模型减半,适合大部分场景;INT4(4位整数)将模型压缩到1/4,质量有一定损失;FP8(8位浮点,H100原生支持)兼顾范围和精度。量化公式:xq = round(x/scale) + zero_point。

为什么重要

一个70B的FP16模型需要140GB显存,INT4量化后仅需35GB,可以在单张消费级GPU上运行。量化是让大模型普惠化的最直接手段。INT8量化几乎不影响模型质量,是生产部署的标配。

实践要点

优先尝试INT8量化,质量损失通常可忽略;INT4量化需要选择合适的算法(GPTQ/AWQ)以最小化精度损失;注意校准数据集的选择会影响PTQ质量;关注异常值(outlier)通道,它们是量化精度损失的主因。

常见误区

误区一:量化只是简单的四舍五入——实际需要复杂的校准和误差最小化策略。误区二:INT4量化一定比INT8快——需要硬件支持INT4计算核心才能实际加速。