标签: 知识蒸馏

0

把 140GB 模型塞进一张显卡:量化、剪枝与知识蒸馏如何取舍

一个 700 亿参数模型若用 FP16 保存,仅权重就约 140GB,尚未计算 KV Cache、激活和运行时缓冲。消费级显卡通常只有 24GB 或 48GB 显存,模型压缩因此成为本地推理和边缘部署的基础技术。量化减少每个数值的位宽,剪枝移除不重要的连接或结构,知识蒸馏则训练一个较小模型模仿教师。三者可以组合,却优化不同问题:文件更小不一定运行更快,零权重不一定节省计算,学生模型相似也不代表保留全部推理能力。