275
1
847
超级版主
导语 现在很多端侧AI、本地离线大模型,对外宣称“大模型能力,小模型体积,手机/消费级GPU即可运行”,背后大量用到**知识蒸馏(模型蒸馏)**技术。很多开发者容易把蒸馏和量化、剪枝混为一谈:量化、剪枝是改造原有大模型;蒸馏是师生知识迁移,训练一个全新轻量化学生模型,让小模型学到大模型的判断逻辑与“暗知识”。本文通俗讲解师生架构、软标签、温度系数、损失函数,拆解完整蒸馏流程,对比剪枝、量化,梳理LLM业务场景、调参经验与常见踩坑。 通俗师徒类比:知识蒸馏就像资深老师傅(教师大模型),不直接把全套工具硬件交给学徒,而是传授自己多年积累的判断经验、思考习惯。学徒(学生小模型)规模更小,但可以复刻老师傅大部分的决策能力。
通俗师徒类比:知识蒸馏就像资深老师傅(教师大模型),不直接把全套工具硬件交给学徒,而是传授自己多年积累的判断经验、思考习惯。学徒(学生小模型)规模更小,但可以复刻老师傅大部分的决策能力。
关键区分蒸馏 vs 剪枝 / 量化 技术核心思路对象特点知识蒸馏知识迁移,训练全新小模型生成新模型学习教师软标签暗知识,复刻思考逻辑剪枝Pruning剔除原有模型权重中不重要参数改造原有模型模型架构不变,删掉部分权重连接量化Quantization降低权重数值比特位数改造原有模型压缩存储与推理算力,模型结构不变
软标签不仅仅标记谁是正确答案,还暴露教师眼中各个类别之间的相似程度:猫和狗相似度远高于猫和沙发。这些类别关系就被称为暗知识,是蒸馏最核心的宝藏。
工程经验,蒸馏训练T一般取3‑10之间,T过大分布全部趋于平均,知识被抹平;T接近1等价于退化成硬标签训练,失去蒸馏价值。
伪代码示意
大语言模型蒸馏还衍生中间层蒸馏:除输出logits,还让学生拟合教师Transformer每一层隐藏状态,进一步提升迁移效果。
⚠️边界提醒:蒸馏不能无中生有。学生模型能力上限受自身参数量约束,学生不可能全方位超过教师;只能逼近教师在训练数据集覆盖范围内的表现。
举报
本版积分规则 发表回复 回帖后跳转到最后一页
相关侵权、举报、投诉及建议等,请发 E-mail:2026@typc.net
Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|晋ICP备2026008270号-1|晋公网安备14010602111293号