蒸馏后学生模型更差?问题出在教师太自信
把大模型蒸馏成小模型,结果学生比老师还差——这个现象在工程里并不少见。原因不在学生学得不够努力,而在它学错了对象。 学生学到的是"过度自信" 常规蒸馏的做法,是让学生去模仿教师输出的那一个最高概率答案。但原文指出,教师给出的往往是过度自信的、接近独热(one-hot)的输出,而不是背后真正的概率分布。 学生照单全收,学到的就是这种"笃定"的姿态。 两个后果同时发生 原文把这种失败描述得很直接:学生模型既能力更弱,又更自信地犯错。也就是说,它不只是答得差,还答得理直气壮。 能力下降:没有学到教师真正的判断依据 自信上升:继承了教师被压缩后的确定性表达 问题的根源,是蒸馏过程中丢失了概率分布这一层信息。学生模仿的是结果,不是教师做判断时的完整依据。 为什么这件事值得注意 蒸馏本意是用更小的成本换接近的效果。但如果目标只是复刻那个最可能的答案,学生拿到的就是一个被削平了信息的教师,能力与校准度同时受损。 原文给出的判断是:朴素蒸馏经常失败,原因正在于此。 特别
发表评论