知识蒸馏(Knowledge Distillation)是一种将大型复杂模型(教师模型)的知识”压缩”到小型模型(学生模型)中的技术。就像一位经验丰富的教授(教师模型)将毕生所学提炼成精华教给学生(学生模型)一样,知识蒸馏的核心思想不是直接让小模型学习原始训练数据,而是让它学习大模型的”行为模式”和”决策边界”。通过这种方式,学生模型虽然体积更小、推理速度更快、部署成本更低,却能保留大模型绝大部分的性能,通常能达到教师模型95%以上的效果。这使得知识蒸馏成为模型部署和边缘设备上运行AI的关键技术。