漫话大模型:7 家中国公司被点名「蒸馏」,他们到底偷走了什么?
2026 年 9 月,Anthropic 发布了一份报告,点名 7 家中国 AI 公司——阿里、DeepSeek、月之暗面、智谱、小米、商汤、MiniMax——指控它们用各种方式"蒸馏"Claude 模型的能力。 报告里列了惊人的数字:阿里被指在 5 到 7 月间产生了 1.5 亿次交互;DeepSeek 被指在 14 天内把 1200 万次用户请求转发给 Claude;月之暗面被指把近 30 万真实用户的问题直接转给 Claude 代答。 当然,这些都是 Anthropic 单方面的指控,被点名的公司大多没有回应。但不管真相如何,有一个技术问题值得搞清楚: "蒸馏"到底是什么?为什么大厂这么怕它?以及,正规的蒸馏是怎么做的? 蒸馏(Distillation)的思路其实特别朴素:让一个小模型,学一个大模型的行为。 大模型很强,但太贵——跑一次要一堆 GPU。小模型便宜,但没那么聪明。怎么办?让大模型当老师,小模型当学生。老师做 100 万道题,把答案(包括思考过程)记下来,学生照着学。 老师模型→生成大量"标准答案"→学生模型→对着答案做监督学习老师模型 \to 生成大量"标准答案" \to 学生模型 \to 对着答案做监督学习老师模型→生成大量"标准答案"→学生模型→对着答案做监督学习 老师的标准答案是"先配方,再求根"。但学生没学会配方,它自己想了一条歪路:"先两边同时乘 x"——这步就错了,后面全错。 问题是:老师的作业本里,从来没有出现过"两边同时乘 x"这个错误。 老师不会做错,所以老师的标准答案里没有这种"错误路径"的教学案例。 学生拿着老师的标准答案训练,只能学到"正确路径长什么样",但一旦自己生成时走偏了,就进入了老师从未示范过的地带——之后生成的所有 token 都越来越歪,一路错到底。 这叫暴露偏差(exposure bias):训练时学生只见过"标准答案",生成时却要面对"自己的错误",这两者的分布完全不同。

