
@阑夕:很多人让我说说一下Anthropic今天发布报告里关于蒸馏指控的部分,行,我尽量讲真话。
蒸馏模型这个事情,分为事实判断和价值判断两个部分。
在事实判断部分,国产模型的态度,基本看不到明确否认的,这个很容易理解,因为它是真的会留下客观证据,从业者没必要为了一份工作,搭上自己一辈子的职业信誉。
主流的解释口径,在于价值判断,就是让教师模型言传身教这件事情本身,作为行业普遍的学习手段,是没问题的,所谓的禁止蒸馏,只不过是公司的用户协议,而无法上升到法律层面。
再说了,前沿模型在训练时,也一定从互联网上抓取了你我的生产内容,你我这样的人,有机会表示拒绝吗?表示了又能怎么样呢?
所以后来,Anthropic也在改变描述,在蒸馏前面加上了「工业级」这个定语,用以和正常合理的蒸馏行为作出区分,但总体上,仍然是用户协议的性质。
既然是用户协议,那就遵循猫鼠游戏的玩法,你可以封号,我也能起号,看谁手更快喽?
而且蒸馏并不是没有害处的,过于依赖蒸馏,就会锁死模型智能的上限,因为学生模型是不可能超过老师模型的,这是物理规律,所以在蒸馏之外,国产模型也在花大力气去做架构创新。
不过Anthropic的报告,倒是意外回答了关于今年7月短暂出现在OpenCode里的DeepSeek神秘灰测模型的都市传说,这个很有意思。
应该还有不少人记得,7月中旬,有人发现在OpenCode里调用DeepSeek的API完成任务时,会偶尔抽到一个能力明显超过V4 Preview的模型,前段效果足以媲美Fable 5。
你们现在去B站限定那段时间搜索,还能看到上百条录屏,全是各种炸裂体,坚信这就是DeepSeek憋的大招,发布出来即可成为中国第一个与Fable 5平起平坐的新模型,也就是大家期待的V4 Pro。
当时技术社区里有人质疑,因为实在和Claude的模型特征太像了,这是不是DeepSeek把一部分请求路由到了Claude完成,还被各种嘲讽:
「什么?你是说梁圣,收了V4 Preview的费率,给我用满血的Fable 5吗?义父!容我一拜!」
结果最简单的直觉反而是真的,因为8月DeepSeek-V4 Pro发布之后,并没有复现灰测模型的能力,甚至一个月不到就被自家的V4.1 Flash给斩杀了⋯⋯
虽然至今还有人对那几天的灰测模型念念不忘,认为这是梁圣在藏,有核弹级的好东西就是不拿出来给大伙用——所以才说已经成了都市传说——Anthropic的报告细节实际上交叉验证了这个说法,大部分蒸馏交互都是在7月份发生的。
这当然不是DeepSeek真的在做慈善,OpenCode是一个编程平台,用户交互的都是真实的高价值任务,在这个过程会产生长程Agent轨迹,非常适合抽取原本被隐藏的思维链,所以贴钱给用户发福利,是有确定回报的。
真正比较危险的,是在Anthropic明牌反华的立场下,还通过第三方中转站来做这样的蒸馏,敏感数据流向Anthropic之后,难保它不会反手交给美国情报部门。
而且中转站掺水也是无法控制的,晚点LatePost前段时间的一期播客就讲到了,有家国产模型在中转站可劲儿的蒸了好久,最后发现海外模型被节省成本的中转站偷偷替换成了自家的模型,相当于一直是在自己蒸自己⋯⋯
[笑cry][笑cry][笑cry]
