博海拾贝 文摘 蒸馏模型这个事情,分为事实判断和价值判断两个部分

蒸馏模型这个事情,分为事实判断和价值判断两个部分

截屏2026-09-11 16.12.06.webp

@阑夕:很多人让我说说一下Anthropic今天发布报告里关于蒸馏指控的部分,行,我尽量讲真话。

蒸馏模型这个事情,分为事实判断和价值判断两个部分。

在事实判断部分,国产模型的态度,基本看不到明确否认的,这个很容易理解,因为它是真的会留下客观证据,从业者没必要为了一份工作,搭上自己一辈子的职业信誉。

主流的解释口径,在于价值判断,就是让教师模型言传身教这件事情本身,作为行业普遍的学习手段,是没问题的,所谓的禁止蒸馏,只不过是公司的用户协议,而无法上升到法律层面。

再说了,前沿模型在训练时,也一定从互联网上抓取了你我的生产内容,你我这样的人,有机会表示拒绝吗?表示了又能怎么样呢?

所以后来,Anthropic也在改变描述,在蒸馏前面加上了「工业级」这个定语,用以和正常合理的蒸馏行为作出区分,但总体上,仍然是用户协议的性质。

既然是用户协议,那就遵循猫鼠游戏的玩法,你可以封号,我也能起号,看谁手更快喽?

而且蒸馏并不是没有害处的,过于依赖蒸馏,就会锁死模型智能的上限,因为学生模型是不可能超过老师模型的,这是物理规律,所以在蒸馏之外,国产模型也在花大力气去做架构创新。

不过Anthropic的报告,倒是意外回答了关于今年7月短暂出现在OpenCode里的DeepSeek神秘灰测模型的都市传说,这个很有意思。

应该还有不少人记得,7月中旬,有人发现在OpenCode里调用DeepSeek的API完成任务时,会偶尔抽到一个能力明显超过V4 Preview的模型,前段效果足以媲美Fable 5。

你们现在去B站限定那段时间搜索,还能看到上百条录屏,全是各种炸裂体,坚信这就是DeepSeek憋的大招,发布出来即可成为中国第一个与Fable 5平起平坐的新模型,也就是大家期待的V4 Pro。

当时技术社区里有人质疑,因为实在和Claude的模型特征太像了,这是不是DeepSeek把一部分请求路由到了Claude完成,还被各种嘲讽:

「什么?你是说梁圣,收了V4 Preview的费率,给我用满血的Fable 5吗?义父!容我一拜!」

结果最简单的直觉反而是真的,因为8月DeepSeek-V4 Pro发布之后,并没有复现灰测模型的能力,甚至一个月不到就被自家的V4.1 Flash给斩杀了⋯⋯

虽然至今还有人对那几天的灰测模型念念不忘,认为这是梁圣在藏,有核弹级的好东西就是不拿出来给大伙用——所以才说已经成了都市传说——Anthropic的报告细节实际上交叉验证了这个说法,大部分蒸馏交互都是在7月份发生的。

这当然不是DeepSeek真的在做慈善,OpenCode是一个编程平台,用户交互的都是真实的高价值任务,在这个过程会产生长程Agent轨迹,非常适合抽取原本被隐藏的思维链,所以贴钱给用户发福利,是有确定回报的。

真正比较危险的,是在Anthropic明牌反华的立场下,还通过第三方中转站来做这样的蒸馏,敏感数据流向Anthropic之后,难保它不会反手交给美国情报部门。

而且中转站掺水也是无法控制的,晚点LatePost前段时间的一期播客就讲到了,有家国产模型在中转站可劲儿的蒸了好久,最后发现海外模型被节省成本的中转站偷偷替换成了自家的模型,相当于一直是在自己蒸自己⋯⋯

[笑cry][笑cry][笑cry]

本文来自网络,不代表博海拾贝立场,转载请注明出处:https://www.bohaishibei.com/post/112715/
关注微信
微信扫一扫关注我们

微信扫一扫关注我们

关注微博
Telegram
返回顶部