
@这很盒里吧:据两位字节员工向『The Information』爆料,在上个月的 Seed 团队全员大会上,张一鸣罕见表态:字节跳动不会把蒸馏当作提升 AI 模型能力的捷径,即便这意味着公司眼下落后于国内竞争对手。
报道称,张一鸣此前很少在 Seed 团队的会议上发言。在其他负责人谈及公司为何不会用蒸馏来抢占先机后,他打破了沉默。
张一鸣表示,字节跳动”应该愿意为更长期的目标牺牲一些短期收益”,但他没有详细说明这些长期目标是什么。
据字节员工称,字节跳动不愿使用蒸馏,被视为其大语言模型落后于国内其他 AI 实验室的原因之一。
字节跳动的特殊之处还在于,它是国内主要 AI 公司中唯一一家大语言模型几乎全部为专有模型的企业,而其同行则专注于开源模型。
据字节跳动员工称,Seed 团队内部关于是否应转向蒸馏的争论由来已久。
今年,国内竞争对手的开源模型快速进步,给字节跳动带来了更大压力。据员工称,每当中国有强大的新开源模型发布,字节跳动内部关于蒸馏的争论就会升温。
蒸馏可以节省大量训练时间和算力开销,因为开发中的新模型可以直接学习现有前沿模型的推理步骤,而不必只依赖原始和精选的训练数据。
@阑夕:多说几句早上那个字节大模型的战略选择不蒸馏路线的话题吧。
The Information把相关原因推测为担心再次出现TikTok那样的地缘危机,属于合情但不合理。
我这么说字节可能也不爱听,就是真要算起账来,跟排在前面的GLM、Kimi、DeepSeek比起来,Seed在美国市场的调用量根本不够看,天塌了也是高个子先碰到头好吗⋯⋯
Z Finance提了一个点,字节Seed内部不只是禁止蒸馏美国的模型,连中国的开源模型也不让蒸,设置了硬检测机制。
国内市场总没有蒸馏禁令吧,说明字节并不是担心TikTok事件重演,纯粹是对技术路线的分歧做了选择,判断蒸馏会干扰自己这边的训练突破,不想被一时的榜单捆住手脚。
很经典的张一鸣延迟满足理论。
再次推荐一下姚顺宇的那期播客,讲了很多关于蒸馏的业内研究,其中一个主要观点是,蒸馏的技术路线存在「知其然而不知其所以然」的代价,能做对题,但未必掌握了正确的解题思路,适合追赶,无法领先。
在我看来,蒸馏是一个中性的手段,或者说属于学习手段之一,而不是唯一,就像同样是背单词,有人用间隔重复法,有人用词缀记忆法,有人用语境阅读法,不必分对错,用结果说话。
再说了,字节能不走蒸馏的路子,如果真的可以长期坚持下来,摸索出独有的训练路径,对于国产模型的大形势也是有好处的,选择越多,就一定主动在我。
