站点图标 博海拾贝

天才的洞见,不该撞碎在算力墙上

截屏2026-09-17 09.03.14.webp

大模型竞赛其实是一场看不到尽头的搏杀。

DeepSeek V4、Kimi K3横空出世后,很多人乐观地认为中美大模型差距又被追赶到半年差距,甚至开始盘算下一阶段就是拼电力,优势在我。这才没几天,就忘却了 2025 年 2 月前,那被模型代差巨大支配的日子,那时候可不是“差半年”,是差一个时代。

其实,那一次代差的缩小,太靠几个天才灵光闪现的架构创新,而现在,真实的代差再次被拉大。

9 月 3 日,OpenAI 发布了 GPT-6 Astra。同一周,Anthropic 的 Fable 系列又把 agentic 的上限抬了一截。可能还是有人说,从跑分来看,国产顶尖模型也不比Astra、Fable 差多少啊,成本还更低。

从综合智能指数算,Artificial Analysis 上 K3 是 57.1,在 7 月份时只和Fable 5相差 2.8 分,但现在 Astra是 61分,Fable 5.1 是 66 分,差距再度拉大。另从能力边界来看,FrontierMath Tier 4 上,K3 的准确率只有约 39%,而 OpenAI 和 Anthropic 的前沿模型都超90%。至于 ARC-AGI-3,ARC Prize 官方页面上 K3 、DeepSeek V4 的成绩栏都是空白。

分数体现的是,中国模型在有标准答案、能自动判分、公开数据覆盖得住的赛道表现得还不错,比如 SWE、知识考试。但在真实工作任务、长程工具链以及还没有标准答案的领域,比如带工具的 HLE、computer use、研究级数学、offensive security,美国 SOTA 模型定义了新赛道,这些赛道,中国模型要么缺席,要么差距大到十几个百分点、几百个 Elo。

更难绷的是,仅仅两个月时间, Anthropic 就从 Opus 5 走到 Fable 5.1,OpenAI 就从 GPT-5.6 Sol 走到 GPT-6 Astra,小版本迭代从四个月压缩到两周,不靠架构灵感,全凭算力充裕到可以支撑高频次的完整训练周期。而国产模型就连小版本迭代仍需等上数月。

美国 SOTA 模型领先固然有架构、算法、数据、后训练的先发优势,但更大的优势还是在充沛的算力情况下,可以做超大参数、追求等效智能最大化,而因为算力的硬约束,中国模型不得不另辟蹊径。

所以,谈差距几个月其实没什么意义,只不过把“能力”这个多维度的东西,只取几个指标,硬压成了一个时间差。

时间差这东西,没法做对照实验去验证。真要检验,只有一个办法,那就是冻结比较,也即中国最强的模型,要花几个月才能达到 Astra 今天的水平。

最近,Anthropic CEO Amodei 放话,说前沿模型已经强大到必须放慢能力提升的速度。奥尔特曼、马斯克都点了头。这话听着更像是硅谷精英在抢占道德高地,甚至不排除是想借此拖住对手,为IPO造势。但不管动机是什么,“刹车”从来是领先者的特权,不是追赶者的选项。他们可以喊,我们不能跟。

我绝非是在长他人志气灭自己威风。恰恰相反,看清差距在哪、为什么会有这个差距,才是追赶的前提。把部分跑分接近当成能力接近,把“半年差距”当成理所当然,才是真正的危险。

SOTA 模型定义的是未来生产力,以期涌现新产业、重塑旧产业,不是为了跑分。在未来生产力的赛道上,算力不是背景条件,就是入场券,并且,这张入场券越来越贵。

01

其实,要说算力不足,国产模型只能被迫走性价比路线,也只是说了前半句。

2024 到 2025 年,大模型竞赛最稀缺的是转化效率,那是 DeepSeek 的主场。MLA、FP8、GRPO 这些原创性创新是实打实的,是算力有限的条件下被逼出来的效率创新,同样,也是DeepSeek 团队对大模型是压缩-预测概率生成机制的深刻理解,在数学/应用数学层面,把注意力机制、数值精度、强化学习目标函数都重新拆解过一遍。

那真是天才般的洞见,技术社区讨论热度极高就是证明,后面非议再多也改变不了那些公式、算法的价值,它们已经开源,全球很多模型都往这条路线收敛,DeepSeek 一度拿到了范式定义权,那时候性价比是进攻武器。

但到了 2026 年,攻守再度易形。

黄仁勋在 Astra 发布当周透露,GPT-6 Astra 的预训练用了超过 10 万块英伟达 Grace Blackwell 芯片(NVLink72 架构),是 OpenAI 历史上规模最大的训练任务之一。

可能有人会说,10 万块英伟达 Grace Blackwell 芯片就只提高了这点分数,性价比是不是太低了?

这个质疑恰恰暴露了跑分思维的盲区。分数只是 Astra 的表层产出,“烧掉”10 万块卡不是把综合指数从 59 拉到 61,是趟出了条没有标准答案的赛道。GDPval 考的是真实经济场景里的工作产出;FrontierMath Tier 4 97.6%,考的是研究级数学的原创推理;ARC-AGI-3 在 OpenAI 专用适配框架下报 99.9%,考的是抽象泛化能力。

除了编程、金融分析、科研辅助这些常规用途,还意味着网络攻防战的天平将向有最前沿模型的一方倾斜,作为攻击方能长程自主渗透,作为防守方能实时漏洞挖掘。在芯片设计方面,EDA 拥有工业界最完美的验证器,Synopsys、Cadence、Siemens EDA 三家都转向长程自主 Agent。先有能力,后有应用,谁也不好说在超强能力供给之上,会生长出多少新应用。

而三个独立能力同时提升,既可能是强 harness + 验证器饱和 + 评测定向优化的结果,也可能就是 Open AI 后训练生产线已经找到了通用方法,让 RL 飞轮、AI 训 AI、合成数据在十万卡集群上日夜不停地自我对弈,能在任何有验证器或有人类评的基准上刷到饱和,将基准从能力的数分切换到生产力的报表。

无论哪种可能,前沿模型在预训练和后训练都走上了超大集群、重资本、强互联依赖的路子,训练集群从万卡迈向了十万卡。最前沿模型已经不再单纯追求更高跑分,而在于打造更有生产力的机器。

当然,如果有人就此气馁说,看吧,人家十万卡、数据又多、工程师更顶尖,过去是参数拼不过,现在就更追不上了。

这种投降主义思维要不得。2025 年 2 月之前,中国模型是愁云惨淡,连推理链怎么复现都搞不掂。而现在有 DeepSeekV4、Kimi K3、Qwen 3.8 Max、GLM5.3、Hy4 等等模型,打通了架构设计-预训练-后训练全链条,就更没有理由认为不能趟出新路。

其实,OpenAI、Anthropic也不是拿到了什么天顶星技术,Astra、Fable的成功,不是只有十万卡集群,还有拿十万卡集群做好后训练。

次世代模型能力的边际增量已经越来越来自 RL 飞轮、AI 训 AI、合成数据,这恰恰最吃算力,吃得很凶。OpenAI 的 GPT-Red 一代代接入 RL 训练,Claude Code 和 Codex 让用户付费生产精英轨迹,这些轨迹回炉变成下一代的后训练燃料。

既然方式知晓了,那么解题也就有了抓手。

中国模型在能自动判分的赛道并不差,是因为训练燃料是现成的,题库、测试、公开数据。但现在到了没有标准答案的赛道,燃料得自己造,要么花大价钱请人类专家标注(单条长程数据上千美元),要么用海量算力跑 RL 环境自我对弈。前者中国模型厂还在积累,苦功夫笨功夫,而后者,那就想办法增加算力。

是的,算力约束不仅决定了中国模型训练得起多大的模型,更决定了能造得起多好用的训练燃料。前者决定参数规模,后者决定能力边界。Astra 和 Fable 的发布表明,美国前沿已经把竞赛重心从前者搬到了后者,这是目前中国模型在现有算力预算下结构性够不着的战场。

一年多前,DeepSeek 用惊艳的数学架构将性能墙往前推,用有限的算力制造出不输当时前沿的模型,现在到了重新思考如何突破算力墙的桎梏了。

02

其实,梁文锋也早就意识到这点。

在投资人分享会里,他亲口承认,中美 AI 的差距,主要是算力资源的差距。他算了一笔账,训练一个跟美国同等规模的模型,需要 5 万张 GB300,或者 20 万张华为 950。DeepSeek 当时大概只有 2 万张 H 卡等效算力,大部分还是此前一两个月刚到货的。

他对算力采购的态度是能买多少就买多少,就怕采购的钱花不出去。

注意这组数字的对比:由于囤得早,DeepSeek 是中国所有模型厂里算力条件最好的之一,2 万张 H卡等效。而 OpenAI 单 Astra 一个训练任务就用了 10 万+ 块 Blackwell。这已经不是 2 倍、5 倍的差距了,是数量级的差距。

我们预估 DeepSeek 下代模型,会从注重极致压缩,切换到更注重极致推理。因为效率的边际收益已经收窄,下代模型要往真实工作任务、长程工具链、无标准答案的赛道上走,就必须把重心从压缩-预测的效率端,移到 RL 飞轮、合成数据、精英轨迹回炉,超大参数+后训练,算力更吃紧。

中国和美国的算力差距有多大,按 Bernstein 估算的是 2025 年中国 AI 算力数量大约是美国的 15%,在自主可控算力方面,Epoch AI 则悲观认为华为 2026 年的 AI 算力产量不到英伟达的 4%。

差距是很大,但国产芯片已经做了很多努力,从无到有,中芯 N+2(等效 7nm)是全国唯一能规模量产 AI 芯片的先进制程产线;昇腾 950 超节点在推理性能/价格上已经可以对标 GB200/GB300,寒武纪在部分 workloads 上也站稳了脚跟,等等。目前,国产主流大模型都已经或正在与国产算力集群进行推理适配。

没有半导体产业链的厚积薄发,今日中美算力差距更大。

但与算力需求相比,国产算力产能还是硬约束。按产业链估算,2026 年国产 AI 芯片需求约 420 万颗,中芯供给约 260 万颗,这 260 万颗要分给所有人:华为自己要,寒武纪要,海光要,地平线要,壁仞要,摩尔线程要,阿里平头哥要,全在门口排队。HBM 是另一个瓶颈,国产 HBM 的产能、良品率爬坡决定了封装厂的产出上限,这个瓶颈 2027 年前仍卡得死死。

据估算,2026 年昇腾 950DT 的产量只有“数十万颗”,而 DeepSeek 在内蒙古乌兰察布的部署就签了 16 万颗,履约期至少 18 个月。换句话说,DeepSeek 一家的一笔订单,就吃掉了国产先进芯片全年产量的大头,而这 16 万颗昇腾 950DT,目前主要用于推理,能否用到训练上,还得看新进展。

这不是黑国产芯片,恰恰相反,国产芯片在推理侧已经立住了,推理算力自主可控,能腾出手来攻克训练算力自主,从技术角度,目前缺的是能用于前沿训练的先进算力。

训练对单卡算力密度、互联、软件生态的要求是推理的数倍。950DT 的设计初衷包含训练,但 DeepSeek 选择不拿它训练,原因可能除了算子层面的适配问题,就是 20 万张对 5 万张的换算,加上生态成熟度,训练用国产卡目前等于用 4 倍的卡、跑 2 倍的工程风险。

国产下代模型的预训练算力需求,只会更大。去年国产旗舰模型的参数规模还在一万亿量级,今年已经跳到 2.8 万亿,明年业界预期是3-5 万亿,参数量近乎翻一倍,那预训练所需的算力就不是翻一倍,是翻好几倍,数据规模、通信开销、显存占用、训练稳定性,每一样都跟着膨胀。

如果国产芯片的产能和训练生态要到 18 到 24 个月后才能跟上,那么在此期间,国产下代模型的预训练算力缺口会扩大,等产能到位再补训练,等于把下一代模型冻结在今天的参数规模、性能位阶上,而OpenAI和Anthropic很可能又把赛道往前再推了一个身位,定义了新一代范式。

除了预训练,后训练的算力黑洞也在扩大。如果 Astra 预训练烧了 10 万块卡的算力,后训练的量级大概率不在它之下,甚至更高。预训练是一次性的、可以规划的大规模同步任务,而后训练是常态化、多轮次、低效率的算力吞吐,同样一块卡,跑 RL 的吞吐可能只有跑预训练的几分之一,再加上同一个 prompt 要采样多次、轨迹可能很长、还涉及多轮工具调用,后训练的 GPU 小时消耗自然膨胀。

OpenAI 的 GPT-6 Astra、Anthropic 的 Fable ,全是后训练强化的“怪兽”。两年前,前沿实验室预训练与后训练的算力比大约是 10:1,半年前已经接近 1:1,现在这个比例正在反转。

如果说,训练算力的缺口靠等国产产能爬坡还能勉强算出一个时间表,那么,后训练的算力需求是持续性的,缺口会一直张着,而且越往后越大。

03

模型层的竞赛日新月异,算是回合战,芯片层的战争是持久战,两者本来就不在一个时间尺度上,芯片层是需要数年乃至十几年的积累,不可能毕其功于一役,而模型层迭代的窗口以月计,显然等不了,也等不起。

此前DeepSeek V4 的延期发布就证明了这点。

最近蒸馏事件又闹得沸沸扬扬,无论真假如何,还是暴露同一个问题,那就是:算力不足。

纵使中国模型团队能搭出DSA+MLA+GRPO 、KDA+AttnRes 这样的架构,能能在 KV 缓存压缩和强化学习目标函数上做出世界级的数学洞察,但架构创新解决的是用更少的卡跑出更好的结果,解决不了没有足够的卡去跑足够的次数,不得不外采精英轨迹。

天才的洞见撞上现实的墙,总体上太平洋两岸在半导体、AI 的技术、人才、算力差距客观上是巨大的,也正因为如此,国产模型、芯片从业者非常不容易,差距缩小是建立在极小概率的天才闪光、极苛刻的工程约束、极艰难的路线选择之上,那不是常态。

把差距缩小当成常态,就低估了从业者们有多不容易,把进步当成理所当然,就会忘了这种追赶本身有多么脆弱,它依赖的不仅是努力,还有运气,而运气,不会永远都在。

目前,中国模型厂,基本是走 API 低价路线的:便宜-毛利撑不起轨迹矿和验证器生态-造不出精英训练信号-能力只能在旧赛道收敛。而美国前沿的循环相反:贵-Claude Code/Codex 向精英收费、精英生产高质量轨迹-信号回炉-更强-支撑更高生产力溢价-更强一代模型。

要打破国产模型自我削弱的闭环,就必须建立起模型—应用—信号的正循环,研发下代大参数高性能模型,通过应用获得人类专家标注,有算力去跑 RL 自我对弈,把精英轨迹回炉成下一代模型的燃料。

所以,在等待国产算力上量的同时,卡模应该分开走,齐头并进。

Blackwell 是买不到,那么可以看情况放开引进 H200 ,让模型厂补充训练算力缺口,腾出更多国产算力用于推理,并探索预训练、后训练、推理的国产算力适配。H200 的供给是有可能的、生态是成熟的(CUDA、NCCL、整个训练栈零迁移成本),DeepSeek 现有的 2 万张 H 集群、其他模型厂的算力集群可以直接扩容。对模型厂而言,这是唯一“今天下单、下个月训练”的选项。

乌兰察布的国产卡跑推理,英伟达卡跑训练产能,两者不是对立关系,是分工关系,本质是用现成的算力把下一回合的入场券先攥在手里,给国产芯片争取那 18 到 24 个月的爬坡时间,期间的国产适配尝试正好积累经验。等国产芯片产能到位的那天,模型厂手里既有迭代了下一代模型,也有在乌兰察布上跑出来的国产推理经验,才是真正全栈全量国产化的时候。

不然等国产产能到位再补训练,等于把国产模型的能力基线冻结。因为算力不够,就不是预训练能不能完成、版本能不能快速迭代的问题,是整个架构大概率只能继续往极致压缩上加点,再有数学洞见也只能往效率里挖,产不出更多精英轨迹反哺后训练,后训练缺算力又缺飞轮,没法往能力上追。

这道新高墙不是再用数学/应用数学的新洞见搭起新架构就能翻过去的,从等效能力的维度,就不是“还差多久”的问题。

目前国产模型的护城河、调用份额,很大程度上建立在同等智能、开源、更低价格上,如果美国模型厂在用最前沿模型占据了能力赛道的同时,继续调低次级模型的价格,那么国产模型赖以生存的性价比优势就不再是绝对优势。2026 年夏天已经出现了这个苗头,GPT-5.6 Luna 输入价格降幅 80%,Anthropic 以半价推出 Claude Opus 5。

国产模型性价比的护城河,正在被美国厂商用降价战术一点点侵蚀。侵蚀的速度,不仅取决于美国模型的迭代速度,还取决于国产模型能不能在窗口期内把能力边界推上去。如果推不上去,国产模型就会被双向挤压。

要不要补充 H200不仅是技术问题,更是一个还要不要留在牌桌上的战略问题。它当然不是解药,只是止痛药,它补得了窗口期内的训练缺口,补不了代际差距,更补不了国产训练栈从万卡到十万卡的工程能力。谁也不指望买 20 万颗上一代产品就追平 Blackwell 集群,但这样做的意义,是以时间换空间。

AI是大国博弈的关键,必须得赢,那么确实是要进一步完善算力基础设施,构建多层次网络化算力体系。能否采购到 H200 不只是模型厂的采购决策,放到全国一体化算力网的框架里看,其实是算力底座分层布局的一个节点,算力底座的统筹布局是为更前沿模型铺路的。

毕竟,谁都不想再经历一次 2025 年 2 月前那种全面被碾压的悲观情绪。

来源:翔哥有话要说

退出移动版