

Kimi发布参数达2.8万亿的K3开源大模型,性能媲美国际顶尖闭源模型,但因算力严重不足被迫暂停新用户接入。其技术突破验证了Scaling Law在中国的持续有效性,也暴露推理经济性短板;国产算力(如华为昇腾)正加速升级以支撑大模型需求,形成中国芯片‘第二场战争’。

作为年度最强开源模型,
在算力不足的情况下,通过算法、工程的优化,叠加参数的扩展,不仅追上前沿闭源模型的性能,打破Scaling Law“撞墙”一说,甚至还引发了一部分硅谷巨头的焦虑与恐慌。
OpenAI战略负责人迪恩·W·鲍尔说:“开源模型会阻碍人工智能领域的进一步资本支出。”
这不难理解,大家都在探索AGI,你来做的话需要10块钱,而别人只需要1块。那么,你就需要论证多出来的9块钱的必要性、合理性。对于年度资本开支7000亿美元的硅谷巨头来说,如果答案是否定的,人工智能产业将迎来一轮史无前例的“泡沫破裂”。
不过,“搅局”的同时,
7月19日晚间,
通知信大意是:热度高、需求超预期、存量算力不够且逼近极限。不得不暂停C端新用户订阅,将已有算力分配给存量用户,直至新算力到位再陆续开放更多订阅名额。
“暂停”增量用户接入与“Token Plan”限售,虽然都源于算力紧缺,但二者略有不同。
过去,国内模型推理算力不够,通过“Token Plan”限售的方式开一个口子提供服务,起码意味着有供给空间,也能够在后续通过API接入转化重度用户。直接“暂停”接入,把增量用户拒之门外,意味着算力供给上没有任何腾挪的空间,可见现阶段
“它自己的算力都没法批量获取,现在这么多用户想用都没法开通付费账户,这严重影响商业变现和用户口碑。”一位资深科技投资人说。
长期关注中国科技产业发展的上海财经大学教授胡延平认为,
关于ROI的问题,胡延平认为只从“算力/token”来看问题,有可能出现用户token消耗越多亏损越大的情况,只有从“算力成本效率/token”来分析,才能看清算力约束的真实涵义。
“类似
“我们已经在非常努力地通过模型性能的优化和算力供给来解决问题。”
以刚刚在2026世界人工智能大会(WAIC)上亮相的华为昇腾Atlas 950超节点为例,仅按64卡机柜100KW功耗上限来换算,不考虑交换等设备,1GW相当于10000个Atlas 950机柜,即640000张NPU。再假设单卡价格是20万元,整个1GW的订单,仅算力部分就将超过1200亿元。
即便考虑国产卡价格差异,按照平均单价10万元算,1GW纯国产算力,也将是一笔超600亿元的算力大单。若消息准确,对国产算力来说将是一个巨大利好。
“从目前披露的信息看,K3暂未呈现出范式级的全新架构。”期智研究院研究员李彪告诉腾讯科技。
KDA和AttnRes此前已有论文,本次更值得关注的是将这些模块与极稀疏MoE、低精度训练和大规模并行系统整合,并扩展到2.8万亿参数。 “由于K3完整技术报告尚未发布,目前仍难以评估其全部技术增量。”李彪补充说。
《
“
他认为,模型规模仍是提升前沿能力的重要变量,但规模能否有效转化为能力,取决于架构、数据配比、优化方法和基础设施的共同配合。“对于2.8万亿参数的极稀疏MoE模型,当前更显性的工程约束来自功耗、通信开销、专家负载均衡和集群可靠性。从其能够支撑2.8万亿参数MoE训练来看,
另一位学术研究员也认同训练过程中Infra、工程能力的重要性,“大家思路都大差不差,归根结底变成软件工程了。”
前述科技投资人告诉腾讯科技,中国公司再一次在较短时间内把开源模型推到接近全球闭源旗舰模型的水平,“我觉得还是非常厉害。它给我的冲击是Scaling Law还在继续;当前最前沿的模型训练配方,中国公司也可以快速掌握。”
如果把上述研究员、有投资人的观点综合到一起,可以归结为:
所以,
当可靠的Scaling Law路径有了,剩下就是找钱的问题。
在一级市场,过去半年
如果时间倒退至2025年12月31日,彼时杨植麟发内部信确认完成了5亿美元的C轮融资。
“当前现金持有量超过100亿元。相比于二级市场,我们判断还可以从一级市场募集更大量资金,事实上,我们B/C轮融资金额就超过绝大部分IPO募资及上市公司的定向增发。所以我们短期不着急上市。”杨植麟在内部信中说。
资料显示,
半年之前,杨植麟判断可以从一级市场拿到更多的钱,这个点后续被时间验证了,但100亿元的现金在7个月之后,在
“
根据Artifacial Analysis的“智能指数”评测,
拆分成单一任务,
单看定价,
不过,对于用户而言,追逐性价比就是追逐更高经济性。放在
他说,如果不考虑量效比,长期竞争会是问题,“某些时间点会出现token不经济”。
胡延平以英伟达为例,强调在H200上,token的ROI下可能是亏的,但升级为B300可能分分秒秒都是“印钞机”。这其实给国产算力提出了一个新的要求,既要给国产模型保证算力供给,也要在硬件层面释放token的经济性。
SemiAnalysis 5月份报告显示,在

高交互负载下,B200 NVFP4 较 H100 FP8 运行Minimax 2.5成本对比
关于国产算力的进化,今年的世界人工智能大会(WAIC)出现了一些比较好的趋势。最典型的就是2025年的华为CloudMatrix 384和2026年的Atlas 950两代超节点的进化——单柜从32卡到64卡,计算密度翻倍;计算柜也从12个增至16个。机柜内部采用高密度铜缆电互联,机柜间采用全光互联,从支持千亿参数模型的训练,扩展至万亿参数模型的低精度训练和混合推理。
这种变化,不去现场看,不做对比,很难直观地感受到差异。
《2026,中国芯片为国产模型“托底”》里提到了国产算力进化背后的一些花絮,其中最具代表性的是国产算力从业者都表现出了不同程度的喜悦、开心,这里面有几个原因:公司上市,很大一部分员工获得了股权激励;同时,市场开始为中国芯片重新定价,逐步放大这种财富效应。
如果说上市是中国芯片的第一场战争,那么接住国产大模型的需求,为其token成本托底,将成为关键的第二战。
本文来自微信公众号“腾讯科技”,作者:苏扬