Kimi K3爆火GPU资源紧张引发热议

来源:时代一线 分类:科技
Kimi K3爆火GPU资源紧张引发热议

先前关闭自动续费功能的老用户,公司将慢慢重启续订的选择权,同时老用户升级服务等级的通道也将逐步开启。关于新推出的套餐,暂时因为计算能力不够用,还不能对外售卖,具体的恢复购买时间还定不下来。

从公司公开的说明来看,这次的风波更像是希望在有限的计算资源下,重新分配给新加入的和一直使用的用户,并不是在改动会员制度。

K3公布之后,全球的AI开发者很快有很多关于它的使用体验和评测文章。不少人把它拿来和Claude、GPT这些国外的顶尖模型对比,讨论的焦点慢慢从各项基准测试成绩,转向了它们的推理成本、GPU资源以及服务稳定性,成了AI圈新的热门话题。

K3发布后,迅速成为了全球AI模型讨论的中心。

независимый AI模型评测机构Artificial Analysis发布的最新“智能指数(Intelligence Index)”里面,Kimi K3综合得分是57分,在全球排在第三位,仅次于Claude Fable 5(60分)和GPT-5.6 Sol(59分),稍微超过Claude Opus 4.8(56分)。

同时,K3完成每项任务的平均成本是0.94美元,和GPT-5.6 Sol差不多,但只相当于Claude Opus 4.8的一半。

对于行业里的人来说,更重要的消息是,这是首个进入Artificial Analysis综合榜单前三的开源模型。长时间以来,“开源模型总是比闭源模型落后半代”是业内的一种共识,而K3的出现,让这个差距缩小了许多。

图源:Monolith励思资本

除了排名高的成绩,K3本身的参数数量也引起了业内的注意。K3是月之暗面推出的首款拥有2.8万亿参数的MoE模型。

一位国产AI芯片企业的人士对界面新闻报道说,今年开始,随着Anthropic这些海外公司不断推出更大参数的模型,国内模型的竞争又回到了“大参数、长上下文”这个老赛道上,万亿参数、百万级的上下文正成了顶尖模型的重要竞争方向。

在他看来,K3之所以很快走红,不仅因为它模型能力不错,还因为它代表国产开源模型首次达到了这个参数量级。“对整个行业来说,2.8T本身就是一个很有影响力的信号。”

业内的高度关注很快就传到了开发者群体那里。

在X(Twitter)、Reddit、OpenRouter、Linux.do、V2EX这些平台上,很多开发者立刻分享了他们的使用体验,不少人把K3连接到Cursor、Cline、OpenCode这些AI编程工具里去测试。从生成代码、安排Agent任务到调用工具等,K3成了最近几天AI圈里讨论最多的模型之一。

讨论大多集中在三个问题:第一,它真的能取代Claude来写程序吗?第二,它实际是否已经达到了国际顶尖模型的水平?第三,它到底值不值得转用?

一些开发者认为,K3最突出的优势并不在于聊天能力,而是在于可以处理长时间流程的Agent任务和代码的生成场景。一些体验过的人说,在修改复杂代码、调用工具等任务里,K3已经能和Claude、GPT这些国际顶尖模型竞争了。

但也有人反馈说,在真实的工程项目里,尽管模型能力很强,但它还是会漏掉一些细节,需要人来修改;此外,在处理复杂的统计推理等任务时,表现还是不太稳定。

另一方面的讨论集中在成本上。有用户觉得,K3虽然单次使用的价格很有竞争力,但由于复杂任务会消耗大量的Token,实际使用成本可能并不便宜,特别是在长流程Agent任务里这个问题更明显。

K3的热度也迅速传到了海外的AI圈子。

美国科技投资公司Atreides Management的创始人Gavin Baker把K3称为AI发展过程中的一个“转折点(inflection point)”,他认为高质量的开源模型正在加速AI能力的传播,这种影响不会只局限在模型公司,还会惠及整个AI应用生态系统。

但也有一些研究者持谨慎态度。

长期研究AI对工作影响的宾夕法尼亚大学沃顿商学院教授Ethan Mollick在X上表示,他曾经让Kimi K3对自己先前的学术研究做了一次复杂的统计复查,但模型在很多地方弄错了,包括错误地使用了统计方法。

Mollick认为,K3已经非常接近世界顶级的模型了,但在复杂专业任务中的可靠性和稳定性,还需要更多实际场景的检验,不能仅仅依靠基准测试的结果来判断。

这个情况也反映出当前AI社区对于新模型的一种普遍心态:一方面,K3在生成代码、Agent等场景的表现得到了很多开发者的认可;另一方面,模型在处理复杂专业任务时的稳定性和可靠性,还需要更多真实场景的持续验证,不能只根据榜单成绩来评价。

计算能力不足仍然是难题

正是在开发者快速涌入、请求量不断上升的情况下,月之暗面很快又遇到了另一个挑战——计算能力不够。

前几年,大模型行业里最常见的讨论是“训练一个模型需要多少GPU”、“参数的数量达到了多少”,而不是因为用户太多,不得不暂停对外提供服务。

实际上,即使模型训练完成了,计算资源的投入也并没有结束,尤其是在AI Coding、Agent等技术快速进步的背景下,模型需要持续调用工具、处理上下文、执行多轮推理,单次请求使用GPU资源的时间远远超过了传统的聊天场景。模型的能力越强、上下文越长、用户调用越频繁,对推理计算资源的需求就越大。

“现在最大的麻烦还是缺算力,尤其是高质量的推理算力。”上海国投孚腾资本的投资总监陈雨沁先前在界面新闻的采访中说,就连顶级的模型公司也开始取消无限量的使用政策,提高服务价格,这本质上都显示出推理资源依然很紧张。“如果基础建设没有跟上去,很多应用公司其实也不敢真的大规模推广产品。”

“从供需关系来看,国内AI算力长期是供不应求的,而随着头部模型集中发布,这种紧张的情况会变得更加明显。”上述芯片厂的人士对界面新闻报道说。

他介绍,目前像月之暗面、智谱、MiniMax这些独立的模型公司,获得算力主要依靠两种方式:一是向公有云厂商租用算力服务,二是建立自己的算力集群。但前者资源有限,后者又属于重资产投入,需要较长的建设周期,因此模型厂的算力供给一直存在一定的压力。

“业内普遍觉得,要支撑万亿参数模型训练和推理,至少需要万卡级的集群。”他表示,从2024年开始,真正具备万卡级部署能力的厂商仍然不多,很多已经宣布要建设的大规模集群项目,落地周期往往是以年为单位计算,所以供需之间仍然存在长期的缺口。

今年WAIC期间,一个细节给上述国产芯片厂商留下了深刻印象。

他告诉界面新闻,在国产芯片厂展示超节点产品的时候,大家问得最多的两个问题就是:“能不能支持万卡集群?”“能不能支持万亿参数模型训练?”

和过去围绕单卡性能、芯片参数讨论相比,现在产业链更加关注超大规模集群能力,以及支持顶尖模型持续训练、推理的基础设施建设。

这个变化,也显示了当前大模型竞争逻辑的转变。

过去,模型公司比拼的是参数数量、训练能力以及Benchmark的成绩;而现在,随着越来越多模型进入实际生产环境中,推理效率、服务稳定性、成本控制以及基础设施能力,开始成为新的竞争关键点。

K3暂停对新用户开放服务,也许只是一次暂时的资源调整,但却让外界第一次如此清楚看到,大模型竞争已经进入了新的阶段。模型的能力决定产品能否吸引用户,而推理算力、基础建设以及持续的服务能力,则决定了它是否能够承担真正的大规模应用。

相关推荐