7月27日深夜,月之暗面(Moonshot AI)宣布开源Kimi K3模型权重,发布47页技术报告,并同时开放MoonEP、FlashKDA、AgentEnv三大支撑K3训练的底层基础设施(Infra)技术。“现在,每个人都可以下载并部署Kimi K3模型——无论是用于内部研发,还是嵌入到面向终端用户的产品中,均可自由使用。”
“每次有新模型发布,我们都会测一测,从成本、能力等角度看看它能不能替代我们正在使用的模型。”TalkMe CEO贾子健告诉记者,作为一家开发C端口语练习应用的公司,测试大模型已经是工作习惯。
这一次贾子健测试的对象是Kimi K3。自7月17日凌晨发布后,月之暗面的Kimi K3成为最受关注的大模型。参数规模2.8万亿,取代参数量1.6万亿的DeepSeek-V4 Pro,成为参数量最大的开源权重模型。因为OpenAI、Anthropic等公司推出的模型闭源,其参数量外界不得而知,但外界普遍推测其顶尖模型参数量可能大幅领先于开源模型。
新的架构,超过两万亿的参数规模,都让贾子健对Kimi K3有比较高的期待。他认为:“当下,‘大力出奇迹’的定律依然有效。”
Kimi K3一经发布,使用量也迅速提升。人们争相使用的Kimi K3究竟好不好用?贾子健的答案是:“‘好’并不等于适合。就像兰博基尼足够好,但是不适合每天接送孩子。”
7月20日,2026世界人工智能大会(WAIC 2026)上,Kimi展区的Kimi K3大模型展品。图/视觉中国
“蒸馏小模型”争议
Kimi K3在多项测评中表现出色。根据月之暗面公告,Kimi K3在多imi K3排名全球第三,落后于Claude Fable 5和GPT-5.6 Sol。在第三方评估平台Code Arena上,Kimi K3的编程能力位列第一,这是开源模型首次在该榜单上超越闭源模型登顶。
当然,月之暗面在公告中承认,Kimi K3的整体表现仍落后于最强的闭源模型Claude Fable 5和GPT-5.6 Sol。
众多模型测评博主的感受更为直观。博主“AI拯救打工人”使用Kimi K3“手搓”了几款网页游戏。他给Claude Opus4.8(测评时Anthropic体系中能力仅次于Claude Fable 5的模型)和Kimi K3相同的提示词,做一款3D第一人称射击游戏,Kimi K3交付的结果更接近一款真实游戏,而且画面质感明显更好。他告诉记者:“制作这款游戏,Opus4.8花费4.9美元,而Kimi K3只花费1.95美元。”
在他看来,Kimi K3多模态,特别是视觉理解能力比较强。“比如你可以给Kimi K3一个现成的网页,或者网页截图,他就能够参照其设计新的网页。”
而多模态能力此前一直被认为是国内大模型的短板,比如DeepSeek- V4、智谱的GLM-5.2并未从一开始就推出多模态版本。“现在也可以用DeepSeek-V4、GLM-5.2完成一些前端设计任务,但是相比之下Claude Fable 5能做出很高级的设计,差距不小。”一位AI业内人士告诉记者,之前让DeepSeek做一些设计工作,感觉它就像“瞎”了一样。
Kimi K3被认为进一步缩小了国产模型与顶尖模型之间的差距。加州大学伯克利分校计算机科学教授Ion Stoica的观点被普遍引用,行业此前普遍判定中国开源模型与全球顶尖水平存在6至9个月差距,如今这一差距已收缩至2至3个月。
在此之前,智谱GLM-5.2被认为是国产模型最接近顶尖大模型的产品,当时仅将技术差距压缩至4个月左右。
当Kimi K3发布后,外界特别是美国业界的困惑在于:在高端芯片受限的情况下,国内模型厂商是如何训练出逼近顶尖水平的模型?
在Kimi K3发布前后的72小时内美股半导体板块蒸发数千亿美元,《华尔街日报》认为,Kimi K3加剧了这轮芯片股的抛售。Kimi K3被认为像DeepSeek-R1一样,一定程度动摇了人们对于高端算力芯片的信仰。
OpenAI 与 Anthropic则指控月之暗面利用模型蒸馏技术窃取知识产权。通俗地说,蒸馏就是让“小模型”通过学习“大模型给出的答案”,在较低算力和成本条件下获得类似能力。
针对外界争议,月之暗面企业业务负责人黄震昕公开回应,否认了“K3是蒸馏小模型”的猜测,强调其性能跃升来自底层原创架构创新。
尽管Kimi K3带给美国业界的震撼与DeepSeek相似,不过从应用层面的影响来看,称其为“DeepSeek 2.0时刻”也许过于乐观。
被指“又慢又贵”?
“普通人使用大模型以聊天为主,或者让它协助自己完成一些简单任务,这些应用远远触碰不到大模型的能力边界。我们更为关注其能不能应用于业务。”贾子健表示,作为一家应用开发公司,可能首先会关注大模型的编程能力,这是顶尖大模型非常重要的一个评判维度。编程有明确的规则边界,能够比较清晰地评判大模型能力。
他认为,Kimi K3编程能力比较出色。“特别是在前端能力上,比如人们很容易就被其生成的一些更精细的网页3D游戏所吸引,人是视觉动物。但是在我们的测试中,面对一些比较常规的后端编程任务,Kimi K3所表现的能力与DeepSeek-V4 Pro基本相当,这是我们实际应用更为关注的能力。前端能力再强,目前也仅限于‘手搓’小游戏,或者做个Demo(演示)的水平。”
除去编程,贾子健这次的测试维度还包括听话、防瞎编、脑子、记性和脑洞,共六个方面。他的结论是,相比于DeepSeek-V4 Pro,两者能力打平,但DeepSeek效率胜出,而且更便宜。同样完成他测评中的6项任务,DeepSeek比Kimi快30%以上,而后者价格是前者十几倍。比如对于一项考察记忆力的任务,Kimi比DeepSeek多花了近7分钟。
“C端产品会比较在意响应速度,就像你给对方发一条微信,20分钟才得到回复肯定无法接受。但是对于一些长程推理场景,比如科研,响应速度就不那么重要。其实在测试前,基于Kimi K3参数量,我们就认为它一定会‘慢’一些,测试的结果也符合预期。”贾子健说,“应该在不同的场景找到适合的模型。”
根据月之暗面公告,Kimi K3主要面向长程编程、知识工作和推理等前沿智能场景而设计。
贵,并且慢,这其实是不少Kimi K3用户的共同感受。在价格方面,Kimi K3的API价格为每百万Tokens输入2元(命中缓存)和20元(未命中缓存),输出100元。其输出价格和未命中缓存的输入价格在主流国产模型中都是最高。此前被认为代表国产模型前沿能力的GLM-5.2每百万Tokens的输入单价为8元、输出单价为28元、缓存命中为2元。
这种成本的上涨还体现在对算力的需求上,月之暗面如今正面临算力瓶颈。
贾子健认为,未来Kimi K3在推出后续版本时,可能会在性价比层面优化,模型参数量对应不同的运营、使用成本,并非简单的“越大越好”。“比如Kimi K3和DeepSeek-V4 Pro都是开源模式,但是并不意味着两者的部署成本相同,比如DeepSeek-V4部署可能需要十台左右的英伟达H200,对于一家初创公司而言已经不便宜,而Kimi K3可能需要二三十台英伟达H200。”
从这个角度来看,DeepSeek-R1更多是一款平衡成本和能力的开源模型,让大模型的大规模部署成为可能。大模型应用往往是能力、成本和效率综合考虑的结果,一款能力更强的大模型,并不一定意味着商业上的成功。
融资需要“讲故事”
“其实相比于国内使用的主流模型,Kimi K3的性价比没有那么高,更适合目前使用Claude和GPT的海外用户。”前述AI业内人士告诉记者。
Kimi K3的API价格相较Claude Fable 5和GPT-5.6 Sol仍有优势。换算为美元后,其每百万Tokens输入价格为3美元、输出15美元。Claude Fable 5的API价格每百万Tokens输入为10美元,输出为50美元;GPT-5.6 Sol在短上下文每百万Tokens输入5美元,输出30美元;长上下文则为输入10美元,输出45美元。
这位业内人士认为,月之暗面“秀肌肉”的意味比较明显,意义更多在于试水新架构,以及为下一步融资与未来上市做铺垫。“随着参数量的提升,其算力能不能支持其应用,而且是否要为短期内激增的用户扩张算力,都是考验。因为月之暗面本身并非巨头,而是一家创业公司,算力本就有限。包括其究竟会不会大规模应用到更多生产环节,吸引更多C端用户,而非少量的技术极客,还要打上一个问号。”
“如果可以使用GPT和Claude的话,还会优先使用这两款模型,但是额度用完,或者遭遇封禁,就会考虑使用像Kimi K3、GLM-5.2这样与其能力比较接近的模型。”博主“AI拯救打工人”坦言。
月之暗面正处在上市前夜,根据彭博社报道,月之暗面计划在8月启动新一轮融资,目标估值为投前500亿美元,这将成为公司上市前最后一轮融资。
月之暗面由杨植麟于2023年4月创立,公司名源自平克·弗洛伊德专辑。杨植麟本科毕业于清华,博士就读于卡内基梅隆大学,师从苹果AI负责人,曾任职于Google Brain。
公司成立后融资迅猛:2024年完成超10亿美元A+轮及B轮,估值达33亿美元;2025年底完成5亿美元C轮,估值43亿美元;2026年密集融资,半年内连续完成四轮融资,估值升至200亿美元,最新一轮估值已达315亿美元,半年时间实现了超7倍的估值涨幅。
推动其估值上升的是月之暗面抓住了年初“龙虾热”的机遇,年化经常性收入不断上升。据媒体报道,其年化经常性收入在2026年3月突破1亿美元、5月突破2亿美元、6月中旬突破3亿美元。
随着Kimi K3发布,月之暗面估值还在上升。CIC灼识董事总经理陈一心告诉记者,月之暗面 Pre-IPO轮估值大增的因素,还在于其标的的稀缺性。智谱、MiniMax已在港股上市,DeepSeek首轮融资不对外资开放,一级市场能买到的头部中国基模资产,选项并不多。
不过,大模型的能力正在不断迭代,哪怕是顶尖大模型的护城河也在变浅。在Kimi K3发布之前,国内最强大模型的称号还属于6月发布的智谱GLM-5.2。而在Kimi K3发布之后,Anthropic很快发布了 Claude Opus 5,称其接近 Claude Fable 5 的前沿智能,但价格只有后者的一半,同样在打“性价比”的牌。
但是模型公司通过发布新模型获取新用户的难度在增加。根据XSignal统计,如GPT-5.5发布后,ChatGPT月活跃用户的增长幅度明显低于GPT-5发布时期,表明单次模型迭代对用户扩张的边际拉动正在减弱。产品竞争正由增量获客转向存量经营,下一阶段的关键将更多落在推理成本优化、付费转化,以及Agent对复杂生产力场景的持续渗透。
陈一心认为,融资热度能维持多久,不取决于模型在榜单的领先优势能持续多久,而取决于模型能力带来的商业化进展是否长期可持续。
记者:陈惟杉
(chenweishan@chinanews.com.cn)
编辑:闵杰