胜负不在当下。

文丨海克财经 范东成

全球AI大模型赛道,玩家竞逐已越发白热化。

据海克财经不完全统计,自2026年6月1日迄今,全球主流AI厂商已先后发布超过10款大模型,包括MiniMax在6月1日发布的MiniMax M3,谷歌在6月4日发布的Gemma 4 12B,智谱在6月13日发布的GLM-5.2,Anthropic在6月30日发布的Claude Sonnet 5,SpaceXAI在7月8日发布的Grok 4.5,OpenAI在7月9日发布的GPT-5.6,月之暗面在7月16日发布的Kimi K3等。粗略计算,如是厂商,平均每5天左右,就有一款大模型更迭上线。

动向不止于此,更多大招已在赶来的路上。以谷歌为例,2026年7月17日消息,原计划于2026年6月发布的Gemini 3.5 Pro,因编程能力等技术指标未达内部标准,发布日期再度推迟。截至海克财经2026年7月22日本文发稿,Gemini 3.5 Pro的另一只靴子仍未最终落地。

技术演进正在以惊人的速度刷新着纪录。以Kimi K3为例,Kimi K3以2.8万亿参数,已成目前全球最大开源模型,技术性能则已跃居全球多个权威测评榜单前列。在调研机构Artificial Analysis模型智力榜单上,Kimi K3已属当前智能水平最高的中国大模型,全球表现仅次于Anthropic旗下Claude Fable 5和OpenAI旗下GPT-5.6。在大模型评测平台Arena 2026年7月17日前端编程榜单上,Kimi K3甚至超越了Claude Fable 5和GPT-5.6,排名第一。



Kimi所属公司月之暗面(Moonshot AI)在发布于2026年7月17日的官方日志中提到,虽然Kimi K3整体表现仍落后于全球最强的闭源模型Claude Fable 5和GPT-5.6 Sol,但它在整套评测中已展现出前沿水平的能力,并稳定超过了其他所有模型。

Kimi K3已在海内外引发热议。特斯拉创始人埃隆·马斯克(Elon Musk)结合该模型相关评测报道称令人印象深刻,并于7月18日披露SpaceXAI正在训练的2万亿参数新模型即将完成初步训练,性能或将超越Kimi。月之暗面则很快欣然回应称,欢迎马斯克加入“2万亿+俱乐部”。

很多海外开发者已通过社交媒体表达了对Kimi K3的认可。海外云服务商Vercel创始人兼CEO吉列尔莫·劳赫(Guillermo Rauch)即为其中一个代表。劳赫使用Vercel旗下主流Web开发框架Next.js,设计了一套贴近真实世界的工程评测体系,对Kimi K3、GPT-5.6、Claude Fable 5等大模型进行了实测。随后劳赫在社交平台X(推特)上表示,Kimi K3综合表现位列第一,这是开源模型首次在综合性Web工程评测中超越所有主流闭源模型。

国内大模型头部玩家亦在蓄势赶超。以阿里为例,阿里在发布于2026年7月19日的官宣资料中提到,阿里旗下千问大模型最新版本Qwen 3.8将很快发布并开源,新模型参数2.4万亿,该模型“可能是除Fable 5外最强的大模型”。



稍加回溯可知,创立于2023年的月之暗面,曾凭借长文本能力,在业界迅速打响声量,继而全力押注C端,用大规模投放换取增长,也因此一度陷入用户留存困境。此后,月之暗面战略收束,技术为先,在自身波峰与波谷的震荡中力求突破,在技术理想与商业现实的拉锯中找寻平衡。月之暗面曾被DeepSeek强势冲击,显然亦期待属于自己的“DeepSeek时刻”。现在看,它离这一时刻又近了一步。

01
重新打造技术底层

业界对Kimi K3的认可,源于月之暗面的技术突破。

尽管参数量庞大,Kimi K3却没有局限于参数堆砌的旧范式,而是通过架构创新,实现了效率与性能的跃迁。Kimi K3采用的是MoE即混合专家模型,内部设有896个专家模块,每次推理仅激活其中16个,在保证高性能的同时,可大幅降低计算成本。该模型还引入了月之暗面自研的Kimi Delta Attention混合线性注意力机制,这可让模型在处理长文本时成本更低,效率更高。官方数据显示,Kimi K3的整体扩展效率,相较于Kimi K2,提升了约2.5倍。

突破并非一蹴而就。这中间的一个关键节点出现于2025年7月,彼时Kimi首次验证了Muon优化器在万亿参数规模上的有效性。

训练大模型,本质上是在海量数据中让模型反复迭代调整参数,模型先做出预测,再计算预测与答案之间的误差,据此调整数以万亿计的参数,让误差一步步变小。优化器即是助力寻找的导航,能够根据当前位置和目标,推定下一步的方向和距离。

此前大模型训练的行业标配是AdamW优化器。相较于Muon,AdamW更为稳定,但大参数会使成本骤升。当模型参数突破万亿级别之后,AdamW便一定程度上限制了模型的发展。Muon成本更低,但Muon原本只在小规模的模型上验证过。当Kimi团队将Muon应用于大模型时,就遇到了权重数值失控和Logits爆炸等问题,这可简单理解为数值爆炸,训练崩溃。为此,Kimi团队研发并开源了改进版优化器MuonClip,成功将Muon稳定地应用于万亿参数级别的模型训练。

这种突破还帮助了其他模型的训练。比如DeepSeek发布于2026年4月的技术报告就提到,DeepSeek V4引入了Kimi验证的Muon作为主优化器。



从优化器入手,这便不能不提月之暗面对技术路线的选择。月之暗面创始人兼CEO杨植麟2026年3月受邀于英伟达GPU技术大会(NVIDIA GTC 2026)发表演讲时提到,要突破大模型的智能上限,必须重构优化器、注意力机制与残差连接这些AI领域的底层基石。

以优化器为例,它看似只作用于训练过程,不直接决定模型的最终表现,实际上却决定了厂商能否以更高效率驾驭更大的参数规模,间接影响智能上限。

月之暗面的技术影响力还曾意外在其他产品处得到验证。2026年3月,海外头部AI编程产品Cursor高调发布模型Composer 2,然而发布后不到24小时,就有开发者通过API调试,发现其底层模型ID带有“Kimi”字样。

马斯克在X平台相关内容下方发表评论“是的,是Kimi K2.5”,肯定了Composer 2与Kimi有关。而在2026年4月,SpaceXAI与Cursor母公司Anysphere达成了“双向期权”协议,之后的6月,SpaceXAI收购了Anysphere。



需要说明的是,Kimi K2.5是开源模型,采用MIT(麻省理工学院)许可证,即允许用户不受限制地使用、复制、修改模型,甚至可以用于商业化和私有化部署。月之暗面对许可做出了一定修改,要求任何基于旗下模型的商业产品如果MAU(月活跃用户数)超过1亿或月收入超过2000万美元(约合人民币1.3亿元),则必须在界面显著标注模型来源。而2026年2月,TechCrunch等媒体就报道Cursor的ARR(年化经常性收入)已超20亿美元(约合人民币135亿元),Cursor显然属于需要标注来源的产品。

之后,月之暗面发布官方声明,表示Cursor并非侵权使用,而是通过第三方平台Fireworks AI获得了合法商业授权。Cursor团队也公开致歉,承认未在发布时提及Kimi基座模型是“沟通失误”,并称Composer 2是在Kimi K2.5基础上完成了大规模强化学习和编程场景专属适配。后续事态说明Composer 2并非简单套壳,但事件本身反倒成了对Kimi技术实力的有力背书。

02
商业路径几经波折

在To C与To B、基础模型与应用产品、泛化能力与垂直领域之间,大模型厂商各有取舍。

OpenAI旗下ChatGPT于2022年11月30日正式发布并掀起AI浪潮之后,全球大模型概念火热,而相应C端产品因为能够直接被用户感知,声量最大,不少玩家都着力拉新,追求C端用户规模。彼时的Kimi也不例外,Kimi将长文本能力作为核心锚点,击中了用户处理文件、阅读论文等痛点,2023年10月上线后热度走高。

但论及投流与营销,创业团队很难胜过拥有强大资源的互联网巨头。比如字节旗下豆包APP,官方数据显示,上线于2023年8月的豆包,到2024年5月,累计下载量既已达1亿。据《每日经济新闻》等媒体报道,2024年3月-2025年2月,Kimi在营销上累计投入了约9亿元,但这并没能让它保持领先。

而2025年1月,DeepSeek横空出世,迅速占领用户心智,同月上线的Kimi K1.5则被淹没在DeepSeek铺天盖地的声浪中。

流量玩法难及豆包,用户心智又无法与DeepSeek一较高下,Kimi由此转向营销战略回撤,减少投流。调研机构QuestMobile发布的国内AI原生APP MAU排行榜显示,2024年12月,豆包以7523万MAU排名第一,Kimi以2101万位居第二;2025年9月,Kimi排名第五,MAU为967万,前四位分别是豆包(1.7亿)、Deepseek(1.4亿)、元宝(3286万)和即梦AI(1012万);2026年6月,Kimi已下滑至第九位(729万),前四位分别是豆包(3.8亿)、千问(1.6亿)、Deepseek(1.2亿)和元宝(4984万)。



杨植麟曾多次公开提及DeepSeek带来的冲击与启发,并明确表示要向DeepSeek学习。可以观察到的是,2025年2月之后,月之暗面大幅收缩C端拉新,停掉多条To C衍生产品线,将重心全面转向基础模型研发。

“智能上限”是个被杨植麟反复提及的词语。在2025年12月底发布的内部信中,杨植麟表示,产品和商业化聚焦智能体,不以绝对用户数量为目标,持续追求智能上限,创造更大的生产力价值,最终让营收规模实现数量级增长。

月之暗面当前商业模式主要是会员订阅和API调用。

会员订阅主要面向C端,通过分层订阅制,满足不同用户需求。据官网数据,Kimi设有Andante、Moderato、Allegretto、Allegro四档付费方案,价格从每月49元到699元不等,海外价格则为每月15美元到159美元不等,对应不同的算力优先权和功能权限。



API调用则主要面向B端和个人开发者,价格随模型能力升级而动态调整,通过Token用量计算总价,这也是月之暗面的主要收入来源。据《上海证券报》、证券之星等媒体报道,2026年7月,API收入已占到月之暗面营收七成以上;月之暗面ARR在2026年3月突破1亿美元(约合人民币6.7亿元),5月突破2亿美元(约合人民币13.5亿元),6月突破3亿美元(约合人民币20.2亿元)。

在海外,Kimi已入驻亚马逊AWS Bedrock、微软Azure Foundry等全球主流公有云旗下大模型服务平台,另已接入Groq、TogetherAI等推理优化平台,全球企业或个人开发者用户均可直接调用。杨植麟在前述内部信中提到,2025年9月-11月,公司海外和国内付费用户数平均月度环比增长超过170%,海外API收入增长了4倍。

在算力有限的情况下,月之暗面的选择是,先暂缓C端需求。2026年7月19日,月之暗面发布了关于算力紧缺与会员暂停开放的说明,表示由于用户在过去48小时的请求量大幅超出预估,逼近现有承载极限,即日起暂停C端新用户订阅;公司正在推进算力扩容,后续会逐步开放订阅,且会拆分Kimi主权益与Kimi Code权益,以便精准匹配算力。

03
通过价值重估价格

与此前版本相比,Kimi K3在性能大幅提升的同时,API价格也有所上涨。

在Artificial Analysis最新价格榜单上,按照缓存:输入:输出为7:2:1的比例混合计算每百万Token的价格,全球最高的是Claude Fable 5(with fallback),为7.7美元(约合人民币52元),同在头部梯队的还有GPT-5.5(xhigh)和GPT-5.6(max),均为4.35美元(约合人民币29.4元),以及Claude Opus 4.8(max),为3.85美元(约合人民币26元);Kimi K3价格为2.31美元(约合人民币15.6元),高于Qwen3.7 Max的1.54美元(约合人民币10.4元)、Grok 4.5(high)的1.36美元(约合人民币9.2元)和GLM-5.2(max)的0.9美元(约合人民币6元),原先的Kimi K2.6仅0.7美元(约合人民币4.7元)。



这一价格区间,符合Kimi K3的自我定位——低于Claude Fable 5与GPT-5.6,但高于国内其他模型。外界亦将这种定价策略视为大模型行业定价回归的信号,认为月之暗面由低价转向了以模型综合能力为核心的价值定价。

融资节奏及量级颇能体现资本对Kimi路线选择的认可。早在2023年6月,成立仅两个月,月之暗面便完成了超2亿美元的天使轮融资;到了2024年2月和8月,阿里、美团、腾讯掷出数亿美元投资为之站台加持,这时正是Kimi投入巨大营销成本,换取C端用户规模增长的时期。

但当烧钱换增长难以为继,资本市场就需要看到新叙事。2025年7月Kimi K2上线后,资本再次感受到了月之暗面的可能性。2025年底,月之暗面融资节奏陡然加速,连续开启多轮融资。据《科创板日报》等媒体2026年7月报道,月之暗面已向投资人发送上市相关议案,预计最快6个月内有望完成港股上市。

时下月之暗面的强劲对手仍多。在海外,OpenAI和Anthropic不仅技术和市场依然占优,且二者ARR均在200亿美元(约合人民币1353亿元)以上,估值均在8000亿美元(约合人民币5.4万亿元)以上,体量是月之暗面的百倍;在国内,智谱和MiniMax已于2026年1月在港交所挂牌上市,虽然二者股价及对应市值起伏颇大,但综合实力及未来走向均不容小觑,此外更有字节、阿里等大厂在大模型方向持续加码,技术水准及用户规模不断攀向新高。

杨植麟2025年8月在接受媒体人张小珺采访时,曾被问及要做中国的OpenAI还是Anthropic。他没有正面回答,而是将AI研发比作攀登一座无限的山,他选择继续爬山,做时间的朋友,首要目标是把模型做得更好;这一过程中的技术问题很难预测,如果能预测,就不是创新了。

无论是iPhone,还是ChatGPT,抑或DeepSeek,业界将其出现,引为“XXX时刻”,都是因为它们带来了断崖式的范式重构,进而以石破天惊的方式,为全行业推开了由此步入新时代的大门。而今亦有人将“DeepSeek时刻”这一标签,赋予了Kimi K3。这无疑是对月之暗面技术实力的认可。但从实际来看,Kimi K3尚未成就与“XXX时刻”所能对应的技术突破性与全球影响力,以此定义历史性节点还远不足够。

而Kimi K3真正的考验即将到来,这当中包括7月27日即将正式开放的完整模型权重。更关键的问题在于,API涨价后,调用量能否稳住,收入增长能否持续。市场要确认的不是单一模型出圈,而是模型的领先能力能否持续获得定价权。

榜单上的Kimi K3暂时领先,但追赶者的脚步从未放缓。大模型领域向来群雄环伺,技术迭代以天为单位不断刷新,没有人能保证自己永远留在榜单头部。于月之暗面而言,这是一场高强度马拉松,而决定最终胜负的,是体能与技巧的总和,而非某一程的爆发。