据TechCrunch报道,美国白宫科技顾问指控中国公司月之暗面(Moonshot)开发Kimi K3时,可能复制了美国公司Anthropic的Fable模型,还可能使用了受出口限制的高端芯片。但美国官方没有显示任何完整证据。
值得注意的是,TechCrunch采访的美国AI专家并不认同这个简单说法。华盛顿指控Kimi K3这么强,全靠“蒸馏”美国模型,这个论断是反科学的。
所谓蒸馏,简单说,就是不断向一个强模型提问,把它的回答收集起来,再拿去训练自己的模型。这样做可能让新模型学到一些表达方式、答题套路和特定任务能力。但专家认为,这很难直接“复制”一个前沿模型的整体实力。
原因很简单。一个强大的大模型,不只是很多问答内容的集合。它还要靠大量数据、模型设计、训练方法、强化学习、工程系统和反复调试。
这就像看很多名厨做菜,可以学会几道菜的样子,但不等于立刻拥有一家顶级餐厅的采购体系、后厨团队和长期经验。
报道中,Laude研究所的研究员汉考克(Braden Hancock)说,Fable公开时间不长,而Kimi K3很快就发布了。要在这么短的时间里,大量调用Fable,收集数据、完成训练,再推出一个强模型,时间上很难说得通。
Allen研究所的研究员拉姆伯(Nathan Lambert)也认为,随着模型越来越接近前沿,单靠监督微调式的蒸馏,作用会越来越有限。真正要提高复杂推理能力,往往还要依赖强化学习和大规模训练系统。
这并不表示AI行业没有不当行为。若有人非法获取模型权重、源代码、私有数据,或绕过限制大量盗用服务,当然应当调查和追责。但不能因为一个中国模型表现不错,就直接断定它“是偷来的”。这既不是严谨的技术判断,更忽略了中国团队自身的研发能力。
中国AI团队能做出强模型,并不神秘。中国有大量工程师和研究人员,也有丰富的互联网应用场景。近年来,中国团队在模型压缩、混合专家架构、推理优化、数据处理和强化学习方面投入很大。美国专家也提醒,美国人容易低估中国AI团队的技术实力。即使中国的进展会放慢,但不会停止。
不过,这不代表中国AI没有难题。用户觉得Kimi K3响应很快,并不说明训练下一代模型不受芯片限制。线上回答快,主要是推理问题,可以靠量化、缓存、批处理和集群调度优化。训练更强的新模型,则需要长期、稳定、便宜的大规模算力,还需要高速互连和成熟的软件系统。
国产芯片已经能承担不少训练和推理任务,但如果单颗芯片性能、软件生态或互连效率仍有差距,就往往要用更多芯片来补。这样能做出来,却意味着更高的硬件投入、电力消耗、机房需求和运维难度。未来真正的竞争,不是谁能发布一次热门模型,而是谁能持续训练下一代模型。
所以,对Kimi K3最合理的看法不是“中国AI靠偷”,也不是“中国AI已经没有瓶颈”。中国AI有真实的能力,也有真实的压力。未来能否继续缩小差距,关键仍在芯片产能、基础软件、训练系统、能源和长期的工程能力。
the end