中国Moonshot推出了参数达2.8万亿的开放式AI模型Kimi K3
Краткий пересказ от QRazy ИИ
- Kimi K3来自Moonshot AI,是最大的语言模型之一,拥有2.8万亿参数,与领先的系统竞争。
- 该模型采用创新的混合专家架构,以提高请求处理的效率。
- 在专门测试中,Kimi K3表现出色,在复杂任务中超越了GPT-5.6 Sol和Claude Fable 5。
- 尽管基准测试令人印象深刻,但在实际场景中的表现仍有待提高,结果需谨慎解读。
了解中国公司Moonshot推出的新开放AI模型Kimi K3,具有创纪录的2.8万亿参数,承诺将彻底改变人工智能技术。
中国公司Moonshot AI推出了Kimi K3——全球最大的开放语言模型之一,拥有2.8万亿参数。开发者声称,这款新产品已经能够与最佳商业AI系统竞争,在一些专业测试中甚至超越了它们。该模型的权重公司承诺将在2026年7月公开。
几年前,开放的大型语言模型明显落后于OpenAI、Anthropic和Google等封闭系统。如今,这一差距正在迅速缩小。中国公司Moonshot AI声称其新模型Kimi K3已经达到了领先商业解决方案的水平,并在一些专业测试中超越了它们。
近三万亿参数——但没有多余的计算
Kimi K3基于专家混合架构(Mixture-of-Experts),包含2.8万亿参数。该模型最初支持处理图像,最大上下文窗口大小达到一百万个标记。
Moonshot AI称Kimi K3是第一款属于近三万亿参数系统类的开放模型。然而,这样令人信服的规模并不意味着在每次请求中都会使用所有计算资源。架构包括896个专门的“专家”,但在处理每个标记时,仅激活其中的16个。这种方法大大提高了推理效率,相较于必须在每次调用中使用所有参数集的模型。
在日常工作中,领先者仍然领先
开发者并不掩饰,整体用户体验中Kimi K3目前仍落后于Claude Fable 5和GPT-5.6 Sol等模型。他们估计,正是这些系统在日常使用场景中依然提供了更高水平的普遍性能。
然而,独立测试结果看起来要令人感兴趣得多。
在复杂任务中,Kimi K3领先
在用于评估模型解决复杂软件工程任务能力的基准测试FrontierSWE中,Kimi K3获得了81.2分。相比之下,GPT-5.6 Sol得到了71.3分,而Claude Opus 4.8则得到了66.7分。
另一个指标——SWE Marathon——也对新模型有利。在这里,Kimi K3的成绩为42分,而GPT-5.6 Sol获得39分,Claude Fable 5则获得35分。
这些成就不仅限于编程。在BrowseComp测试中,该模型创造了新的记录——91.2分。此外,Kimi K3在以下几项边界级别的测试中表现出色:
- AutomationBench;
- SpreadsheetBench 2;
- OmniDocBench;
- 多个视觉推理测试。
综合这些结果,Moonshot AI的新开发表明,开放模型已经能够在理论上与最强的封闭系统竞争,并在一些实际重要领域开始设定新的性能水平。
为什么我们应该对记录保持谨慎态度
基准测试中的高分并不总是意味着在实际使用中的同样显著的优势。模型在日常任务中的表现取决于许多因素,这些因素无法在标准化测试中完全反映。
一些提到的测试中模型通过不同的代理环境(agent harnesses)进行运行,这增加了额外的复杂性。因此,直接比较结果并不总是正确的,数据需要谨慎解读。
尽管如此,Kimi K3的出现表明,开放的人工智能模型几乎赶上了美国主要公司封闭开发的进展,并在某些专门任务中开始设定新的性能水平。

Обсуждение закрыто
Видно, что спор идет. Быстрый вход — и ответы откроются сразу.