中国开源模型Kimi K3发布:在关键基准测试中超越Claude Fable和GPT-5.6 Sol
月之暗面(Moonshot AI)日前发布了全球规模最大的开源AI模型——Kimi K3。该模型在多个关键基准测试中表现抢眼,在写作能力上甚至超越了Anthropic的Claude Fable 5和OpenAI的GPT-5.6 Sol。
在由Towards AI推出的写作Elo排行榜上,Kimi K3以2840分高居榜首,超过Claude Fable 5(最高2760分)。该排行榜通过让模型撰写真实脚本,并与已发布的版本进行盲评,采用国际象棋Elo评分系统。此前该领域长期由Anthropic团队主导。
此外,在Arena AI的前端代码排行榜上,K3以1679分击败Fable 5的1631分,在七个前端领域中的六个占据第一名。该排行榜基于数千次人对代码生成任务的人工投票,同样采用Elo评分。
在涵盖编码、推理、智能体工作和知识等九项独立评估的人工分析智能指数(Artificial Analysis Intelligence Index,0-100分)中,K3得分为57,Claude Fable 5为60,GPT-5.6 Sol为59,Claude Opus 4.8为56。这意味着K3综合能力排名第三,仅比Fable 5低3%。

架构与性能
K3拥有2.8万亿参数,采用混合专家(MoE)架构,将参数拆分为896个专家子网络,每次任务仅激活其中一部分。这使得模型在保持前沿智能水平的同时,无需“融化服务器机房”。月之暗面表示,这是全球首个3万亿参数级别的开源模型,专为长时编码、知识工作和推理等前沿智能场景设计。作为对比,DeepSeek的V4-Pro参数上限为1.6万亿,月之暗面自己的K2为1万亿。K3的参数量几乎是最接近的开源竞争对手的两倍。
模型支持100万token的上下文窗口,具备原生图像和视频理解能力,并始终开启推理模式。两大架构创新提升了效率:Kimi Delta Attention在百万token上下文下可将解码速度提升6.3倍;注意力残差(Attention Residuals)则跨层选择性路由信息,以不到2%的额外计算成本带来约25%的训练效率提升。整体而言,K3的扩展效率约为K2的2.5倍。
价格优势
Kimi K3的API定价为每百万输入token 3美元,每百万输出token 15美元,与Anthropic的中端模型Claude Sonnet 5持平。但在九项基准测试中,K3的性能仅比顶级模型Fable 5低3%,而每任务成本仅为0.94美元,低于GPT-5.6 Sol的1.04美元和Opus 4.8的1.80美元。换言之,K3以中端价格提供了接近前沿的性能。
据Decrypt报道,今年年初中美前沿AI模型的定价差距高达15-30倍。K3并未像DeepSeek那样大幅降价,而是以西方中端模型的价格提供近乎前沿的性能,对API开发团队而言是重大成本改善。
如果Anthropic坚持仅通过API提供Fable 5,那么K3将成为距离行业第二名最近的开源替代品,且每任务成本仅为Opus 4.8的一半。
芯片限制下的突破
K3的发布为美国芯片出口管制政策的争议提供了新论据。美国自2023年底限制英伟达H800 GPU对华出口,月之暗面此前使用这些芯片训练了早期模型。K3的基准测试文档提及使用了H200以及“来自替代供应商的GPGPU”——外界普遍认为是华为昇腾硬件。
月之暗面总裁张宇彤在今年达沃斯论坛上表示:“我们知道没有奢侈的条件去单纯扩大算力……这迫使我们在基础研究和效率上集中精力。”美银分析师在发布后报告中写道,K3证明“预训练扩展与架构创新相结合,仍然可以在受限条件下为中国旗舰模型带来阶跃式提升”。月之暗面是所谓的“AI虎”初创公司之一,它们在没有华盛顿认为所需芯片的情况下,已经改变了全球模型格局。
需要注意的缺点
K3在AA-Omniscience基准测试中的幻觉率从前代K2.6的39%飙升至51%。即正确回答更多,但编造答案的情况也更多。模型自身文档也承认可能“过度主动”,在长时间自主任务中替用户做出意外决策。对于计划从K2.6升级的团队,需要重点测试幻觉差异。
免费版可以通过官网体验,但服务器拥堵导致任务频繁中断,几乎无法使用。建议订阅付费或通过API使用。

开源计划
模型权重将于7月27日发布,面向大型企业和商业用户。目前国内没有任何GPU(无论多大)能够独立运行如此规模的模型。
