月之暗面(Moonshot AI)旗下 Kimi 团队上周发布 Kimi K3,在人工智能分析公司(Artificial Analysis)的代理知识工作基准 AA-Briefcase 中以 1543 的 Elo 分数位列第二,仅次于 Claude Fable 5(1574),领先 GPT-5.6 Sol、Claude Sonnet 5 和 Claude Opus 4.8 等主流模型。
AA-Briefcase 测什么
AA-Briefcase 是 Artificial Analysis 自建的代理能力测评,模拟真实办公场景:模型需在完全私有的数据集上处理数千个复杂输入文件,产出电子表格、演示文稿、界面原型等可交付成果。评分维度涵盖任务正确性、分析质量和呈现质量,最终合成为单一 Elo 分数。Kimi K3 在这份试卷上较上一代 Kimi K2.6(816 分)提升了 727 分,进步幅度显著。
能力长短板
在客观任务通过率上,Kimi K3 达到 51%,仅次于 Fable 5(56%),优于 Sonnet 5 和 GPT-5.6 Sol。分析质量 Elo 为 1754,与 Fable 5 的 1744 基本持平,说明模型在推理与信息整合上已属第一梯队。但呈现质量相对薄弱,Elo 为 1471,落后于 GPT-5.6 Sol(1660)和 Opus 4.8(1492)——换言之,Kimi K3 能把事情做对、分析到位,但在输出格式和可视化呈现上仍有提升空间。
代价:成本与耗时双高
高表现的另一面是资源消耗。Kimi K3 单次任务平均耗时 56.4 分钟,约是 Fable 5 的 2.5 倍、Grok 4.5 的 3.8 倍。每个任务平均消耗 120k 输出 token、穿越 83 轮对话(GPT-5.6 Sol 仅需 50 轮),使用第一方 Kimi API 时速度也相对较慢。折算到成本上,单任务约 10.57 美元,在 AA-Briefcase 测评模型中属最贵一档。Kimi K3 的 token 定价为输入 3 美元/百万、输出 15 美元/百万,缓存 token 有 90% 折扣,但高轮次与高输出量仍推高了实际开销。
综合来看,Kimi K3 在知识型代理任务中已具备接近顶级的执行能力,但企业在选用前需权衡其部署成本与响应速度——它更像是一个「做得对但有点慢、有点贵」的专业助手。
编注:信源为人工智能分析公司(Artificial Analysis)测评报告,数据截至 2026 年 7 月。材料覆盖 Kimi K3 在 AA-Briefcase 的完整成绩与成本耗时对比,未涉及该模型在其他基准的表现或商业定价策略。