• 2026年08月10日 星期一
  • 宁波市互联网协会官方网站!
首 页>>行业新闻>>

第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol

信息来源:特工宇宙 发布日期:2026-08-10

内容编辑丨特工小海 特工小天

内容审核丨特工少女

Kimi K3 发布十天后,AI 原生云服务商 Together AI 公布了一份独立评测报告。

https://www.together.ai/blog/kimi-k3-vs-gpt-5-6-sol-on-deepswe-cost-coding-and-routing

报告的结论出人意料:如果你的 Coding Agent 还在按榜单选模型——Together AI 这份独立评测可能会让你改默认配置。

如果单看「一次就写对代码」,GPT-5.6 Sol 确实领先;但 Together AI 多问了一个问题:如果允许模型多次尝试呢?

答案立刻反转:Kimi K3 在 DeepSWE-pass@2 上以 82.0% 反超 Sol 的 81.0%,到 DeepSWE-pass@4 时差距拉大到 89.4% 对 85.8%。

最终的结论就是:如果比一次定胜负,GPT-5.6 Sol 赢;如果在允许 2-4 次重试的 Agent 架构里,Kimi K3 的天花板更高,并且价格更低。

下面来拆开看这份报告的具体数据。

图片

图片

一次调用,GPT-5.6 Sol 哪里强?

在展开对比之前,有必要解释一下为什么 Together AI 选择了 DeepSWE 作为评测基准:

DeepSWE 是今年五月发布的,继 SWE-bench 之后出现的新一代编程评测。近几个月,包括 OpenAI、Anthropic 在内的多家厂商在模型发布时,都优先引用了 DeepSWE 成绩作为编程能力的证明。

图片

它和 SWE-bench Pro 的区别在于两点:

第一,提示长度约为 SWE-bench 的一半,但解决方案需要的代码量是后者的 5.5 倍。这意味着模型不能靠读懂长 Prompt 提取线索来取巧,必须真正自己思考和理解问题,并生成大量有效代码。

第二,所有任务和评估指标都是从零开始编写的,模型在预训练阶段不可能见过相同的题目。

这两个特性让 DeepSWE 成为当前最难刷分的编程评测之一。

图片

理解了评测方法,再看 Together AI 本次试验的具体方法和数据:实验一共有 904 条执行记录,覆盖 113 个任务,每个任务 4 次独立尝试,两个模型都使用了最大推理强度。

如果只看单轮测试的效果,GPT-5.6 Sol 的整体优势如下:

1. 在单次尝试的场景下,Sol 确实更强。pass@1 达到 72.7%,领先 Kimi K3 约 4 个百分点。72.7% 的 pass@1 意味着它在接近四分之三的任务上,第一次就能给出正确答案。

图片

2. 稳定性上 Sol 的优势更明显。在 4 次尝试中全部成功的任务数,Sol 有 61 个,Kimi K3 只有 45 个。换句话说,Sol 在更多任务上能稳定复现成功:它的可靠性评分达到 84.5%,Kimi K3 为 76.6%。

3. Sol 在速度方面的领先也很明显。Sol 的中位执行时间是 17 分钟,Kimi K3 需要 66 分钟(基于 7 月 25 日 Moonshot 的 Kimi K3 API 数据)。

4. Sol 的整体 Token 消耗更少。Sol 完成任务所需的步骤数大约少了 40%,因此同一个任务,消耗更少。

如果你的场景是一次定胜负、对延迟敏感、预算充足的用户,Sol 是更稳妥的选择。

图片

为什么 K3 适合 Agent 场景

但现实中的编程 Agent 很少是「一次定胜负」的。

pass@1 衡量的是一次命中率,pass@k 衡量的是 k 次尝试内至少成功一次的概率。对带有重试机制的 Agent 来说,pass@k 更接近真实表现:

实际的 Coding Agent 本来就会重试多次,pass@k 更高意味着实际成功率更高。

Kimi K3 在 pass@2 上就已经反超,82.0% 对 81.0%。到 pass@4 时差距拉大到 89.4% 对 85.8%。

图片

与此同时,Kimi K3 每次部署成本为 4.65 美元,Sol 为 8.37 美元。换算下来,每花 100 美元,Kimi K3 能解决 14.7 个任务,Sol 只能解决 5.3 个。每美元解题效率, K3 领先 Sol 约 2.8 倍。

图片

报告中对失败模式的分析,解释了这种差异的来源:

1. Kimi K3 有 65% 的失败案例属于差一点就成功的类型。

即超过 80% 的测试用例都通过了,只卡在小细节上。这类错误在重试时更容易被修正,因为模型已经掌握了问题的主体逻辑。

2. Sol 的失败模式则不同,它是真不会。

它在 20% 的失败案例中会破坏代码库原有的测试,这个比例在 GPT 系列模型中比较一致。更关键的是,Sol 一旦第一次失败,后续重试的改善幅度有限。

在多轮对话中,即使提供了报错信息,Sol 也倾向于在同一个方向上反复修补,缺乏跳出当前思路的能力。报告将此归因为采样多样性不足。

图片

最优解:Kimi K3 优先,Sol 兜底

Together AI 在报告中,提出了一个可直接落地的工程建议:

如果任务只能调用一次,使用 Sol 更可靠。如果允许重试,又有测试套件把关,使用 Kimi K3 具有极高的覆盖率和成本优势。

因此对多数 coding agent 团队而言,目前更合理的答案是:让 Kimi 先处理大部分任务,再让 Sol 接手那些没有通过验证的部分。

具体来说,研究团队发现两个模型的成功/失败分布相关性只有 0.46:这意味着它们不是「谁强谁弱」的关系,而是互补关系,它们擅长和不擅长的题目有明显区别。

基于这个发现,Together AI 提出了一种级联路由策略先运行 Kimi K3,如果测试套件拒绝了结果,再升级到 Sol。这个策略的准确率达到约 85.6%,覆盖 113 个任务中的 108 个。

图片

85.6% 不仅高于任何单一模型的 pass@1,还超过了“完美路由器”的理论上限 83.4%。

所谓完美路由器,是指假设你能提前 100% 准确地判断每道题该交给哪个模型,但每题只调用一次。级联策略之所以能突破这个上限,是因为它给困难任务提供了两次独立尝试的机会。

从成本角度看,这个策略也合理:

Kimi K3 能在第一轮清掉大约 70% 的任务队列,只有剩下的难题才需要调用更贵的 Sol。每个任务的平均成本约为 7.30 美元,低于直接全部使用 Sol 的 8.37 美元,但准确率高出近 13 个百分点。

当然,这个策略有一个前提条件:你需要有验证器,也就是测试套件,来判断第一轮的结果是否正确。没有验证器的情况下,现实中的路由器准确率会落在 70 多分的区间。

在具体的任务分配上,Together AI 也给出了参考:

1. 序列化处理(92 对 79)、并发处理(72 对 55)和程序分析(64 对 56)更适合交给 Sol。

2. 操作工具相关任务(79 对 73)和运行时相关任务(77 对 75)则更适合选择 Kimi K3。

3. 合规性方面两者基本打平,61 对 59。

图片

图片

国产模型的七月:从追赶者到搅局者

以上是纯技术层面的对比。但这份报告发布的时间点,恰好撞上了中国 AI 行业的一个敏感节点。

7 月,海外模型的合规风险集中爆发:

Anthropic 不仅试图垄断旗下 Fable5 模型,还指控阿里巴巴蒸馏 Claude,随后 Anthropic 被曝出在 Claude Code 中对中国用户做了隐式标记,紧接着工信部迅速发布 Claude Code 安全风险提示,阿里全面禁用 Claude 全系产品。

依赖海外闭源 API 的技术路线,合规风险骤然上升。

但国产模型的回应速度超出预期:在技术封锁和信任危机并行的 72 小时内,Kimi K3、Qwen3.8-Max 相继发布,国产开源模型首次在多项评测中进入全球前三。

从 Together AI 这份报告看,至少在编程 Agent 场景下,Kimi K3 已经是全球最优选项之一,而不只是海外模型的平替。这也意味着,国产模型不再是「追赶」,而是第一次真正意义上达到了全球第一梯队水平。

于是紧接着,国产模型带来的能力和价格压力,迅速传导到了大洋彼岸:

7 月最后一天,OpenAI 对上线仅三周的 GPT-5.6 Luna 实施了 80% 的降价——这是 OpenAI 历史上最大幅度的单次价格调整。

同一天,DeepSeek-V4-flash 正式版发布,以最高性价比的表现再次惊艳全球。与此同时,Gemini 3.5 Pro 在 Arena 平台上线不到 30 分钟后撤回。

图片

与此同时,海内外模型厂商竞争的焦点正在转移:

当模型被嵌入 Agent 工作流后,单次推理成本不再是唯一指标,多轮调用的总成本和成功率才是关键。这恰好是国产模型目前的优势区间。

更重要的是,这只是开始。

8 月,智谱据传即将释放 GLM 最新模型(网传名为 GLM-5.5),对标 Fable5。创始人唐杰用「史诗级 plus」来描述这次升级。同时,智谱整体开放了限购并调高了 GLM 的套餐额度,似乎在为新模型上线做准备,也体现出对这次发布的自信。

此外,DeepSeek-V4-Pro 正式版预计 8 月初跟进。预计 9 月,MiniMax 的 3 万亿级别参数 M3 Pro 也将发布。

图片

如果这些模型的编程能力也达到类似水平,Together AI 报告中提出的级联路由策略将有更多组合可能。


当 Anthropic 和 OpenAI 还在争论谁是世界第一模型的时候,中国已经在量产第一梯队了。

恭喜 Kimi K3 的优秀表现,以及期待本月即将发布的 GLM 新模型能否再度引爆全球。


本页网址:http://nbis.cn/news/12633.html

上一篇

下一篇