第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol
9197点击    2026-08-10 15:06

第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol


Kimi K3 发布十天后,AI 原生云服务商 Together AI 公布了一份独立评测报告。


https://www.together.ai/blog/kimi-k3-vs-gpt-5-6-sol-on-deepswe-cost-coding-and-routing


报告的结论出人意料:如果你的 Coding Agent 还在按榜单选模型——Together AI 这份独立评测可能会让你改默认配置。


如果单看「一次就写对代码」,GPT-5.6 Sol 确实领先;但 Together AI 多问了一个问题:如果允许模型多次尝试呢?


答案立刻反转:Kimi K3 在 DeepSWE-pass@2 上以 82.0% 反超 Sol 的 81.0%,到 DeepSWE-pass@4 时差距拉大到 89.4% 对 85.8%。


最终的结论就是:如果比一次定胜负,GPT-5.6 Sol 赢;如果在允许 2-4 次重试的 Agent 架构里,Kimi K3 的天花板更高,并且价格更低。


下面来拆开看这份报告的具体数据。


第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol


一次调用,GPT-5.6 Sol 哪里强?


在展开对比之前,有必要解释一下为什么 Together AI 选择了 DeepSWE 作为评测基准:


DeepSWE 是今年五月发布的,继 SWE-bench 之后出现的新一代编程评测。近几个月,包括 OpenAI、Anthropic 在内的多家厂商在模型发布时,都优先引用了 DeepSWE 成绩作为编程能力的证明。


第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol


它和 SWE-bench Pro 的区别在于两点:


第一,提示长度约为 SWE-bench 的一半,但解决方案需要的代码量是后者的 5.5 倍。这意味着模型不能靠读懂长 Prompt 提取线索来取巧,必须真正自己思考和理解问题,并生成大量有效代码。


第二,所有任务和评估指标都是从零开始编写的,模型在预训练阶段不可能见过相同的题目。


这两个特性让 DeepSWE 成为当前最难刷分的编程评测之一。


第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol


理解了评测方法,再看 Together AI 本次试验的具体方法和数据:实验一共有 904 条执行记录,覆盖 113 个任务,每个任务 4 次独立尝试,两个模型都使用了最大推理强度。


如果只看单轮测试的效果,GPT-5.6 Sol 的整体优势如下:


1. 在单次尝试的场景下,Sol 确实更强。pass@1 达到 72.7%,领先 Kimi K3 约 4 个百分点。72.7% 的 pass@1 意味着它在接近四分之三的任务上,第一次就能给出正确答案。


第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol


2. 稳定性上 Sol 的优势更明显。在 4 次尝试中全部成功的任务数,Sol 有 61 个,Kimi K3 只有 45 个。换句话说,Sol 在更多任务上能稳定复现成功:它的可靠性评分达到 84.5%,Kimi K3 为 76.6%。


3. Sol 在速度方面的领先也很明显。Sol 的中位执行时间是 17 分钟,Kimi K3 需要 66 分钟(基于 7 月 25 日 Moonshot 的 Kimi K3 API 数据)。


4. Sol 的整体 Token 消耗更少。Sol 完成任务所需的步骤数大约少了 40%,因此同一个任务,消耗更少。


如果你的场景是一次定胜负、对延迟敏感、预算充足的用户,Sol 是更稳妥的选择。


为什么 K3 适合 Agent 场景


但现实中的编程 Agent 很少是「一次定胜负」的。


pass@1 衡量的是一次命中率,pass@k 衡量的是 k 次尝试内至少成功一次的概率。对带有重试机制的 Agent 来说,pass@k 更接近真实表现:


实际的 Coding Agent 本来就会重试多次,pass@k 更高意味着实际成功率更高。


Kimi K3 在 pass@2 上就已经反超,82.0% 对 81.0%。到 pass@4 时差距拉大到 89.4% 对 85.8%。


第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol


与此同时,Kimi K3 每次部署成本为 4.65 美元,Sol 为 8.37 美元。换算下来,每花 100 美元,Kimi K3 能解决 14.7 个任务,Sol 只能解决 5.3 个。每美元解题效率, K3 领先 Sol 约 2.8 倍。


第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol


报告中对失败模式的分析,解释了这种差异的来源:


1. Kimi K3 有 65% 的失败案例属于差一点就成功的类型。


即超过 80% 的测试用例都通过了,只卡在小细节上。这类错误在重试时更容易被修正,因为模型已经掌握了问题的主体逻辑。


2. Sol 的失败模式则不同,它是真不会。


它在 20% 的失败案例中会破坏代码库原有的测试,这个比例在 GPT 系列模型中比较一致。更关键的是,Sol 一旦第一次失败,后续重试的改善幅度有限。


在多轮对话中,即使提供了报错信息,Sol 也倾向于在同一个方向上反复修补,缺乏跳出当前思路的能力。报告将此归因为采样多样性不足。


最优解:Kimi K3 优先,Sol 兜底


Together AI 在报告中,提出了一个可直接落地的工程建议:


如果任务只能调用一次,使用 Sol 更可靠。如果允许重试,又有测试套件把关,使用 Kimi K3 具有极高的覆盖率和成本优势。


因此对多数 coding agent 团队而言,目前更合理的答案是:让 Kimi 先处理大部分任务,再让 Sol 接手那些没有通过验证的部分。


具体来说,研究团队发现两个模型的成功/失败分布相关性只有 0.46:这意味着它们不是「谁强谁弱」的关系,而是互补关系,它们擅长和不擅长的题目有明显区别。


基于这个发现,Together AI 提出了一种级联路由策略:先运行 Kimi K3,如果测试套件拒绝了结果,再升级到 Sol。这个策略的准确率达到约 85.6%,覆盖 113 个任务中的 108 个。


第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol


85.6% 不仅高于任何单一模型的 pass@1,还超过了“完美路由器”的理论上限 83.4%。


所谓完美路由器,是指假设你能提前 100% 准确地判断每道题该交给哪个模型,但每题只调用一次。级联策略之所以能突破这个上限,是因为它给困难任务提供了两次独立尝试的机会。


从成本角度看,这个策略也合理:


Kimi K3 能在第一轮清掉大约 70% 的任务队列,只有剩下的难题才需要调用更贵的 Sol。每个任务的平均成本约为 7.30 美元,低于直接全部使用 Sol 的 8.37 美元,但准确率高出近 13 个百分点。


当然,这个策略有一个前提条件:你需要有验证器,也就是测试套件,来判断第一轮的结果是否正确。没有验证器的情况下,现实中的路由器准确率会落在 70 多分的区间。


在具体的任务分配上,Together AI 也给出了参考:


1. 序列化处理(92 对 79)、并发处理(72 对 55)和程序分析(64 对 56)更适合交给 Sol。


2. 操作工具相关任务(79 对 73)和运行时相关任务(77 对 75)则更适合选择 Kimi K3。


3. 合规性方面两者基本打平,61 对 59。


第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol


国产模型的七月:从追赶者到搅局者


以上是纯技术层面的对比。但这份报告发布的时间点,恰好撞上了中国 AI 行业的一个敏感节点。


7 月,海外模型的合规风险集中爆发:


Anthropic 不仅试图垄断旗下 Fable5 模型,还指控阿里巴巴蒸馏 Claude,随后 Anthropic 被曝出在 Claude Code 中对中国用户做了隐式标记,紧接着工信部迅速发布 Claude Code 安全风险提示,阿里全面禁用 Claude 全系产品。


依赖海外闭源 API 的技术路线,合规风险骤然上升。


但国产模型的回应速度超出预期:在技术封锁和信任危机并行的 72 小时内,Kimi K3、Qwen3.8-Max 相继发布,国产开源模型首次在多项评测中进入全球前三。


从 Together AI 这份报告看,至少在编程 Agent 场景下,Kimi K3 已经是全球最优选项之一,而不只是海外模型的平替。这也意味着,国产模型不再是「追赶」,而是第一次真正意义上达到了全球第一梯队水平。


于是紧接着,国产模型带来的能力和价格压力,迅速传导到了大洋彼岸:


7 月最后一天,OpenAI 对上线仅三周的 GPT-5.6 Luna 实施了 80% 的降价——这是 OpenAI 历史上最大幅度的单次价格调整。


同一天,DeepSeek-V4-flash 正式版发布,以最高性价比的表现再次惊艳全球。与此同时,Gemini 3.5 Pro 在 Arena 平台上线不到 30 分钟后撤回。


第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol


与此同时,海内外模型厂商竞争的焦点正在转移:


当模型被嵌入 Agent 工作流后,单次推理成本不再是唯一指标,多轮调用的总成本和成功率才是关键。这恰好是国产模型目前的优势区间。


更重要的是,这只是开始。


8 月,智谱据传即将释放 GLM 最新模型(网传名为 GLM-5.5),对标 Fable5。创始人唐杰用「史诗级 plus」来描述这次升级。同时,智谱整体开放了限购并调高了 GLM 的套餐额度,似乎在为新模型上线做准备,也体现出对这次发布的自信。


此外,DeepSeek-V4-Pro 正式版预计 8 月初跟进。预计 9 月,MiniMax 的 3 万亿级别参数 M3 Pro 也将发布。


第三方机构实测:Agent 场景下,Kimi K3 反超 GPT-5.6 Sol


如果这些模型的编程能力也达到类似水平,Together AI 报告中提出的级联路由策略将有更多组合可能。


当 Anthropic 和 OpenAI 还在争论谁是世界第一模型的时候,中国已经在量产第一梯队了。


恭喜 Kimi 3 的优秀表现,以及期待本月即将发布的 GLM 新模型能否再度引爆全球。


‼️ 欢迎来 TokenDance 上调用各种国产模型,不定期有许多折扣~


官网:https://tokendance.space/models


文章来自于"特工宇宙",作者 "特工小海 特工小天"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0