Kimi K3在DeepSWE评测中性能追平Claude Fable 5且成本仅需35%
Together AI引用最新评测指出,Kimi K3与Claude Fable 5在DeepSWE软件工程基准上的对比表现亮眼。结果显示,Kimi K3不仅能达到与Fable 5相同的性能水平,其成本仅为后者的约35%,且在更高的pass@k指标上实现了反超。这一评测数据表明,开源前沿模型在特定任务能力上已不再落后,为开发者提供了极具性价比的替代方案。
无法读取当前簇头内容,但簇实体与成员引用仍可检查。
Together AI引用最新评测指出,Kimi K3与Claude Fable 5在DeepSWE软件工程基准上的对比表现亮眼。结果显示,Kimi K3不仅能达到与Fable 5相同的性能水平,其成本仅为后者的约35%,且在更高的pass@k指标上实现了反超。这一评测数据表明,开源前沿模型在特定任务能力上已不再落后,为开发者提供了极具性价比的替代方案。
Kimi K3 在 DeepSWE 榜单中首次亮相即位列第三,成为首个展现出前沿级性能的开放权重模型。其测试结果已逼近 Claude Fable 和 GPT-5.6 Sol 等头部闭源旗舰,标志着开源模型在核心能力上正式追平顶尖闭源水平,打破了原有能力边界。这一突破性成绩引发了业内广泛关注与讨论,进一步验证了其在复杂任务中的实际实力。
Kimi.ai 转发 Together AI 的评测数据称,在 DeepSWE 软件工程任务中,Kimi K3 展现出与 Claude Fable 5 相当的性能,且成本仅约为后者的 35%,并在更高的 pass@k 指标上取得领先。这一评测结果凸显了 Kimi K3 在特定编程任务中的高性价比,为开发者提供了更具成本效益的模型选择。
Together AI 发布了 Kimi K3 与 Claude Fable 5 在 DeepSWE 软件工程任务上的对比评测结果。数据显示,Kimi K3 能够提供与 Fable 5 相当的性能,但成本仅约为后者的 35%,并在更高的 pass@k 指标上占据优势,Perplexity CEO Aravind Srinivas 对此评价为“强劲的结果”。这一评测凸显了 Kimi K3 在代码生成领域的极高性价比,为开发者提供了更具经济效益的替代方案。
Together AI 发布了 Kimi K3 与 Claude Fable 5 在 DeepSWE 软件工程基准上的对比分析。结果显示,Kimi K3 在仅需约 35% 成本的情况下,实现了与 Fable 5 相当的性能,并在更高的 pass@k 指标上取得领先。研究人员指出,更高的 pass@k 往往对应着包含人类参与的实际软件工作流,这一数据点为评估模型在真实人机协同场景中的应用潜力提供了重要参考。
Together AI发布了Kimi K3与Claude Fable 5在DeepSWE软件工程任务上的对比分析。结果显示,Kimi K3能够以约35%的成本实现与Fable 5相当的性能,并在更高的pass@k指标上取得领先。这一评测表明开源模型在特定复杂任务上已具备与顶级闭源模型竞争的实力,为开发者提供了更具性价比的替代方案。
Together AI 发布了基于 DeepSWE 针对 Kimi K3 与 Claude Fable 5 在软件工程任务上的对比分析。结果显示,Kimi K3 能够提供与 Fable 5 相当的性能,但成本仅为后者的约 35%,并且在较高的 pass@k 指标上表现更为出色。Aravind Srinivas 转发并评价该结果“非常强劲”。这一评测数据为开发者在权衡代码生成模型的性能与成本时,提供了直观的参考依据。