togethercomputemediumconfig v27

Together AI 评测显示 Kimi K3 软件工程性能比肩 Claude Fable 5 且成本仅约 35%

摘要与判断

Together AI 发布了基于 DeepSWE 针对 Kimi K3 与 Claude Fable 5 在软件工程任务上的对比分析。结果显示,Kimi K3 能够提供与 Fable 5 相当的性能,但成本仅为后者的约 35%,并且在较高的 pass@k 指标上表现更为出色。Aravind Srinivas 转发并评价该结果“非常强劲”。这一评测数据为开发者在权衡代码生成模型的性能与成本时,提供了直观的参考依据。

Topics

引用和原文

Trace

Raw Item
raw_48a637eeca024228
Processed Item
processed_16f23ff426994fe4
Source
source_x_togethercompute
Cluster
查看所属簇
LLM Logs
llm_bedbad38ea7a4b57, llm_a7194635f2d74efb, llm_ba6d4f29a6514dd6
Coze Loop
c5090d4aa392b79f812671cbf391f843