togethercomputecriticalconfig v27

Kimi K3在DeepSWE评测中性能追平Claude Fable 5且成本仅需35%

摘要与判断

Together AI引用最新评测指出,Kimi K3与Claude Fable 5在DeepSWE软件工程基准上的对比表现亮眼。结果显示,Kimi K3不仅能达到与Fable 5相同的性能水平,其成本仅为后者的约35%,且在更高的pass@k指标上实现了反超。这一评测数据表明,开源前沿模型在特定任务能力上已不再落后,为开发者提供了极具性价比的替代方案。

Topics

引用和原文

Trace

Raw Item
raw_d2ed26caf6e544af
Processed Item
processed_7d9dd6d8fec744b5
Source
source_x_togethercompute
Cluster
查看所属簇
LLM Logs
llm_049b8de9cf81417b, llm_99f7be6a8b214bdb, llm_f8b23abd9d1a4283
Coze Loop
97d48a0ca24faad4d6dbed22fce5ec35