togethercomputecriticalconfig v27
Kimi K3在DeepSWE评测中性能追平Claude Fable 5且成本仅需35%
摘要与判断
Together AI引用最新评测指出,Kimi K3与Claude Fable 5在DeepSWE软件工程基准上的对比表现亮眼。结果显示,Kimi K3不仅能达到与Fable 5相同的性能水平,其成本仅为后者的约35%,且在更高的pass@k指标上实现了反超。这一评测数据表明,开源前沿模型在特定任务能力上已不再落后,为开发者提供了极具性价比的替代方案。
Topics
引用和原文
Trace
- Raw Item
- raw_d2ed26caf6e544af
- Processed Item
- processed_7d9dd6d8fec744b5
- Source
- source_x_togethercompute
- Cluster
- 查看所属簇
- LLM Logs
- llm_049b8de9cf81417b, llm_99f7be6a8b214bdb, llm_f8b23abd9d1a4283
- Coze Loop
- 97d48a0ca24faad4d6dbed22fce5ec35