Chris Paxtonmediumconfig v27
Together AI 评测显示 Kimi K3 在高 pass@k 指标上优于 Claude Fable 5
摘要与判断
Together AI 发布了 Kimi K3 与 Claude Fable 5 在 DeepSWE 软件工程基准上的对比分析。结果显示,Kimi K3 在仅需约 35% 成本的情况下,实现了与 Fable 5 相当的性能,并在更高的 pass@k 指标上取得领先。研究人员指出,更高的 pass@k 往往对应着包含人类参与的实际软件工作流,这一数据点为评估模型在真实人机协同场景中的应用潜力提供了重要参考。
Topics
引用和原文
Trace
- Raw Item
- raw_acc2957f844d4ce5
- Processed Item
- processed_a67525831da64865
- Source
- source_x_feishu_candidate_chris_j_paxton
- Cluster
- 查看所属簇
- LLM Logs
- llm_68ecdc1170e54257, llm_09f8d2d8272a428c, llm_8b3f66d01b864587
- Coze Loop
- 0f0f76f0fd291238fa1949e2328efd80