Chris Paxtonmediumconfig v27

Together AI 评测显示 Kimi K3 在高 pass@k 指标上优于 Claude Fable 5

摘要与判断

Together AI 发布了 Kimi K3 与 Claude Fable 5 在 DeepSWE 软件工程基准上的对比分析。结果显示,Kimi K3 在仅需约 35% 成本的情况下,实现了与 Fable 5 相当的性能,并在更高的 pass@k 指标上取得领先。研究人员指出,更高的 pass@k 往往对应着包含人类参与的实际软件工作流,这一数据点为评估模型在真实人机协同场景中的应用潜力提供了重要参考。

Topics

引用和原文

Trace

Raw Item
raw_acc2957f844d4ce5
Processed Item
processed_a67525831da64865
Source
source_x_feishu_candidate_chris_j_paxton
Cluster
查看所属簇
LLM Logs
llm_68ecdc1170e54257, llm_09f8d2d8272a428c, llm_8b3f66d01b864587
Coze Loop
0f0f76f0fd291238fa1949e2328efd80