Agent Arena比较模型性能与成本:Kimi K3以低价进入前四
Agent Arena数据显示,前15款模型的代理任务表现与成本差异明显:Kimi K3(Max)排名第4,单任务中位成本为0.62美元;Claude Opus 5(Max)排名靠前但成本达3.37美元。该比较为用户评估代理模型的性能价格比提供参考,但属于转发的评测信息。
簇级候选:8 个已有簇, 共 8 条代表。
Agent Arena数据显示,前15款模型的代理任务表现与成本差异明显:Kimi K3(Max)排名第4,单任务中位成本为0.62美元;Claude Opus 5(Max)排名靠前但成本达3.37美元。该比较为用户评估代理模型的性能价格比提供参考,但属于转发的评测信息。
下线会立即隐藏 Defomo 内容,并联动撤回 Elys 全部 Feed、详情和分享入口;恢复不会补推历史 Feed。 本操作覆盖整个事件簇及未来新成员。
Agent Arena数据显示,前15款模型的代理任务表现与成本差异明显:Kimi K3(Max)排名第4,单任务中位成本为0.62美元;Claude Opus 5(Max)排名靠前但成本达3.37美元。该比较为用户评估代理模型的性能价格比提供参考,但属于转发的评测信息。
簇级候选:8 个已有簇, 共 8 条代表。
Agent Arena已上线“帕累托前沿”榜单,按真实智能体任务表现与单任务中位成本比较模型;当前入选包括Claude Opus 5、Kimi K3、GPT 5.5、Grok 4.5、GLM 5.2、GPT 5.6 Luna和Mimo V2.5 Pro,其中Claude Opus 5性能提升12.34%、单任务成本1.78美元,Kimi K3为10.53%和0.62美元。该榜单将效果与成本放在同一维度,便于评估不同模型在智能体任务中的性价比。
Agent Arena展示代理模型排行榜,基于全球用户社区提供的数百万真实世界长周期任务,评估模型调用网络搜索、文件系统和终端工具完成复杂工作流的表现。排行榜通过因果追踪方法比较模型相对平均模型的实际结果,为用户提供代理能力对比参考,但内容本身未披露具体模型成绩或重大产品变化。