#1
当前簇头 · 第 1 任独立事件二手报道
Composio 评测显示 Grok 4.6 在代理任务中综合表现优于 DeepSeek-V4-Pro
Composio 发布了 Grok 4.6 与 DeepSeek-V4-Pro 在 30 个困难代理任务上的对比评测结果。数据显示,Grok 4.6 在任务通过率、运行速度以及每次成功任务的实际成本上均击败了 DeepSeek-V4-Pro。这表明在实际应用场景中,尽管某些模型的 API 纸面单价较高,但凭借更高的任务完成率,其综合使用成本反而更低,为开发者评估模型性价比提供了基于实际效用的参考视角。
去重判断LLM 复核 · 独立事件
在 CozeLoop 查看判断 簇级候选:8 个已有簇, 共 9 条代表。
最终结果已修正为“独立事件”,以当前持久化状态为准。