ℏεsammediumconfig v30
Composio 评测显示 Grok 4.6 在代理任务中综合表现优于 DeepSeek-V4-Pro
摘要与判断
Composio 发布了 Grok 4.6 与 DeepSeek-V4-Pro 在 30 个困难代理任务上的对比评测结果。数据显示,Grok 4.6 在任务通过率、运行速度以及每次成功任务的实际成本上均击败了 DeepSeek-V4-Pro。这表明在实际应用场景中,尽管某些模型的 API 纸面单价较高,但凭借更高的任务完成率,其综合使用成本反而更低,为开发者评估模型性价比提供了基于实际效用的参考视角。
Topics
引用和原文
Trace
- Raw Item
- raw_f65447aecf314a85
- Processed Item
- processed_09a797258ad94703
- Source
- source_x_feishu_candidate_hesamation
- Cluster
- 查看所属簇
- LLM Logs
- llm_7b0fe0cc71734f6b, llm_dda9dd7acc2c4887, llm_7f2f7fdf2a054026
- Coze Loop
- a76bddadc703d42d31e05601db7e5454