elonmuskmediumconfig v30

Grok 4.6 在 ARC-AGI 测试中表现与 GPT-5.6 相当且成本更低

摘要与判断

Grok 4.6 在 ARC-AGI 基准测试中公布最新成绩,在 ARC-AGI-1 和 ARC-AGI-2 任务中分别获得 87.5% 和 67.1% 的得分。在更复杂的 ARC-AGI-3 任务中,Grok 4.6 开启高推理模式后得分 2.11%,单任务成本为 5600 美元。与 GPT-5.6 Sol 的高推理模式相比,Grok 4.6 在得分相当的情况下,成本大幅降低至其三分之一左右。这一结果展示了 Grok 4.6 在复杂推理任务中的成本效率优势,为开发者提供了更具性价比的方案。

Topics

引用和原文

Trace

Raw Item
raw_2c2d10b7c6224cae
Processed Item
processed_e3aaf449250a43d6
Source
source_x_elonmusk
Cluster
查看所属簇
LLM Logs
llm_c291757c5ec240b8, llm_f5b2327a5e5e486a, llm_e3ce7eafad714dbb
Coze Loop
b40b4f10b2ab40c79c9308d3ec7902b0