返回簇列表
多源确认簇行为开启Mongo 实时数据

Grok 4.6 在 ARC-AGI 测试中表现与 GPT-5.6 相当且成本更低

Grok 4.6 在 ARC-AGI 基准测试中公布最新成绩,在 ARC-AGI-1 和 ARC-AGI-2 任务中分别获得 87.5% 和 67.1% 的得分。在更复杂的 ARC-AGI-3 任务中,Grok 4.6 开启高推理模式后得分 2.11%,单任务成本为 5600 美元。与 GPT-5.6 Sol 的高推理模式相比,Grok 4.6 在得分相当的情况下,成本大幅降低至其三分之一左右。这一结果展示了 Grok 4.6 在复杂推理任务中的成本效率优势,为开发者提供了更具性价比的方案。

成员
1
换头
0
最近活动
08/14 13:50:49
MEMBERS

簇内帖子

按进入簇的先后排序 · duplicate 不隐藏
#1
当前簇头 · 第 1 任独立事件二手报道

Grok 4.6 在 ARC-AGI 测试中表现与 GPT-5.6 相当且成本更低

Grok 4.6 在 ARC-AGI 基准测试中公布最新成绩,在 ARC-AGI-1 和 ARC-AGI-2 任务中分别获得 87.5% 和 67.1% 的得分。在更复杂的 ARC-AGI-3 任务中,Grok 4.6 开启高推理模式后得分 2.11%,单任务成本为 5600 美元。与 GPT-5.6 Sol 的高推理模式相比,Grok 4.6 在得分相当的情况下,成本大幅降低至其三分之一左右。这一结果展示了 Grok 4.6 在复杂推理任务中的成本效率优势,为开发者提供了更具性价比的方案。

elonmusk来源权威 1 级(1 级最高)发布于 08/14 13:36:05原帖 内容详情
去重判断LLM 复核 · 独立事件

簇级候选:8 个已有簇, 共 8 条代表

在 CozeLoop 查看判断
最终结果已修正为“独立事件”,以当前持久化状态为准。