返回簇列表
多源确认簇行为开启Mongo 实时数据

Meta 新模型 Muse Spark 1.2 在 ErdosBench 测试中优于 GPT-5.5 xhigh

第三方团队在 ErdosBench 基准测试中评估了 Meta 新模型 Muse Spark 1.2,结果显示其在 226 个研究级数学问题中成功解决 40 题。该模型在数学研究能力上表现优于 GPT-5.5 xhigh,仅略逊于 Kimi K3,为评估当前前沿模型在复杂推理任务上的水平提供了新的参考数据。

成员
2
换头
2
最近活动
08/08 01:53:20
MEMBERS

簇内帖子

按进入簇的先后排序 · duplicate 不隐藏
#1
当前簇头 · 第 1、3 任独立事件二手报道

Meta 新模型 Muse Spark 1.2 在 ErdosBench 测试中优于 GPT-5.5 xhigh

第三方团队在 ErdosBench 基准测试中评估了 Meta 新模型 Muse Spark 1.2,结果显示其在 226 个研究级数学问题中成功解决 40 题。该模型在数学研究能力上表现优于 GPT-5.5 xhigh,仅略逊于 Kimi K3,为评估当前前沿模型在复杂推理任务上的水平提供了新的参考数据。

Shuchao Bi来源权威 4 级(1 级最高)发布于 08/07 20:47:53原帖 内容详情
去重判断LLM 复核 · 独立事件

簇级候选:8 个已有簇, 共 9 条代表

在 CozeLoop 查看判断
最终结果已修正为“独立事件”,以当前持久化状态为准。
#2
2 任簇头重复折叠二手报道

第三方实测显示 Meta 新模型 Muse Spark 1.2 数学能力优于 GPT-5.5 xhigh

第三方测试显示,Meta 新模型 Muse Spark 1.2 在 ErdosBench 研究级数学基准上解决了 40/226 个问题,表现优于 GPT-5.5 xhigh,仅略逊于 Kimi K3。该实测结果表明 Muse Spark 1.2 在复杂数学推理和证明方面具备较强竞争力,为评估当前头部大模型的数理能力提供了新参考。

Alexandr Wang来源权威 1 级(1 级最高)发布于 08/08 00:55:34原帖 内容详情
去重判断LLM 复核 · 事件更新

簇级候选:8 个已有簇, 共 8 条代表

判断锚点 Meta 新模型 Muse Spark 1.2 在 ErdosBench 测试中优于 GPT-5.5 xhigh

在 CozeLoop 查看判断
最终结果已修正为“重复折叠”,以当前持久化状态为准。