Alexandr Wangmediumconfig v28

第三方实测显示 Meta 新模型 Muse Spark 1.2 数学能力优于 GPT-5.5 xhigh

摘要与判断

第三方测试显示,Meta 新模型 Muse Spark 1.2 在 ErdosBench 研究级数学基准上解决了 40/226 个问题,表现优于 GPT-5.5 xhigh,仅略逊于 Kimi K3。该实测结果表明 Muse Spark 1.2 在复杂数学推理和证明方面具备较强竞争力,为评估当前头部大模型的数理能力提供了新参考。

Topics

引用和原文

Trace

Raw Item
raw_9a6f7e414e164685
Processed Item
processed_dcc73d78e42e4112
Source
source_x_alexandr_wang
Cluster
查看所属簇
LLM Logs
llm_91fe2b4ae71c497f, llm_f26e7eee6e154106, llm_09d28c7d51714261
Coze Loop
64f1a408920c0a8a317302cd5c076ef6