Shuchao Bimediumconfig v28

Meta 新模型 Muse Spark 1.2 在 ErdosBench 测试中优于 GPT-5.5 xhigh

摘要与判断

第三方团队在 ErdosBench 基准测试中评估了 Meta 新模型 Muse Spark 1.2,结果显示其在 226 个研究级数学问题中成功解决 40 题。该模型在数学研究能力上表现优于 GPT-5.5 xhigh,仅略逊于 Kimi K3,为评估当前前沿模型在复杂推理任务上的水平提供了新的参考数据。

Topics

引用和原文

Trace

Raw Item
raw_d55576ab2d9840fa
Processed Item
processed_3b5955ee10fd44db
Source
source_x_shuchaobi
Cluster
查看所属簇
LLM Logs
llm_d63dcf31544845bc, llm_1319afa838504446, llm_21838fb14bea4922
Coze Loop
6c78cee0a74f87b43f0024b2e3aacd06