Alexandr Wangmediumconfig v28
第三方实测显示 Meta 新模型 Muse Spark 1.2 数学能力优于 GPT-5.5 xhigh
摘要与判断
第三方测试显示,Meta 新模型 Muse Spark 1.2 在 ErdosBench 研究级数学基准上解决了 40/226 个问题,表现优于 GPT-5.5 xhigh,仅略逊于 Kimi K3。该实测结果表明 Muse Spark 1.2 在复杂数学推理和证明方面具备较强竞争力,为评估当前头部大模型的数理能力提供了新参考。
Topics
引用和原文
Trace
- Raw Item
- raw_9a6f7e414e164685
- Processed Item
- processed_dcc73d78e42e4112
- Source
- source_x_alexandr_wang
- Cluster
- 查看所属簇
- LLM Logs
- llm_91fe2b4ae71c497f, llm_f26e7eee6e154106, llm_09d28c7d51714261
- Coze Loop
- 64f1a408920c0a8a317302cd5c076ef6