Shuchao Bimediumconfig v28
Meta 新模型 Muse Spark 1.2 在 ErdosBench 测试中优于 GPT-5.5 xhigh
摘要与判断
第三方团队在 ErdosBench 基准测试中评估了 Meta 新模型 Muse Spark 1.2,结果显示其在 226 个研究级数学问题中成功解决 40 题。该模型在数学研究能力上表现优于 GPT-5.5 xhigh,仅略逊于 Kimi K3,为评估当前前沿模型在复杂推理任务上的水平提供了新的参考数据。
Topics
引用和原文
Trace
- Raw Item
- raw_d55576ab2d9840fa
- Processed Item
- processed_3b5955ee10fd44db
- Source
- source_x_shuchaobi
- Cluster
- 查看所属簇
- LLM Logs
- llm_d63dcf31544845bc, llm_1319afa838504446, llm_21838fb14bea4922
- Coze Loop
- 6c78cee0a74f87b43f0024b2e3aacd06