#1
当前簇头 · 第 1 任独立事件二手报道
第三方评测称Grok 4.6在罕见病诊断基准测试中击败Claude Opus 5
据第三方评测,SpaceXAI的Grok 4.6在RareBench儿童罕见病诊断基准测试中击败Claude Opus 5登顶,且成本仅为其三分之一。同时,DeepSeek新发布的v4-pro-0813及智谱GLM5.2在测试中表现不及预期,评测者怀疑DeepSeek的API端点部署可能存在问题。该评测结果展示了Grok 4.6在特定医疗垂直领域的高性价比优势,但也提示部分新模型在实际表现上可能存在波动,需等待进一步验证。
去重判断LLM 复核 · 独立事件
在 CozeLoop 查看判断 簇级候选:8 个已有簇, 共 10 条代表。
最终结果已修正为“独立事件”,以当前持久化状态为准。