返回簇列表
多源确认簇行为开启Mongo 实时数据

第三方评测称Grok 4.6在罕见病诊断基准测试中击败Claude Opus 5

据第三方评测,SpaceXAI的Grok 4.6在RareBench儿童罕见病诊断基准测试中击败Claude Opus 5登顶,且成本仅为其三分之一。同时,DeepSeek新发布的v4-pro-0813及智谱GLM5.2在测试中表现不及预期,评测者怀疑DeepSeek的API端点部署可能存在问题。该评测结果展示了Grok 4.6在特定医疗垂直领域的高性价比优势,但也提示部分新模型在实际表现上可能存在波动,需等待进一步验证。

成员
1
换头
0
最近活动
08/14 03:00:13
MEMBERS

簇内帖子

按进入簇的先后排序 · duplicate 不隐藏
#1
当前簇头 · 第 1 任独立事件二手报道

第三方评测称Grok 4.6在罕见病诊断基准测试中击败Claude Opus 5

据第三方评测,SpaceXAI的Grok 4.6在RareBench儿童罕见病诊断基准测试中击败Claude Opus 5登顶,且成本仅为其三分之一。同时,DeepSeek新发布的v4-pro-0813及智谱GLM5.2在测试中表现不及预期,评测者怀疑DeepSeek的API端点部署可能存在问题。该评测结果展示了Grok 4.6在特定医疗垂直领域的高性价比优势,但也提示部分新模型在实际表现上可能存在波动,需等待进一步验证。

Sualeh Asif来源权威 2 级(1 级最高)发布于 08/14 02:55:35原帖 内容详情
去重判断LLM 复核 · 独立事件

簇级候选:8 个已有簇, 共 10 条代表

在 CozeLoop 查看判断
最终结果已修正为“独立事件”,以当前持久化状态为准。