Sualeh Asifmediumconfig v30
第三方评测称Grok 4.6在罕见病诊断基准测试中击败Claude Opus 5
摘要与判断
据第三方评测,SpaceXAI的Grok 4.6在RareBench儿童罕见病诊断基准测试中击败Claude Opus 5登顶,且成本仅为其三分之一。同时,DeepSeek新发布的v4-pro-0813及智谱GLM5.2在测试中表现不及预期,评测者怀疑DeepSeek的API端点部署可能存在问题。该评测结果展示了Grok 4.6在特定医疗垂直领域的高性价比优势,但也提示部分新模型在实际表现上可能存在波动,需等待进一步验证。
Topics
引用和原文
Trace
- Raw Item
- raw_e0eab60b0069433a
- Processed Item
- processed_19f5b0a4fee34add
- Source
- source_x_feishu_candidate_sualehasif996
- Cluster
- 查看所属簇
- LLM Logs
- llm_3a4e5e7aed3b4d3e, llm_0936460ab527417e, llm_f5d3025ae8a84a2f
- Coze Loop
- 1f1f6fbf59a9ff293c07c79b7a0c8991