ℏεsamhighconfig v23
Claude Fable 5 更新后触发硬性护栏致代码能力暴跌
摘要与判断
Anthropic 7月1日更新的 Claude Fable 5 模型在 BridgeBench 基准测试中性能出现断崖式下跌,其中代码调试能力从 86.2 暴跌至 25.9,重构能力从 73.6 降至 38.4。测试表明,性能滑坡并非模型本身能力受损,而是 Anthropic 新增的硬性安全护栏在大量任务中被过度触发,导致模型强制回退至旧版 Opus。这一机制变动将严重影响开发者在代码重构与调试场景下的实际使用体验与效率。
Topics
引用和原文
Trace
- Raw Item
- raw_5517d9e29a2f4f72
- Processed Item
- processed_c94da36258964528
- Source
- manual_x
- Cluster
- 未归簇
- LLM Logs
- llm_136cae031eb54139, llm_9f39ec655be5412b, llm_6b1b595c8b704486
- Coze Loop
- bf1daced02dd07f80098727c36be4779