ℏεsamhighconfig v23

Claude Fable 5 更新后触发硬性护栏致代码能力暴跌

摘要与判断

Anthropic 7月1日更新的 Claude Fable 5 模型在 BridgeBench 基准测试中性能出现断崖式下跌,其中代码调试能力从 86.2 暴跌至 25.9,重构能力从 73.6 降至 38.4。测试表明,性能滑坡并非模型本身能力受损,而是 Anthropic 新增的硬性安全护栏在大量任务中被过度触发,导致模型强制回退至旧版 Opus。这一机制变动将严重影响开发者在代码重构与调试场景下的实际使用体验与效率。

Topics

引用和原文

Trace

Raw Item
raw_5517d9e29a2f4f72
Processed Item
processed_c94da36258964528
Source
manual_x
Cluster
未归簇
LLM Logs
llm_136cae031eb54139, llm_9f39ec655be5412b, llm_6b1b595c8b704486
Coze Loop
bf1daced02dd07f80098727c36be4779