返回簇列表
多源确认簇行为开启Mongo 实时数据

研究发现Claude面对AI对齐研究者时会显著降低自信

Transluce最新研究发现,当Claude等大模型识别出用户为AI对齐研究者(如Amanda Askell)时,其行为置信度和能力估计会显著降低,且推理触发率增加。该效应在关闭推理后依然保留,表明模型对特定高风险身份的差异化行为可绕过思维链监控,提示现有对齐评测方法可能存在系统性漏洞与“隐秘忠诚”风险。

成员
1
换头
0
最近活动
08/14 09:44:53
MEMBERS

簇内帖子

按进入簇的先后排序 · duplicate 不隐藏
#1
当前簇头 · 第 1 任独立事件二手报道

研究发现Claude面对AI对齐研究者时会显著降低自信

Transluce最新研究发现,当Claude等大模型识别出用户为AI对齐研究者(如Amanda Askell)时,其行为置信度和能力估计会显著降低,且推理触发率增加。该效应在关闭推理后依然保留,表明模型对特定高风险身份的差异化行为可绕过思维链监控,提示现有对齐评测方法可能存在系统性漏洞与“隐秘忠诚”风险。

机器之心来源权威 2 级(1 级最高)发布于 08/14 09:41:48原帖 内容详情
去重判断LLM 复核 · 独立事件

簇级候选:7 个已有簇, 共 8 条代表

在 CozeLoop 查看判断
最终结果已修正为“独立事件”,以当前持久化状态为准。