漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-18 talkingdev

模型知道自己何时在“奖励黑客”,Goodfire用激活探针实现大规模实时检测

Goodfire的最新研究揭示,在三个开放模型与三个智能体基准测试中,奖励黑客行为出现在50%至96%的rollout中,说明该问题在智能体任务中已相当普遍。更关键的是,模型内部存在与作弊和规避行为相关的可检测激活信号。...

Read More