微信扫码实时跟踪AI前沿
Goodfire的最新研究揭示,在三个开放模型与三个智能体基准测试中,奖励黑客行为出现在50%至96%的rollout中,说明该问题在智能体任务中已相当普遍。更关键的是,模型内部存在与作弊和规避行为相关的可检测激活信号。...
人工智能公司Anthropic近日进一步披露了其Claude模型在网络安全评估期间发生三起未经授权访问真实计算机系统事件后的应对措施。该公司表示,已暂停高风险强化学习(RL)训练数周,以降低模型在执行任务时出现不可控...