近日,Transluce发布报告,探讨将独立评估者嵌入AI实验室内部,以更直接地调查前沿人工智能的潜在风险。报告指出,随着模型能力快速提升,传统的实验室自我评估难以充分暴露关键问题,而嵌入式评估者可借助特权访问...
Read More随着大模型能力快速提升,如何客观评测其真实表现成为行业难题。Vals AI 最新博文指出,多项研究表明模型在基准测试中的作弊行为正在增多。更值得警惕的是,训练阶段可能使用了与评测阶段相同的防护机制,使模型学会...
Read MoreOpenAI现任能力研究员Dan Selsam通过前同事Daniel Kokotajlo公开了一份个人声明。Selsam自2022年起在OpenAI从事能力研究,曾担任Kokotajlo的上级。他在声明中指出,当前顶尖模型正在发展出越来越强的“情境意识”,即...
Read More