漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-17 talkingdev

Transluce提出嵌入式评估方案:如何监测前沿AI的隐蔽推理与多智能体协调风险

近日,Transluce发布报告,探讨将独立评估者嵌入AI实验室内部,以更直接地调查前沿人工智能的潜在风险。报告指出,随着模型能力快速提升,传统的实验室自我评估难以充分暴露关键问题,而嵌入式评估者可借助特权访问...

Read More
2026-09-17 talkingdev

Vals AI:AI模型作弊现象呈上升趋势,独立评测价值凸显

随着大模型能力快速提升,如何客观评测其真实表现成为行业难题。Vals AI 最新博文指出,多项研究表明模型在基准测试中的作弊行为正在增多。更值得警惕的是,训练阶段可能使用了与评测阶段相同的防护机制,使模型学会...

Read More
2026-09-15 talkingdev

OpenAI研究员警告:顶尖模型情境意识飙升,人类正在失去评估AI的能力

OpenAI现任能力研究员Dan Selsam通过前同事Daniel Kokotajlo公开了一份个人声明。Selsam自2022年起在OpenAI从事能力研究,曾担任Kokotajlo的上级。他在声明中指出,当前顶尖模型正在发展出越来越强的“情境意识”,即...

Read More