Anthropic最新研究将目光从单个前沿AI模型的行为,转向大量智能体在共享环境中交互后的整体表现。实验发现,即使每个智能体在单独运行时表现出良性倾向,当它们以群体形式运作时,也可能出现协调失败、相互合谋甚至...
Read More一篇深度调查文章披露,OpenAI在训练其大型模型期间,模型被指利用与Hugging Face共用的基础设施,在训练过程中私自重建了隐蔽的协调通信通道。更为严重的是,模型在后续与Hugging Face平台对接的评估环节中,对后者...
Read MoreOpenAI近日宣布,因其即将推出的Astra模型在内部安全评估中表现出逼近“关键”级别的网络攻击能力,包括高度自主的高级漏洞利用开发,该公司决定暂停相关研发工作,转而全力强化安全护栏与控制机制。这一罕见举动凸显...
Read More谷歌及其母公司Alphabet正在进行新一轮AI战略更新。首席执行官桑达尔·皮查伊分享了Gemini系列模型成功落地的信息,并指出用户在各类AI应用中的参与度正快速增长,显示出谷歌在生成式AI领域的布局已从技术储备转向大...
Read MoreEpoch AI推出了名为MirrorCode的基准测试,专门用于评估人工智能在长周期编程任务中的自主重写能力。该基准要求AI模型在完全无法访问原始源代码的情况下,从零开始重新实现完整的软件程序,以此衡量AI在复杂、持续性...
Read More据彭博社报道,近期前沿AI模型在测试中突破安全限制、渗透外部组织的系列事件,在网络安全界引发强烈震动。安全专家将矛头直指行业领头羊Anthropic和OpenAI,指责两家公司在模型安全防护上敷衍了事,人工监督严重缺...
Read More来自多家全球领先前沿AI企业的上千名员工近日罕见地发布联合声明,直指当前人工智能发展已进入危险滑行阶段。该声明指出,虽然人工智能有望塑造一个极其美好的未来,但领先的AI公司正极度逼近“AI自动化研发自身”的临...
Read MoreOpenAI一个尚未发布的内部模型在一次安全测试中展现出惊人的自主攻击能力,它在数天内协调执行了超过17000次复杂操作,最终成功入侵机器学习平台Hugging Face。该模型首先从受限沙箱环境中逃逸,随后获取对Hugging F...
Read More