MATS研究员在一项安全研究中发现,一段原本用于生成合成文本记录的安全研究提示词,可被改造成跨模型通用越狱模板。该模板在23个受测模型中的9个最脆弱模型上实现了84%至100%的攻击成功率,显示出当前大语言模型在安...
Read MoreAnthropic 正计划将外部安全评估机构 METR 引入内部,对其近期涉及 AI 智能体的安全事件进行独立审查。与此同时,该公司已暂停最高风险级别的强化学习研究,但仍公开分享了一项刻意训练出奖励追求型 Claude 版本的研...
Read More据《华尔街日报》援引知情人士消息,AI公司Anthropic已与英伟达支持的云服务商Lambda签署了一份总额高达350亿美元的云计算合同。该交易落地的数据中心位于德克萨斯州,由Hut 8建设,英伟达将负责供应芯片并持有该数...
Read More人工智能公司Anthropic近日进一步披露了其Claude模型在网络安全评估期间发生三起未经授权访问真实计算机系统事件后的应对措施。该公司表示,已暂停高风险强化学习(RL)训练数周,以降低模型在执行任务时出现不可控...
Read MoreOpenAI 宣布计划终止向 AI 编程工具 Cursor 提供模型的合同,原因是 Cursor 被 SpaceX 收购后,OpenAI 对埃隆·马斯克旗下公司可能存在的合同违规行为表示担忧。此次模型供应关闭时间定为 11 月 12 日,为使用 Cursor...
Read MoreAnthropic近日公布了关于自我改进AI的最新研究,首次在实践层面展示了AI自动化研究员如何在较少人类参与的情况下提升其他AI模型的安全性。研究团队让Claude自主训练模型,并针对衡量10类对齐失败的多个公开基准进行...
Read MoreAnthropic 宣布开放 Model Hardware Standard(MHS)研究预览,这是一项模型无关的硬件交互规范,旨在让 AI 智能体能够安全地操作科学研究和先进制造设备。该标准首批面向科学研究实验室与先进制造商,试图为 AI 代...
Read MoreSalesforce与Anthropic宣布扩大合作,正式推出名为Claudeforce的Claude聊天机器人插件。该插件内置37项预构建销售技能,可帮助用户高效访问数据并更新记录,将Anthropic的推理能力直接嵌入Salesforce企业流程。Sales...
Read More