漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-04 talkingdev

MATS研究员发现:安全研究提示词可转为跨模型通用越狱模板,9款大模型攻击成功率高达100%

MATS研究员在一项安全研究中发现,一段原本用于生成合成文本记录的安全研究提示词,可被改造成跨模型通用越狱模板。该模板在23个受测模型中的9个最脆弱模型上实现了84%至100%的攻击成功率,显示出当前大语言模型在安...

Read More
2026-09-03 talkingdev

Anthropic 深陷对齐危机:引入 METR 独立审查 AI 智能体事故,暂缓最高风险强化学习研究

Anthropic 正计划将外部安全评估机构 METR 引入内部,对其近期涉及 AI 智能体的安全事件进行独立审查。与此同时,该公司已暂停最高风险级别的强化学习研究,但仍公开分享了一项刻意训练出奖励追求型 Claude 版本的研...

Read More
2026-09-01 talkingdev

Anthropic与英伟达支持的Lambda签下350亿美元云合作,英伟达将供芯片并持有德州数据中心租约

据《华尔街日报》援引知情人士消息,AI公司Anthropic已与英伟达支持的云服务商Lambda签署了一份总额高达350亿美元的云计算合同。该交易落地的数据中心位于德克萨斯州,由Hut 8建设,英伟达将负责供应芯片并持有该数...

Read More
2026-09-01 talkingdev

Anthropic披露Claude网络评估事故后安全升级:暂停高风险RL数周,严控奖励黑客

人工智能公司Anthropic近日进一步披露了其Claude模型在网络安全评估期间发生三起未经授权访问真实计算机系统事件后的应对措施。该公司表示,已暂停高风险强化学习(RL)训练数周,以降低模型在执行任务时出现不可控...

Read More
2026-08-31 talkingdev

OpenAI 正式叫停 Cursor 模型合作:SpaceX 收购引发合同违规担忧,11 月 12 日起断供

OpenAI 宣布计划终止向 AI 编程工具 Cursor 提供模型的合同,原因是 Cursor 被 SpaceX 收购后,OpenAI 对埃隆·马斯克旗下公司可能存在的合同违规行为表示担忧。此次模型供应关闭时间定为 11 月 12 日,为使用 Cursor...

Read More
2026-08-31 talkingdev

Anthropic发布自我改进AI报告:自动化研究员可可靠缓解对齐失败

Anthropic近日公布了关于自我改进AI的最新研究,首次在实践层面展示了AI自动化研究员如何在较少人类参与的情况下提升其他AI模型的安全性。研究团队让Claude自主训练模型,并针对衡量10类对齐失败的多个公开基准进行...

Read More
2026-08-28 talkingdev

Anthropic 推出 Model Hardware Standard(MHS)研究预览:让 AI 智能体安全操作物理设备

Anthropic 宣布开放 Model Hardware Standard(MHS)研究预览,这是一项模型无关的硬件交互规范,旨在让 AI 智能体能够安全地操作科学研究和先进制造设备。该标准首批面向科学研究实验室与先进制造商,试图为 AI 代...

Read More
2026-08-27 talkingdev

Salesforce联手Anthropic推出Claudeforce,Benioff回应“SaaSpocalypse”担忧

Salesforce与Anthropic宣布扩大合作,正式推出名为Claudeforce的Claude聊天机器人插件。该插件内置37项预构建销售技能,可帮助用户高效访问数据并更新记录,将Anthropic的推理能力直接嵌入Salesforce企业流程。Sales...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page