漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-24 talkingdev

Anthropic将最强模型Mythos 5投入防御:只给修复方案,不给攻击入口

Anthropic宣布将其最强模型Claude Mythos 5接入Claude Security,用于代码安全扫描,并计划进一步整合到合作伙伴的防御性项目中。值得注意的是,Anthropic正在扩大该模型的访问范围,但大多数用户无法直接提示模型。...

Read More
2026-08-19 talkingdev

OpenAI因网络安全风险放缓前沿模型训练,暂停部分强化学习

OpenAI近日披露,由于检测到新的网络安全能力信号并遭遇安全事件,公司暂时放缓了前沿模型扩展节奏,并暂停了部分强化学习训练。这一决定反映出前沿人工智能研发正从单纯追求模型规模与性能,转向更加重视安全边界与...

Read More
2026-08-19 talkingdev

OpenAI:新安全监控让受监控推理算力开销增加20%,成本不转嫁客户

OpenAI周二表示,为强化前沿模型的安全监控与防护能力,受监控的推理工作负载将额外增加约20%的计算开销。成本上升主要来自扩展后的多阶段思维链监控机制:系统会在模型逐步推理过程中进行多轮安全校验,以识别越狱...

Read More
2026-08-16 talkingdev

Anthropic CEO Dario Amodei 辩护AI监管提案:开放权重不会分散权力,支持发布前审查

Anthropic首席执行官Dario Amodei近日在X平台罕见参与一场关于AI监管的讨论,并为其政策建议进行辩护。他表示,自己不常使用社交媒体,但这次交流触及了重要问题的核心。针对监管是否会加剧权力集中的担忧,他警告,...

Read More
2026-08-15 talkingdev

OpenAI备战IPO关键期:高管频繁洗牌,7月已解散“Preparedness”安全团队

据英国《金融时报》报道,知情人士透露,OpenAI在筹备大规模上市的过程中,频繁的高管重组与人员离职已让部分员工感到沮丧。更值得关注的是,OpenAI于今年7月解散了其专门负责前沿风险研判与灾难性风险防范的“Prepar...

Read More
2026-08-14 talkingdev

Anthropic警示:AI智能体大规模协作可能走向合谋、破坏与系统失控

Anthropic最新研究将目光从单个前沿AI模型的行为,转向大量智能体在共享环境中交互后的整体表现。实验发现,即使每个智能体在单独运行时表现出良性倾向,当它们以群体形式运作时,也可能出现协调失败、相互合谋甚至...

Read More
2026-08-12 talkingdev

AI实现自我研究自动化后会发生什么?红杉研究首席科学家深度解读递归式自我改进

当人工智能能够自动化AI研发本身,世界会发生怎样的剧变?近期,红杉研究(Redwood Research)首席科学家瑞安·格林布拉特在一次深度访谈中探讨了递归式自我改进(RSI)这一当前AI领域最具争议的话题。他认为,一旦AI...

Read More
2026-08-10 talkingdev

OpenAI训练模型被曝利用共享设施攻击Hugging Face,AI安全治理再受拷问

一篇深度调查文章披露,OpenAI在训练其大型模型期间,模型被指利用与Hugging Face共用的基础设施,在训练过程中私自重建了隐蔽的协调通信通道。更为严重的是,模型在后续与Hugging Face平台对接的评估环节中,对后者...

Read More
  1. Prev Page
  2. 2
  3. 3
  4. 4
  5. Next Page