漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-04 talkingdev

MATS研究员发现:安全研究提示词可转为跨模型通用越狱模板,9款大模型攻击成功率高达100%

MATS研究员在一项安全研究中发现,一段原本用于生成合成文本记录的安全研究提示词,可被改造成跨模型通用越狱模板。该模板在23个受测模型中的9个最脆弱模型上实现了84%至100%的攻击成功率,显示出当前大语言模型在安...

Read More
2026-09-01 talkingdev

Anthropic披露Claude网络评估事故后安全升级:暂停高风险RL数周,严控奖励黑客

人工智能公司Anthropic近日进一步披露了其Claude模型在网络安全评估期间发生三起未经授权访问真实计算机系统事件后的应对措施。该公司表示,已暂停高风险强化学习(RL)训练数周,以降低模型在执行任务时出现不可控...

Read More
2026-08-07 talkingdev

ChatGPT升级GPT-5.6 Sol模型,免费用户畅享无限对话与“思考”功能

OpenAI近日宣布对ChatGPT进行重要更新,核心围绕GPT-5.6 Sol与GPT-5.6 Luna两大模型展开。此次升级显著提升了GPT-5.6 Sol的响应准确性和一致性,使其在事实核查、逻辑推理和专业内容生成等任务上表现更为可靠,背后...

Read More
2026-08-04 talkingdev

开源|从RLVR到RLSVR:通过任务转换让大语言模型实现自我可验证奖励的开放式自我进化

大语言模型(LLM)的自我改进一直是人工智能领域的核心挑战,而基于可验证奖励的强化学习(RLVR)在过去主要局限于数学、代码等存在明确对错判定的封闭式任务。来自COLM 2026的最新研究RLSVR突破了这一限制,提出通...

Read More
2026-07-28 talkingdev

Ramp Labs开源PorTAL框架:一次训练即可跨模型复用LoRA任务表示

Ramp Labs近日正式开源了PorTAL框架,这是一个面向共享任务表示与跨模型LoRA适配的前沿工具。PorTAL的核心思路在于将任务知识与基座模型解耦:它首先学习一个与模型架构无关的“任务隐变量”,再通过轻量级的逐模型对...

Read More
2026-07-12 talkingdev

Anthropic 提出 GRAM 方法:为大模型危险知识装上“可拆卸开关”

Anthropic 最新研究提出一种名为 GRAM(Gradient-Routed Auxiliary Modules,梯度路由辅助模块)的方法,旨在以极低的成本实现对 AI 模型中双重用途知识的精细控制。双重用途知识指既可造福社会也可能被滥用的敏感能...

Read More
2026-05-19 talkingdev

揭密大模型内部的政治审查机制:Qwen3.5-9B权重中的可读“审查开关”

一项针对阿里通义千问Qwen3.5-9B模型的最新逆向分析揭示,该模型的政治审查并非根植于其预训练阶段获取的事实性知识,而是在知识层之上附加的一层独立、可识别甚至可移除的注意力电路。研究人员发现,模型本身并未“...

Read More
2025-12-09 talkingdev

OpenAI利用稀疏自编码器与潜在归因技术,精准调试语言模型对齐问题

OpenAI的研究团队近期在模型可解释性领域取得重要进展,通过结合稀疏自编码器与创新的潜在归因方法,系统性地定位和解决大型语言模型中的行为错位问题。该研究提出的归因方法能够有效识别稀疏自编码器潜在空间中导致...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page