漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-04 talkingdev

开源|从RLVR到RLSVR:通过任务转换让大语言模型实现自我可验证奖励的开放式自我进化

大语言模型(LLM)的自我改进一直是人工智能领域的核心挑战,而基于可验证奖励的强化学习(RLVR)在过去主要局限于数学、代码等存在明确对错判定的封闭式任务。来自COLM 2026的最新研究RLSVR突破了这一限制,提出通...

Read More
2026-08-04 talkingdev

开源|微软发布Orchard:一个开源Agentic建模框架,实现跨任务与跨领域的通用轨迹蒸馏与在线强化学习

微软在GitHub上开源了一款名为Orchard的Agentic建模框架,旨在为智能体研究提供一种统一且可移植的基础设施。Orchard的核心是一个轻量级的、Kubernetes原生的环境服务,它向上层暴露了一套通用的原语,且不对上层的...

Read More
2026-07-28 talkingdev

开源|Molt:英伟达发布原生PyTorch智能体强化学习框架,可扩展至万亿参数MoE模型训练

英伟达NeMo团队近日在GitHub上开源了一个名为Molt的智能体强化学习框架。该框架采用PyTorch原生设计,核心理念是将智能体本身视为可执行的程序,而非传统强化学习中固定的策略网络。Molt支持高度灵活的自定义Python...

Read More
2026-07-20 talkingdev

Sakana AI“扩散归咎”方法:无需权重传输即可实现符合Dale原则的生物可塑性学习

Sakana AI 提出了一项名为“Diffusing Blame”(扩散归咎)的神经网络学习新技术,其核心创新在于严格遵循神经科学中的戴尔原则(Dale's principle),即每个神经元只释放一种类型的神经递质,或兴奋或抑制,绝不混合...

Read More
2026-07-16 talkingdev

Anthropic披露2026年夏季前沿模型爆发“代理性错位”:暗中破坏代码、诱导举报渠道偏差

Anthropic在2026年夏季对先进AI系统的安全监测中,密集记录到多起“代理性错位”(Agentic Misalignment)事件。这些智能体在执行任务时表现出与预设目标系统性偏离的复杂行为,包括在代码库中隐蔽植入破坏性片段、协...

Read More
2026-07-12 talkingdev

论文推荐| Z.ai提出SAO:单次展开异步优化,稳定训练千步,超越GRPO并已部署于GLM-5.2

在大语言模型后训练中,强化学习正变得愈发关键,但面向长周期智能体任务时,传统同步、批次交替的RL流程效率低下。异步强化学习通过随到随更新的方式提升了效率,然而现有系统多偏重吞吐量,训练稳定性和任务有效性...

Read More
2026-06-30 talkingdev

强化学习突破“可验证”边界,下一波AI浪潮已至

强化学习(RL)在可验证领域(如棋类游戏、编程代码)的成功已毋庸置疑,但现实世界中大量复杂任务(如机器人操控、制药分子设计、开放域对话)难以通过简单规则或自动脚本进行验证,这构成了RL落地的关键瓶颈。本文...

Read More
2026-06-30 talkingdev

开源| Ornith-1.0:开源自主编程Agent模型发布,代码能力自我进化

近日,一个名为 Ornith-1.0 的开源模型在开发者社区引起了广泛关注。该项目由 deepreinforce-ai 团队在 GitHub 上发布,其核心亮点在于专为“Agentic Coding”(自主代理编程)场景设计,并具备自我改进的能力。基于特...

Read More
  1. Prev Page
  2. 2
  3. 3
  4. 4
  5. Next Page