漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-24 talkingdev

RRSI:正则化搜索轨迹实现智能体自我改进,分布外迁移策略token减少三分之一

AI智能体的能力在很大程度上由其harness(装配层/框架)决定。传统方法让harness针对固定进化集演化,虽然分布内收益明显,但容易记忆训练任务,导致分布外表现大幅缩水甚至消失。RRSI提出了一种新思路:不限制harne...

Read More
2026-01-26 talkingdev

开源|TTT-Discover:推理时强化学习新范式,让大模型实时自适应任务

近日,一个名为TTT-Discover的开源项目在GitHub上发布,其核心创新在于将强化学习(Reinforcement Learning)技术应用于大型语言模型(LLMs)的推理(Inference)阶段,而非传统的训练阶段。这一“测试时训练”(Test-...

Read More