AI智能体的能力在很大程度上由其harness(装配层/框架)决定。传统方法让harness针对固定进化集演化,虽然分布内收益明显,但容易记忆训练任务,导致分布外表现大幅缩水甚至消失。RRSI提出了一种新思路:不限制harne...
Read More近日,一个名为TTT-Discover的开源项目在GitHub上发布,其核心创新在于将强化学习(Reinforcement Learning)技术应用于大型语言模型(LLMs)的推理(Inference)阶段,而非传统的训练阶段。这一“测试时训练”(Test-...
Read More