近期开放模型在短短数月内取得显著进展,基础模型已不再是能力提升的主要瓶颈。以GLM5.3和Qwen3.8-27B为代表的新一代模型,其相较上一代的性能提升主要来自后训练阶段的优化,而非单纯扩大基础模型规模。值得关注的...
Read Morefal Research 宣布推出 H3 Max,这是 MiniMax H3 的后训练版本,由 fal 推理团队专门针对生成速度进行优化。官方表示,该模型可在不到 3 秒内生成一段 5 秒长的视频,显著降低视频生成等待时间。在人类偏好评估中,H...
Read MoreTaoLive团队针对直播电商数字人代理的实时性与适应性矛盾,提出Harness-Aware Training(HAT)后训练方法。其核心是将技能、钩子、系统提示和工具模式从模型权重中解耦,使运行时行为可随业务策略变化而无需重新训练...
Read MoreHarvey 宣布推出其首个后训练开放权重模型 Tenet,该模型基于 Kimi K3 基础版本,通过异步强化学习在真实的长周期法律环境中进行训练。与单纯向模型灌入更多法律文本不同,Harvey 将尽职调查、审查表格、律所知识等...
Read More人工智能安全公司Cogent推出了其最新的前沿网络推理模型VR-1,该模型经过专门的后训练,能够自主探查陌生企业环境、组合跨系统弱点,并通过实际执行验证攻击路径。VR-1的核心能力在于模拟真实攻击链:从有限初始访问...
Read More美国能源部与开放智能实验室Arcee AI宣布联合开发Genesis-Science-1(GS1),一个面向科学计算工作流的开放权重AI模型。该项目旨在解决科学研究中计算流程难以复现的长期痛点,通过透明、可定制的模型架构和开放权重...
Read More在大语言模型后训练中,强化学习正变得愈发关键,但面向长周期智能体任务时,传统同步、批次交替的RL流程效率低下。异步强化学习通过随到随更新的方式提升了效率,然而现有系统多偏重吞吐量,训练稳定性和任务有效性...
Read More在大型语言模型(LLM)和视觉语言模型(VLM)部署中,模型量化是降低计算和存储成本的关键技术。然而,传统量化方法往往需要在模型大小和推理精度之间做出艰难取舍,尤其是在超低位宽(如2-bit、3-bit)下,精度损失...
Read More