漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品

Perplexity近日披露其Computer模型的一项新训练方法,通过将拒绝采样微调与提示引导自蒸馏相结合,让AI既能从成功执行的会话中学习,也能从用户纠正过的失败操作中吸收经验。传统微调往往依赖高质量成功样本,但真实世界中的工具使用充满不确定性和错误恢复过程。该方案先利用拒绝采样筛选可靠轨迹,再借助提示引导的自蒸馏将失败修复中的隐含知识迁移到模型中,从而形成更稳健的工具调用策略。这一思路有助于智能体在浏览器操作、软件交互等开放环境中减少错误累积,提升任务完成率。对行业而言,它凸显了真实交互数据和用户反馈在AI训练中的价值,可能推动智能体从静态演示学习走向规模化经验学习。Perplexity此举也展示了AI助手公司如何通过后训练优化计算机使用模型,提高产品在复杂任务中的竞争力。

核心要点

  • Perplexity结合拒绝采样微调与提示引导自蒸馏训练Computer模型
  • 模型能够同时从成功会话和用户纠正后的失败案例中学习
  • 该方法瞄准真实世界工具使用场景,提升智能体的任务适应能力

Read more >