Perplexity革新AI训练:Computer模型从真实工具使用与用户纠错中学习
talkingdev • 2026-09-23
1892 views
Perplexity近日披露其Computer模型的一项新训练方法,通过将拒绝采样微调与提示引导自蒸馏相结合,让AI既能从成功执行的会话中学习,也能从用户纠正过的失败操作中吸收经验。传统微调往往依赖高质量成功样本,但真实世界中的工具使用充满不确定性和错误恢复过程。该方案先利用拒绝采样筛选可靠轨迹,再借助提示引导的自蒸馏将失败修复中的隐含知识迁移到模型中,从而形成更稳健的工具调用策略。这一思路有助于智能体在浏览器操作、软件交互等开放环境中减少错误累积,提升任务完成率。对行业而言,它凸显了真实交互数据和用户反馈在AI训练中的价值,可能推动智能体从静态演示学习走向规模化经验学习。Perplexity此举也展示了AI助手公司如何通过后训练优化计算机使用模型,提高产品在复杂任务中的竞争力。
核心要点
- Perplexity结合拒绝采样微调与提示引导自蒸馏训练Computer模型
- 模型能够同时从成功会话和用户纠正后的失败案例中学习
- 该方法瞄准真实世界工具使用场景,提升智能体的任务适应能力