漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品

在人工智能系统开发中,评估设计与模型迭代是决定模型能否稳定落地的关键环节。Anthropic 旗下 Claude 团队近日发布了 /claude-api build-eval 与 /claude-api hillclimb 两个新命令,旨在将评估设计及爬山优化过程自动化。高质量评估需要尽可能贴近生产环境、为更强模型保留性能余量、奖励更充分的推理过程,并具备较低的运行间方差。新命令能够自动构建经过审查的测试集和评分器,随后以每次仅改动提示、技能、模型设置或测试框架代码中的一个变量的方式开展爬山式优化,并利用留出样本和噪声检查来识别和防止过拟合。这一方法为开发者提供了更可靠、可复现的模型迭代路径,减少人工设计评估时的主观偏差,提升模型在真实生产场景中的表现与可信度。

核心要点

  • 良好评估应镜像生产环境,保留性能余量并保持低运行间方差
  • build-eval 自动生成审查过的测试集与评分器,hillclimb 以单变量变更进行爬山优化
  • 通过留出案例与噪声检查有效防止过拟合,确保优化结果真实可信

Read more >