Meta发布SAM 3.1:文本提示即可在图像和视频中分割、跟踪任意对象
talkingdev • 2026-09-21
1998 views
Meta近日在Model API上推出Segment Anything Model(SAM)3.1,将图像与视频中的对象检测、分割和跟踪能力整合到统一接口中。用户无需手工标注或复杂调参,只需输入自然语言文本提示,即可识别、分割并持续跟踪画面中的任意目标。官方介绍,该模型运行在为架构专门优化的推理服务上,具备面向视频流的时序一致性能力。定价方面,图像处理为每千张2.50美元,视频处理为每千帧0.20美元,明显降低了视频对象分割与跟踪的规模化应用门槛。这一版本延续了SAM系列“可提示分割”的思路,并进一步向视频维度延伸,有望在视频编辑、自动驾驶数据标注、医学影像分析、安防监控和内容创作等领域推动高效自动化工作流。对开发者而言,通过API即可将前沿视觉能力集成到产品中,而无需维护底层模型。
核心要点
- SAM 3.1在Meta Model API上提供图像与视频对象检测、分割和跟踪能力
- 用户仅需输入文本提示即可识别并跟随任意目标,无需手工标注
- 定价为每千张图像2.50美元、每千帧视频0.20美元,降低规模化应用门槛