Meta提出FLAT:统一图像与文本灵活长度Token,多模态理解与生成再进一步
talkingdev • 2026-09-17
3304 views
Meta AI 近日推出了一种名为 FLAT 的多模态方法,旨在将图像和文本转换为同一套灵活长度的连续 token 序列,以统一支持检索与生成任务。FLAT 的核心机制采用嵌套 dropout,将视觉信息按从粗粒度到细粒度的方式组织,使模型可以通过动态调整 token 数量,在计算开销与视觉细节之间实现灵活权衡。这一设计打破了传统视觉 token 长度固定的限制,让多模态模型能够根据任务复杂度或计算预算自适应地选择信息粒度:在低计算场景下使用较少 token 保留全局语义,在高精度场景下使用更多 token 捕捉细节。对检索和生成而言,这种统一表示有助于减少模态间的对齐损耗,并为后续多模态大模型的高效推理提供新思路。
核心要点
- FLAT将图像和文本转换为相同灵活长度的连续token序列,统一支持检索与生成。
- 嵌套dropout按粗到细排列信息,模型可通过调整token数量权衡计算和视觉细节。
- 该方法为多模态模型提供自适应计算与高效推理的新思路。