通义千问发布Qwen-Image-3.0图像生成模型:支持4.5k token输入,原生渲染12种语言
talkingdev • 2026-07-22
1291 views
阿里巴巴通义千问团队近日正式推出第三代基础图像生成模型Qwen-Image-3.0,在内容丰富度、细节真实感和世界知识融合方面实现全面升级。该模型支持最高4.5k token的文本输入,能够精准理解复杂长文本的语义,并生成富含真实细节的高质量图像。Qwen-Image-3.0的一大突破在于原生支持12种语言的文字渲染,打破了此类模型多语种文本嵌入图像的壁垒。此外,模型具备模拟网页、游戏界面、直播画面等主流数字界面的能力,使其不再仅为艺术创作服务,而是向可落地的生产力工具迈出关键一步。凭借内置的广泛世界知识,Qwen-Image-3.0在品牌设计、多语种内容制作、UI原型快速生成等场景展现出巨大的应用潜力,有望重塑视觉内容生产流程。这一发布标志着图像生成模型从追求视觉冲击向注重实用部署、深度融入产业价值链的方向演进。
核心要点
- Qwen-Image-3.0支持4.5k token长文本输入,显著提升对复杂指令的理解和图像生成精度。
- 模型原生支持12种语言文字渲染,并可模拟网页、游戏、直播等主流数字界面。
- 凭借丰富的世界知识,该模型定位为可实际部署的生产力工具,拓展了图像生成的应用边界。