阿里千问发布 Qwen-Image-3.0,超长指令让复杂图文一键生成
7 月 21 日,阿里发布最新图像生成基础模型 Qwen-Image-3.0。新模型支持最大 4.5k token 超长输入,可一次生成涵盖公式符号、几何图形、逻辑推导步骤等多元素融合的知识图解、复杂 UI 界面,同时支持 12 国语言和 20 多款字体原生渲染,字字清晰,大幅降低多语言产品海报、影视/漫画分镜等“可读可用”商业素材的生产成本。
Qwen-Image-3.0 是千问图像生成和编辑模型系列的第三代基础模型,核心能力全面升级, GPT-Image-2 擅长的直播间页面,Qwen-Image-3.0 也能轻松生成,人像摄影、数学试卷、古碑拓片,千问生成的图片细节满满,栩栩如生。
Qwen-Image-3.0 着重提升了模型对于复杂信息的承载能力,较前代在文本输入长度上实现了 4.5 倍的跃升。这意味着,在影视短剧分镜、复杂信息图、产品说明页等需要超长提示词输入的场景中,用户不再需要将需求压缩成一句话,而是可以像给设计师撰写需求文档一样,完整描述画面结构、文字内容、视觉风格和排版细节,从而让模型更精准地生成图文内容,减少反复生成和人工调试成本。凭借 Qwen-Image-3.0 对于语义并置和空间控制能力的极致把握,新模型可一次性生成涵盖 9 种不同领域的 9 宫格知识图解,字字清晰,幅幅准确。
Qwen-Image-3.0 拥有更详实的知识,能轻松理解复杂指令和画面的逻辑嵌套关系。新模型可根据一条指令,在同一幅图中生成网页、软件界面、聊天窗口、海报等多类视觉内容的组合式表达。比如,当用户输入“在 VSCode 编程界面中,通过千问 App 生成一张发布在聊天界面里的手冲咖啡海报”时,模型能够准确理解其中的多层 UI 嵌套关系,并依次生成 VSCode 编程界面、千问 App 界面、社交媒体聊天界面和咖啡海报,在保持各层界面结构、风格准确的同时,甚至连手机截图里的时间数字,低至 10 像素的小字,都清晰可辨。
得益于 Qwen-Image-3.0 独特的"生图编辑一体化"模型架构,新模型在文生图中积累的文字渲染能力、细节质感和世界知识也自然迁移到了编辑场景中,诸如古画修复、全景图生成、手绘草图转 PPT、多镜头机位生成等复杂编辑任务,均可一键完成。用户无需在生成与编辑之间反复切换工具,也无需担心风格、文字、细节在二次处理时出现偏差。新模型能够在保持原图结构与语义一致性的基础上,精准执行局部改写、内容扩展和风格迁移,真正实现"所想即所得",让图像创作从单次生成走向可持续迭代的完整工作流。
据了解,阿里云百炼、千问 AI 平台已开通 API 邀测,Qwen Studio 和千问 APP 也即将上线供免费体验。