阿里现在有两条 Qwen 图像模型线,它们并不共用版本序号。Qwen-Image-2.1 发布于 2026 年 9 月 20 日,是开放权重模型:生成器 7B 参数、原生透明输出、最多 10 张参考图的编辑能力,可从 Hugging Face 下载。Qwen Image 3.0 和 3.0 Pro 于 7 月 22 日公布、自 2026 年 8 月 4 日起在 API 上提供,是托管模型,按张计费且不公开权重。名字上看起来“3.0 更新”,但更诚实的说法是:它们回答的是不同的问题——你是想自己跑这个模型,还是租用它?
本文从许可证、成本、能力和运维四个维度把两者并排比较,最后给出一张决策表。想看 2.1 的功能介绍请参考 What is Qwen-Image-2.1;想看代码,请看 how-to guide。无论选哪个,最终都会变成一个应用调用的 HTTP 接口,而 Apifox 可以把两者放在同一个集合里,让切换只需改一项配置。
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。
并排对比
| Qwen-Image-2.1 | Qwen Image 3.0 / 3.0 Pro | |
|---|---|---|
| 发布时间 | 2026 年 9 月 20 日 | 2026 年 7 月 22 日公布;2026 年 8 月 4 日上线 API |
| 分发方式 | 开放权重(Hugging Face、ModelScope) | 仅托管 API;不公开权重 [VERIFY] |
| 许可证 / 条款 | Qwen Research License;商业使用需要单独许可 | 标准 API 服务条款 |
| 价格 | 你自己的 GPU 时间 | qwen-image-3.0:$0.03/张(1K 或 2K)。qwen-image-3.0-pro:1K 为 $0.04,2K 为 $0.075。输入图片 $0.003/张 [VERIFY] |
| 生成器规模 | 7B(32 层 Single-Stream DiT)+ Qwen3-VL 8B 编码器 | 未披露 |
| 最大分辨率 | 默认 2048 x 2048;最高 2752 x 1536 | 2048 x 2048 |
| 透明输出 | 原生 RGBA 生成和编辑 | 未宣传 |
| 参考图 | 最多 10 张 | 支持输入图片(按张计费);上限未公布 [VERIFY] |
| 局部编辑 | 圆圈标注、手绘涂鸦、独立 mask | 发布材料中未宣传 |
| 文字渲染 | 改进的排版、风格和版式 | 核心卖点:约 10 px 的细小文字,12 种语言(自我报告) |
| 单次调用输出数 | 一张(需要自己循环) | 最多 6 张 |
| prompt 长度 | 未说明 | Pro 上约 4.5K token(官方说法) |
| prompt 改写 | 需要你自己运行独立的 PE-T2I / PE-I2I 模型 | 服务端处理 |
| 试用入口 | HF Space、Qwen Chat、ComfyUI | Model Studio 控制台、Qwen Chat |
3.0 这一列的信息来源是阿里 7 月的公告,以及 LLM Stats 整理的 QwenCloud 文档;做预算前请在 Model Studio 上重新核对价格表,因为图像定价因地区而异。
许可证是第一道筛子
对大多数团队来说,这一行就已经结束比较了。2.1 的许可证规定,未经单独的商业许可,你“不得将本材料用于任何商业目的”。这与最初的 Qwen-Image 所采用的 Apache 2.0 条款不同,也意味着基于 2.1 构建的面向客户的功能,在上线前需要给 Qwen 商务团队发一封邮件并签署协议。
Qwen Image 3.0 是一个采用标准商业条款的付费 API。按张付费,然后就可以发布。
所以:研究、评估、内部工具,或者你愿意协商许可的项目,2.1 是可以考虑的。本季度就要交付、又没有法务预算的产品功能,3.0 是默认选择。
成本:GPU 账单 vs 每张三分钱
3.0 的标准档在两种分辨率下都是 $0.03/张,所以每月 1 万张就是 $300,编辑时每张输入图片再加 $0.003。Pro 在 2K 下价格翻倍。
自托管 2.1 没有按张计价,但只有在达到一定量级、且 GPU 本来就会闲置的情况下,这笔账才算得过来。Qwen 没有公布吞吐量数据,所以你得自己测:在单张数据中心 GPU 上以 40 步、2048 x 2048 运行,统计每小时能出多少张,除以小时费率,再和 $0.03 比较。使用大量参考图的编辑正是 2.1 的 KV cache 复用发挥作用的地方,因为参考图是每个请求编码一次,而不是每一步都编码。如果你的 GPU 还要和其他负载共享,请记住图像生成在突发时会独占它。
一个粗略的经验法则:每月几千张以内,算上工程时间,API 更便宜。每月数万张以上、负载稳定并且已经签好许可协议,自托管更划算。介于两者之间,取决于你是否已经在运行 GPU。
能力:透明通道 vs 密集文字
这两个模型是为不同的任务构建的。
当输出需要 alpha 通道时,选 2.1。 贴纸、商品抠图、UI 素材、分层合成、从照片中抠出主体并输出 RGBA:2.1 在同一个模型中原生支持这些,包括在不丢失透明度的前提下编辑透明图层。3.0 的发布材料没有提到 alpha 输出。要在 3.0 上实现,就意味着额外加一步背景移除,并随之带来光晕伪影。
当编辑是主要工作负载时,选 2.1。 十张参考图、按圆圈或涂鸦或 mask 选择区域,以及在人脸和商品上的保真度处理,是 2.1 这次发布的中心内容。发布说明里展示了用六张人像合成合影、用五张商品图生成穿搭、以及用十张家具照片布置出一间房。
当图像主要内容是文字时,选 3.0。 仪表盘、线框图、海报,以及包含多语言细小文字的幻灯片式版式,是 3.0 调优的方向。2.1 也改进了排版,但 3.0 的“12 种语言下 10 px 文字”是更强的公开主张,而 Pro 上 4.5K token 的 prompt 预算也更适合长篇版式说明。
需要单次调用返回多个候选时,选 3.0。 每次请求最多 6 张输出是 2.1 没有的工作流特性;用 2.1 你得自己遍历 seed。
两家的页面都没有给出带数字的基准表。2.1 的发布文章展示了一张 Qwen-Image-Bench 图表;3.0 的主张属于自我报告。请把两者都当作你自己评估的输入,而 Apifox 那一节可以让这件事变得可重复。
运维:你要承担什么
自托管 2.1 意味着你要负责:模型下载和更新、显存足够的 GPU(Qwen 没有公布显存表;README 提供了 CPU offload,并指向带 FP8 的 vLLM-Omni、SGLang 和 LightX2V)、一个服务封装、突发负载下的排队,以及两个可选的 prompt 改写模型(如果你希望一句话 prompt 也能用)。作为回报,你得到数据本地化、除你之外没有别人设的速率限制,以及一个不会被人从背后改掉的固定模型版本。
使用 3.0 意味着你要负责:阿里云账号和地域选择、API key、限流处理,以及托管模型在你的测试运行和生产之间行为发生变化的风险。作为回报,你得到零基础设施和一张按张计费的账单。
如果你是在跨厂商比较而不只是在 Qwen 内部比较,Nano Banana 2 API 和 gpt-image-2.5 API 两篇指南讨论了 Google 和 OpenAI 面临的同类托管权衡。
决策表
| 你的情况 | 选择 |
|---|---|
| 本季度就要交付商业功能,没有法务预算 | 3.0 |
| 需要透明 PNG 或 RGBA 编辑 | 2.1(商业用途需许可) |
| 使用大量参考图做编辑 | 2.1 |
| 多语言、文字密集的版式 | 3.0 |
| 研究、评估、内部工具 | 2.1 |
| 每月几千张以内 | 3.0 |
| 每月数万张,已有 GPU 在跑,许可证已签 | 2.1 |
| 数据不能离开你的网络 | 2.1 |
| 希望每次请求返回六个候选 | 3.0 |
把两者放在同一个集合里运行
对很多团队来说,实际答案是两者都用:2.1 负责透明素材流水线和内部工具,3.0 负责面向客户的文字版式。只要两者处于同一份契约之后,这个方案就很干净。
在 Apifox 中,一次定义好 POST /v1/images 接口,包含 prompt、aspect、transparent、seed 和一个 references 文件字段,然后建两个环境:一个 base_url 指向你的 2.1 封装(how-to guide 里有一个 40 行的 FastAPI 版本),另一个指向 Model Studio 3.0 接口的适配层。接着:
- 用固定 seed 把同一组 prompt 发给两者,并把响应保存为测试用例。
- 对有差异的部分做断言:
Content-Type、响应体大小下限,以及 2.1 在请求透明输出时的X-Image-Mode: RGBA响应头。 - 记录每个请求的响应时间;Apifox 每次运行都会展示它,这正好是 Qwen 没有公布的吞吐量数字。
- 每周运行一次该场景。当 3.0 的托管行为发生变化,或者你把 2.1 换成量化版本时,差异会出现在报告里,而不是出现在支持工单里。
- 把接口 mock 掉,让前端在模型选型尚未确定时就能按契约开发。
常见问题
Qwen Image 3.0 是开源的吗? 3.0 和 3.0 Pro 都没有公开权重,它们是托管 API 模型 [VERIFY]。Qwen-Image-2.1 才是开放权重的那个版本。
Qwen-Image-2.1 可以商用吗? 只有获得 Qwen 单独的商业许可才可以。默认的 Qwen Research License 排除商业使用。
哪个更便宜? 低用量下,$0.03/张的 3.0 更便宜。高用量、稳定负载且硬件已经在跑的情况下,在你拿到许可并测出自己的吞吐量之后,2.1 更划算。
3.0 能生成透明图像吗? 官方没有宣传这一点。原生 RGBA 输出是 2.1 的特性;参见 What is Qwen-Image-2.1。
可以免费试用其中任意一个吗? 2.1 有 Hugging Face Space 和 Qwen Chat 入口;free-tier guide 列出了各种选项。3.0 可以在 Qwen Chat 中使用,也可以通过 Model Studio 的试用额度访问,额度因地区而异。
接下来做什么
2.1 和 3.0 是一次分叉,而不是一条升级路径。许可证决定第一个问题,工作负载决定第二个,用量决定第三个。无论你最终落在哪一边,都把它放在一份你会去测试的契约之后:how-to guide 构建了 2.1 那一侧,而同一个 Apifox 集合可以在你需要的那天就接管 3.0 那一侧。
HiFox :将 Agent 变成真正的队友
另外,我们也在思考,AI 如何从个人提效走进团队协作。
HiFox 是一个让人和 AI Agent 在同一个工作现场协作的平台:你可以像给同事分派任务一样指派 Agent,在任务看板中跟踪进度、查看结果,让 Agent 成为团队里的队友。
👉 立即体验 Hifox:https://hifox.com
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。