阿里现在同时提供两条 Qwen 图像模型线,它们的版本号并不属于同一个序列。Qwen-Image-2.1 于 2026 年 9 月 20 日发布,是开放权重模型:生成器 7B 参数、原生透明输出、支持最多 10 张参考图的编辑,可从 Hugging Face 下载。Qwen Image 3.0 与 3.0 Pro 分别于 2026 年 7 月 22 日发布、8 月 4 日起在 API 上提供,是托管模型,按张计费且未公开权重。数字上看“3.0 更新”,但更诚实的说法是:它们回答的是不同的问题——你是想自己跑这个模型,还是租用它?
本文从许可、成本、能力和运维四个维度把两者并排对比,最后给出决策表。2.1 的功能详解见 What is Qwen-Image-2.1;需要代码请看操作指南。无论你选哪个,最终都会变成应用调用的一个 HTTP endpoint,而 Apifox 可以把两者放在同一个集合里,切换只是改一个配置。
并排对比
| Qwen-Image-2.1 | Qwen Image 3.0 / 3.0 Pro | |
|---|---|---|
| 发布时间 | 2026 年 9 月 20 日 | 2026 年 7 月 22 日发布;2026 年 8 月 4 日上线 API |
| 分发方式 | 开放权重(Hugging Face、ModelScope) | 仅托管 API;未公开权重 [VERIFY] |
| 许可 / 条款 | Qwen Research License;商业使用需另行获得许可 | 标准 API 服务条款 |
| 价格 | 你自己的 GPU 时间 | qwen-image-3.0:每张 $0.03(1K 或 2K)。qwen-image-3.0-pro:1K $0.04,2K $0.075。输入图每张 $0.003 [VERIFY] |
| 生成器规模 | 7B(32 层 Single-Stream DiT)+ Qwen3-VL 8B 编码器 | 未披露 |
| 最大分辨率 | 默认 2048 x 2048;最高 2752 x 1536 | 2048 x 2048 |
| 透明输出 | 原生 RGBA 生成与编辑 | 未宣传 |
| 参考图 | 最多 10 张 | 支持输入图(按张计费);上限未公开 [VERIFY] |
| 局部编辑 | 圈选、涂抹标注、独立蒙版 | 发布材料中未宣传 |
| 文字渲染 | 字体排印、风格与版式有所改善 | 核心卖点:约 10 px 的细小文字,支持 12 种语言(官方自述) |
| 单次调用输出数 | 一张(自己循环) | 最多 6 张 |
| 提示词长度 | 未说明 | Pro 约 4.5K token(官方说法) |
| 提示词改写 | 需自行运行独立的 PE-T2I / PE-I2I 模型 | 服务端处理 |
| 试用入口 | HF Space、Qwen Chat、ComfyUI | Model Studio 控制台、Qwen Chat |
3.0 一栏的资料来自阿里 7 月的发布说明,以及 LLM Stats 转述的 QwenCloud 文档;做预算前请在 Model Studio 上重新核对价格表,因为图像定价因地区而异。
许可是第一道筛子
对多数团队来说,这一行就能结束对比。2.1 的许可证规定:你“未经获得单独的商业许可,不得将本材料用于任何商业目的”。这与初代 Qwen-Image 所采用的 Apache 2.0 条款不同,意味着基于 2.1 构建面向客户的功能,需要在上线前给 Qwen 商务团队发邮件并签署协议。
Qwen Image 3.0 是带标准商业条款的付费 API。按张付费,即可上线。
所以:研究、评测、内部工具,或者愿意去谈许可的项目,2.1 可以考虑。本季度就要上线、又没有法务预算的产品功能,默认选 3.0。
成本:GPU 账单 vs 每张三分钱
3.0 标准档在两种分辨率下都是每张 $0.03,所以每月 1 万张是 $300,编辑时每张输入图另加 $0.003。Pro 在 2K 下翻倍。
自托管 2.1 没有按张计费,但只有在量大、且 GPU 本来闲置的情况下这笔账才算得过来。Qwen 未公开吞吐数据,所以自己测:在单块数据中心 GPU 上以 40 步、2048 x 2048 出图,统计每小时出图数,除以每小时费率,再与 $0.03 比较。参考图多时,2.1 的 KV cache 复用正是优势所在——参考图每次请求只编码一次,而不是每一步都编码。如果 GPU 还要跑其他负载,要记得图像生成在峰值时会独占它。
一个粗略的判断:每月几千张以下,把工程时间算进去后 API 更便宜。每月几万张以上、负载稳定且已签好许可,自托管更划算。介于两者之间,取决于你是否已经在跑 GPU。
能力:透明 vs 密集文字
这两个模型是为不同的任务打造的。
当输出需要 alpha 通道时选 2.1。 贴纸、商品抠图、UI 素材、分层合成、把主体从照片中抠成 RGBA:2.1 在同一个模型里原生支持这些,包括在不丢失透明度的前提下编辑透明层。3.0 的发布材料没有提到 alpha 输出。在 3.0 上做这件事需要额外的抠图步骤,随之而来的是边缘光晕问题。
当编辑是主要负载时选 2.1。 十张参考图、用圆圈/涂抹/蒙版做区域选择,以及人像与商品的高保真还原,是 2.1 这次发布的重点。发布文章展示了由六张人像合成合影、由五张商品图生成穿搭、由十张家具照片生成布置好的房间。
当图像以文字为主时选 3.0。 仪表盘、线框图、海报,以及包含多语言细小文字的类幻灯片版式,正是 3.0 调优的方向。2.1 在字体排印上也有提升,但 3.0“12 种语言、10 px 文字”的公开说法更强,其 Pro 上 4.5K token 的提示词预算也适合长篇版式描述。
当需要单次调用拿到多个候选时选 3.0。 单次请求最多输出六张是 2.1 不具备的工作流能力;用 2.1 只能遍历 seed。
两家的页面都没有给出带数字的基准测试表。2.1 的发布文章只有一张 Qwen-Image-Bench 图表;3.0 的说法属于自述。两者都应视为你自行评测的起点,而Apifox 章节让这件事可重复。
运维:你需要承担什么
自托管 2.1 意味着你需要负责:模型下载与更新、显存足够的 GPU(Qwen 未公布显存表;README 提供了 CPU offload,并指向支持 FP8 的 vLLM-Omni、SGLang 和 LightX2V)、一层服务封装、峰值负载下的排队,以及两个可选的提示词改写模型(如果你希望一句话提示词也能用)。作为回报,你获得数据本地性、只有你自己设定的速率限制,以及一个不会被别人暗中更换的固定模型版本。
使用 3.0 意味着你需要负责:一个阿里云账号并选择地域、API key、限流处理,以及托管模型在你的测试运行与生产之间行为发生变化的风险。作为回报,你不需要任何基础设施,只需按张收发票。
如果你是在跨厂商对比而不是在 Qwen 内部对比,Nano Banana 2 API 和 gpt-image-2.5 API 指南也讨论了 Google 和 OpenAI 同样的托管取舍。
决策表
| 你的情况 | 选择 |
|---|---|
| 本季度要上线商业功能,没有法务预算 | 3.0 |
| 需要透明 PNG 或 RGBA 编辑 | 2.1(商业用途需先取得许可) |
| 需要用大量参考图编辑 | 2.1 |
| 多语言的文字密集版式 | 3.0 |
| 研究、评测、内部工具 | 2.1 |
| 每月几千张以下 | 3.0 |
| 每月几万张,已有 GPU 在跑,许可已签 | 2.1 |
| 数据不能出你的网络 | 2.1 |
| 希望每次请求拿到六个候选 | 3.0 |
放在同一个集合里运行两者
对很多团队来说,务实的答案是两者都用:2.1 用于透明素材管线和内部工具,3.0 用于面向客户的文字版式。只要两者处在同一份契约之下,这件事就能干净地运转。
在 Apifox 中定义一次 POST /v1/images 接口,包含 prompt、aspect、transparent、seed 和一个 references 文件字段,然后建两个环境:base_url 指向你的 2.1 封装(操作指南里有一个 40 行的 FastAPI 版本),另一个指向 Model Studio 3.0 接口的适配层。然后:
- 把同一组提示词以固定 seed 分别发给两者,并把响应保存为测试用例。
- 对差异之处做断言:
Content-Type、响应体积下限,以及 2.1 在请求透明输出时的X-Image-Mode: RGBAheader。 - 记录每个请求的响应时间;Apifox 在每次运行时都会显示它,这正是 Qwen 没有公开的吞吐数据。
- 每周运行这个测试场景。当 3.0 的托管行为发生变化,或你把 2.1 换成量化版本时,差异会出现在报告里,而不是工单里。
- 对接口做 mock,让前端在模型选型尚未确定时也能按契约开发。
and import the endpoint to start comparing.
常见问题
Qwen Image 3.0 开源吗? 3.0 与 3.0 Pro 都没有公开权重;它们是托管 API 模型 [VERIFY]。开放权重的是 Qwen-Image-2.1。
Qwen-Image-2.1 可以商用吗? 只有获得 Qwen 单独的商业许可才行。默认的 Qwen Research License 排除了商业用途。
哪个更便宜? 低用量下,3.0 每张 $0.03。用量大、负载稳定,且用的是你已在运行的硬件时,2.1 更便宜——前提是你已取得许可并实测过吞吐。
3.0 能生成透明图像吗? 官方没有宣传这一点。原生 RGBA 输出是 2.1 的能力;参见 What is Qwen-Image-2.1。
两者都能免费试用吗? 2.1 有 Hugging Face Space 和 Qwen Chat 入口;免费额度指南列出了各种选项。3.0 可在 Qwen Chat 中使用,也可通过 Model Studio 的试用额度,额度因地区而异。
下一步
2.1 与 3.0 是一次分叉,而不是升级路径。许可决定第一个问题,负载决定第二个问题,用量决定第三个问题。无论你最终选哪个,都把它放在一份经过测试的契约后面:操作指南构建的是 2.1 那一侧,而同一个 Apifox 集合可以在你需要的那天就接上 3.0 那一侧。
HiFox:将 Agent 变成真正的队友
另外,我们也在思考,AI 如何从个人提效走进团队协作。
HiFox 是一个让人和 AI Agent 在同一个工作现场协作的平台:你可以像给同事分派任务一样指派 Agent,在任务看板中跟踪进度、查看结果,让 Agent 成为团队里的队友。
👉 立即体验 HiFox:https://hifox.com
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,
欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。