Qwen-Image-2.1 对比 Qwen Image 3.0:开放权重还是托管 API?

Qwen-Image-2.1(开放权重、研究许可、原生透明)对比 Qwen Image 3.0(托管 API、$0.03 每张、密集文字):许可证、成本、能力与决策表。

用 Apifox,节省研发团队的每一分钟

Qwen-Image-2.1 对比 Qwen Image 3.0:开放权重还是托管 API?

免费使用 Apifox

相关推荐

最新文章

API

一体化协作平台

API 设计

API 文档

API 调试

自动化测试

API Mock

API Hub

立即体验 Apifox
目录

阿里现在有两条 Qwen 图像模型线,它们并不共用版本序号。Qwen-Image-2.1 发布于 2026 年 9 月 20 日,是开放权重模型:生成器 7B 参数、原生透明输出、最多 10 张参考图的编辑能力,可从 Hugging Face 下载。Qwen Image 3.0 和 3.0 Pro 于 7 月 22 日公布、自 2026 年 8 月 4 日起在 API 上提供,是托管模型,按张计费且不公开权重。名字上看起来“3.0 更新”,但更诚实的说法是:它们回答的是不同的问题——你是想自己跑这个模型,还是租用它?

本文从许可证、成本、能力和运维四个维度把两者并排比较,最后给出一张决策表。想看 2.1 的功能介绍请参考 What is Qwen-Image-2.1;想看代码,请看 how-to guide。无论选哪个,最终都会变成一个应用调用的 HTTP 接口,而 Apifox 可以把两者放在同一个集合里,让切换只需改一项配置。

AI Coding 交流群

如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。

并排对比

Qwen-Image-2.1 Qwen Image 3.0 / 3.0 Pro
发布时间 2026 年 9 月 20 日 2026 年 7 月 22 日公布;2026 年 8 月 4 日上线 API
分发方式 开放权重(Hugging Face、ModelScope) 仅托管 API;不公开权重 [VERIFY]
许可证 / 条款 Qwen Research License;商业使用需要单独许可 标准 API 服务条款
价格 你自己的 GPU 时间 qwen-image-3.0:$0.03/张(1K 或 2K)。qwen-image-3.0-pro:1K 为 $0.04,2K 为 $0.075。输入图片 $0.003/张 [VERIFY]
生成器规模 7B(32 层 Single-Stream DiT)+ Qwen3-VL 8B 编码器 未披露
最大分辨率 默认 2048 x 2048;最高 2752 x 1536 2048 x 2048
透明输出 原生 RGBA 生成和编辑 未宣传
参考图 最多 10 张 支持输入图片(按张计费);上限未公布 [VERIFY]
局部编辑 圆圈标注、手绘涂鸦、独立 mask 发布材料中未宣传
文字渲染 改进的排版、风格和版式 核心卖点:约 10 px 的细小文字,12 种语言(自我报告)
单次调用输出数 一张(需要自己循环) 最多 6 张
prompt 长度 未说明 Pro 上约 4.5K token(官方说法)
prompt 改写 需要你自己运行独立的 PE-T2I / PE-I2I 模型 服务端处理
试用入口 HF Space、Qwen Chat、ComfyUI Model Studio 控制台、Qwen Chat

3.0 这一列的信息来源是阿里 7 月的公告,以及 LLM Stats 整理的 QwenCloud 文档;做预算前请在 Model Studio 上重新核对价格表,因为图像定价因地区而异。

许可证是第一道筛子

对大多数团队来说,这一行就已经结束比较了。2.1 的许可证规定,未经单独的商业许可,你“不得将本材料用于任何商业目的”。这与最初的 Qwen-Image 所采用的 Apache 2.0 条款不同,也意味着基于 2.1 构建的面向客户的功能,在上线前需要给 Qwen 商务团队发一封邮件并签署协议。

Qwen Image 3.0 是一个采用标准商业条款的付费 API。按张付费,然后就可以发布。

所以:研究、评估、内部工具,或者你愿意协商许可的项目,2.1 是可以考虑的。本季度就要交付、又没有法务预算的产品功能,3.0 是默认选择。

成本:GPU 账单 vs 每张三分钱

3.0 的标准档在两种分辨率下都是 $0.03/张,所以每月 1 万张就是 $300,编辑时每张输入图片再加 $0.003。Pro 在 2K 下价格翻倍。

自托管 2.1 没有按张计价,但只有在达到一定量级、且 GPU 本来就会闲置的情况下,这笔账才算得过来。Qwen 没有公布吞吐量数据,所以你得自己测:在单张数据中心 GPU 上以 40 步、2048 x 2048 运行,统计每小时能出多少张,除以小时费率,再和 $0.03 比较。使用大量参考图的编辑正是 2.1 的 KV cache 复用发挥作用的地方,因为参考图是每个请求编码一次,而不是每一步都编码。如果你的 GPU 还要和其他负载共享,请记住图像生成在突发时会独占它。

一个粗略的经验法则:每月几千张以内,算上工程时间,API 更便宜。每月数万张以上、负载稳定并且已经签好许可协议,自托管更划算。介于两者之间,取决于你是否已经在运行 GPU。

能力:透明通道 vs 密集文字

这两个模型是为不同的任务构建的。

当输出需要 alpha 通道时,选 2.1。 贴纸、商品抠图、UI 素材、分层合成、从照片中抠出主体并输出 RGBA:2.1 在同一个模型中原生支持这些,包括在不丢失透明度的前提下编辑透明图层。3.0 的发布材料没有提到 alpha 输出。要在 3.0 上实现,就意味着额外加一步背景移除,并随之带来光晕伪影。

当编辑是主要工作负载时,选 2.1。 十张参考图、按圆圈或涂鸦或 mask 选择区域,以及在人脸和商品上的保真度处理,是 2.1 这次发布的中心内容。发布说明里展示了用六张人像合成合影、用五张商品图生成穿搭、以及用十张家具照片布置出一间房。

当图像主要内容是文字时,选 3.0。 仪表盘、线框图、海报,以及包含多语言细小文字的幻灯片式版式,是 3.0 调优的方向。2.1 也改进了排版,但 3.0 的“12 种语言下 10 px 文字”是更强的公开主张,而 Pro 上 4.5K token 的 prompt 预算也更适合长篇版式说明。

需要单次调用返回多个候选时,选 3.0。 每次请求最多 6 张输出是 2.1 没有的工作流特性;用 2.1 你得自己遍历 seed。

两家的页面都没有给出带数字的基准表。2.1 的发布文章展示了一张 Qwen-Image-Bench 图表;3.0 的主张属于自我报告。请把两者都当作你自己评估的输入,而 Apifox 那一节可以让这件事变得可重复。

运维:你要承担什么

自托管 2.1 意味着你要负责:模型下载和更新、显存足够的 GPU(Qwen 没有公布显存表;README 提供了 CPU offload,并指向带 FP8 的 vLLM-Omni、SGLang 和 LightX2V)、一个服务封装、突发负载下的排队,以及两个可选的 prompt 改写模型(如果你希望一句话 prompt 也能用)。作为回报,你得到数据本地化、除你之外没有别人设的速率限制,以及一个不会被人从背后改掉的固定模型版本。

使用 3.0 意味着你要负责:阿里云账号和地域选择、API key、限流处理,以及托管模型在你的测试运行和生产之间行为发生变化的风险。作为回报,你得到零基础设施和一张按张计费的账单。

如果你是在跨厂商比较而不只是在 Qwen 内部比较,Nano Banana 2 API 和 gpt-image-2.5 API 两篇指南讨论了 Google 和 OpenAI 面临的同类托管权衡。

决策表

你的情况 选择
本季度就要交付商业功能,没有法务预算 3.0
需要透明 PNG 或 RGBA 编辑 2.1(商业用途需许可)
使用大量参考图做编辑 2.1
多语言、文字密集的版式 3.0
研究、评估、内部工具 2.1
每月几千张以内 3.0
每月数万张,已有 GPU 在跑,许可证已签 2.1
数据不能离开你的网络 2.1
希望每次请求返回六个候选 3.0

把两者放在同一个集合里运行

对很多团队来说,实际答案是两者都用:2.1 负责透明素材流水线和内部工具,3.0 负责面向客户的文字版式。只要两者处于同一份契约之后,这个方案就很干净。

在 Apifox 中,一次定义好 POST /v1/images 接口,包含 prompt、aspect、transparent、seed 和一个 references 文件字段,然后建两个环境:一个 base_url 指向你的 2.1 封装(how-to guide 里有一个 40 行的 FastAPI 版本),另一个指向 Model Studio 3.0 接口的适配层。接着:

  • 用固定 seed 把同一组 prompt 发给两者,并把响应保存为测试用例。
  • 对有差异的部分做断言:Content-Type、响应体大小下限,以及 2.1 在请求透明输出时的 X-Image-Mode: RGBA 响应头。
  • 记录每个请求的响应时间;Apifox 每次运行都会展示它,这正好是 Qwen 没有公布的吞吐量数字。
  • 每周运行一次该场景。当 3.0 的托管行为发生变化,或者你把 2.1 换成量化版本时,差异会出现在报告里,而不是出现在支持工单里。
  • 把接口 mock 掉,让前端在模型选型尚未确定时就能按契约开发。

常见问题

Qwen Image 3.0 是开源的吗? 3.0 和 3.0 Pro 都没有公开权重,它们是托管 API 模型 [VERIFY]。Qwen-Image-2.1 才是开放权重的那个版本。

Qwen-Image-2.1 可以商用吗? 只有获得 Qwen 单独的商业许可才可以。默认的 Qwen Research License 排除商业使用。

哪个更便宜? 低用量下,$0.03/张的 3.0 更便宜。高用量、稳定负载且硬件已经在跑的情况下,在你拿到许可并测出自己的吞吐量之后,2.1 更划算。

3.0 能生成透明图像吗? 官方没有宣传这一点。原生 RGBA 输出是 2.1 的特性;参见 What is Qwen-Image-2.1。

可以免费试用其中任意一个吗? 2.1 有 Hugging Face Space 和 Qwen Chat 入口;free-tier guide 列出了各种选项。3.0 可以在 Qwen Chat 中使用,也可以通过 Model Studio 的试用额度访问,额度因地区而异。

接下来做什么

2.1 和 3.0 是一次分叉,而不是一条升级路径。许可证决定第一个问题,工作负载决定第二个,用量决定第三个。无论你最终落在哪一边,都把它放在一份你会去测试的契约之后:how-to guide 构建了 2.1 那一侧,而同一个 Apifox 集合可以在你需要的那天就接管 3.0 那一侧。

HiFox :将 Agent 变成真正的队友

另外,我们也在思考,AI 如何从个人提效走进团队协作。

HiFox 是一个让人和 AI Agent 在同一个工作现场协作的平台:你可以像给同事分派任务一样指派 Agent,在任务看板中跟踪进度、查看结果,让 Agent 成为团队里的队友。

👉 立即体验 Hifox:https://hifox.com

AI Coding 交流群

如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。