Devin Fusion 进入 Desktop 与 CLI:选 lead 和 sidekick,而不是再换一个更贵模型

Cognition 把 Fusion 双模型 harness 做到 Devin Desktop 与 CLI:Fable 5.1 规划验收,SWE-2 执行。产品方数据显示任务花费可降约 36%–39%,但部分基准分数会下滑。

用 Apifox,节省研发团队的每一分钟

Devin Fusion 进入 Desktop 与 CLI:选 lead 和 sidekick,而不是再换一个更贵模型

免费使用 Apifox

相关推荐

最新文章

API

一体化协作平台

API 设计

API 文档

API 调试

自动化测试

API Mock

API Hub

立即体验 Apifox
目录

Cognition 在 2026 年 9 月 11 日发布博文 Introducing Fusion in Devin Desktop & CLI:此前在 Devin Cloud 预览的双模型 harness,现在可以在 Desktop 和 CLI 里直接选用。你不再只挑一个模型,而是指定一个 lead 和一个 sidekick。官方推荐配对是 Fable 5.1 做 lead、SWE-2 做 sidekick。Cognition 称这是 Fable 与 Astra 上「最有效率的前沿 harness」,在主要编码测试上「最高约 39% 更有效率」——这是产品方数据,不是独立复测。博文日期写作 09.11.26。

Devin CLI 的 Fusion 模型选择界面,需分别指定 Lead 和 Sidekick
官方演示动图截帧:Fusion 模式下要分别选 Lead 与 Sidekick。来源:Cognition「Introducing Fusion in Devin Desktop & CLI」。

团队原先的摩擦是:长任务一上来就用最贵模型,token 账单先炸;改用便宜模型,规划阶段又在歧义处走偏。按提示词做路由更糟——任务有多难,往往要读过代码才知道;中途换模型还会打断 prompt cache。本文只写 Desktop/CLI 这次落地,以及它怎样改「选模型」这一步。Fusion 最早在 2026 年 6 月的 Cloud 预览里出现,这次是把同一套 harness 交到本机工作流。

AI Coding 交流群

如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。

发生了什么

Fusion 把一次会话拆成两个并行 agent,各自有工具和缓存。Lead 始终掌管会话:给委派任务写 brief(约束加成功标准),审查结果,面向用户,并可随时收回控制权。Sidekick 负责探索代码、实现、测试并回报。两边交换的是 brief、结果和反馈,不是完整转录,缓存因此能保住。Cognition 明确反对「看第一句提示就路由」:难度在检查代码之前未知,中途换模型会打断缓存。Lead 始终是面向用户的那个 agent,Sidekick 不直接对用户回话。

Harness 行为按配对变化。更弱的 sidekick 会拿到更处方化的 brief、更少被允许顶嘴;更强的 sidekick 可以挑战计划、参与早期探索。规划相关的探索不应交给弱 sidekick。官方推荐 Fable 5.1 + SWE-2,并强调通用指令会伤分数,配对必须单独调。启用时要选两个模型,而不是一个。

Artificial Analysis Coding Agent Index v1.5 上,Cognition 公布:Claude Code + Fable 5.1(max)62.2 分、12.36 美元;Fusion Fable 5.1 + SWE-2 为 61.7 分、7.90 美元,约便宜 36%。Codex + Astra(max)61.6 分、7.47 美元;Fusion Astra + SWE-2 为 58.9 分、4.54 美元,约便宜 39%。分数接近,花费下降,但 Astra 组合在这项指数上低了 2.7 分。

分项基准同样来自这篇博文。DeepSWE 1.1:Fable 5.1 为 64.3 分、14.63 美元,Fusion Fable 为 63.1 分、7.88 美元(约 −46%);Astra 为 67.6 分、7.88 美元,Fusion Astra 为 67.3 分、4.69 美元(约 −40%)。SWE-Atlas QnA 上 Fusion Fable 从 64.8 分升到 65.9 分,花费从 7.57 美元降到 5.00 美元;Fusion Astra 从 61.8 分、5.72 美元降到 59.4 分、3.59 美元。Vals Code Migration 上 Fusion Fable 从 54.6 分升到 57.3 分,花费从 70.97 美元降到 42.00 美元。这些数字必须标成产品方数据。

一次完整工作场景

输入是你已经在用的 Devin Desktop 或 CLI。CLI 安装命令写在博文里:curl -fsSL https://cli.devin.ai/install.sh | bash。装好后打开 Fusion,选 lead 和 sidekick,而不是只点一个模型名。用户仍然只跟 lead 说话:描述迁移、修 bug 或实现功能。界面上能看到 Lead 与 Sidekick 两个选择器,而不是单一模型列表。

操作上,lead 把工作切成带约束的 brief 交给 sidekick。sidekick 在自己的工具循环里改代码、跑测试,把结果送回。lead 验收,不合格就收回控制权或改 brief 再派。因为交换的不是整段转录,两边的 prompt cache 可以分开累积。官方举过一次会话构成:11.3 万 Fable 5.1 token 加 9.7 万 SWE-2 token,共 21 万,比全程 Fable 5.1 大约便宜 39%。

交付仍是 lead 汇总后的代码、测试结果和说明。反馈回路是看任务级花费和是否返工,而不是看哪个模型的百万 token 单价更低。Cognition 的原话是:模型和 model-harness 组合应该按「每个任务多少钱」评估,而不是按「每 token 多少钱」。评测合作方写明是 Artificial Analysis 与 Vals AI。

Fusion 在 DeepSWE、Terminal-Bench、SWE-Atlas 等基准上的分数与花费对照表
编辑绘制:转述 Cognition 2026-09-11 博文中的基准数字。DeepSWE 上 Fusion 可降费约 40%–46%;Astra 在 Terminal-Bench 4 从 55.6 降到 50.0。不是独立复测。

为什么这会改变「选模型」这一步

以前工作流是:任务进门 → 人选一个模型 → 模型自己规划并实现 → 账单按该模型全量 token 出。Fusion 把中间改成:任务进门 → 人选配对 → lead 规划并验收 → sidekick 执行。Cognition 还写过一个反直觉结论:「用更贵的模型有时会让整个系统更便宜」。他们举例:Fable 做 lead 对比 Opus 4.8,尽管 Fable 单价更高,平均任务成本大约低 9%;在 Astra Fusion 的 FrontierCode 上,SWE-2(0.75 美元/百万 token)对比 GPT-5.6 Luna(0.20 美元/百万 token)得到 63.4 分、2.34 美元,对上 62.0 分、2.39 美元——更便宜的 sidekick 并不自动更省。

他们把 FrontierCode 的回合花销拆成:Plan 32%、Setup 34%、Implementation 5%、Debug 17%、Validate 9%,其余收尾。实现本身只占 5%,所以把规划交给弱模型省下的单价,很容易被返工吃回去。这就是工作流真正改动的一步:人选的不再是「今晚用哪个旗舰」,而是「谁写 brief、谁落地、验收权在谁」。Terminal-Bench 4 上 Fusion Fable 花费从 17.46 美元降到 13.37 美元(约 −23%),Fusion Astra 从 10.08 美元降到 6.06 美元(约 −40%),但 Astra 分数从 55.6 掉到 50.0,说明降本和保分不能当成同一件事。

限制与人必须接管的点

数字不是全面胜利。Astra 在 Terminal-Bench 4 从 55.6 降到 50.0;Index v1.5 上 Fusion Astra 也低于单模型 Astra。Vals Code Migration 上 Fusion Fable 从 54.6 升到 57.3,但 Fusion Astra 从 67.7 降到 61.3,花费从 44.36 美元降到 35.51 美元。FrontierCode 1.1 上 Fusion Fable 几乎持平(63.6 到 63.5)同时从 2.68 美元降到 1.67 美元;Fusion Astra 在同一项上是 63.4 分、2.34 美元。配对必须调 brief;把规划探索交给弱 sidekick,是官方点名不要做的事。

这些分数来自与 Artificial Analysis、Vals AI 的合作评测,是产品方公布值。CLI 安装脚本走官方域名,仍要在可信环境执行。Fusion 不管你的仓库权限、密钥和合并门禁:lead 审查的是 sidekick 回报,不是你的生产变更流程。人要接管的是配对选择、失败基准上的回退,以及 lead 说「完成」之后的代码审查。不要把「最高约 39% 更有效率」读成每一项任务都更便宜或更高分。

如何试用

安装 Devin CLI 或打开 Desktop,启用 Fusion,按官方推荐先试 Fable 5.1 + SWE-2。先拿一条你熟悉的仓库任务看花费和返工,不要一上来用它做不可回滚的迁移。若某类任务分数明显下滑,把 lead 的 brief 写得更处方化,或把规划探索收回 lead。Cloud 上的 Fusion 预览和这次 Desktop/CLI 落地是同一套分工,但本机入口改变的是日常编码会话,而不是云端队列策略。SWE-Atlas 上 Fusion Astra 花费约降 37%,分数同时从 61.8 降到 59.4,试用时要把这类下滑单独记下来。

信息来源

开发必备:API 全流程管理神器 Apifox

介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。

如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用

Apifox

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案

获取专属报价与部署方案

icon 详细的私有化部署系统架构与安全白皮书
icon 针对您公司规模的专属报价单
icon 免费的 1v1 专属产品演示 (Demo) 机会
获取部署方案
* 提交后,我们的客户经理将在 1 个工作日内与您联系
林俊锋 企业微信
@Apifox 专属顾问
扫码备注: 私有化 + 公司名