如果你已经在使用 Kimi 开展业务,2026 年 7 月 16 日发布的 Kimi K3 会带来一个实际的问题:这是你必须升级的选择,还是一个可以暂时忽略的更大、更昂贵的模型?Kimi K2.7 Code 是 K2 系列中专注于编程的版本,上个季度许多团队已将其接入到他们的 Agent 和 CI 中。而 K3 则截然不同:它是 Moonshot 的新旗舰模型,构建在更大的规模之上,采用了全新注意力机制设计和 1M token 的上下文窗口。本文将深入剖析哪些是真正的改变,哪些是市场宣传,以及如何决定是否进行迁移。
我们在这里并非完全中立:我们撰写了这两款模型的指南,因此这是我们会提供给同行的坦诚的升级建议。由于两者都提供了兼容 OpenAI 的 API,你可以在 Apifox 中并排运行相同的请求,分别发给 kimi-k3 和 kimi-k2-7-code,并在重写任何生产环境代码之前对比输出、延迟和 token 消耗的差异。首先,我们来看看结论。
TL;DR:结论一览
- K3 是规模更大、更通用的模型。 它是一个 2.8T 参数的混合专家(MoE)模型,大约是 K2.7 Code 所属的约 1T 参数级 K2 系列的三倍。K2.7 Code 是编程领域的专家;而 K3 是 Moonshot “能力最强”的旗舰模型,在长程 Agent 编程任务中也表现强劲。
- 上下文跳转到 1M tokens。 K3 可以处理 1,048,576 个 token,这彻底改变了“将整个仓库丢给它”的实际意义。
- 架构是全新的,而不仅仅是规模的扩大。 Kimi Delta Attention、Attention Residuals 以及 Stable LatentMoE 框架(896 个专家中激活 16 个)才是真正的工程突破。
- 价格有所上涨。 K3 的官方定价为:缓存命中输入 $0.30/M,缓存未命中输入 $3/M,输出 $15/M。只有在缓存命中率很高的情况下,低廉的输入成本计算才合算。
- 坦率的上限: Moonshot 自己的博客也表示 K3 仍然落后于 Claude Fable 5 和 GPT-5.6 Sol。对于开源模型来说,它处于前沿水平,但并不是绝对的领跑者。
- 如果出现以下情况,建议迁移: 你需要更大的上下文、更强的通用推理能力,或运行长程 Agent。如果出现以下情况,建议留守 K2.7 Code: 你的工作负载是单一的编程任务,价格符合预期,且 K2.7 已经达到了你的质量标准。
两种不同类型的模型
在对比规格之前,需要明白一点:K2.7 Code 和 K3 是为了完成不同任务而设计的。
Kimi K2.7 Code 是 K2 家族中专注于编程的成员(该家族包括 K2、K2 Thinking、K2.5、K2.6,然后是 K2.7 Code),其参数量上限在 1T 左右。它将该系列的能力重点转向代码生成、修改以及 Agent 开发者任务:如果你的工作是“通过 API 编写和修复代码”,那么它是一个经过调优且性价比极高的选择。关于 K2.7 Code 的具体参数量、上下文和定价,请参阅我们的“什么是 Kimi K2.7 Code”解析。
K3 并不是一个专注于代码(coding)的版本。它是全新的旗舰模型,也是 Moonshot 最强大的通用模型,而代码能力只是其广泛能力集之中的一项强项。因此,你实际面对的并不是旧代码模型与新代码模型之间的对比;你是在将一个专才与一个同样擅长代码的通才进行对比,这才是决定是否迁移的主要因素。
两代模型之间究竟发生了什么变化
抛开市场宣传的辞藻,以下是实际发生的变化。
规模:总参数量大约增至三倍
K3 是一个拥有 2.8T 参数的混合专家(MoE)模型。而此前诞生了 K2.7 Code 的 K2 系列处于约 1T 参数级别,因此 K3 的总参数量大约是其三倍。需要注意的一点是:Moonshot 并未公布 K3 的激活参数量(active-parameter count)。MoE 模型在处理每个 token 时仅运行其部分权重,因此“2.8T 总参数量”并不是决定推理成本的指标。不要将 2.8T 理解为“每次请求都会触发 2.8T 的参数”。不过,Moonshot 确实公布了它的激活模式,我们将在下文介绍。
全新的注意力机制架构,而非单纯的规模扩大
这部分是真正的创新,而不仅仅是体量变大。K3 构建于三个核心部分之上:
- Kimi Delta Attention:一种混合线性注意力机制。与标准的二次方注意力机制相比,线性注意力机制在处理序列长度时具有更好的扩展性,这也是实现 1M token 窗口实用化的关键所在。
- Attention Residuals:Moonshot 将其描述为标准残差连接的直接替代方案。
- Stable LatentMoE:这是一种混合专家框架,在每个 token 处理时仅激活 896 个专家中的 16 个。
Moonshot 报告称,相比 Kimi K2,其扩展效率(scaling efficiency)提升了约 2.5 倍:即在单位计算量下获得更强的能力,而不仅仅是增加计算量。作为 K2 代模型的 K2.7 Code 并没有采用这种重构设计,因此两者之间的差距不仅在于“更大”,更在于“架构不同”。
上下文:支持高达 1M token
K3 支持 1,048,576 token 的上下文窗口。对于编写代码的工作流而言,这意味着你可以一次性将大型真实代码仓库的很大一部分、其测试以及日志直接丢给智能体(agent),而不是只能零星喂给它几个文件。如果你之前在使用 K2.7 Code 处理大型仓库任务时遇到了上下文上限瓶颈,那么这一改变将是日常使用中对你影响最大的一项。
定位:从专才到旗舰通才
K2.7 Code 是一个专注于代码的版本;而 K3 则是旗舰级的“全能型”模型,并且同样擅长执行长周期的智能体化(agentic)代码编写任务。Moonshot 展示了其在解决复杂的、多步骤问题上的自主运行能力,其中包括在一个芯片设计任务上单次持续运行 48 小时的案例。这些案例是否适用于你的工作负载,需要你自己进行测试,而不是盲目相信。但其意图显而易见:K3 旨在服务于那些运行时间长且需要保持状态的智能体,而在这种场景下,1M 上下文和全新的注意力机制设计将能充分发挥其优势。
定价:旗舰级费率
K3 的公开定价为:缓存命中输入每百万 token 0.30 美元,缓存未命中输入每百万 token 3 美元,输出每百万 token 15 美元。输入端 10 倍的价差是很有意思的地方。在缓存命中率高的工作负载中(例如在多次调用中重复使用大型系统提示词和仓库上下文的智能体编程),实际输入成本会非常接近 0.30 美元,而不是 3 美元;而在使用全新上下文的单次调用中,你则需要支付 3 美元的标价。每百万 token 15 美元的输出价格属于旗舰级水平,没有任何折扣杠杆。关于完整的缓存计算,请参阅我们的 Kimi K3 定价指南,并在假定 K3 在单次任务中绝对更贵之前,先确认 K2.7 Code 的费率。
K3 在行业前沿中的真实定位
我们很容易将“2.8T 旗舰”解读为“最新的最强模型”,因此这里有必要说明一下厂商通常会淡化的部分。Moonshot 自己的发布博客中也提到,K3 仍落后于 Claude Fable 5 和 GPT-5.6 Sol。虽然它在特定基准测试上具有竞争力,甚至在某些方面处于领先地位,但它并未声称自己夺得了总冠军的桂冠。
独立的评估结果也印证了这一点。Artificial Analysis 将 K3 的 智能指数定为 57,在 189 个模型中排名第 4,输出速度约为每秒 62 个 token,在其所处的价位段中偏慢。在 Moonshot 公布的代码基准测试中,结果互有胜负,而非呈现压倒性优势:在 DeepSWE 上,K3 的得分为 67.5,而 Fable 5 为 70.0;在 Terminal-Bench 2.1 上,K3 的得分为 88.3,而 Fable 5 为 84.6。与前沿模型相比,K3 互有胜负。对于一个开源权重模型来说,这已经是一个很强的结果,但没必要过度吹捧。欲了解 Moonshot 的完整声明,请阅读 Kimi K3 官方发布文章;我们将在 Kimi K3 基准测试分析中详细剖析官方数据与独立测试之间的差距。
在做迁移决策时,“相比自家前代产品有显著提升”与“击败所有闭源模型”是两个不同的概念。但这两者目前同时成立。
您应该迁移还是继续使用 K2.7 Code?
请根据您的工作负载依次思考以下问题。
如果符合以下任一情况,请迁移至 K3
- 您遇到了上下文限制。 如果 K2.7 Code 在处理大型仓库任务、整个服务重构或冗长的 Agent 对话历史时出现内容截断,那么 1M 的上下文窗口就是最明确的迁移理由。原生的容量优势是无可替代的。
- 您的任务属于长流程且是 Agent 化的。 需要在多次工具调用中保持状态的多步骤运行是 K3 的设计初衷。如果您的 Agent 在执行长任务时容易“跑偏”,可以测试一下 K3 是否能更好地保持上下文连贯性。
- 您需要通用的推理能力,而不仅仅是代码。 如果您的产品将代码与规划或分析混合在一起,那么仅专精于代码的模型可能不是合适的工具。
- 您的缓存命中率很高。 在多次调用中复用大型系统提示词(system prompt)和共享上下文,可以利用 K3 仅为 $0.30 的缓存命中输入计费来摊薄旗舰模型的定价,从而使实际使用成本接近您在 K2.7 上的花费。
如果符合以下任一情况,请继续使用 K2.7 Code
- 您的工作负载仅限于特定领域的代码编写,且 K2.7 已经能满足要求。 如果当前的生成质量尚可且能正常交付,那么使用更大的旗舰模型可能会带来不必要的成本。“够用且更便宜”是一个完全合理的选择。
- 您对成本敏感,且缓存复用率较低。 每次都是全新上下文的单次(one-shot)调用需要支付 K3 $3 的缓存未命中输入和 $15 的输出费用。因此,在没有高缓存命中率的情况下,使用旗舰模型的经济账很难算得通。
- 延迟比巅峰智能水平更重要。 K3 约 62 tokens/秒的速度低于其所处价位段的中位数。如果您的应用受延迟限制,在假设更大模型体验更快之前,请先进行基准测试。
- 开源权重是您方案的先决条件。 K3 的权重预计将于 2026 年 7 月 27 日左右发布,因此任何本地部署需求都应以 Moonshot 在 Hugging Face 上的实际发布页面为准,而不应想当然地认为已经发布。
实际应用场景
抽象的建议作用有限,下面我们来看几个具体的应用画像。
中等规模仓库上的 CI 代码修复机器人。 如果它在 K2.7 Code 上已经能通过测试且保持低成本,你可能不需要 K3。任务单一、上下文契合、单次运行成本敏感。保持原状即可;只有在失败率上升时再重新评估。
大型 Monorepo 上的自主重构 Agent。 这是 K3 的主场:1M 上下文可以一次性加载更多代码库、测试和日志,且其长程(long-horizon)设计专为跨多个步骤修改多个文件的运行而生。值得进行实际尝试。
对于实际配置,我们的 Kimi K3 编码实操和 Kimi K3 API 指南涵盖了模型选择以及兼容 OpenAI 的快速入门;如果你仍在使用较旧的版本线,K2.6 说明文档填补了这一脉络。
如何在决定采用前对两者进行 A/B 测试
最干净的决策方式是将相同的请求发送给这两个模型,并对比其差异。由于两者都兼容 OpenAI-SDK,这几乎不需要什么工作量。
将一个请求指向 Moonshot 接口,模型设置为 kimi-k2-7-code,然后发送第二个相同的请求,模型设置为 kimi-k3。保持其他所有参数不变:相同的 system prompt、user message、temperature 和 tools。然后比较决定你决策的这三个方面:
- 在你真实 Prompt 下的输出质量,应以评估生产环境输出的标准来判断,而不是凭感觉。
- 延迟(Latency),因为根据其独立的速度数据,K3 是较慢的模型,这在交互式应用中可能会抵消质量提升带来的优势。
- Token 开销,包括缓存命中率如何改变两者之间的实际输入成本。
Apifox 让这种直观的对比工作流变得非常简单。将这两个请求保存在同一个项目中,将模型 ID 替换为环境变量,实时观察 Server-Sent Events(SSE)流式响应,检查 tool-call 负载,并查看每次调用的 Token 使用情况。复制请求,修改一个字段,你就可以在无需编写临时测试套件代码的情况下进行受控的 A/B 测试。下载 Apifox 进行设置,如果你习惯在编辑器中工作,VS Code 中的 Apifox 集成能让你在代码旁直接使用它。这是一种基于事实而非营销宣传进行决策的免费方式。

核心结论
K3 是超越 K2.7 Code 的真正跨代飞跃,而不仅仅是改个名字。它将总参数量大约翻了三倍,达到 2.8T,采用了全新的注意力机制架构(Kimi Delta Attention、Attention Residuals、Stable LatentMoE),将上下文扩展到 1M token,并将产品定位从编程专有模型重塑为旗舰级通用模型。它的标价也更高,并且正如 Moonshot 自己所承认的那样,它仍然落后于 Fable 5 和 GPT-5.6 Sol,因此升级并不是理所当然的。如果你需要大上下文、通用推理能力或长程 Agent 行为,那就升级吧。如果 K2.7 Code 已经以你满意的价格达到了你的标准,那么保持现状也是合理的。在你自己常用的 Prompt 上运行这两个模型,对比差异,让事实来做决定。
button
常见问题解答
哪一个更适合编程? K2.7 Code 专门针对编程进行了微调,是处理特定编码任务的强劲且具性价比的选择。K3 是一款旗舰级通用模型,同样擅长长流程 Agent 级编码,并拥有大得多的上下文。对于大型仓库(big-repo)、多步骤的 Agent 工作,K3 具有结构性优势;而对于特定编码,K2.7 应对自如,选择 K2.7 Code 会是更划算的支出。
Kimi K3 比 K2.7 Code 更贵吗? K3 的官方定价为:缓存命中输入 $0.30/M,缓存未命中输入 $3/M,输出 $15/M,这属于旗舰级定价。每个任务的实际成本是否更高,取决于您的缓存命中率和输出字数,因此建议根据您自己的工作负载来对比实际成本。两款模型都兼容 OpenAI-SDK,所以切换模型基本上只需要修改 model-ID 并重新测试提示词(prompt)即可。
Kimi K3 开源了吗? 发布首日并未开源。Moonshot 表示,完整模型权重预计将在 2026 年 7 月 27 日左右公布。在权重正式发布之前,K3 仅提供 API 和 App 版本。任何私有化部署计划都需以该版本的发布为前提。
K3 比 Claude Fable 5 或 GPT-5.6 Sol 更好吗? 根据 Moonshot 自己的官方博客,答案是否定的。虽然 K3 在某些特定基准测试中具有竞争优势或处于领先地位,但整体上仍然落后于这两者。根据第三方机构 Artificial Analysis 的独立评估,它的智能指数(Intelligence Index)为 57,在 189 个模型中排名第 4。它是一个强有力的开放权重竞争者,但并非绝对的前沿领跑者。
开发必备:API 全流程管理神器 Apifox
介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。
如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。
获取专属报价与部署方案
详细的私有化部署系统架构与安全白皮书
针对您公司规模的专属报价单
免费的 1v1 专属产品演示 (Demo) 机会