# 智能体

Gemini 3.8 Flash 上线:低价推理模型开始重做代码代理的“连续任务”
Gemini 3.8 Flash 上线:低价推理模型开始重做代码代理的“连续任务”
Google 于 9 月 2 日发布 Gemini 3.8 Flash,主打软件工程、代理任务和多步推理;真正值得关注的不是单次回答,而是能否用较低单价把规划、工具调用、测试反馈连成一条更长的任务链。
Google Fairwind:漏洞修复被放进受控闭环,Gemini 3.8 Flash Cyber 暂不开放给所有人
Google Fairwind:漏洞修复被放进受控闭环,Gemini 3.8 Flash Cyber 暂不开放给所有人
Google 9 月 2 日公布 Fairwind 计划,将 Gemini 3.8 Flash Cyber 与 CodeMender 组合,用于在组织受保护环境中发现、验证和生成漏洞修复;它面向可信防御者,重点是缩短修复循环并保留权限与人工接管。
Cursor 推出 Self-hosted machines:云端代理开始在你的内网执行工具调用
Cursor 推出 Self-hosted machines:云端代理开始在你的内网执行工具调用
Cursor 9 月 2 日发布 Self-hosted machines,让 Cloud Agents 在客户自有网络中执行工具操作,并提供个人机器、团队 worker pools、外部沙箱和 Linux/macOS computer use;焦点从模型能否改代码推进到代理在哪里运行、谁管理执行环境。
GPT-6 Astra 发布:多步工具调用开始支持“中途驾驶”,但验收仍要靠团队任务
GPT-6 Astra 发布:多步工具调用开始支持“中途驾驶”,但验收仍要靠团队任务
OpenAI 9 月 3 日介绍 GPT-6 Astra,重点覆盖编码、研究、电脑操作和复杂多步工作;Responses API 支持异步工具调用与中途 steering。团队应验证长任务编排是否减少返工,而不是只看一次性 benchmark。
Claude Fable 5.1 上线:代码审查与长时项目成为模型能力的主战场
Claude Fable 5.1 上线:代码审查与长时项目成为模型能力的主战场
Anthropic 9 月 1 日发布 Claude Fable 5.1,并将其定位在高级编码、代码审查、性能工作和长时自治项目;团队应把连续上下文带来的收益与预算、审阅和回滚一起验证。
Cursor 云端 Agent 接入 Vercel Sandbox:团队可以把执行环境搬到自己的基础设施上
Cursor 云端 Agent 接入 Vercel Sandbox:团队可以把执行环境搬到自己的基础设施上
Vercel 于 2026 年 9 月 3 日披露,Cursor Cloud Agents 可以在 Vercel Sandbox 中执行。真正变化不只是换了运行时,而是把代码修改、命令执行和测试放进团队可控制的隔离环境,同时保留 Cursor 的 Agent 循环。
Muse Spark 1.3 发布:少一点工具调用,不等于少一点人工把关
Muse Spark 1.3 发布:少一点工具调用,不等于少一点人工把关
Meta AI Research 于 2026 年 9 月 2 日发布 Muse Spark 1.3,称其面向长任务和编码工作流,并报告相较 1.2 少约 20% 工具调用、少约 25% token。真正需要评估的是效率、成本与数据治理如何同时变化。
Google 把语音带进 Gmail、Docs 和 Keep:从口述线索到可交付文档的三步工作流
Google 把语音带进 Gmail、Docs 和 Keep:从口述线索到可交付文档的三步工作流
Google 于 2026 年 9 月 3 日宣布 Gmail Live、Docs Live 和 Keep Live 开始滚动推出。三项功能分别处理收件箱问答、免手起草和口述整理,真正的变化是把“想到—查找—成稿”连成一个语音入口,但权限和订阅边界仍需先确认。
VS Code Agent Host:让持久编码会话跨编辑器、浏览器与远程主机继续运行
VS Code Agent Host:让持久编码会话跨编辑器、浏览器与远程主机继续运行
VS Code 于 8 月 26 日公布 Agent Host:会话由独立 Host 持有,编辑器、Agents 窗口、浏览器和远程客户端可连接同一任务。本文拆解它对长任务连续性、审查和远程开发的实际影响。
GitHub Agentic Workflows 加入 cooldown 与 stop-after:Agent 自动化开始有“停机线”
GitHub Agentic Workflows 加入 cooldown 与 stop-after:Agent 自动化开始有“停机线”
GitHub Agentic Workflows 8 月 31 日周报介绍 v0.87.x 预发布线的 cooldown、stop-after 与工具 schema 诊断,重点不是让 Agent 更强,而是让触发频率、生命周期和异常边界变得可配置、可审计。
Cursor Cloud Agents 支持无仓库起步:先做可交互原型,再保存到 Origin
Cursor Cloud Agents 支持无仓库起步:先做可交互原型,再保存到 Origin
Cursor 8 月 27 日允许 Cloud Agents 在没有连接 GitHub 或其他 SCM 时开始工作,满意后再创建 Origin 仓库。本文说明这条路径如何减少原型启动摩擦,以及为什么它仍不能跳过工程治理。
Warp 把 Coding Agent 做成可测量的“软件工厂”:先评分,再让 Agent 提议改配置
Warp 把 Coding Agent 做成可测量的“软件工厂”:先评分,再让 Agent 提议改配置
Warp 8 月 27 日介绍闭环云端软件工厂:用 factory.yaml 版本化 Agent、技能和路由,用 scorer 评估正确性、成本与表达,再由 self-improvement Agent 以 diff 提议改动,最终仍由人审查并合并。
一份 llms.txt 就能触发安装?研究揭示 Coding Agent 的文档供应链边界
一份 llms.txt 就能触发安装?研究揭示 Coding Agent 的文档供应链边界
Ars Technica 8 月 27 日报道一项针对 6,214 个域名的研究:研究人员在 120 个站点的 llms.txt 或 llms-full.txt 中发现指向未注册包或域名的内容,并观察到 Claude、Codex 和 Hermes 参与了相关安装链路。对开发团队而言,文档必须被当作不可信输入,而不是天然的执行授权。
Caddi 发布 Loop Studio:业务人员演示任务后,后台自动化怎样保留可治理的刹车
Caddi 发布 Loop Studio:业务人员演示任务后,后台自动化怎样保留可治理的刹车
Caddi 8 月 24 日发布面向后台流程的 AI Agent 与 Loop Studio。产品把流程发现、屏幕演示、例外追问、权限范围和执行记录放在一起,关键仍是人如何批准变更。
Qwen Code 新增 /advisor:让第二个只读视角检查当前编码对话
Qwen Code 新增 /advisor:让第二个只读视角检查当前编码对话
Qwen Code 新增 /advisor,只读审视当前编码对话并列出风险与缺失证据。它不是自动批准器,而是为 Coding Agent 加入第二意见检查点。
Qoder CN IDE 新增应用窗口快照:把当前页面交给 Agent 分析
Qoder CN IDE 新增应用窗口快照:把当前页面交给 Agent 分析
Qoder CN IDE 在 Windows 新增应用窗口快照。报错页面、设计参考与当前窗口可以成为 Agent 的附件,但权限和敏感信息边界仍需先设好。