# 工具评测

OpenAI 上线 Decisions API:判定类调用不再生成文本,答案快 10 倍只收输入的钱
OpenAI 上线 Decisions API:判定类调用不再生成文本,答案快 10 倍只收输入的钱
POST /v1/decisions 对同一输入一次回答多个类型化问题,返回概率、选项或分数;官方称比 Responses API 快约 10 倍,当前仅 gpt-6-luna,只按输入计费。
Claude Haiku 5.5 发布:价格最高降九成,编码子代理可以整体换引擎
Claude Haiku 5.5 发布:价格最高降九成,编码子代理可以整体换引擎
10 万 tokens 以内输入 $0.10、输出 $0.50 每百万,比 Haiku 4.5 低 90%;首个支持 effort 调节的 Haiku,官方定位编码子代理。
GitHub 为 Agent 规模重建 Git 基础设施:提交量同比涨超 5 倍,写吞吐内部基准最高 35 倍
GitHub 为 Agent 规模重建 Git 基础设施:提交量同比涨超 5 倍,写吞吐内部基准最高 35 倍
GitHub 工程博客披露正在重建 Git 基础设施:agent 几乎每个动作后都提交,push 与写入吞吐需要提升数个数量级。现有 Spokes 多副本模型让“加副本吸收读负载”反而拖慢写入,新方向是把协调压到最小、让存储与计算解耦。
Vercel AI Gateway 加了“置信度回退”:决策模型答得不自信就换模型重跑,两次都计费
Vercel AI Gateway 加了“置信度回退”:决策模型答得不自信就换模型重跑,两次都计费
Vercel AI Gateway 上线置信度回退:决策模型返回的置信度低于你设定的阈值时,网关把这次决策交给回退模型重做。Choice/Score 用阈值、Boolean 用概率区间,触发的两次决策都会计费,功能仍在 beta。
Cursor 把本地 Agent 接到手机上:Remote Control 默认开启,电脑得一直开机插着电
Cursor 把本地 Agent 接到手机上:Remote Control 默认开启,电脑得一直开机插着电
Cursor 发布 Remote Control:在 Cursor iOS App 里查看和回复跑在自己电脑上的本地 Agent。默认全员开启(Enterprise 除外),Agent 不搬到云端,代价是电脑必须开机联网、插电并保持开盖。
GitHub 堆叠 PR 正式 GA:栈作为单个合并组进队列,rebase 后审批不再被清空
GitHub 堆叠 PR 正式 GA:栈作为单个合并组进队列,rebase 后审批不再被清空
GitHub 把堆叠 PR 从 public preview 转正:栈作为一个 merge group 进出合并队列,rebase 后未改动代码上的审批会被保留,webhook 新增 stacked 动作。auto-merge 仍在滚动推出。
Actions Runner Controller 0.15.0 发布:自托管 Runner 集群补上原地升级、优雅停机与并发控制
Actions Runner Controller 0.15.0 发布:自托管 Runner 集群补上原地升级、优雅停机与并发控制
GitHub 发布 Actions Runner Controller 0.15.0:补丁升级改为原地修改资源,停机时间与并发、限流、事件过滤均可配置,官方未提及破坏性变更。
Claude Cowork 把执行环境整体搬进云端:10 月 6 日起 Pro/Max 新任务不再跑本地 VM
Claude Cowork 把执行环境整体搬进云端:10 月 6 日起 Pro/Max 新任务不再跑本地 VM
Claude 官方文档称云端 Cowork 的 agent loop 与代码执行都跑在 Anthropic 服务器上,10 月 6 日起 Pro/Max 新任务转入云端,本地文件仍经桌面端代取。
GitHub Secret Scanning 新增 5 类密钥检测:AI 生成的密钥进了公开仓库,发行方先收到通知
GitHub Secret Scanning 新增 5 类密钥检测:AI 生成的密钥进了公开仓库,发行方先收到通知
GitHub 把 Lovable、Pydantic、Supabase 的 5 类密钥纳入 Secret Scanning;公开仓库命中合作方密钥时会自动上报发行方,由其撤销或轮换。
Cloudflare OS 开放托管版等待名单:Agent 工作区开始接 GitHub 仓库与 Gmail
Cloudflare OS 开放托管版等待名单:Agent 工作区开始接 GitHub 仓库与 Gmail
Cloudflare OS 开放全托管版等待名单:开通只需指定自定义域名、Access 策略与 AI Gateway;同时新增挂载 GitHub 仓库并开 PR、Gmail 收发与草稿、以及 Excel/CSV/PDF/Markdown/HTML 导出。
Vercel Agent 支持安装私有 npm 包:凭据不进沙箱,Agent 读不到 token
Vercel Agent 支持安装私有 npm 包:凭据不进沙箱,Agent 读不到 token
Vercel Agent 现在可以安装私有 npm 包:用 NPM_TOKEN 或 NPM_RC 作为团队共享环境变量,认证在注册表请求离开沙箱时完成,凭据值留在沙箱之外,Agent 与沙箱内进程都读不到。
Cloudflare AI Search 正式 GA:图片改为像素级嵌入,11 月 1 日开始计费
Cloudflare AI Search 正式 GA:图片改为像素级嵌入,11 月 1 日开始计费
Cloudflare AI Search 正式 GA:新增原生图像嵌入、PDF OCR,文件上限从 4 MiB 提到 10 MiB;2026 年 11 月 1 日起计费,免费额度从共享 2,000 次查询改为语义与全文各 1,000 次。
Claude Code 2.1.287 加入 Claude Mods:插件可以改到更深一层,权限规则成了主要成本
Claude Code 2.1.287 加入 Claude Mods:插件可以改到更深一层,权限规则成了主要成本
Claude Code 2.1.287 加入 Claude Mods,官方措辞是插件可以修改更深层的行为,并附带内置 Mod「You should know」。随后两版的修复集中在权限优先级、组织管控不可被改写、以及 Mod 绘制失败只坏自己。
llama.cpp 上线 Decision Models:模型不再生成文本,改为给选项打分,单题最低 3 毫秒
llama.cpp 上线 Decision Models:模型不再生成文本,改为给选项打分,单题最低 3 毫秒
llama.cpp 服务端新增 /v1/systemone,用打分代替生成来回答选择题、打分题和是非题;官方放出 6 个决策模型,最小 144M,单题延迟 3 毫秒起,并说明了置信阈值必须自行标定。
ServiceNow 发布 AutoSynthData:把 Agent 的失败自动转成训练数据,ITSM 场景 Pass@1 从 18.77% 提到 27.18%
ServiceNow 发布 AutoSynthData:把 Agent 的失败自动转成训练数据,ITSM 场景 Pass@1 从 18.77% 提到 27.18%
ServiceNow CoreAI 发布 AutoSynthData:一条把 Agent 失败转成合成训练数据的流水线,靠目标模型与教师模型的差异定位短板,再批量造题、验证、微调。Hybrid 场景 Pass@1 提升 7.2 个百分点,ITSM 场景从 18.77% 提到 27.18%。
Ai2 开源 AstaBrief 8B:一次生成带引用的科研报告,51 秒完成原本 178 秒的活
Ai2 开源 AstaBrief 8B:一次生成带引用的科研报告,51 秒完成原本 178 秒的活
Ai2 开源 AstaBrief 8B,基于 Qwen3-8B,用 SFT + DPO 训练,把研究问题与文献片段一次写成带引用的报告。权重、训练数据、检查点与示例工作流全部放出,产品里单篇平均 51.1 秒,对比 Claude 驱动的 Thinking 模式 178.5 秒。