# 工具评测

Cloudflare 上线 Web Search API:Agent 取实时网页结果改走 AI Gateway,统一计费并支持自带 Key
Cloudflare 上线 Web Search API:Agent 取实时网页结果改走 AI Gateway,统一计费并支持自带 Key
10 月 2 日 Cloudflare 发布 Web Search API(Beta),Agent 可通过 AI Gateway 取回实时网页结果,接入 Ceramic.ai、Exa、Linkup 三家,按各家标价不加价,支持 BYOK 与 Zero Data Retention 标注。
微软与 Hugging Face 发布 ThinkingBox-Bench:507 个有状态任务各跑 20 遍,只查数据库改没改对
微软与 Hugging Face 发布 ThinkingBox-Bench:507 个有状态任务各跑 20 遍,只查数据库改没改对
微软 Copilot Studio 团队与 Hugging Face 发布 ThinkingBox 与 ThinkingBox-Bench:507 个有状态业务任务各跑 20 遍,只按数据库终态和副作用判分。结果显示三分之二的失败依然「干净退出」,重复 20 次后头部模型 pass@1 保持率从 78% 到 8% 不等。
Cloudflare 开源 Clef 决策模型:Agent 的路由判定改成打分,同时放出 RL 微调平台
Cloudflare 开源 Clef 决策模型:Agent 的路由判定改成打分,同时放出 RL 微调平台
10 月 1 日 Cloudflare 在 Workers AI 上线 Clef 与 Clef-flash 两款决策模型,权重以 Apache 2.0 开源,并预览一套 RL 微调平台。它们不生成文本,只对给定选项打分返回概率,Agent 的路由与判定因此从「解析文本」变成「读概率」。
如何使用 DeepSeek V4-Flash-Vision API(图像输入指南)
如何使用 DeepSeek V4-Flash-Vision API(图像输入指南)
本文介绍 DeepSeek V4-Flash-Vision API 的图片输入方式、计费规则、使用限制与多模态请求测试方法。
【勿删】如何使用 DeepSeek API 4.0?一文介绍
【勿删】如何使用 DeepSeek API 4.0?一文介绍
DeepSeek API 4.0 来了!本文将从零开始,手把手教你如何获取 API Key,并使用强大的 API 调试工具 Apifox,轻松完成对 DeepSeek API 的首次调用和参数调试,让你快速上手这款强大的 AI 模型。
GPT-6.1 Sol 进入 GitHub Copilot:Pro+ 起步,企业默认会自动打开新模型
GPT-6.1 Sol 进入 GitHub Copilot:Pro+ 起步,企业默认会自动打开新模型
GitHub 9 月 29 日把 GPT-6.1 Sol 加进 Copilot 模型选择器,覆盖 Pro+/Max/Business/Enterprise 四档,官方称它完成多步编码任务时 token 和步数都明显更少。个人用户是多一个下拉项,企业管理员则要先查一遍 model policy 的默认行为。
Claude Sonnet 5.5 进入 GitHub Copilot:Copilot Pro 也能用,官方称步数更少
Claude Sonnet 5.5 进入 GitHub Copilot:Copilot Pro 也能用,官方称步数更少
GitHub 9 月 28 日宣布 Claude Sonnet 5.5 在 Copilot 全面可用,覆盖 Pro 到 Enterprise 五档,比 GPT-6.1 Sol 多出入门付费档。官方称它在编码任务上与 Sonnet 5 打平但步骤、token、工具调用更少。本文拆解可用范围、计费口径与验证方法。
GitHub 仓库自定义属性能由外部系统托管了:CMDB 和内部开发者门户可以直接供数
GitHub 仓库自定义属性能由外部系统托管了:CMDB 和内部开发者门户可以直接供数
GitHub 9 月 29 日公开预览外部自定义属性:仓库的归属、服务层级、生命周期与合规状态可由 CMDB 或内部开发者门户托管并持续同步,值在 GitHub 只读,各集成拥有独立命名空间,可用于 ruleset 定位。
GitHub Copilot 新功能全局默认策略:10 月 22 日生效,未配置的会按默认自动落地
GitHub Copilot 新功能全局默认策略:10 月 22 日生效,未配置的会按默认自动落地
GitHub 9 月 24 日为企业新增 Copilot 新功能全局默认策略,10 月 22 日生效。Enabled、Disabled、Let organizations decide 三个选项决定了未来每个新功能由谁做决定;显式配置过的功能会被保留,未配置的才跟随默认。
Dependabot 运行器设置下沉到仓库:私有包仓库的依赖更新终于能跑通
Dependabot 运行器设置下沉到仓库:私有包仓库的依赖更新终于能跑通
GitHub 9 月 29 日把 Dependabot 的运行器配置从组织级下沉到仓库级,可为版本更新和安全更新指定运行器类型、自定义标签和运行器组。它解决的是私有包仓库拉不到依赖的老问题,但安全配置目前不会强制执行这类设置。
Nano Banana 2.1 API 实战指南:从首次调用到多轮编辑与成本控制
Nano Banana 2.1 API 实战指南:从首次调用到多轮编辑与成本控制
面向开发者的 Nano Banana 2.1 API 教程:获取 key、发起首次调用,以及宽高比、2K/4K 输出、图像编辑、多轮修改、参考图、搜索接地与费用核算。
Nano Banana 2.1 vs Nano Banana 2 vs Pro:四款 Gemini 图像模型怎么选
Nano Banana 2.1 vs Nano Banana 2 vs Pro:四款 Gemini 图像模型怎么选
并排对比 Nano Banana 2.1、Nano Banana 2、Pro 和 Lite 的规格、每千张图片成本,以及输入密集场景下的盈亏平衡点,帮你决定该切到哪个模型。
如何免费使用 Nano Banana 2.1:六条路径逐一核查
如何免费使用 Nano Banana 2.1:六条路径逐一核查
逐一核查 Nano Banana 2.1 的免费途径:AI Studio、Gemini 应用、Google Flow 与 Cloud 试用额度,并给出免费额度用尽后最便宜的付费方案。
Nano Banana 2.1 正式发布:价格只有 Nano Banana 2 的一半,文字渲染终于可用
Nano Banana 2.1 正式发布:价格只有 Nano Banana 2 的一半,文字渲染终于可用
Nano Banana 2.1(gemini-nano-banana-2.1)单张图片成本仅为 Nano Banana 2 的一半。本文梳理 Google 公布的改进、完整定价与发布说明里没提的几个坑。
Mistral Large 4 API 指南:首次调用、推理控制、函数调用与成本核算
Mistral Large 4 API 指南:首次调用、推理控制、函数调用与成本核算
五分钟跑通 Mistral Large 4 的首次调用,并覆盖容易踩坑的部分:reasoning_effort 分块解析、图像输入、函数调用、JSON 输出与费用估算。
Mistral Large 4 发布:Le Chonk 在网络安全基准上胜过 GPT-6 Astra 与 Claude
Mistral Large 4 发布:Le Chonk 在网络安全基准上胜过 GPT-6 Astra 与 Claude
1.05T 参数的 Mistral Large 4 解读:规格、预览价、网络安全 82% 得分背后的拒绝率前提,以及它在人工编码评测中仍落后 Claude 的地方。