文章目录
  1. 01受限判断从自由生成中拆出
  2. 02同类能力出现托管与开放权重两条路线
  3. 03控制责任继续落在 Agent 运行时
  4. →后续观察
  5. ↗来源与核验
今日要点
  1. Strands Decider 2B 移除语言生成头,以 pointer head 对给定选项评分;这种设计适合工具选择、路由和分类,但官方明确称其不适合编码、聊天、摘要或复杂推理。
  2. Cloudflare 同日发布 27B 的 Clef 与 9B 的 Clef-flash,可在 Workers AI 调用并下载开放权重;64K 上下文、最多 64 个问题和延迟数字均不能替代具体业务判断的校准与独立测试。
  3. Google ADK 2.11.0 与 OpenAI Agents Python 0.23.0 把人工确认、取消、模型调用预算、加密历史扫描预算和审批归属进一步显式化,说明控制责任仍在 Agent 运行时而非决策模型本身。
Signal 01

受限判断从自由生成中拆出

Strands Agents 于 10 月 1 日发布 Strands Decider 2B。其架构以 Qwen3.5-2B 的主体为基础,移除用于生成文本的语言模型头,改用 pointer head 对预先给定的选项评分。模型因此只在候选集合中作选择或给出分数,而不是生成任意文本;官方列出的适用方向包括模型路由、工具选择、评估、护栏、记忆与上下文管理,并明确称它不适合编码、聊天机器人、文档摘要和复杂推理。

官方将代码、权重、训练数据和脚本一并开放,并称模型可在本地 CPU 或 GPU 上运行。发布文报告的本地中位延迟约为 RTX 3090 上 115 毫秒、M3 MacBook 小任务上 153 毫秒,但延迟随任务长度增加,RTX 3090 图表测试的是 v18,而发布模型为 v19。这些数字属于项目方测试,没有同时给出企业工作流的并发、阈值、误判代价或独立复核结果。

对企业落地意味着什么

对企业落地而言,工具选择、工单路由或策略分类可以不再全部交给自由生成模型,但固定候选、概率输出和低延迟并不等于正确决策。候选集合、业务阈值、低置信回退与误判后果仍是独立的运行合同;决策模型适合受限判断,也不能替代需要解释、综合或生成的通用模型。

Signal 02

同类能力出现托管与开放权重两条路线

Cloudflare 于 10 月 1 日发布 Clef 与 Clef-flash,参数规模分别为 27B 与 9B,两者均提供 64K 上下文,可在一次请求中处理最多 64 个 yes/no、选项或分级问题。它们已在 Workers AI 提供托管调用,权重也以 Apache 2.0 许可证发布;输出是每个允许答案的概率和类型化结果,而不是需要再解析的自由文本。

Cloudflare 公布的 43 次基准运行中,Clef、Clef-flash 与 Jev 的中位延迟分别为 209.3、38.8 和 524.1 毫秒。这是厂商自测,不能与 Strands 的本地硬件结果直接横比,也没有证明任一模型在具体企业数据上的决策准确率。Cloudflare 目前把针对客户工作负载的微调描述为由工程团队参与的合作服务,自助微调平台仍是后续计划,不能写成已经开放的标准产品。

对企业落地意味着什么

对企业落地而言,同一种受限判断能力已经同时出现本地开放权重和托管 API 形态,部署位置、数据边界、延迟构成与微调可得性因此需要分开比较。参数规模、上下文长度和厂商基准只能描述产品条件,不能直接推出工单路由、风险分类或工具调用在企业规则下已经达到可自动执行的水平。

Signal 03

控制责任继续落在 Agent 运行时

Google ADK Python 2.11.0 于 10 月 2 日 00:44 UTC 发布。该版本允许 Runner、Workflow 和节点接收 abort_signal,在客户端断开时取消运行;工作流中的工具节点可以通过 RequestInput 暂停并等待人工确认。新增的 ModelConsultTool 还分别设置每轮和每会话预算,本地 SQLite memory service 则把一种状态持久化选择放进框架。

OpenAI Agents Python 0.23.0 随后于 01:08 UTC 发布,新增可配置的 MCP 列表分页、可选的 Docker 删除保护、记忆整合轮次和加密历史扫描预算,并修复敏感 trace 元数据处理、函数工具审批归属、流式回调积压等问题。两份 Release 展示的是框架行为与缺陷修复,不是安全认证,也没有给出采用这些能力后的任务成功率、人工覆写率或单位任务成本。

对企业落地意味着什么

对企业落地而言,生成模型负责产出、决策模型负责受限判断,仍不足以定义一次可控执行。人工确认属于谁、取消如何传播、预算在哪个范围计数、历史如何扫描与持久化,都是运行时必须保持一致的状态语义。企业验收对象因此从单一回答质量扩展到候选与阈值、审批与取消、预算与状态四组可以分别失败的边界。

Verification

来源与核验

  1. Google ADK Python v2.11.0Google Agent Development Kit · 2026-10-02T00:44:00Z · 项目 Release
  2. OpenAI Agents Python v0.23.0OpenAI Agents SDK · 2026-10-02T01:08:00Z · 项目 Release

本文由英科铸数基于所列公开资料编辑撰写。事实与数据以原始来源为准;“对企业落地意味着什么”为英科铸数结合企业客户场景所作的编辑分析,不构成对第三方产品的背书。

← 返回每日观察