- MLPerf Inference v6.1 新增 End-to-End RAG 和 Edge Agentic Inference;后者包含多轮编码负载、时延与准确率门槛,数据中心 Agentic 基准仍待发布。
- Claude Code v2.1.274 修复 MCP 长超时配置未生效及损坏会话无限重试,并提供启动等待上限;这些是厂商发布记录,尚无同条件独立可靠性复测。
- Cohesity Agent Resilience 当前仅向部分客户开放,首发支持 Amazon Bedrock AgentCore 与 Bedrock Agents,目标在 2026 年底全面可用;Microsoft 与 Google 平台支持仍属路线图。
性能评测的对象开始覆盖完整工作流
MLCommons 于 9 月 16 日发布 MLPerf Inference v6.1。新增的 End-to-End RAG 将嵌入、向量检索、重排和 LLM 回答纳入同一管线,分别测量文档语料入库与对已有向量库的问答。它覆盖多个组件,不再只测孤立的生成步骤。
同轮新增的 Edge Agentic Inference 面向单用户边缘环境,以单流编码负载体现逐轮增长的历史,结合时延指标与统计准确率门槛。两项任务分别考察限时准确率和带内置准确性检查的确定性负载性能;公告明确,相关数据中心 Agentic 性能基准仍待发布。
完整管线和多轮负载使性能比较更接近实际应用中的依赖关系,但测量范围仍由任务、模型、量化与场景定义。这些结果可以补充容量判断,不能直接证明企业数据权限正确、长任务持续可靠或故障后能完整恢复;确定性负载的性能也不等于所有真实任务的成功率。
平均成功率与重复成功率回答不同问题
作为较早背景,IBM Research 于 9 月 15 日介绍 ALTK-Evolve 的 Consistency Analyzer,相关论文于 9 月 8 日提交。作者在 AppWorld test_normal 的 168 项任务上测试 ReAct 与 GPT-4.1:五次运行的平均成功率 Mean@5 为 77.4%,而五次全部成功的任务比例 Pass^5 仅为 53.0%。Pass^5 与“至少一次成功”的 Pass@5 是不同指标。
作者从已记录轨迹中的决策步骤进行受控重采样,再生成可用于未来运行的指南。同任务测试中,Pass^5 提高到 69.0%,Mean@5 提高到 81.0%;诊断步骤复用已记录上下文,不执行新的工具调用,也不再次完整运行任务。数字来自作者实验,并非独立企业业务评测。
多轮推理基准与重复运行研究提供互补视角:前者描述给定工作负载的性能,后者描述相同任务是否稳定成功。在涉及写入的流程中,重复执行还可能产生额外副作用,因此轨迹分析有潜在价值;但离线决策诊断不能替代环境中的结果核验,指南的效果也仍取决于实际任务与模型。
运行时故障需要可区分的停止与恢复语义
Claude Code v2.1.274 于 9 月 17 日发布,新增首个非交互回合等待 MCP 连接的上限,并修复 Streamable HTTP 工具调用在配置更长超时后仍约五分钟超时的问题。对于 unexpected tool_use_id 导致的 400 错误循环,版本说明称损坏 transcript 会在可能时自愈,否则用明确错误和 rewind 提示结束重试。
同一版本还修复恢复压缩会话时丢失 active goal,以及把 insufficient_scope 的 403 错误误报为登录过期。发布说明能够确认这些修复进入该版本,却没有提供恢复完整性、重复副作用或生产故障率的独立测试结果。
连接未就绪、超时、权限不足和会话损坏分别对应不同处置条件,不能都归为可自动重试的临时失败。更清楚的错误与等待上限有助于解释失败,但恢复会话是否保留全部状态、外部动作是否已发生,仍依赖工具结果与持久记录;结束错误循环也不等于业务已经恢复。
恢复对象延伸到 Agent 状态及其依赖资源
Cohesity 于 9 月 16 日公布 Agent Resilience,首发保护 Agent 记忆与配置,提供时间点恢复,并将 Agent 管理的数据库、文件系统及其他服务纳入保护范围。拓扑视图用于关联记忆存储、应用、数据库和底层设施。当前能力仅向部分客户开放,支持 Amazon Bedrock AgentCore 与 Bedrock Agents,目标在 2026 年底全面可用;Microsoft 与 Google 平台仍在路线图中。
Google 同日发布的 CISO 材料提供了状态保护的另一类背景:Mandiant 在 2026 年第二季度调查到多起盗取专有模型、技能、提示、源代码及研究资料的勒索事件。Google 主张用动态关系图关联代码、模型、数据沿袭与运行身份。这是厂商调查与防御设计,不能据此判断每家企业的暴露程度,也不是独立验证所有保护机制的测试。
Agent 的记忆、配置与业务资源相互依赖,使故障恢复可能涉及多个版本和时间点。拓扑和关系图可以帮助界定保护范围,但不能仅凭“已备份”认定恢复后状态可信;已泄露资料无法靠回滚收回,已执行动作也未必可逆。现有材料尚未给出跨平台一致恢复、凭证撤销及恢复后业务验证的共同保证。
后续观察
- MLPerf 数据中心 Agentic 基准何时发布,以及完整工作流性能与重复成功率是否能在相同任务条件下共同呈现。
- Claude Code 是否公开会话修复与恢复的可复现测试,明确中断工具调用和外部副作用的处理边界。
- Cohesity 全面可用时是否明确保护字段、跨资源恢复一致性、恢复时间与恢复点目标,并公布独立演练结果。
来源与核验
本文由英科铸数基于所列公开资料编辑撰写。事实与数据以原始来源为准;“对企业落地意味着什么”为英科铸数结合企业客户场景所作的编辑分析,不构成对第三方产品的背书。
← 返回每日观察