文章目录
- d-Matrix 计划把 Raptor XPU 接入 NVIDIA MGX 与 NVLink Fusion,并以 GPU 处理预填充、XPU 加速解码作为异构推理示例;Raptor 尚未流片,集成机架仅预计 2027 年第四季度初始供应,不能当作已交付性能。
- Baseten 允许把一个部署的全部副本限制在指定 Baseten region;NVIDIA、Palantir 与 Dell 则给出同一类企业工作流在云端、本地和隔离环境中的部署形态。
- OpenAI Agents API 把长任务的会话、上下文和执行循环托管化,并允许选择托管、VPC 或合作沙箱;该产品仍处于 public beta。
路线图拟以 GPU 预填充与 XPU 解码做异构分工
d-Matrix 在北京时间 9 月 10 日 20:59:26 发布与 NVIDIA 的多年路线图,随后 NVIDIA 于 21:00:21 发布对应说明。两份材料把 Raptor XPU 放入 NVIDIA MGX 机架:NVLink 承担机架内 scale-up,Spectrum-X 承担 scale-out,计划同时接入 Vera CPU、ConnectX-9 SuperNIC 和 BlueField-4 DPU。NVIDIA 强调这一共同机架还包括供电、散热和供应链,而不是只提供一条芯片互连。
d-Matrix 把 AI 编程、实时聊天和语音 Agent 列为低时延目标场景,并给出异构解耦示例:NVIDIA GPU 处理计算密集的 prefill,Raptor XPU 加速对交互更敏感的 decode。Raptor 采用将 DRAM memory chip 与 SRAM compute chip 结合的 3D 堆叠思路,但公告没有给出内存容量、带宽、功耗、首 token 时延、每 token 时延、吞吐或并发数字。当前处于生产状态的是上一代 Corsair;Raptor 预计 2026 年底前 tape-out,接入 MGX 的初始供应预计在 2027 年第四季度。
这条路线说明“低时延”不能只写成一个平均响应时间。容量规划和采购测试因而涉及 prefill、decode、批处理吞吐、尾延迟以及阶段间传输开销,也必须区分路线图设备与已供应设备。厂商对 ultralow latency、能效和更低风险的表述没有随同可复现基准,现阶段只能作为架构方向,不能提前计入生产容量。
地域驻留从合同要求变成部署配置
Baseten 于北京时间 9 月 11 日 02:56:54 发布 Regional Deployments,允许把一个部署中的每个 replica 限制到某个 Baseten region。用户可以在 dashboard、CLI 或 Management API 中选择区域,官方示例为 `baseten model push --region eu`;公告把合规、数据驻留和降低时延列为使用理由。
这项更新能证明副本可以绑定到 Baseten 定义的区域,却没有列出所有可选区域、可用区粒度、跨区故障切换、网络路径、价格或区域级服务等级。它也没有说明控制面日志、备份和支持数据是否与推理副本遵循完全相同的地域边界。
对受监管数据或跨地域服务,这使 region 成为版本化部署清单中的一个独立字段,并与模型修订、副本数、容灾策略和允许的数据类别相关联。区域选择可以缩短网络距离,也可以帮助满足驻留要求,但“工作负载在某区域运行”与“相关数据从未离开该司法辖区”仍是两个判断;端到端合规还取决于故障切换、日志、备份、支持访问及合同边界。
数据边界需要延伸到计算、存储、网络和治理链
NVIDIA 与 Palantir 于北京时间 9 月 10 日 17:00 公布供应链 AI 合作:定制 Nemotron 开放模型进入 Palantir Foundry 与 AIP,并以 Palantir Ontology 表达业务对象和关系;客户可用自己的数据后训练模型,cuOpt 用于约束与情景分析,NeMo AutoModel、NeMo RL 与 Palantir Autopilot 用于把业务反馈纳入持续改进。公告明确保留专家对最终决策的控制,并称该栈可运行于云端或本地,首先在 NVIDIA 自身供应链部署。
Dell 于北京时间 21:38:53 补充了本地参考形态:PowerEdge XE9780 与 Blackwell Ultra GPU 承担模型定制、检索、推理和 Agent 工作负载,PowerEdge R670 承担控制面与数据处理;ObjectScale、PowerFlex、Spectrum-X、ConnectX 与 PowerSwitch 分别覆盖对象存储、块存储、GPU 网络和管理流量隔离。Dell 还把 Rubix 的多租户策略以及 Apollo 在企业数据中心、主权设施和 air-gapped 环境中的部署与生命周期管理列入架构,但没有披露整体方案的价格、供货周期、功耗或业务效果。
地域驻留只是数据边界的一层。本地部署还要回答模型和数据放在哪类存储、GPU 与管理流量如何隔离、谁能更新运行环境、反馈数据如何进入后训练,以及故障时由谁负责。NVIDIA 与 Dell 的材料属于厂商方案和前瞻性陈述,能够定义待验收的组件,却不能证明每个行业客户已经获得同样的效果或完整 air-gap 能力。
长任务属于另一种执行时长与环境等级
OpenAI 官方开发者论坛的 staff 公告于北京时间 9 月 11 日 04:54:46 发布,宣布 Agents API 面向所有开发者进入 public beta。OpenAI 托管 Agent 循环、模型调用、工具使用、长时间会话和上下文管理,开发者仍决定 Agent 的能力以及代码和文件在哪里运行。可选环境包括自带沙箱、合作沙箱、OpenAI-hosted sandbox,以及具有 CPU、GPU、内存、文件与 secret storage 选项的托管或 VPC 部署。
公告称 Agents API 本身不额外收费,费用来自所用 token 与工具;这不是完整任务成本、性能保证或服务等级。它也没有给出最长执行时间、恢复点语义、并发上限或故障重试保证。产品文章只标注 9 月 10 日,本文采用的是官方论坛公告的精确发布时间;该时间能够锚定公告进入窗口,不能反推产品文章的精确上线时刻。
长时间 Agent 与实时对话的运行目标不同:前者更关心状态保存、权限、资源上限、恢复和制品边界,后者更关心首 token 与逐 token 时延。把它们纳入同一服务目录时,验收指标仍需分开;尤其在 beta 阶段,长任务的可恢复状态、超时规则和费用上限仍是未被产品公告替代的运行边界。
后续观察
- d-Matrix 是否会在 Raptor tape-out 和 MGX 集成后公开首 token、逐 token、吞吐、功耗与阶段间传输的同条件基准。
- Baseten 是否会公布 regional deployment 的区域清单、故障切换、日志与备份驻留范围,以及各区域价格和服务等级。
- 企业能否用同一份运行目录同时记录时延等级、region、本地或云端形态、数据类别、执行时长、恢复语义和成本上限。
来源与核验
本文由英科铸数基于所列公开资料编辑撰写。事实与数据以原始来源为准;“对企业落地意味着什么”为英科铸数结合企业客户场景所作的编辑分析,不构成对第三方产品的背书。
← 返回每日观察