文章目录
  1. 01路线图拟以 GPU 预填充与 XPU 解码做异构分工
  2. 02地域驻留从合同要求变成部署配置
  3. 03数据边界需要延伸到计算、存储、网络和治理链
  4. 04长任务属于另一种执行时长与环境等级
  5. 后续观察
  6. 来源与核验
今日要点
  1. d-Matrix 计划把 Raptor XPU 接入 NVIDIA MGX 与 NVLink Fusion,并以 GPU 处理预填充、XPU 加速解码作为异构推理示例;Raptor 尚未流片,集成机架仅预计 2027 年第四季度初始供应,不能当作已交付性能。
  2. Baseten 允许把一个部署的全部副本限制在指定 Baseten region;NVIDIA、Palantir 与 Dell 则给出同一类企业工作流在云端、本地和隔离环境中的部署形态。
  3. OpenAI Agents API 把长任务的会话、上下文和执行循环托管化,并允许选择托管、VPC 或合作沙箱;该产品仍处于 public beta。
Signal 01

路线图拟以 GPU 预填充与 XPU 解码做异构分工

d-Matrix 在北京时间 9 月 10 日 20:59:26 发布与 NVIDIA 的多年路线图,随后 NVIDIA 于 21:00:21 发布对应说明。两份材料把 Raptor XPU 放入 NVIDIA MGX 机架:NVLink 承担机架内 scale-up,Spectrum-X 承担 scale-out,计划同时接入 Vera CPU、ConnectX-9 SuperNIC 和 BlueField-4 DPU。NVIDIA 强调这一共同机架还包括供电、散热和供应链,而不是只提供一条芯片互连。

d-Matrix 把 AI 编程、实时聊天和语音 Agent 列为低时延目标场景,并给出异构解耦示例:NVIDIA GPU 处理计算密集的 prefill,Raptor XPU 加速对交互更敏感的 decode。Raptor 采用将 DRAM memory chip 与 SRAM compute chip 结合的 3D 堆叠思路,但公告没有给出内存容量、带宽、功耗、首 token 时延、每 token 时延、吞吐或并发数字。当前处于生产状态的是上一代 Corsair;Raptor 预计 2026 年底前 tape-out,接入 MGX 的初始供应预计在 2027 年第四季度。

对企业落地意味着什么

这条路线说明“低时延”不能只写成一个平均响应时间。容量规划和采购测试因而涉及 prefill、decode、批处理吞吐、尾延迟以及阶段间传输开销,也必须区分路线图设备与已供应设备。厂商对 ultralow latency、能效和更低风险的表述没有随同可复现基准,现阶段只能作为架构方向,不能提前计入生产容量。

Signal 02

地域驻留从合同要求变成部署配置

Baseten 于北京时间 9 月 11 日 02:56:54 发布 Regional Deployments,允许把一个部署中的每个 replica 限制到某个 Baseten region。用户可以在 dashboard、CLI 或 Management API 中选择区域,官方示例为 `baseten model push --region eu`;公告把合规、数据驻留和降低时延列为使用理由。

这项更新能证明副本可以绑定到 Baseten 定义的区域,却没有列出所有可选区域、可用区粒度、跨区故障切换、网络路径、价格或区域级服务等级。它也没有说明控制面日志、备份和支持数据是否与推理副本遵循完全相同的地域边界。

对企业落地意味着什么

对受监管数据或跨地域服务,这使 region 成为版本化部署清单中的一个独立字段,并与模型修订、副本数、容灾策略和允许的数据类别相关联。区域选择可以缩短网络距离,也可以帮助满足驻留要求,但“工作负载在某区域运行”与“相关数据从未离开该司法辖区”仍是两个判断;端到端合规还取决于故障切换、日志、备份、支持访问及合同边界。

Signal 03

数据边界需要延伸到计算、存储、网络和治理链

NVIDIA 与 Palantir 于北京时间 9 月 10 日 17:00 公布供应链 AI 合作:定制 Nemotron 开放模型进入 Palantir Foundry 与 AIP,并以 Palantir Ontology 表达业务对象和关系;客户可用自己的数据后训练模型,cuOpt 用于约束与情景分析,NeMo AutoModel、NeMo RL 与 Palantir Autopilot 用于把业务反馈纳入持续改进。公告明确保留专家对最终决策的控制,并称该栈可运行于云端或本地,首先在 NVIDIA 自身供应链部署。

Dell 于北京时间 21:38:53 补充了本地参考形态:PowerEdge XE9780 与 Blackwell Ultra GPU 承担模型定制、检索、推理和 Agent 工作负载,PowerEdge R670 承担控制面与数据处理;ObjectScale、PowerFlex、Spectrum-X、ConnectX 与 PowerSwitch 分别覆盖对象存储、块存储、GPU 网络和管理流量隔离。Dell 还把 Rubix 的多租户策略以及 Apollo 在企业数据中心、主权设施和 air-gapped 环境中的部署与生命周期管理列入架构,但没有披露整体方案的价格、供货周期、功耗或业务效果。

对企业落地意味着什么

地域驻留只是数据边界的一层。本地部署还要回答模型和数据放在哪类存储、GPU 与管理流量如何隔离、谁能更新运行环境、反馈数据如何进入后训练,以及故障时由谁负责。NVIDIA 与 Dell 的材料属于厂商方案和前瞻性陈述,能够定义待验收的组件,却不能证明每个行业客户已经获得同样的效果或完整 air-gap 能力。

Signal 04

长任务属于另一种执行时长与环境等级

OpenAI 官方开发者论坛的 staff 公告于北京时间 9 月 11 日 04:54:46 发布,宣布 Agents API 面向所有开发者进入 public beta。OpenAI 托管 Agent 循环、模型调用、工具使用、长时间会话和上下文管理,开发者仍决定 Agent 的能力以及代码和文件在哪里运行。可选环境包括自带沙箱、合作沙箱、OpenAI-hosted sandbox,以及具有 CPU、GPU、内存、文件与 secret storage 选项的托管或 VPC 部署。

公告称 Agents API 本身不额外收费,费用来自所用 token 与工具;这不是完整任务成本、性能保证或服务等级。它也没有给出最长执行时间、恢复点语义、并发上限或故障重试保证。产品文章只标注 9 月 10 日,本文采用的是官方论坛公告的精确发布时间;该时间能够锚定公告进入窗口,不能反推产品文章的精确上线时刻。

对企业落地意味着什么

长时间 Agent 与实时对话的运行目标不同:前者更关心状态保存、权限、资源上限、恢复和制品边界,后者更关心首 token 与逐 token 时延。把它们纳入同一服务目录时,验收指标仍需分开;尤其在 beta 阶段,长任务的可恢复状态、超时规则和费用上限仍是未被产品公告替代的运行边界。

Verification

来源与核验

  1. d-Matrix Adopts NVIDIA NVLink Fusion for Rack-Scale XPU DeploymentNVIDIA · 2026-09-10T13:00:21Z · 官方发布
  2. Regional deploymentsBaseten · 2026-09-10T19:56:54+01:00 · 官方发布
  3. NVIDIA and Palantir Bring Sovereign Intelligence to Critical Supply ChainsNVIDIA / Palantir · 2026-09-10T09:00:00Z · 官方发布
  4. Sovereign AI for the Supply Chain, Built on Infrastructure You ControlDell Technologies · 2026-09-10T13:38:53+00:00 · 官方发布
  5. Introducing the Agents API and hosted sandboxesOpenAI Developer Community · 2026-09-10T20:54:46.591Z · 官方发布

本文由英科铸数基于所列公开资料编辑撰写。事实与数据以原始来源为准;“对企业落地意味着什么”为英科铸数结合企业客户场景所作的编辑分析,不构成对第三方产品的背书。

← 返回每日观察