- AMD 的 0.9.0.amd0 分支把 verl、ROCm 10.0、vLLM 0.27.0、SGLang、Ray 2.58.0 与 MI300/MI350 系列写入同一支持矩阵,同时保留驱动、设备访问和通信后端等已知条件;官方没有公布新的独立吞吐或延迟对比。
- Spectrum 称已开始在其网络中激活算力,并可触达 1,000 多个既有边缘设施、使容量位于 5 亿连接设备 10 毫秒范围内;公告披露的是合作与展会演示,没有给出已激活站点数、价格、SLA 或真实生产负载指标。
- ZincFive 公布正在开发的机架级 BBU 与 DPM,分别面向分钟级备电和瞬态功率缓解,并列出 12V、48V、400V 与 800V 架构范围;新产品的具体规格、可用时间和现场验证仍待公布。
后训练支持被写成一张版本与设备矩阵
9 月 28 日,AMD 发布 verl 0.9.0 在 ROCm 10.0 上的启用说明。官方将 AMD 分支锁定为 release/0.9.0.amd0,宿主驱动为 ROCm 10.0.0,基础镜像为 rocm/primus:v26.7;镜像同时包含从源码构建的 vLLM 0.27.0 与 SGLang,并固定 Ray 2.58.0、Megatron-Core 0.18.0。支持矩阵列出的 GPU 架构是 gfx942 与 gfx950,分别覆盖 MI300 和 MI350 系列相关型号,训练后端包括 FSDP、FSDP2 与 Megatron,运行方式包括 colocate 和 fully async。
这并不是不附条件的硬件兼容声明。文档要求宿主已经安装并正常运行 ROCm 10.0,容器能够访问 /dev/kfd 与 /dev/dri;SGLang attention 后端在该镜像中固定为 Triton,vLLM 与 SGLang 的自定义 all-reduce 默认关闭。官方还把既有 8 张 MI355X 的异步工作负载作为回归路径,并列出部分模型配置调整与已知问题。当天材料没有给出新的独立首 token 延迟、吞吐、并发、功耗或成本比较。
对企业落地而言,GPU 采购与模型后训练不能只核对芯片型号,还要把驱动、容器、训练器、推理引擎、通信路径和具体模型配置绑定成可复现的版本组合。AMD 的矩阵降低了支持范围的不确定性,但它仍是厂商维护的启用路径;不同 GPU 数量、网络拓扑、模型和量化方式下的稳定性与成本,仍不能由这份说明直接外推。
边缘算力的位置开始与网络服务一起表达
同日,Charter 旗下 Spectrum 公布 Edge Compute Infrastructure 合作进展,并称已经开始在网络中激活计算能力。厂商称其现有基础设施可触达 1,000 多个自有运营的较小型边缘设施,使分布式算力位于美国 5 亿连接设备 10 毫秒范围内;公告把高容量光纤网络、既有供电设施和 NVIDIA 加速计算组合为同一平台描述。这里的“可触达”是网络覆盖口径,公告没有给出已有多少站点实际安装并运行 GPU。
公告列出的合作包括:Cast AI 将 Spectrum 托管的 Blackwell Ultra 节点接入多云计算结构,Hydra Host 将其 AI Factory 平台用于 Spectrum 所有和运营的容量,HP 展示 Z Boost、ZGX Nano 与 ZGX Fury,WWT 则在展会进行机器人演示。这些信息确认了合作方、部署方向和演示场景,但没有披露可订购区域、容量库存、价格、服务等级、功耗、数据驻留条款,或在真实生产负载下的首 token 延迟、吞吐和并发。
对企业落地而言,边缘部署的验收对象会同时包含算力位置、回传网络、数据边界和区域运维,而不仅是单台设备规格。靠近数据产生和业务执行位置可能缩短部分链路并减少原始数据外移,但 10 毫秒覆盖范围、现场演示和伙伴协议不能替代应用端到端时延、可用性、安全隔离与故障切换验证,也不能说明服务已经在 1,000 多个站点规模化交付。
机架供电开始区分备电与瞬态功率
ZincFive 9 月 28 日宣布开发两类机架级镍锌储能方案:Battery Backup Unit 用于分钟级备电,AI Dynamic Power Module 用于在机架负载快速变化时供给或吸收功率。公告称开发工作覆盖既有 48V 机架体系,并面向侧挂式和更高电压架构;产品页进一步列出 DPM 支持 48V、400V 与 800V,BBU 支持 12V、48V、400V 与 800V。厂商还称相关镍锌技术完成超过 1,000 万次动态功率循环,并列出 UL 9540A 测试结果。
这些数字描述的是 ZincFive 的技术与拟议架构,不是新 DPM 和 BBU 已在量产客户环境完成的独立测试。公司明确表示仍在与 OEM、客户和行业伙伴评估需求,具体产品细节、规格与供货信息将随开发推进后续公布。当前公开材料没有给出机架单元尺寸、kW/kWh、响应时间、效率、热管理条件、价格、交付日期、OEM 清单或生产现场数据;此前交付或签约的 2GW 公司业绩也不能等同于新机架产品的出货量。
对企业落地而言,AI 集群的电力评估需要把断电后的持续供电与毫秒到分钟范围的负载波动分开,才能判断上游配电、冷却和机架内储能分别承担什么角色。ZincFive 的材料提供了一个明确的产品方向,但目前仍属开发状态;在额定功率、持续时间、循环寿命、故障模式、认证范围和供货信息公开之前,不能把它写成可采购的容量方案。
三类约束需要回到同一工作负载核验
当天三组材料处于不同层级:AMD 给出可构建的软件版本与 GPU 架构组合,Spectrum 描述网络与边缘设施的覆盖及合作方式,ZincFive 描述仍在开发的机架级电力模块。它们没有采用共同基准,也没有覆盖同一模型、数据、并发、站点或功率曲线,因此不能把 GPU 支持、网络覆盖和电力循环次数合成一个性能结论。
公开材料也留下了互不相同的空白。AMD 文档没有提供新一轮独立性能与成本数据;Spectrum 没有披露生产站点数量、SLA 和应用负载结果;ZincFive 没有发布新模块的完整规格、价格与供货。这些边界说明企业 AI 基础设施正在从单一加速器扩展为软件、位置、网络和供电的组合问题,但“小型化”“低时延”或“更稳定”仍需连续、可比且针对具体业务的证据。
对企业落地而言,较完整的验收单位应是一个可重复的端到端工作负载:锁定模型与版本、数据位置、批量和上下文条件、算力与网络拓扑、功率曲线、故障恢复以及成本口径,再分别记录厂商自测与独立结果。今天的更新扩大了需要被核对的变量范围,却没有给出可以跨平台直接排序的总分;把不同层级的厂商数字混为一谈,反而会掩盖真实瓶颈。
后续观察
- AMD 的 0.9.0.amd0 组合是否会公布跨 MI300/MI350 型号、不同节点拓扑和真实企业模型的独立稳定性、吞吐、延迟与成本结果。
- Spectrum 将披露多少实际激活站点、可订购区域、容量、价格、SLA、数据驻留与真实应用端到端时延。
- ZincFive 的 DPM 与 BBU 何时发布 RU、kW/kWh、响应时间、效率、冷却、认证、价格、供货和生产现场验证。
来源与核验
本文由英科铸数基于所列公开资料编辑撰写。事实与数据以原始来源为准;“对企业落地意味着什么”为英科铸数结合企业客户场景所作的编辑分析,不构成对第三方产品的背书。
← 返回每日观察