- Z.ai 发布 GLM-5.3-Flash:总参数 3200 亿、激活参数 180 亿,提供原生多模态和 100 万 token 上下文,并以 MIT 许可开放权重;官方 API 价格目前处于截至 9 月 9 日的限时折扣期。
- vLLM 0.28.0 将权重卸载、E/P/D 解耦和分层 KV 缓存纳入正式版本,并覆盖 CUDA、ROCm、CPU 与 XPU 产物;同一版本也包含依赖升级和接口移除等不兼容变更。
- AWS 与 NVIDIA 计划在 2027—2028 年新增部署 200 万张 Blackwell Ultra、Rubin 和 Rubin Ultra GPU;这是未来容量规划,不是已经上线的资源,也未给出交易金额或云端价格。
模型层:把推理负担写进架构
Z.ai 于 8 月 26 日发布 GLM-5.3-Flash。官方资料将其描述为总参数 3200 亿、激活参数 180 亿的原生多模态模型,采用线性注意力与稀疏注意力结合的架构,支持 100 万 token 上下文、图像与视频输入、文件处理、工具调用、JSON 输出、流式返回和缓存。模型权重由 Z.ai 的官方 Hugging Face 账号以 MIT 许可发布,模型卡列出了 Transformers、vLLM、SGLang、TokenSpeed 和 KTransformers 等运行路径。
价格页显示,限时折扣期内每 100 万 token 的输入、缓存输入和输出价格分别为 0.075、0.015 和 0.25 美元,折扣截至 2026 年 9 月 9 日 24:00(UTC+8)。官方还给出相对于 GLM-5.3 的注意力计算和 KV 缓存缩减口径,但这些属于厂商测算;公开资料没有同时披露最低显存、量化条件、首 token 延迟、吞吐、并发、功耗或独立生产基准,而且模型的思考模式目前不能关闭。
对企业落地而言,较少的激活参数和混合注意力提供了新的成本杠杆,但“180 亿激活参数”不能直接换算为单机可部署性或服务容量。实际资源需求仍受精度、量化、上下文长度、批量、输出长度和质量约束影响;MIT 许可与已有运行框架扩大了私有化选择,却不等同于已经具备特定硬件适配、企业支持或安全合规认证。限时 API 价格也不能直接作为长期总拥有成本。
运行时层:KV 缓存开始跨越多级存储
vLLM 项目在 8 月 26 日发布正式版 v0.28.0。新版的 Model Runner V2 增加 E/P/D 解耦、权重卸载和多层 MTP KV 缓存支持;分层 KV 缓存则加入磁盘卸载、可由外部模块实现的二级存储管理器、部分加载结果、分层指标以及与并行方式无关的标准 CPU 布局。
该版本同时提供 CUDA 13、CUDA 12.9、ROCm、CPU 和 XPU 的镜像或安装产物,扩展了 NVIDIA、AMD、Intel 与通用 CPU 的部署入口。发布说明也明确列出不兼容变化,包括 bitsandbytes 支持迁移到外部插件、Transformers 依赖升级,以及移除 calculate_kv_scales 和 override_attention_dtype。页面中的 Kimi-K3 加速和显存节省数字来自项目贡献者在特定模型与配置下的测试,不是独立生产基准,也不能外推到其他模型、硬件、上下文或并发条件。
对企业落地而言,缓存开始成为可在 GPU、CPU 与磁盘之间组织的服务层资产,分层缓存和解耦执行也把容量优化从“增加 GPU”扩展为内存层级与服务拓扑设计,有可能提高稀缺加速器的利用率;相应代价是更多的数据搬运、尾延迟、故障域、监控与版本兼容变量。运行时具备某项卸载能力,并不意味着特定业务负载必然降低成本,模型热度分布、存储带宽、网络拓扑和服务级目标仍会决定结果。
供给层:200 万张 GPU 仍是未来计划
AWS 与 NVIDIA 在 8 月 26 日联合宣布,计划于 2027—2028 年在 AWS 全球基础设施中新增部署 200 万张 NVIDIA GPU,覆盖 Blackwell Ultra、Rubin 和 Rubin Ultra。合作范围还包括 Vera CPU、NVLink Fusion、NVHBM,以及与 AWS Nitro、Elastic Fabric Adapter 的集成;双方还提出为美国政府建设包含 10 万张 GPU、达到 IL6 及以上安全级别的 AI 基础设施。
这项公告描述的是未来两年的扩容路线,不代表 200 万张 GPU 已采购、交付或对客户开放。官方没有披露交易金额、区域与时间表拆分、具体实例规格、可用率或价格,TechCrunch 的同期报道也将其表述为计划部署。
对企业落地而言,200 万张 GPU 的计划增强了超大规模云端供给继续扩张的路线信号,但不足以推导 GPU 云服务单价将下降,也不能替代对具体地区和实例供货的判断。采购条件仍由实际区域、实例形态、网络与存储配套、交付节奏、服务等级和定价决定。它与模型及运行时效率并非替代关系:更大的基础设施池可以承载更多工作负载,而单次推理的资源消耗仍取决于模型架构和服务工程。
集成层:同日补丁暴露版本边界
Hugging Face 在 8 月 26 日先后发布 Transformers v5.16.0 和 v5.16.1。v5.16.0 将旧有的张量并行后端替换为基于 DTensor 的实现;约两小时后发布的 v5.16.1 恢复了原有兼容行为并设置弃用周期,同时加入 GLM-5.3-Flash 支持。模型发布与框架适配在同一天衔接。
GLM-5.3-Flash 模型卡给出了多个本地运行框架,vLLM 0.28.0 也提供跨硬件产物;两者的公开材料仍没有组成一套经过共同验证的企业部署矩阵。
对企业落地而言,模型“已开放”、框架“已支持”和运行时“有正式版本”是三个不同状态;同日出现的兼容性恢复也表明,支持列表并不消除依赖版本和迁移路径的约束。模型权重、转换器版本、推理引擎、量化格式、驱动与硬件后端之间任何一层变化,都可能改变正确性、性能和可运维性。把当天三类更新放在一起,更稳妥的结论是扩容需要综合评估一条版本协同的服务栈;只有在锁定版本组合、数据条件和服务目标后,各项能力才会形成可复现的部署结果,上游的兼容性恢复或不兼容变更也会进入验证范围、回退条件和生命周期成本。
后续观察
- GLM-5.3-Flash 在相同精度、上下文、批量和硬件条件下的独立首 token 延迟、吞吐、并发、功耗与质量测试。
- vLLM 分层 KV 缓存和 E/P/D 解耦在混合硬件、长上下文与持续并发场景中的稳定性、尾延迟及迁移成本。
- AWS 与 NVIDIA 计划对应的区域、实例规格、价格、网络与电力配套,以及 2027—2028 年的实际交付节奏。
来源与核验
本文由英科铸数基于所列公开资料编辑撰写。事实与数据以原始来源为准;“对企业落地意味着什么”为英科铸数结合企业客户场景所作的编辑分析,不构成对第三方产品的背书。
← 返回每日观察