文章目录
- Baseten 将在太平洋时间 9 月 25 日 17:00 停用 GLM 4.7、Kimi K2.7、Kimi K2.6、Inkling、Inkling Small 和 DeepSeek v4 Pro 的模型 ID;届时这些 ID 会失效并对所有请求返回错误。
- Fireworks 的 9 月 25 日下线只覆盖旧 DeepSeek、GLM、Muse 与 Kimi 的 Serverless 入口,Dedicated 部署不受影响;相同模型名称在不同服务形态中因此可能具有不同生命周期。
- DeepSeek 于 9 月 10 日曾计划自今天 12:00 起把 deepseek-v4-pro 暂时路由到 V4.1 Flash;当前 API 文档已改为 9 月 14 日后继续提供 V4 Pro、计费不变。LiteLLM 最新候选版本开始同步弃用日期并显示实际路由模型,但目录与路由日志都不能替代生效前的最终状态复核。
同一轮模型迁移出现了三种生命周期处理
Baseten 于 9 月 13 日公布,GLM 4.7、Kimi K2.7、Kimi K2.6、Inkling、Inkling Small 和 DeepSeek v4 Pro 将在太平洋时间 9 月 25 日 17:00 被弃用。公告把截止后的行为写得很明确:相关模型 ID 会变为非活动状态,并对所有请求返回错误。它没有承诺旧 ID 自动映射到推荐替代项,因此继续使用这些 ID 的调用方将在截止点遇到显式失败。
Fireworks 于 9 月 12 日公布了同样指向 9 月 25 日的 Serverless 迁移,范围包括 DeepSeek V4 Flash (0731)、DeepSeek V4 Pro (0813)、DeepSeek V4 Flash Vision Exp、GLM 5.2、Muse Glimmer 30B、Kimi K2.6 和 Kimi K2.7 Code。该公告同时限定,Fast 与 US-only Serverless 变体在适用时也受影响,而 Dedicated 部署不受影响。三项 DeepSeek 模型推荐迁往 V4.1 Flash,GLM 5.2 推荐迁往 GLM 5.3,Muse 推荐迁往 NVIDIA Nemotron 3.5 Lightning 30B A3B,两项 Kimi 模型可迁往 GLM 5.3 或 Kimi K3。
DeepSeek 对自有 API 的第三种处理发生在计划生效前。官方 9 月 10 日公告称,旧 V4 Flash 与 V4 Flash Vision Exp 已退役,其兼容模型名暂时路由到 V4.1 Flash,并原定自北京时间 9 月 14 日 12:00 起把所有 deepseek-v4-pro 请求也路由到 V4.1 Flash。当前 API 文档则改为:因用户需求,9 月 14 日后继续提供 DeepSeek V4 Pro API,计费方式不变,如有变化将另行通知。两份官方材料保留了不同阶段的口径,运行判断应以生效前最后状态为准。
这三种处理把“端点还通不通”和“仍在运行什么”分成了两个问题:硬下线会形成可见错误,按服务形态退役只影响部分部署,而临生效前改期会使旧迁移清单迅速失真。企业运行状态若只记录请求中的 model 字符串或首次公告,无法区分服务中断、部署范围变化和计划被覆盖。
接口兼容不代表替代模型在任务上等价
DeepSeek 将 V4.1 Flash 描述为 5520 亿参数的多模态 MoE 模型,输入阶段每个 token 激活 80 亿参数,输出阶段激活 160 亿参数,并支持最长 100 万 token 上下文。官方模型卡同时说明,指令模型结果使用最高 reasoning_effort=100;代码 Agent 评测采用不同的 DeepSeek Harness、mini-SWE 或 Claude Code 脚手架,视觉 Agent 评测使用 51.2 万 token 上下文。模型能力数字因此绑定着推理强度、上下文和执行脚手架,不能只由 API 名称继承。
同一份官方表格也显示“替代”不是每一项都更高:V4.1 Flash 在 Terminal-Bench 2.1 的 Pass@1 为 90.6,高于 V4 Pro 的 87.9;DeepSWE v1.1 为 74.2,对照为 62.7。但在 GPQA Diamond 上,V4.1 Flash 为 90.9,低于 V4 Pro 的 92.4;在同为文本子集的 HLE 口径上则为 39.1 对 42.7。该表属于厂商在指定配置下的评测,不是企业负载的独立结果,却足以说明计划中的别名重定向不能被解释为逐任务等价升级。
模型入口保持兼容可以减少代码改动,但输出质量、工具行为、视觉输入、上下文占用、时延和价格仍可能改变。可比较的迁移记录需要同时固定请求别名、实际模型修订、推理参数、脚手架和业务样本;否则迁移后的成功率变化很难被归因。
私有部署不会消除生命周期,只会改变失效方式
Fireworks 明确把 9 月 25 日的退役限制在 Serverless,Dedicated 部署继续运行。这种边界使同一供应商中的服务形态成为模型身份的一部分:共享端点可能按平台目录快速更新,专用实例则由独立部署和容量承担生命周期。它也意味着从 Serverless 切到 Dedicated 并非单纯更换 URL,还涉及镜像、GPU 形态、扩缩容、补丁和费用口径。
NVIDIA AI Enterprise 的生命周期公告展示了私有化侧的另一种约束。Llama-3.1-8B-Instruct、Llama-3.3-Nemotron-Super-49B-v1.5 和 Nemotron 3 Nano 的 model-specific NIM 都以 Production Branch 6 为最后支持分支,Production Branch 7 不再包含,支持在 2027 年 1 月结束;此后相应制品不再获得 CVE 补丁、缺陷修复或更新。NVIDIA 给出的迁移路径包括改用 model-free NIM 并配置受支持的模型来源和 profile,或迁移到其他受支持 NIM;其中后两项还明确要求切换前验证行为或应用质量、性能和 GPU 容量。
云端端点的主要风险常表现为某日开始报错或被自动路由,私有部署的风险则更多表现为运行分支冻结、补丁停止和硬件容量重新核算。两者都属于模型服务生命周期,只是责任边界不同;模型清单只有同时包含提供方、服务形态、端点或镜像标识、运行分支和支持截止日,才足以描述实际暴露面。
网关开始补路由账,但发布记录还不是生产证据
北京时间 9 月 13 日发布的 LiteLLM v1.102.0-rc.1 把模型目录与路由可见性列入同一候选版本:发布记录包括审计 deepseek-flash 与 gpt-live-1、修正 xAI 与 Groq 的弃用日期、同步 Azure 与 Together 的弃用日期,并增加 Fireworks 上的 DeepSeek V4.1 Flash。它还在 Claude Code 与 Codex 中显示实际路由模型和会话节省,暴露复杂度路由响应头,修复自动路由层不健康时的回退,并为发布容器提供 cosign 签名验证说明。
这些改动说明多模型网关正在把目录、价格、弃用、实际路由与回退原因变成可观察状态,但发布页把 v1.102.0-rc.1 标为 Pre-release。它能证明相关代码进入候选版本,不能证明目录永远及时、所有提供方都会返回不可变的底层修订,也不能证明自动回退后的业务结果与原模型一致。网关日志若只展示友好名称或节省金额,仍不足以重建一次请求实际经过的模型、价格和策略。
模型生命周期的可审计单位正在从一个 API model 名称扩展为一条解析链:调用方别名、网关路由、提供方端点、实际模型修订、服务形态、价格快照、回退原因和验证结果彼此关联。控制面可以记录这条链,但是否允许自动替换、遇到未知修订时失败关闭,仍取决于业务风险与既定策略。
后续观察
- DeepSeek V4 Pro 的延续安排会维持多久、后续变更是否提供明确生效时间,以及 API 是否提供可稳定记录的实际模型修订。
- Baseten 与 Fireworks 在 9 月 25 日截止点的具体错误码、最后成功请求时间、区域差异和迁移后的容量安排。
- 多模型网关是否会形成跨提供方的标准字段,同时记录请求别名、解析版本、价格快照、服务形态、回退原因和验证批次。
来源与核验
本文由英科铸数基于所列公开资料编辑撰写。事实与数据以原始来源为准;“对企业落地意味着什么”为英科铸数结合企业客户场景所作的编辑分析,不构成对第三方产品的背书。
← 返回每日观察