9 月 10 日对在腾讯云上跑 AI 推理的团队是"双变动日",且两件事方向相反:中午 12:00 起 DeepSeek flash 系列执行新定价、价格下调;今晚 23:59:59,GLM-5.3-Flash 结束 5 折恢复目录价。
本文只回答一个问题:这两处变动之后,推理账单该怎么重算。
| 一、先把两个时间点钉死 |
| 变动项 | 生效/截止时间 | 方向 | 影响面 |
| DeepSeek flash 系列新价 | 9/10 12:00 起 | 下调 | flash 系列全部调用 |
| GLM-5.3-Flash 5 折 | 9/10 23:59:59 止 | 上调 | 该模型全部调用 |
两件事边界规则不同:DeepSeek 是"之后都算新价",GLM 折扣是"到此为止",跨期调用按请求发起时间计算。
| 二、DeepSeek 这次是降,但降在哪要算清楚 |
据 DeepSeek 开放平台公告,9 月 10 日 12 时起 flash 系列执行新价:空闲时段输入缓存命中 0.02 元/百万 tokens、未命中 1 元、输出 4 元;高峰时段为空闲 2 倍。这是 8 月以来第三次调价。
对照腾讯云 TokenHub 现行价目(2026-09-08 更新)「DeepSeek-V4-Flash 0731 正式版【原厂直供】」空闲档:输入 1.5、输出 4.5、缓存命中 0.05。新价三项都更低——输入约降 33%、输出约降 11%、缓存命中约降 60%。
降幅最大的不是输出,是缓存命中。多轮对话、长系统提示、RAG 反复召回同一批上下文的场景省得最多;单次独立问答几乎吃不到红利。
| 口径提醒:【原厂直供】模型跟随原厂调价,但 TokenHub 页面未必同步更新,计费以账单为准,建议 9 月 11 日核对实际单价。 |
| 三、GLM 恢复原价:不是"贵了一倍",是回到基准 |
GLM-5.3-Flash 目录价为输入 0.8、输出 2.8 元/百万 tokens;5 折期按 0.4、1.4 结算,结束后回到目录价。
换成账单:日均输出 5,000 万 tokens 的业务,5 折期输出侧 70 元/天、恢复原价 140 元/天,月差约 2,100 元;同类业务三四个,年化差额到六位数。算术见《GLM-5.3-Flash 限时 5 折的算术》。
更值得注意的是:恢复原价后输出 2.8 元仍是 TokenHub 上最低的商用单价之一——它不是变贵了,是回到本来该在的位置。
| 四、模型单价改不了,账单能改 |
先说清楚:模型目录价由官方统一制定,任何腾讯云代理渠道都不能改写单价。能动的是单价之外的三个变量。
| 变量 | 可操作空间 | 幅度 |
| 时段 | 峰谷差 2 倍;周末全天空闲价 | 输出侧可差 50% |
| 模型 | GLM-5.3-Flash 2.8 vs GLM-5.3 28 | 同族差 10 倍 |
| 缓存 | 命中 0.02–0.3 vs 未命中 1–20 | 命中率定单价 |
① 时段排程。原厂直供模型峰谷差 2 倍,8 月 23 日起周末全天按空闲价。离线标注、批量摘要等可延迟任务应排到空闲与周末。
② 任务分层。分类、抽取、路由等轻任务下沉到 GLM-5.3-Flash、Hy3 或 Hy-MT2-Lite(输出 1.2 元);复杂推理与代码生成才上 GLM-5.3、Kimi K3(100 元)。
③ 缓存复用。系统提示词、工具定义、知识库固定前缀应尽量前置且保持不变,让请求命中前缀缓存。这次命中价下调 60%,等于官方给会用缓存的人发补贴。
| 五、三个最容易算错的地方 |
① 峰谷按服务端接收请求的时间算,不是返回时间。23:50 发起、00:10 返回的请求仍按发起时段计费。
② 5 折跨期按请求发起时间算,不是完成时间。23:59:59 前发起的调用仍享 5 折,在跑的任务不必中断,但新发起的过了零点就是原价。
③ 同名模型有"原厂直供"和"非原厂直供"两个价。DeepSeek-V4-Pro 0813 正式版:原厂直供空闲档输出 13.5 元,非原厂直供 24 元,选错一行单价差近一倍。
| 六、今天剩下的 14 小时清单 |
| 时间 | 动作 |
| 现在–12:00 | 留存 flash 当前调用量与缓存命中率,作为调价前后基线 |
| 12:00–18:00 | 拉取新价生效后首批账单,核对实际结算单价 |
| 18:00–23:00 | 统计 GLM-5.3-Flash 日均用量,测算恢复原价后月增量 |
| 23:00–23:59 | 可提前的批量任务排入并发起(按发起时间享 5 折) |
| 七、腾讯云代理能补上的三块 |
① 用量结构诊断。把过去 30 天调用按模型、时段、命中率拆开,找出"旗舰跑轻任务""高峰跑批量"两块浪费。
② 模型分层方案。按任务类型给出主模型加兜底模型的切换规则,不是简单换便宜模型。
③ 与算力资源整体打包。推理成本之外,GPU、带宽、存储往往占比更大,需与云资源一起测算。腾讯云代理商折扣的实际口径见腾讯云代理商折扣,能省多少见《通过腾讯云代理采购到底能省多少钱》,选型与采购路径见《腾讯云企业选型终极指南与一站式采购攻略》,测算方法见《TCO 降本测算方法》。
| 结语 |
同一天一个降价、一个恢复原价,说明 AI 推理单价已进入高频调整期,盯着单次调价意义不大。真正决定账单的是时段、模型、缓存三个可控变量——腾讯云代理的价值不在这张价目表上,而在价目表之外。同批 9/30 到期的其他 AI 服务调整见《9 月 30 日 AI 服务调整迁移清单》。
|
概泽科技是腾讯云核心代理商,专注企业云服务超过10年,已服务超过5000家企业客户。 提供免费架构咨询、选型诊断、迁移规划,帮助企业以最低成本完成上云布局。 📞 17601247379
扫码获取专属优惠方案 · 1对1服务 |
在线咨询
二维码

TOP