智谱 GLM-5.3-FlashX 上线,速度 5 倍,价格 2.5 倍

2026-09-19 智谱GLM定价风险

先给数字。GLM-5.3-FlashX 和原来的 Flash 对比(均为每百万 token 人民币单价):

模型输入输出缓存命中上下文
GLM-5.38 元28 元2 元1M
GLM-5.3-Flash0.8 元2.8 元0.23 元1M
GLM-5.3-FlashX2 元7 元0.57 元1M

速度确实上去了:官方口径最高 200 tokens/s,是 Flash 的 5 倍。对于对话类、流式输出类应用,这个提升是能直接感知到的——用户等第一颗字的时间短了一大截。

但这是一次变相涨价。同样的模型系列,同样的能力水平,想要更快的那档就得掏 2.5 倍。智谱今年的动作连贯得有点吓人:2 月发布 GLM-5 时上调 API 与 Coding Plan 价格,3 月 GLM-5-Turbo 再涨 20%,4 月 GLM-5.1 又涨 10%,这次是第四次。公司在财报会上说得很直白:截至 8 月底 MaaS 平台 token 调用量较年初增长 40 倍、用户 740 万,同期 API 定价同比提高 101%,毛利率升到 24.6%。

翻译成人话:低价期结束了。

对一个人做产品的影响很具体:

  • 别把单价写进商业模型:如果你的定价是按”调用一次成本 3 分钱”算出来的毛利,那么一次 2.5 倍调价就能把毛利打穿。合同里定价、免费额度上限、甚至要不要做这个功能,都应该以”最坏情况单价”来算,不是今天的单价。
  • 模型层必须可替换:把厂商 SDK 直接散落在业务代码里是最常见的坑。抽一层薄的适配:统一的调用签名、统一的参数映射、配置文件里选模型。理想状态是换模型只改一行配置,一小时内可回滚。
  • 留一个”贵到什么程度就不用它”的阈值:提前写死,比如”输出单价超过 X 元就降级到本地模型”。真到了那天你不会有心情算账。
  • 快也是有收益的:如果你的场景是交互式(客服、写作助手、实时翻译),FlashX 贵的那部分钱换来更好的体验,可能反而提高留存。别本能地拒绝涨价,按”单位任务的综合体验成本”算。

顺带一条行业信号:证券日报的分析口径里提到”大模型价格战基本落幕”。这跟我们上周报的 OpenRouter 出图实测、DeepSeek 峰谷定价拼起来看,是同一件事的三面——厂商开始追求单位算力的毛利,而不是装机量。这意味着未来一年的成本趋势更可能是缓慢上行,而不是继续探底。较优的应对是把”能本地跑的那部分”逐步挪到本地(本站收录的 Ollama、llama.cpp、LiteLLM 都是为这种切换准备的),把云 API 花在真正需要最强模型的地方。

原文:https://next.ithome.com/archiver/1/004/061.htm

原文出处 · 事实以此为准
IT之家 · 智谱 GLM-5.3-FlashX 模型上线
阅读原文 ↗