---
title: "把输出速度提到200 Tokens/s，智谱在赌什么？"
date: 2026-09-19
category: AI大模型
site: 脑机网
canonical: https://www.logic.wang/a/njw-fbcaf7
language: zh-CN
---

# 把输出速度提到200 Tokens/s，智谱在赌什么？

> 9 月 18 日午间，智谱在官方微信宣布上线 GLM-5.3-FlashX，API 同步全面开放。

9 月 18 日午间，智谱在官方微信宣布上线 GLM-5.3-FlashX，API 同步全面开放。

两个数字值得记：推理速度最高可达 200 Tokens/s，较现有的 GLM-5.3-Flash 提升 5 倍；定价提升至原版本的 2.5 倍。

速度提 5 倍，价格涨 1.5 倍——这种"加价提速"的打法，在当前国内大模型普遍降价的背景下，是个反常操作。

**为什么要做"更贵更快"**

要理解这个决定，得先看它面对的是什么局面。

GLM-5.3-Flash 此前以"Ox Alpha"之名面向全球开发者上线，凭借性能和性价比获得了不错的口碑，调用量持续攀升。据智谱介绍，由 10 万张国产芯片组成的推理集群上线即被打满。

"打满"是个关键词。这意味着瓶颈不是需求，而是供给——想用的人用不上，因为算力不够。

在这种情况下，继续降价是没意义的。价格降下来只会让排队更长、体验更差。合理的做法是：把有限的算力分配给愿意付更高价格、对速度更敏感的场景，同时用更高的单价支撑算力扩容。

所以 FlashX 不是一次常规的版本升级，而是一次算力资源配置的调整。

**算力是硬约束**

智谱今年的融资节奏很能说明问题：7 月和 9 月分别完成 40 亿美元、50 亿美元再融资，用途明确写着持续扩容算力。

2026 年上半年，智谱的算力乘数指标同比增长了 14 倍。瑞银预计，该指标在未来 6 至 12 个月内可超过 1——这个"1"的含义是，算力供给将不再构成收入增长的硬约束。换句话说，现在是硬约束。

这也是为什么"10 万张国产芯片集群打满"这个细节重要。它既说明需求真实，也说明国产算力在大模型推理场景里已经能扛住生产级负载。

**从生态投入到变现**

另一条线更值得琢磨。

智谱近期已与海内外头部云服务商签署收入分成协议，相关收入将从 10 月起确认。这意味着 GLM 系列开源模型不再只是纯粹的生态投入——通过第三方云基础设施和企业销售渠道扩大模型分发，能快速提升变现能力。

这条路 Anthropic 走过。它目前已覆盖 AWS Bedrock、Google Cloud Vertex AI 和 Microsoft Azure Foundry 三大云平台。到 2026 年春季，其年化收入已超过 300 亿美元，而 2025 年底仅约为 90 亿美元。

半年翻三倍多，云渠道的分发能力是主要推手之一。

智谱的动作也很直接：把年末 ARR（年度经常性收入）指引由 24 亿美元上调至 30 亿美元，上调幅度 25%。截至当前，公司全业务口径 ARR 已达到 18 亿美元。

**一个值得注意的转折**

开源大模型的商业模式，一直是行业里的老大难。

模型开源意味着任何人都能免费拿去用，那钱从哪来？过去几年主流答案是"开源换生态、生态换其他收入"，逻辑成立但链条太长。

现在出现了一条更短的链路：开源模型通过云厂商分发，云厂商按调用量付费给模型方。模型方不用自己建销售团队，云厂商不用自己从头训模型，各取所需。

这条路能不能走通，取决于两件事：一是模型的竞争力是否强到云厂商不得不接，二是分成比例是否划算。

从智谱敢上调 ARR 指引 25% 来看，至少它自己认为第一件事已经成立了。

**风险在哪**

当然也有隐忧。

速度提到 200 Tokens/s 是个体验改进，但它不解决模型能力本身的问题。如果竞品在同等速度下能力更强，或者同等能力下更便宜，FlashX 的溢价就撑不住。

更根本的是，依赖云厂商分发意味着把自己的用户关系交出去一部分。模型方离最终用户越远，议价能力就越弱。这是一个需要用持续的技术领先来平衡的结构性风险。

不过就眼下而言，智谱的这道题解得挺清楚：算力不够就融资扩容，扩容的钱从愿意为速度付费的客户身上赚，同时把开源模型变成云渠道里的分发资产。

在所有人都在降价的时候选择提价，需要的不是勇气，而是对自己稀缺性的判断。市场会很快给出答案。

---

来源：脑机网（https://www.logic.wang/）｜原文：https://www.logic.wang/a/njw-fbcaf7
本内容仅供参考，不构成投资建议。
