今年以来,智谱 ARR 增长 15 倍,根据我们了解,在 Kimi 和阿里新模型发布后,智谱 ARR 增速没有受影响。有投资人透露目前 ARR 来到 20 亿美元,但智谱官方已经否认,接近公司的人表示,实际数字应该更高
市场一度流传智谱 ARR 已经达到 20 亿美元,智谱官方否认了这个数字,接近公司的人却认为实际数字可能更高。
数字究竟是多少,还缺少公司确认。我更关心的是另一个信号:今年以来,智谱 ARR 据报道增长了 15 倍;Kimi 和阿里发布新模型后,它的增速也没有明显放缓。
这说明当前的大模型市场仍在扩容,还没有进入你多拿一块、我就少一块的存量竞争。
编程让卖 token 成为真正的生意
这一轮增长的直接动力是编程。
智谱开放平台注册用户已接近 700 万,其中包括 2.3 万家企业客户。对标 Codex 的 ZCode,上线一个月用户突破百万。GLM-5 发布后,智谱 ARR 据报道在短期内翻倍。
编程与聊天不同。一个 Agent 完成任务,平均要处理7万多个 token 的上下文。项目越复杂,调用越频繁,消耗也越大。过去卖 token 更像在等待需求,现在 Coding 把需求真正推到了生产力场景里。
这也解释了为什么价格上涨没有立刻压低调用量。智谱 2025 年年报显示,定价提高一倍后,调用量反而增长八倍。Coding Plan 的入门价格也从最初每月 20 元,提高到目前 Lite 版每月 118 元。
这不是简单的涨价逻辑,而是供需关系变了:需求快速增加,算力却没有同步扩张,模型公司必须重新分配有限的推理能力。
算力不足,逼出了效率革命
智谱已经启用超过5万块国产算力芯片,但算力依然是瓶颈。硬件不能快速增加,竞争自然转向同一批芯片能够产出多少 token。
这使 Infra 从后台工程问题,变成了模型公司的核心经营能力。
智谱与中科加禾合作,通过拆分 KV 缓存,在长程任务中把单个推理服务吞吐最高提升 132%;ZCube 架构宣称可让生产集群吞吐提升最高 15%,同时减少交换机和光模块需求;高速版 API 达到每秒 400 token,约为常规服务的八倍。
GLM-5.2 的几项架构调整也直接围绕推理成本展开。IndexShare 在百万 token 场景下降低单位 token 计算量,改进后的 MTP 草稿层提高接受长度和生成速度。最终,在20万上下文长度下,GLM-5.2 的吞吐能力比 GLM-5.1 高出接近 70%。
Kimi 走了更激进的路线,把四分之三的注意力层改成线性注意力,以一定能力损失换取更小缓存和更高吞吐。路线不同,方向一致:模型、编译器和硬件正在重新耦合。
我认为,未来一两年模型竞争的重要变量,不只是排行榜上的能力差距,还有单位算力的产出。大规模部署中,哪怕 1% 的效率提升,也可能转化为巨额成本差异。
API 的毛利,来自技术纵深
推理效率持续提高,用户需求持续增长,卖 token 因而开始具备更清晰的商业模型。
报道援引的估算显示,智谱 API 在自有算力上运行时,理想毛利率可达 50% 到 60%。但这个数字没有计入前期的大规模算力采购和人员投入,不能直接等同于公司的整体盈利能力。
真正值得注意的是,开放权重未必会把官方 API 的价格打穿。
第三方可以部署模型,却未必能复制模型厂商在训练、架构和推理引擎之间积累的协同优化。模型厂商掌握更深的推理效率经验,因此仍有机会用更低成本提供同一个模型。
这也是开源争议的核心。一些厂商开始给开源授权增加商业限制;智谱的 GLM-5.2 仍采用宽松的 MIT 协议。开源是否损害定价权,最终不只取决于权重是否免费,还取决于第三方能否达到官方服务的效率。
独立模型公司的窗口重新打开
半年多前,独立模型公司的商业模式并不清楚。本地化项目、C 端订阅和高额亏损,都很难支撑一个稳定叙事。
Coding 改变了算账方式。按 token 计费的生产力需求快速增长,而大厂在第一梯队编程模型上曾经出现空档,给了智谱、Kimi 等公司一段难得的时间窗口。
独立公司没有太多历史包袱,研究方向调整更快,也更愿意把资源集中到新需求上。智谱较早把研究重心转向编程,因而抓住了这一轮机会。
但这个窗口不会长期存在。
阿里和腾讯正在继续扩大算力基础设施投入,大厂在资本、芯片采购和人才成本上都有明显优势。独立模型公司却仍受制于算力,有时还要向潜在竞争对手租用资源。模型只要掉出第一梯队,定价权和增长故事都可能迅速变化。
更大的风险是模型被当成零件
企业客户正在建立内部路由,根据任务难度组合不同价格、不同性能的模型。模型可以随时切换,数据、业务逻辑和工作流则留在企业内部。
这是理性的企业选择,却削弱了模型公司的客户黏性。领先模型守住位置的时间越来越短,用户又能在平台之间迁移,单纯的 API 很难形成长期壁垒。
因此,今天的高增长和较高毛利,并不能自动推导出稳定的终局。独立模型公司必须同时解决四件事:保持模型领先、提高推理效率、获得足够算力,并在企业工作流中建立不容易被替换的位置。
窗口还开着,市场也仍在增长。智谱的 ARR 是否高于传闻中的 20 亿美元,并不是最重要的问题。真正重要的是,它已经证明中国模型公司可以依靠 Coding 和 API 获得快速增长;接下来要证明的,是这种增长能否在大厂追赶、模型趋同和企业内部路由普及之后继续成立。