BLOG
GLM 自曝 10 万块国产加速卡自建推理集群:工程成色与叙事成色,分开看
热点跟踪:热点发布 × 技术判断 × 实用建议。 作者:永亮
9 月 17 日,z.ai 官方博客发布《Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure》,同日登上 Hacker News 热榜,366 分。博客称:智谱在超过 10 万块国产 AI 加速卡集群上从零建成完整的生产级推理服务,GLM-5.3-Flash 的全部生产推理都跑在这套系统上,并称此前没有人在这个规模部署过国产加速卡集群。博客把这件事放进「递归自我改进」(Recursive Self-Improvement)的框架里讲:AI 帮助人类造 AI 基础设施,下一代模型将在这一代 AI 参与建设的设施上训练。同一天,HN 评论区里讨论最热的却是另一件事——涨价。工程自立的故事和用户钱包的体感,在同一张热榜上碰头了,这期就两件事一起读。
发生了什么
按时间线摆事实。
9 月 17 日,博客发布,同日登上 HN 热榜 366 分。核心内容一句话概括:官方称,智谱在超过 10 万块国产 AI 加速卡上从零建成生产级推理服务,GLM-5.3-Flash 的全部生产推理跑在该系统上。
博客还讲了一个匿名上线的故事:官方称,GLM-5.3-Flash 曾以匿名代号 Ox-Alpha 在 OpenCode 和 OpenRouter 上线,上线一周内成为两个平台用量第一,六天处理超过 62 万亿 token。也就是说,先不谈集群规模,这个模型本身已经在两个第三方平台上以匿名身份跑过一轮市场检验——按官方口径。
官方口径:四条归拢
把官方自报的内容归拢成四条,以下全部带「博客称」的归属。
第一条,规模与成色。 超过 10 万块国产 AI 加速卡,从零建成生产级推理,GLM-5.3-Flash 全部生产推理在其上。博客自报的难点有四类:芯片显存与带宽有限;新架构叠加 1M 上下文与多模态,复杂度同时压上来;软件生态不成熟;kernel 支持不完整、文档缺失,部分环节靠猜。自报的技术栈包括:节点内张量并行(linear attention 与 LM Head)、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合精度 cache 量化、Layer Split、EPD(Encode-Prefill-Decode)分离式架构。这套清单本身是有信息量的:它大致画出了在国产卡上做推理要啃的骨头在哪里。
第二条,数字。 博客称,端到端性能较初始基线提升约 3×;硬件利用率与单 token 成本「达到与主流 NVIDIA GPU 相当的水平」(官方原话)。
第三条,Agent 叙事。 博客称,大量工作由 GLM-5.3 驱动的 Infra Agent 完成,从首次成功运行到生产就绪不到两周;安全伙伴用 GLM 在真实代码库中发现数千个漏洞;GLM-5.3 是团队每日编码伙伴,「正稳步走向取代我们」(官方原话)。
第四条,RSI 框架。 博客的标题就是「走向递归自我改进」:GLM 帮人类造 AI 基础设施,这件事将改变下一代模型的训练方式;配套还有一个可信访问计划(trusted access program),向安全研究伙伴开放能力。
冷静的另一半
第一件:3× 是相对自己的初始基线。 「较初始基线提升约 3×」——基线是团队自己搭的第一版,3× 是相对自己的相对数。它说明这套系统这一年优化做得勤,不说明它在任何行业坐标系里的位置。拿相对数当成绩单发,本身不算错,但读者需要自动做一步换算:起点越低,同样的 3× 含金量越不一样。这步换算,官方博客不会替你算。
第二件:「与主流 NVIDIA GPU 相当」缺对标对象。 「主流 NVIDIA GPU」是哪款、哪一代、什么负载、什么精度下的数据?博客没有给。这不是文字洁癖:「相当」是一个对标结论,对标结论必须带对标对象,否则它只是一个听起来像结论的形容词。读者能核实的部分是零,能感受的部分全是语气。
第三件:RSI 是框架,不是结论。 递归自我改进在技术上是有严格含义的:AI 改进自身、且改进速度自我加速。博客里实际发生的事是:推理工程优化(量化、并行、缓存策略),加上 Agent 辅助基础设施开发。这是扎实的工程,但它不是「AI 造 AI」。把常规推理工程装进宏大叙事,是当下厂商博客的标准动作——术语的重量级决定故事能传多远,而读者按故事重量接收、按工程重量兑现,中间就会出现落差。识别这中间的落差,比争论 RSI 是否成立更有用。
第四件:同一天的体温差。 博客讲的是普惠与算力自立的故事;同一天,HN 评论区的用户体感是涨价与额度收紧——按评论区口径,中间档从约 $20/月涨到约 $80/月,老的 Max 套餐($360/年)下架,现在的 Max 约 $168/月,按官方文档口径约折合 $1100 的 GLM-5.3 额度,多位用户抱怨额度限制紧。需要交代清楚:这些目前仍是评论区口径与文档口径,尚未见到官方定价公告。但体感温差是真实的——基础设施叙事越宏大,用户越会拿价格表来核对普惠的承诺。两条信息同一天出现,单读任何一条都会偏,放在一起读才有完整意义。
第五件:立场。 10 万卡集群目前只有官方自报,没有任何第三方或客户侧印证。立场说清楚:若属实属事实级工程成就,这个量级、这个难度的国产卡生产部署是实打实的硬仗,不该被一句「宣传」抹掉;但审计的另一面同样成立——10 万卡、3×、两周、62 万亿 token、数千漏洞,所有关键数字目前全部是官方自报,没有一项有第三方可复核。不唱衰,也不照单全收。这不只针对这一家,是读任何厂商博客的默认姿势。
值得关注的
其一,集群规模的独立印证。 10 万卡是否会出现第三方佐证——外媒跟进、客户侧证据、技术社区的独立复核。目前为零,这是全篇分量最重、也最缺印证的一个数字。
其二,定价的官方公告。 评论区流传的涨价是否落地为官方定价页的更新。若落地,前面说的「温差」就从评论口径升级为官方口径,讨论的地基会更实。
其三,「相当」的补全。 官方是否公开对标对象与负载条件。哪怕只是一句「在某型号、某典型负载下」,这个结论才开始进入可讨论的范畴。
其四,外媒跟进。 目前全篇来源只有官方博客加 HN。The Information、Bloomberg、SCMP 这类媒体若跟进,尤其出现独立技术复核,相应事实的确定性就可以升级。
结语
10 万块国产加速卡如果能被独立证实,这件事的工程分量不需要任何叙事加持,它本身就值得记录。需要打折的是叙事部分:3× 是相对数,「相当」无对标,RSI 是框架包装。工程成色与叙事成色,分开看——前者等第三方印证,后者现在就可以按审计来读。厂商博客既是广告位也是技术档案,区别不在发布者,在读者做不做那一步除法。
参考来源
- z.ai 官方博客 2026-09-17《Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure》(关键数字均为官方自报口径)
- Hacker News 同日讨论(366 分):评论区定价口径、额度体验与「对西方 AI 实验室是小行星级事件」等评论观点(评论观点,不是事实)
- z.ai 官方文档:Max 套餐额度口径(经 HN 评论转述)