BLOG

GLM enthüllt selbstgebautes Inferenzcluster mit 100.000 inländischen Beschleunigerkarten: Ingenieursleistung und Erzählkraft getrennt betrachten

Kael Zhang
GLMZhipuAI-Infrastruktur
广告 · Advertisement

Trendverfolgung: Trendveröffentlichung × Technische Einschätzung × Praktische Tipps. Autor: Yongliang


Am 17. September veröffentlichte der offizielle Blog von z.ai den Artikel „Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure“ und erreichte am selben Tag die Top-Liste von Hacker News mit 366 Punkten. Der Blog behauptet: Zhipu hat einen vollständigen, produktionsreifen Inferenzdienst von Grund auf auf einem Cluster mit über 100.000 inländischen AI-Beschleunigerkarten aufgebaut, und die gesamte Produktionsinferenz von GLM-5.3-Flash läuft auf diesem System. Zudem wird behauptet, dass zuvor niemand einen Cluster aus inländischen Beschleunigerkarten in diesem Maßstab eingesetzt hat. Der Blog rahmt dieses Ereignis im Kontext der „rekursiven Selbstverbesserung“ (Recursive Self-Improvement) ein: AI hilft Menschen beim Bau von AI-Infrastruktur, und die nächste Modellgeneration wird auf Einrichtungen trainiert, an deren Bau diese AI-Generation beteiligt war. Am selben Tag war jedoch im Kommentarbereich von HN ein anderes Thema am heißesten diskutiert – die Preiserhöhung. Die Geschichte der technischen Unabhängigkeit und das Gefühl der Geldbörse der Nutzer stoßen auf derselben Hitliste aufeinander; in dieser Ausgabe lesen wir beides zusammen.

Was ist passiert

Fakten chronologisch darlegen.

Am 17. September wurde ein Blogbeitrag veröffentlicht und erreichte am selben Tag die HN-Startseite mit 366 Punkten. Der Kerninhalt lässt sich in einem Satz zusammenfassen: Laut offiziellen Angaben hat Zhipu (智谱) einen produktionsreifen Inferenzdienst von Grund auf auf mehr als 100.000 inländischen KI-Beschleunigerkarten aufgebaut, und die gesamte Produktionsinferenz von GLM-5.3-Flash läuft auf diesem System.

Der Blog erzählt auch eine Geschichte über einen anonymen Start: Laut offiziellen Angaben war GLM-5.3-Flash unter dem Codenamen Ox-Alpha auf OpenCode und OpenRouter gegangen, wurde innerhalb einer Woche nach dem Start die Nummer eins bei der Nutzung auf beiden Plattformen und verarbeitete in sechs Tagen über 62 Billionen Token. Das bedeutet, dass das Modell selbst – abgesehen von der Clustergröße – bereits einen Marktest auf zwei Drittanbieterplattformen unter anonymer Identität durchlaufen hat – nach offiziellen Angaben.

Offizielle Stellungnahme: Vier Punkte zusammengefasst

Die von offizieller Seite gemeldeten Inhalte wurden zu vier Punkten zusammengefasst; im Folgenden wird alles mit der Zuschreibung „laut Blog“ versehen.

Erstens, Umfang und Qualität. Über 100.000 inländische KI-Beschleunigerkarten; von Grund auf wurde eine produktionsreife Inferenz aufgebaut, und die gesamte Produktionsinferenz von GLM-5.3-Flash läuft darauf. Laut Blog gibt es vier Arten von Herausforderungen: begrenzter Grafikspeicher und begrenzte Bandbreite der Chips; die neue Architektur in Kombination mit 1M-Kontext und Multimodalität, wodurch die Komplexität gleichzeitig zunimmt; eine unreife Software-Ökologie; unvollständige Kernel-Unterstützung und fehlende Dokumentation, wobei einige Bereiche auf Raten basieren. Der gemeldete Technologie-Stack umfasst: Tensor-Parallelisierung innerhalb von Knoten (linear attention und LM Head), ReplaySSM, W8A8-Quantisierung, INT8/FP8/BF16-Mischpräzisions-Cache-Quantisierung, Layer Split, EPD (Encode-Prefill-Decode) dezentrale Architektur. Diese Liste ist selbst informationshaltig: Sie skizziert grob, wo die harten Nüsse beim Durchführen von Inferenz auf inländischen Karten zu knacken sind.

Zweitens, Zahlen. Laut Blog hat sich die End-to-End-Leistung im Vergleich zur anfänglichen Basislinie etwa um das 3-fache erhöht; die Hardware-Auslastung und die Kosten pro Token haben „ein Niveau erreicht, das mit gängigen NVIDIA-GPUs vergleichbar ist“ (wörtliches Zitat der offiziellen Seite).

Drittens, das Agent-Narrativ. Laut Blog wurde ein Großteil der Arbeit von einem von GLM-5.3 angetriebenen Infra-Agenten erledigt; von der ersten erfolgreichen Ausführung bis zur Produktionsreife vergingen weniger als zwei Wochen; Sicherheitspartner fanden mithilfe von GLM Tausende von Schwachstellen in echten Codebasen; GLM-5.3 ist der tägliche Coding-Partner des Teams und „bewegt sich stetig darauf zu, uns zu ersetzen“ (wörtliches Zitat der offiziellen Seite).

Viertens, der RSI-Rahmen. Der Titel des Blogs lautet „Auf dem Weg zur rekursiven Selbstverbesserung“: GLM hilft Menschen beim Bau von KI-Infrastruktur, was die Trainingsmethoden der nächsten Modellgeneration verändern wird; begleitend gibt es ein Trusted Access Program (vertrauenswürdiges Zugriffsprogramm), das Sicherheitsforschungspartnern die Fähigkeiten offenlegt.

Die nüchterne andere Seite

Erster Punkt: 3× bezieht sich auf die eigene anfängliche Basislinie. „Eine Verbesserung von ca. 3× gegenüber der anfänglichen Basislinie“ – die Basislinie ist die erste Version, die das Team selbst aufgebaut hat, 3× ist eine relative Zahl im Vergleich zu sich selbst. Dies zeigt, dass an der Optimierung dieses Systems im Laufe des Jahres fleißig gearbeitet wurde, sagt aber nichts über seine Position in irgendeinem Branchenkoordinatensystem aus. Relative Zahlen als Zeugnis zu veröffentlichen, ist an sich nicht falsch, aber der Leser muss automatisch einen Umrechnungsschritt vornehmen: Je niedriger der Ausgangspunkt, desto anders ist der Wert derselben 3×. Dieser Umrechnungsschritt wird vom offiziellen Blog nicht für dich durchgeführt.

Zweiter Punkt: „Vergleichbar mit gängigen NVIDIA-GPUs“ fehlt das Vergleichsobjekt. Welches Modell, welche Generation, welche Workload und welche Genauigkeit liegen den Daten für „gängige NVIDIA-GPUs“ zugrunde? Der Blog gibt dies nicht an. Das ist keine Wortklauberei: „Vergleichbar“ ist ein Benchmark-Ergebnis, ein Benchmark-Ergebnis muss ein Vergleichsobjekt enthalten, sonst ist es nur ein Adjektiv, das wie ein Ergebnis klingt. Der Teil, den der Leser überprüfen kann, ist gleich Null; der Teil, den er fühlen kann, ist nur der Tonfall.

Dritter Punkt: RSI ist ein Framework, kein Fazit. Rekursives Selbstverbessern (Recursive Self-Improvement) hat technisch gesehen eine strikte Bedeutung: Die KI verbessert sich selbst, und die Geschwindigkeit der Verbesserung beschleunigt sich selbst. Was im Blog tatsächlich passiert, ist: Optimierung des Inferenz-Engineerings (Quantisierung, Parallelisierung, Caching-Strategien) zusammen mit Agent-unterstützter Infrastrukturentwicklung. Das ist solide Ingenieursarbeit, aber es ist nicht „KI erschafft KI“. Gewöhnliches Inferenz-Engineering in ein großes Narrativ zu verpacken, ist die Standardbewegung in aktuellen Hersteller-Blogs – das Gewicht der Terminologie bestimmt, wie weit die Geschichte reicht, aber der Leser nimmt sie nach dem Gewicht der Geschichte auf und muss sie nach dem Gewicht der Ingenieursarbeit einlösen; dazwischen entsteht eine Lücke. Diese Lücke zu erkennen, ist nützlicher als zu streiten, ob RSI gilt.

Vierter Punkt: Der Temperaturunterschied am selben Tag. Der Blog erzählt die Geschichte von Inklusivität und Rechenleistungsautonomie; am selben Tag ist die Wahrnehmung der Nutzer im Kommentarbereich von HN von Preiserhöhungen und Kürzungen der Kontingente geprägt – nach Angaben der Kommentare stieg die mittlere Stufe von ca. 20 $/Monat auf ca. 80 $/Monat, der alte Max-Tarif (360 $/Jahr) wurde eingestellt, der aktuelle Max liegt bei ca. 168 $/Monat, was nach offiziellen Dokumenten etwa 1100 $ an GLM-5.3-Kontingent entspricht, und mehrere Nutzer beklagten enge Kontingentbeschränkungen. Es muss klar gestellt werden: Dies sind derzeit noch Angaben aus dem Kommentarbereich und den Dokumenten, es gibt noch keine offizielle Preisbekanntmachung. Aber der gefühlte Temperaturunterschied ist real – je größer das Narrativ über die Infrastruktur, desto mehr werden Nutzer die Preisliste nutzen, um das Versprechen der Inklusivität zu überprüfen. Beide Informationen erscheinen am selben Tag; liest man nur eine, ist das Bild verzerrt, liest man beide zusammen, hat es eine vollständige Bedeutung.

Fünfter Punkt: Standpunkt. Der 100.000-Karten-Cluster beruht derzeit nur auf offiziellen Eigenangaben, ohne Bestätigung durch Dritte oder Kunden. Der Standpunkt sei klar gesagt: Wenn es stimmt, ist es eine technische Leistung auf Faktebene, und die Produktion und Bereitstellung von inländischen Karten in diesem Ausmaß und dieser Schwierigkeit ist ein harter Kampf, der nicht mit einem Wort wie „Propaganda“ abgetan werden sollte; aber die andere Seite der Prüfung gilt ebenso – 100.000 Karten, 3×, zwei Wochen, 62 Billionen Token, tausende Sicherheitslücken, alle Schlüsselzahlen sind derzeit offizielle Eigenangaben, keine davon ist durch Dritte überprüfbar. Nicht pessimistisch beurteilen, aber auch nicht kritiklos akzeptieren. Das gilt nicht nur für diesen einen Hersteller, es ist die Standardhaltung beim Lesen von Blogs beliebiger Hersteller.

Beachtenswertes

Erstens, die unabhängige Bestätigung des Cluster-Maßstabs. Ob es für die 100.000 Karten Drittbestätigungen geben wird – Nachberichterstattung durch ausländische Medien, Beweise von Kundenseite, unabhängige Überprüfungen durch die Tech-Community. Derzeit ist dies gleich Null; das ist die gewichtigste und gleichzeitig am wenigsten bestätigte Zahl im gesamten Text.

Zweitens, die offizielle Ankündigung der Preisgestaltung. Ob die in den Kommentaren kursierenden Preiserhöhungen in einem Update der offiziellen Preisseite umgesetzt werden. Wenn dies geschieht, wird der zuvor erwähnte „Unterschied“ von der Ebene der Kommentare auf die offizielle Ebene gehoben, und die Grundlage für die Diskussion wäre gefestigter.

Drittens, die Vervollständigung des „Vergleichs“. Ob die offizielle Seite die Benchmark-Objekte und Lastbedingungen offenlegt. Selbst wenn es nur ein Satz ist wie „unter einem bestimmten Modell und einer typischen Last“, erst dann beginnt diese Schlussfolgerung, in den Bereich des Diskutierbaren einzutreten.

Viertens, die Nachberichterstattung durch ausländische Medien. Derzeit stammen die Quellen für den gesamten Text nur aus dem offiziellen Blog und HN. Wenn Medien wie The Information, Bloomberg oder SCMP darauf eingehen, insbesondere wenn unabhängige technische Überprüfungen auftauchen, kann die Gewissheit über die entsprechenden Fakten erhöht werden.

Fazit

Wenn die 100.000 inländischen Beschleunigerkarten unabhängig verifiziert werden können, benötigt die ingenieurtechnische Tragweite dieser Sache keinerlei erzählerische Aufwertung; sie ist an sich schon der Aufzeichnung wert. Was abgewertet werden muss, ist der narrative Teil: 3× ist eine relative Zahl, „vergleichbar“ hat keinen Referenzwert, RSI ist Framework-Verpackung. Technischer Gehalt und Erzählgehalt sollten getrennt betrachtet werden – Ersteres wartet auf die Bestätigung durch Dritte, Letzteres kann jetzt bereits wie ein Audit gelesen werden. Hersteller-Blogs sind sowohl Werbeflächen als auch technische Archive; der Unterschied liegt nicht beim Herausgeber, sondern darin, ob der Leser diesen Divisionsschritt vornimmt.

Quellen

  • z.ai offizieller Blog 2026-09-17 „Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure“ (alle Schlüsselzahlen stammen aus offiziellen Angaben)
  • Hacker News Diskussion am selben Tag (366 Punkte): Preisaussagen im Kommentarbereich, Erfahrungen mit den Kontingenten und Kommentare wie „ein planetarisches Ereignis für westliche KI-Labore“ (Kommentarmeinungen, keine Fakten)
  • z.ai offizielle Dokumentation: Kontingentangaben zum Max-Tarif (wie in HN-Kommentaren berichtet)
广告 · Advertisement

Häufige Fragen

Welche Rolle spielt die rekursive Selbstverbesserung bei der Entwicklung des Inferenzdienstes?

Die rekursive Selbstverbesserung bedeutet, dass AI-Infrastruktur durch AI selbst gebaut wird, und die nächste Modellgeneration wird auf Einrichtungen trainiert, an deren Bau diese AI-Generation beteiligt war.

Welche Bedeutung hat der Blogbeitrag vom 17. September?

Der Blogbeitrag vom 17. September enthüllt, dass Zhipu einen Inferenzdienst auf einem Cluster mit über 100.000 inländischen AI-Beschleunigerkarten aufgebaut hat, und erreichte am selben Tag die Top-Liste von Hacker News.

Wie hat GLM-5.3-Flash seine Marktposition erreicht?

GLM-5.3-Flash, unter dem Codenamen Ox-Alpha, wurde innerhalb einer Woche nach dem Start auf OpenCode und OpenRouter zur Nummer eins in der Nutzung und verarbeitete in sechs Tagen über 62 Billionen Token.