BLOG

mini-AGI: Ein kontinuierlich lernendes Byte-Level-Sprachmodell, trainiert von Grund auf auf einer 8GB-Grafikkarte

Kael Zhang
Open-SourceSprachmodellekontinuierliches-Lernen
广告 · Advertisement

Technische Zerlegung: Analyse des KI-Technologie-Frameworks – Erklärung, Analyse, technische Bewertung, Werturteil, praktische Anwendung. Autor: Yongliang


Bei den heutigen Mainstream-Sprachmodellen ist das Training ein einmaliges Geschäft: Sie lesen in einem Zug enorme Mengen an Korpusdaten, erstarren zu einem Basismodell, und neues Wissen kann danach nur durch Runden von Fine-Tuning-Patches aufgepfropft werden. Pfropft man zu viel auf, kommt es zum Vergessen, und um wirklich weiterzulernen, muss neu trainiert werden. Am 21. September 2026 stellte der GitHub-Autor Alexey Borsky das Projekt mini-AGI, das diese Reihenfolge komplett umkehrt, auf Show HN vor und erhielt 255 Upvotes und 56 Diskussionen. Seine Behauptung ist sehr direkt: Lesen und Trainiert-Werden sind ein und dasselbe – das Modell liest blockweise aus dem Zeichenstrom, führt für jeden gelesenen Block einen Gradientenschritt aus, friert niemals ein und macht niemals einen Abschluss. Dieser Artikel zerlegt das Ganze anhand von sechs Aspekten: Was es ist, warum es sich zu sehen lohnt, wie der Mechanismus funktioniert, Zahlen und Grenzen, wer es zum Laufen bringen kann und für wen es geeignet ist.

1. Was es ist

mini-AGI ist ein Sprachmodell auf Byte-Ebene: Das Alphabet besteht aus den 256 Byte-Werten, es gibt keinen Tokenizer, und für jeden Datentyp – Text, Code, Schachaufzeichnungen, Dialoge – der hereinkommt, ist kein neues Vokabular nötig. Seine Kernidentität ist ein „Modell für kontinuierliches Lernen“: Es liest kontinuierlich aus dem Zeichenstrom, aktualisiert die Gewichte nach jedem verarbeiteten Datenblock, und Lesen, Inferenz und Lernen laufen über denselben Codepfad. Die Positionsbestimmung in der README lohnt sich, im Original zu behalten: „Keine separate Fine-Tuning-Phase, keine eingefrorene Basis, Lesen und Trainiert-Werden sind ein und dasselbe“.

Am wenigsten intuitiv ist die Art und Weise, wie die Parametermenge gespeichert wird. Die Gewichte liegen nicht auf der Grafikkarte, sondern auf der Festplatte und werden bei Bedarf in den VRAM ausgelagert – daher wird die Obergrenze der Parametermenge des Modells durch die Festplattenkapazität bestimmt, nicht durch den VRAM. Das ist wie der virtuelle Speicher eines Betriebssystems: Der Adressraum, den ein Programm sieht, ist viel größer als der physische Speicher; übertragen auf diesen Fall ist der Parameterraum, den das Modell sieht, viel größer als der VRAM. Ungenutzte Gewichte liegen auf der Festplatte, und wer an der Reihe ist zu arbeiten, wird in die Grafikkarte geladen. Diese Umkehrung ist der Ausgangspunkt seines gesamten Designs – die Grafikkarte bestimmt nicht mehr, wie groß das Modell wachsen kann, sondern nur, wie schnell es läuft. Das gesamte Projekt umfasst 42 Dateien, 30 Python-Dateien, 17 MB Umfang und steht unter der MIT-Lizenz.

Aber die Erwartungshaltung muss von vornherein klar festgelegt werden, wie der Autor selbst in der README festnagelt: „as of now this is a small toy-level model. Do not expect a frontier level capabilities.“ Dies ist ein kleines Experiment, das beweist, dass „kontinuierliches Lernen ohne katastrophales Vergessen möglich ist“, kein Durchbruch in den Fähigkeiten. Auch die Gewichte wurden noch nicht veröffentlicht – die erste Runde des Korpus ist noch nicht vollständig gelesen, was voraussichtlich noch mehrere Wochen dauern wird. Der Autor möchte abwarten, bis diese Runde beendet ist und die Zahlen sich stabilisiert haben, bevor er sie der Öffentlichkeit präsentiert. Mit diesen beiden Sätzen im Hinterkopf weiterzulesen, ist der richtige Ansatz: Man sollte es als ein sorgfältig durchgeführtes Kontrollexperiment betrachten und nicht als ein unfertiges Produkt.

2. Warum es sich jetzt lohnt, es anzusehen

Der Grund, warum es sich lohnt, es sich anzusehen, liegt nicht darin, wie stark das Modell ist, sondern darin, dass es sich auf die Gegenseite des aktuellen Paradigmas gestellt hat.

Der Standardansatz, um heute an ein Modell zu kommen, ist: Das Basismodell einfrieren und dann eine dünne Fine-Tuning-Schicht darüberlegen – LoRA, Adapter, fortgesetztes Domain-Pretraining sind alles Varianten dieser Idee. Das Basismodell ist ein heiliges, unbewegliches Kapital, neues Wissen ist angehängtes Gepäck. Dieser Ansatz ist technisch ausgereift, aber er hat einen strukturellen Preis: Das Modell lernt nie wirklich dazu, sondern das Gepäck wird immer schwerer, bis es irgendwann anfängt, sich gegenseitig zu blockieren – katastrophales Vergessen.

Die Antwort von mini-AGI ist die Aufhebung der Grenze zwischen „Training“ und „Nutzung“. Das Modell lernt in jeder Sekunde seiner Existenz: Wikipedia lesen ist Lernen, Schachaufzeichnungen lesen ist Lernen, und mit Ihnen zu dialogieren ist ebenfalls Lernen. Das ist konzeptionell nah am Menschen: Niemand zwängt zwanzig Jahre Lektüre in eine „Pre-Training-Phase“ und schließt das Buch dann für immer. Der Preis für die Umsetzung ist, dass man durchgehend den Optimizer-Status mitschleppt, um Online-Gradienten-Updates durchzuführen. Die technische Schwierigkeit ist weitaus höher als beim Einfrieren nach dem Training, weshalb dies lange ein rein theoretisches Konzept in Papieren blieb – bis jemand es in eine 8-GB-Consumer-Grafikkarte gequetscht hat. Dieses Komprimierungsschema an sich ist der Hauptaugenmerk dieses Artikels.

Die Reaktionen auf Hacker News verdeutlichen ebenfalls den Charakter dieses Projekts. Befürworter sagten, es sei wie ein frischer Frühlingswind, „Mini-AGI“ und „8 GB VRAM“ im selben Satz zu sehen – ein lokal lauffähiges Modell für kontinuierliches Lernen scheint nicht mehr so unerreichbar; andere Entwickler, die im Bereich des kontinuierlichen Lernens forschen, gaben an, sie hätten sich gerade Sorgen gemacht, da ihre aktuellen Lösungen alle nur nachträglich reparierten, und seien sehr erfreut, ein System zu sehen, das von Grund auf zur Verhinderung von katastrophalem Vergessen konzipiert wurde – es lohne sich, es zu klonen und Zeile für Zeile zu lesen. Wieder andere zogen eine historische Parallele: Vor dem Aufkommen von Personalcomputern glaubte die alte Generation von Experten, Großrechner würden als Erste künstliche Intelligenz meistern, doch der Mainstream-Weg erwies sich als Sackgasse – nach der Demokratisierung der Rechenleistung brachten Randgruppen-Explorationen tatsächlich Neues hervor. Die 255 Stimmen gelten nicht einem Produkt, sondern einem ernsthaft technisch umgesetzten Gegenentwurf zum Mainstream.

3. Kerntechnische Mechanismen

Das gesamte Design wird durch drei harte Randbedingungen bestimmt: Es muss in 8 GB VRAM passen, darf nicht quantisiert werden, darf nicht vergessen und muss alle Daten lesen können. Keine Quantisierung ist eine eiserne Regel – das Training benötigt Gradienten, und Gradienten plus Optimizer-Status sind etwa dreimal so groß wie das Volumen der Gewichte, daher müssen die Gewichte auf der Festplatte gespeichert sein, und auf der Grafikkarte verweilt nur der aktuelle Working Set. Dass alles gelesen werden kann, bedingt Byte-Level-Eingaben – kein Vokabular bedeutet kein Problem der Art „bei seltenen Daten das Vokabular erweitern und Embeddings neu trainieren zu müssen“.

Die Architektur ist dreischichtig: 2 dichte Prefix-Blöcke plus 1 rekurrenter Block, wobei dieser rekurrente Block maximal 24-mal auf denselben Zeichenbatch angewendet wird. Die Tiefe ist ein PonderNet-artiges adaptives Halting: Ein Halting-Head gibt jedem Zeichen in jeder Zeile eine Bewertung und beurteilt, ob eine weitere berechnete Zeile das Ergebnis ändern würde – einfache Zeichen stoppen nach 1 Zeile, schwierige Zeichen rechnen automatisch weiter. Dadurch wird „Rechenleistung folgt der Schwierigkeit“ von einem Schlagwort zu einer zeichenweisen Ausführungsstrategie.

Das Routing ist eine Variante des Mixture-of-Experts-Ansatzes: Bei 26 Block-Anwendungen wählt jede Anwendung unabhängig ihre eigenen Top-8-Experten; dasselbe Zeichen kann in unterschiedlichen Tiefen denselben Experten wiederholt wählen. Die Experten haben keine manuell annotierten Themen; das Soft-Top-k-Routing verteilt spontan unterschiedliche Fähigkeiten auf verschiedene Experten. Dies wird von Wachstums- und Pruning-Mechanismen begleitet – wenn die Kapazität nicht ausreicht, entsteht neue Kapazität; Experten, die lange nicht genutzt wurden, werden geprunt. Der Autor ergänzte dies auf Hacker News mit einer sehr anschaulichen Erklärung: Das sei sehr „organisch“, zusätzlich zur traditionellen Backpropagation gebe es im Hintergrund eine Ebene der natürlichen Auslese, wobei jeder neue Experte 16 „Eltern“ habe.

Als Positionskodierung wurde Rotary gewählt, und zwar ohne lernbare Parameter – dies dient direkt dem kontinuierlichen Lernen: Das Kontextfenster muss nicht neu initialisiert werden, sondern kann durch fortgesetztes Training erweitert werden. Für ein Modell, das immer neue Daten liest, ist dies ein Muss und keine Optimierung: Sobald das Fenster durch Learned Position Embeddings fixiert ist, bedeutet eine Fenstervergrößerung, dass das Modell die Hälfte seines Koordinatensystems vergisst und von vorne anfangen muss. Die Lese-Schreib-Symmetrie ist ein weiteres Designmerkmal, das man sich merken sollte: Lesen und Schreiben nutzen denselben Forward-Pass, aber Schreiben verbraucht mehr Tiefe als Lesen, durchschnittlich ca. 9,9 Zeilen pro Zeichen beim Schreiben gegenüber ca. 8,0 Zeilen beim Lesen – die Generierung eines Zeichens erfordert wiederholtes Abwägen, während das Verstehen eines Zeichens in einem Schritt geschieht; diese Asymmetrie entspricht genau der menschlichen Erfahrung. Der Working Set wird alle 64 Zeichen neu ausgewählt; Greedy-Decoding ist vollständig deterministisch, zwei Durchläufe ergeben denselben Satz. In einer Zeit, in der alle über Zufälligkeit sprechen, ist ein kleines Modell, das bereit ist, „Reproduzierbarkeit“ in seine Designziele aufzunehmen, ein erfrischender Ansatz.

4. Zahlen und Grenzen

Laut README-Aufzeichnung: Das Modell hat 318,1 Mio. Zeichen gelesen und 169 Experten hervorgebracht; der Held-out-Loss über alle acht Fächer beträgt 0,8336 ± 0,0331 nats/char, was 1,2026 bits/byte entspricht. Die Unterschiede zwischen den Fächern sind groß: Chess 0,796, Stories 0,919, Arithmetic 0,948, Code 1,066, Reasoning 1,145, Chat 1,199, Chat_Hermes 1,699, Wikipedia 1,847 – strukturierte, regelbasierte Daten sind leicht zu verarbeiten, offener Text ist schwer; diese Reihenfolge stimmt mit der Intuition überein. Insbesondere die beiden Chat-Kategorien unterscheiden sich um fast 0,5, was zeigt, dass „Plaudern wie ein Mensch“ gerade für dieses kleine Modell das teuerste Fach ist, während Regeln billig sind.

Die Messung selbst ist verrauscht: Die Experten-Planung (Scheduling) auf CUDA ist nicht-deterministisch, zwei Durchläufe mit derselben Konfiguration weichen um ca. 0,014 voneinander ab; der Autor empfiehlt, 0,03 als Schwellenwert für „echte Unterschiede“ zu betrachten. Diese Ehrlichkeit, Fehlerbalken in das README zu schreiben, verdient ausdrücklich Lob.

Data Scaling ist die Tabelle im Projekt mit dem meisten Forschungscharakter: Der Loss sinkt mit der Datenmenge nach einem Potenzgesetz, Exponent -0,239, Güte der Anpassung R²=0,96 – was zwischen Kaplans 0,095 und Chinchillas 0,28 liegt. Die Kontrollgruppe verdeutlicht die Effizienz noch besser: MambaByte-353M mit ähnlicher Parametergrößenordnung und ähnlichen FLOPs muss 94-mal mehr Daten lesen, um ein vergleichbares Niveau zu erreichen; Transformer-320M sogar 251-mal mehr. Der Autor extrapoliert daraus: Um auf 1,00 BPB zu sinken, werden ca. 0,75B Zeichen und 6 Tage benötigt; um auf 0,80 BPB zu sinken, ca. 1,92B Zeichen und 24 Tage – beides liegt innerhalb eines einzelnen Durchlaufs durch das 7,87B-Zeichen-Korpus. Der Zeitmaßstab von Tagen bis Wochen stammt von einer Laptop-Grafikkarte.

Aber die Grenzen müssen klar ausgesprochen werden: „Kontinuierlich lernen können“ ist nicht gleichbedeutend mit „Generalisieren können“. Auf Hacker News fragte ein Skeptiker direkt: Kann diese Architektur generalisieren oder verlässt sie sich hauptsächlich auf Memorierung? Wurden grundlegende Aufgaben wie Addition ausprobiert? Die Antwort des Autors war unmissverständlich. Das Modell ist zu klein und unzureichend trainiert, es wird keine Generalisierung behauptet, bis das gesamte Korpus gelesen wurde und Benchmarks durchgeführt werden. 1,2 bits/byte ist noch weit von produktiver Nutzbarkeit entfernt. Diese Extrapolationstabelle ist eine Erweiterung der Experimente des Autors, kein Versprechen.

5. Wie man es ausführt und wer es nutzen kann

Die Einstiegshürde ist niedriger als gedacht, aber es gibt eine harte Voraussetzung: Eine CUDA-Grafikkarte mit mindestens 8 GB VRAM. Die Referenzmaschine ist eine RTX 3070 Laptop – also eine Gaming-Laptop-Grafikkarte, keine Laborausrüstung. Als Software wird nur Python 3.10 oder höher benötigt, der Code steht unter der MIT-Lizenz, und man kann direkt nach dem Klonen trainieren. Keine Cluster, keine Warteschlangen, keine Kontingente und keine Cloud-Rechnungen – wie weit trainiert wird und wie viel Strom verbraucht wird, geschieht komplett vor den eigenen Augen.

Drei Arten von Leuten können sofort loslegen: Forschungsstudenten im Bereich des kontinuierlichen Lernens – dies ist eine Referenzimplementierung, die man ausführen und modifizieren kann und deren Mechanismen völlig offenliegen, was viel günstiger ist als eine Paper-Reproduktion von Grund auf; Ingenieure, die Mixture-of-Experts-Routing und adaptive Berechnungstiefe erforschen wollen – die Kombination aus 26 Anwendungen, Top-8-Routing und PonderNet-Halting ist in diesem Code entkoppelt und lesbar; man ändert eine Stelle und sieht das Ergebnis an dieser Stelle; sowie Hardware-Enthusiasten, die einfach beweisen wollen, „was man mit 8 GB VRAM eigentlich trainieren kann“ – nebenbei können sie beobachten, wie 169 Experten von selbst aus den Daten herauswachsen.

Zwei Arten von Leuten sollten noch warten: Diejenigen, die fertige Gewichte für Evaluierungen haben wollen – die Gewichte sind noch nicht veröffentlicht, man muss warten, bis das erste Korpus vollständig gelesen ist, was voraussichtlich einige Wochen dauert; und diejenigen, die ein Out-of-the-Box-Produkterlebnis erwarten – dies ist Forschungscode, kein Service, keine Benutzeroberfläche, keine API, alles beginnt in der Kommandozeile.

6. Werturteil und für wen es geeignet ist

Betrachtet man den Wert als Forschungsbeispiel und den Produktivitätswert getrennt, wird das Profil dieses Projekts klar.

Wert als Forschungsbeispiel: Hoch. Es ist ein vollständiges Ingenieursbeispiel, das „kontinuierliches Lernen ohne katastrophales Vergessen“ vom Paper-Konzept in 8 GB Consumer-VRAM komprimiert, Festplatten-Gewichte plus Working-Set-Paging, Rotary-Kodierung ohne Lernparameter, Wachstum und Pruning – jedes Design dient direkt dem einen Ziel „ohne Unterbrechung zu lernen“, und alles ist Open Source, vollständig lesbar. Die Tabelle, deren Scaling-Exponent zwischen Kaplan und Chinchilla liegt, ist selbst zitierfähige Primärdaten. Alle, die an kontinuierlichem Lernen oder effizienten Architekturen forschen, sollten seinen README einmal gelesen haben.

Produktivitätswert: Derzeit null, auch nach eigener Aussage des Autors. Gewichte nicht veröffentlicht, Selbsteinschätzung der Fähigkeiten auf Toy-Level, 1,2 Bits/Byte Verlustniveau, Generalisierungsfähigkeit nicht deklariert – heute damit irgendetwas zu machen, ist weder zuverlässig noch ratsam. Jede Behauptung, die es als „AGI-Implementierung“ hochspielt, ist ein Missverständnis des Projekts selbst; der Name des Projekts ist nur ein Name, der Autor beweist, dass „kontinuierliches Lernen ohne Vergessen möglich ist“, nicht dass „Intelligenz bereits angekommen ist“.

Für wen es geeignet ist: Forscher in den Bereichen kontinuierliches Lernen und effiziente Architekturen, Entwickler, die die gesamte technische Implementierung des Online-Lernens verstehen möchten, sowie Beobachter, die der Frage „was mit wenig VRAM möglich ist“ nachgehen.

Für wen es nicht geeignet ist: Teams, die nach produktiven Fertigmodellen suchen; Personen, die erwarten, dass nach Abschluss des Trainings sofort ein Generalisierungsdurchbruch eintritt – der Autor sagt ausdrücklich, dass die Generalisierung erst getestet werden kann, wenn das gesamte Korpus gelesen wurde, und dass bis dahin alle Antworten auf die Frage „was ist möglich“ unvollständig sind.

Referenzen

  • GitHub-Repository: volotat/mini-AGI (README, LICENSE), Stand 2026-09-22
  • Hacker News: Show HN „Mini-AGI – Dynamic continual learning model trained on 8GB VRAM“, Story 49783133, 255▲ / 56💬, 2026-09-21
  • README-Benchmark und Scaling-Tabelle (318,1M Zeichen / 169 Experten, held-out 1,2026 BPB, nach Fachgebieten Bits/Byte, Potenzgesetz -0,239, Extrapolationstabelle); Antwort des Autors auf Generalisierungszweifel in der HN-Diskussion
广告 · Advertisement

Häufige Fragen

Was ist der grundlegende Unterschied zwischen mini-AGI und gewöhnlichen großen Sprachmodellen?

Gewöhnliche Modelle werden nach dem Training eingefroren, neues Wissen kann nur durch Fine-Tuning-Patches hinzugefügt werden, und zu viele Patches führen zu katastrophalem Vergessen. mini-AGI hebt die Grenze zwischen „Training" und „Verwendung" auf: Das Modell liest blockweise aus dem Zeichenstrom, führt für jeden gelesenen Block einen Gradientenschritt aus, und Lesen, Inferenz und Lernen laufen über denselben Codepfad – es wird niemals eingefroren und macht nie seinen Abschluss. Der Preis ist, dass durchgehend Optimierungszustände für Online-Updates mitgeführt werden müssen, was die technische Schwierigkeit erhöht; daher ist die Tatsache, dass der Autor es auf eine einzige 8-GB-Grafikkarte gequetscht hat, die eigentliche Hauptattraktion.

Was ist besonders an seiner Architektur?

Drei Designs dienen direkt dem kontinuierlichen Lernen: Erstens die PonderNet-artige adaptive Tiefe, bei der 2 dichte Vorspannblöcke plus 1 rekursiver Block bis zu 24 Mal angewendet werden – einfache Zeichen stoppen nach 1 Durchlauf, schwierige Zeichen rechnen automatisch mehr; zweitens wählen die 26 Blockanwendungen jeweils unabhängig ihre Top-8-Experten, die Experten haben keine manuell annotierten Themen und arbeiten mit Wachstum und Pruning zusammen – wenn die Kapazität nicht ausreicht, wachsen neue Experten, ungenutzte werden abgeschnitten; drittens hat die Rotary-Positionskodierung keine lernbaren Parameter, das Kontextfenster kann allein durch weiteres Training erweitert werden, ohne Neuinitialisierung.

Was zeigen die aktuellen Zahlen über seinen Entwicklungsstand?

Laut README-Aufzeichnung: bisher 318,1 M Zeichen gelesen, 169 Experten, Held-out-Durchschnitt über acht Fächer 1,2026 Bits/Byte, Chess am besten (0,796), Wikipedia am schlechtesten (1,847). Der Verlust sinkt mit der Datenmenge nach einem Potenzgesetz, Exponent -0,239, was zwischen Kaplans 0,095 und Chinchillas 0,28 liegt; das Vergleichsmodell ähnlicher Größenordnung MambaByte-353M hat 94-mal mehr Daten gelesen. Aber „kontinuierlich lernen können" ist nicht gleichbedeutend mit „generalisieren können": Der Autor stellt klar, dass das Modell zu klein ist, gibt keine Generalisierungserklärung ab, und dass es sich um ein Toy-Level-Experiment handelt, dessen Gewichte noch nicht veröffentlicht sind.