BLOG
mini-AGI:8GBのグラフィックカード1枚でゼロから訓練する継続学習バイトレベル言語モデル
技術分解:AI技術フレームワークの解析——説明、分析、技術評価、価値判断、実地適用。著者:永亮
今日の主流な言語モデルにおいて、訓練は一発勝負である。一気に大量のコーパスを読み切り、ベースモデルとして固定化し、その後の新知識は何度もファインチューニングというパッチを上乗せするしかなく、乗せすぎると忘却し、本当に学習を続けたければ再訓練しなければならない。2026年9月21日、GitHubユーザーのAlexey Borskyが、この順序を完全に逆転させたプロジェクトmini-AGIをShow HNに投稿し、255のアップボート、56のコメントを獲得した。その主張は非常に率直である。読書と訓練は同じことである——モデルは文字ストリームからブロックごとに読み込み、1ブロック読むごとに1ステップの勾配を進め、決して凍結せず、決して卒業しない。本稿では6つの事項に分解して解説する。何であるか、なぜ見る価値があるか、仕組みの構築方法、数字と境界、誰が実行できるか、誰に適しているか。
一、何であるか
mini-AGIはバイトレベルの言語モデルである。アルファベットは256個のバイト値であり、トークナイザはなく、いかなるデータタイプ——テキスト、コード、棋譜、対話——が入力されても新しい語彙表は不要である。その核心的なアイデンティティは「継続学習モデル」である。文字ストリームから連続的に読み込み、1ブロックのデータを処理するごとに重みを更新し、読み込み、推論、学習は同じコードパスを通る。READMEにある位置づけの一文は、そのまま記憶に値する。「単独のファインチューニング段階はなく、凍結されたベースモデルもなく、読書と訓練は同じことである」。
最も直感に反するのはパラメータ数の格納方式である。重みはGPU上ではなくディスクに常駐し、必要に応じてVRAMにページインされる——したがって、モデルのパラメータ数の上限はディスク容量で決まり、VRAMでは決まらない。これはオペレーティングシステムの仮想メモリのようなものである。プログラムが見るアドレス空間は物理メモリよりはるかに大きく、これを当てはめると、モデルが見るパラメータ空間はVRAMよりはるかに大きく、使われない重みはディスク上に眠り、仕事の順番が来たものがGPUに乗る。この視点の転換が、本プロジェクトのあらゆる設計の出発点である——GPUはもはやモデルがどれだけ大きくなれるかを決定せず、それがどれだけ速く実行できるかのみを決定する。プロジェクト全体で42ファイル、30のPythonファイル、17MBのサイズで、MITライセンスである。
しかし、おさえるべき点を先にはっきりさせておかなければならない。作者自身がREADMEで次のように断っている。「as of now this is a small toy-level model. Do not expect a frontier level capabilities.」これは「継続学習は破滅的忘却を起こさずに行える」ことを証明する小さな実験であり、能力のブレイクスルーではない。重みもまだ公開されていない——最初のラウンドのコーパスを読み終えておらず、あと数週間かかると見込まれている。作者の意図は、このラウンドを読み終え、数字が固まってから公開するということである。この2つの文を念頭に置いて読み進めるのが正しい読み方である。未完成の製品としてではなく、真面目にやり遂げた対照実験として扱うこと。
二、なぜ今見る価値があるか
見る価値がある理由は、モデルがどれほど強力かということではなく、それが現在のパラダイムの対極に立っていることにある。
今日、モデルを手に入れる際の標準的なアプローチは次の通りである。ベースモデルを凍結し、その上に薄いファインチューニングの層を重ねる——LoRA、アダプタ、領域別の継続事前学習は、すべてこの考え方の変種である。ベースモデルは神聖不可侵犯の資産であり、新知識は外付けの荷物である。この路線はエンジニアリング的に成熟しているが、構造的な代償がある。モデルは決して真に「成長」せず、ただ荷物が掛け増されていき、ある時点で互いに衝突し始める——破滅的忘却である。
mini-AGIの回答は、「訓練」と「使用」の境界を取り除くことである。モデルが生きている毎秒、学習している。Wikipediaを読むのは学習であり、棋譜を読むのは学習であり、あなたと対話するのも学習である。これは概念上、人間に近い。20年間の読書をある「事前学習段階」に圧縮して、その後封印する人間はいない。これを実現する代償は、オプティマイザの状態を常に背負いながらオンライン勾配更新を行うことであり、そのエンジニアリング難度は訓練後に凍結するよりもはるかに高いため、長らく論文上の概念にとどまっていた——誰かがそれを8GBのコンシューマー向けGPUに押し込むまでは。この圧縮スキーム自体が、本稿の主な見どころである。
Hacker Newsでの反応も、このプロジェクトの気質を示している。支持者の中には、「Mini-AGI」と「8GB VRAM」が同じ文に登場するのを見て希望が湧いたと言う人もおり——ローカルで継続学習モデルを動かすことは、それほど手の届かない存在ではないようだ。また、継続学習の研究をしている開発者は、手元の手法がすべて事後補修型であることに頭を悩ませていたところ、最初から破滅的忘却を防ぐために構築されたシステムを見て喜び、クローンして行ごとに読む価値があると述べている。さらに、話題を歴史的な次元に引き戻す人もいた。パソコンが登場する前、昔の専門家たちはメインフレームが先に人工知能を征服すると思っていたが、結果的に主流の路線は袋小路となった——計算能力の民主化の後、周縁での探索が逆に新しいものを生み出したのである。255票が与えた評価は、一つの製品に対するものではなく、真面目にエンジニアリングされた反主流のサンプルに対するものである。
三、コア技術メカニズム
設計全体は3つのハード制約によって決定された:8GBのVRAMに収めなければならない、量子化不可、忘却不可、あらゆるデータを読取可能とすること。量子化しないことは絶対的な規定である——学習には勾配が必要であり、勾配とオプティマイザの状態を合わせると重みの体積の約3倍になるため、重みはディスクに置かなければならず、GPU上には現在のワーキングセットのみを常駐させる。あらゆるデータを読めるということは、バイトレベルの入力を決定する——語彙表がなければ、「未知のデータに遭遇して語彙表を拡張し埋め込みを再学習する」といった問題は存在しない。
アーキテクチャは3層構造である:2つのDense前奏ブロックに、1つの循環ブロックを加え、この循環ブロックは同じバッチの文字に対して最大24回適用される。深さはPonderNet式の適応的ハルティングである:halting headが各文字の各行に対してスコアを付与し、もう1行計算しても答えが変わるかどうかを判断する——単純な文字は1行で停止し、難しい文字は自動的に計算量を増やす。これにより、「計算力は難易度に追従する」というスローガンが、文字ごとの実行戦略へと変貌する。
ルーティングはMixture of Expertsアプローチの変種である:26回のブロック適用において、毎回独自にtop-8の専門家を選択する。同じ文字が異なる深さで同じ専門家を繰り返し選択することも可能である。専門家には人手でアノテーションされたテーマはなく、soft top-kルーティングが自発的に異なる能力を異なる専門家に割り当てる。これに成長と枝刈りのメカニズムを組み合わせる——容量が不足すれば新しい容量が成長し、長期間使用されない専門家は枝刈りされる。著者はHacker News上で非常に視覚的な説明を補足した:これは非常に「有機的」であり、伝統的な誤差逆伝播の他に、背景に自然淘汰の層があり、各新専門家には16の「親」が存在する。
位置エンコーディングはRotaryが選択され、学習パラメータを持たない——これは継続学習に直接寄与する:コンテキストウィンドウを再初期化する必要がなく、学習を継続するだけで拡張できる。常に新しいデータを読み込んでいるモデルにとって、これは最適化ではなく必須要件である:一度learned position embeddingでウィンドウが固定されると、ウィンドウの拡張はモデルに座標系の半分を忘れさせ、最初からやり直すことに等しい。読み書きの対称性も記憶に値するもう一つの設計である:読み取りと書き込みは同じ順伝播を共有するが、書き込みは読み取りよりも深さを消費し、平均して文字あたり約9.9行であるのに対し、読み取りは約8.0行である——1つの文字を生成するには繰り返し熟考が必要だが、理解するには一足飛びで済み、この非対称性は人間の経験と見事に一致する。ワーキングセットは64文字ごとに再選択される。貪欲デコーディングは完全に決定論的であり、2回実行すれば同じ文が得られる。誰もがランダム性を語る時代において、「再現可能」を設計目標に書き込む意志を持つ小規模モデルは、清流と言える。
四、数字と境界
READMEの記録によると:モデルはすでに318.1M文字を読み、169の専門家が成長している。held-outの全8科目の損失は0.8336 ± 0.0331 nats/charであり、1.2026 bits/byteに相当する。科目別に見ると差が大きい:chess 0.796、stories 0.919、arithmetic 0.948、code 1.066、reasoning 1.145、chat 1.199、chat_hermes 1.699、wikipedia 1.847——構造化されルールが明確なデータは咀嚼しやすく、オープンなテキストは咀嚼しにくい。この順序は直感と一致する。特にchatの2つの段階では差が0.5近くあり、「人間のように雑談する」ことがこの小規模モデルにとって最もコストの高い科目であり、ルールは逆に安価であることを示している。
測定自体にノイズがある:CUDA上での専門家のスケジューリングは非決定的であり、同じ構成で2回実行すると約0.014の差が生じる。著者は0.03を「真の差異」の閾値とすることを推奨している。=このように誤差範囲をREADMEに記載する誠実さは、名指しで称賛に値する。
データスケーリングは、プロジェクトで最も研究的な香りがする表である:損失はデータ量(量)に伴いべき乗則で低下し、指数は-0.239、適合度はR²=0.96である——Kaplanの0.095とChinchillaの0.28の間に収まっている。対照群は効率をよりよく説明している:同じパラメータ規模でFLOPsが近いMambaByte-353Mは、同等のレベルに達するために94倍のデータを読み込む必要があり、Transformer-320Mでは251倍である。著者はこれに基づいて外挿している:1.00 BPBまで下げるには2約0.75B文字、6日が必要であり、0.80 BPBまで下げるには約1.92B文字、24日が必要である——いずれも7.87B文字コーパスの1パスの範囲内である。日から週単位の時間スケールは、1台のノートPCのGPUによるものである。
しかし、境界については語り尽くさなければならない:「継続的に学習できる」ことは「汎化できる」ことと同義ではない。Hacker Newsでは、疑問を呈する者が直接こう尋ねた:このアーキテクチャは汎化できるのか、それとも主に記憶に頼っているのか?加算のような基礎的なタスクで試したか?著者の回答は曖昧さがない。モデルが小さすぎ、学習が不足しているため、汎化についての宣言は行わず、コーパス全体を読み終えてからベンチマークに挑む。1.2 bits/byteは、実用化可能なレベルからもまだ遠い。この外挿表は著者による自身の実験の延長であり、約束ではない。
五、どう実行するか、誰が遊べるか
ハードルは想像より低いが、1つの厳しい前提がある:CUDA GPU、VRAM 8GB以上。基準機はRTX 3070 Laptop——つまりゲーミングノートPCのGPUであり、何かの実験室の設備ではない。ソフトウェアはPython 3.10以上のみ、コードはMITライセンスであり、クローンすればすぐに学習を開始できる。クラスタもなく、待ち行列もなく、クォータもなく、クラウドの請求書もない——どこまで学習させるか、どれだけ電力を消費するか、すべて自分の目の届くところにある。
3種類の人々が今すぐ遊べる:継続学習方向の大学院生にとって、Fこれは実行および変更可能でメカニズムがすべて明らかになっているリファレンス実装であり、論文をゼロから再現するよりもはるかにコストが低い。混合専門家ルーティングと適応的計算深度を研究したいエンジニアにとって、26回の適用、top-8ルーティング、PonderNet haltingの組み合わせはこのコード群においてデカップリングされて読みやすく、1箇所変更すればその効果を確認できる。そして、「8GBで一体何を学習できるのか」を単純に検証したいハードウェア愛好家——ついでに169の専門家がデータからどのように自ら成長するかも観察できる。
2種類の人々は少し待つ必要がある:既製の重みを使って評価を行いたい人——重みは未公開であり、最初のラウンドのコーパスを読み終えるのを待つ必要があり、数週間かかると予想される。すぐに使える製品体験を期待する人——これは研究用コードであり、サービスではない。インターフェースもAPIもなく、すべてはコマンドラインから始まる。
六、価値判断と誰に向いているか
研究サンプルとしての価値と生産性としての価値を分けて語ると、このプロジェクトの輪郭が明確になる。
研究サンプルとしての価値:高い。それは「持続的学習、破滅的忘却なし」という論文上の概念を8GBのコンシューマー級VRAMに詰め込んだ完全なエンジニアリングサンプルである。ディスク重みとワーキングセットのページング、学習パラメータなしのrotaryエンコーディング、成長と枝刈り、これらの各設計は「停止せずに学習し続ける」という一つの目標に直接貢献しており、かつすべてがオープンソースであり、すべてが読解可能である。scaling指数がKaplanとChinchillaの間に収まっているあの表は、それ自体が引用に値する一次データである。持続的学習や高効率アーキテクチャに取り組む人は、全員そのREADMEを一読すべきである。
生産性としての価値:現状ではゼロ。作者自身も同じ見解である。重みは未公開、能力はtoy-levelと自己評価しており、1.2 bits/byteの損失水準、汎化能力は未言及である——現時点でこれを使って何かをすることは、信頼性がなく、かつすべきではない。これを「AGIの実現」と喧伝するいかなる説も、プロジェクト自体の誤読である。プロジェクトの名前はただの名前であり、作者が証明したのは「持続的学習は忘却なしで可能である」ことであり、「知能はすでに到来している」ことではない。
誰に向いているか:持続的学習と高効率アーキテクチャの方向性の研究者、オンライン学習のエンジニアリング実装全体を読み解きたい開発者、そして「小さなVRAMで何ができるか」という観点に注目している観察者。
誰に向いていないか:既成モデルの生産性を求めるチーム。訓練完了と同時に汎化のブレイクスルーを期待する人——作者は汎化はコーパス全体を読み終えてから測る必要があると明言しており、それまでは「何ができるか」の答えはすべて未完成である。
参照元
- GitHubリポジトリ:volotat/mini-AGI(README、LICENSE)、2026-09-22時点
- Hacker News:Show HN「Mini-AGI – Dynamic continual learning model trained on 8GB VRAM」、story 49783133、255▲ / 56💬、2026-09-21
- READMEのbenchmarkおよびscaling表(318.1M文字 / 169エキスパート、held-out 1.2026 BPB、分野別bits/byte、べき法則 -0.239、外挿表)、HN議論における汎化への懐疑に対する作者の返答