BLOG
AI hat jedes CAPTCHA geknackt: Wie beweist man noch Menschlichkeit?
Einstieg: Eine KI hat gerade im Web bewiesen, dass sie „kein Roboter” ist
Am 7. September hat Sharif Shameem vom OpenAI Labs öffentlich vorgeführt: GPT-6 Astra schafft am Stück alle 48 Level der Mensch-Maschine-Verifizierung in ‚I’m Not a Robot’.
Die ersten Level waren noch das vertraute Bilder-Erkennen und Texte-Bewerten; danach stieg der Schwierigkeitsgrad steil an – Drag & Drop, Einparken, visuelle Suche, Rhythmussteuerung, kleine Logikspiele. Astra sah dabei den ganzen Weg über auf den Bildschirm, bediente Maus und Tastatur, passte seine Aktionen an die Veränderungen auf der Seite an – und erhielt am Ende das vom Spiel verliehene „Zertifikat als Mensch”.
Das Lächerliche und das Beunruhigende an der Sache liegen am selben Punkt: Captchas wurden ursprünglich genau zu dem Zweck entworfen, Maschinen vor der Tür „Interface bedienen wie ein Mensch” aufzuhalten. Jetzt ist die Maschine hinter dieser Tür herausgekommen – und hat die Tür abmontiert.
Interessant ist: Der KI-Tech-Kommentar, der darüber berichtete, trägt im Titel bereits einen Abschied – „Auf Wiedersehen, reCAPTCHA”. Aber ist die Verteidigungslinie damit wirklich gefallen? Ich habe die technischen Fakten hinter diesen 48 Leveln und das tatsächliche Anti-Bot-System moderner Websites einmal durchgearbeitet und die Fragen dann an Yongliang weitergegeben – 17 Jahre in der Softwarebranche, aktuell AI Technology Director. Die Enterprise-Systeme, die er baut, haben Tag für Tag mit der Frage „Mensch oder Maschine” zu tun.
Shiwen: Die KI hat alle Captchas geschafft – war dein erster Impuls „Jetzt ist alles vorbei” oder „Ich hab’s geahnt”? Yongliang: Beides nicht. Meine Reaktion war: „Was kommen musste, ist endlich da.” Captchas halten nie „Schlaumeier” ab, sondern „unbeholfene Hände” – und jetzt, da die KI nicht mehr unbeholfen ist, ist diese Frage natürlich gegenstandslos. Aber gegenstandslos ist die Frage, nicht die Prüfung. Shiwen: Dann reden wir eben alles gründlich durch: Was genau hat sie da überwunden, worauf setzen moderne Websites zur Abwehr weiterhin – und wie geht es mit dem „Beweis, dass du ein Mensch bist” künftig weiter?
Q1: 48 Level gemeistert – was bedeutet das technisch eigentlich?
永亮: Es bedeutet, dass KI zum ersten Mal „Oberflächen verstehen“ und „kontinuierliches Bedienen“ zu einem stabilen Arbeitsablauf verschweißt hat.
Viele halten das Bestehen von Captchas für nichts anderes als „verbesserte Bilderkennung“ – das ist das größte Missverständnis. Die Erkennung ist nur das Eintrittsticket; die eigentliche Schwierigkeit kommt erst danach.
Betrachtet man das Ganze aus der Perspektive eines Kontrollsystems: Eine Webseite hat einen internen Zustand, und der Screenshot, den die KI sieht, ist nur ein davon sichtbar gewordener Ausschnitt. Bei jedem Klick und jedem Ziehen von Astra verändert sich die Seite – die KI muss aus einem einzelnen Frame, den bisherigen Frames und ihren eigenen bereits ausgeführten Aktionen ableiten, „an welchem Punkt der Aufgabe ich mich gerade befinde“. Das Park-Level veranschaulicht das Problem am deutlichsten: Im Bild ist ein Auto zu sehen, aber das Bild verrät nichts darüber, „warum das Auto genau hier steht“; das Rhythmus-Level ist noch gnadenloser – die Umgebung verändert sich weiter, während es denkt.
Getragen wird dieser Arbeitsablauf von drei verifizierten Fähigkeitsebenen. Öffentliche Daten: Astra erreichte bei ScreenSpot-Pro (misst die Fähigkeit der Oberflächen-Lokalisierung von „Semantik zu Koordinaten“) 92,7 %; bei OSWorld 2.0 (misst langanhaltende echte Computerbedienung) 72,6 % – die Dauer der simulierten Aufgaben ließ sich dabei von rund 75 auf rund 40 Minuten drücken.
Eine entscheidende Erkenntnis dabei: Präzision im Einzelschritt ≠ Stabilität in der Abfolge. Klickt man einen Button falsch an, gerät die Seite im nächsten Frame in einen anderen Zweig, und alle weiteren Schlussfolgerungen bauen auf einer falschen Prämisse auf. Langanhaltende Bedienung braucht deshalb ein verborgenes Modul – die „Zustandsprüfung nach der Aktion“: Ich habe geklickt, um das Pop-up zu schließen – ist das Pop-up im neuen Screenshot immer noch da? Dann gilt dieser Schritt als fehlgeschlagen: wiederholen oder einen anderen Weg einschlagen. Dass alle 48 Level geschafft wurden, zeigt, dass dieser Prüfmechanismus wirklich funktioniert.
Eine ehrliche Anmerkung: Der Präsentator selbst hat keine vollständigen Details zur Laufzeitumgebung veröffentlicht; die 48/48 sollte man nicht als strenges rein visuelles Benchmark-Ergebnis werten. Aber die Richtung, die es aufzeigt, ist real – die Annahme, auf der Captchas beruhen – „Maschinen sind nicht zu kontinuierlicher GUI-Bedienung fähig“ –, ist bereits zusammengebrochen.
Q2: Laufen Websites heute also immer noch „nackt“ herum? Was genau ist das moderne Anti-Bot-System eigentlich?
永亮: Es läuft niemand mehr nackt herum. Die eigentliche Verteidigungslinie ist schon vor zehn Jahren umgezogen – von den „Prüfungsaufgaben“ hinein in den Browser und auf den Server.
Du glaubst, du löst gerade ein Bilderrätsel mit neun Feldern, doch die Bildaufgabe ist längst nur noch die letzte Staffage. Die eigentliche Bewertung findet in zwei Ebenen statt, die du nicht siehst.
Erste Ebene: die Signale der Browser-Umgebung. Der Mechanismus von reCAPTCHA v3: Noch bevor du irgend etwas anklickst, vergibt der Browser im Hintergrund einen Risikoscore für dein Verhalten – Mausbewegungen, Verweildauer auf der Seite, Interaktionskontext, alles fließt in die Berechnung ein. Am Ende bekommt der Server einen Score und entscheidet, ob du durchgelassen wirst. Cloudflares Turnstile geht noch weiter: Eine Reihe leichtgewichtiger Challenges läuft im Browser (Rechen-Challenges, Web-API-Probing, Umgebungsmerkmale); nach dem Bestehen wird ein Einmal-Token ausgestellt – 300 Sekunden gültig und nur einmal einlösbar.
Zweite Ebene: Netzwerk- und Anfragemerkmale. TLS-Handshake-Fingerabdrücke (JA3/JA4) verraten, ob du ein echter Browser bist; zeitliche Abfolge, Frequenz und Kontextanomalien der Anfragen – der Server sieht das alles.
Diese beiden Ebenen zusammen erklären eine Sache: Astra besteht die „kognitiven Prüfungsaufgaben”, aber der Server sieht noch Dinge, die Astra nicht sehen kann – in welchem Client es läuft, ob die Anfrage-Sequenz normal verläuft, ob das Token gültig ist. Wie ein Prüfling, der alle Fragen richtig beantwortet – nur merkt der Aufsichtslehrer, dass sein Stift gar nicht ihm gehört.
Aber auch diese Verteidigungslinie hat ein Verfallsdatum. KI läuft heutzutage oft direkt in echten Chrome-Browsern und erbt damit von Natur aus sämtliche Protokollmerkmale eines echten Browsers – etwas völlig anderes als die Selenium-Skripte von früher, die man auf den ersten Blick als Fake durchschauen konnte. Die Cloudflare-Dokumentation unterstützt Automatisierungs-Frameworks bis heute ausdrücklich nicht, aber das Zeitfenster, in dem sich „Mensch und Maschine anhand des Browser-Fingerabdrucks unterscheiden“ lassen, wird immer enger.
Q3: Wird „Beweise, dass du ein Mensch bist” künftig überhaupt noch gelten?
Yongliang: Diese Frage selbst muss neu geschrieben werden – denn künftig ist die Hälfte aller „Maschinen-Zugriffe” legitim.
Denk dir ein Szenario, das schon bald alltäglich sein wird: Du schickst deinen KI-Assistenten los, um Flüge zu prüfen, Bestellungen zu ändern oder Spesenabrechnungen einzureichen. Der Server hat tatsächlich eine Maschine vor sich – blockt man sie aber ab, blockt man deine eigenen berechtigten Anliegen ab. Die binäre „Mensch/Maschine”-Klassifizierung herkömmlicher CAPTCHAs liefert schlicht nicht mehr genug Information.
Die Antwort der Branche: die Frage austauschen. Statt „Bist du eine Maschine?” fragt man künftig „Welche Maschine bist du, wer hat dich autorisiert zu kommen und was ist dir erlaubt?”
Web Bot Auth, das Cloudflare in diesem Jahr eingeführt hat, ist die konkrete Umsetzung genau dieses Gedankens: Der KI-Assistent erzeugt sein eigenes Ed25519-Schlüsselpaar, signiert mit dem privaten Schlüssel jede HTTP-Anfrage und veröffentlicht den öffentlichen Schlüssel in einem öffentlichen Verzeichnis. Der Server prüft die Signatur – das folgt einer völlig anderen Logik als das CAPTCHA: CAPTCHAs erraten anhand von Verhaltensmerkmalen, wer du bist; Signaturen beweisen kryptografisch, wer du bist. Und selbst wenn die visuellen Fähigkeiten der KI zehnmal so stark wären, könnte sie trotzdem keine gültige Signatur mit dem privaten Schlüssel eines anderen berechnen.
Aber Authentifizierung ist nur die erste Hälfte, Autorisierung die zweite: Sobald die Identität der KI bestätigt ist, muss noch festgelegt werden, was sie tun darf – Bestellungen abfragen erlaubt, Bestellungen stornieren nicht erlaubt; und wenn ein Hauptassistent einen Unterassistenten aufruft, müssen die Berechtigungen auf jeder Stufe weiter eingeengt werden. Das Web-Sicherheitsmodell der Zukunft ist eine verifizierbare Delegationskette: KI-Identität gültig → Nutzer-Autorisierung gültig → Token nicht abgelaufen → Aktion innerhalb des autorisierten Rahmens.
Auf gut Deutsch gesagt: Im CAPTCHA-Zeitalter fragte man „Bist du ein Mensch?”, im KI-Zeitalter fragt man „Wer bist du, wer hat dich geschickt und was darfst du tun?” Vom Abweisen von Maschinen zum Verwalten von Maschinen.
Q4: Was sollten normale Entwickler und kleine Unternehmen jetzt tun?
永亮: Drei Dinge, nach Priorität geordnet.
Erstens: Wenn deine Website Bild-CAPTCHAs noch als Hauptverteidigungslinie einsetzt, solltest du heute aufrüsten. Setz auf reCAPTCHA v3 oder Cloudflare Turnstile (kostenlos) und verlagere die Prüfung auf die Serverseite. Die Bildrätsel kannst du drinlassen – aber nur als Dekoration, nicht als Schloss.
Zweitens: Behandle KI-Traffic nicht pauschal als Feind. Deine Nutzer werden schon bald mit KI-Assistenten ankommen. Es ist besser, im Vorfeld zu klären, welche Aktionen für autorisierte KI offen sind und welche nicht, als später in Panik einfach alles zu sperren.
Drittens: Wenn du KI-Anwendungen entwickelst, fang an, über eine Identität für deine Clients nachzudenken. Standards wie Web Bot Auth stecken noch in den Anfängen, aber die Richtung ist klar: KI, deren Identität sich verifizieren lässt, wird sich im Netz künftig viel ungehinderter bewegen als „anonyme KI”. Wer sich früher anbindet, wird früher nicht mehr versehentlich getroffen.
Und um gleich einen Schrecken zu zerstreuen, den vielleicht viele haben: CAPTCHAs verschwinden nicht über Nacht. Wenn du dich morgen auf einer Website anmeldest, wirst du weiterhin Ampeln anklicken. Was sich wirklich ändert, ist die Logik dahinter – du spürst sie nur nicht. Infrastruktur erneuert sich schon immer im Stillen: Du musst dein Handy nicht wechseln – die Schlösser der Welt wurden trotzdem längst getauscht.
Q5: Worauf läuft das Ganze hinaus? Wie können wir in zwanzig Jahren beweisen, wer wir sind?
Yongliang: Das Endspiel ist vielleicht dieses – dass es nichts mehr zu beweisen gibt.
Blickt man zwanzig Jahre zurück: Die Blütezeit der CAPTCHAs war im Kern eine Ära des „Mensch geht online, Maschine assistiert“ – die Grenze zwischen Mensch und Maschine war klar, deshalb genügte eine einzige Aufgabe, um beide Seiten zu trennen. Heute löst sich diese Grenze auf: Bei jeder menschlichen Handlung ist KI beteiligt, und hinter jeder KI-Operation steht die Absicht eines Menschen.
Bis dahin wird die „Identität“ auf eine tiefere Ebene absinken: Dein Gerät, deine Schlüssel, deine biometrischen Merkmale, deine Berechtigungskette – im Hintergrund erledigen sie jeden Nachweis. Du spürst die Verifizierung nicht mehr, genau so wenig wie du heute den TLS-Handshake spürst.
Klingt wunderbar? Ein entgegengesetzter Hinweis von mir: Wenn der Nachweis vollständig automatisiert ist, ist auch das Risiko der Identitätsanmaßung vollständig automatisiert. Wird deine KI-Identität gestohlen, ist das so, als wäre das digitale „Du“ gestohlen worden – künftig wird der sichere Umgang mit deinem privaten Schlüssel genauso wichtig sein wie der mit deinem Personalausweis.
Vor zwanzig Jahren lautete die Frage: Sitzt auf der anderen Seite des Bildschirms ein Mensch? In zwanzig Jahren lautet sie: Auf der anderen Seite des Bildschirms stehen zehn Identitäten – welche davon repräsentiert dich wirklich?
Epilog
拾闻: Zum Schluss: Fass diese Folge in einem Satz zusammen? 永亮: Die KI hat nicht das CAPTCHA gemeistert, sondern die alte Welt, in der „Mensch und Maschine strikt auf getrennten Seiten stehen“ – künftige Sicherheit hängt nicht davon ab, Maschinen bei Prüfungen zu überlisten, sondern sie gut zu managen. 拾闻: Diesen Satz schenken wir euch mit. Bis zur nächsten Folge.
【Technischer Tiefgang】Wie sehen die drei Verteidigungslinien moderner Anti-Bot-Systeme wirklich aus?
In dieser Folge war immer wieder die Rede davon, dass die „Verteidigungslinie umgezogen” ist – für technisches Publikum hier einmal die tatsächliche Schichtung von heute, auseinandergenommen (am Beispiel des Cloudflare-Systems).
Erste Schicht: Client-Challenge. Nach dem Laden der Seite läuft im Browser ein leichtgewichtiges JavaScript: Rechen-Challenges (eine Aufgabe, deren Lösung kaum Rechenleistung kostet), Web-API-Probing (verfügt dieser Browser über die Schnittstellen, die ein normaler Browser haben sollte), Konsistenzprüfungen der Umgebung (passen Bildschirmgröße, Schriftarten und Zeitzone zusammen?). Für Menschen unmerkbar, in Sekunden abgeschlossen. Das Ergebnis ist ein kurzlebiges Einmal-Token – beachte: Den Frontend-Code zu verändern, um ein „Bestanden” vorzutäuschen, bringt nichts, denn das Token muss serverseitig eingelöst und verifiziert werden.
Zweite Schicht: Netzwerk-Fingerprints. Beim TLS-Handshake legt der Client Merkmale wie die Präferenzen bei Verschlüsselungssuiten und die Reihenfolge der Extensions offen (JA3/JJA4-Fingerprints) – ein echter Chrome und ein Python-Skript haben völlig unterschiedliche Fingerprints. Hinzu kommen die Reihenfolge der Request-Header und das HTTP/2-Frame-Verhalten: Der Server kann der Verbindung ein Profil anfertigen, ohne den Inhalt anzusehen. Genau deshalb werden viele Crawler „blockiert, bevor sie überhaupt eine Anfrage senden”.
Dritte Schicht: Serverseitiges Risikomanagement. Token-Verifizierung (gültig? bereits verwendet? im Zeitfenster?) + Analyse der Verhaltenssequenz (sehen die Anfragen dieser IP in der letzten Stunde wie die eines normalen Nutzers aus?) + Geschäftsregeln (Bestellfrequenz, Verknüpfung zwischen Gerät und Konto). Diese Schicht sieht nicht eine einzelne Anfrage, sondern den gesamten zeitlichen Verlauf.
Vierte Schicht, gerade im Aufbau: Kryptografische Identität. Web Bot Auth nutzt den HTTP-Message-Signatures-Standard: KI-Clients signieren jede Anfrage mit einem privaten Ed25519-Schlüssel, die Signatur deckt den Anfrageinhalt ab (Manipulationsschutz), ein created/expires-Zeitfenster ist eingeschlossen (Replay-Schutz), und der öffentliche Schlüssel wird in einem durchsuchbaren Verzeichnis veröffentlicht. Die Signaturprüfung kostet den Server Millisekunden, doch eine Fälschung scheitert auf kryptografischem Niveau.
Legt man alle vier Schichten übereinander, ist die wahre Rolle dieses 3×3-Captcha-Bildes im Gesamtsystem: echten Nutzern das ritualhafte Gefühl von „Ich werde hier geschützt” zu vermitteln. Das Türschloss steckt längst dort, wo du es nicht siehst.