BLOG
Hot-Tracking 007 | Google veröffentlicht Gemini 3.8 Live und Extended Thinking: Ein Sprach-Agent, der 'laut denkt', und ein Antwortbogen unter eigener Aufsicht
Hot-Tracking: Heiße Releases × Technische Einordnung × Praktische Ratschläge. Autor: Yongliang
Am 15. September hat Google in seinem offiziellen Blog (verfasst von Tom Ouyang und Malini Jaganathan vom Gemini Audio Team) gleich zwei Sprachmodelle veröffentlicht: Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking. Ersteres setzt auf Skalierung und Kosteneffizienz und betont Konversationsintelligenz und visuelles Verständnis; Letzteres zielt auf hochkomplexe Aufgaben und wirbt mit „Reasoning und Sprechen gleichzeitig“ – das Modell denkt und spricht zugleich, und wenn etwas zu überprüfen ist, sagt es zuerst „Let me check that…“ und meldet dann in Echtzeit den Fortschritt. Noch am selben Tag konnten Entwickler über die Gemini API und AI Studio darauf zugreifen; Privatanwender sehen die neuen Funktionen gestaffelt in Search Live, in der Gemini Live App und in Workspace; die Enterprise-Version bleibt eine private Preview. Im Feld der Sprach-Agents ist dieses Jahr viel los, und alle reden davon, „arbeiten zu können“ statt nur „plaudern zu können“. Google tritt diesmal mit großer Geste auf: Nach offizieller Darstellung belegte Extended Thinking den ersten Platz auf dem Speech to Speech Quality Index des Drittanbieter-Rankings Artificial Analysis (82.6). Aber dieser Leistungsnachweis lohnt es sich, Zeile für Zeile zu lesen – denn zwischen denen, die die Aufsicht führen, denen, die den Antwortbogen schreiben, und denen, die den Prüfungssaal verlassen, gibt es erhebliche Überschneidungen: Es ist oft ein und dieselbe Firma.
Was veröffentlicht wurde
Zunächst die harten Fakten der offiziellen Darstellung, sämtlich aus dem offiziellen Blog vom 15. September:
Die beiden Modelle haben klar getrennte Rollen. Gemini 3.8 Live geht die Skalierungslinie: Kosteneffizienz vorrangig, automatischer Sprachwechsel zwischen 97 Sprachen im Gespräch, dazu nahezu echtzeitnahe visuelle Eingaben – in der Release-Demo gehörten dazu das Ansehen einer Schachstellung und das direkte Schreiben einer React-Komponente aus einer einfachen Skizze. Zudem kann es im Hintergrund Toolaufrufe und API-Anfragen ausführen, ohne das laufende Gespräch zu unterbrechen. Gemini 3.8 Live Extended Thinking geht die Linie hoher Komplexität: mehrstufige Reasoning-Aufgaben, mit dem Kennzeichen „der Denkprozess wird ausgesprochen“ – der Nutzer hört, wann das Modell gerade recherchiert und wann es rechnet, statt vor Stille auf das Ergebnis zu warten.
Die Verfügbarkeit gliedert sich in drei Ebenen. Die Entwickler-Ebene ist ab Tag eins nutzbar: Gemini API und AI Studio wurden synchron geöffnet. Die Privatnutzer-Ebene ist nach Abos gestaffelt: Search Live, die Gemini Live App sowie Docs Live / Gmail Live / Keep Live in Workspace hängen an den beiden Abostufen Google AI Pro und Ultra – nicht jeder bekommt am selben Tag alle Funktionen. Die Enterprise-Ebene bleibt eine private Preview: Gemini Enterprise-Kunden müssen einen Antrag stellen.
Auch das Drumherum ist vollständig: Die Audioausgabe trägt ein SynthID-Wasserzeichen, und offiziell wurde ein model card veröffentlicht. Die Liste des Partner-Ökosystems ist lang – Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel, Vision Agents; Kunden-Referenzen: Salesforce, Genspark, Lumeris.
Wie man den offiziellen Leistungsnachweis liest
Diesen Abschnitt muss man langsam lesen, denn die Zahlen stammen aus unterschiedlichen Quellen und sind nicht gleich viel wert.
Aus Drittanbieter-Rankings stammen zwei Ergebnisse: Extended Thinking liegt auf dem Speech to Speech Quality Index von Artificial Analysis auf Platz 1, mit 82.6 Punkten; auf der Nutzer-Präferenzliste der Speech Agent Arena liegt es auf Platz 2. Das sind Tests externer Institutionen und dürfen als unabhängige Bewertung gelten.
Aus der offiziellen Eigenmessung stammen: eine Task-Completion-Rate von 68.6% beim τ-Voice-Agenten, 35.1% im Szenario Sierra τ-Voice-banking und 97.7% bei Big Bench Audio. Diese Zahlen sind bislang von keiner unabhängigen dritten Partei reproduziert; im Haupttext können sie daher nur „offizielle Angabe“ heißen.
Am interessantesten ist der Punkt zu ServiceNow EVA-Bench. Im offiziellen Blog heißt es, Extended Thinking habe „die Pareto-Front aus Genauigkeit und Gesprächsqualität verschoben“ – doch direkt danach folgt eine Selbstnotiz: Die Tests wurden auf der Live API der Gemini Enterprise Agent Platform ausgeführt. Übersetzt heißt das: Dieser Benchmark für den Enterprise-Kundenservice lief auf Googles eigener Agent-Plattform. Dass EVA-Bench das Evaluierungs-Framework von ServiceNow ist, stimmt unbestritten; aber die Laufumgebung ist der eigene Stack – diese Einschränkung hat der Hersteller selbst notiert, und Leser sollten sie sich selbst merken.
Die Lesart dieses Leistungsnachweises lautet also: Der Drittanbieter-Teil darf zitiert werden, der Eigenmessungs-Teil muss entsprechend markiert werden, und bei EVA-Bench sind beide Hälften zugleich festzuhalten – „fremdes Framework“ und „eigene Rennstrecke“.
Die nüchterne andere Hälfte
Das ist der Teil, über den diese Ausgabe eigentlich ernsthaft sprechen will. Fünf Punkte, nach Gewicht sortiert.
Erstens: eigene Release-Show + eigene Benchmarks – ehrlich, aber nicht vollständig ehrlich. Dass KI-Hersteller ihre eigenen Ergebnisse auf ihrer eigenen Plattform verkünden, ist Branchenroutine und kein Wunder. Aber das ehrliche Material liegt diesmal frei im Raum: Die Selbstnotiz zu EVA-Bench, „ausgeführt auf der Live API der Gemini Enterprise Agent Platform“, bedeutet, dass der Hersteller die Interessenlage selbst markiert hat. Das ist kein Schummeln – die Einschränkung steht offen sichtbar; aber es ist auch keine unabhängige Verifikation. Die echte Lücke liegt woanders: Diese glänzenden Zahlen zu τ-Voice und Big Bench Audio hat im gesamten Release-Material keine einzige externe Institution reproduziert. Der Hype der Präsentation vergeht; ob diese Zahlen ein zweites Mal von einer dritten Partei getestet werden, entscheidet darüber, ob sie standhalten.
Zweitens: die Namenskunde von „Extended Thinking“ – ist lautes Denken Reasoning-Transparenz oder anthropomorphe Inszenierung. Bei Textmodellen lässt sich eine Chain of Thought Wort für Wort auditieren, als Screenshot festhalten und kritisieren. Bei Sprache ist das anders: Man hört ein flüssiges „Let me check that…“, aber recherchiert und rechnet das Modell wirklich – oder beruhigt es einen nur mit einem trainierten verbalen Muster? Das „Denken“ der Sprachinteraktion lässt sich nicht wie Text auditieren – Zuhörende haben weder die Berechtigung, den Reasoning-Prozess einzusehen, noch eine Möglichkeit, „echtes mehrstufiges Reasoning“ von „inszeniertem mehrstufigem Reasoning“ zu unterscheiden. Latenz als „Denken“ zu verpacken ist ingenieurstechnisch eine elegante Produktentscheidung; erzählerisch stiehlt es dem Begriff „extended thinking“ das Vertrauen, das er sich im Textzeitalter aufgebaut hat. Zwischen Transparenz und Inszenierung liegt eine Schicht aus Sprache – und wer diese Schicht definiert, ist derzeit der Hersteller selbst.
Drittens: Zwischen Versprechen und Auslieferung liegen Abotabelle und Preview-Liste. Dass Entwickler am Releasetag die API nutzen konnten, ist wahr. Aber das private Workspace-Komplettpaket – Docs Live, Gmail Live, Keep Live – ist nach Pro-/Ultra-Abos gestaffelt; zwischen „veröffentlicht“ und „du kannst es nutzen“ liegt eine Paywall. Das Kernverkaufsargument der Enterprise-Seite, Gemini Enterprise, ist weiterhin private Preview: antragspflichtig, intransparent, ohne Zeitplan. Das ist kein Problem von Google allein, sondern der Branchenalltag „Ankündigung in voller Breite, Auslieferung in Stufen“. Für