BLOG
TimesFM 3.0: Nachdem Google die Zeitreihenvorhersage „LLM-isiert“ hat
Technischer Deep-Dive: Analyse von AI-Technologie-Frameworks – Erklärung, Analyse, technische Bewertung, Werturteil, praktische Anwendung, Eigenbau-Lösungen. Autor: 永亮
1. Was ist das: Ein Basismodell, das Zeitreihen als „Sprache“ modelliert
Traditionelle Zeitreihenvorhersage ist ein Handwerk: Für jede Geschäftskurve braucht man ein Modell, Hyperparameter-Tuning, Überprüfung der Saisonalität, Behandlung von Ausreißern – Zyklen, die Wochen dauern. Der Ansatz von TimesFM ist, dieses Problem komplett neu zu schreiben: Da Sprachmodelle aus massiven Textmengen lernen können, „was das nächste Wort ist“, warum nicht Zeitreihen in kleine Segmente (Patches) schneiden, sie als „Wörter“ behandeln und einen decoder-only Transformer darauf trainieren, damit er lernt, „wie die nächste Kurvenaussieht“?
Die Antwort ist ja. TimesFM positionierte sich bei Veröffentlichung als „Zero-Shot“: Kein Fine-Tuning für Ihr Geschäft, einfach vorhersagen, die Wirkung hält mit oder übertrifft viele traditionelle Modelle, die speziell für diesen Datensatz angepasst wurden. Nach offiziellen Angaben belegte 3.0 den ersten Platz in drei Hauptbewertungen: fev-bench mit 100 realen Aufgaben, TIME benchmark mit 50 Bereichsdatensätzen und Platz 1 unter allen Basismodellen im GIFT-Eval.
2. Kernmechanismen und technische Architektur
2.1 Von 1.0 bis 3.0: Ein Entwicklungspfad, der immer mehr einem LLM ähnelt
Die Arbeit zu TimesFM 1.0 brachte das LLM-Trio in die Zeitreihen: Patch-Ifizierung (kontinuierliche Kurven in Segmente fester Länge schneiden, nach Normalisierung linear in Embeddings projizieren, äquivalent zur Tokenisierung von Text), decoder-only autoregressiv (nur in die Vergangenheit schauen, Zukunft segmentweise generieren), großangelegtes breites Vorab-Training (Mischung aus echten und synthetischen Daten, damit das Modell ausreichend diverse Trends, Saisonalitäten und plötzliche Muster sieht).
Version 2.5 (September 2025) erledigte zwei Dinge: Die Parameterzahl wurde von 500 Mio. auf 200 Mio. reduziert, die Kontextlänge von 2048 auf 16k erweitert – ein kleineres Modell für ein längeres Gedächtnis; gleichzeitig wurde die Ausgabe von Einzelpunktvorhersagen auf optionale 30 Millionen Quantil-Köpfe hochgestuft, mit bis zu 1000 Schritten Quantilvorhersage. Die Fähigkeit „Vorhersageintervalle“ ist ein Muss für diejenigen, die mit Lagerbestand und Kapazitätsplanung zu tun haben: Entscheidern ist nicht wichtig „nächste Woche Verkauf 1200 Stück“, sondern „P90 Lagerbestand nicht über 1500 Stück“.
Die 3.0 schließt die zwei größten Lücken von Basismodellen in realen Unternehmensszenarien: multivariate gemeinsame Modellierung und Kovariaten-Fusion.
2.2 Hauptteil: Stacked Mixing Transformer, zweifache Aufmerksamkeit in einer Schicht
Aus der Hugging Face-Modellkarte und dem Quellcode lässt sich die vollständige Struktur der 3.0 rekonstruieren: 20 Transformer-Schichten, Modell-Dimension 1280, 16 Attention-Köpfe, Kontext-Patch-Länge 32, Vorhersage-Patch-Länge 64.
Der Schlüssel liegt darin, dass jede Schicht keine gewöhnliche Self-Attention ist, sondern eine Struktur namens MixingTransformer im Quellcode, die drei Dinge nacheinander erledigt:
Schritt eins, Sequenz-Attention (Sequence Attention). Kausale Attention auf die Patch-Sequenz jeder einzelnen Variablen – strikt nur in die Vergangenheit schauen, nicht in die Zukunft. Hier ist fast das vollständige Standard-Set moderner LLMs versammelt: RoPE-Rotationspositionskodierung, QK-norm (RMS-Normalisierung auf Query/Key angewendet, um Attention-Logits zu stabilisieren), per-dim scale, zusätzlich KV-Cache-Unterstützung für inkrementelles Decoding.
Schritt zwei, Variablen-Attention (Variate Attention). Den Tensor transponieren und auf der Variablendimension an jeder Zeitposition Attention ausführen – diese Schicht beantwortet die Frage „Welche Beziehung hat die Änderung von Variable A zu Variable B zum selben Zeitpunkt“. Dies ist der Kern multivariater Vorhersagen: Ladenumsätze und Temperatur, Gerätespannung und Vibration, die Korrelation steckt in der kreuzvariablen Abhängigkeit. Beachten Sie, dass sie nicht-kausal ist (alle Variablen werden gleichzeitig beobachtet), im Quellcode wird sie durch einen unabhängigen RoPE-Schalter und eine kausale Maskenkonfiguration von der Sequenz-Attention unterschieden.
Schritt drei, FFN. Das Feed-Forward-Netzwerk rundet es ab, pre-norm/post-norm plus Restverbindung.
Dieses Design aus „Zeit-Dim-Attention + Variablen-Dim-Attention + FFN“, das jede Schicht einmal durchläuft, stammt direkt von iTransformer ab (der Ansatz, Variablen als Tokens zu behandeln), aber TimesFM überlagert es mit kausaler Sequenz-Attention innerhalb derselben Schicht und modelliert zeitliche Abhängigkeiten und kreuzvariabile Abhängigkeiten in einem einzigen Forward-Pass. 20 Schichten × zweifache Attention, aber die Parametergröße wird bei etwa 300 Mio. gehalten – allein diese Konfiguration zielt darauf ab, „auf einem MacBook laufen zu können“.
2.3 RevIN und CPM: Zwei leicht zu übersehende, aber entscheidende technische Details
Ein altes Problem bei Zeitreihenmodellen ist die Input-Verteilungsdrift: Dieselbe Verkaufskurve, die Skala von Hundert bis Millionen, Mittelwert und Varianz driften mit der Zeit. TimesFMs Lösung ist RevIN (Reversible Instance Normalization): Vor dem Eintritt in das Modell wird mit dem gleitenden Mittelwert und der Standardabweichung der einzelnen Sequenz normalisiert, nach der Ausgabe wird die Rücktransformation zur ursprünglichen Skala durchgeführt. Im Quellcode sind diese Statistiken patchweise akkumulierte laufende Statistiken (running stats), und sie unterstützen das Einfrieren an angegebenen Positionen – bei der Inferenz über einen langen Horizont mischt sich keine zukünftige Information unbemerkt in den Normalisierungsmaßstab ein.
Noch interessanter ist der in 3.0 eingeführte CPM-Maskierungsmechanismus. Die Umsetzung im Quellcode ist: Beim Training oder Inferieren werden die Zielvariablen an bestimmten Patch-Positionen zusätzlich maskiert, und dann werden die RevIN-Statistiken dieser Positionen mit den eigenen Schätzwerten des Modells iterativ verfeinert – die Implementierung von cpm_iterative_revin_refine arbeitet sich Patch für Patch vorwärts, jede maskierte Position aktualisiert Mittelwert und Varianz mit „vorheriger verfeinerter Statistik + aktuelle Modellschätzung“, während Nicht-CPM-Positionen ihre ursprünglichen Statistiken behalten. Die Motivation dieses Mechanismus ist sehr praktisch: Bei der Vorhersage langer Sequenzen sind die späten Vorhersagepunkte weiter vom „beobachteten Intervall“ entfernt, die Normalisierungsdrift ist schwerwiegender; das Modell den Normalisierungsmaßstab selbst korrigieren zu lassen, bedeutet, der Langzeit-Vorhersage einen Kalibrator hinzuzufügen, der sich an die Vorhersagetiefe anpasst. Das README erweitert die Abkürzung CPM nicht, aber das Verhalten ist „ein Segment maskieren, das Modell die Statistiken selbst weiterführen lassen“.
2.4 Wie kommen Kovariaten in das Modell?
Die von 3.0 beworbene „flexible Kovariaten-Unterstützung“ ist im Quellcode相当direkt umgesetzt: Roll + Concat + Maske als Input-Features. Historische Kovariaten (nur Vergangenheit, z.B. historisches Wetter) werden direkt hinter den Input-Patch gehängt; zukünftige Kovariaten (Vergangenheit und Zukunft, z.B. Werbekalender) werden durch Verschieben (Rolling) der Sequenz ermittelt, um die Werte des entsprechenden zukünftigen Fensters zu erhalten. Ein feineres technisches Detail ist: Die Maske selbst (welcher Punkt maskiert ist, welcher Patch die Zielvariable ist) wird ebenfalls als Gleitkomma-Feature mit den numerischen Werten verkettet und geht gemeinsam in einen vor dem Transformer liegenden ResidualBlock für die erste Einbettung – das Modell weiß nicht nur „wie hoch der Wert ist“, sondern auch „welche Werte echt sind und welche Platzhalter“.
2.5 Ausgabekopf: 9 Quantile plus ein hartes Clipping
Auf der Ausgabeseite gibt jeder Punkt jedes Vorhersage-Patches 9 Quantile aus (0,1 bis 0,9, Median bei Index 4), nach inverser RevIN zur ursprünglichen Skala wird ein hartes Value-Clipping durchgeführt. Quantilsregression ersetzt die Punktschätzung, sodass ein einziger Inferenz-Durchlauf direkt Konfidenzintervalle für Entscheidungen liefert; das harte Clipping ist eine technische Schutzmaßnahme, um zu verhindern, dass extreme Logits nach der Denormalisierung numerisch explodieren.
2.6 Rezept für Trainingsdaten
Die Modellkarte deckt auf, dass die Vorabtrainingsdaten der 3.0 aus vier Quellen gemischt sind: GIFT-Eval-Vorabtrainingsset (Entfernung der Überlappung mit fev-bench, um Verunreinigung der Bewertung zu vermeiden), Wikipedia-Seitenaufrufe (Abgeschnitten im November 2023), Google Trends-Top-Abfragen (Abgeschnitten Ende 2022) sowie synthetische und erweiterte Daten. Ein bemerkenswertes Detail ist, dass die ersten beiden echtdatenquellen ein klares Stichdatum (Cutoff) haben – die Bewertungshygiene ist recht ordentlich.
3. Technische Bewertung: Highlights sind echt, aber drei Realitätschecks sind nötig
Ersteinmal die Highlights. Die Parametergröße von 200 bis 300 Millionen bedeutet extrem niedrige Inferenzkosten. Für den offiziellen Benchmark (330M-Modell, M4 Max, Kontext 512, 64 Schritte Vorhersage) gibt es öffentliche Laufzeitdaten; das MLX-Backend macht lokale Inferenz auf Apple Silicon zu einer echten Option. Die Mixing-Struktur mit doppelter Attention pro Schicht ist bei multivariaten Szenarien die richtige Designrichtung; die begleitende SKILL.md und die Agent-Integration zeigen, dass Google das Entwickler-Ökosystem ernsthaft pflegt.
Jetzt zu den drei Realitätschecks.
Erstens, die Gewichte der 3.0 stehen unter einer nicht-kommerziellen Lizenz. Dies ist die am leichtesten zu übersehende Klausel dieses Updates: Der Repository-Code und die Gewichte von 2.5 und früher sind Apache-2.0, aber die 3.0-Vorabtrainingsgewichte unterliegen gesondert der timesfm-non-commercial-license-v1.0 – nicht-kommerziell, nicht-produktiv. Für die persönliche Forschung ist alles offen, aber Unternehmen, die es in der Produktion einsetzen, gehen ein rechtliches Risiko ein; für den kommerziellen Gebrauch müssen die 2.5-Gewichte (Apache-2.0) oder kanalisierter Wege wie BigQuery ML genutzt werden. Offiziell steht dies im README sehr prominent, was auf eine bewusste geschäftliche Anordnung hindeutet: Open Source für Reichweite, Vermarktung über die Cloud.
Zweitens, bei „drei Benchmarks auf Platz 1“ muss der Bewertungsmaßstab gelesen werden. Platz 1 bei fev-bench und TIME ist in Ordnung, aber beachten Sie das einschränkende Wort bei GIFT-Eval: „Platz 1 unter allen Basismodellen“ – nicht Platz 1 im gesamten Feld. Im Bereich der Zeitreihenvorhersage sind viele spezialisierte Modelle (für einen einzelnen Datensatz optimiert) bei spezifischen Aufgaben immer noch stärker, Basismodelle gewinnen durch Generalisierbarkeit und fehlendes Tuning, nicht durch die absolute Genauigkeitsobergrenze. Der Preis für Zero-Shot ist der Verzicht auf den letzten Optimierungsspielraum für Ihr Geschäft. Zudem liegt der Cutoff der Trainingsdaten in den Jahren 2022-2023, was für Geschäftskurven, die auf aktuelle makroökonomische Muster angewiesen sind, eine implizite Verzerrung darstellt.
Drittens, der Feind der Zeitreihe ist die Drift. Zero-Shot-Modelle lernen „häufige Muster“. Wenn sich Ihr Geschäft strukturell ändert – Produktpalette gewechselt, neuer Wettbewerber aufgetreten, makroökonomischer Richtungswechsel –, geht die Annahme der Übertragbarkeit historischer Muster fehl. Der CPM-Selbstkalibrierungsmechanismus mildert nur die Drift auf Normalisierungsebene, er rettet nicht die Drift auf Musterebene. In solchen Momenten benötigt jedes Vorhersagemodell menschliches Eingreifen, TimesFM bildet da keine Ausnahme.
4. Werturteil: Unternehmenswert ist größer als persönlicher Wert
Vorhersage ist ein typischer Unternehmensbedarf: Absatzprognose, Traffic-Prognose, Kapazitätsplanung, Lagerbestandsauffüllung. Diese Szenarien haben drei Gemeinsamkeiten – die Daten sind privat, die Frequenz ist规律mäßig, die Fehlerkosten sind quantifizierbar. TimesFM trifft genau diesen Schnittpunkt: Kein Tuning senkt die Hürde für Tests, BigQuery ML lässt die Daten das Cloud-Verlassen nicht, Quantil-Ausgaben koppeln direkt an die Lagerstrategie.
Der Wert für persönliche Entwickler ist indirekter: Es eignet sich nicht für „wild/vage“ Probleme, die vom Rauschen dominiert sind (wie „morgen Aktienkurs vorhersagen“, solchen Modellen sollte man nicht trauen). Seine Süßzone liegt bei Geschäftskurven, die „规律mäßig, mit Kovariaten, mit Historie“ sind. Mit einem Wort: Dies ist ein Werkzeug für Unternehmensdatenteams, um Arbeitskraft zu sparen, kein Werkzeug für Einzelpersonen, um Wunderdinge zu bauen. Und die nicht-kommerzielle Lizenz zeigt genau, dass Google es so positioniert.
5. Implementierung: Drei Wege
Personen/Forschung: Pip-Install, zwei Routen zur Auswahl:
pip install timesfm[torch] # PyTorch-Route
pip install timesfm[mlx] # Apple Silicon lokale Inferenz
Wenige Codezeilen für Vorhersage: forecaster.predict(context, horizon=128, return_quantiles=True). Offizielle Beispiele decken auch die Syntax für multivariate Kovariaten ab sowie ein vollständiges Beispiel für LoRA-Fine-Tuning mit Hugging Face Transformers + PEFT – einmal mit Ihren privaten Geschäftskurven feintunen, die Genauigkeit lässt sich meist noch um ein Stück heben.
Unternehmen: Priorität für das TimesFM-Modell in BigQuery ML, direkter Aufruf in SQL, Daten verlassen das Lager nicht; oder über gehostete Endpunkte im Vertex AI Model Garden, geeignet für Produktionslasten mit elastischem Skalieren.
Kommerziell und selbst gehostet: Verwenden Sie die 2.5 Apache-2.0-Gewichte oder sehen Sie sich die folgenden Alternativen an.
6. Wie man eine ähnliche Lösung selbst baut: Replikationsroute mit kleinem Modell + Mixing-Architektur
Nachdem man den Quellcode gelesen hat, kann das Paradigma von TimesFM 3.0 in eine klare Modulliste zerlegt werden, für den Selbstbau einer Domain-Version einfach entsprechend zusammenbauen:
- Datenseite wichtiger als Modellseite. Sammeln Sie hochwertige multivariate Kurven aus Ihrer Branche, ergänzt durch kontrollierte synthetische Datenerweiterung (Trend, Zyklus, Mutation-Injektion); die Skalierung ist viel entscheidender als die Modellgröße. Das Rezept der 3.0 ist echte Daten (mit Cutoff gegen Verunreinigung) + synthetische Erweiterung, kopieren Sie diesen Gedanken.
- Normalisierungsschicht: Implementieren Sie RevIN mit patchweiser Akkumulation, unterstützen Sie das Einfrieren von Statistiken – dies ist der Schlüssel, um bei der Inferenz über lange Horizonte ein Lecken zukünftiger Informationen zu verhindern, und hier stolpern viele selbst entwickelte Modelle.
- Rückgrat: Ein kleiner decoder-only Transformer (200–300 Mio. Parameter reichen als Start), pro Schicht drei Blöcke – kausale Sequenz-Attention (RoPE + QK-norm) → nicht-kausale Variablen-Attention → FFN, alles pre/post-norm plus Restverbindung.
- Maskierungsstrategie: Zufälliges Maskieren von Patches beim Training und die „Maske selbst“ als Input-Feature verwenden – dies ist eine der Quellen für die Zero-Shot-Fähigkeit.
- Ausgabeschicht: Quantilsregression (0,1–0,9 neun Stufen) + Inverse Normalisierung + hartes Clipping, melden Sie nicht nur Punktschätzungen.
- Bewertungsseite muss selbst aufgebaut werden, Platz 1 im allgemeinen Benchmark bedeutet nicht Platz 1 in Ihrem Geschäft.
Wenn Sie das Rad nicht neu erfinden wollen, gibt es in der Open-Source-Community lizenzfreundlichere Alternativen: Amazons Chronos und Salesforces Moirai/Moirai-MoE verfolgen denselben Weg der „Zeitreihen-Tokenisierung“, die Lizenzen sind kommerzieller freundlicher, das Ökosystem ist ausgereift, es lohnt sich, sie bei der Auswahl gemeinsam einem Stresstest zu unterziehen.
Fazit
TimesFM 3.0 ist das bisher vollständigste offizielle Muster auf dem Weg der „LLM-Iisierung der Vorhersage“: Patch-Ifizierung, kausale Attention, RoPE, maskiertes Vorabtraining – diese ausgereiften LLM-Komponenten werden systematisch in die Zeitreihendomain übertragen, gestapelt mit Variablen-Attention, RevIN-Selbstkalibrierung und Quantil-Ausgabe als den drei zeitreihenspezifischen Komponenten, der technische Abschlussgrad ist sehr hoch. Aber zwei Details bestimmen die echte Nutzung: Die nicht-kommerzielle Lizenz der 3.0-Gewichte drängt Sie zur Google Cloud oder zu den 2.5-Gewichten, und das einschränkende Wort „Basismodell“ bei Platz 1 erinnert Sie daran, das allgemeine Ranking nicht als Geschäftsversprechen zu missdeuten. Für Unternehmensdatenteams lohnt es sich, sofort auf die Bewertungsliste zu setzen; für technische Teams ist es das beste lebende Lehrbuch, um zu untersuchen, „wie man die Methodik der LLM-Architektur auf nicht-textuelle Sequenzen überträgt“.
Referenzen
- TimesFM GitHub-Repository (README, v3.0.0 release notes): https://github.com/google-research/timesfm
- Hugging Face Model Card: google/timesfm-3.0-pytorch (Architekturparameter und Rezept für Trainingsdaten)
- Quellcode: src/timesfm3/torch/ model.py, transformer.py, cpm_revin_refine.py (MixingTransformer-Schichtstruktur, RevIN/CPM-Implementierung, Kovariaten-Fusion)
- Paper: A decoder-only foundation model for time-series forecasting, ICML 2024, arXiv:2310.10688
- BigQuery ML TimesFM-Dokumentation / Google Workspace-Update-Logs (Sheets-Integration)