BLOG

TimesFM 3.0:Google 把时间序列预测「LLM 化」之后

Kael Zhang
AITimeSeriesGoogle
广告 · Advertisement

技术拆解:解析 AI 技术框架——说明、分析、技术评估、价值判断、落地使用、自建方案。 作者:永亮


一、这是什么:把时间序列当”语言”来建模的基座模型

传统的时间序列预测是个手艺活:每个业务一条曲线,就要配一个模型,调参、验季节性、处理离群点,周期以周计。TimesFM 的思路是把这个问题整个重写——既然语言模型可以从海量文本里学会”下一个词是什么”,那把时间序列切成一段段小片段(patch),当成”词”来训练一个 decoder-only transformer,它能不能学会”下一段曲线长什么样”?

答案是能。TimesFM 在发布时就是”零样本”定位:不针对你的业务微调,拿过来直接预测,效果就能打平甚至超过很多为该数据集专门调过的传统模型。官方口径下,3.0 在三个主流评测上拿了第一:覆盖 100 个真实任务的 fev-bench、50 个领域数据集的 TIME benchmark,以及在 GIFT-Eval 的所有基础模型中排名第一。

二、核心机制与技术架构

2.1 从 1.0 到 3.0:一个越来越像 LLM 的演进路线

TimesFM 1.0 的论文把 LLM 的三件套搬进时间序列:patch 化(把连续曲线切成固定长度的小段,归一化后线性投影成 embedding,等价于文本的 token 化)、decoder-only 自回归(只看过去、逐段生成未来)、大规模广谱预训练(真实数据加合成数据混合,让模型见过足够多样的趋势、季节性与突变模式)。

2.5 版本(2025 年 9 月)做了两件事:参数量从 5 亿降到 2 亿、上下文长度从 2048 拉到 16k——用更小的模型换更长的记忆;同时把输出从单点预测升级成可选的 3000 万分位数头,最长出 1000 步的分位数预测。“预测区间”这个能力对做库存和容量规划的人是刚需:决策者要的不是”下周销量 1200 件”,而是”P90 不超过 1500 件的备货量”。

3.0 则补上了基础模型在真实企业场景最大的两块短板:多变量联合建模和协变量融合。

2.2 主体:Stacked Mixing Transformer,一层里做两次注意力

从 Hugging Face 模型卡和源码可以还原 3.0 的完整结构:20 层 transformer,模型维度 1280,16 个注意力头,上下文 patch 长度 32,预测 patch 长度 64。

关键在于每一层不是普通的自注意力,而是源码里叫 MixingTransformer 的结构,一层里依次做三件事:

第一步,序列注意力(sequence attention)。 对每个变量各自的 patch 序列做因果注意力——严格只看过去,不看未来。这里几乎是现代 LLM 的标准配置全集:RoPE 旋转位置编码、QK-norm(RMS 归一化加在 query/key 上,稳住注意力 logits)、per-dim scale,外加 KV cache 支持增量解码。

第二步,变量注意力(variate attention)。 把张量转置,在每个时间位置上对变量维度做注意力——这一层回答的问题是”同一时刻,变量 A 的变化和变量 B 有什么关系”。这是多变量预测的核心:门店销量和气温、设备的电压和振动,关联就藏在跨变量的相关性里。注意它是非因果的(所有变量同时观测),源码里通过独立的 RoPE 开关和因果掩码配置与序列注意力区分开。

第三步,FFN。 前馈网络收尾,pre-norm/post-norm 加残差连接。

这套”时间维注意力 + 变量维注意力 + FFN”每层各来一遍的设计,与 iTransformer(把变量当 token 的思路)一脉相承,但 TimesFM 把它和因果序列注意力叠加在同一层内,一次前向就同时完成时序依赖和跨变量依赖的建模。20 层 × 两次注意力,参数量级却控制在 3 亿上下——单看这配置,就是奔着”MacBook 上能跑”去的。

2.3 RevIN 与 CPM:两个容易被忽略、但决定成败的工程细节

时序模型的老难题是输入分布漂移:同一条销售曲线,量纲从百到百万,均值方差随时段漂移。TimesFM 的方案是 RevIN(可逆实例归一化):进模型前用每条序列自身的滑动均值和标准差归一化,出结果后再反变换回原尺度。源码里这套统计量是逐 patch 累积的 running stats,且支持在指定位置冻结——推理长 horizon 时,归一化基准不会偷偷混入未来信息。

更有意思的是 3.0 引入的 CPM 掩码机制。源码中的做法是:训练或推理时把目标变量在某些 patch 位置上额外遮掉,然后用模型自己的估计值迭代精修这些位置的 RevIN 统计量——cpm_iterative_revin_refine 的实现是沿 patch 逐个前进,每个被遮位置用”前一个已精修统计量 + 当前模型估计”更新均值方差,而非 CPM 位置则保持原统计量不动。这套机制的动机很实际:长序列预测中,越靠后的预测点离”已观测区间”越远,归一化漂移越严重;让模型自我修正归一化基准,等于给长 horizon 预测加了一个随预测深度自适应的校准器。README 没有展开 CPM 的缩写全称,但它的行为就是”遮掉一段、让模型自己把统计量续上”。

2.4 协变量怎么进模型

3.0 宣传的”灵活协变量支持”,源码实现相当直接:roll + 拼接 + 掩码作为输入特征。历史协变量(past-only,比如历史天气)直接拼在输入 patch 后面;未来协变量(past-and-future,比如促销日历)通过对序列做移位 rolling 拿到对应未来窗口的值。更细的工程细节是:掩码本身(哪个点被遮、哪个 patch 是目标变量)也作为浮点特征与数值拼接,一起进一个 pre-transformer 的 ResidualBlock 做初始嵌入——模型不仅知道”值是多少”,还知道”哪些值是真的、哪些是占位”。

2.5 输出头:9 个分位数加一个硬裁剪

输出端,每个预测 patch 的每个点输出 9 个分位数(0.1 到 0.9,中位数在索引 4),反 RevIN 回原尺度后做 value clip 硬裁剪。分位数回归替代点估计,让同一次推理直接产出可供决策的置信区间;硬裁剪则是防止极端 logit 在反归一化后爆数值的工程护栏。

2.6 训练数据配方

模型卡披露 3.0 的预训练数据四路混合:GIFT-Eval 预训练集(剔除与 fev-bench 重叠的部分,避免评测污染)、Wikipedia 页面浏览量(截断至 2023 年 11 月)、Google Trends 头部查询(截断至 2022 年底)、以及合成与增强数据。值得注意的细节是前两条真实数据都带了明确的 cutoff 日期——评测卫生做得比较规范。

三、技术评估:亮点真实,但三条冷水要泼

先说亮点。参数量 2-3 亿级别意味着推理成本极低,官方基准(330M 模型、M4 Max、上下文 512、预测 64 步)有公开的耗时数据,MLX 后端让 Apple Silicon 本地推理成为真实选项;每层双注意力的 mixing 结构在多变量场景是正确的设计方向;配套的 SKILL.md 和 agent 集成说明 Google 在认真经营开发者生态。

再看三条冷水。

第一,3.0 的权重换了非商用许可。 这是本次更新最容易被忽略的条款:仓库代码和 2.5 及更早的权重都是 Apache-2.0,但 3.0 预训练权重单独适用 timesfm-non-commercial-license-v1.0——非商用、非生产环境。个人研究随便用,企业拿它跑生产有法律风险;商用得用 2.5 的权重(Apache-2.0)或者走 BigQuery ML 这类 Google 云托管渠道。官方在 README 里把这条写得很显眼,说明是故意的商业安排:开源做声量,变现走云。

第二,“三个 benchmark 第一”要读评测口径。 fev-bench 第一、TIME 第一都没问题,但注意 GIFT-Eval 的限定词是”所有基础模型中第一”——不是全场第一。时间序列预测领域大量专用模型(为单一数据集调优的)在特定业务上仍然更强,基模胜在通用性和免调参,不是绝对精度天花板。零样本的代价是放弃针对你业务的最后一截优化空间。另外训练数据 cutoff 在 2022-2023 年,对依赖近期宏观模式的业务曲线,这本身构成一层隐性偏差。

第三,时间序列的敌人是漂移。 零样本模型学的是”常见模式”,当你的业务发生结构性变化——换了产品线、来了新竞品、宏观政策转向——历史模式的迁移假设会失效。CPM 那套自校准机制缓解的是归一化层面的漂移,救不了模式层面的漂移。这类时刻,任何预测模型都得靠人工干预,TimesFM 不会例外。

四、价值判断:企业价值大于个人价值

预测是个典型的企业需求:销量预测、流量预测、容量规划、库存补货。这些场景有三个共同点——数据是私有的、频率是规律的、误差成本可量化。TimesFM 恰好卡在这个交集上:免调参降低了试用门槛,BigQuery ML 集成让数据不出云就能跑,分位数输出直接对接库存策略。

对个人开发者的价值则间接一些:它不适合”预测明天股价”这种噪声主导的野问题(这类问题任何模型都不该信)。它的甜区是”有规律、有协变量、有历史”的业务曲线。一句话:这是给企业数据团队省人力的工具,不是给个人造神器的工具。而那层非商用许可,恰恰说明 Google 也是这么定位的。

五、如何落地:三条路径

个人/研究:pip 装包就能跑,两条路线任选:

pip install timesfm[torch]   # PyTorch 路线
pip install timesfm[mlx]     # Apple Silicon 本地推理

几行代码出预测:forecaster.predict(context, horizon=128, return_quantiles=True)。官方示例还覆盖多变量的协变量写法,以及用 HuggingFace Transformers + PEFT 做 LoRA 微调的完整例子——拿你的私有业务曲线微调一遍,精度通常还能再抬一截。

企业:优先看 BigQuery ML 的 TimesFM 模型,SQL 里直接调用,数据不用出仓;或者走 Vertex AI Model Garden 的托管端点,适合要弹性扩缩的生产负载。

商用且想自托管:用 2.5 的 Apache-2.0 权重,或者看下面的替代方案。

六、如何自建类似方案:小模型 + mixing 架构的复刻路线

读完源码,TimesFM 3.0 的范式可以拆成一份明确的模块清单,自建领域版直接对着搭:

  1. 数据侧比模型侧重要。收集你行业的高质量多变量曲线,配上可控的合成数据增强(趋势、周期、突变注入),规模远比模型大小关键。3.0 的配方是真实数据(带 cutoff 防污染)+ 合成增强,照抄这个思路。
  2. 归一化层:实现逐 patch 累积的 RevIN,支持统计量冻结——这是长 horizon 推理防止未来信息泄漏的关键,也是很多自研模型翻车的地方。
  3. 主干:小的 decoder-only transformer(2-3 亿参数足够起步),每层三块——因果序列注意力(RoPE + QK-norm)→ 非因果变量注意力 → FFN,全部 pre/post-norm 加残差。
  4. 掩码策略:训练时随机遮 patch,并把”掩码本身”作为输入特征——这是它零样本能力的来源之一。
  5. 输出层:分位数回归(0.1-0.9 九档)+ 反归一化 + 硬裁剪,不要只报点估计。
  6. 评测侧务必自建,通用 benchmark 第一不代表你的业务第一。

如果不想造轮子,开源社区有许可更友好的平替:Amazon 的 Chronos 和 Salesforce 的 Moirai/Moirai-MoE 走的是同一条”时间序列 token 化”路线,许可对商用更友好,生态也成熟,值得在选型时放在一起压测。

结论

TimesFM 3.0 是”预测 LLM 化”这条路线目前最完整的一个官方样本:patch 化、因果注意力、RoPE、掩码预训练这些 LLM 成熟件被系统性地搬进时序领域,叠上变量注意力、RevIN 自校准和分位数输出这三件时序专用件,工程完成度很高。但两个细节决定了它的真实用法——3.0 权重的非商用许可把你推向 Google 云或 2.5 权重,而”基础模型第一”的限定词提醒你别拿通用榜当业务承诺。对企业数据团队,它值得立刻进评估清单;对技术团队,它是研究”如何把 LLM 架构方法论迁移到非文本序列”的最好活体教材。

参考来源

  • TimesFM GitHub 仓库(README、v3.0.0 release notes):https://github.com/google-research/timesfm
  • Hugging Face 模型卡:google/timesfm-3.0-pytorch(架构参数与训练数据配方)
  • 源码:src/timesfm3/torch/ 下的 model.py、transformer.py、cpm_revin_refine.py(MixingTransformer 层结构、RevIN/CPM 实现、协变量融合)
  • 论文:A decoder-only foundation model for time-series forecasting,ICML 2024,arXiv:2310.10688
  • BigQuery ML TimesFM 文档 / Google Workspace 更新日志(Sheets 集成)
广告 · Advertisement

常见问题

TimesFM 3.0是什么?

TimesFM 3.0是Google Research开发的时间序列预测基础模型,它能够处理长时间序列数据,支持零样本预测和多种预测任务,适用于金融、气象等领域。

TimesFM 3.0的核心架构是什么?

TimesFM 3.0采用Stacked Mixing Transformer架构,结合RevIN归一化和CPM(可控预测机制)技术,能够处理多变量时间序列,并提供准确的分位数预测。

TimesFM 3.0有哪些主要优势?

TimesFM 3.0的主要优势包括强大的零样本预测能力、对长时间序列的支持以及分位数预测输出。这些特性使其在金融、气象等需要长期预测的领域具有应用价值。

TimesFM 3.0有哪些局限性?

TimesFM 3.0的局限性包括非商用许可限制(≤2.5版本才是Apache-2.0)、作为基础模型并非在所有基准测试中都是最优,以及可能存在的分布漂移问题。用户需根据自身需求评估其适用性。