论文标题:Falcon-X: A Time Series Foundation Model for Heterogeneous Multivariate Modeling 作者:Ant Group(蚂蚁集团)
发布时间:2026 年 5 月(arXiv:2605.27286)
论文链接:https://arxiv.org/pdf/2605.27286v2
核心亮点:首个针对异构多变量时序的基础模型,通过潜在原型空间解耦差分注意力机制,解决异变量语义对齐与复杂交互建模难题,支持零样本结构迁移。

  • Code: https://github.com/ant-intl/Falcon-TST
  • Model: https://pypi.org/project/falcon-tst/

一、研究背景与问题痛点

1.1 时序基础模型(TSFMs)现状

  • 现有 TSFMs 多聚焦单变量时序建模,多变量扩展方案直接在原始变量空间操作。
  • 核心缺陷:原始空间混合缺乏异构物理量对齐机制标准非负注意力无法捕捉现实系统中普遍的协同 / 拮抗复杂交互

1.2 异构多变量时序的核心挑战

  1. 语义异构:变量量纲、分布、物理意义差异大(如温度、电压、流量),难以直接关联。
  2. 交互复杂:变量间存在非线性、正负相关交织的依赖关系。
  3. 迁移困难:原始空间绑定变量维度,跨场景 / 跨领域零样本迁移能力弱。

二、核心创新:Falcon-X 模型架构

2.1 整体设计思路

核心范式原始空间 → 统一潜在原型空间 → 原始空间,通过解耦实现异构变量语义对齐与高效交互。

整体方案如下,输入为多领域(不同主题)多条序列通过单序列标准化之后,进行token处理,参照patch方法,然后对单条序列进行时间上的注意力计算,然后给到统一原型差分注意力机制,对每个主题进行原型空间映射;映射到统一空间后,在主题间进行注意力计算,实现主体间信息学习;最后根据初始序列信息对原型空间还原以及主体间信息融合,生成最终信息表征;给到分位数预测头进行预测,与逆标准化得到未来预测.

2.2 输入处理

输入N个主体,一共m条序列,其不同主体序列数可能不同,长度取L,同时加上未来预测长度T,单条序列跳过缺失值进行标准化

为了能够区分历史与未来,做了相对时间戳列\tau;为了区分缺失与未缺失,做了二值掩码M.这两列会拼到序列上,完成信息拼接扩充后,整条序列会被切分为P = \frac{L+T}{L_p}个互不重叠、单段长度为 L_p 的时序块(Patch),再通过残差块嵌入层映射至隐层维度 D:

token完成后进行单条序列时间维度上注意力计算,这个常见,不再展开.

2.3 统一原型差分注意力(Unified Prototype Diff-Attention)

原始特征空间下变量交互天然存在语义错位问题,为解决该问题,Falcon-X 将异构时序嵌\boldsymbol{H}_T投影至维度固定为 C 的潜在原型空间;本文提出差分注意力机制,可显式建模正向、负向两类语义关联亲和度。

定义两组全局共享的可学习参数矩阵\boldsymbol{K}_\mathrm{pos},\boldsymbol{K}_\mathrm{neg} \in \mathbb{R}^{C \times D},分别代表协同时序原型、拮抗时序原型。对任意实体 e_i,设其时序嵌入为\boldsymbol{h}_T^i \in \mathbb{R}^{m_i \times P \times D},通过线性投影生成查询向量 \boldsymbol{Q}^i 与数值向量\boldsymbol{V}^i。 双重依赖注意力图用于量化该实体的m_i个异构变量与 C 个统一原型间的关联程度,计算公式如下:

式中 \boldsymbol{A}_\mathrm{pos}^i,\boldsymbol{A}_\mathrm{neg}^i \in \mathbb{R}^{m_i \times P \times C}基于差分注意力分数对数值特征做聚合,即可得到实体e_i的统一表征\boldsymbol{h}_C^i \in \mathbb{R}^{C \times P \times D},其聚合方式如下所示:

这样的好处是可以避免不同实体间序列数不一致的问题,统一在实体上进行计算.同时,为了确保差分注意力生效,添加了正交损失 \mathcal{L}_\mathrm{orth} = \mathrm{Sim}(\boldsymbol{K}_\mathrm{pos},\boldsymbol{K}_\mathrm{neg}),为0时,两者不相似.

随后在实体间进行交叉注意力计算,这个也比较常见,不再展开.

2.4 变量重组路由(Variate Reassembly Router)

为精准还原每个变量专属的时序轨迹,Falcon-X 采用请求 - 分发机制,从统一原型空间定向检索信息,映射回各实体原始物理维度m_i.

形式化定义:对每个实体e_i,基于其原始输入张量,通过三组独立线性投影生成路由所需组件:

各组件作用说明:

  1. 路由请求\boldsymbol{R}^i_\mathrm{req}:相当于实体身份标识,承载原始变量独有的时序轨迹特征;
  2. 原型索引\boldsymbol{P}^i_\mathrm{idx}:全局原型库的可寻址索引表,用于从源上下文\boldsymbol{S}^i_\mathrm{ctx} 中选择性提取精炼语义信息;

该重构方案不做稠密 Token 级交互,而是通过带缩放点积的软性路由运算完成重建:每个变量会动态分配自身表征至一组潜在原型,公式为:

这样就从实体间原型空间信息表示转为m维度的实体间原型信息表示.再跟原始时序嵌入进行动态融合

该结构的优势:在变量弱相关场景下,有效抑制跨变量语义干扰;在变量强相关场景中,充分利用变量间依赖关系提升建模效果。

2.5 输出环节

这个就没什么好说的,进行分位数的损失函数学习,其预测再通过逆标准化(也比较常规).


三、实验结果与性能优势

3.1 数据集使用

1. 预训练数据(大规模异构混合)
  • 来源:融合 GIFT-Eval、Chronos、QuitoBench 等公开时序数据集,外加大量合成单变量 / 多变量数据
  • 合成数据设计
    • 单变量:混合不同频率 / 趋势 / 季节性信号。
    • 多变量:按依赖关系分组,注入瞬时 + 时序交叉变量依赖,模拟真实异构场景。
  • 规模:覆盖多领域(电力、交通、金融、天气等),支持最长 8192 步输入、480 步预测
2. 评测基准(2 个主流异构多变量榜单)GIFT-Eval(主评测)
    • 特点:高度异构,变量数 / 采样率 / 物理量差异大,含缺失值、不规则采样。
    • 指标:MASE(点预测)、CRPS(概率校准)
  1. fev-bench(泛化测试)
    • 特点:侧重长期预测、跨域迁移,部分含外生协变量。
    • 指标:同 GIFT-Eval(MASE/CRPS)。

3.2 其他算法的对比(核心结论:SOTA 级,长程更优)

对比模型涵盖主流时序基础模型(TSFM)+ 专用多变量模型Moirai 2.0、TimesFM-2.5、Chronos-2、Timer-S1、Toto-2.0、STRIDE等。

1. GIFT-Eval(主榜)
  • Falcon-XMASE=0.666,CRPS=0.453(第一)
  • 优势幅度
    • STRIDE:MASE↓1.2%
    • Toto-2.0-FT:MASE↓1.9%,CRPS↓2.2%
    • Timer-S1:MASE↓3.9%,CRPS↓6.6%。
  • 长程稳定性:短期(0.65)、中期(0.68)、长期(0.70)MASE 波动极小;Chronos-2长期 MASE 升至 0.76,退化明显。
2. fev-bench(泛化榜)
  • Falcon-XMASE=0.652,CRPS=0.490(第二),仅次于 Chronos-2(MASE=0.645),差距仅1.1%/1.0%
  • 关键优势仅用内生目标序列,无需额外历史 / 未来协变量;显著优于 TiRex、Toto-1.0、Moirai 2.0 等。
3. 核心对比结论
  • 异构建模更强潜在原型空间对齐 > 原始空间变量混合(如 Chronos-2 分组注意力、Moirai 拼接)。
  • 正负依赖更全统一原型差分注意力(UPDA)同时捕捉协同 + 拮抗关系,优于仅建模聚合效应的标准注意力。
  • 长程迁移更稳:** 潜在实体注意力(LEA)+ 变量重组路由(VRR)** 有效缓解长程误差累积。

3.3 自身消融实验(验证核心组件必要性)

1. 模块消融(核心结构)
  • 仅保留正原型(Kₚₒₛ,无 Kₙₑ₉)性能暴跌,证明负亲和力建模是异构序列交互的核心
  • 无门控残差:性能显著下降,门控机制对跨变量信息过滤、弱相关系统抗干扰至关重要。
  • 无时间戳 + 掩码:对不规则采样、缺失值鲁棒性大幅降低,显式时序 / 缺失建模不可替代。
2. 训练策略消融
  • 无变量随机洗牌:性能严重受损,随机置换迫使模型学习内容驱动而非索引依赖的关系。
  • 无灵活预测窗口:固定长度预测削弱未知 horizon 泛化能力
  • 联合训练 vs 两阶段联合训练更优,可统一时序动态 + 跨变量依赖,无需分阶段预训练 / 微调。
3. 关键参数与扩展实验
  • 上下文长度:8192 输入下性能稳定,超长序列建模能力强
  • 原型维度 C:C=64 时最优,过低欠拟合、过高过拟合
  • 推理范式:对比 Chronos-2,Falcon-X 多变量推理更鲁棒,尤其在高异构、强依赖场景。

四、关键结论与未来方向

5.1 核心结论

  • Falcon-X 通过潜在原型空间解耦 + 差分注意力,从根本上解决异构多变量时序的语义对齐复杂交互难题。
  • 统一潜在空间设计赋予模型强大零样本迁移能力,为跨领域时序建模提供通用范式。

5.2 未来研究方向

  1. 扩展至多模态时序(如文本 - 时序、图像 - 时序)融合建模。
  2. 优化原型映射效率,适配超大规模变量(数千维度)场景。
  3. 探索潜在原型的可解释性,挖掘变量间深层依赖关系。
Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐