本文面向当前 Fine-tune + Recency 版本,系统说明 Recency 的设计目标、数学原理。


1. 设计目标

在实时流失预测里,我们希望模型满足两点:

  1. 对近期行为变化更敏感(干预后能更快下调风险)。
  2. 仍保持严格因果(预测时不看未来)。

传统做法通常是直接用最后一步特征 h_t 做分类:logit_k = head_k(h_t)
这会把历史信息都压缩到单点表示里,近期与久远历史难以显式区分。

Recency 的核心改造是:

  • 不再只看 h_t
  • 对前缀 h_1...h_t 做“带时间偏置的加权汇聚”。
  • 每个 horizon (K25/K50/K100) 各自学习一套“近期偏好强度”。

2. 总体流程(从输入到输出)

给定观测到第 t 步的序列:

  1. 先经因果卷积主干得到每步隐状态 h_1...h_t
  2. 对每个 horizon k,计算每个历史步 i<=t 的权重 a_{t,k,i}
  3. 用这些权重做加权和,得到 horizon 专属表示 c_{t,k}
  4. 各 horizon 头分别输出 logit。

形式上:

ct,k=∑i≤tat,k,ihi,logitt,k=headk(ct,k) c_{t,k}=\sum_{i\le t} a_{t,k,i}h_i,\quad \text{logit}_{t,k}=head_k(c_{t,k}) ct,k=itat,k,ihi,logitt,k=headk(ct,k)


3. 数学原理

3.1 内容分数(content score)

对于第 i 步、horizon k

sk,i=wk⊤hi+bk s_{k,i}=w_k^\top h_i+b_k sk,i=wkhi+bk

这里 w_k,b_kscore_proj 学习,表示“该步内容本身对 horizon k 的重要性”。

3.2 时间偏置(recency bias)

定义 horizon 专属参数:

γk=softplus(rawk)≥0 \gamma_k=\text{softplus}(\text{raw}_k)\ge 0 γk=softplus(rawk)0

然后把时间索引偏置加到分数里:

s~k,i=sk,i+γk⋅i \tilde{s}_{k,i}=s_{k,i}+\gamma_k\cdot i s~k,i=sk,i+γki

在固定 t 的前缀 softmax 中,上式等价于:

s~k,i=sk,i−γk(t−i)+const(t) \tilde{s}_{k,i}=s_{k,i}-\gamma_k(t-i)+\text{const}(t) s~k,i=sk,iγk(ti)+const(t)

常数项在 softmax 里会抵消,所以本质是:

  • 距当前越远(t-i 越大)惩罚越大;
  • \gamma_k 越大,近期偏好越强。

3.3 前缀归一化权重

只在 i\le t 的前缀里做归一化:

at,k,i=exp⁡(s~k,i)∑j≤texp⁡(s~k,j) a_{t,k,i}=\frac{\exp(\tilde{s}_{k,i})} {\sum_{j\le t}\exp(\tilde{s}_{k,j})} at,k,i=jtexp(s~k,j)exp(s~k,i)

这就是最终的 Recency 权重。


4. 为什么实现是严格因果

因果性来自两层保证:

  1. 主干是因果卷积h_t 仅依赖 x_{\le t}
  2. 池化是前缀池化a_{t,k,i} 只在 i<=t 上归一化,且实现用 cumsum 逐步累积,不会引入未来步。

因此在评估时即使一次性喂整段序列,取第 t 步输出时仍是因果的。


5. 训练时 gamma 如何被学习

gamma_k 与预测损失联合训练:

  • 若近期特征对降低损失有帮助,梯度会推动 gamma_k 变大;
  • 若近期信号不稳定,梯度会抑制 gamma_k 增长;
  • 最终不同 horizon 会形成不同的时间敏感度。

经验上:

  • 短 horizon(如 K25)更容易学出较强近期偏置;
  • 但如果启用过早,可能导致短序列排序失真,因此需要 min_obs 保护。

6. 与标准 Self-Attention 的区别

Recency 不是标准 QK^T 注意力,主要区别:

  1. 没有显式 query-key 两两交互(更轻量)。
  2. 权重由“内容打分 + 时间偏置”构成。
  3. 用前缀累积实现,复杂度与在线场景更友好。

它更像“带可学习时间衰减的前缀池化”。


7. 业务意义:为什么能“更快遗忘旧风险”

干预后若近期行为改善,Recency 会把更多权重放到新近步,早期高风险片段权重下降。
这不是删除历史,而是按时间距离重分配证据贡献。

因此它实现的是“可控遗忘”,不是“无记忆”。


8. 一句话总结

Recency 的本质是:
在严格因果前提下,把“前缀历史”从单点读取升级为“按时间距离可学习重加权”的 horizon 专属读取机制。
它解决的是“信息如何读”的问题,不是“主干如何编码”的替代。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐