1.论文信息

  • 论文标题:InTrain: Intrinsic Trainability for Zero-Cost Neural Architecture Search

  • 论文作者:Qinqin Zhou, Fuhai Chen, Jipeng Wu, Zhiwei Chen, Zhikai Hu, Weiwei Cai

  • 发表会议:CVPR 2026

2.论文主要贡献

传统 NAS 方法需要将数千个候选架构完整训练至收敛状态,计算成本极高,往往需要耗费数千 GPU 工时。为突破这一算力瓶颈,免训练型 NAS 评估指标零代价指标)应运而生。这类方法无需执行模型优化流程,即可预判架构性能,将评估成本降低了数个数量级。

现阶段主流零代价指标基于激活值统计特征、梯度特性、网络表达能力、神经元多样性等不同角度设计方案。尽管这类方法效果可观,但存在根本性缺陷:仅依靠孤立的经验规则设计指标,没有从本质上探究架构可训练性的底层逻辑,且只关注梯度幅值、激活方差等表象特征,而非决定可训练性的核心架构属性

本文三大核心贡献:

  • 本章基于信息几何与动态系统理论,提出固有可训练性,将其作为衡量网络原生优化能力的核心架构属性,并从前向、反向双向信息传递角度完成量化建模,区别于依赖优化算法、超参数的经验可训练性仅由网络拓扑结构与初始化参数决定
  • 提出 InTrain 方法,通过几何表征能力优化鲁棒性两大维度建模固有可训练性,并采用尺度不变的乘法交互模式完成融合。

几何表征能力:架构需要具备充足能力,以表达复杂的高维函数。本文采用参与率(PR)量化该能力,用于衡量激活特征流形的有效维度。若网络特征表征发生坍缩(参与率过低),则无法拟合复杂任务。

优化鲁棒性:架构需保证梯度能够稳定传播,以此解决梯度消失、梯度爆炸问题。

核心观点:几何表征能力与优化鲁棒性为乘法耦合关系,优化鲁棒性相当于表征能力的 “门控单元”。

  • 在 NAS-Bench-101、NAS-Bench-201 等主流基准上取得优异效果,证明本文理论落地后,实际性能可对标结构复杂的集成类方法。
    在这里插入图片描述

3.论文创新点

我们将网络可训练性建模为几何表征能力与优化鲁棒性的乘法耦合结果:

  • 借助逐层激活协方差的参与率,衡量信息分布的均匀度,量化几何表征能力;

  • 依靠梯度方差 - 最大值比值构建梯度健康度,量化优化鲁棒性;

  • 相较于传统零代价指标,InTrain 不仅预测精度高、计算效率优,还能逐层诊断网络的表征瓶颈与梯度问题,可解释性更强,为架构筛选提供了更丰富的参考依据。

4.方法

4.1 理论基础

深度神经网络是层级化的信息处理器:前向传播中,输入数据经过多层非线性映射,逐步生成抽象特征;反向传播中,误差信号沿着参数空间逆向传递,实现梯度下降优化。
一个具备可训练性的架构,必须同时满足两大条件:拥有充足的几何表征能力以拟合复杂函数,具备可靠的优化鲁棒性以保证梯度有效传播。
本文设定三条设计准则,作为量化固有可训练性的依据:

  • 深度不变性:保证不同深度的架构可以公平对比。层数更多的网络天然具备更强的表征能力,因此需要结合拓扑复杂度做归一化处理

  • 组合性:契合深度学习的层级特性。信息在层间以乘法形式传递,任意一层出现信息瓶颈,都会限制后续所有层的处理能力,因此指标适合采用对数乘积聚合,而非简单算术累加。

  • 双向性:前向传播与反向传播同等重要,建模时必须同时兼顾两者。

遵循以上准则,我们分别量化几何表征能力 γ ( A ) \gamma(A) γ(A) 与优化鲁棒性 o ( A ) o(A) o(A),最终通过乘法融合得到固有可训练性 I ( A ) I(A) I(A)

4.2 基于参与率的几何表征能力

前向传播会将输入数据映射为一系列特征流形。对于第 ℓ \ell 层网络,激活矩阵 A ℓ ∈ R N × C A_\ell \in \mathbb{R}^{N \times C} ARN×C N N N 为样本数, C C C 为通道数)可看作特征空间 R C \mathbb{R}^C RC 中的点集。该点集的有效维度直接决定单层网络的表征能力,我们通过分析激活值的协方差结构实现量化。

协方差矩阵 C ℓ C_\ell C 能够捕捉激活值的二阶统计特征,其特征谱可直观反映方差在各维度上的分布情况:若方差全部集中在单一特征模态中,说明该层信息发生坍缩;若特征谱分布均匀,则代表信息在多个通道中完整保留。传统矩阵秩等指标存在局限 —— 它对所有非零奇异值一视同仁,无法体现方差分布的均匀程度。因此本文选用 参与率(PR) 作为有效维度的衡量标准。

参与率(有效维度计算)

设协方差矩阵 C ℓ C_{\ell} C 的特征值为 { λ i } i = 1 C \{\lambda_i\}_{i=1}^{C} {λi}i=1C,参与率计算公式如下:
P R ( C ℓ ) = ( T r C ℓ ) 2 T r ( C ℓ 2 ) = ( ∑ i = 1 C λ i ) 2 ∑ i = 1 C λ i 2 PR(C_{\ell}) = \frac{\big(\mathrm{Tr}C_{\ell}\big)^2}{\mathrm{Tr}(C_{\ell}^2)} = \frac{\left(\sum_{i=1}^{C}\lambda_i\right)^2}{\sum_{i=1}^{C}\lambda_i^2} PR(C)=Tr(C2)(TrC)2=i=1Cλi2(i=1Cλi)2

参与率与二阶雷尼熵存在数学关联:令归一化特征值 p i = λ i / ∑ j λ j p_i=\lambda_i/\sum_j\lambda_j pi=λi/jλj,则
P R = 1 ∑ i p i 2 = exp ⁡ ( H 2 ) PR = \frac{1}{\sum_i p_i^2} = \exp(H_2) PR=ipi21=exp(H2)
其中 H 2 H_2 H2 为二阶雷尼熵。从信息论角度可解释为:参与率越高,代表方差分散在更多维度中,信息保留越完整。

多层特征聚合

网络为层级化结构,信息逐层传递,某一层参与率过低特征坍缩)会形成瓶颈,限制后续所有层的表征能力。基于组合性准则,我们对单层参与率做对数乘积聚合,最终得到全网几何表征能力 γ ( A ) \gamma(A) γ(A)
γ ( A ) = ∑ ℓ = 1 L log ⁡ ( P R ( C ℓ ) ) \gamma(A) = \sum_{\ell=1}^{L} \log\big(PR(C_{\ell})\big) γ(A)==1Llog(PR(C))
其中 L L L 为网络总层数。

协方差矩阵计算方式

输入批次数据 X ∈ R N × D X\in\mathbb{R}^{N\times D} XRN×D,逐层提取激活张量 A ℓ A_{\ell} A
卷积层激活维度为 ( N , C , H , W ) (N,C,H,W) (N,C,H,W),我们将其重塑为 ( N ⋅ H ⋅ W , C ) (N\cdot H\cdot W,C) (NHW,C),把所有空间位置视作额外样本,沿通道维度计算协方差(符合“通道对应独立特征”的定义)。

逐层中心化协方差矩阵公式:
C ℓ = 1 N eff ( A ℓ − A ˉ ℓ ) ⊤ ( A ℓ − A ˉ ℓ ) + ϵ I C_{\ell} = \frac{1}{N_{\text{eff}}} \left(A_{\ell}-\bar{A}_{\ell}\right)^{\top} \left(A_{\ell}-\bar{A}_{\ell}\right) +\epsilon I C=Neff1(AAˉ)(AAˉ)+ϵI

式中:
A ˉ ℓ \bar{A}_{\ell} Aˉ 为该层激活均值;卷积层的有效样本数 N eff = N ⋅ H ⋅ W N_{\text{eff}}=N\cdot H\cdot W Neff=NHW
I I I 为单位矩阵;
ϵ = 10 − 10 \epsilon=10^{-10} ϵ=1010,用于数值稳定,避免矩阵奇异,同时不会影响正常矩阵的特征谱。

4.3 基于梯度健康度的优化鲁棒性

几何表征能力决定网络“能表达什么”,而优化鲁棒性决定网络“能否被训练”。即便网络表达能力极强,若梯度存在异常,也无法完成训练。本节通过梯度分析评估优化鲁棒性。

梯度异常与稳定性

梯度消失、梯度爆炸是深度学习长期存在的核心难题:梯度消失会导致浅层参数几乎无法更新,网络无法学习长距离依赖;梯度爆炸则会让参数更新失控,训练彻底失稳。两类问题的根源均在于反向传播的乘法传递特性:第 ℓ \ell 层的梯度由后续所有层雅可比矩阵的乘积决定。

残差连接、批归一化等经典结构可缓解该问题,但在架构搜索场景中,候选架构拓扑随机,无法预设这类优化结构。因此我们需要一种通用指标,在不依赖特定架构设计的前提下,量化梯度健康状态。

方差 - 最大值比值(梯度健康指标)

针对单个参数 θ i \theta_i θi,损失对该参数的梯度 ∇ θ i L \nabla_{\theta_i} L θiL 反映参数对损失的影响程度。健康的梯度应满足:梯度幅值在各分量上分布均匀,整体幅值处于稳定区间。本文设计梯度健康度指标:
h ( θ i ) = min ⁡ ( 1 ,    σ ( ∇ θ i ) max ⁡ ( ∣ ∇ θ i ∣ ) + ϵ ) h(\theta_i) = \min\left(1,\;\frac{\sigma(\nabla_{\theta_i})}{\max(|\nabla_{\theta_i}|)+\epsilon}\right) h(θi)=min(1,max(θi)+ϵσ(θi))
式中:
σ ( ⋅ ) \sigma(\cdot) σ() 代表梯度分量的标准差;
ϵ = 10 − 10 \epsilon=10^{-10} ϵ=1010 防止除零错误。

该指标含义:
比值越高,代表梯度幅值分布越均衡,参数各分量贡献相近,优化过程更稳定;
比值越低,代表梯度集中在少量分量上,优化存在隐患;
上限设为 1,避免异常值干扰,同时统一指标取值范围。

该指标与多任务学习中的梯度冲突研究逻辑相通:梯度相对最大值的方差越大,代表参数各分量梯度方向多样性越强,对应优化条件更优良。

全网优化鲁棒性聚合

与几何表征能力的“瓶颈式传递”不同,优化鲁棒性属于并行累加属性:全网的梯度更新能力是所有独立参数通路的总和,不会被单个劣质参数完全限制。因此我们对所有参数的梯度健康度做累加聚合,得到全网优化鲁棒性 o ( A ) o(A) o(A)
o ( A ) = ∑ i = 1 ∣ Θ ∣ h ( θ i ) o(A) = \sum_{i=1}^{|\Theta|} h(\theta_i) o(A)=i=1∣Θ∣h(θi)
其中 ∣ Θ ∣ |\Theta| ∣Θ∣ 为网络总参数量。该累加结果可理解为:网络容纳稳定梯度更新的总“容量”,每个健康参数都会为该容量贡献分值。

合成损失函数设计

计算梯度需要损失函数,为剥离数据集分布对梯度的干扰,仅探究架构本身的梯度特性,本文采用虚拟输入 + 随机标签方案:

合成输入批次: X X X 服从标准高斯分布 N ( 0 , 1 ) \mathcal{N}(0,1) N(0,1)
合成目标标签: t t t 服从均匀分布 U ( 0 , C ) \mathcal{U}(0,C) U(0,C) C C C 为输出类别数)。

根据任务类型选用不同合成损失,保证梯度流经网络所有通路:

  • 分类任务(输出维度 K > 1 K>1 K>1):随机生成类别标签,使用交叉熵损失:
    L C = − ∑ n , k I [ t n = k ] log ⁡ y n k \mathcal{L}_C = -\sum_{n,k} \mathbb{I}[t_n=k] \log y_{nk} LC=n,kI[tn=k]logynk
  • 空间输出任务(如分割,输出维度 ( N , K , H ′ , W ′ ) (N,K,H',W') (N,K,H,W)):生成同维度随机张量,使用均方误差损失:
    L M = ∥ y − t ∥ 2 \mathcal{L}_M = \|y - t\|^2 LM=yt2

该设计无需真实标签与任务专属损失函数,核心目的不是评估模型精度,而是探测架构原生的梯度传播规律。随机信号可充分激活网络所有通路,暴露架构层面的梯度缺陷。

4.4 固有可训练性最终计算

完成几何表征能力 γ ( A ) \gamma(A) γ(A) 与优化鲁棒性 o ( A ) o(A) o(A) 的量化后,我们分析二者的耦合关系,并给出固有可训练性的最终公式。

乘法门控假设

我们提出核心假设表征能力与优化鲁棒性并非相互独立,而是通过乘法门控机制交互。两种极端场景可验证该逻辑:

  • 几何表征能力极强,但优化鲁棒性趋近于 0:网络拥有强大表达能力,但梯度无法正常传播,训练完全失效;
  • 优化鲁棒性极强,但几何表征能力趋近于退化:梯度传播稳定,但网络只能拟合简单映射,无实际价值。

由此可见:单一维度的优势无法弥补另一维度的缺陷。加法融合会错误判定“单维失效、单维优异”的架构具备中等可训练性,而乘法融合能够精准体现二者的门控关系。

公式与归一化处理

架构 A A A 的固有可训练性最终公式:
I ( A ) = γ ( A ) × ( 1 + o ( A ) ) log ⁡ ( L + 1 ) I(A) = \frac{\gamma(A) \times \big(1 + o(A)\big)}{\log(L+1)} I(A)=log(L+1)γ(A)×(1+o(A))

各模块解释:

  • 1 + o ( A ) 1+o(A) 1+o(A):保证优化鲁棒性取值恒为正,规避 o = 0 o=0 o=0 时整体结果为 0 的退化情况,同时保留原有的比例关系;
  • log ⁡ ( L + 1 ) \log(L+1) log(L+1):基于网络层数 L L L 做对数归一化,实现深度不变性。几何能力与优化鲁棒性会随层数增加而上升,直接除以层数会过度削弱深层网络的合理优势;对数形式契合网络信息处理能力随层数亚线性增长的规律,同时让不同深度的架构可公平对比。

5.实验分析

本章全面验证 InTrain 的排序准确性,以及在完整 NAS 流程中的实用性。依次介绍实验基准、实现细节、主流基准结果、MobileNetV2 搜索空间结果,最后通过消融实验拆解各模块作用。

5.1. 实验数据

选用三大经典 NAS 测试空间:NAS-Bench-101、NAS-Bench-201、MobileNetV2;
测试数据集包含 CIFAR-10、CIFAR-100、ImageNet16-120、ImageNet-1K。
对比 ZiCo、Synflow、Grad_norm、Zen-score、VKDNW_single、Jacov 等主流零代价 NAS 指标,以及 AZ-NAS 集成方法、DARTS 等传统可微 NAS。
完整搜索流程:将 InTrain 嵌入进化搜索框架,命名为 InTrain-NAS;超参数配置遵循进化 NAS 领域通用规范。
统一采用斯皮尔曼 SPR、肯德尔 KT衡量指标排序与真实模型精度的匹配度

5.2. 基准数据集排序对比结果

NAS-Bench-101:InTrain 的 KT=0.56、SPR=0.75,全面优于参数量、FLOPs 及各类单一流派零代价指标。

NAS-Bench-201:在 CIFAR-10/100、ImageNet 三个数据集上 KT 均超 0.66、SPR 超 0.85;雷达图直观显示 InTrain 在全部 6 个评测维度(3 数据集 ×2 评估系数)轮廓最外,综合性能强于所有单一基线指标,比肩集成式 AZ-NAS,跨数据集波动极小、稳定性遥遥领先。

MobileNetV2 大规模真实场景:在 450M/600M/1000M FLOPs 算力约束下,InTrain-NAS 搜索出的网络 ImageNet-1K Top1 精度分别达 78.9%、79.9%、81.3%,同算力下性能最优,整体搜索仅消耗 0.4GPU 天,算力开销极低。
在这里插入图片描述
在这里插入图片描述

在这里插入图片描述

5.3. 消融实验验证模块合理性

融合方式消融:单独使用几何表征(参与率)或梯度鲁棒性(梯度健康度)效果有限;两模块简单相加后性能反而下降;乘法耦合的完整 InTrain 效果最优,证实表征能力与优化鲁棒性是门控协同、非独立叠加关系。
输入鲁棒性测试:高斯合成输入表现最佳;输入分辨率在 32–128 区间对结果影响微弱;常量输入会破坏协方差计算,不可采用;仅依靠合成虚拟数据即可稳定评估,无需真实样本。
在这里插入图片描述
在这里插入图片描述

5.4. 整体实验结论

InTrain 凭借前向几何表征 + 反向梯度鲁棒性的双维度乘法建模,在多基准、多数据集下排序预测精度全面领先主流单一零代价指标;嵌入进化搜索得到的 InTrain-NAS 能以极低算力产出高精度轻量化网络;消融实验完整支撑论文固有可训练性的理论设计逻辑,方法鲁棒性与实用性兼备。

6.个人声明

本文为作者对原论文的学习笔记与心得分享,受个人学识与理解所限,文中对论文内容的解读或有不够周全之处,一切以原论文正式表述为准。本文仅用于学术交流与传播,内容均由作者独立整理完成,不代表本公众号立场。
如文中所涉文字、图片等内容存在版权争议,请及时与作者联系,作者将在第一时间核实并妥善处理

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐