文章目录
- 论文主要贡献
- 论文创新点
- 方法
- 逐节点零代价编码模块
- 融合贝叶斯网络的混合架构 MABN
- 贝叶斯网络模块
- 混合 Mixer 架构
- 节点分段Patchify
- LayerNorm 标准化
- 转置 Transpose
- 跨段 FFN 多层 MLP
- 转置复原 + 残差连接
- 可微排序优化:DiffKendall
- 无训练非负加权变体 ParZC†
- 实验
论文名称:ParZC: Parametric Zero-Cost Proxies for Efficient NAS
论文作者:Peijie Dong1*, Lujun Li2*, Zhenheng Tang2, Xiang Liu1, Zimian Wei3,Qiang Wang4, Xiaowen Chu1,2†
发表会议:AAAI 2025
论文主要贡献
- 提出参数化零代价代理框架 ParZC,融合节点零代价统计量自带的不确定性建模,实现自适应代理打分;
- 设计 MABN 混合贝叶斯网络架构,用于量化逐节点零代价特征的预估不确定性;同时提出 DiffKendall 损失,强化模型排序能力;
- 在 NASBench-101/201、NDS、视觉 Transformer 多类搜索空间开展完备实验,充分验证 ParZC 对比现有方法的优越性。
论文创新点
- 指出传统零代价 NAS 的同质化假设缺陷,实验证明节点贡献随深度差异巨大;
- 提出 ParZC 参数化零代价代理框架,设计 MABN 建模节点非线性关联与预测不确定性;
- 发明 DiffKendall 可微排序损失,直接优化架构排序匹配度;
方法
逐节点零代价编码模块
不同节点、不同零代价代理的统计量数值量级差距极大,本文采用最小 - 最大归一化缓解特征尺度失衡、降低条件数,归一化公式:
σ ( z k ( N ( m ) ) ) : = z k ( N ( m ) ) − min ( z k ( N ( m ) ) ) max ( z k ( N ( m ) ) ) − min ( z k ( N ( m ) ) ) \sigma\left(z_k\left(N^{(m)}\right)\right):=\frac{z_k\left(N^{(m)}\right)-\min\left(z_k\left(N^{(m)}\right)\right)}{\max\left(z_k\left(N^{(m)}\right)\right)-\min\left(z_k\left(N^{(m)}\right)\right)}σ(zk(N(m))):=max(zk(N(m)))−min(zk(N(m)))zk(N(m))−min(zk(N(m)))
式中:
- z k z_kzk:第k kk种节点级零代价代理,将单节点统计量映射为实数;
- N ( m ) N^{(m)}N(m):搜索空间中第m mm个网络;
- z k ( N ( m ) ) ∈ R L z_k\left(N^{(m)}\right)\in \mathbb{R}^Lzk(N(m))∈RL:代表该网络全部L LL个节点的代理统计量;
- σ \sigmaσ:最小 - 最大缩放,将所有特征归一至同一区间,保障后续模型训练稳定。
融合贝叶斯网络的混合架构 MABN
本文提出 MABN 架构,嵌入概率关系显式建模零代价统计量的预估不确定性。
贝叶斯网络模块
零成本代理指标是网络随机初始化、仅单批次前传反传算出的统计量,每次采样波动大;浅层 / 深层节点的 ZC 指标估算误差不同,传统 MLP/GCN 把权重当成固定单点数值,完全忽略预测不确定性。贝叶斯模块为每个节点特征输出概率分布,自动学习不同节点的置信度,Kendall 排序相关性显著提升。
权重服从高斯分布:
W b ∼ N ( μ , σ 2 ) W_b \sim \mathcal{N}(\mu,\sigma^2)Wb∼N(μ,σ2)
贝叶斯权重通过重参数化表达为:
W b = μ + log ( 1 + e ρ ) ⋅ ϵ W_b = \mu + \log(1+e^\rho) \cdot \epsilonWb=μ+log(1+eρ)⋅ϵ
式中:
μ \muμ:权重分布均值(对应传统网络权重);
ρ \rhoρ:对数方差参数,采用log ( 1 + e ρ ) \log(1+e^\rho)log(1+eρ)(softplus 函数)保证标准差恒大于 0;
ϵ ∼ N ( 0 , I ) \epsilon \sim \mathcal{N}(0,I)ϵ∼N(0,I):标准正态分布采样噪声。
可靠的节点分段:方差σ \sigmaσ更小,权重稳定,对模型的贡献被放大;
噪声大、可靠性低的节点分段:方差σ \sigmaσ更大,权重波动剧烈,模型会自动降低其影响力。
混合 Mixer 架构
传统MLP只能单独处理单个节点,GCN只能和直接相连邻居交换信息,都不能使深层节点和浅层节点相连。
核心目的:把网络浅层、中层、深层节点的零代价特征互相融合,让模型自动学到「深层节点对性能预测更重要」,从结构上打破同质化假设。
节点分段Patchify
在送入Mixer模块前,先执行分块操作:
将网络全部算子节点依据深度(最长数据流路径)进行分组,切分为S SS个分段(Patch):
- Patch1:浅层节点
- Patch2:中层节点
- PatchS _SS:深层节点
输入张量维度:批次 × 架构数 × 分段数 × 单段特征维度
- 每一行:对应一组深浅节点的整体特征
- 每一列:对应当前分段内的ZC特征通道
LayerNorm 标准化
对贝叶斯模块输出的分段特征做归一化,消除数值波动,稳定后续 MLP 训练。
转置 Transpose
交换张量两个维度完成维度变换:
[ N , S , L ] → [ N , S ′ , L ] [N,S,L] \rightarrow [N,S',L][N,S,L]→[N,S′,L]
意义:原本一段一段隔开的浅层 / 中层 / 深层 Patch,现在全部摊开到同一维度,MLP 可以一次性读取所有深浅分段,实现跨层信息交互。
跨段 FFN 多层 MLP
MLP 会同时读取 Patch1(浅层)、Patch2(中层)、Patch3(深层)全部数据;
模型通过梯度自动学习权重:深层 Patch 的特征对最终打分贡献更大,浅层 Patch 贡献更小;
自动捕捉深浅节点之间非线性关联:比如浅层卷积 + 深层卷积组合对精度的联合影响。
转置复原 + 残差连接
再次 T 转置,把张量恢复为[N,S,L]原始形状;
残差 Skip:把最开始贝叶斯输入的原始分段特征,直接加到 MLP 输出上。
作用:缓解深层网络梯度消失,保留原始节点有效信息。
可微排序优化:DiffKendall
设计了一种新的肯德尔系数,使其可微,能参与梯度下降
本文提出 DiffKendall,采用带超参数α \alphaα的 Sigmoid 函数平滑原始肯德尔τ \tauτ中不可微的符号函数:
σ α ( Δ ) = sigmoid ( α Δ ) − sigmoid ( − α Δ ) \sigma_\alpha(\Delta) = \text{sigmoid}(\alpha\Delta) - \text{sigmoid}(-\alpha\Delta)σα(Δ)=sigmoid(αΔ)−sigmoid(−αΔ)
可微近似肯德尔τ \tauτ损失定义如下:
τ d = − 1 ( L 2 ) ∑ i ≠ j σ α ( Δ x i j ) ⋅ σ α ( Δ y i j ) \tau_d = -\frac{1}{\binom{L}{2}} \sum_{i \ne j} \sigma_\alpha(\Delta x_{ij}) \cdot \sigma_\alpha(\Delta y_{ij})τd=−(2L)1i=j∑σα(Δxij)⋅σα(Δyij)
式中:
- ( L 2 ) \binom{L}{2}(2L):全部架构配对总数量;
- Δ x i j = x i − x j \Delta x_{ij} = x_i - x_jΔxij=xi−xj:预测分数的样本配对差值;
- Δ y i j = y i − y j \Delta y_{ij} = y_i - y_jΔyij=yi−yj:真实精度的样本配对差值。
相较于仅随机抽取少量配对的成对排序损失,DiffKendall 遍历全部样本配对,能够完整捕捉序列整体排序一致性。
无训练非负加权变体 ParZC†
受MABN学习得到的节点重要性分布启发,本文设计一种无训练加权策略,可直接适配任意现有零代价代理,稳定提升排序性能。
采用正弦加权函数保证权重非负、变化平滑无突变,第i ii个节点的权重计算公式:
w i = sin ( 0.5 × i 2 ) + 1 w_i = \sin\left(\frac{0.5 \times i}{2}\right) + 1wi=sin(20.5×i)+1
该权重取值范围固定在0 ∼ 2 0 \sim 20∼2,无需额外参数优化,轻量化适配各类零代价代理指标。
实验
个人声明
本文为作者对原论文的学习笔记与心得分享,受个人学识与理解所限,文中对论文内容的解读或有不够周全之处,一切以原论文正式表述为准。本文仅用于学术交流与传播,内容均由作者独立整理完成,不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议,请及时与作者联系,作者将在第一时间核实并妥善处理。