ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

AAAI|2025|ParZC:面向高效神经网络架构搜索的参数化零代价代理

AAAI|2025|ParZC:面向高效神经网络架构搜索的参数化零代价代理

文章目录

    • 论文主要贡献
    • 论文创新点
    • 方法
      • 逐节点零代价编码模块
      • 融合贝叶斯网络的混合架构 MABN
        • 贝叶斯网络模块
        • 混合 Mixer 架构
          • 节点分段Patchify
          • LayerNorm 标准化
          • 转置 Transpose
          • 跨段 FFN 多层 MLP
          • 转置复原 + 残差连接
      • 可微排序优化:DiffKendall
      • 无训练非负加权变体 ParZC†
    • 实验

论文名称:ParZC: Parametric Zero-Cost Proxies for Efficient NAS
论文作者:Peijie Dong1*, Lujun Li2*, Zhenheng Tang2, Xiang Liu1, Zimian Wei3,Qiang Wang4, Xiaowen Chu1,2†
发表会议:AAAI 2025

论文主要贡献

  • 提出参数化零代价代理框架 ParZC,融合节点零代价统计量自带的不确定性建模,实现自适应代理打分;
  • 设计 MABN 混合贝叶斯网络架构,用于量化逐节点零代价特征的预估不确定性;同时提出 DiffKendall 损失,强化模型排序能力;
  • 在 NASBench-101/201、NDS、视觉 Transformer 多类搜索空间开展完备实验,充分验证 ParZC 对比现有方法的优越性。

论文创新点

  • 指出传统零代价 NAS 的同质化假设缺陷,实验证明节点贡献随深度差异巨大;
  • 提出 ParZC 参数化零代价代理框架,设计 MABN 建模节点非线性关联与预测不确定性;
  • 发明 DiffKendall 可微排序损失,直接优化架构排序匹配度;

方法

逐节点零代价编码模块

不同节点、不同零代价代理的统计量数值量级差距极大,本文采用最小 - 最大归一化缓解特征尺度失衡、降低条件数,归一化公式:

σ ( z k ( N ( m ) ) ) : = z k ( N ( m ) ) − min ⁡ ( z k ( N ( m ) ) ) max ⁡ ( z k ( N ( m ) ) ) − min ⁡ ( z k ( N ( m ) ) ) \sigma\left(z_k\left(N^{(m)}\right)\right):=\frac{z_k\left(N^{(m)}\right)-\min\left(z_k\left(N^{(m)}\right)\right)}{\max\left(z_k\left(N^{(m)}\right)\right)-\min\left(z_k\left(N^{(m)}\right)\right)}σ(zk(N(m))):=max(zk(N(m)))min(zk(N(m)))zk(N(m))min(zk(N(m)))

式中:

  • z k z_kzk:第k kk种节点级零代价代理,将单节点统计量映射为实数;
  • N ( m ) N^{(m)}N(m):搜索空间中第m mm个网络;
  • z k ( N ( m ) ) ∈ R L z_k\left(N^{(m)}\right)\in \mathbb{R}^Lzk(N(m))RL:代表该网络全部L LL个节点的代理统计量;
  • σ \sigmaσ:最小 - 最大缩放,将所有特征归一至同一区间,保障后续模型训练稳定。

融合贝叶斯网络的混合架构 MABN

本文提出 MABN 架构,嵌入概率关系显式建模零代价统计量的预估不确定性。

贝叶斯网络模块

零成本代理指标是网络随机初始化、仅单批次前传反传算出的统计量,每次采样波动大;浅层 / 深层节点的 ZC 指标估算误差不同,传统 MLP/GCN 把权重当成固定单点数值,完全忽略预测不确定性。贝叶斯模块为每个节点特征输出概率分布,自动学习不同节点的置信度,Kendall 排序相关性显著提升。

权重服从高斯分布:
W b ∼ N ( μ , σ 2 ) W_b \sim \mathcal{N}(\mu,\sigma^2)WbN(μ,σ2)
贝叶斯权重通过重参数化表达为:
W b = μ + log ⁡ ( 1 + e ρ ) ⋅ ϵ W_b = \mu + \log(1+e^\rho) \cdot \epsilonWb=μ+log(1+eρ)ϵ

式中:
μ \muμ:权重分布均值(对应传统网络权重);
ρ \rhoρ:对数方差参数,采用log ⁡ ( 1 + e ρ ) \log(1+e^\rho)log(1+eρ)(softplus 函数)保证标准差恒大于 0;
ϵ ∼ N ( 0 , I ) \epsilon \sim \mathcal{N}(0,I)ϵN(0,I):标准正态分布采样噪声。

可靠的节点分段:方差σ \sigmaσ更小,权重稳定,对模型的贡献被放大;
噪声大、可靠性低的节点分段:方差σ \sigmaσ更大,权重波动剧烈,模型会自动降低其影响力。

混合 Mixer 架构

传统MLP只能单独处理单个节点,GCN只能和直接相连邻居交换信息,都不能使深层节点和浅层节点相连。

核心目的:把网络浅层、中层、深层节点的零代价特征互相融合,让模型自动学到「深层节点对性能预测更重要」,从结构上打破同质化假设。

节点分段Patchify

在送入Mixer模块前,先执行分块操作:
将网络全部算子节点依据深度(最长数据流路径)进行分组,切分为S SS个分段(Patch):

  • Patch1:浅层节点
  • Patch2:中层节点
  • PatchS _SS:深层节点

输入张量维度:批次 × 架构数 × 分段数 × 单段特征维度

  • 每一行:对应一组深浅节点的整体特征
  • 每一列:对应当前分段内的ZC特征通道
LayerNorm 标准化

对贝叶斯模块输出的分段特征做归一化,消除数值波动,稳定后续 MLP 训练。

转置 Transpose

交换张量两个维度完成维度变换:
[ N , S , L ] → [ N , S ′ , L ] [N,S,L] \rightarrow [N,S',L][N,S,L][N,S,L]

意义:原本一段一段隔开的浅层 / 中层 / 深层 Patch,现在全部摊开到同一维度,MLP 可以一次性读取所有深浅分段,实现跨层信息交互。

跨段 FFN 多层 MLP

MLP 会同时读取 Patch1(浅层)、Patch2(中层)、Patch3(深层)全部数据;
模型通过梯度自动学习权重:深层 Patch 的特征对最终打分贡献更大,浅层 Patch 贡献更小;
自动捕捉深浅节点之间非线性关联:比如浅层卷积 + 深层卷积组合对精度的联合影响。

转置复原 + 残差连接

再次 T 转置,把张量恢复为[N,S,L]原始形状;
残差 Skip:把最开始贝叶斯输入的原始分段特征,直接加到 MLP 输出上。
作用:缓解深层网络梯度消失,保留原始节点有效信息。

可微排序优化:DiffKendall

设计了一种新的肯德尔系数,使其可微,能参与梯度下降
本文提出 DiffKendall,采用带超参数α \alphaα的 Sigmoid 函数平滑原始肯德尔τ \tauτ中不可微的符号函数:
σ α ( Δ ) = sigmoid ( α Δ ) − sigmoid ( − α Δ ) \sigma_\alpha(\Delta) = \text{sigmoid}(\alpha\Delta) - \text{sigmoid}(-\alpha\Delta)σα(Δ)=sigmoid(αΔ)sigmoid(αΔ)

可微近似肯德尔τ \tauτ损失定义如下:
τ d = − 1 ( L 2 ) ∑ i ≠ j σ α ( Δ x i j ) ⋅ σ α ( Δ y i j ) \tau_d = -\frac{1}{\binom{L}{2}} \sum_{i \ne j} \sigma_\alpha(\Delta x_{ij}) \cdot \sigma_\alpha(\Delta y_{ij})τd=(2L)1i=jσα(Δxij)σα(Δyij)

式中:

  • ( L 2 ) \binom{L}{2}(2L):全部架构配对总数量;
  • Δ x i j = x i − x j \Delta x_{ij} = x_i - x_jΔxij=xixj:预测分数的样本配对差值;
  • Δ y i j = y i − y j \Delta y_{ij} = y_i - y_jΔyij=yiyj:真实精度的样本配对差值。

相较于仅随机抽取少量配对的成对排序损失,DiffKendall 遍历全部样本配对,能够完整捕捉序列整体排序一致性。

无训练非负加权变体 ParZC†

受MABN学习得到的节点重要性分布启发,本文设计一种无训练加权策略,可直接适配任意现有零代价代理,稳定提升排序性能。

采用正弦加权函数保证权重非负、变化平滑无突变,第i ii个节点的权重计算公式:
w i = sin ⁡ ( 0.5 × i 2 ) + 1 w_i = \sin\left(\frac{0.5 \times i}{2}\right) + 1wi=sin(20.5×i)+1

该权重取值范围固定在0 ∼ 2 0 \sim 202,无需额外参数优化,轻量化适配各类零代价代理指标。

实验

个人声明
本文为作者对原论文的学习笔记与心得分享,受个人学识与理解所限,文中对论文内容的解读或有不够周全之处,一切以原论文正式表述为准。本文仅用于学术交流与传播,内容均由作者独立整理完成,不代表本公众号立场。如文中所涉文字、图片等内容存在版权争议,请及时与作者联系,作者将在第一时间核实并妥善处理。

返回列表