AAAI-26,用于扩散模型噪声优化的双种子进化算法

📅 2026/8/3 6:10:40 👁️ 阅读次数 📝 编程学习
AAAI-26,用于扩散模型噪声优化的双种子进化算法

目录

    • 1.摘要
    • 2.研究背景与相关工作
    • 3.扩散采样与条件引导基础
    • 3.双种子协同全局搜索
    • 4.基于引导反演的局部变异
    • 5.结果分析
    • 6.参考文献
    • 7.算法辅导·应用定制·读者交流

1.摘要

扩散模型已成为条件生成,尤其是文本到图像(T2I)主流方法,但其输出对初始噪声种子极其敏感。现有噪声优化大多依赖随机高斯采样、启发式筛选或局部调整,难以系统覆盖噪声空间,也常偏向单一评价指标。论文提出基于进化种子优化方法 SOE,把全局进化搜索与局部语义细化结合起来:用 CLIPScore 选择语义匹配最强种子,用 ImageReward 选择人类偏好最高种子,再通过退火双种子插值探索两者之间的潜在区域,并用少步扩散反演注入条件语义。

2.研究背景与相关工作

复杂组合提示词常导致目标实体缺失、属性错配和对象关系不合逻辑。注意力增强方法通常依赖 U-Net;梯度或反演方法属于局部搜索,容易受初始区域限制;将初始噪声映射为黄金噪声方法则需要针对生成模型训练额外网络。基于奖励模型的全局筛选能够生成更高质量图像,但单一评价标准往往只改善视觉质量,语义对齐提升有限。

论文据此提出双目标噪声搜索:在保持扩散先验分布的同时,让两个具有互补优势的种子共同决定搜索方向。全局阶段负责覆盖更广的噪声区域,局部阶段通过反演在有意义的语义轨迹附近细化;两者交替执行,形成不需要训练的进化式优化流程。

3.扩散采样与条件引导基础

扩散前向加噪过程可表示为

x t = α ˉ t x 0 + 1 − α ˉ t ϵ , ϵ ∼ N ( 0 , I ) . x_t=\sqrt{\bar{\alpha}_t}\,x_0+\sqrt{1-\bar{\alpha}_t}\,\epsilon,\qquad \epsilon\sim\mathcal{N}(0,I).xt=αˉtx0+1αˉtϵ,ϵN(0,I).

DDIM 通过确定性的非马尔可夫轨迹逐步将初始噪声x T x_TxT去噪为图像;DDIM Inversion 则沿相反方向把低噪声图像映射回高噪声状态,以恢复与提示词一致的初始噪声。分类器无关引导(CFG)在条件和无条件噪声预测之间插值:

ϵ ^ ( x t , t , c ) = ϵ θ ( x t , t , ∅ ) + s [ ϵ θ ( x t , t , c ) − ϵ θ ( x t , t , ∅ ) ] , \widehat{\epsilon}(x_t,t,c)=\epsilon_\theta(x_t,t,\varnothing)+s\bigl[\epsilon_\theta(x_t,t,c)-\epsilon_\theta(x_t,t,\varnothing)\bigr],ϵ(xt,t,c)=ϵθ(xt,t,)+s[ϵθ(xt,t,c)ϵθ(xt,t,)],

其中,s ss为引导尺度,c cc为文本条件。

3.双种子协同全局搜索

每轮先从标准高斯先验采样N s N_sNs个噪声向量{ x j } j = 1 N s \{x_j\}_{j=1}^{N_s}{xj}j=1Ns,分别用两个代表不同偏好的评价函数打分:R 1 R_1R1为语义相关性 CLIPScore,R 2 R_2R2为人类偏好 ImageReward。由此得到两类极值种子:

x s e m = arg ⁡ max ⁡ x j R 1 ( x j ) , x h u m = arg ⁡ max ⁡ x j R 2 ( x j ) . x_{\mathrm{sem}}=\arg\max_{x_j}R_1(x_j),\qquad x_{\mathrm{hum}}=\arg\max_{x_j}R_2(x_j).xsem=argxjmaxR1(xj),xhum=argxjmaxR2(xj).

x s e m x_{\mathrm{sem}}xsem匹配提示词语义,x h u m x_{\mathrm{hum}}xhum符合视觉偏好。为在两个极值之间探索,SOE 使用带随机扰动插值生成候选噪声:

x i = ( 1 − e i ) x s e m + e i x h u m + z 2 n i , z ∼ N ( 0 , I ) , x_i=(1-e_i)x_{\mathrm{sem}}+e_i x_{\mathrm{hum}}+\frac{z}{\sqrt{2n_i}},\qquad z\sim\mathcal{N}(0,I),xi=(1ei)xsem+eixhum+2niz,zN(0,I),

其中,e i ∈ [ 0 , 1 ] e_i\in[0,1]ei[0,1]控制插值偏向,n i n_ini为迭代编号。按噪声范数的概率密度构造目标:

L S O E = ∑ j = 1 N e log ⁡ P ( x j ) ∥ x j ∥ exp ⁡ ⁣ ( − n i − e i 2 ) , L_{\mathrm{SOE}}=\sum_{j=1}^{N_e}\log P(x_j)\,\lVert x_j\rVert\exp\!\left(-\frac{n_i-e_i}{2}\right),LSOE=j=1NelogP(xj)xjexp(2niei),

4.基于引导反演的局部变异

双种子插值负责全局探索,局部变异则通过少步 DDIM 反演实现。SOE 先用 DDIM 将选中的潜变量x T x_TxT映射到中间状态x t i n v x_{t_{\mathrm{inv}}}xtinv,再利用带引导差异的反演得到新的初始噪声,从而在语义相关轨迹附近寻找更优点。

5.结果分析

论文从 HPDv2、Pick-a-Pic 和 DrawBench 三个数据集抽取提示词,前两个各随机抽取 200 条,DrawBench 抽取 100 条。实验使用 SDv1.4、SDv2.1、SDXL 和 SDv3.5 medium;SDv1.4 与 SDv2.1 输出512 × 512 512\times512512×512图像,其余模型输出1024 × 1024 1024\times10241024×1024图像。评价指标包括 CLIPScore、ImageReward、PickScore、Aesthetic Evaluation Score(AES)和 Human Preference Score v2(HPSv2)。为综合不同指标的相对提升,定义平均增益(Average Gain,AG):

A G = ∑ i S i − S b a s e S b a s e , \mathrm{AG}=\sum_i\frac{S_i-S_{\mathrm{base}}}{S_{\mathrm{base}}},AG=iSbaseSiSbase,

其中S i S_iSi是 SOE 在第i ii个指标上的得分,S b a s e S_{\mathrm{base}}Sbase是对应基础模型得分,AG 越高表示综合改善越明显。基线包括 Vanilla SD、Whole-inversion、Z-Sampling、Zigzag、Inversion、Attention Excite、Initno、Golden noise 和 RewardSelect。

文本结果显示,SOE 在语义对齐和视觉质量上都稳定优于基线。

SOE 将扩散模型初始噪声优化表述为一种全局—局部协同进化搜索,用两个评价模型分别保留语义和人类偏好优势,通过退火式双种子插值覆盖更广噪声区域,再以少步引导反演进行局部细化,无需微调生成模型即可作为即插即用模块接入不同扩散架构。

6.参考文献

Tan Y, He Y, Zhu Y, et al. Dual-seed evolutionary algorithm for noise optimization in diffusion models[C]//Proceedings of the AAAI Conference on Artificial Intelligence. 2026, 40(11): 9341-9349.

7.算法辅导·应用定制·读者交流

xx