SIFT 的变体与发展

📅 2026/7/20 16:06:05 👁️ 阅读次数 📝 编程学习
SIFT 的变体与发展

在前两篇的内容里我们已经知道:从 DoG 尺度空间开始,到关键点检测、亚像素定位、方向分配,再到 128 维描述子的构建和最终匹配,SIFT 建立了一套完整且高度系统化的局部特征提取管道。解决了局部特征中的多个核心问题,如尺度不变性、旋转不变性和一定程度上的光照变化鲁棒性等。

直今,SIFT 依然是评价局部特征算法的重要基准之一。

但没有完美的算法,随着应用场景越来越复杂,人们发现 SIFT 仍然存在一些明显的不足:

问题 影响
计算速度较慢 难以满足实时视觉任务
描述子维度较高(128维) 存储和匹配开销较大
对大视角变化支持有限 大倾角拍摄时匹配性能下降
没有充分利用颜色、多光谱等信息 在特殊数据上表现受限
自然,在 SIFT 提出后的二十多年里,大量研究工作开始围绕这些问题不断改进,并提出变体和新算法。

基于这些,本篇内容围绕以下问题展开:

SIFT 的变体是否像其他领域一样将 SIFT 这样的起点算法完全取代?特征检测算法是否有了新的突破?DL 盛行的当下,SIFT 现代价值是怎么样的?

为了较清晰地回答这些问题,可以大致将后续发展分为以下四类:

让 SIFT 更快。
让 SIFT 的描述能力更强、匹配更加准确。
让 SIFT 能适应更多特殊应用场景。
深度学习方法。
前三类工作虽然采用的方法各不相同,但都没有脱离 SIFT 的整体框架。
真正改变这一领域发展方向的还是最后的深度学习时代:以数据驱动的逻辑重新设计特征检测与匹配算法。

6de0a39a-18cf-446c-9491-6ec5449054e0.png

  1. 第一条路线:让 SIFT 更快#
    那一大串复杂的算法管道让 SIFT 精度有了保障,在很长一段时间里,它一直都是局部特征匹配精度的标杆。

但相应地,SIFT 的计算速度也限制了它的广泛应用:它几乎每一步都需要大量计算,这些操作共同带来了较大的计算开销。

对于图像拼接而言,这样的速度通常还能接受,因为拼接更关注最终精度。
但对于另外一些视觉任务,例如视频实时处理、机器人定位、自动驾驶等领域,算法往往需要达到几十帧甚至上百帧每秒(FPS)的处理速度。

此时,SIFT 的计算量就成为最大的瓶颈。改进想法自然出现:

能否保留 SIFT 的整体思想,尝试把那些计算最耗时的部分换成更简单、更快速的实现?

SURF,就是围绕这个问题诞生的。

2.1 SURF:用近似计算换取速度#
2006 年,论文 SURF: Speeded Up Robust Features 提出了 SURF,它的目标十分直接:

在尽量保持 SIFT 匹配性能的前提下,大幅提高计算速度。

SURF 几乎保留了 SIFT 的整个处理流程,但在每一个计算量最大的地方,都寻找了一种更加高效的替代方案。

先摆个表格整体来看,二者的对应关系如下:

SIFT SURF
DoG 检测器 Hessian 行列式
高斯卷积 Box Filter(箱式滤波)
梯度计算 Haar 小波响应
128维描述子 64维描述子
下面来简要展开一下:

2.2 Box Filter 和积分图#
SIFT 为了计算 LoG,需要不断进行高斯卷积,高斯卷积虽然精确,但卷积核越大,计算量也越大。

于是 SURF 采用了一种更简单的近似方法:Box Filter(箱式滤波器)。

8341caac-b7c3-4beb-b272-f8f27fe482f8.png

如图所示,Box Filter 其实就是用了更简单的权重取代高斯核。
这样,SURF 不再需要像 SIFT 那样不断建立高斯金字塔,而是直接通过改变滤波器尺寸来模拟不同尺度。

而与其搭配使用的是一种数据结构:积分图(Integral Image),它本质上是一张累加表:

8b71ab02-ccac-41bd-aea6-7d3e0e50683e.png

同样如图,积分图和 Box Filter 的配合起到了如下作用:

任意矩形区域内的像素和,都可以通过四次加减运算直接得到。配合 Box Filter 的简化权重,可以让卷积不再逐个加权求和,而是通过常数级的计算构建金字塔。

这是整个算法能够加速的基础。

2.2 进一步简化描述子#
除去对检测器的加速外,SURF 对描述子的计算也进行了简化。

SIFT 在每个子区域统计多个方向的梯度直方图,最终得到 128 维描述子。
而 SURF 则采用 Haar 小波响应(其实就是差分),只统计四个统计量:

cda1ecd8-b4c1-416d-bf4e-014100c4d4fd.png

这样,最终描述子维度变为了 64 维,后续匹配速度进一步提高。

经过这一系列近似替换,SURF 在保持较高匹配性能的同时,大幅降低了计算复杂度,在典型情况下,比 SIFT 约快 2~5 倍 。
但实际加速比例会受到图像规模、特征点数量以及具体实现方式等因素影响,因此不同实验中的速度提升并不存在统一数值。

  1. 第二条路线:让描述子更精确#
    SURF 解决了 SIFT 的速度问题。

但研究者们很快便发现了新的优化空间:SIFT 使用 128 维梯度直方图获取的描述子信息丰富,区分能力强,但带来了两个问题:

维度较高: 需要更大的存储开销和更慢的匹配速度。
各维度的重要性并不完全相同: 有些方向上的梯度特别强,而另一些方向虽然较弱,却同样包含着有价值的信息。
于是便有了另一种优化思路:

能不能保持 SIFT 检测器不变,只改描述子本身的获取逻辑来提升精度?

随后几年,大量工作开始围绕描述子展开。

3.1 RootSIFT:改动最小,收益最大#
2012 年,论文 Three things everyone should know to improve object retrieval 提出的 RootSIFT 是一个改动极小的变体,它唯一修改的,仅仅是最后一步:描述子的归一化方式。

SIFT 在得到描述子以后,会进行 L2 归一化:

这样可以减弱整体亮度变化带来的影响。

但研究者发现,仅使用 L2 归一化仍然存在一个问题:
假设某个方向上的梯度特别强,欧氏距离会更多关注最大的那个数值,80 与 79 的差异往往比 3 与 1 的差异更加影响最终距离。
但对于局部特征来说,那些较小的梯度方向,同样可能包含着重要的信息。

于是,RootSIFT 把最后一步改成了少见的 L1 归一化后再开平方:

整个改动,就只有这一行公式,但它在多个公开数据集上,都获得了约 10%~20% 的匹配精度提升。

其逻辑可以这么理解:

RootSIFT 会削弱那些特别大的梯度响应,让原本较弱的方向拥有更多的话语权,这样,描述子的各个维度能够更加均衡地参与匹配。

最终,RootSIFT 几乎不增加任何额外计算,却能够显著提升匹配效果,因此被认为是"性价比最高"的 SIFT 改进之一,在许多工程实践中已经成为默认配置。

3.2 PCA-SIFT:更精简的描述子#
除了提高精度,还有另一部分研究者提出了一个问题:

128 维描述子中是否存在冗余?

还是图像数据的偏置:相邻方向之间、相邻网格之间,本身就存在较强相关性。
因此,128 维之间并不是完全独立的,能不能把这些重复的信息压缩掉?

04 年,论文 PCA-SIFT: A More Distinctive Representation for Local Image Descriptors 提出了 PCA-SIFT,显然,其关键技术是我们之前展开过的 PCA。

但其改进了 PCA 的使用思路,做法是这样的:

对大量训练图像提取 SIFT 描述子组成矩阵进行 PCA,取最终结果中固定维度的主成分组成投影矩阵,对之后新的描述子直接使用该投影矩阵降维。

0ecd47a5-833a-412a-a7ce-834e311355c3.png

这么做是因为如果两张图各自 PCA,那么同一个点投影以后就在不同坐标系,描述子无法比较,所以必须都用同一个 PCA。

直观来看这样不仅减少了存储空间,也提高了匹配速度。
但由于 PCA 投影矩阵需要提前训练,让其泛用性较低:自然图像训练得到的投影矩阵,未必适用于遥感图像;可见光训练得到的模型,也未必适用于高光谱图像。

因此,PCA-SIFT 虽然理论出色,但实际应用远没有 RootSIFT 广泛。

3.3 GLOH:重新设计描述子#
此外,还有一部分工作,则没有选择修改归一化方式,也没有选择降维,而是重新设计描述子的空间结构。

其中比较具有代表性的是 05 年的论文 **A Performance Evaluation of Local Descriptors 提出的 GLOH(Gradient Location and Orientation Histogram),其采用 极坐标划分同心圆后统计方向 的方式生成描述子:

109342a5-a8a0-406b-b77b-805153d27013.png

这种结构更加符合图像中局部区域的几何分布,因此理论上能够表达更多空间信息。

但这也意味着更复杂的计算,而且最终 GLOH 仍然需要利用 PCA 再次降到 128 维。
虽然实验结果表明,它的描述能力略优于 SIFT,但是提升并不算明显,而实现复杂度却增加了不少。
因此,这类方法更多还是停留在学术研究中。

  1. 第三条路线:让 SIFT 适应更多场景#
    经过前面的改进,SIFT 的速度越来越快,描述子也越来越成熟。

但在不断实验中,研究者们发现 SIFT 还存在一点局限:它的不变性其实是有限的,当两张图像之间存在较大的拍摄角度变化,比如无人机俯视拍摄或者手持相机斜拍建筑时,SIFT 的匹配性能会明显下降。

因为这些情况下,同一个物体在图像中的形状已经发生了明显拉伸。
这种变化已经不再是简单的旋转或缩放,而属于仿射变换(Affine Transformation) 的范畴了:

一种介于刚体变换(只允许平移和旋转,保持长度与角度)和更一般的投影变换之间的几何模型,能够很好地描述许多实际拍摄场景中的局部形变,是计算机视觉中应用最广泛的变换模型之一。

7ee88804-eda0-4771-8a9a-17e56c02f33d.png