三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

医学论文解读-CartiMorph: A framework for automated knee articular cartilage morphometrics

医学论文解读-CartiMorph: A framework for automated knee articular cartilage morphometrics

期刊:Medical Image Analysis

年份:2024

英文题目:Semi-supervised medical image classification via distance correlation minimization and graph attention regularization

中文译为:基于距离相关性最小化与图注意力正则化的半监督医学图像分类

一、摘要

医学影像深度学习通常需要大量由临床专家标注的数据,但医学影像标注存在下面的系列问题:

  • 成本高;
  • 耗时长;
  • 需要专业医生;
  • 数据隐私与伦理限制;

现实情况通常是:少量 labeled data+大量 unlabeled data

因此作者提出一种新的:Semi-Supervised Learning,半监督学习方法。

论文的核心有两个部分。

第一:Distance Correlation Minimization

对于同一张未标注医学图像,作者首先做两种不同的数据增强,然后分别送入两个相互独立、不共享参数的深度神经网络:,得到两套特征,随后计算,距离相关性,并将其最小化。

目的不是强迫两套特征一样,而恰恰相反,是减少两个特征空间之间的redundant information,即冗余信息。让两个网络从同一张图像中学习:

不同但互补的医学影像特征。


第二:Graph-Attention Regularization

作者进一步认为:

一张医学图像不能只单独看,它和其他患者影像之间本身存在潜在关系。

例如:

  • 相似病理;
  • 相似组织结构;
  • 相似影像表现;
  • 相似异常模式。

因此作者把一个batch中的未标注样本构造成:Graph

同一个图像经过两种增强以后,会形成两套图结构: Rf​和: Rg​

作者要求: Rf​≈Rg​

也就是说:

即使同一批医学图像经过不同增强,样本之间的内在关系应该基本保持一致。

从而进一步利用未标注数据。

最终实验覆盖:

  • X-ray;
  • dermoscopy;
  • CT;
  • MRI;

四种医学影像场景,并且在多个标注预算下,与多种半监督方法相比取得了较有竞争力的结果。

二、创新点

创新点一:首次将距离相关性最小化用于医学影像半监督分类

已有很多半监督方法采用:Prediction Consistency

例如:

同一张图经过不同增强以后,分类结果应该一致。

或者采用:Pseudo Label,利用模型预测结果作为未标注数据的标签。

但这些方法都有问题。

例如伪标签容易出现:Confirmation Bias

即:

模型一开始预测错了,错误标签又继续拿来训练模型,导致错误越来越强化。

Mean Teacher等方法又可能因为Teacher和Student参数高度耦合,导致:

两个网络缺乏足够的功能多样性。

因此作者没有强迫两个网络: Prediction A​=Prediction B​

而是在:Feature Space上做文章。

作者提出:

让同一张图不同增强视图产生的两个特征空间尽可能减少统计依赖。

距离相关性的优势在于:

不仅能够检测线性关系,也能够检测非线性关系。

这一点非常适合DNN,因为深度网络本身就是: Nonlinear Transformation

创新点二:提出基于图注意力的未标注样本关系正则化

作者认为仅仅做特征去相关还不够。未标注医学图像之间实际上具有:Relational Information

例如两个膝关节MRI可能都存在:

  • ACL异常;
  • 半月板异常;
  • 相似骨结构;
  • 类似组织信号。

这些相似性本身也是非常有价值的信息。

因此作者建立:图,每个节点对应一个未标注样本。

作者不提前人为定义:

“哪两张图片应该连接”。

而是:所有节点先连接

再通过:GAT(Graph Attention Network)

自动学习: Attention(i,j)

即:

第 i 个样本应该多大程度关注第 j 个样本。

然后要求同一批图像在两个不同增强视图下: Rf​和: Rg​的样本关系保持一致。

因此它学习的是: Instance−to−instance relation​,而不是简单利用单个图像。

创新点三:不依赖伪标签,也不需要Teacher–Student参数耦合

这也是论文和很多SSL方法的重要区别。它没有:Pseudo Label,所以避免了严重的:confirmation bias。

同时两个网络: f(⋅)和: g(⋅)参数是: θ和: ϕ两套独立参数。

不是: Teacher=EMA(Student)

因此作者把它称为:non-coupled DNN architectures

即:

两个网络结构可以相同,也可以不同,而且参数独立更新。

这样理论上能够保持更强的:representation diversity即表示多样性

三、方法

这篇论文的方法可以看成三个Loss:

分别对应:

  1. 有标签数据分类监督;
  2. 未标注数据特征去相关;
  3. 未标注数据图关系一致性。

作者对未标注数据生成两个不同视图,论文主要采用:RandAugment

包括:

  • Brightness;
  • AutoContrast;
  • Equalize;
  • Invert;
  • Rotate;
  • Posterize;
  • Solarize;
  • Contrast;
  • Sharpness;
  • Shear;
  • Translate;

之后将增强的图像和标签图像一起送入两个分支,对有标签数据的分类预测,对未标注样本的进行距离相关性和图正则化约束。

3.1 Distance Correlation

对于未标注样本,两个网络得到:X和: Z。

作者计算不同样本之间的特征距离:

然后经过双中心化得到:

进一步计算:Distance Covariance

然后归一化得到:

其范围: 0≤≤1。

其中:≈1

说明两个特征空间:

高度相关、包含大量重复信息。

而:≈0

说明:

两个特征空间之间依赖较小。

所以训练目标是: min

为什么这里是“最小化相关性”而不是“最大化一致性”

这是这篇论文最容易让人疑惑的地方。通常SSL会说:

同一张图不同增强应该得到相似表示。

但是本文认为:

如果两个网络最后学习到完全相同的东西,就产生了大量冗余信息。

例如两个网络都只学:

  • 灰度强弱;
  • 某个固定组织纹理;

但忽略其他信息。

作者希望:

网络A可能更加关注:Texture

网络B可能更加关注: Structure或者: Pathological Pattern

因此: X和: Z之间不应该完全重复。

所以这里的思想更接近:Feature Decorrelation / Redundancy Reduction

而不是传统的consistency。

3.2 构建未标注样本图

然后作者把X看作一个图​,把: Z看作另外一个图

每个:或者:就是一个节点。

所有节点先全部连接: Fully Connected Graph。

因此不需要事先知道:

哪两个病人是同一类。

分别使用Graph Attention Network学习样本关系和:

  • 对于节点i和 j
  • 计算注意力:
  • 再经过Softmax得到:
  • 这个值表示:
    样本 i 和样本 j 在当前特征空间中有多强的关系。
  • 最终形成:两张注意力关系矩阵。

虽然作者希望X和 Z本身不要太冗余,

但它们对于:“哪些患者彼此相似”的判断应该保持稳定。

例如同一batch中:

  • Patient A和Patient C非常相似;
  • Patient B和Patient D比较相似;

这种关系不应该因为图像亮度或旋转发生变化。

因此作者要求:​。利用Cross-Entropy定义:

3.3 总损失

最终:

其中论文实验设置λ=0.4。

所以三部分分别承担:

  • Lcls​学习:疾病类别。
  • Ldc​减少:两个网络特征的冗余。
  • Lgr​保持:未标注样本之间的关系一致。

所以最终形成一种很有意思的组合:Feature Representation不同,​但Data Relationship:一致​

可以把它理解成:

两个网络可以从不同角度理解同一批患者,但对“哪些患者彼此相似”的认识应该一致。

训练的时候需要:

  • 两个DNN;
  • 两个GAT;
  • Distance Correlation;
  • Graph regularization。

但是测试的时候:全部不需要。

训练结束后,作者只选择:validation表现最好的那个DNN backbone用于最终分类。

因此:Training:2DNN+2GAT

但是: Inference:1DNN

所以GAT不会给测试阶段增加额外计算开销。

四、试验

4.1 数据集

数据集模态任务
NIH-14X-ray14种胸部疾病多标签分类
ISIC 2018Dermoscopy皮肤病变7分类
COV19-CTCTCOVID阳性/阴性
Knee MRNetMRI膝关节异常分类

标注比例:

数据集模态任务
NIH-14X-ray14种胸部疾病多标签分类
ISIC 2018Dermoscopy皮肤病变7分类
COV19-CTCTCOVID阳性/阴性
Knee MRNetMRI膝关节异常分类

4.2 结果

当标注只有5%本文:75.77

明显高于监督训练: 66.26

7.5%标注本文: 79.38也是最佳。

但是当标注提高到: 15%,25%以后:NoTeacher反而超过本文。

所以作者明确指出:

SSL-DcGaR最大的优势主要体现在极少标签条件。

五、总结

本文提出SSL-DcGaR半监督医学图像分类方法,通过两个独立DNN对同一未标注图像的不同增强视图进行编码,利用距离相关性最小化减少两个特征空间中的冗余信息,同时将未标注样本构造成全连接图,并通过图注意力学习样本间关系,约束不同视图下的关系结构保持一致;最终将监督分类、特征去相关和图关系正则化联合优化,从而在仅有少量人工标注的情况下提升医学影像分类性能

← 返回列表