【论文学习】MICCAI 2025 || Gut-VLM:面向大型视觉语言模型胃肠道图像分析的幻觉感知多模态基准
Gut-VLM
Hallucination-Aware Multimodal Benchmark for Gastrointestinal Image Analysis with Large Vision-Language Models
MICCAI 2025
Gut-VLM:面向大型视觉语言模型胃肠道图像分析的幻觉感知多模态基准
构建一个同时保留“模型错误报告、错误位置标签和专家修正报告”的胃肠镜图文数据集,并让视觉语言模型学习发现和纠正自己的幻觉。
幻觉是指:模型生成的描述看起来合理,但与图像中的真实医学内容不一致。
例如,一张正常幽门图像,模型可能生成:图像中央存在红色异常。但医学专家查看图像后认为没有这种异常,这句话就是幻觉。
医学场景下这种错误尤其危险,因为模型可能:声称存在实际上不存在的息肉;把正常组织描述为炎症;错误描述病灶颜色或位置;错误判断是否出血、感染;错误描述异物或医疗器械。
Gut-VLM数据集怎么构建:论文使用 Kvasir-v2 胃肠镜数据集中的图像,共标注了1816张
第一阶段:GPT-4o生成报告
先让 GPT-4 Omni 根据每张胃肠镜图像生成诊断性描述。
提示词要求报告覆盖12个医学问题,包括:解剖部位;解剖标志物的颜色和位置;异常区域的颜色和位置;息肉数量;是否存在炎症;是否出血;是否存在异物;是否感染;是否存在医疗器械。
得到的是未经审核的模型报告,其中可能同时包含正确句子和错误句子
第二阶段:专家识别和纠正幻觉
4名胃肠科专家逐句审查GPT-4o报告。
每个句子被标记为:Non-hallucinated:与图像一致;Hallucinated:包含与图像不一致的信息
对于错误句子,专家还需要提供正确版本。
最终,每张图像可能包含:
胃肠镜图像 ├── GPT-4o原始报告 ├── 每句话的幻觉标签 ├── 专家修正后的句子 └── 完整的专家修正报告
论文发现GPT-4o生成的报告中:
只有30.39%的报告完全正确;
1.70%的报告所有句子都包含幻觉;
67.84%的报告同时包含正确句子和错误句子。
也就是说,接近70%的报告属于这种情况:一部分内容正确 + 一部分内容错误
这比整段报告完全错误更符合真实风险。因为混合型错误看起来更可信,也更难检测。
幻觉感知微调方法:论文比较了两种训练方式
普通微调
普通方法只给模型看:
输入:医学图像 目标:专家修正后的正确报告
模型只学习“正确答案是什么”,不知道原模型曾经犯了什么错误。
幻觉感知微调
作者提出的方法输入:医学图像 + GPT生成的错误报告
要求模型分两步输出:
第一步:找出哪些句子存在幻觉; 第二步:把错误报告修正为正确报告。
模型不仅要学习正确答案,还要学习错误模式以及如何纠正错误
测试了4个开源视觉语言模型:
LLaVA-1.6-7B;
Qwen2-7B;
DeepSeek-7B-VL;
mPLUG-Owl-2B。
训练设置:
Rank-8 LoRA;
训练5轮;
batch size 8;
学习率 (1x10^{-4});
A100 GPU。
比较三种模型:
Pretrained:未经微调
Finetuned:普通正确报告微调
Finetuned-H:幻觉感知微调
摘要
视觉语言模型(Vision-Language Models,VLMs)在医学领域正变得越来越普及,它们能够弥合医学图像与临床语言之间的差距。现有VLM在理解医学图像和文本查询,并生成详细的描述性医学诊断报告方面展现出了出色的能力。
然而,幻觉问题仍然是VLM面临的一项重要挑战。这里的“幻觉”是指模型生成与图像视觉内容不一致的描述。这一问题在医学领域可能造成尤为严重的后果。
为了促进胃肠道(Gastrointestinal,GI)图像分析领域的VLM研究,并深入研究模型幻觉问题,我们构建了一个胃肠道图像—文本多模态数据集——Gut-VLM。
该数据集通过一个两阶段流程构建。首先,使用ChatGPT为Kvasir-v2数据集中的图像生成描述性医学报告。在这一过程中,ChatGPT会产生一些带有幻觉或错误内容的文本。随后,在第二阶段,由医学专家对这些报告进行系统审查,识别并纠正其中可能存在的不准确信息,从而保证数据标注具有较高的质量和临床可靠性。
与仅包含描述性文本的传统数据集不同,Gut-VLM还提供了用于标识幻觉句子的标签,以及这些错误句子所对应的修正内容。
减少VLM幻觉的一种常见方法,是在小规模、特定任务的数据集上对模型进行微调。然而,我们利用所构建的数据集采取了一种不同的策略。我们并非仅仅对VLM进行微调,使其生成医学文本报告,而是训练模型检测并纠正幻觉。我们将这种方法称为“幻觉感知微调”(hallucination-aware finetuning)。
实验结果表明,与仅针对描述性报告生成进行微调相比,幻觉感知微调能够取得更好的效果。此外,我们还使用多种评价指标,对多个当前先进的视觉语言模型进行了全面评估,从而建立了一个相应的评测基准。
GitHub代码仓库:bhattarailab/Hallucination-Aware-VLM
图一
图1:上图:数据标注流程概览;下图:[左]来自Gut- VLM 的数据样本,根据提示中提出的问题描述了底层条件,展示了幻觉文本(红色)与修正后的文本(绿色);[右]该数据集中ChatGPT-4 Omni生成响应的统计结果。
上半部分:数据标注流程
Kvasir-v2胃肠镜图像 + 医学提示词 ↓ GPT-4o生成报告 ↓ 得到可能含幻觉的描述 ↓ 胃肠科专家逐句检查 ↓ 修正后的报告 ↓ AI提取结构化诊断问答 ↓ 人工再次检查 ↓ 最终诊断问答标注
左下部分:一个具体错误案例
图像是一张正常盲肠胃肠镜图像 提示词是:请用一段文字描述该图像,并回答下面列出的所有问题 GPT-4o原始输出:这是一张正常盲肠的图像。图像中央存在一个小息肉,颜色偏黄。解剖标志物为结肠内壁,主要呈粉红色。没有观察到炎症、出血、感染、异物或医疗器械。
其中红色文字是幻觉:图像中央存在一个黄色的小息肉 但图像中实际上没有息肉。GPT-4o把正常的阑尾开口错误识别成了息肉。
另一个错误是:解剖标志物是结肠内壁,主要呈粉红色 专家认为这里的解剖标志物描述不准确
专家修正后的报告:这是一张正常盲肠的图像。图像中央可见颜色偏黄的阑尾开口。该图像的解剖标志物是盲肠。未观察到炎症、出血、感染或异物,也未发现医疗器械。图像中不存在息肉。
中下部分:12个诊断问题
GPT-4o生成报告时,需要覆盖12个问题,主要包括:
图像属于哪一种解剖结构?
图像中是否存在解剖标志物?
解剖标志物是什么颜色?
图像中是否存在异常?
如果存在异常,异常是什么颜色?
异常位于图像中的什么位置?
是否存在息肉?如果有,有多少个?
是否存在医疗器械?如果有,在哪里、有多少个?
是否存在炎症?
是否存在出血?
是否存在异物?
是否存在感染?
因此,它不是让GPT-4o自由描述,而是用固定问题约束报告内容。
右上部分:报告级统计
数据集中共有1816份GPT-4o报告。
| 报告类型 | 数量 | 比例 | 含义 |
|---|---|---|---|
| All correct | 552 | 30.39% | 所有句子均正确 |
| Hallucinated | 32 | 约1.76% | 所有句子都包含幻觉 |
| Mixed Responses | 1232 | 67.84% | 同时包含正确和错误句子 |
重要的发现:只有约30%的报告完全正确,约68%的报告是“正确信息与错误信息混合”。
混合型错误最危险,因为整篇报告不是明显胡说,而是:大部分内容正确 + 少数医学事实错误
右下部分:不同医学属性的准确率
柱状图表示GPT-4o在不同类型问题上的准确率,大致为:
解剖类别:约50%,最低;
异常或解剖标志物的颜色:约85%;
位置:约90%;
医学表现,如炎症、出血、感染:约90%;
息肉数量:约80%。
这说明错误不是均匀分布的:GPT-4o对颜色、位置和部分医学表现判断较好,但对具体解剖类别的识别明显较差。