三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

小白程序员必看:轻松学会大模型幻觉消除法,即插即用提升效果!

小白程序员必看:轻松学会大模型幻觉消除法,即插即用提升效果!

本文介绍了一种名为DICA的对比对齐方法,用于解决多模态大模型在图像问答中的幻觉问题。作者提出模型幻觉主要由注意力漂移和视觉证据利用不足两种原因导致,设计了VAE和OIC两个诊断指标实时监测这两种异常,并针对不同异常设计了对应的纠正方法,在无需重训模型的情况下,即可在推理时即插即用,有效降低幻觉率,提升模型表现。

一句话先说结论

你让多模态大模型看图回答问题,它经常“说瞎话”——比如图里明明没有卡车,它偏说有。

云南大学团队发现:这种幻觉不是一种病,而是两种病——注意力走神和闭眼答题。他们设计了两个“体温计”实时监测,一发烧就对症下药。不用重新训练模型,推理时即插即用,效果全面碾压现有方法。

两种失败模式 + 两个诊断指标 + 两剂靶向药
= 推理时即插即用的幻觉消除器

注意力漂移(左)vs 视觉证据利用不足(右)


多模态大模型的两种“病”

以往的方法把幻觉当成一种病统一治疗,就像医生不管你是发烧还是骨折,统一开退烧药。

研究发现幻觉有两种完全不同的根因:

失败模式现象比喻
注意力漂移注意力突然从相关区域散开或跳到无关区域考试时走神看错题
视觉证据利用不足输出越来越不依赖图片,纯靠语言先验脑补闭着眼凭经验答题

两个“体温计”:实时诊断

体温计 1:VAE(视觉注意力熵)

衡量注意力有多集中。正常时随网络变深而降低;突然飙升 = 注意力散了 = 即将走神。

体温计 2:OIC(输出-图像相关性)

衡量输出有多依赖图片。正常时逐步升高;突然下降 = 开始闭眼答题 = 即将脑补。

VAE 和 OIC 随网络层的变化趋势,红点为异常

两种异常发生时的注意力热力图与答案概率曲线


两剂“靶向药”:对症下药

药方 1:VAE 引导漂移纠正(VAE-GDC)

病症:注意力散了,隐状态被高熵噪声污染。

药方:引入“描述性路径”,用其稳定的隐状态校准被污染的隐状态。力度由分布距离动态调节。

药方 2:OIC 引导接地恢复(OIC-GGR)

病症:模型不再看图,纯靠语言先验编造。

药方:找到还“记得看图”的中间层,用对比解码把输出拉回视觉证据。

DICA 整体架构


实验结果

POPE 物体存在性判断(F1,LLaVA-v1.5)

设定VCDOPERAMoDDICA
Random84.2086.9286.0088.82
Popular83.2086.6885.6087.50
Adversarial84.0083.4582.3083.67

CHAIR 幻觉率(越低越好,LLaVA-v1.5)

方法CHAIR_s ↓CHAIR_i ↓Recall ↑
VCD51.014.977.2
MoD42.612.478.9
DICA41.811.577.8

MME 综合评分(越高越好,LLaVA-v1.5)

方法存在性位置颜色总分
VCD180.0108.3133.3531.7
MoD195.0126.7175.0638.3
DICA195.0148.3175.0661.5

关键发现

注意力漂移比闭眼答题更常见

VAE-GDC 触发率 15.29%,OIC-GGR 仅 1.75%。走神是更高频病因。

两个模块互补,缺一不可

消融实验显示单独去掉任一模块都有明显退化,联合使用效果最佳。

修复极精准,几乎不误伤

正确→正确保持率 86.9%,错误→正确修复率 37.4%,误伤率仅 1.3%。

DICA 前后 VAE/OIC 变化

双模块触发频率与层分布


局限性

  1. 有额外计算开销——实时监测两个指标,延迟略增。

  2. 阈值需手调——换模型可能要重新调参。

  3. 治不了视觉编码器的盲区——编码器看不见的东西,DICA 也救不了。


为什么值得关注?

即插即用

不用重训模型,代码已开源,直接集成到现有多模态系统即可降低幻觉率。

先诊断后治疗

区分失败模式再对症下药,比一刀切更精准。思路可推广到其他模型异常检测场景。

指标可解释

VAE 和 OIC 物理意义明确,可直接作为模型输出可信度的量化依据。


多模态幻觉不是一种病,而是两种病

注意力漂移 → 走神看错
视觉证据利用不足 → 闭眼答题

DICA:实时体检 + 靶向用药
不用重训,推理即插即用


如何学习大模型 AI ?

由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。

但是具体到个人,只能说是:

“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。

这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。

我在一线科技企业深耕十二载,见证过太多因技术卡位而跃迁的案例。那些率先拥抱 AI 的同事,早已在效率与薪资上形成代际优势,我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在大模型的学习中的很多困惑。我们整理出这套AI 大模型突围资料包

  • ✅ 从零到一的 AI 学习路径图
  • ✅ 大模型调优实战手册(附医疗/金融等大厂真实案例)
  • ✅ 百度/阿里专家闭门录播课
  • ✅ 大模型当下最新行业报告
  • ✅ 真实大厂面试真题
  • ✅ 2026 最新岗位需求图谱

所有资料 ⚡️ ,朋友们如果有需要《AI大模型入门+进阶学习资源包》下方扫码获取~

① 全套AI大模型应用开发视频教程

(包含提示工程、RAG、LangChain、Agent、模型微调与部署、DeepSeek等技术点)

② 大模型系统化学习路线

作为学习AI大模型技术的新手,方向至关重要。 正确的学习路线可以为你节省时间,少走弯路;方向不对,努力白费。这里我给大家准备了一份最科学最系统的学习成长路线图和学习规划,带你从零基础入门到精通!

③ 大模型学习书籍&文档

学习AI大模型离不开书籍文档,我精选了一系列大模型技术的书籍和学习文档(电子版),它们由领域内的顶尖专家撰写,内容全面、深入、详尽,为你学习大模型提供坚实的理论基础。

④ AI大模型最新行业报告

2025最新行业报告,针对不同行业的现状、趋势、问题、机会等进行系统地调研和评估,以了解哪些行业更适合引入大模型的技术和应用,以及在哪些方面可以发挥大模型的优势。

⑤ 大模型项目实战&配套源码

学以致用,在项目实战中检验和巩固你所学到的知识,同时为你找工作就业和职业发展打下坚实的基础。

⑥ 大模型大厂面试真题

面试不仅是技术的较量,更需要充分的准备。在你已经掌握了大模型技术之后,就需要开始准备面试,我精心整理了一份大模型面试题库,涵盖当前面试中可能遇到的各种技术问题,让你在面试中游刃有余

以上资料如何领取?

为什么大家都在学大模型?

最近科技巨头英特尔宣布裁员2万人,传统岗位不断缩减,但AI相关技术岗疯狂扩招,有3-5年经验,大厂薪资就能给到50K*20薪!

不出1年,“有AI项目经验”将成为投递简历的门槛。

风口之下,与其像“温水煮青蛙”一样坐等被行业淘汰,不如先人一步,掌握AI大模型原理+应用技术+项目实操经验,“顺风”翻盘!

这些资料真的有用吗?

这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。

资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。

以上全套大模型资料如何领取?

← 返回列表