三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

【IJCAI 2025】LLM 因果发现综述论文解读:直接推断·后验修正·先验知识三大整合路径|从大模型因果推理视角

【IJCAI 2025】LLM 因果发现综述论文解读:直接推断·后验修正·先验知识三大整合路径|从大模型因果推理视角

摘要

本文解读 IJCAI 2025 Survey Track 综述论文《Large Language Models for Causal Discovery: Current Landscape and Future Directions》。该论文首次系统梳理大语言模型(LLM)如何变革因果发现(Causal Discovery),提出直接推断、后验修正、先验知识三种整合角色,覆盖 40+ 篇方法论文与12+ 个基准数据集。综述指出 LLM 是"不完美的领域专家":知识广度大但存在预训练数据泄漏与"因果鹦鹉"式记忆风险,LLM 与统计方法结合的混合范式(如 chatPC、CMA)才是当前最佳实践,为因果 AI 领域提供了评测体系与未来方向的重要借鉴。

视频讲解:点击观看 B 站视频

  • 摘要
  • 论文基本信息
  • 背景与动机
  • 研究主线:从问题到结论
  • 基准/方法设计
  • 分类全景
  • 方法细节
    • 因果序预测(Pairwise Discovery)
    • 全图发现与后验修正
    • 先验知识注入与 CI 检验
  • 实验设计与结果
    • 任务与评测协议
    • 基准数据集全景
    • 端到端流水线示例
    • 混淆变量与稳健性
  • 结果对比总结
  • 关键发现
  • 局限性
  • 常见问题(FAQ)
    • LLM 如何参与因果发现?
    • 什么是"因果鹦鹉"?
    • LLM 因果发现和统计方法哪个更好?
    • 评测 LLM 因果发现用什么指标?
    • 为什么要用模拟器再生成数据(Novel 基准)?
    • LLM 能替代领域专家吗?
  • 参考链接

论文基本信息

项目内容
标题(英文)Large Language Models for Causal Discovery: Current Landscape and Future Directions
标题(中文)LLM 时代的因果发现:整合路径与未来方向
作者Guangya Wan, Yunsheng Lu, Yuqi Wu, Mengxuan Hu, Sheng Li
机构University of Virginia · University of Chicago · University of Alberta
会议IJCAI 2025 (Survey Track)
arXivhttps://arxiv.org/abs/2402.11068
项目网站https://github.com/wan19990901/Causal-LLM-Paper(作者维护的论文资源库)

背景与动机

因果发现(CD)旨在从数据中揭示"为什么发生"的因果关系,是科学发现与决策优化的基石,但长期依赖两大支柱:统计方法(约束基的 PC 算法、打分基的 BIC/NOTEARS)与领域专家。专家咨询成本高、周期长,成为整个发现流程最严重的瓶颈。

大语言模型提供了变革性的思路:凭借预训练中沉淀的海量文本知识,LLM 可以充当可规模化的"元专家"——跨领域同时提供专家级推理,自动完成统计方法无法利用的语义元数据处理。综述由此提出三个整合维度:

  1. 直接推断:LLM 仅凭变量描述文本直接输出因果结构,自动化专家假设生成;
  2. 后验修正:LLM 作为评审专家,逐步缩小统计方法遗留的 Markov 等价类、纠正边方向;
  3. 先验知识:LLM 把领域知识转化为硬约束、软正则或边概率矩阵,注入传统 CD 算法。

既有综述的局限:Glymour 等(2019)的统计 CD 综述完全没有 LLM 视角;Zhao 等(2023)首次讨论 LLM 因果推理但任务范围更广(反事实、效应估计);Zhang 等(2024)提出检索增强的因果图发现,但对"LLM 如何变革 CD 方法本身"分析有限。本文是首个以该问题为主线的系统性综述。

从历史脉络看(附录 H 整合):统计 CD 始于 2001 年 Spirtes 等人的 PC 算法,2018 年 NOTEARS 把结构学习重写为连续优化,2022–2024 年迎来 LLM 整合潮(Willig 2022 奠基因果序预测,chatPC / ILS-CSL / CMA 把 LLM 嵌入统计管线,CausalBench 提供统一基准),2024–2026 年进入医疗、基因调控、金融等领域落地阶段。

研究主线:从问题到结论

图 6:研究主线 Mermaid 流程图——专家瓶颈 → LLM 元专家 → 三角色分类法 → 统计+LLM 融合 → 12+ 基准评测 → 混合范式最优(Mermaid 流程图)

基准/方法设计

综述的方法框架围绕 LLM 的三种功能角色展开,其统一洞察是:LLM 的预训练知识可以按需扮演领域专家,且可规模化、跨领域复用

  • 直接推断:输入变量描述文本 $T = {t_1, \dots, t_n}$,LLM 输出因果语句集合 $S = {(x_i, x_j)}$。含两条技术路线:因果序预测(Willig 2022、Kıcıman 2023,Chain-of-Thought 提示)与完整/部分因果图发现(Long 2024、Jiralerspong 2024 图分区加速)。
  • 后验修正:Long 2023 用 LLM 逐步压缩 Markov 等价类(控制误定向风险);ILS-CSL(Ban 2023)迭代纠正边方向;CMA(Abdulaal 2024)结合深度结构因果模型(DSCM)做全局+局部精化,支持链图。
  • 先验知识:硬约束直接删边;软约束作为 BDeu/BIC 打分正则项;Darvariu 2024 提出边存在/方向的概率先验;chatPC 把条件独立检验($X \perp Y \mid Z$)转成自然语言提示,LLM 充当检验 Oracle 驱动 PC 算法。

图 1:LLM 用于因果发现的三种路径:(a) 直接因果推断、(b) 统计结果的后期修正、(c) 为传统方法提供先验知识(图源论文)

分类全景

图 7:LLM×因果发现三角色分类全景——直接推断、后验修正、先验知识及其代表方法(Mermaid 分类图)

方法细节

因果序预测(Pairwise Discovery)

逐对查询构成独立二分类问题,用准确率与 F1 评测。代表性提示词:"Which is more likely to be true: (A) lung cancer causes cigarette smoking, or (B) cigarette smoking causes lung cancer?"。结合 Chain-of-Thought 提示,系统性地从预训练知识中提取因果机制。

图 2:直接推断范式:以自然语言查询"X 是否导致 Y",基础模型直接给出因果回答(图源论文)

全图发现与后验修正

全图发现中边决策相互依赖(NP-完全问题),逐对发现的代价随变量数二次增长,Jiralerspong 2024 用图分区策略缓解。后验修正路线的代表性方法:Long 2023 在给定全部条件独立关系时用 LLM 渐进减少等价类内候选结构;CMA 则先由 LLM 提出初始图,再拟合深度结构因果模型并迭代精化,可处理多模态复杂数据。

先验知识注入与 CI 检验

条件独立检验是约束基 CD 的基石。chatPC 方法将"X 与 Y 在给定 Z 下是否独立"转化为自然语言提示,LLM 的回答直接驱动 PC 算法构图。Darvariu 2024 的概率先验框架兼容任何依赖边概率矩阵的传统 CD 算法。附录 A 还给出完整提示词设计表:因果验证任务要求逐步推理后输出 Valid/Invalid,全图发现任务要求以边 $x_i \to x_j$ 形式输出因果图——结构化输出、概率校准与 CoT 提示直接决定 LLM 作为 CD 引擎的性能上限。

图 3:LLM 担任条件独立检验 Oracle 的通用流程:把"X 与 Y 在给定 Z 下是否独立"转成自然语言提示,驱动约束基算法(图源论文)

实验设计与结果

任务与评测协议

  • 因果序预测:逐对查询、独立二分类,Accuracy / F1;
  • 全图发现:边决策相互依赖(NP-完全),SHD(结构汉明距离)/ NHD(归一化汉明距离)评测。

基准数据集全景

数据集领域节点图数逐对 (Pair)全图 (Full)
Asia医疗8--
Insurance商业27--
CauseNet网络12.2M--×
Tübingen科学222--×
CLADDER混合3.510,112
CORR2CAUSE混合2–6207,972
CausalBench混合2–10915

多图基准(CLADDER 10,112 图、CORR2CAUSE 207,972 图)以数万到数十万张图支撑统计显著对比;Novel 列用模拟器再生成数据,检验 LLM 在未见因果模式上的泛化能力,隔离预训练数据泄漏。

端到端流水线示例

图 4:LLM×CD 完整流水线示例:变量三元组子图 → 多数投票定边 → 平票由 GPT-4 裁决 → 因果序作为先验注入 PC/CaMML → 下游因果效应推断(图源论文)

混淆变量与稳健性

图 5:混淆变量示例:忽略共同原因 E(运动)时,"D 导致 WL"的朴素结论不可靠——显式建模混杂是 LLM 因果问答的关键(图源论文)

结果对比总结

图 8:结果对比总结——纯统计与纯 LLM 直接推断汇入混合范式,精度与可扩展性均优于单侧(Mermaid 流程图)

关键发现

  • 记忆 ≠ 推理:CLADDER 分析显示,LLM 在未见过的因果模式(Novel 数据)上性能显著下降——更多是"因果鹦鹉"式复述预训练知识,而非真正的因果推理。
  • 数据泄漏风险:直接推断易受预训练泄漏影响;用模拟器再生成的 Novel 基准是公平评测的关键设计。
  • 混合范式更优:LLM 提供先验/修正 + 统计方法负责结构搜索的组合,在精度与可扩展性上优于任何单侧;后验修正还能打破 Markov 等价类的不可辨识困境。
  • 扩展性瓶颈:全图发现的逐对查询代价随变量数二次增长($O(n^2)$),图分区与高效采样是必要缓解手段。
  • 应用快速外溢:医学电子胎心监护、基因调控网络(LLM4GRN)、金融风险分析、因果世界模型等场景已开始落地。
  • Oral 信号(附录 C 整合):从 ResearchStudio-Idea 框架看,本文命中 P6 重新表述为可解对象(把"请教专家"重构为自然语言查询 + 概率输出)、P4 混淆隔离诊断(模拟器再生成隔离泄漏)、P5 统一异构输入(文本元数据与观测数据统一进 LLM 查询空间)三个模式,属于典型的 Society 型贡献——为社区提供了分类法与评测基础设施。

局限性

  • 评测协议不统一:各方法缺乏标准化对比,难以确立真正的 SOTA;作者建议合成数据 + 既有基准双轨并用,并标准化大图子集采样流程。
  • 可解释性存疑:LLM 是"因果鹦鹉"还是真推理仍无定论,需要控制变量的归因研究。
  • SCM 诊断缺失:LLM 目前只能判断因果边是否存在,无法验证线性/非线性、函数形式、噪声分布等结构因果模型(SCM)属性。
  • 扩展性受限:全图发现的二次查询成本,以及后验修正方法在大图上的适用性均未充分验证。

作者展望的三大方向:领域专用 LLM 与专家智能体(含 RAG)、统一评测框架、SCM 属性验证。

常见问题(FAQ)

LLM 如何参与因果发现?

三种角色:直接推断(LLM 仅凭变量描述文本输出因果结构)、后验修正(LLM 评审并纠正统计方法的结果)、先验知识(LLM 输出约束/概率先验注入传统算法)。

什么是"因果鹦鹉"?

CLADDER 等基准的 Novel 数据(模拟器再生成、未见于预训练语料)显示 LLM 性能显著下降,说明模型更多是复述预训练中嵌入的因果知识,而非进行真正的因果推理——这是目前 LLM 因果发现可信度的核心争议。

LLM 因果发现和统计方法哪个更好?

都不是最优——混合范式(如 chatPC 把条件独立检验交给 LLM、CMA 用 LLM 先验引导深度结构因果模型)在精度与可扩展性上同时优于纯 LLM 与纯统计方法。

评测 LLM 因果发现用什么指标?

因果序预测用准确率与 F1;全图发现用结构汉明距离 SHD 与归一化汉明距离 NHD。基准图规模从 Asia 的 8 节点到 CauseNet 的 1200 万节点不等。

为什么要用模拟器再生成数据(Novel 基准)?

LLM 预训练可能"见过"标准基准的因果模式,造成性能虚高。用模拟器再生成数据可以隔离这种泄漏,检验模型在全新因果模式上的真实泛化能力。

LLM 能替代领域专家吗?

短期不能完全替代。LLM 是"不完美的专家"——广度大但深度与可信度存疑;当前最佳实践是让 LLM 充当统计因果发现的补充(先验与修正来源),而非独立替代。

参考链接

  • arXiv 论文页:https://arxiv.org/abs/2402.11068
  • IJCAI 2025 官方 DOI:https://doi.org/10.24963/ijcai.2025/1186
  • 作者维护的 Causal-LLM-Paper 资源库:https://github.com/wan19990901/Causal-LLM-Paper
  • CLADDER 基准(Jin et al., 2023):https://arxiv.org/abs/2311.09247
  • CausalBench 基准(Zhou et al., 2024):https://arxiv.org/abs/2404.12544
  • Kıcıman et al., Causal Reasoning and Large Language Models:https://arxiv.org/abs/2305.00028

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

← 返回列表