【IJCAI 2025】LLM 因果发现综述论文解读:直接推断·后验修正·先验知识三大整合路径|从大模型因果推理视角

📅 发布时间:2026/8/9 1:55:06
【IJCAI 2025】LLM 因果发现综述论文解读:直接推断·后验修正·先验知识三大整合路径|从大模型因果推理视角 摘要本文解读 IJCAI 2025 Survey Track 综述论文《Large Language Models for Causal Discovery: Current Landscape and Future Directions》。该论文首次系统梳理大语言模型LLM如何变革因果发现Causal Discovery提出直接推断、后验修正、先验知识三种整合角色覆盖 40 篇方法论文与12 个基准数据集。综述指出 LLM 是不完美的领域专家知识广度大但存在预训练数据泄漏与因果鹦鹉式记忆风险LLM 与统计方法结合的混合范式如 chatPC、CMA才是当前最佳实践为因果 AI 领域提供了评测体系与未来方向的重要借鉴。视频讲解点击观看 B 站视频摘要论文基本信息背景与动机研究主线从问题到结论基准/方法设计分类全景方法细节因果序预测Pairwise Discovery全图发现与后验修正先验知识注入与 CI 检验实验设计与结果任务与评测协议基准数据集全景端到端流水线示例混淆变量与稳健性结果对比总结关键发现局限性常见问题FAQLLM 如何参与因果发现什么是因果鹦鹉LLM 因果发现和统计方法哪个更好评测 LLM 因果发现用什么指标为什么要用模拟器再生成数据Novel 基准LLM 能替代领域专家吗参考链接论文基本信息项目内容标题英文Large Language Models for Causal Discovery: Current Landscape and Future Directions标题中文LLM 时代的因果发现整合路径与未来方向作者Guangya Wan, Yunsheng Lu, Yuqi Wu, Mengxuan Hu, Sheng Li机构University of Virginia · University of Chicago · University of Alberta会议IJCAI 2025 (Survey Track)arXivhttps://arxiv.org/abs/2402.11068项目网站https://github.com/wan19990901/Causal-LLM-Paper作者维护的论文资源库背景与动机因果发现CD旨在从数据中揭示为什么发生的因果关系是科学发现与决策优化的基石但长期依赖两大支柱统计方法约束基的 PC 算法、打分基的 BIC/NOTEARS与领域专家。专家咨询成本高、周期长成为整个发现流程最严重的瓶颈。大语言模型提供了变革性的思路凭借预训练中沉淀的海量文本知识LLM 可以充当可规模化的元专家——跨领域同时提供专家级推理自动完成统计方法无法利用的语义元数据处理。综述由此提出三个整合维度直接推断LLM 仅凭变量描述文本直接输出因果结构自动化专家假设生成后验修正LLM 作为评审专家逐步缩小统计方法遗留的 Markov 等价类、纠正边方向先验知识LLM 把领域知识转化为硬约束、软正则或边概率矩阵注入传统 CD 算法。既有综述的局限Glymour 等2019的统计 CD 综述完全没有 LLM 视角Zhao 等2023首次讨论 LLM 因果推理但任务范围更广反事实、效应估计Zhang 等2024提出检索增强的因果图发现但对LLM 如何变革 CD 方法本身分析有限。本文是首个以该问题为主线的系统性综述。从历史脉络看附录 H 整合统计 CD 始于 2001 年 Spirtes 等人的 PC 算法2018 年 NOTEARS 把结构学习重写为连续优化2022–2024 年迎来 LLM 整合潮Willig 2022 奠基因果序预测chatPC / ILS-CSL / CMA 把 LLM 嵌入统计管线CausalBench 提供统一基准2024–2026 年进入医疗、基因调控、金融等领域落地阶段。研究主线从问题到结论图 6研究主线 Mermaid 流程图——专家瓶颈 → LLM 元专家 → 三角色分类法 → 统计LLM 融合 → 12 基准评测 → 混合范式最优Mermaid 流程图基准/方法设计综述的方法框架围绕 LLM 的三种功能角色展开其统一洞察是LLM 的预训练知识可以按需扮演领域专家且可规模化、跨领域复用。直接推断输入变量描述文本 $T {t_1, \dots, t_n}$LLM 输出因果语句集合 $S {(x_i, x_j)}$。含两条技术路线因果序预测Willig 2022、Kıcıman 2023Chain-of-Thought 提示与完整/部分因果图发现Long 2024、Jiralerspong 2024 图分区加速。后验修正Long 2023 用 LLM 逐步压缩 Markov 等价类控制误定向风险ILS-CSLBan 2023迭代纠正边方向CMAAbdulaal 2024结合深度结构因果模型DSCM做全局局部精化支持链图。先验知识硬约束直接删边软约束作为 BDeu/BIC 打分正则项Darvariu 2024 提出边存在/方向的概率先验chatPC 把条件独立检验$X \perp Y \mid Z$转成自然语言提示LLM 充当检验 Oracle 驱动 PC 算法。图 1LLM 用于因果发现的三种路径(a) 直接因果推断、(b) 统计结果的后期修正、(c) 为传统方法提供先验知识图源论文分类全景图 7LLM×因果发现三角色分类全景——直接推断、后验修正、先验知识及其代表方法Mermaid 分类图方法细节因果序预测Pairwise Discovery逐对查询构成独立二分类问题用准确率与 F1 评测。代表性提示词Which is more likely to be true: (A) lung cancer causes cigarette smoking, or (B) cigarette smoking causes lung cancer?。结合 Chain-of-Thought 提示系统性地从预训练知识中提取因果机制。图 2直接推断范式以自然语言查询X 是否导致 Y基础模型直接给出因果回答图源论文全图发现与后验修正全图发现中边决策相互依赖NP-完全问题逐对发现的代价随变量数二次增长Jiralerspong 2024 用图分区策略缓解。后验修正路线的代表性方法Long 2023 在给定全部条件独立关系时用 LLM 渐进减少等价类内候选结构CMA 则先由 LLM 提出初始图再拟合深度结构因果模型并迭代精化可处理多模态复杂数据。先验知识注入与 CI 检验条件独立检验是约束基 CD 的基石。chatPC 方法将X 与 Y 在给定 Z 下是否独立转化为自然语言提示LLM 的回答直接驱动 PC 算法构图。Darvariu 2024 的概率先验框架兼容任何依赖边概率矩阵的传统 CD 算法。附录 A 还给出完整提示词设计表因果验证任务要求逐步推理后输出 Valid/Invalid全图发现任务要求以边 $x_i \to x_j$ 形式输出因果图——结构化输出、概率校准与 CoT 提示直接决定 LLM 作为 CD 引擎的性能上限。图 3LLM 担任条件独立检验 Oracle 的通用流程把X 与 Y 在给定 Z 下是否独立转成自然语言提示驱动约束基算法图源论文实验设计与结果任务与评测协议因果序预测逐对查询、独立二分类Accuracy / F1全图发现边决策相互依赖NP-完全SHD结构汉明距离/ NHD归一化汉明距离评测。基准数据集全景数据集领域节点图数逐对 (Pair)全图 (Full)Asia医疗8--✓✓Insurance商业27--✓✓CauseNet网络12.2M--✓×Tübingen科学222--✓×CLADDER混合3.510,112✓✓CORR2CAUSE混合2–6207,972✓✓CausalBench混合2–10915✓✓多图基准CLADDER 10,112 图、CORR2CAUSE 207,972 图以数万到数十万张图支撑统计显著对比Novel 列用模拟器再生成数据检验 LLM 在未见因果模式上的泛化能力隔离预训练数据泄漏。端到端流水线示例图 4LLM×CD 完整流水线示例变量三元组子图 → 多数投票定边 → 平票由 GPT-4 裁决 → 因果序作为先验注入 PC/CaMML → 下游因果效应推断图源论文混淆变量与稳健性图 5混淆变量示例忽略共同原因 E运动时D 导致 WL的朴素结论不可靠——显式建模混杂是 LLM 因果问答的关键图源论文结果对比总结图 8结果对比总结——纯统计与纯 LLM 直接推断汇入混合范式精度与可扩展性均优于单侧Mermaid 流程图关键发现记忆 ≠ 推理CLADDER 分析显示LLM 在未见过的因果模式Novel 数据上性能显著下降——更多是因果鹦鹉式复述预训练知识而非真正的因果推理。数据泄漏风险直接推断易受预训练泄漏影响用模拟器再生成的 Novel 基准是公平评测的关键设计。混合范式更优LLM 提供先验/修正 统计方法负责结构搜索的组合在精度与可扩展性上优于任何单侧后验修正还能打破 Markov 等价类的不可辨识困境。扩展性瓶颈全图发现的逐对查询代价随变量数二次增长$O(n^2)$图分区与高效采样是必要缓解手段。应用快速外溢医学电子胎心监护、基因调控网络LLM4GRN、金融风险分析、因果世界模型等场景已开始落地。Oral 信号附录 C 整合从 ResearchStudio-Idea 框架看本文命中 P6 重新表述为可解对象把请教专家重构为自然语言查询 概率输出、P4 混淆隔离诊断模拟器再生成隔离泄漏、P5 统一异构输入文本元数据与观测数据统一进 LLM 查询空间三个模式属于典型的 Society 型贡献——为社区提供了分类法与评测基础设施。局限性评测协议不统一各方法缺乏标准化对比难以确立真正的 SOTA作者建议合成数据 既有基准双轨并用并标准化大图子集采样流程。可解释性存疑LLM 是因果鹦鹉还是真推理仍无定论需要控制变量的归因研究。SCM 诊断缺失LLM 目前只能判断因果边是否存在无法验证线性/非线性、函数形式、噪声分布等结构因果模型SCM属性。扩展性受限全图发现的二次查询成本以及后验修正方法在大图上的适用性均未充分验证。作者展望的三大方向领域专用 LLM 与专家智能体含 RAG、统一评测框架、SCM 属性验证。常见问题FAQLLM 如何参与因果发现三种角色直接推断LLM 仅凭变量描述文本输出因果结构、后验修正LLM 评审并纠正统计方法的结果、先验知识LLM 输出约束/概率先验注入传统算法。什么是因果鹦鹉CLADDER 等基准的 Novel 数据模拟器再生成、未见于预训练语料显示 LLM 性能显著下降说明模型更多是复述预训练中嵌入的因果知识而非进行真正的因果推理——这是目前 LLM 因果发现可信度的核心争议。LLM 因果发现和统计方法哪个更好都不是最优——混合范式如 chatPC 把条件独立检验交给 LLM、CMA 用 LLM 先验引导深度结构因果模型在精度与可扩展性上同时优于纯 LLM 与纯统计方法。评测 LLM 因果发现用什么指标因果序预测用准确率与 F1全图发现用结构汉明距离 SHD 与归一化汉明距离 NHD。基准图规模从 Asia 的 8 节点到 CauseNet 的 1200 万节点不等。为什么要用模拟器再生成数据Novel 基准LLM 预训练可能见过标准基准的因果模式造成性能虚高。用模拟器再生成数据可以隔离这种泄漏检验模型在全新因果模式上的真实泛化能力。LLM 能替代领域专家吗短期不能完全替代。LLM 是不完美的专家——广度大但深度与可信度存疑当前最佳实践是让 LLM 充当统计因果发现的补充先验与修正来源而非独立替代。参考链接arXiv 论文页https://arxiv.org/abs/2402.11068IJCAI 2025 官方 DOIhttps://doi.org/10.24963/ijcai.2025/1186作者维护的 Causal-LLM-Paper 资源库https://github.com/wan19990901/Causal-LLM-PaperCLADDER 基准Jin et al., 2023https://arxiv.org/abs/2311.09247CausalBench 基准Zhou et al., 2024https://arxiv.org/abs/2404.12544Kıcıman et al., Causal Reasoning and Large Language Modelshttps://arxiv.org/abs/2305.00028给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件