微软:LLM图表因果推理基准CARL-GT

📖标题:CARL-GT: Evaluating Causal Reasoning Capabilities of Large Language Models
🌐来源:arXiv, 2412.17970
🌟摘要
🔸因果推理能力对于教育和医疗保健等广泛应用中的大型语言模型(LLM)至关重要。但仍然缺乏更好地理解这些能力的基准。目前的LLM基准主要基于会话任务、学术数学测试和编码测试。这些基准在规范化的环境中评估LLM,但它们在评估解决现实世界问题的技能和能力方面受到限制。
🔸在这项工作中,我们提供了一个名为CARL-GT的基准,它使用图形和表格数据评估大型语言模型的因果推理能力1。该基准具有从因果图推理、知识发现和决策方面评估LLM的各种任务。此外,为任务开发了有效的零样本学习提示。在我们的实验中,我们利用基准来评估开源LLM,并提供LLM因果推理能力的详细比较。
🔸我们发现LLM在随意推理方面仍然很弱,尤其是在使用表格数据发现新见解方面。此外,我们通过分析LLM的性能来研究和讨论不同基准任务之间的关系。实验结果表明,LLM在不同任务上具有不同的强度,它们在不同类别的任务(即因果图推理、知识发现和决策)上的表现比同一类别的任务表现出更强的相关性。详见https://github.com/TURuibo/CauTabBench/tree/main/carl_gt
🛎️文章简介
🔸研究问题:当前大语言模型(LLM)在因果推理能力评估方面不足以解决现实问题。
🔸主要贡献:论文提出了一个名为CARL-GT的基准测试,用于全面评估LLM在因果图推理、知识发现和决策制定方面的因果推理能力。
📝重点思路
🔸基准任务设计:设计了三种类型的基准任务,分别是因果图推理、知识发现和决策制定。
🔸因果图推理:通过提供因果图,要求LLM回答关于节点邻接关系、d-分离关系和父节点的问题。
🔸知识发现:基于观测数据,要求LLM推断因果图的结构,包括邻接矩阵、d-分离关系和因果方向。
🔸决策制定:通过提供因果图和观测数据,要求LLM进行干预和反事实推理,预测干预后的变量分布和反事实结果。
🔸实验设置:使用零样本学习的方式,对多个开源LLM进行评估,并通过F1分数、AUC、准确率等指标来衡量模型的表现。
🔎分析总结
🔸因果图推理:LLM在邻接矩阵估计任务上表现较好,但在d-分离和因果方向估计任务上表现较差,尤其是因果方向估计任务最为困难。
🔸知识发现:LLM在d-分离和因果方向估计任务上表现不佳,部分模型甚至无法提供答案。
🔸决策制定:LLM在干预和反事实推理任务上的表现参差不齐,Mistral-7B在整体任务上表现较好,而Mixtral在反事实推理任务上表现最佳。
🔸任务相关性:不同任务之间的相关性较弱,尤其是干预分布估计任务与其他任务呈负相关,而反事实推理任务与其他任务呈正相关。
🔸数据规模影响:增加数据行数(从50行到100行)对LLM的表现没有显著提升,表明现有数据规模可能不足以支持更复杂的因果推理任务。
💡个人观点
论文创新性地提出了一个围绕图的因果推理基准。
🧩附录



更多推荐
所有评论(0)