可解释人工智能(XAI)是人工智能的一个研究领域,致力于让人们理解计算系统的行为、输出及局限。它既涵盖运行机制可供直接审查的模型,也涵盖用于解释不透明系统的技术。在机器学习中,解释可以指出影响较大的输入、描述决策规则,或展示不同输入会如何改变预测。解释必须与具有说服力的辩护区分开来:易于理解,并不意味着准确反映了系统的运行机制。(nvlpubs.nist.gov)
范围与概念区分
可理解性(interpretability)与可解释性(explainability)有所重叠,但不同研究群体对它们的定义并不一致。可理解性通常关注人能否理解模型的结构或行为;可解释性则通常关注能否为输出提供理由或证据。两者都取决于受众和任务。调查错误的开发者、审查系统的审计人员,以及受某项决策影响的人,可能需要不同的信息。(nvlpubs.nist.gov)
一个核心区分是内在可解释模型与事后解释之间的区别。小型决策树学习模型、稀疏规则列表,以及受到适当约束的线性回归模型,可以直接呈现其预测机制。事后解释方法则分析已经训练好的模型,但未必能使其完整的运行过程变得易于理解。复杂度是重要因素:规模很大的决策树,或包含大量变换后变量的线性模型,仍可能难以理解。并不存在一条普遍规律,认为预测准确率越高,可解释性就必然越低。(nature.com)
解释还可以分为针对单次预测的局部解释,以及描述模型在众多输入下的行为的全局解释。局部解释并不能证明同样的关系在所有情形下都成立。模型无关方法通过输入和输出来开展分析,而模型特定技术则利用内部结构或可获取的导数等性质。(arxiv.org)
主要方法
局部替代模型。 LIME于2016年提出,使用较简单的解释模型,在选定输入附近对原模型进行近似。它生成经过扰动的样本,获取预测结果,再拟合一个可理解的近似模型,并赋予更接近待解释输入的样本更高权重。由此得到的解释是局部的;其有效性取决于采样邻域、可理解的表示方式,以及替代模型与原模型的一致程度。(arxiv.org)
特征归因。 归因方法将一次预测或预测差异分配给各个输入特征。SHAP于2017年提出,借鉴博弈论中的夏普利值,为加性解释提供了一个框架。特征被视为参与者,相对于指定的参照,各自对预测作出贡献。归因结果取决于如何表示缺失特征和背景数据,因此这些数值并不是脱离具体情境的特征重要性度量。(proceedings.neurips.cc)
基于梯度的解释。 对于可微的人工神经网络,梯度衡量的是输出对输入的局部敏感程度。积分梯度沿着从基线输入到实际输入的路径累积梯度。这一方法围绕归因的形式化要求而设计,包括敏感性和实现不变性。其解释仍取决于所选的基线和输出量。应用领域包括计算机视觉和自然语言处理。(proceedings.mlr.press)
反事实解释。 反事实解释指出,对输入作出哪些改变会使模型产生不同的结果。例如,一则示例性解释可以说明,需要作出什么改变,才能让预测跨过某个分类阈值。这类解释不必揭示完整的模型。不过,它们描述的是模型中的一种替代情形,并不保证相应的现实行动可行,或会产生同样的结果。(arxiv.org)
评估与可靠性
美国国家标准与技术研究院在2021年的报告中提出了四项原则:解释、有意义性、解释准确性和知识边界。它们分别要求提供理由或证据、让目标受众能够理解解释、正确反映生成输出的过程,以及识别系统能够正常发挥作用的条件范围。解释准确性不同于预测准确性:错误的预测可以得到忠实的解释,而正确的预测也可能附带误导性的解释。(nvlpubs.nist.gov)
因此,评估不能仅看可视化是否美观或用户是否满意。研究人员会检验解释是否确实依赖于学习到的参数和训练数据,以及是否能反映模型行为的相关变化。在2018年的论文《显著性图的合理性检验》中,使用随机化参数和标签的实验表明,一些视觉上颇具说服力的方法,对其本应解释的性质并不敏感。因此,看似合理的热力图不足以证明解释具有忠实性。(papers.nips.cc)
以人为中心的评估关注解释是否能帮助人们完成特定任务,例如识别不可靠的预测,或在不同模型之间作出选择。LIME最初的实验考察了这些用途,而不是仅凭视觉吸引力来衡量解释质量。其目标是在充分知情的基础上合理依赖模型,而不只是增强信任。(arxiv.org)
用途与局限
解释可用于支持模型调试、检查和错误分析。它们有助于揭示模型是否依赖了非预期的线索,并厘清候选系统之间的差异。然而,近似模型可能遗漏重要行为,而对模型依赖关系的解释,本身并不能确立现实世界中的因果关系。内在可解释模型和事后解释提供了了解决策机制的不同途径,不应将两者视为可以互换。(arxiv.org)
对于大语言模型而言,流畅的语言解释带来了一个特殊的可靠性问题。有关思维链提示的研究表明,在某些情况下,提示中诱发偏差的特征影响了答案,却未在随附的解释中得到承认。因此,模型生成的推理文本可以作为有用的研究材料,但并不构成对答案生成过程的、经过验证的计算描述。评估解释的忠实性,需要模型自身描述之外的证据。(arxiv.org)
参考来源
- Four Principles of Explainable Artificial Intelligencenvlpubs.nist.gov
- Stop explaining black box machine learning models for high stakes decisions and use interpretable models insteadnature.com
- "Why Should I Trust You?": Explaining the Predictions of Any Classifierarxiv.org
- A Unified Approach to Interpreting Model Predictionsproceedings.neurips.cc
- Axiomatic Attribution for Deep Networksproceedings.mlr.press
- Counterfactual Explanations without Opening the Black Box: Automated Decisions and the GDPRarxiv.org
- Sanity Checks for Saliency Mapspapers.nips.cc
- Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Promptingarxiv.org