可复现性是指在指定条件下重复执行研究程序时,获得一致结果的能力。它使证据、方法与结论之间的关系能够接受独立检验,从而支撑科学方法。这一概念在不同学科中的含义有所不同。在计算研究中,可复现性通常指使用原始数据、代码和分析程序获得一致结果;使用新收集的数据重复开展实验,通常则被区分为重复验证。无论是复现还是重复验证,单凭其本身都无法证明某项结论正确,也无法证明该结论适用于原始研究情境之外的情境。(nationalacademies.org)
术语与范围
美国国家科学院、工程院和医学院于2019年发布的报告《科学中的可复现性与可重复验证性》,明确区分了计算可复现性与可重复验证性。可复现性涉及相同的输入数据和计算方法,而可重复验证性涉及使用独立收集的数据研究同一个科学问题。可推广性则关注研究发现是否适用于不同人群或情境。这些区分将核查分析过程与检验其实证发现能否再次出现分开了。(nationalacademies.org)
另一个需要区分的概念是可重复性,它通常指在各项条件保持高度一致的情况下重复操作。相比之下,在计量学中,再现性条件包括地点、操作人员或测量系统的变化。《国际计量学词汇》规定,应明确指出哪些条件发生了变化,哪些条件保持不变。因此,如果不说明所涉及的程序、条件和比较标准,仅说“可复现”并不能提供充分的信息。(jcgm.bipm.org)
计算机科学领域的术语用法也发生过变化。2020年,美国计算机协会修订了其研究产物评审术语,使之与更广泛的科学用法更加一致。该协会对复现结果与重复验证结果的区分,取决于独立研究是否使用了原作者提供的研究产物。(prod-www.acm.bloomreach.cloud)
计算可复现性
计算结果所依赖的因素,不仅包括已发表的公式或所指明的算法。相关要素还包括输入文件、预处理、参数设置、源代码、软件依赖项和运行条件。因此,仅凭论文的方法部分,可能不足以复现一项复杂分析。即使报告中的方法在科学上是合理的,文件缺失、未记录的手动操作、含糊不清的说明和过时的软件,也可能使分析过程无法重建。(nationalacademies.org)
可复现性并不总是要求二进制层面的输出完全相同。对于确定性计算,要求结果完全一致可能是适当的;但有些研究允许结果在规定的数值容差范围内存在差异。计算环境和算术运算行为的变化可能影响输出;在科学上真正重要的问题是,这些差异是否改变了所报告的结果或结论。因此,比较标准应区分计算结果完全相同与结果处于可接受的变动范围这两种情况。(nationalacademies.org)
重新执行分析也不能证明其假设前提是恰当的。同一套程序可能稳定地复现某个编程错误,或对统计学的不当应用。计算可复现性使分析过程能够接受检查;而对实验设计、结果解释和支持证据的评估,仍是另一项独立任务。(nationalacademies.org)
文档与研究基础设施
可复现的研究会保留从输入到输出的可追溯路径。数据溯源记录数据的来源及其转换过程。版本控制标识代码和数据的特定修订版本,而工作流管理系统则描述依赖关系和执行顺序。这些机制共同帮助人们将已发表的表格和图形与生成它们的程序关联起来。(nationalacademies.org)
实用的研究材料包包括可执行代码、明确标识的数据、参数配置和软件文档。存档仓储和持久标识符有助于保存和查找这些材料。共享开源软件便于检查,但材料可获取本身并不能证明材料包完整、能够执行,或足以复现相关出版物中的研究结果。(nationalacademies.org)
2016年正式发表的FAIR数据原则将研究对象描述为可发现、可访问、可互操作和可重用。这些原则强调机器可处理的元数据,不仅适用于数据集,也适用于分析工具和工作流。FAIR原则中的可访问性可以包含身份认证和权限授权,并不等同于不受限制的公开访问。当数据隐私或其他限制因素制约材料分发时,这一区别尤为重要。(nature.com)
机器学习
在机器学习中,文档必须涵盖模型构建和评估两个方面。相关信息包括训练数据、预处理、模型架构、超参数、优化程序和性能指标。NeurIPS 2019的可复现性计划结合了研究报告核对清单、代码提交政策和独立的复现挑战赛,以改进研究方法与结果的交流和评估方式。(arxiv.org)
软件层面的确定性是这一问题的组成部分之一。软件框架可以提供各种运算的确定性实现,但仅仅启用这些实现,并不能保证整个应用程序都具有可复现性。与之配套的数据处理和执行流程同样重要。将可复现的实现与能够令人信服地支持模型所宣称性能的证据区分开来,可以避免混淆这两个不同的问题。(docs.pytorch.org)
评估与科学解释
独立核查可以检验研究产物是否可获取、是否按文档说明运行,或是否确实能够得到主要结果。美国计算机协会的徽章认证体系将研究产物可用性、研究产物评估和结果验证分为不同类别。这些类别承认,提供材料和成功复现结果是不同的成果,而不是可以相互替代的同行评审形式。(prod-www.acm.bloomreach.cloud)
对重复验证的评估会考虑不确定性,而不是要求观测结果完全相同。效应估计值、置信区间以及对统计假设检验的解释,都可以为比较提供依据,但并不存在适用于所有研究领域的通用标准。一次重复验证失败,并不能确凿地推翻原始假说,正如一次重复验证成功也不能保证其正确一样。差异可能源于偶然性、未受控制的条件、方法上的不足,或所研究系统中此前未被认识到的特征。(nationalacademies.org)