校准是计量学中的一项操作,用于建立测量仪器或测量系统的示值与计量标准所提供的量值之间的关系,并将测量不确定度纳入考虑。在规定条件下,可利用这些关系从后续示值获得测量结果。校准可以给出修正值、表格、曲线或数学关系,并不一定涉及对仪器的改动。在统计学和机器学习中,“校准”一词另有含义,指预测概率与观测结果之间的一致程度。(jcgm.bipm.org)
含义与相关操作
《国际计量学词汇》将校准描述为分两个阶段进行的操作。首先,建立参考量值及其不确定度与相应仪器示值及其不确定度之间的关系。其次,利用这些信息确定如何从示值获得测量结果。在实验室的日常用语中,“校准”有时仅指其中的比较阶段。(jcgm.bipm.org)
校准不同于**调整;调整是对测量系统进行改动,使其给出规定的示值。改变零点设置或灵敏度属于调整,而在不改动仪器的情况下确定所需的修正值则属于校准。验证**用于确定是否满足规定要求,例如误差是否在允许限值以内。校准结果可以为验证提供依据,但校准本身并不只是作出合格或不合格的判断。(jcgm.bipm.org)
参考标准与溯源性
参考标准提供的是带有相应不确定度的量值,而非绝对无误差的量值。计量溯源性通过一条有文件记录、不间断的校准链,将测量结果与规定的参考联系起来;链中的每次校准都会引入不确定度。参考通常包括国际单位制单位的复现,但也可以采用其他明确定义的参考。溯源性是测量结果的属性,而不只是仪器或其制造商的属性。(nist.gov)
国家计量院保存和维护参考标准,并提供校准服务,以支撑这条溯源链。不过,由这类机构校准过的仪器,并不意味着其后每次测量的溯源性都会自动得到确立。用户采用的测量程序、测量条件、不确定度评定,以及对设备的持续管控也都很重要。此外,仅有溯源性并不能证明不确定度已小到足以满足某项具体应用的要求。(nist.gov)
校准程序
校准程序规定被测量,即拟测量的量,同时规定测量范围、参考标准、比较方法及相关工作条件。校准程序涵盖的量包括质量、温度、压强、时间、体积和电学量等。由于不同仪器和不同量需要采用不同的比较方式,其技术细节也各不相同。(nist.gov)
文件记录应包含方法、标准、结果及不确定度评定,以支持所声明的溯源性。在多个参考值处进行比较,可以确定仪器在一定范围内的响应。重复观测和持续的测量质量保证检查,有助于表征测量的变异性及其随时间的变化。校准的条件和限制十分重要:在一组条件下建立的校准关系,并不意味着仪器在其他任何条件下的性能都能得到无条件保证。(nvlpubs.nist.gov)
校准曲线与数学模型
校准曲线表示参考值与仪器响应之间的关系。一种常见模型为
[ y=a+bx+\varepsilon, ]
其中,(x) 为参考值,(y) 为响应,(a) 为偏移量,(b) 为响应斜率,(\varepsilon) 表示测量误差。这是一个线性回归模型;此外,也可采用二次、幂律及其他非线性关系。模型选择不能仅凭目视判断来确定。(itl.nist.gov)
对于后续测得的响应 (y'),只要估计斜率不为零,就可由该线性关系得到经校准的估计值
[ \hat{x}=\frac{y'-\hat{a}}{\hat{b}}. ]
因此,应用校准通常涉及响应关系的反函数。对于非线性模型,可能需要选择符合物理意义的根,或采用插值。当测量过程保持统计受控状态时,这一关系可以继续使用;而某些化学测量程序则会为每个批次重新建立曲线。(itl.nist.gov)
经校准结果的不确定度
对示值进行修正并不能消除不确定度。不确定度评定需考虑参考值、观测到的变异性、拟合关系,以及其他相关贡献。因此,未来某次测量经修正后所得结果的不确定度,并不等同于原始校准观测值的离散程度。(itl.nist.gov)
测量不确定度表示指南的框架区分了基于观测数据统计分析的 A 类评定和基于其他信息的 B 类评定。各项贡献以标准不确定度表示,并通过测量模型进行合成,其中包括相关的协方差。这些类别区分的是评定方法,而不是将影响简单地划分为随机影响和系统影响。(emtoolbox.nist.gov)
扩展不确定度通常表示为 (U=ku_c),其中 (u_c) 为合成标准不确定度,(k) 为包含因子。在适当的正态分布假设下,(k=2) 对应约 95% 的包含概率。这种解释有其适用条件,并非普遍成立。(emtoolbox.nist.gov)
再校准与持续管控
校准建立的是测量当时的关系,仪器的性能此后可能发生变化。再校准间隔取决于稳定性、环境影响、准确度要求以及适用的外部要求。每年校准一次并非普遍适用的安排。历史结果、与其他标准的比较以及统计控制图,都可以为设定或调整校准间隔提供依据。记录校准前后的性能,有助于区分仪器性能的劣化与维护过程中引入的变化。(nist.gov)
概率校准
在预测建模中,校准关注的是预测的概率是否与观测频率相符。例如,在相关样本组中,置信度约为 0.8 的预测,其正确比例应约为 80%。分类准确率与校准是不同的概念:模型即使能正确分类许多样本,也可能表现出过高的置信度。可靠性图用于比较置信度与实际观测到的准确率。(proceedings.mlr.press)
后处理方法利用单独的验证集来拟合概率变换。温度缩放先将网络输出的 logits 除以一个通过学习得到的正标量,再应用Softmax函数。这一操作会改变置信度,但不会改变得分最高的类别。与物理测量中的校准不同,这一程序依赖的是带标签的观测数据,而非通向计量标准的溯源链。(proceedings.mlr.press)