信息检索(IR)是从资料集合中查找满足用户信息需求的内容的过程,也指对这一过程的科学研究。检索对象通常是非结构化文本,但也包括图像、音频和其他媒体。检索系统解析查询,识别可能相关的条目,并返回匹配结果集或排序后的列表。这一领域属于计算机科学,并与自然语言处理和机器学习密切相关。(nlp.stanford.edu)
信息需求、查询与相关性
信息需求并不等同于表达这一需求的查询。例如,研究飞机维护的人可能只输入几个关键词,而相关文档采用的却是不同术语。同义词可能导致有用的内容无法匹配,歧义词则可能带来不相关的匹配结果。因此,检索并不只是检查文档是否包含用户输入的那些词。(nlp.stanford.edu)
相关性关注的是某个条目在多大程度上满足实际的信息需求。它可能取决于搜索任务和用户所处的情境,而不只是词汇上的重合。常规数据库查询通常依据明确的条件筛选结构化记录;与之相比,信息检索往往需要根据不完整的证据估计内容的有用程度。不过,结构化筛选与排序式文本搜索仍可在同一系统中协同运行。(nlp.stanford.edu)
索引与查询处理
对于大型资料集合,每次查询都逐篇从头到尾搜索文档,效率很低。因此,系统会构建索引,以便直接访问候选文档。其中一种核心数据结构是倒排索引,它将每个纳入索引的词项与一个倒排列表关联起来,列表中记录包含该词项的文档。倒排记录还可以包含出现次数和位置;位置信息可用于短语匹配和邻近搜索。(nlp.stanford.edu)
文本处理决定了哪些内容会进入索引。分词与词元化将文本划分为可搜索的单元,规范化则统一某些拼写或字符形式上的差异。系统可能移除常见的停用词,或通过词干提取、词形还原,将相关词形归并。这些选择会影响索引大小和匹配方式。查询通常也会经过相应的处理,使其表示形式能够与索引中的内容进行比较。(nlp.stanford.edu)
搜索时,系统解析查询、检索候选文档、计算得分并呈现结果。布尔代数中的运算符用于组合匹配条件:AND 要求两个条件都满足,OR 允许任一条件满足,NOT 则排除符合指定条件的结果。排序检索采用评分算法对候选文档排序,使部分匹配的文档也能参与比较,而不必满足单一的、非此即彼的条件。(nlp.stanford.edu)
检索模型
经典的基于词项的模型使用文档中的词语来描述文档。词袋模型保留词语的出现次数,但忽略其确切顺序。在向量空间表示中,文档和查询的各个坐标对应词汇表中的词项。TF–IDF 加权将文档内的词频与逆文档频率结合起来,赋予出现在较少文档中的词项更高的区分权重。余弦相似度用于比较所得向量的方向。(nlp.stanford.edu)
概率模型利用概率对相关性证据进行形式化描述。BM25 源自概率检索方法,结合了逆文档频率、趋于饱和的词频贡献和文档长度归一化。这里的饱和是指,词项反复出现所带来的额外影响会逐渐减小,而不是让其贡献始终与出现次数成正比地无限增长。(nlp.stanford.edu)
另一种方法使用语言模型,估计文档模型生成查询的可能性。这类模型需要进行平滑处理,因为某个词项没有出现在某篇文档中,并不意味着必须将其概率设为零。这些方法从不同角度刻画了查询措辞与文档内容之间的关系。(nlp.stanford.edu)
学习式检索与稠密检索
学习排序利用样例或交互证据,学习如何对候选文档排序。排序特征可以包括文本匹配得分,以及文档或查询的其他特征;监督学习提供了组合这些信号的方法。(nlp.stanford.edu)
稠密检索将查询、文档或段落表示为通过学习得到的、维度相对较低的向量。人工神经网络可以分别编码查询和段落,因此段落的表示可以在查询到来之前预先计算。在双编码器方法中,检索通过内积或其他相似度度量来比较这些表示。学习得到的表示能够关联措辞不同的问题和段落,但其效果取决于具体任务和训练数据。(aclanthology.org)
查询改写是解决词汇不匹配问题的另一种途径。查询扩展会添加相关词项,而相关性反馈则根据对初次检索所得文档的相关性判断来调整查询。伪相关性反馈不获取用户的明确判断,而是将初次检索结果中选定的一部分视为相关文档。(nlp.stanford.edu)
评估
检索效果通常通过资料集合、搜索主题和相关性判断来评估。查准率是检索结果中被判定为相关的条目所占的比例;查全率是所有相关条目中被检索出来的条目所占的比例。F值通过调和平均将两者结合起来。两者的相对重要性因任务而异:找到一个有用的首条结果,与找到几乎所有相关文档,是不同的目标。(nlp.stanford.edu)
排序结果的评估指标会考虑结果顺序。前 k 项查准率考察排名靠前的固定数量的结果。平均精度均值汇总相关结果所在位置上的查准率,而归一化折损累积增益既能处理分级相关性,也会降低排名靠后条目的贡献。响应时间和索引大小也是系统层面需要考虑的因素。(nlp.stanford.edu)
文本检索会议(Text REtrieval Conference,TREC)创办于1992年,通过共享测试集合和评估流程支持比较研究。这类基准使实验之间更具可比性,但结果仍取决于所采用的主题、资料集合和相关性判断。(trec.nist.gov)
应用
信息检索的应用包括万维网搜索、企业文档搜索和个人资料集合搜索。在检索增强生成中,检索组件为文本生成模型选取外部段落。这将证据选择与答案生成结合起来,但检索质量与生成答案的质量仍是两个不同的问题。(nlp.stanford.edu)