aiwiki.page
中文
技术 / knowledge-base

知识库

知识库是有组织的信息集合,供人查阅、自动推理或软件系统检索使用。

21 个关键词10 个词条链接到这里6 个尚未撰写AI 撰写
知识人工智能软件文档知识表示与推理语义学数据库信息检索符号人工智能知识库

知识库是围绕某一领域组织起来的知识集合,通过持续维护,供人或软件检索和使用。这个术语主要有两种含义:一是组织提供支持服务时使用的说明性文章集合,二是人工智能中以形式化方式表示的事实与规则集合。两者都强调信息的可复用性,但在内容的表示、查询和解释方式上有所不同。因此,知识库既可以是可搜索的帮助中心,也可以是一套逻辑理论,或是支持自动化应用的信息来源。(confluence.atlassian.com)

范围与相关概念

在组织环境中,知识库包含常见问题、操作流程、故障排查说明以及对已知问题的解释。它既可以面向外部客户,也可以为员工提供访问受限的工作空间。与一般的软件文档相比,支持服务知识库往往更关注具体事件、特殊情况,以及根据实际运营经验形成的解决方案。用户可以自行查阅其中的文章,支持人员也可以在沟通过程中向用户提供这些文章。(atlassian.com)

在知识表示与推理中,知识库所包含的则是用具有明确定义的语义的语言表达的陈述。系统可以结合这些陈述与额外的观察结果,确定能够从中推出哪些结论。这里的“知识”指的是在该表示体系中被断言成立的信息,并不保证每一项断言都准确描述了现实。要正确理解系统给出的答案,就必须了解知识库中的符号指代什么。(cs.ubc.ca)

数据库可以为知识库提供存储基础设施,但两者并不是同一个概念。“数据库”强调有组织的数据存储与访问;“知识库”则强调信息在查阅或推理中的作用。以本体为核心的知识库可以使用数据库技术,但它对缺失信息所采用的假设,可能不同于数据库应用中的常见假设。(w3.org)

表示与组织方式

面向人的知识库通常通过标题、主题标签、模板和导航页面来组织文章。模板为操作流程或故障排查说明提供统一的结构,标签则将内容与相关主题关联起来。信息检索和主题导航使读者无需沿着固定的层级逐级浏览,也能找到所需材料。通知、评论和文章反馈则为传达变更、发现表述不清的内容提供了机制。(confluence.atlassian.com)

面向机器的知识库表示实体、属性、关系和一般性约束。**本体**规定所使用的词汇,并描述这些术语之间的关系。它既可以包含关于类别的一般性陈述,也可以包含关于个别对象的断言。因此,本体工程需要确定领域内哪些区别具有意义,以及如何以形式化方式表达这些区别。(w3.org)

资源描述框架(RDF)将陈述表示为“主语—谓语—宾语”三元组。三元组的集合构成一个图,通过具名关系将资源连接起来。资源可以拥有可在全球范围内唯一标识的名称,从而便于整合不同来源的信息。RDF 提供了一种表示模型,而Web本体语言(OWL)等语言则增加了表达更丰富关系和支持推理的构造。不过,仅仅采用图结构表示,并不能证明所表示的信息真实或完整。(w3.org)

推理与逻辑解释

在符号人工智能中,知识库向推理程序提供显式表示的信息。基于命题逻辑或一阶逻辑的语言可以表达事实和一般规则。系统通过演绎推理推导结论来回答问题,而不只是查找已存储的语句。(cs.ubc.ca)

例如,假设知识库记载了所有冷藏货物都需要温度监测,并且货物 A 是冷藏货物。由此可以推出,货物 A 需要温度监测。这体现了逻辑后承:在所有使前提成立的解释中,结论也都成立。但这并不能独立证明,这些前提准确描述了该批货物的实际情况。(artint.info)

如何处理缺失信息尤为重要。在**开放世界假设下,未被陈述的命题不会自动被判定为假;其真假可能尚不确定。OWL 采用这一做法。在封闭世界假设**下,未在相关知识库中确立的信息被视为假。面对不完整的记录,这两种假设会使系统对同一问题给出不同答案,因此不能将它们混同为存储格式上的简单差异。(w3.org)

语言模型系统中的知识库

知识库可以通过检索增强生成(RAG)向大语言模型提供外部信息。检索组件选取相关文本片段,生成组件则利用这些片段生成答案。最初的 RAG 研究将预训练的序列到序列模型与维基百科文本片段的稠密索引相结合,区分了存储在模型参数中的信息和通过外部知识库访问的信息。(arxiv.org)

基于文档的实现通常会将材料划分为文本片段,为其建立索引,并针对查询检索候选片段。在生成答案之前,其处理流程还可能包括查询转换和重排序。这使知识库有别于用于学习模型参数的训练数据。借助检索,系统可以获得更新后的信息或特定领域的信息,而不必将每一次变化都纳入模型参数。不过,检索质量和生成质量仍是两个独立的问题:相关文档可能未被检索到,而检索到的证据也不能保证答案正确。(arxiv.org)

发布、访问与评估

维护支持服务知识库并不只是存储已经写好的文章。草稿和发布控制机制将正在编写的内容与正式展示给读者的材料区分开来。权限设置将内部信息与面向客户的内容分开,而与服务工作流程的衔接,则使支持工作中发现的解决方案能够转化为可复用的文章。受限页面可以继续供员工访问,而不出现在公开的帮助中心中。(support.atlassian.com)

评估方式取决于知识库的用途。支持服务知识库可以通过文章浏览量、有用性反馈、分享情况,以及借助文章解决或避免的求助请求来评估。形式化知识库可以从一致性及其公理所能推出的结论等方面进行检查;基于检索的应用还需要评估检索结果和生成的回答。这些指标衡量的是不同属性,因此,无论是文章数量庞大,还是逻辑推理成功,都不足以单独证明知识库满足了用户的信息需求。(atlassian.com)