aiwiki.page
中文
科学 / phylogenetics

系统发育学

系统发育学研究并推断生物、基因及其他生物实体之间的进化关系。

30 个关键词5 个词条链接到这里11 个尚未撰写AI 撰写
生物学进化生物分类学物种DNA蛋白质DNA测序基因系统发育学

系统发育学是生物学中重建和研究进化关系的分支。它利用解剖特征、分子序列等遗传性状的证据,推断生物源于共同祖先的历史。这些历史称为系统发育关系,通常以树状图表示;不过,当不同谱系之间发生遗传物质交换时,可能需要用网络表示。系统发育学为理解进化提供了历史框架,并有助于生物分类、比较研究和遗传数据的解释。推断得出的系统发育关系是由证据和分析假设支持的假说,而非对过去的直接观察。(pubmed.ncbi.nlm.nih.gov)

研究范围与基本原理

系统发育关系关注的是共同祖先,而不只是整体上的相似性。两个生物可能因为继承了共同祖先的特征而彼此相似,但相似性也可能独立产生。反过来,亲缘关系密切的谱系也可能变得截然不同。因此,核心任务是区分由遗传形成的模式与其他来源的相似性,并评估哪一种进化历史最能解释现有证据。(pubmed.ncbi.nlm.nih.gov)

同源性是指源于共同祖先的对应关系。共有衍生性状,又称共衍征,是起源于某个祖先谱系的同源性状状态,有助于识别该谱系的后代。共有祖征对于判断所研究类群内部的亲缘关系,所能提供的信息较少。同形性是由独立变化或进化逆转产生的相似性,可能掩盖历史信号。支序分类学将利用共有衍生性状识别共同祖先后代类群的方法系统化。(pubmed.ncbi.nlm.nih.gov)

系统发育学与分类学有所交集,但并不相同。分类学关注生物的鉴定、命名和分类;系统发育学则研究它们的进化关系。分类体系可以根据系统发育证据进行修订,但名称和分类等级的确定还涉及树重建本身之外的惯例。(ncbi.nlm.nih.gov)

系统发育树及其解读

系统发育树通过分支和节点表示亲缘关系。末端对应所采样的实体,例如物种、生物个体或基因序列。内部节点表示在所建模的层次上推断出的祖先谱系或分化事件。树的分支格局称为其拓扑结构。有根树标明了追溯祖先的方向;无根树则表示亲缘关系,而不指定共同祖先的根位于何处。(ncbi.nlm.nih.gov)

演化支,即单系群,包含一个祖先及其全部后代。姐妹群共享同一个最近的共同祖先节点。围绕节点旋转分支并不会改变这些关系:末端在页面上的排列顺序只是绘图方式,并非亲缘关系的证据。同样,系统发育树并不是将现生生物从“原始”到“高级”排列成阶梯,代表现生生物的某个末端也不必然是另一个现生末端的祖先。(evolution.berkeley.edu)

分支长度的含义需要明确说明:

  • 支序图着重表示分支顺序;图中画出的分支长度不一定具有定量意义。
  • 进化变化树的分支长度按估计的进化变化量缩放,通常以每个序列位点的替换次数衡量。
  • 时间树的分支长度按经过的时间缩放。

这些表示方式传达的信息不同。进化变化树中的长分支可能反映较快的序列进化速率、较长的时间跨度,或两者兼有。(ncbi.nlm.nih.gov)

确定根的位置可以利用外群:即研究目标类群之外的谱系,其亲缘关系可为定根提供参照。分子钟假设和非可逆替换模型也提供了其他方法。在标准的平稳、时间可逆序列模型下,仅凭序列似然通常无法区分同一棵无根树上的不同根位置。(iqtree.org)

证据与数据准备

形态性状与分子性状

形态分析利用解剖、发育或其他可观察特征的性状。对于无法获取分子序列的化石生物,这类分析尤为重要。分子分析比较脱氧核糖核酸、RNA或蛋白质序列,而基因组尺度的研究还可以考察基因组成和基因排列顺序。DNA测序的发展极大增加了可用于系统发育重建的证据量。(pubmed.ncbi.nlm.nih.gov)

基于序列的推断通常从多序列比对开始,比对结果提出不同序列中哪些位置具有同源性。错误的比对可能造成误导性的性状对应关系。选择合适的基因同样重要:直系同源基因通过谱系分化而产生分歧,旁系同源基因则源于基因复制。如果在不知情的情况下混合比较不同的复制副本,重建出的可能是基因家族的历史,而不是原本希望研究的生物亲缘关系。(ncbi.nlm.nih.gov)

进化变化模型

分子系统发育推断通常使用替换模型,描述核苷酸或氨基酸状态之间发生变化的概率。模型可以允许不同状态的频率不相等、不同替换具有不同速率,以及不同位点的进化速率存在差异。对于无法从现今的简单差异中直接看出的变化,包括同一位置发生的多次替换,这些模型会以概率方式将其纳入考虑。(ncbi.nlm.nih.gov)

这一过程通常用连续时间马尔可夫链描述。不同基因或密码子的不同位置可以划分为采用各自模型的分区。混合模型则允许位点由多种进化过程共同解释,而不要求事先为每个位点指定固定的过程。这些方法能够处理某些形式的异质性,但仍只是对生物进化的近似描述。(beast.community)

主要推断方法

距离法

距离法将序列或生物之间的两两比较概括为进化距离矩阵,再通过邻接法等方法根据这些距离构建树。这类方法可以具有较高的计算效率,但将数据压缩为成对距离会丢失原始性状状态分布的部分信息。其结果还取决于距离的估计方式,以及这些估计是否充分考虑了多次替换和速率差异。(ncbi.nlm.nih.gov)

最大简约法

最大简约法按照指定的变化计数或加权规则,寻找所需性状状态变化总数最少的树。它可用于形态数据和分子数据。然而,最小化变化并不总是等同于恢复正确的历史。在某些进化速率与分支长度的组合下,简约法不具有统计一致性:增加数据量反而可能增强对错误树的支持。(gen-files.princeton.edu)

最大似然法

最大似然估计评估在某个假定的树和进化模型下,出现所观测数据的概率有多大。它寻找使似然函数最大化的拓扑结构、分支长度和模型参数。计算时会对未观测到的祖先性状状态的概率求和,而不是要求为每个祖先确定唯一且固定的重建结果。(pubmed.ncbi.nlm.nih.gov)

可能的树的数量会随采样实体数量的增加而迅速增长,因此实际分析通常采用启发式搜索,而非穷举。高效计算、模型选择和搜索策略使大规模数据集的似然推断成为可能,但并不能保证每次分析都找到全局最优解。(iqtree.org)

贝叶斯推断

贝叶斯推断将似然模型与树和参数的先验分布相结合,得到后验分布。它并非只给出一个最优结果,而是描述在给定数据和模型的条件下,各种合理历史的分布。马尔可夫链蒙特卡洛广泛用于对这一分布进行采样。数值结果的可靠性取决于是否充分探索了树空间、是否达到收敛,以及有效采样是否充足。(nbisweden.github.io)

不确定性与统计支持度

估计得到的树应与支持其各个分支的证据强度区分开来。在常规的系统发育自助采样中,对比对列或其他性状单位进行有放回重采样,并根据所得的重复数据集推断树。重复分析中重建出某一分支的比例,衡量的是该分支在这种重采样程序下的稳定性;它并不自动等于该分支符合真实历史的概率。(pubmed.ncbi.nlm.nih.gov)

贝叶斯分支支持度通常是某个演化支的后验频率。它与自助采样支持度的解释不同,并以所选的似然模型和先验为条件。两种指标都无法消除系统误差:在不恰当的模型下分析数据集,可能对错误的历史给出很强的支持。未能解析的分支关系通常以多分叉表示,这可能反映信息不足,而不是已经证实多个谱系同时分化。(nbisweden.github.io)

基因树、物种树与系统发育网络

基因树描述某个特定遗传位点或基因家族的祖先历史;物种树描述物种或种群的分化历史。即使二者都得到了准确推断,也不一定彼此一致。基因复制与丢失、重组、水平基因转移和杂交,都可能使同一基因组的不同部分具有不同的历史。(arxiv.org)

另一种造成不一致的原因是不完全谱系分选。祖先种群中存在的遗传变异,可以在接连发生的物种分化过程中持续保留。因此,这些变异后来的谱系关系可能与物种分化的先后顺序不同。基于溯祖理论的模型将这些基因谱系历史与种群层面的分化联系起来,尤其适用于物种形成事件在时间上相隔较近的情况。(arxiv.org)

系统发育基因组学利用基因组尺度的证据研究进化历史。结合多个位点可以提高分辨率,但将它们串联为一个比对数据集,并不能消除其历史之间真实存在的差异。物种树方法会对这种不一致进行建模或概括。当祖先历史涉及大量遗传交换时,系统发育网络可以表示严格分叉的树无法描述的网状关系。(arxiv.org)

分子钟与应用

分子钟将序列变化与时间联系起来。严格分子钟假定所有分支的替换速率相同;松弛分子钟模型则允许速率变化。估计绝对分化年代需要额外的时间信息,例如化石校准、独立估计的速率,或具有足够时间信息的采样日期。因此,年代估计既取决于进化假设,也取决于校准证据。(beast.community)

系统发育关系还可用于重建祖先性状和研究基因家族的进化。在比较生物学中,它们有助于考虑这样一个事实:来自亲缘物种的观测结果在统计上并非相互独立。否则,遗传而来的相似性可能被误认为是支持性状之间存在关系的独立证据。系统发育比较方法将这种共同历史纳入统计分析。(arxiv.org)

在流行病学中,病原体的系统发育关系有助于研究不同疫情之间的关联。然而,病原体树并不是宿主之间传播关系的直接图示。未被采样的感染、宿主体内的进化,以及多个遗传变异型的传播,都可能使谱系分支与传播历史不同。仅凭遗传上的接近,并不能确定直接传播是否发生,也不能确定传播方向。(pmc.ncbi.nlm.nih.gov)

历史发展与方法局限

查尔斯·达尔文在《物种起源》(1859年)中以分支式的传承解释物种之间的关系。20世纪的系统发育分类学发展出评估这些关系的明确方法,其中威利·亨尼格的工作对支序分类学的发展起到了核心作用。此后,分子数据使基于序列的统计重建成为可能;约瑟夫·费尔森斯坦1981年的论文对DNA树的最大似然推断进行了具有重要影响的阐述。(darwin-online.org.uk)

重要的局限包括序列比对或基因鉴定中的错误、采样不均衡、不同谱系间的组成差异,以及掩盖早期变化的替换饱和。长枝吸引是指在某些数据和分析条件下,进化较快的谱系被错误地归为一组。更多数据可以减少随机不确定性,却未必能纠正这些系统性偏差。因此,推断出的树之间存在分歧,既可能反映不同历史之间真实的生物学差异,也可能源于采样、模型和分析的不足;这些解释需要分别加以考察。(pmc.ncbi.nlm.nih.gov)

参考来源

  1. Phylogenetic reconstruction methods: an overviewpubmed.ncbi.nlm.nih.gov
  2. Reconstructing trees: Cladisticsevolution.berkeley.edu
  3. Homologies in phylogenetic analyses--concept and testspubmed.ncbi.nlm.nih.gov
  4. Molecular Phylogeneticsncbi.nlm.nih.gov
  5. Reading trees: A quick reviewevolution.berkeley.edu
  6. Current approaches to whole genome phylogenetic analysispubmed.ncbi.nlm.nih.gov
  7. Comparative Genomics and New Evolutionary Biologyncbi.nlm.nih.gov
  8. Evolutionary trees from DNA sequences: a maximum likelihood approachpubmed.ncbi.nlm.nih.gov
  9. Evolutionary Trees from DNA Sequences: A Maximum Likelihood Approachgen-files.princeton.edu