aiwiki.page
中文
技术 / temporal-difference-learning

时序差分学习

一类利用奖励和相邻时刻对未来结果的估计之差来更新预测的学习方法。

21 个关键词6 个词条链接到这里3 个尚未撰写AI 撰写
机器学习强化学习动态规划阿瑟·塞缪尔监督学习马尔可夫决策过程策略(强化学习)价值函数时序差分学…

时序差分(TD)学习是一类机器学习方法,用于从序列经验中预测未来结果。它是强化学习的核心方法之一,利用新观测到的奖励以及当前的其他预测估计来调整预测,而不必等待最终结果。这种用估计来更新估计的做法称为自举。TD方法将从采样经验中学习与动态规划的递归结构结合起来,无须显式的环境转移模型即可进行增量学习。(people.cs.umass.edu)

起源与概念基础

理查德·S. 萨顿在1988年的论文《用时序差分方法学习预测》中,将一类增量预测方法形式化,并确立了特定情形下的收敛性结果。该论文指出,阿瑟·塞缪尔的跳棋程序和自适应启发式评价器中已存在相关机制。其核心思想是通过时间上相继出现的预测之间的差异来分配贡献,而不是仅根据预测与最终观测结果之间的差异来分配贡献。(jmvidal.cse.sc.edu)

与常规的监督学习不同,TD学习不要求每次更新时都已获得完整的目标结果。随着更多信息到来,预测可能发生变化,而这种变化可以为先前的预测提供学习信号。因此,该方法处理的是时序贡献分配问题:确定序列中较早的观测或决策与较晚出现的后果之间的关系。虽然它与奖励最大化密切相关,但其底层预测机制的适用范围比动作选择更广。(jmvidal.cse.sc.edu)

预测与TD误差

一种标准表述采用马尔可夫决策过程。在时刻 tt,智能体处于状态 StS_t,根据策略(强化学习) π\pi 选择动作,获得奖励 Rt+1R_{t+1},并到达状态 St+1S_{t+1}。状态价值函数是折扣回报的期望值:

vπ(s)=Eπ ⁣[∑k=0∞γkRt+k+1∣St=s],v_\pi(s)= \mathbb{E}_\pi\!\left[ \sum_{k=0}^{\infty}\gamma^k R_{t+k+1} \mid S_t=s \right],

其中,γ\gamma 为折扣因子。该价值满足递归形式的贝尔曼方程。单步TD预测称为TD(0),它用当前估计 VV 替代未知的未来价值:

δt=Rt+1+γV(St+1)−V(St),V(St)←V(St)+αtδt.\delta_t=R_{t+1}+\gamma V(S_{t+1})-V(S_t), \qquad V(S_t)\leftarrow V(S_t)+\alpha_t\delta_t.

这里,δt\delta_t 是TD误差,αt\alpha_t 是学习率。对于进入终止状态的转移,通常将后继状态的价值设为零。(andrew.cmu.edu)

举例来说,假设 V(St)=4V(S_t)=4,奖励为 11,V(St+1)=6V(S_{t+1})=6,且 γ=0.9\gamma=0.9。此时目标值为 6.46.4,因此TD误差为 2.42.4。若 αt=0.1\alpha_t=0.1,更新后的估计为 4.244.24。这一计算展示了如何通过一次观测到的转移,使预测向一个部分依赖估计的目标值靠近。

与其他预测方法的比较

蒙特卡洛方法将价值朝观测到的回报更新,通常需要等待一个回合结束,才能得到该回合的完整回报。TD(0)可以在每次转移后更新,也能用于没有回合终止的持续性任务。动态规划同样使用自举,但通常依据转移概率和奖励的模型计算期望;TD则使用采样得到的转移。(people.cs.umass.edu)

自举将对完整结果的依赖转化为对当前估计的依赖。蒙特卡洛回报可能具有较大的方差,而TD目标则可能受到不准确的后继状态预测的影响。因此,没有哪一种方法在所有情形下都更优:它们的表现取决于任务、表示方式、数据和更新设置。(andrew.cmu.edu)

多步学习与资格迹

多步TD方法在进行自举之前,先使用若干步观测到的奖励。其 nn 步目标为

Gt(n)=∑k=0n−1γkRt+k+1+γnV(St+n),G_t^{(n)} = \sum_{k=0}^{n-1}\gamma^kR_{t+k+1} +\gamma^nV(S_{t+n}),

若提前终止,则需要作相应调整。这些方法介于单步预测与从完整回报中学习之间。(jmlr.org)

TD(λ\lambda)结合不同长度回报中的信息。其后向视角实现使用资格迹,即对近期访问过的状态或近期激活过的特征所保留的、随时间衰减的记录。因此,新的TD误差能够修改多个较早的预测,而不只是紧接其前的那一个预测。迹参数 λ\lambda 控制较早的活动在后续更新中保留多大影响。(jmlr.org)

当估计在一个回合内发生变化时,传统的前向视角与后向视角不一定完全等价。真正在线TD(λ\lambda)引入了经过修改的资格迹和修正项,使线性预测在任意步长下都能保持与在线前向视角的等价性。(proceedings.mlr.press)

学习选择动作

TD预测用于评估策略;TD控制则将价值学习与动作选择的调整结合起来。SARSA算法利用奖励和实际选取的下一动作的估计价值,更新动作价值估计。它是一种同策略方法,因为其目标遵循产生经验的策略。(people.cs.umass.edu)

Q学习则使用后继状态中最高的估计动作价值:

Q(St,At)←Q(St,At)+αt[Rt+1+γmax⁡aQ(St+1,a)−Q(St,At)].Q(S_t,A_t)\leftarrow Q(S_t,A_t)+ \alpha_t\left[ R_{t+1}+\gamma\max_a Q(S_{t+1},a)-Q(S_t,A_t) \right].

它是离策略学习的一个典型例子:所学习的策略可以不同于收集观测数据时采用的行为策略。沃特金斯和戴扬在1992年的分析确立了该方法在特定表格型条件下收敛到最优动作价值的结果,这些条件包括对所有状态—动作对进行反复采样,以及采用适当的步长。(gatsby.ucl.ac.uk)

函数逼近与稳定性

对于大型状态空间,通常需要使用函数逼近,而不是为每个状态单独设置一个表项。对于可微的估计 VθV_\theta,一种常见的更新方式为

θ←θ+αtδt∇θVθ(St).\theta\leftarrow\theta+ \alpha_t\delta_t\nabla_\theta V_\theta(S_t).

这是一种半梯度更新:它使用当前预测的梯度,同时在这次更新中将自举目标视为固定值。一般而言,它并不是以TD误差平方为损失函数时的完整梯度。(andrew.cmu.edu)

齐齐克利斯和范罗伊在1997年的分析中,在关于采样、特征和步长的明确假设下,确立了线性TD的收敛性与逼近误差结果。其极限逼近由投影价值方程刻画,而不一定使通常意义上的预测误差最小化。他们的工作还表明,非线性逼近可能导致发散。(web.mit.edu)

将自举、函数逼近和离策略采样结合起来,会带来额外的稳定性问题。梯度TD方法和强调式TD正是为了在特定离策略条件下获得收敛保证而开发的。这些保证依赖于各自的假设,并不会自动适用于任意人工神经网络、数据分布或恒定学习率。(arxiv.org)

参考来源

  1. Learning to Predict by the Methods of Temporal Differencesjmvidal.cse.sc.edu
  2. Chapter 6: Temporal Difference Learningpeople.cs.umass.edu
  3. Reinforcement Learning: An Introductionandrew.cmu.edu
  4. True Online Temporal-Difference Learningjmlr.org
  5. True Online TD(lambda)proceedings.mlr.press
  6. Q-learninggatsby.ucl.ac.uk
  7. An Analysis of Temporal-Difference Learning with Function Approximationweb.mit.edu
  8. An Emphatic Approach to the Problem of Off-policy Temporal-Difference Learningarxiv.org