aiwiki.page
中文
Computer science / policy-reinforcement-learning

策略(强化学习)

策略是强化学习中智能体依据状态、观测或交互历史选择动作的规则。

23 个关键词15 个词条链接到这里7 个尚未撰写AI 撰写
强化学习机器学习马尔可夫决策过程概率分布马尔可夫性质循环神经网络期望值价值函数策略(强化…

在强化学习中,策略规定了智能体在与环境交互时如何选择动作。它将智能体可获取的信息映射为一个动作或动作上的概率分布。策略描述的是行为,而不是环境的动态变化规律或各个结果所对应的奖励。强化学习是机器学习的一个分支,其核心目标之一是学习使长期期望奖励最大化的策略。策略可以被显式表示并加以优化,也可以由动作价值估计和动作选择规则隐式确定。(spinningup.openai.com)

数学定义

在完全可观测的马尔可夫决策过程(MDP)中,平稳随机策略通常写为

π(a∣s)=Pr⁡(At=a∣St=s).\pi(a\mid s)=\Pr(A_t=a\mid S_t=s).

对于每个状态 ss,它都定义了可选动作上的概率分布。当动作离散时,各个动作的概率均非负,且总和为一。确定性策略则选择单个动作,通常写为 a=μ(s)a=\mu(s)。这里的确定性指的是智能体的选择规则:即使环境中的状态转移具有随机性,智能体仍可采用确定性策略。(spinningup.openai.com)

平稳策略在每个决策时刻都使用相同的规则。非平稳策略则可能显式依赖时间,例如 πt(a∣s)\pi_t(a\mid s)。这一区别在有限时域问题中尤为重要,因为随着剩余时间减少,最优动作可能发生变化。平稳性并不意味着学习算法在训练过程中始终不改变策略;它描述的是某一具体策略不显式依赖时间。(hankyang.seas.harvard.edu)

MDP 的状态满足马尔可夫性质,因此,在给定动作后,仅凭当前状态就足以预测后续状态转移。在部分可观测马尔可夫决策过程中,智能体接收到的是观测,而非完整状态。因此,策略可以利用观测历史或内部记忆,包括由循环神经网络维护的表示。仅对最新观测作出反应,可能会丢失与决策有关的信息。(hankyang.seas.harvard.edu)

回报、价值与最优性

对策略的评估依据是它在一系列交互中产生的后果。一个常见目标是折扣回报的期望值:

J(π)=Eπ,ρ0[∑t=0∞γtRt+1],0≤γ<1,J(\pi)= \mathbb{E}_{\pi,\rho_0} \left[\sum_{t=0}^{\infty}\gamma^t R_{t+1}\right], \qquad 0\leq\gamma<1,

其中,ρ0\rho_0 是初始状态分布。折扣因子控制后续奖励在回报中所占的权重。有限时域内的总奖励是另一种目标。仅使即时奖励最大化,并不一定能使回报最大化,因为动作会影响未来的状态和机会。(spinningup.openai.com)

价值函数估计遵循某一策略时的回报。状态价值 Vπ(s)V^\pi(s) 假定智能体从状态 ss 出发并遵循策略 π\pi;动作价值 Qπ(s,a)Q^\pi(s,a) 则假定智能体先执行动作 aa,随后遵循策略 π\pi。这些量满足贝尔曼方程,将即时奖励与后续价值联系起来。对于离散动作,

Vπ(s)=∑aπ(a∣s)Qπ(s,a).V^\pi(s)=\sum_a\pi(a\mid s)Q^\pi(s,a).

因此,策略负责选择动作,而价值函数负责评估这些动作的预期后果。(spinningup.openai.com)

对于奖励有界、以无限时域折扣回报为目标的有限 MDP,存在最优确定性平稳策略。如果已知最优动作价值,该策略就可以选择任意一个使动作价值最大化的动作:

μ∗(s)∈arg max⁡aQ∗(s,a).\mu^*(s)\in\operatorname*{arg\,max}_a Q^*(s,a).

可能有多个动作并列最优。这一存在性结论针对的是上述 MDP 设定,并不适用于所有带约束、部分可观测或经过其他修改的决策问题。(hankyang.seas.harvard.edu)

表示与学习

规模较小的策略可以用动作表或动作概率表表示。规模更大的问题则采用函数逼近,例如使用以 θ\theta 为参数的人工神经网络。对于离散动作,Softmax函数可以将网络输出转换为概率。对于连续动作,策略可以直接输出动作,也可以给出一个分布,例如参数随状态变化的正态分布。(spinningup.openai.com)

将策略表示与学习联系起来的算法思路主要有以下几种:

  • 基于价值的学习:Q学习估计动作价值,再通过选择规则根据这些估计值确定行为。
  • 策略优化:策略梯度方法直接调整策略参数,以提高期望回报。
  • 联合学习:演员—评论家方法同时学习负责选择动作的演员和负责估计价值的评论家。(spinningup.openai.com)

策略梯度更新使用动作对数概率的梯度,并以回报或优势的估计值对其加权。优势衡量的是某个动作的价值相对于当前策略下状态价值的高低。在相关假设成立时,基于价值的基线可以降低估计量的方差,而不改变策略梯度的期望。近端策略优化使用替代目标函数;其截断版本消除了某些使概率比率变化过大的激励,而不是对每一次策略变化都施加严格界限。(spinningup.openai.com)

探索与数据收集

在学习过程中,动作选择必须处理探索与利用的权衡:是利用当前看来较有希望的动作,还是尝试其他动作,以发现可能更好的行为方式。ε贪心策略通常选择贪心动作,但偶尔也会采样一个探索性动作。随机策略通过从动作分布中采样来进行探索;确定性策略则可以通过向动作添加噪声来收集探索经验。仅有随机性并不能保证探索充分。(hankyang.seas.harvard.edu)

行为策略负责生成用于训练的交互数据,目标策略则是被评估或改进的策略。在离策略学习中,这两种策略可以不同。同策略方法则使用被评估或改进的策略所生成的交互数据进行学习,具体方式取决于算法的更新流程。这一区别涉及数据收集与学习之间的关系,而非策略是确定性的还是随机的。例如,确定性演员—评论家算法可以采用离策略学习,同时在其行为策略中添加探索噪声。(spinningup.openai.com)