在微积分中,可微标量值函数的梯度是描述函数相对于输入变量的一阶变化的向量。在欧几里得空间中,梯度的各个分量是函数的偏导数。当梯度非零时,它指向函数在局部增长最快的方向,其大小表示沿该方向的增长率。梯度记作 (\nabla f) 或 (\operatorname{grad}f),将微分与几何及优化联系起来。(ocw.mit.edu)
定义与记号
设 (f:U\subseteq\mathbb{R}^n\to\mathbb{R}) 在开集 (U) 上可微。在采用标准欧几里得内积的笛卡尔坐标系中,其梯度为
[ \nabla f(\mathbf{x})= \begin{pmatrix} \frac{\partial f}{\partial x_1}(\mathbf{x})\ \vdots\ \frac{\partial f}{\partial x_n}(\mathbf{x}) \end{pmatrix}. ]
每个偏导数衡量的是保持其他坐标不变时,函数随某一坐标的变化率。符号 (\nabla) 称为 nabla 或 del,表示一个微分算子;将它作用于标量值函数,会得到向量值函数。在每一点赋予这个向量,就形成了梯度向量场。(ocw.mit.edu)
梯度通过以下局部展开表示函数的导数:
[ f(\mathbf{x}+\mathbf{h}) =f(\mathbf{x})+\nabla f(\mathbf{x})\cdot\mathbf{h} +o(|\mathbf{h}|). ]
因此,点积给出了微小位移所引起的一阶变化。当位移的长度趋于零时,余项相对于位移的大小可以忽略不计。梯度的几何解释建立在这种线性近似之上,而不仅仅依赖于各个偏导数的存在。(ocw.mit.edu)
方向变化与等值集
对于单位向量 (\mathbf{u}),方向导数为
[ D_{\mathbf{u}}f(\mathbf{x}) =\nabla f(\mathbf{x})\cdot\mathbf{u}. ]
如果梯度非零,那么当 (\mathbf{u}) 与梯度同向时,该表达式取最大值;当两者反向时,取最小值。这两个极值分别为 (|\nabla f|) 和 (-|\nabla f|)。沿垂直于梯度的方向,一阶变化为零。因此,“增长最快”指的是按单位欧几里得距离衡量的瞬时增长率,并不一定意味着有限位移的最佳选择。(ocw.mit.edu)
等值集由满足 (f(\mathbf{x})=c) 的点组成。在梯度非零的正则点处,梯度垂直于该等值集的每一个切向方向。在二维空间中,这些集合是等值曲线,可用等值线表示;在三维空间中,它们则是等值面。梯度属于函数的输入空间,因此,二元函数的梯度本身并不是其函数图像在三维空间中的法向量。(ocw.mit.edu)
例如,对
[ f(x,y)=x^2+2y^2 ]
直接求导,得到 (\nabla f=(2x,4y))。在点 ((1,1)) 处,梯度为 ((2,4)),其大小为 (2\sqrt5),最速上升方向的单位向量为 ((1/\sqrt5,2/\sqrt5))。它在该点垂直于椭圆 (x^2+2y^2=3)。
代数关系
梯度满足线性性质和乘积法则:
[ \nabla(af+bg)=a\nabla f+b\nabla g,\qquad \nabla(fg)=f\nabla g+g\nabla f, ]
其中 (a,b) 为常数,(f,g) 为可微标量函数。对于可微映射 (F:\mathbb{R}^n\to\mathbb{R}^m) 和标量函数 (g:\mathbb{R}^m\to\mathbb{R}),链式法则可写为
[ \nabla(g\circ F)(\mathbf{x}) =J_F(\mathbf{x})^{\mathsf T}\nabla g(F(\mathbf{x})), ]
其中 (J_F) 是雅可比矩阵,上标表示矩阵转置。这个公式说明了敏感度如何通过复合映射传递。对于标量输出,雅可比矩阵通常写成行矩阵,而梯度通常写成列向量。(jmlr.org)
优化与计算
[ \mathbf{x}_{k+1} =\mathbf{x}_k-\alpha_k\nabla f(\mathbf{x}_k). ]
正步长 (\alpha_k) 通常称为学习率,用于控制位移大小。通过线搜索,可以选择使目标函数充分下降的步长。虽然非零的负梯度给出了局部下降方向,但要保证收敛,仍需满足适当的假设并合理选择步长。(web.stanford.edu)
对于无约束可微函数,若局部极小点位于定义域内部,则该点的梯度为零。局部极大点或鞍点也可能满足同样的条件,因此梯度为零一般不足以判定极小点。不过,对于定义在开凸域上的可微凸函数,梯度为零的点就是全局最小点。(web.stanford.edu)
在机器学习中,损失函数的梯度描述其对模型参数的敏感度。自动微分通过对基本运算应用链式法则来计算导数。神经网络中的反向传播是反向模式微分的一种专门应用;它负责计算梯度,而不是决定优化时如何更新参数。相比之下,有限差分近似通过附近点的函数值来估计导数,需要在截断误差与舍入误差之间进行权衡。(jmlr.org)
物理与几何解释
在物理学中,梯度用于描述空间变化。温度梯度指向温度升高的方向;对于遵循傅里叶定律的各向同性材料,热流密度与温度梯度的负值成正比。在静电学中,电场满足 (\mathbf{E}=-\nabla\phi),其中 (\phi) 为电势。空间梯度的单位是相应标量的单位除以长度单位。(feynmanlectures.caltech.edu)
在微分几何中,梯度的定义依赖于度量。在具有度量张量 (g) 的黎曼流形上,梯度是满足以下关系的唯一切向量:
[ g(\operatorname{grad}f,\mathbf{v})=df(\mathbf{v}) ]
该关系对每个切向量 (\mathbf{v}) 都成立。微分 (df) 不依赖于度量,记录了沿各方向的变化;度量则将这些信息转换为向量,并决定“最陡”的含义。因此,只有在适当的欧几里得坐标系中,直接把各坐标偏导数组合起来才能得到梯度分量;在一般坐标系中,还需要引入度量因子。(math.stanford.edu)