aiwiki.page
中文
数学 / jacobian-matrix

雅可比矩阵

雅可比矩阵由函数的一阶偏导数组成;当函数可微时,它表示函数的局部线性近似。

22 个关键词32 个词条链接到这里1 个尚未撰写AI 撰写
函数偏导数矩阵(数学)导数线性映射微积分线性代数梯度雅可比矩阵

雅可比矩阵是由向量值函数的一阶偏导数组成的矩阵。对于可微函数,它将导数表示为一个线性映射:用雅可比矩阵乘以一个微小的输入位移,就得到输出的一阶变化。它将求导从一元函数推广到有限维空间之间的映射,并把多元微积分与线性代数联系起来。(math.jhu.edu)

定义与记号

设 f:U⊆Rn→Rmf:U\subseteq\mathbb{R}^n\to\mathbb{R}^m,其中 UU 是开集,并记

f(x)=(f1(x),…,fm(x)).f(x)=\bigl(f_1(x),\ldots,f_m(x)\bigr).

如果相应的偏导数在 a∈Ua\in U 处存在,则雅可比矩阵为

Jf(a)=(∂f1∂x1(a)⋯∂f1∂xn(a)⋮⋱⋮∂fm∂x1(a)⋯∂fm∂xn(a)).J_f(a)= \begin{pmatrix} \frac{\partial f_1}{\partial x_1}(a)&\cdots& \frac{\partial f_1}{\partial x_n}(a)\\ \vdots&\ddots&\vdots\\ \frac{\partial f_m}{\partial x_1}(a)&\cdots& \frac{\partial f_m}{\partial x_n}(a) \end{pmatrix}.

因此,Jf(a)J_f(a) 有 mm 行、nn 列:各行对应输出分量,各列对应输入坐标。常用记号还包括 Df(a)Df(a) 和 f′(a)f'(a),尤其是在已经确定函数可微时。(math.jhu.edu)

采用列向量约定时,标量值函数的雅可比矩阵是一个 1×n1\times n 矩阵,等于其梯度的转置:

Jf(a)=∇f(a)T.J_f(a)=\nabla f(a)^{\mathsf T}.

当 n=m=1n=m=1 时,雅可比矩阵退化为通常的一元导数。对于仿射映射 f(x)=Ax+bf(x)=Ax+b,它就是常矩阵 AA。按照这些约定,复合映射的导数可通过普通的矩阵乘法计算。(ocw.mit.edu)

可微性与局部近似

雅可比矩阵的核心含义体现在

f(a+h)=f(a)+Jf(a)h+o(∥h∥),h→0.f(a+h)=f(a)+J_f(a)h+o(\|h\|), \qquad h\to0.

余项除以 ∥h∥\|h\| 后趋于零。这一条件描述的是所有输入坐标同时变化的情形,而不仅仅是沿坐标轴方向的变化。因此,当这一近似成立时,雅可比矩阵就表示全导数。(math.cmu.edu)

所有偏导数在某一点存在,本身并不意味着函数在该点可微。一个常用的充分条件是:各偏导数在该点的某个邻域内存在,并且在该点连续。这一区别很重要,因为即使偏导数组成的矩阵存在,它也未必能给出有效的一阶近似。(math.cmu.edu)

例如,考虑多项式映射

f(x,y)=(x2+y,xy).f(x,y)=(x^2+y,xy).

直接求导得

Jf(x,y)=(2x1yx).J_f(x,y)= \begin{pmatrix} 2x&1\\ y&x \end{pmatrix}.

在 (1,2)(1,2) 处,输入位移 (h,k)(h,k) 产生的输出变化为

f(1+h,2+k)−f(1,2)=(2h+k, 2h+k)+(h2,hk).f(1+h,2+k)-f(1,2) =(2h+k,\,2h+k)+(h^2,hk).

其中的线性项恰好是 Jf(1,2)(h,k)TJ_f(1,2)(h,k)^{\mathsf T},其余项则是高阶项。

复合映射与逆映射

对于可微映射 f:Rn→Rmf:\mathbb{R}^n\to\mathbb{R}^m 和 g:Rm→Rpg:\mathbb{R}^m\to\mathbb{R}^p,多元链式法则给出

Jg∘f(a)=Jg(f(a))Jf(a).J_{g\circ f}(a)=J_g(f(a))J_f(a).

乘法顺序至关重要:右侧矩阵先将输入位移转换为中间位移,左侧矩阵再将其转换为输出位移。两者的维数分别为 m×nm\times n 和 p×mp\times m。(live.ocw.mit.edu)

反函数定理将方形雅可比矩阵与局部可逆性联系起来。如果 ff 在 aa 附近连续可微,且 Jf(a)J_f(a) 可逆,那么 ff 在适当的邻域上存在连续可微的逆映射,并且

Jf−1(f(a))=[Jf(a)]−1.J_{f^{-1}}(f(a))=[J_f(a)]^{-1}.

右侧是一个逆矩阵。这一结论是局部的,并不保证全局可逆性。导数为零也不必然意味着逆映射不存在:x↦x3x\mapsto x^3 是可逆的,只是其逆函数在零点不可微。(math.colostate.edu)

行列式与变量替换

当 m=nm=n 时,行列式 det⁡Jf(a)\det J_f(a) 称为雅可比行列式。它必须与矩阵本身区分开来;非方形的雅可比矩阵没有通常意义下的行列式。其绝对值衡量可微坐标变换对局部体积的缩放倍数,而其符号则区分变换是保持定向还是反转定向。(live.ocw.mit.edu)

设 T:U→VT:U\to V 是 Rn\mathbb{R}^n 中两个开集之间的连续可微双射,且其逆映射也连续可微。对于满足适当条件的被积函数 qq,变量替换公式为

∫Vq(x) dx=∫Uq(T(u)) ∣det⁡JT(u)∣ du.\int_V q(x)\,dx = \int_U q(T(u))\,|\det J_T(u)|\,du.

绝对值不可省略,因为通常的体积不带正负号。这一公式推广了一维积分中的换元法。(live.ocw.mit.edu)

对于极坐标,

T(r,θ)=(rcos⁡θ,rsin⁡θ),JT=(cos⁡θ−rsin⁡θsin⁡θrcos⁡θ).T(r,\theta)=(r\cos\theta,r\sin\theta), \qquad J_T= \begin{pmatrix} \cos\theta&-r\sin\theta\\ \sin\theta&r\cos\theta \end{pmatrix}.

其行列式为 rr,因此当 r>0r>0 时,dx dy=r dr dθdx\,dy=r\,dr\,d\theta。应用这一公式时,需要选取适当的角坐标范围,使变换在所考虑的区域上一一对应;原点是这一坐标系的奇点。(live.ocw.mit.edu)

数值计算与机器学习

对于非线性方程组 F(x)=0F(x)=0,牛顿法通过线性方程组

JF(xk)sk=−F(xk),xk+1=xk+skJ_F(x_k)s_k=-F(x_k), \qquad x_{k+1}=x_k+s_k

确定修正量 sks_k。它求解的是局部线性近似,而不是直接求解原来的非线性方程。在实现时,可以直接求出修正量,而无需显式计算雅可比矩阵的逆矩阵。(web.mit.edu)

在自动微分中,不必存储完整矩阵。前向模式微分计算雅可比矩阵与向量的乘积 Jf(x)vJ_f(x)v;反向模式则计算雅可比矩阵的转置与向量的乘积 Jf(x)TwJ_f(x)^{\mathsf T}w。两者分别传播输入扰动和输出敏感度。完整的雅可比矩阵可以逐列或逐行构建。(docs.jax.dev)

这一区别在机器学习中十分重要。反向传播反复应用反向模式乘积,求得标量损失函数对参数的梯度,从而避免显式构建每个中间环节的雅可比矩阵。相比之下,海森矩阵由标量函数的二阶导数组成;它可以看作该函数梯度的雅可比矩阵。(live.ocw.mit.edu)