定义与记号
设 f:U⊆Rn→Rm,其中 U 是开集,并记
f(x)=(f1(x),…,fm(x)).
如果相应的偏导数在 a∈U 处存在,则雅可比矩阵为
Jf(a)=∂x1∂f1(a)⋮∂x1∂fm(a)⋯⋱⋯∂xn∂f1(a)⋮∂xn∂fm(a).
因此,Jf(a) 有 m 行、n 列:各行对应输出分量,各列对应输入坐标。常用记号还包括 Df(a) 和 f′(a),尤其是在已经确定函数可微时。(math.jhu.edu)
采用列向量约定时,标量值函数的雅可比矩阵是一个 1×n 矩阵,等于其梯度的转置:
Jf(a)=∇f(a)T.
当 n=m=1 时,雅可比矩阵退化为通常的一元导数。对于仿射映射 f(x)=Ax+b,它就是常矩阵 A。按照这些约定,复合映射的导数可通过普通的矩阵乘法计算。(ocw.mit.edu)
可微性与局部近似
雅可比矩阵的核心含义体现在
f(a+h)=f(a)+Jf(a)h+o(∥h∥),h→0.
余项除以 ∥h∥ 后趋于零。这一条件描述的是所有输入坐标同时变化的情形,而不仅仅是沿坐标轴方向的变化。因此,当这一近似成立时,雅可比矩阵就表示全导数。(math.cmu.edu)
所有偏导数在某一点存在,本身并不意味着函数在该点可微。一个常用的充分条件是:各偏导数在该点的某个邻域内存在,并且在该点连续。这一区别很重要,因为即使偏导数组成的矩阵存在,它也未必能给出有效的一阶近似。(math.cmu.edu)
例如,考虑多项式映射
f(x,y)=(x2+y,xy).
直接求导得
Jf(x,y)=(2xy1x).
在 (1,2) 处,输入位移 (h,k) 产生的输出变化为
f(1+h,2+k)−f(1,2)=(2h+k,2h+k)+(h2,hk).
其中的线性项恰好是 Jf(1,2)(h,k)T,其余项则是高阶项。
复合映射与逆映射
对于可微映射 f:Rn→Rm 和 g:Rm→Rp,多元链式法则给出
Jg∘f(a)=Jg(f(a))Jf(a).
乘法顺序至关重要:右侧矩阵先将输入位移转换为中间位移,左侧矩阵再将其转换为输出位移。两者的维数分别为 m×n 和 p×m。(live.ocw.mit.edu)
反函数定理将方形雅可比矩阵与局部可逆性联系起来。如果 f 在 a 附近连续可微,且 Jf(a) 可逆,那么 f 在适当的邻域上存在连续可微的逆映射,并且
Jf−1(f(a))=[Jf(a)]−1.
右侧是一个逆矩阵。这一结论是局部的,并不保证全局可逆性。导数为零也不必然意味着逆映射不存在:x↦x3 是可逆的,只是其逆函数在零点不可微。(math.colostate.edu)
行列式与变量替换
当 m=n 时,行列式 detJf(a) 称为雅可比行列式。它必须与矩阵本身区分开来;非方形的雅可比矩阵没有通常意义下的行列式。其绝对值衡量可微坐标变换对局部体积的缩放倍数,而其符号则区分变换是保持定向还是反转定向。(live.ocw.mit.edu)
设 T:U→V 是 Rn 中两个开集之间的连续可微双射,且其逆映射也连续可微。对于满足适当条件的被积函数 q,变量替换公式为
∫Vq(x)dx=∫Uq(T(u))∣detJT(u)∣du.
绝对值不可省略,因为通常的体积不带正负号。这一公式推广了一维积分中的换元法。(live.ocw.mit.edu)
对于极坐标,
T(r,θ)=(rcosθ,rsinθ),JT=(cosθsinθ−rsinθrcosθ).
其行列式为 r,因此当 r>0 时,dxdy=rdrdθ。应用这一公式时,需要选取适当的角坐标范围,使变换在所考虑的区域上一一对应;原点是这一坐标系的奇点。(live.ocw.mit.edu)
数值计算与机器学习
对于非线性方程组 F(x)=0,牛顿法通过线性方程组
JF(xk)sk=−F(xk),xk+1=xk+sk
确定修正量 sk。它求解的是局部线性近似,而不是直接求解原来的非线性方程。在实现时,可以直接求出修正量,而无需显式计算雅可比矩阵的逆矩阵。(web.mit.edu)
在自动微分中,不必存储完整矩阵。前向模式微分计算雅可比矩阵与向量的乘积 Jf(x)v;反向模式则计算雅可比矩阵的转置与向量的乘积 Jf(x)Tw。两者分别传播输入扰动和输出敏感度。完整的雅可比矩阵可以逐列或逐行构建。(docs.jax.dev)
这一区别在机器学习中十分重要。反向传播反复应用反向模式乘积,求得标量损失函数对参数的梯度,从而避免显式构建每个中间环节的雅可比矩阵。相比之下,海森矩阵由标量函数的二阶导数组成;它可以看作该函数梯度的雅可比矩阵。(live.ocw.mit.edu)