偏导数是多元函数对其中一个变量的导数,求导时将其余变量视为常数。它将一元函数的求导推广到多元微积分;在多元情形中,不同输入可以对应不同的变化率。偏导数描述函数对各坐标变化的敏感程度,也是构造梯度、切线性近似和向量值函数导数的基本分量。(ocw.mit.edu)
定义与记号
设 (f:U\subseteq\mathbb R^n\to\mathbb R),其中 (U) 为开集,且 (\mathbf a\in U)。函数对第 (i) 个坐标的偏导数定义为如下极限:
[ \frac{\partial f}{\partial x_i}(\mathbf a) =\lim_{h\to0} \frac{f(\mathbf a+h\mathbf e_i)-f(\mathbf a)}{h}, ]
前提是该极限存在且为有限实数。这里,(\mathbf e_i) 是第 (i) 个分量为 (1)、其余分量均为零的坐标向量。差商中只有 (x_i) 发生变化。常用记号包括 (\partial_i f)、(f_{x_i}) 和 (D_i f)。符号 (\partial) 用来区分偏导运算与通常用 (d) 表示的一元求导运算。(openstax.org)
对于 (z=f(x,y)),(f_x(a,b)) 的几何意义是:函数图像与平面 (y=b) 相交所得曲线在对应点处、沿 (x) 增大方向的斜率。同样,(f_y(a,b)) 描述的是平面 (x=a) 所截曲线的斜率。这些斜率描述的是曲面的特定截面,而不是曲面在所有方向上的变化情况。(ocw.mit.edu)
计算
偏导数遵循通常的求导法则,包括线性法则、乘积法则、商法则和链式法则。仅涉及其他坐标的表达式按常数处理。例如,多项式
[ f(x,y)=x^2y+3y^2 ]
的偏导数为
[ f_x=2xy,\qquad f_y=x^2+6y. ]
因此,(f_x(1,2)=4),而 (f_y(1,2)=13)。这一差别反映了同一函数对两个变量各自变化的不同敏感程度。如果写出 (f_x) 时没有指定求值点,它通常表示一个新函数,其定义域为相应偏导数存在的所有点。(openstax.org)
偏导数与可微性
一个函数在某点的所有一阶偏导数都存在,并不能仅凭这一点就断定函数在该点连续或可微。逐坐标取极限只考察沿坐标轴方向的直线;多元函数的可微性则要求用同一个线性映射来近似任意微小位移引起的函数变化。对于可微的标量值函数,
[ f(\mathbf a+\mathbf h) =f(\mathbf a)+ \sum_{i=1}^{n}f_{x_i}(\mathbf a)h_i +o(|\mathbf h|). ]
余项相对于 (|\mathbf h|) 可以忽略不计。一个常用的充分条件是:各一阶偏导数在该点的某个邻域内存在,并且在该点连续。这是充分条件,而不是必要条件。(openstax.org)
对于二元函数,相应的切平面为
[ z=f(a,b)+f_x(a,b)(x-a)+f_y(a,b)(y-b). ]
它给出一阶近似,而每个偏导数只提供这一近似中的一个系数。(openstax.org)
梯度、方向导数与总变化
在笛卡尔坐标系中,标量函数的各一阶偏导数组成其梯度:
[ \nabla f=(f_{x_1},\ldots,f_{x_n}). ]
若 (f) 可微,则它沿单位向量 (\mathbf u) 的方向导数为
[ D_{\mathbf u}f=\nabla f\cdot\mathbf u, ]
其中点号表示欧几里得内积。因此,偏导数就是沿坐标轴方向的方向导数。当梯度不为零时,梯度方向是所有单位方向中函数瞬时增长最快的方向。(openstax.org)
全导数考虑所有发生变化的输入。若 (z=f(x(t),y(t))),由链式法则可得
[ \frac{dz}{dt} =f_x\frac{dx}{dt}+f_y\frac{dy}{dt}. ]
因此,保持 (y) 不变时求导,与沿着 (y) 也在变化的路径求导,并不相同。对于向量值函数,各一阶偏导数排列成雅可比矩阵;函数可微时,该矩阵表示其导数。(openstax.org)
高阶导数
反复求偏导可以得到二阶及更高阶的导数。为明确求导顺序,定义
[ f_{xy}:=\frac{\partial}{\partial y} \left(\frac{\partial f}{\partial x}\right). ]
由于涉及两个不同的坐标,这称为混合偏导数。克莱罗定理指出,若两个二阶混合偏导数在某个邻域内存在且连续,则它们相等。如果不满足适当的正则性条件,交换求导顺序可能会改变结果。(openstax.org)
各二阶偏导数组成海森矩阵:
[ H_{ij} =\frac{\partial}{\partial x_j} \left(\frac{\partial f}{\partial x_i}\right). ]
对于二阶连续可微函数,该矩阵是对称的,并描述局部近似中的二次项。在数学优化中,海森矩阵提供的信息有助于区分局部极小值点、局部极大值点和鞍点。(live.ocw.mit.edu)
应用与计算方法
偏微分方程描述未知多元函数与其偏导数之间的关系。例如,一维热方程
[ \frac{\partial T}{\partial t} =\alpha\frac{\partial^2T}{\partial x^2} ]
描述理想化均匀介质中的温度演变,其中热扩散率 (\alpha) 为常数。对时间求导时保持位置不变,对空间坐标求导时保持时间不变。这类方程在数学物理学中占有核心地位。(ocw.mit.edu)
在机器学习中,损失函数对模型参数的偏导数组成梯度下降所用的梯度。自动微分通过对基本运算逐步应用链式法则来计算这些导数;反向传播则将这一原理用于神经网络训练。另一种方法是有限差分,通过扰动一个坐标来估计偏导数。其精度取决于步长、函数的光滑性和浮点舍入误差,这与通过变换数学表达式来求导的符号微分不同。(cs.cornell.edu)