全导数(total derivative)
各个偏导只回答某一方向的问题;全导数则一次回答所有方向。它是函数在某点附近的唯一最佳线性逼近——切线在多元情形下的替身。一元导数是一个数(斜率),而 f 在某点的全导数是一个线性映射,一台接受任意位移向量、返回函数预测变化量的机器。
对标量函数 f(x, y),全导数是偏导排成的行 [partial f / partial x, partial f / partial y];把一小步 (dx, dy) 喂给它就得到 df = (partial f / partial x) dx + (partial f / partial y) dy,即 f 实际变化的最佳线性估计。对向量值映射,这一行就变成完整的雅可比矩阵。其定义性质是:这个线性估计的误差比步长更快地缩小:当 h -> 0 时 f(a + h) - f(a) - Df(a) h 是 o(|h|)。这个小 o 条件正是多元情形下“可微”的含义,它确实比仅仅拥有偏导更强。
这正是你真正想要的对象。梯度是全导数披上向量外衣的样子;链式法则是全导数的复合(矩阵相乘);误差传播、牛顿法以及动力系统的线性化都依赖全导数。把导数看成一个线性映射、而非一堆偏导,是让多元与向量微积分其余部分汇成一幅连贯图景的概念性飞跃。
对于 f(x, y) = x^2 + 3 x y,在 (1, 2) 处的全导数是行 [2x + 3y, 3x] = [8, 3]。一步 (dx, dy) 预测使 f 改变 8 dx + 3 dy;在 (1, 2) 附近这个线性公式以一阶逼近真实曲面。
全导数是单个线性映射(这里是一个行向量),它一次预测每个方向上的变化。
拥有全部偏导并不保证全导数存在;你还需要线性逼近的误差为 o(|h|)。当偏导在该点附近连续时,可微自动成立——这是常用的充分条件。