多元与向量微积分

梯度(gradient)

再次站到那座高度取决于你东西位置和南北位置的小山上。在你脚下,存在一个地面爬升最陡的方向——就像水若倒流、向上坡奔涌时会走的方向。梯度正是一个恰好指向那个方向的箭头:增长最快的方向。它的长度告诉你这条最陡上坡有多陡。从它转过九十度,你就沿着等高线行走,既不升也不降。

用数学语言说,函数 f(x, y, ...) 的梯度把它所有的偏导数捆成一个向量:grad f = (∂f/∂x, ∂f/∂y, ...),常用倒三角符号写作 ∇f。每个分量是沿某一坐标轴的斜率;合在一起就拼出那个唯一的最陡上升方向,而且梯度始终垂直于 f 保持不变的那些等值线或等值面。

这个概念是现代优化与机器学习的引擎。要寻找代价函数的极小值——比如训练一个模型——你就反复沿梯度的相反方向、向下坡迈步,这套做法叫梯度下降。一个诚实的提醒:梯度只描述脚下这一小片地形的走势。一路顺着它下坡,可能让你停在附近某个低谷里,而那并不是全局最低点。

grad f = ( df/dx , df/dy ) e.g. f = x^2 + y^2 => grad f = (2x, 2y)

对 f = x^2 + y^2,梯度 (2x, 2y) 沿背离原点的方向指出,即最陡的上坡方向。

梯度指向增长最快的方向,因此优化时要朝它的相反方向(下坡)移动以减小代价。

又称
gradgradient vector梯度向量梯度