多元與向量微積分
梯度(gradient)
再次站到那座高度取決於你東西位置和南北位置的小山上。在你腳下,存在一個地面爬升最陡的方向——就像水若倒流、向上坡奔湧時會走的方向。梯度正是一個恰好指向那個方向的箭頭:增長最快的方向。它的長度告訴你這條最陡上坡有多陡。從它轉過九十度,你就沿著等高線行走,既不升也不降。
用數學語言說,函數 f(x, y, ...) 的梯度把它所有的偏導數捆成一個向量:grad f = (∂f/∂x, ∂f/∂y, ...),常用倒三角符號寫作 ∇f。每個分量是沿某一座標軸的斜率;合在一起就拼出那個唯一的最陡上升方向,而且梯度始終垂直於 f 保持不變的那些等值線或等值面。
這個概念是現代最佳化與機器學習的引擎。要尋找代價函數的極小值——比如訓練一個模型——你就反覆沿梯度的相反方向、向下坡邁步,這套做法叫梯度下降。一個誠實的提醒:梯度只描述腳下這一小片地形的走勢。一路順著它下坡,可能讓你停在附近某個低谷裡,而那並不是全域最低點。
grad f = ( df/dx , df/dy ) e.g. f = x^2 + y^2 => grad f = (2x, 2y)
對 f = x^2 + y^2,梯度 (2x, 2y) 沿背離原點的方向指出,即最陡的上坡方向。
梯度指向增長最快的方向,因此最佳化時要朝它的相反方向(下坡)移動以減小代價。
又稱
另見