影像形成與基礎
數位影像
數位影像是一格一格的數字陣列,用來代表一張圖。底片照片是銀鹽顆粒的連續塗布,而數位影像則被離散化了兩次:在空間上(場景被切成有限多個像素位置的陣列)以及在數值上(每個像素所量測到的光被四捨五入到有限多個等級)。結果是一張你可以精確儲存、複製與運算的表格,往後的處理不再因傳遞而額外損失。
嚴格來說,灰階數位影像是一個定義在有限整數網格上的函數 I(x, y),把每個像素座標對應到一個強度——也就是一個二維數字矩陣。彩色影像是這種矩陣的堆疊,每個通道一張,因此天然是一個三維陣列(高 x 寬 x 通道數),在現代視覺程式中常稱為張量(tensor)。影片再加上一條時間軸,成為「高 x 寬 x 通道 x 幀」。因此任何數位影像的兩項要素都是:空間座標(取樣落在何處)以及該位置上所儲存的數值(光有多強、是什麼顏色)。
正是這種「就是一堆數字」的觀點使電腦視覺成為可能:從模糊化、邊緣偵測,到執行卷積網路(CNN)或視覺 Transformer(ViT),每一個運算都是對這些數字做算術。ResNet 並沒有「看到」一隻貓;它是透過學到的濾波器,對像素值做乘加運算。把這個抽象想清楚——影像是定義在網格上、經過取樣與量化的函數——就能釐清為何取樣率、位元深度與色彩空間都會改變下游演算法所能還原的內容。
索引慣例很容易出錯:影像處理函式庫通常以 I[row, column] = I[y, x] 來定址像素,但幾何與相機數學使用 (x, y) 且 x 為水平方向。兩者混用會在無聲無息中把影像轉置或把座標對調。請務必確認第一個索引指的是列(垂直)還是 x(水平)。