JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

狀態空間模型:機率的骨幹

在深度學習之前,這個領域是在線性高斯與點過程的潛在變數模型上磨出直覺的 — 而這些模型至今仍是每一種更花俏方法都必須超越的誠實基準。

潛在線性動力系統

你在第二冊認識了狀態空間模型,把它當作估計工具 — 在動力矩陣與觀測矩陣已給定的情況下,跑一個卡爾曼濾波器來追蹤狀態。前沿把問題翻轉過來:這些參數是未知的,而整件事的重點就是要從資料中學出動力學。這種重新框架 — 從對已知系統做濾波,轉為辨識一個未知的系統 — 正是資料驅動系統辨識的精髓。

一個潛在狀態空間模型:未觀測的低維狀態在學到的動力學之下演化,並透過一個發射模型生成觀測到的放電。所謂學習,就是同時還原狀態路徑與動力學。

x_{t+1} = A\,x_{t} + B\,u_{t} + w_{t}, \;\; w_{t}\sim\mathcal{N}(0,Q); \qquad y_{t}\mid x_{t} \sim \mathrm{Poisson}\!\bigl(\exp(C\,x_{t}+d)\bigr)

一個帶點過程讀出的潛在線性動力系統。A 是動力學、C 是負載,而放電計數 yₜ 服從對數線性速率的卜瓦松分布。與第二冊的卡爾曼濾波器不同,這裡的 A、B、C、Q 全都是學出來的。

卜瓦松對數線性讀出很關鍵:放電是計數,而非高斯電壓,因此乾淨的線性高斯卡爾曼遞迴不再有精確的封閉形式。就這一項改動 — 一個非共軛的觀測模型 — 便迫使這個領域走向本指南其餘部分要談的近似推論機制。

學出模型

在參數未知的情況下,擬合會在兩件工作之間交替:在當前參數下推論潛在路徑,再在推論出的路徑下更新參數。這就是期望最大化 — E 步驟做貝氏平滑(線性高斯情形下是RTS 平滑器,帶放電時則是點過程濾波器),M 步驟做最大概似的參數更新。它是經典、可解釋的主力工具。

對於非高斯的情形,精確平滑是難解的,因此現代的擬合採用變分推論:假設一個對潛在路徑而言可處理的近似後驗,並透過最大化資料概似的一個下界,把它推向真正的後驗。這種對神經動力學的變分處理,正是從經典 LDS 通往下一則指南那些深度模型的橋樑 — 兩者最大化的是同一個目標。

\log p(y) \;\ge\; \mathbb{E}_{q(x\mid y)}\!\bigl[\log p(y\mid x)\bigr] \;-\; \mathrm{KL}\!\bigl(q(x\mid y)\,\|\,p(x)\bigr) \;=\; \mathcal{L}_{\mathrm{ELBO}}

證據下界。第一項獎勵從推論出的潛在狀態重建放電;KL 項則讓近似後驗貼近動力先驗 p(x)。最大化它,便同時擬合了狀態與模型。

不預設動力學的平滑:GPFA

有時你根本不想承諾一個參數化的動力矩陣 — 你只想要平滑、去雜訊的軌跡來觀察高斯過程因子分析(GPFA)做的正是這件事:它不用矩陣 A,而是在每個潛在維度上放置一個高斯過程先驗,透過一個時間尺度、而非明確的流來編碼平滑性。它至今仍是視覺化族群結構的愛用首選,正因為它施加的假設如此之少。

k(t, t') = \sigma^{2}\,\exp\!\left(-\frac{(t-t')^{2}}{2\,\tau^{2}}\right)

GPFA 的平方指數核:時間尺度 τ 設定一個潛在維度可以多快改變,σ² 設定其尺度。時間上的相關性取代了明確的動力方程 — 有平滑性,卻不做機制上的承諾。

從 LDS 到序列變分自編碼器

單一個線性系統往往太過僵硬 — 真實的神經動力學是非線性的。現代的做法保留狀態空間的骨架,卻讓一個神經網路來參數化各個部件,並以序列變分自編碼器(seq-VAE)的形式端到端訓練:一個編碼器推論出對潛在路徑的分布,一個學到的生成器把它向前推演,而你方才認識的 ELBO 就是損失函數。這正是那個著名的 LFADS 模型所填入的模板 — 也是下一則指南的主題。