生成式AI與大型語言模型
上下文視窗(context window)
/ KON-tekst WIN-doh /
上下文視窗,是語言模型在同一時刻所能「看在眼裡」的文字總量——是它對單次對話或單次請求的工作記憶。此刻模型所能納入考量的一切,都必須裝進這扇窗裡:你的問題、你貼進來的任何文件、系統提示,以及到目前為止的整段對話。它以「詞元」(大致是詞的碎片)計量,可能是幾千個詞元,在更新的模型裡則可達幾十萬。凡落在窗內的,模型都能留意到;凡落在窗外的,它就根本看不見。
想像一張大小固定的書桌。你一次只能攤開那麼多頁;要給新的騰地方,舊的幾頁便會從桌沿滑落、消失不見。一段長對話正是這般光景:一旦對話長過了視窗,最早的幾輪便從視野中跌出,於是模型是真的不再知道開頭說了什麼了——哪怕你記得清清楚楚。這不是人類意義上的「遺忘」;那些字,只是不再擺在它眼前罷了。
兩點要誠實說。更大的視窗不等於記憶:什麼都不會帶進下一段獨立的對話裡去,在那裡模型又從一張白紙重新開始。而視窗大,也不意味著模型把窗裡的內容用得一樣好——研究發現,模型往往最留意一段長上下文的開頭與結尾,卻可能忽略埋在中間的細節(即「迷失在中間」效應)。地方更寬敞有幫助,卻不是「會被留意」的保證。
在一段長對話的開頭,你說「我家狗叫Pixel」。四萬字之後,越過了視窗的邊緣,你問「我家狗叫什麼名字?」——模型卻一無所知,因為那句話早已從桌上滑落。它並非健忘;那些字,只是不再落在它的視野裡了。
越過視窗的邊緣,先前的文字便從視野中徹底消失。
大的上下文視窗不是長期記憶。在同一段對話裡,它把一切看在眼裡,但到了下一段對話便清空重置。而更長,也不會自動地被用得更好——模型可能「丟失」那些被放在超長上下文中段的事實。
又稱
另見