侷限、幻覺與風險

著作權與大型語言模型(copyright and LLMs)

現代模型用極其龐大的文字與影像訓練,其中許多是由握有著作權、卻從沒被徵詢過的人所寫或所畫。這帶出兩個各自獨立的法律問題。第一,未經許可就拿受保護的作品來訓練,合不合法——有人以「合理使用」或「研究」為它辯護,作者、藝術家與新聞機構則反對,說自己的勞動被拿走了。第二,模型的輸出本身會不會構成侵權,例如複製出一段文字或一種可辨識的風格,近到足以取代原作。

這些都還沒有定論,答案因國家而異,此刻正在法院與立法機構裡被激烈攻防。對於使用這些工具的人,務實的提醒有兩點:輸出偶爾會把訓練文本回響得太接近,因而造成法律風險;生成材料的來源出處又很模糊,所以在商業發布前查證是值得的。這是一條法律與倫理的前沿,而不是一個已解決的工程問題,你今天據以打造的規則,明天可能就變了。