同一個提示,兩種答案
到現在你已經親身感受過提示敏感度(prompt sensitivity):改個欄位名稱、把兩句話對調、或把「列出」換成「逐一列舉」,輸出就變了。連重排你的少樣本範例也可能改變結果。這是模型「把文字對應到接續」這種運作方式的固有特性——它並不會在你的措辭底下,去還原出某個標準的「真實本意」。
文本被切分为词元,映射为词元编号,再转为嵌入向量。
用結構減少晃動
你無法消除敏感度,但能縮小它。最大的槓桿是你在第一篇見過的清晰度:一個毫不含糊的指令,能讓它在其間晃動的「其他讀法」變少。第二個槓桿是一致的分隔符與格式——把資料圍起來、為段落命名、固定輸出結構——這能消除那些「小改寫」會趁虛而入的細微含糊處。
第三個槓桿是提示模板。一旦某種措辭有效,就把它凍結進模板,讓請求之間唯一會變的,只有你填進空位的輸入。這就把一段脆弱、僥倖的措辭,轉化成一個穩定、可重複使用的成品——也給了你一個「找到更好做法時」可以集中改進的地方。
禮貌、施壓與情緒提示
你會聽到一些坊間說法,說加上「請」、給點想像中的小費、或加一句「這對我的職涯非常重要」能改善答案。關於情緒與禮貌提示(emotion and politeness prompts),誠實的全貌是好壞參半:這類提示有時會把模型推向更謹慎、更周全的回答,但效果很小、不可靠,且因模型與版本而異。它是一個微弱的微調,不是一根槓桿。
所以把心力花在「可靠地有回報」的地方——清楚的指令、好的範例、扎實的結構——並把情緒化措辭當成「衝刺最後一個百分點」的實驗,而非一套策略。如果禮貌的語氣讓你自己的提示更好讀、更好維護,光這一點就夠當理由了;只是別指望它能拯救一個含糊的請求。
像測試程式那樣測試提示
正因為敏感度的存在,一個正經的提示值得配一個小測試集:一小把輸入,每個都搭配你會接受的答案。把提示跑過全部這些輸入,而不只是你腦中那一個案例,你就能抓到躲在「我試的時候有用」背後的失敗。
- 蒐集 5 到 20 個有代表性的輸入,包含你最害怕的那些邊界案例。
- 為每個輸入寫下「好答案長什麼樣」——也就是你的驗收標準。
- 一次只改一件事(措辭、某個範例、格式),再把整組重跑一遍。
- 保留「在整組上表現最好」的版本,而不是「只在某次示範上漂亮過關」的版本。
数据集被划分为训练集、验证集和测试集。
這就是「以評估驅動的提示」的種子:沒有測試集就改提示,等於在黑暗中編輯。有了測試集,每次微調都變成一個可衡量的下注。
提示在更大的版圖中的位置
提示是引導模型最快、最便宜的方式,而對於極廣泛的任務來說,它就是你需要的全部。當光靠提示一直力有未逮時——模型缺乏新鮮的事實,或某項冷門技能怎麼也學不牢——那就是該動用更重量級工具(如檢索或微調)的訊號。但即便到了那一步,這個系列養成的習慣依然受用:清楚的指令、好的範例、扎實的結構、誠實的測試,會讓其他每一種技術都運作得更好。
一条先检索文档、再将其加入提示词后生成的流程。