JOVANA
Explore Library Glossary Getting Started Three Levels Fields How it works Mission
Join the mission
All guides

讓提示更穩健:敏感度、風格與迭代

為什麼措辭會讓結果晃動、面對禮貌與格式該怎麼辦,以及如何把提示當成真正的成品來測試。

同一個提示,兩種答案

到現在你已經親身感受過提示敏感度(prompt sensitivity):改個欄位名稱、把兩句話對調、或把「列出」換成「逐一列舉」,輸出就變了。連重排你的少樣本範例也可能改變結果。這是模型「把文字對應到接續」這種運作方式的固有特性——它並不會在你的措辭底下,去還原出某個標準的「真實本意」。

每一处措辞改动都会改写模型实际读到的词元序列——把'list'换成'enumerate'或调换语序,都会喂给它不同的输入,于是答案也随之改变。

文本被切分为词元,映射为词元编号,再转为嵌入向量。

用結構減少晃動

你無法消除敏感度,但能縮小它。最大的槓桿是你在第一篇見過的清晰度:一個毫不含糊的指令,能讓它在其間晃動的「其他讀法」變少。第二個槓桿是一致的分隔符與格式——把資料圍起來、為段落命名、固定輸出結構——這能消除那些「小改寫」會趁虛而入的細微含糊處。

第三個槓桿是提示模板。一旦某種措辭有效,就把它凍結進模板,讓請求之間唯一會變的,只有你填進空位的輸入。這就把一段脆弱、僥倖的措辭,轉化成一個穩定、可重複使用的成品——也給了你一個「找到更好做法時」可以集中改進的地方。

禮貌、施壓與情緒提示

你會聽到一些坊間說法,說加上「請」、給點想像中的小費、或加一句「這對我的職涯非常重要」能改善答案。關於情緒與禮貌提示(emotion and politeness prompts),誠實的全貌是好壞參半:這類提示有時會把模型推向更謹慎、更周全的回答,但效果很小、不可靠,且因模型與版本而異。它是一個微弱的微調,不是一根槓桿。

所以把心力花在「可靠地有回報」的地方——清楚的指令、好的範例、扎實的結構——並把情緒化措辭當成「衝刺最後一個百分點」的實驗,而非一套策略。如果禮貌的語氣讓你自己的提示更好讀、更好維護,光這一點就夠當理由了;只是別指望它能拯救一個含糊的請求。

像測試程式那樣測試提示

正因為敏感度的存在,一個正經的提示值得配一個小測試集:一小把輸入,每個都搭配你會接受的答案。把提示跑過全部這些輸入,而不只是你腦中那一個案例,你就能抓到躲在「我試的時候有用」背後的失敗。

  1. 蒐集 5 到 20 個有代表性的輸入,包含你最害怕的那些邊界案例。
  2. 為每個輸入寫下「好答案長什麼樣」——也就是你的驗收標準。
  3. 一次只改一件事(措辭、某個範例、格式),再把整組重跑一遍。
  4. 保留「在整組上表現最好」的版本,而不是「只在某次示範上漂亮過關」的版本。
和机器学习一样,留出一组固定的测试输入,让每次提示词调整都在所有用例上接受度量,而不是凭一次侥幸的运行下结论。

数据集被划分为训练集、验证集和测试集。

這就是「以評估驅動的提示」的種子:沒有測試集就改提示,等於在黑暗中編輯。有了測試集,每次微調都變成一個可衡量的下注。

提示在更大的版圖中的位置

提示是引導模型最快、最便宜的方式,而對於極廣泛的任務來說,它就是你需要的全部。當光靠提示一直力有未逮時——模型缺乏新鮮的事實,或某項冷門技能怎麼也學不牢——那就是該動用更重量級工具(如檢索或微調)的訊號。但即便到了那一步,這個系列養成的習慣依然受用:清楚的指令、好的範例、扎實的結構、誠實的測試,會讓其他每一種技術都運作得更好。

当仅靠提示词无法提供最新事实时,检索增强生成会先取回相关文档并塞进提示词,再让模型作答。

一条先检索文档、再将其加入提示词后生成的流程。