重磅出刊

比提示工程更重要,「上下文工程」Context Engineering怎麼做?

如果AI表現不穩定,有時候問題可能不在提示詞。瞭解「上下文工程」(Context Engineering)的運作邏輯,優化AI的數位辦公桌、打造可靠的自動化生產力。

LLM-AI-提示-上下文 圖片來源:Shutterstock
其他
  • 天下Web only
加入Google偏好來源 在Google搜尋優先看到天下

AI代理明明對你的產品瞭若指掌。你寫了超詳細提示詞、上傳文件,測試好幾十次,客戶詢問價格時,AI代理卻報出上一季的價格,或對一個3年的老客戶推薦入門試用版。

最令人沮喪的是,正確資訊就在你的提示詞第347行寫得清清楚楚,只是被AI忽視掉了。

研究人員說,這是因為大語言模型(LLM)的注意力曲線是U型的,它們能可靠地處理輸入開頭與結尾的資訊,但對於埋在中間的內容,表現會下降30%以上。你為了回應客戶投訴而精心加入的那條規則,模型很有可能從來沒看到。

華頓商學院生成式AI實驗室發現,如果對同一個問題做100次測試,在嚴格要求準確度的情況下,大多數提示詞的表現「只比隨便亂猜好一點」,而且不夠可靠。

你的提示詞很可能一點問題都沒有。許多AI團隊現在把同樣或更多時間花在改善在提示詞的周邊環境上,也就是「上下文」(Context)。

什麼是上下文工程(Context Engineering)?

OpenAI共同創辦人卡帕西(Andrej Karpathy)比喻說,「LLM就像一種新作業系統。LLM是CPU,上下文窗口(Context Window)則是記憶體(RAM)。」

更簡單的說,你的AI是一個員工,「上下文窗口」是他的辦公桌。桌上有的東西,像是螢幕上的客戶檔案、印出來的活動簡報、塞在抽屜裡的品牌指南,就是他目前能用的所有資料。辦公桌會被堆滿,AI的記憶體也是。

廣告

「提示詞」等於你遞給他的一張便利貼。真正決定他能不能幫到客戶的關鍵,是他桌上那疊資料夾和他開著的CRM系統。

用Anthropic在2025年的說法,上下文工程就是「在LLM推理過程中,規劃、維持token品質與數量最佳化的策略」。

用白話說,就是在對的時間,用對的格式,給AI對的資訊。不能多,剛好就可以了。

為什麼你的提示詞沒用?

AI表現不好時,很多人的直覺反應是增加更多規則,讓提示詞愈來愈長,200行、400行甚至500行。但更多提示詞愈長不代表AI表現會跟著提升。為什麼?

1. 中間的資訊被忽略

Chroma實驗室2025年的研究測試多款模型,發現「模型不是均勻地使用上下文,輸入長度增加,表現就會愈來愈不可靠」。他們也發現,在多輪對話中,若將整個對話窗口全部傳回模型,token數量會爆炸,而那些明明清楚寫在上下文裡的指令,照樣會被忽略。

2. 提示詞是靜態的

廣告

你上個月寫了提示詞,後來價格變了,客戶開了新的支援工單,行銷部推出新活動,但提示詞對這些一無所知,它只能包含你寫下它那一刻所存在的資訊。

3. 上下文窗口的極限

每個模型都有上下文窗口。有些模型的容量高達數百萬。但研究顯示,大多數模型在達到這些極限之前,可靠性就開始降低了。

你的超長提示詞會占據空間,對話紀錄不斷累積,空間很快就會填滿。一旦達到上限,舊的資訊就會被擠出去。AI會忘記它十分鐘前才知道的事情。

上下文是如何失效的?

上下文不只會被用完,還會用特定模式失效。商業應用策略師布朗尼克(Drew Breunig)提出4種值得注意的失效模式:

上下文中毒(Context Poisoning):

早期的錯誤或幻覺進入對話紀錄,產生連鎖反應。AI會因為錯誤資訊已經在記錄中,反覆引用它。一旦上下文被污染,後續的每一個決策都會受到影響。

上下文分心(Context Distraction):

廣告

無關的資訊淹沒相關資訊。例如你上傳了10份文件,只有1份跟現在的問題有關,但AI會看全部的內容,不管有沒有相關性。

上下文混淆(Context Confusion):

模型無法判斷哪些上下文片段適用於當前狀況。例如,你在同一個上下文中同時放了企業客戶和個人客戶的定價規則,AI可能搞混。

上下文衝突(Context Clash):

上下文中存在相互矛盾的資訊。上個月的價格和這個月的價格、舊活動規則和新規則都在上下文裡。AI必須挑選,很可能選到錯的。

當你的AI代理表現失常,你可以用這些分類診斷問題所在,看看是中毒(錯誤數據太早進入紀錄)、分心(無關的東西太多)、混淆(分不清適用對象)還是衝突(資訊互相矛盾)。

AI真正需要誰?上下文工程 VS. 提示工程

很多人真心把AI當員工,認為下更多指令、給更多例子就能解決問題。但除了更高品質的命令,AI也需要更好的資訊架構。

廣告

提示工程是「我該說什麼」,上下文工程是「它該知道什麼」。

提示詞是靜態的、一次性的、凍結的。上下文是活的,根據「誰在問」、「他們需要什麼」來即時抓取。提示詞只是文本,上下文是一個數據系統。

想像你在幫新員工辦理入職。你不會遞給他一本50頁的手冊說「每通電話前都給我背熟」。你會給他CRM存取權限,引導他查看知識庫,分享實際案例。你會確保他知道這星期在做什麼活動、哪些情況需要向上通報。這就是上下文工程。

4種上下文策略:

1.    寫入(Write):給AI一個主記憶體之外的地方來儲存資訊,例如暫存便條紙、筆記或檔案,這樣它就不必把所有事情都記在大腦裡。

2.    篩選(Select):只拉入相關資訊。不用給它所有客戶的欄位,只給現在能派上用場的欄位。

3.    壓縮(Compress):上下文太長時就做摘要。不用保留進行20輪的對話全文,留下重要部分就好。

廣告

4.    隔離(Isolate):把複雜任務拆分給多個代理,配備各自獨立的上下文。一個負責研究、一個負責寫作、一個負責審核。每個代理都有乾淨、焦點集中的環境,比一個代理淹沒在所有資訊中好多了。

如果你是行銷,你需要哪些上下文?

舉例來說,一位想要打造AI代理的行銷人員,可能需要3種上下文:

1. 品牌上下文

你要告訴AI你是誰,打造AI個性,包括規則、語氣和邊界,讓回覆的風格像你本人,不是ChatGPT那種怪腔怪調。

需要注意的是,單憑提示詞很難憑空創造品牌人格。研究顯示,LLM生成的人格通常包含系統性偏差,像是太積極、太理想化、太偏頗。

你應該把寫最好的電子郵件、評分最高的客服回覆、分享次數最多的社群貼文餵給AI,這樣一來品牌上下文的根據是你的實績而不是幻想。

品牌上下文應該包括語氣指南(「直接且自信,不要像推銷員」)、反面模式(「絕對不要說『綜效』」)、可以用的術語和禁忌話題(如競爭對手名字或還沒公開的功能)。再加入10到20個語氣到位的真實回覆,以及上報的規則(何時轉由接手、絕對不能給哪些承諾)。

2. 客戶上下文

如果沒有客戶上下文,每一次互動都得從零開始。當客戶已經講過兩次,AI又問一次「您在哪個產業?」就可能讓顧客崩潰。建立好客戶上下文,AI就能說「上次我們聊到您正在評估我們的AP 串接,請問您有機會查看我發給您的文件了嗎?」

要說出這句話,你的AI需要記憶。記憶是區分真正助理和廢話機器人的關鍵。

你應該放進去的資料是:

公司資訊與帳號等級(讓AI判斷是否該推銷企業級功能)
產業(讓AI舉出相關案例)
是否有尚未結案的工單(免得客戶正在氣頭上,AI還興高采烈地問「有什麼我可以幫您的嗎?」)
購買紀錄與過去對話(讓他們不用一直講重複的話)
處於行銷漏斗的哪個階段(讓AI調整產品說明深度)

3. 策略上下文

讓AI知道你的目標。AI不知道現在是第一季,不知道你正在推廣年訂閱計畫,或本季的目標是預約產品展示還是免費試用。

這一層包含:

現在的促銷活動(讓AI知道該提到哪些價格優惠)
有效報價(讓AI知道哪些折扣是真的)
針對不同漏斗階段的規則與轉換目標
競爭定位

如果客戶詢問,你們跟競爭對手有什麼不同,這3種上下文就會發揮效用。品牌上下文規定絕不直接點名競爭對手,客戶上下文顯示對方是金融科技業的企業級試用戶,策略上下文指出現在重點推廣目標是「法遵功能」。

最後AI會產生一個強調法遵的回覆,並提到「企業級安全性」,在不指名道姓的情況下完成競爭定位,一切都符合你品牌該有的語氣。這不能透過提示詞工程完成,關鍵是架構設計。

(資料來源:AOL、STACKER)

你可能有興趣
最新訊息
免費下載為您量身打造無廣告的閱讀環境
訂閱天下雜誌電子報

天下雜誌當期內容的精華與延伸,每周三發送最具時效性的深度內容