你可能遇過這種情況:同一個 AI 工具,昨天還能把研究摘要整理得很清楚,今天突然變得保守、答非所問,或像是刻意避開某些段落。你改了提示、重開對話、換了幾種說法,結果還是不穩。

這時候很容易把問題歸咎於自己:「是不是提示(你打給 AI 的那段指令)寫錯?」有時確實是。但 2026 年 6 月 11 日,The Verge 與 Gizmodo 報導 Anthropic 為 Claude Fable 5 的一項隱形防護設計道歉,並表示會讓相關防護變得可見。這件事提醒我們:AI 回答突然變差時,真正要判斷的不是誰犯錯,重點在於這次輸出還能不能被放進原本的流程。

如果只是拿 AI 幫你想標題,回答變鈍一點,頂多浪費幾分鐘。但如果它正在協助研究摘要、客戶文件、程式碼遷移或安全判斷,模型背後的規則、路由或防護一旦改變,輸出就不能再和昨天的結果直接比較。你需要先弄清楚:它是不知道、不能答、被降級,還是把你的任務默默改成另一件事。

這一篇把「AI 回答突然變差,先判斷它還能不能被信任」收束成一個可操作的判斷:Claude Fable 5 的隱形防護爭議提醒我們:AI 回答突然變差時,不一定是提示寫錯。真正要判斷的是,這次輸出還能不能用在你的流程裡。

問題不是防護,重點在於防護不可見

Anthropic 在 Claude Fable 5 / Mythos 5 發表文章中說,Fable 5 是一個能力很強、但針對一般使用做過安全處理的模型;某些高風險主題會改由次一階模型回應,或受到額外防護。Anthropic 也在另一篇文章談到「蒸餾攻擊」:有人大量取得強模型輸出,再拿去訓練自己的模型。蒸餾本身可以是合法技術,但未經授權、大規模抽取模型能力,就會變成平台要防的行為。

對大多數使用者來說,這件事的實際影響是:某些任務或特定領域的查詢,可能在你沒有被明確告知的情況下,被導向更保守的處理模式。平台設防護並不奇怪。真正困擾使用者的是,當防護沒有被清楚呈現時,使用者只能看到一個模糊結果:答案變短、變空泛、避開細節,或同一題突然不再照原本方式處理。

對一般讀者來說,這與其說模型評測圈的技術細節,不如說日常工作流裡的信任問題。假設你的團隊上週用某個模型測過一批客服回覆,今天要把同一套流程接到正式客服草稿。如果模型今天開始用更保守的方式處理某些案例,但介面沒有明說,你以為自己正在重跑同一個測試,其實條件已經不同了。

這時候最危險的不是 AI 拒答。明確拒答至少留下線索。比較危險的是它看似有回答,卻把任務縮小、跳過敏感段落,或用一個比較弱的模式產生結果,讓你誤以為品質下降只是偶發。

先判斷這次輸出屬於哪一種變化

AI 變得不好用時,先不要立刻改提示,也不要急著換模型。比較好的做法,是先把「變差」說清楚,因為不同變化代表不同決定。

有些變化很明顯:模型直接說不能回答,或要求你改寫問題。這類情況通常跟安全政策、主題限制或產品規則有關。你可以不喜歡這個限制,但至少知道限制存在。

有些變化比較難抓:回答變短、變空泛、少了原本會提供的細節,或只在安全、程式碼、醫療、生物、資料抽取、競品研究等特定任務上變差。這時候要懷疑的就不只是提示,而是模型路由、服務端更新、實驗開關,或某個領域新增防護。

還有一種最麻煩:內容像被偷偷改方向。你問的是 A,它回的是比較安全、比較籠統的 B;你要的是評估,它給的是提醒;你要的是可比較結果,它給的是一段無法重現的建議。這種輸出如果進入研究結論、客戶承諾或正式程式碼變更,就會把「工具限制」包裝成「工作成果」。

你可以先用這張表把眼前的情況分出來:

你看到的現象最可能的原因下一步
模型說不能回答,或要求你改寫問題安全政策或主題限制查官方說明;高風險任務不要用繞法逼它回答
回答變短、變空泛、少了原本的細節模型被降級、路由改變,或防護把任務收窄查狀態頁、產品公告與同任務重測結果;正式任務先暫停使用這次輸出
只有某一類任務突然變差該領域新增防護、資料限制或實驗開關找該領域的官方說明與可信實測;不要把新結果和舊測試直接比較
任務像是被偷偷改方向隱形防護或系統層改寫比較原始需求與輸出差異;不要把它當成可靠測試結果

這張表與其說要抓平台出錯,不如說幫你回答一個更實際的問題:這次輸出還能不能承擔原本那個責任?

廣告

用任務風險決定下一步

不是每個 AI 行為變化都值得大動作處理。寫靈感草稿、改語氣、整理個人筆記時,模型偶爾保守一點,通常可以換提示、換模型,或稍後再試。

但任務一旦牽涉正式判斷,反應就要不同。研究摘要會影響下一步決策,內部報告會被轉述,程式碼草稿可能被合進正式版本,客服或合約文字會被客戶看到。這些情境裡,模型不透明與其說小瑕疵,不如說流程風險。

判斷方式可以分成三層:

任務層級例子AI 行為變化時的做法
低風險靈感草稿、語氣改寫、個人筆記整理可換提示或換模型,主要看效率
中風險研究摘要、內部報告、程式碼草稿可換模型,但要保留來源、輸入與輸出差異
高風險安全審查、法律文件、財務判斷、客戶承諾、正式程式碼合併先查限制、留紀錄、請人覆核;不要只靠換模型解決

比較穩的做法,是把中高風險任務退回可驗證狀態:留下輸入、輸出、模型名稱、時間、限制訊息、官方說明與人工判斷。若供應商承認某項防護原本不可見,受影響的流程就應該重測,而不是沿用上週的評估結論。

這裡的「人工判斷」與其說叫每件事都交給主管簽核,不如說要有一個實際負責的人能回答:這次輸出是否可以交付?它的限制是否被看見?如果明天模型行為又變了,我們能不能知道哪一批結果受到影響?

團隊要讓限制浮上來

如果你把 AI 放進日常工作,不需要要求模型透露所有內部機制;那通常也不可能。但你可以要求流程留下可見訊號。

例如,固定在高風險任務後面加一句:請列出這次你無法回答、需要保守處理、或可能受到工具限制的部分。這句話不能保證 AI 一定坦白,但它會把隱藏限制往檯面上推一步。

更重要的是,不要把「昨天可以」當成永久事實。模型、規則、路由、防護、供應商政策都可能變。當同一組任務今天突然得到不同品質的結果,先查官方狀態、版本說明、模型文件與可信媒體報導,再決定是否改提示或換模型。

如果最後判斷只是低風險任務受影響,換工具就好。如果是高風險流程受影響,先暫停交付、留下紀錄、重測關鍵案例,再決定是否恢復使用。

AI 工具越常被放進工作流,越不能把它當成一個永遠不變的按鈕。真正可靠的流程,與其說要求 AI 永遠完美,不如說當它的行為改變時,人能看見訊號、查到原因,並決定這一步能不能繼續往下走。

用日常來理解

一則四格漫畫:使用者先收到清楚的 AI 回答,隔天看到同題變得模糊,接著用證據卡和檢查清單分類風險,最後讓低風險任務前進並暫停高風險流程覆核。

  1. 小安把同一個問題交給 AI,得到清楚、可用、看起來很穩定的回答。
  2. 隔天同一題突然變得模糊,回答繞路,像是有看不見的規則或較弱模式介入。
  3. 他先不急著改提示,而是把拒答、空泛、任務改向與風險等級分開檢查。
  4. 最後,低風險任務可以繼續;高風險流程先暫停,等人看過限制與證據後再決定。

AI 整理卡

用這篇趨勢跟進判斷整理你的下一步 這不是摘要指令,而是把本文方法套回你的流程。貼到自己的 AI 工具後,先讓它問清楚你的限制、資料與決策目標。

我想把這篇 BMC 微課套用到自己的情境:AI 回答突然變差,先判斷它還能不能被信任

這篇處理的具體問題:Claude Fable 5 的隱形防護爭議提醒我們:AI 回答突然變差時,不一定是提示寫錯。真正要判斷的是,這次輸出還能不能用在你的流程裡。
文章連結:https://boosterminiclass.com/posts/claude-fable-invisible-guardrail-checklist/

請不要只摘要文章。請先問我 3 個問題,確認:
1. 我現在要處理的實際流程或決策是什麼;
2. 這個流程會碰到哪些資料、權限、帳號、成本或對外動作;
3. 我希望今天得到的是停手判斷、試用清單、交接模板,還是風險分級。

接著用這篇文章的框架檢查我的情境:1. 先分辨 AI 回答變差是明確拒答、品質降級、特定任務變差,還是任務被偷偷改方向;2. 對照現象、最可能原因與下一步,判斷這次輸出能不能繼續承擔原本責任;3. 依任務風險分成低、中、高三層,決定要改提示、換模型,還是暫停流程;4. 高風險任務要留下輸入、輸出、限制訊息、官方說明與人工判斷,不把不透明結果當成穩定能力。

請輸出:
- 一句話判斷:我現在應該直接做、先限縮試做,還是暫停;
- 對照表:把本文框架逐項套到我的情境,列出已具備/缺證據/需要人工確認;
- 今天可做的一個最小步驟;
- 需要負責人、日誌、回退或人工審核的地方。

如果 AI 沒有問清楚限制或資料來源,先補問,不要直接採用清單。

廣告

Share

分享這篇微課

如果這篇剛好解開一個工作卡點,可以分享給也在判斷 AI 怎麼用的人。

參考來源