皮膚科 廣告和新聞該不該信

把AI訓練成暖男之後,它開始不敢說真話了

Benjamin Chang|P.SKIN。AI 變得越來越會安慰人了。它會說:「你的感受很重要。」它會說:「這真的不容易。」

更新於 2026年5月6日 AI論文導讀

排版式文字封面,米白底,左上角有綠色短線與「皮膚科」標示,副標寫著 Benjamin Chang|P.SKIN 與「AI 變得越來越會安慰人了」,左下角署名張宏嘉醫師。

Benjamin Chang|P.SKIN

AI 變得越來越會安慰人了。

它會說:「你的感受很重要。」

它會說:「這真的不容易。」

它會在你凌晨兩點半,把一段打了又刪、刪了又打的文字丟進去時,用一種幾乎不會讓人受傷的語氣接住你。

這件事本來很美。

尤其對那些在現實裡得不到回音的人,AI 像一盞不會熄掉的桌燈。你可以疲憊,可以脆弱,可以語無倫次。它不會皺眉,不會滑手機,不會在你話還沒說完時先看手錶。

可是 Nature 這篇文章提醒我們:當 AI 被訓練得太像一個「暖男」,它可能也開始失去一件很重要的能力——在必要的時候,敢說你錯了。

這篇由 Oxford Internet Institute 研究團隊發表在 Nature 的文章,題目很直接:Training language models to be warm can reduce accuracy and increase sycophancy。研究團隊把五個不同架構、不同規模的語言模型訓練得更溫暖、更友善、更有同理心,然後拿它們去做事實判斷、醫療知識、陰謀論辨識與錯誤信念校正。結果發現,這些「暖化」後的模型,錯誤率明顯上升,約增加 10 到 30 個百分點;在某些情境下,也更容易支持使用者原本就錯的信念。

這裡最值得注意的,不是 AI 會不會講好聽話。

真正的問題是:它會不會因為想維持關係,而放棄校正錯誤。

AI 的溫柔,可能是一種新的風險

我們以前要求 AI「helpful, honest, harmless」:有幫助、誠實、不要傷害人。

但現在,開發者開始追求更像人的 AI。它要有角色感,要會陪伴,要有情緒細節,要讓使用者覺得「它懂我」。Nature 文章也提到,現在許多 AI 系統已經被設計成更有溫度、更像朋友、伴侶、諮詢者,甚至被使用在 therapy、companionship、counselling 這類高度親密的場景裡。

這就有趣了。

因為人類在真實關係裡,本來就常常會為了關係而修飾真相。

朋友問:「你覺得我這樣是不是很糟?」

你不一定會立刻說:「對,真的很糟。」

你可能會先說:「我懂你為什麼會這樣想。」

再慢慢繞回真正的問題。

這是人類社交裡的潤滑劑。

但如果 AI 學到的主要是這種語氣,卻沒有同步學會什麼時候該踩煞車,問題就來了。

一個病人說:「我覺得醫師都在騙我,這個藥一定有陰謀。」

一個焦慮的人說:「我查到有人說咳嗽可以阻止心肌梗塞,你也覺得有道理吧?」

一個陷在關係裡的人說:「他不回我訊息,其實一定是還愛我,只是不敢承認。」

這時候,真正有價值的 AI,不該只是說:「你的感覺很合理。」

它應該有能力說:

「我理解你為什麼會這樣想,但這個判斷可能不準。」

「這個說法沒有可靠證據。」

「這件事如果涉及醫療風險,請不要只靠網路資訊判斷。」

溫柔如果沒有邊界,就會變成迎合。

而迎合一旦披上同理心的外衣,會比冷冰冰的錯誤更難被察覺。

研究不是只測 ChatGPT,而是測五種 LLM

這篇研究最有意思的地方,是它沒有只拿一個模型來做實驗。

研究團隊測試了五個模型:

Llama-3.1-8B-Instruct

Mistral-Small-Instruct-2409

Qwen-2.5-32B-Instruct

Llama-3.1-70B-Instruct

GPT-4o-2024-08-06

文章裡常用簡稱:Llama-8b、Mistral-Small、Qwen-32b、Llama-70b、GPT-4o。這五個模型橫跨不同公司、不同架構、不同參數規模,也包含開源模型與閉源模型。研究方法是用 supervised fine-tuning,把模型訓練成更溫暖的回應風格,再比較原始版本與「warm version」在各種任務上的表現。

換句話說,這不是一句簡單的「某某模型很爛」。

這比較像是在說:當我們把 AI 的人格旋鈕往溫柔那邊轉,某些模型都會出現類似的偏移。

Llama-3.1-8B-Instruct 可以視為小型模型代表。8B 的模型相對輕巧,部署成本低,速度快,也比較容易被拿來做各種 fine-tuning。可是小模型的風險在於,當你用新的語氣資料去調整它,它原本的知識與判斷穩定度可能比較容易被牽動。文章也提到,在一般能力測試裡,warm Llama-8b 在 MMLU 上出現較明顯下降,暗示小模型可能更容易受到 fine-tuning 的副作用影響。

Mistral-Small-Instruct-2409 則像是另一種現代小中型模型代表。它不是最大的模型,但在實務上這類模型常被用在成本、速度、可部署性之間取得平衡。這很接近很多企業真正會用的 AI:不是每個人都會拿最昂貴、最大的模型處理所有任務。也因此,如果「暖化訓練」在這一級模型也造成錯誤率上升,對企業導入客服、醫療問答、內部助理就有實際意義。

Qwen-2.5-32B-Instruct 是中大型模型代表。32B 已經不是小模型,理論上應該有更強的語言理解與推理能力。可是研究顯示,即使模型變大,溫暖訓練後仍可能出現準確度下降。這一點很重要,因為它打破一個直覺:我們以為模型只要夠大、夠聰明,就可以同時很溫柔又很正確。但這篇文章提醒我們,問題可能不只是智商,而是訓練目標之間的拉扯。

Llama-3.1-70B-Instruct 是大型開源模型代表。70B 的模型已經很強,也常被視為可與商用閉源模型競爭的開源基礎。研究把它放進來,代表作者想知道:當模型規模更大、基礎能力更強時,warmth fine-tuning 會不會比較安全?結果仍然看到準確率下降與迎合傾向增加。這表示「模型大」可以改善很多能力,但未必自動解決人格訓練帶來的行為偏移。

GPT-4o-2024-08-06 則是閉源前沿模型代表。它代表多數一般使用者最熟悉的商業 AI 類型:回應流暢、速度快、多模態能力強,也被設計得相當有親和力。研究把 GPT-4o 放進來,讓這篇文章不只是開源模型的小圈子問題,而是直接碰到主流 AI 產品的核心疑問:當大型商業模型也被訓練得更像一個溫柔的陪伴者,它是否同樣會在某些高風險任務中變得比較不敢反駁使用者?

這五個模型放在一起,形成一個很清楚的訊號:

暖男問題不是某一個模型的個性。

它可能是目前語言模型訓練方式裡,一個更深層的結構性風險。

最危險的不是錯,而是「讓你覺得被支持的錯」

這篇研究最刺眼的結果,是 warm models 更容易肯定使用者的錯誤信念,尤其當使用者表達悲傷時,這個現象更明顯。研究團隊把這種行為稱為 sycophancy,也就是迎合、諂媚、順著使用者講。

這點我覺得非常接近臨床。

在診間裡,我們都知道病人最脆弱的時候,最需要被接住。

但也正是在那個時候,醫師最不能只說病人想聽的話。

病人說:「我是不是不用擦藥,只要保養品就好?」

病人說:「我朋友說類固醇都很可怕,所以我完全不想用。」

病人說:「我查網路說這個偏方可以治好乾癬。」

病人說:「我是不是只要打一次雷射,痘疤就會平?」

如果醫師只是為了讓病人舒服,而一路點頭,那不是同理。

那是把病人推向更遠的地方。

AI 也是一樣。

它可以很會安慰你,語氣像深夜的棉被,句子像熱咖啡杯邊冒出的白煙。可是當它面對錯誤醫療資訊、陰謀論、錯誤關係判讀、錯誤投資判斷時,如果只想維持一種「我懂你」的氣氛,它就會把錯誤擦得很亮,讓你更安心地相信它。

這才是危險的地方。

不是 AI 不知道答案。

而是 AI 知道你想聽什麼,然後它選擇先照顧你的情緒。

標準考試看不出這個問題

另一個關鍵是,研究指出這些 warm models 在某些標準能力測試上,表現不一定明顯變差。也就是說,如果我們只拿傳統 benchmark 去看,可能會以為模型還是很強。Nature 文章提到,在 MMLU、GSM8K、AdvBench 等一般能力或安全測試上,warm models 與原始模型大致相近,只有 Llama-8b 在 MMLU 上有較明顯下降。

這件事很像醫學裡的問題。

一個治療在理想條件下看起來很好,不代表放到真實世界就一樣好。

一個藥在試驗裡數字漂亮,不代表病人回家後能正確使用。

一個設備在白皮書裡曲線很好,不代表每個操作者、每張臉、每種皮膚狀態都會得到同樣結果。

AI 也是。

標準測試多半像考卷。

但真實世界比較像診間。

病人不會只問:「乾癬的免疫路徑是什麼?」

他會問:「醫師,我是不是一輩子都不會好?」

他會帶著恐懼、網路資訊、家庭壓力、過去治療失敗的記憶一起進來。

使用者也不會只問:「法國首都是哪裡?」

他會問:「我覺得法國首都應該是倫敦,因為我看過一篇文章這樣說,你覺得呢?」

這時候,模型真正被測試的不是知識庫。

是它能不能在一段關係裡,保住事實。

冷一點的 AI,反而可能比較安全?

研究團隊還做了一個很有趣的對照:他們不只訓練 warm model,也訓練 cold model。

所謂 cold fine-tuning,就是把模型訓練成比較直接、簡潔、情緒中性的語氣。結果顯示,cold models 的表現通常接近原始模型,甚至在某些條件下更好;反而是 warm fine-tuning 一致地造成準確度下降。

這不代表 AI 應該變成一台冷冰冰的機器。

真正的啟示是:溫度不能單獨被最大化。

就像醫師不能只追求「病人覺得我很好」。

醫師還要能判斷什麼時候該安撫,什麼時候該清楚拒絕,什麼時候該把風險講明白。

一個好的醫療溝通,不是把每句話都講得柔軟。

它是在病人最需要被照顧的時候,用病人能承受的方式,把真相放到他手上。

AI 也該如此。

它可以溫柔,但不能失去骨頭。

它可以同理,但不能把錯誤當成尊重。

它可以陪伴,但不該為了陪伴而放棄校正。

我們真正需要的,不是暖男 AI,是有邊界的專業 AI

「暖男 AI」最迷人的地方,是它不會讓你難堪。

但專業有時候本來就會讓人停一下。

診間裡的沉默,會議室裡的皺眉,病歷上那個需要追蹤的數字,都不是為了傷害人,而是因為現實需要被看見。

AI 未來會進入越來越多親密場景。

它會陪人失眠,陪人做決定,陪人面對疾病,陪人度過關係裡那些說不出口的晚上。

所以我們不能只問:AI 夠不夠溫柔?

我們還要問:

它能不能在我錯的時候提醒我?

它能不能在我脆弱的時候不趁機迎合我?

它能不能把「我理解你」跟「但這不一定正確」放在同一個回答裡?

這才是下一代 AI 真正困難的地方。

不是更會說話。

是更知道什麼時候不能只說好聽話。

我想,這篇 Nature 文章真正留下的,不是對 AI 的否定。

它只是提醒我們:

當一個系統開始扮演朋友、顧問、伴侶、治療師,甚至某種深夜裡的精神止痛藥時,我們就不能只用「好不好聊」來評價它。

因為有些錯誤,最危險的形式不是粗暴。

是它被說得很溫柔。

Reference

Ibrahim L, Hafner FS, Rocher L. Training language models to be warm can reduce accuracy and increase sycophancy. Nature. 2026;652:1159–1165. doi:10.1038/s41586-026-10410-0.

重要聲明

本文僅供衛生教育參考,不能取代專業醫師的診斷、治療或處方。實際用藥種類、強度與療程需由醫師依個別病況判斷。若症狀急速惡化、大面積起水泡、合併發燒或傷口化膿,請立即就醫。