AI 醫療決策的三層,第三層我交不出去

醫師 AI 工作流・答案變便宜之後
AI 醫療決策的三層,第三層我交不出去

三個隨機對照試驗、一個中醫診間的下午,和一張把工作拆成三層的盤點卡

張益豪醫師把 AI 醫療決策拆成資訊層、情境層、責任層,並且指出後兩層無法外包。我讀完之後,把自己的診間也拆了一遍。

中醫的三層長得不太一樣:資訊層比想像中窄,情境層比想像中寬,責任層還多了一條時間軸。另外我手上有一份他那篇沒有收進去的試驗資料,它補上了這個故事的下半場。

這篇文章包含
  1. 一個病人拿著 AI 的體質判讀走進來
  2. AI 醫療決策的三層:先把定義放在這裡
  3. 兩個試驗說了什麼:問題出在人
  4. 第三個試驗,補上了下半場
  5. 中醫的資訊層比想像中窄
  6. 交出去之前,先脫敏
  7. 情境層:螢幕上沒有那幾格
  8. 輸入這一端,本身就是判斷
  9. 責任層:交不出去的是三週後
  10. 我把資訊層交出去之後,時間去了哪裡
  11. 一張可以複製帶走的三層盤點卡
  12. 三個紅燈
  13. 兩篇對照著讀

一個病人拿著 AI 的體質判讀走進來

她把手機推到我面前,螢幕上是一段條列得很整齊的文字:氣虛、脾虛濕盛、肝鬱化火,各配三到五條佐證,最後還有一句「建議尋求合格中醫師確認」。

她問的第一句話是:「醫師,我核對起來最像中間這個,對不對?」

那個下午我想的事情,跟這段文字的正確與否無關。她其實沒有要跟我辯論 AI 準不準,她是想找一個人,跟她一起把這件事收斂成一個決定,並且陪她走完後面那一段。

中醫這裡還多一個問題。AI 給出的是一張標籤,貼上去就固定了;證是活的,三週後回診,同一個人可能已經走到另一個地方。她螢幕上那段文字,最快的過期時間可能就是下下週。

AI 醫療決策的三層:先把定義放在這裡

資訊層:查文獻、整理病歷、列鑑別診斷、提醒少見但危險的可能性。AI 在這一層做得又快又好。

情境層:同一個診斷,落在不同的人身上會長成不同的答案。年齡、共病、工作型態、家庭支持、經濟能力,還有這個人此刻最害怕什麼。AI 只處理被輸進去的東西。

責任層:治療結果不如預期、病情變化、病人後悔的時候,重新說明、調整計畫、繼續陪伴的那個人。

這個切法來自張益豪醫師 2026 年 8 月的〈AI 給了十個答案之後:醫療決策的三層架構,與診間裡最貴的那一層〉。他從耳鼻喉科與診所經營的位置寫,我從中醫診間往回看,看到的東西剛好可以接在一起。

兩個試驗說了什麼:問題出在人

2024 年《JAMA Network Open》一個隨機對照試驗,50 位家醫科、內科與急診醫師,隨機分成「傳統資源加大型語言模型」與「只用傳統資源」兩組,各 60 分鐘處理最多 6 個臨床情境。診斷推理分數中位數:AI 組 76%、對照組 74%,調整後差 2 個百分點,沒有統計顯著性。

同一個研究裡,模型單獨作答的中位數是 92%,比對照組高 16 個百分點,這個差距達到統計顯著。

模型的能力已經夠了。卡住的地方在人怎麼用它。

2026 年 2 月《Nature Health》那個在巴基斯坦做的試驗換了做法:先讓 60 位醫師完成 20 小時 AI 素養課程,講模型能做什麼、怎麼用、限制在哪裡,訓練完才隨機分組,各 75 分鐘處理最多 6 個情境。結果是 71.4% 對 42.6%,調整後差 27.5 個百分點。

要說清楚一件事:這兩個研究的對照組基準差很遠(74% 對 42.6%),受試者背景、評分量表與臨床情境都不同,兩個數字不能直接放在一起比大小。可以帶走的結論只有一句——訓練會改變人跟模型合作的方式。

第三個試驗,補上了下半場

如果故事停在「訓練就會變好」,那是只看了一半。

同一個研究團隊在 2026 年 5 月的《NEJM AI》發表了另一個隨機對照試驗。這次的受試者是 44 位已經完成同一套 20 小時 AI 素養訓練的醫師,隨機分成兩組:一組拿到正常的模型建議,另一組在 6 個案例中的 3 個,拿到研究團隊刻意植入錯誤的建議。

拿到錯誤建議那一組,診斷推理分數 73.3%,對照組 84.9%,調整後差 −14.0 個百分點。次要指標的診斷正確率從 90.5% 掉到 76.2%,差 −18.3 個百分點。

這些人受過訓練,知道模型會錯,仍然被拉下去了。

作者的建議寫得很直接:把大型語言模型的使用配上工作流程的保障設計與人工查核,不要指望使用者自己抓得到錯誤。

心法一

那 20 小時買到的是「AI 對的時候你飛得起來」,沒有買到「AI 錯的時候你剎得住」。而剎車這件事,剛好就是責任層。

責任層如果只寫成「我會小心一點」,那它等於沒有被設計過。這也是我後來把界線寫成明文的三級制的原因:判斷力在疲憊的星期五晚上會退化,寫下來的規則不會。

中醫的資訊層比想像中窄

望聞問切四個字裡,真正能被打字進對話框的,只有「問」的一部分,而且是病人願意講、也講得出來的那一部分。

脈的浮沉遲數、舌的胖瘦齒痕水滑、按下去那一下手感是實還是空、講話講到第三句氣就不夠、進門那三秒鐘的氣色——這些沒有欄位可以填。它們從來就沒有變成過資料。

所以在我的診間,資訊層 AI 幫得上的具體是這幾件:查文獻與方義、把散亂的主訴整理成時間軸、比對藥物交互作用與禁忌、提醒我少見但不能漏的可能性、把上次的紀錄拉出來對照。

這些我大方交出去,交得很徹底。

交出去之前,先脫敏

資訊層交得徹底,前提是有一道手續一定要先做完:去識別化

姓名、病歷號、生日、身分證字號、聯絡方式、任職單位,這些一律不進對話框,這部分大家都知道。比較容易漏掉的是組合起來才有識別性的那一類:少見的職業,加上一個明確的日期,加上一個小地區,三個湊在一起就足以把人指認出來,即使每一項單獨看都不算個資。

我自己的固定做法是四件事:人用代號(A 女、B 先生);日期改成相對時間(「三週前」取代「7 月 12 日」);年齡改成級距(「四十出頭」取代「43 歲」);罕見特徵改寫成同一類但不指名的講法。改完之後再讀一遍,問自己一句:如果這段文字被貼到公開的地方,認識她的人認不認得出來。

這條在我的界線三級制裡是硬規則,不看情況、不看今天多忙。原因是成本不對稱:資訊層交錯了頂多重做一次,個資交出去收不回來。

情境層:螢幕上沒有那幾格

同樣一個「氣虛」,出現在一個要輪三班的護理師身上,跟出現在一個能睡滿八小時的人身上,處方會走向不同的方向。前者要先處理的是睡眠碎裂造成的持續消耗,後者可以直接補。

情境層的資料有一個共同特徵:它們多半沒有被病人主動說出來。她不覺得「最近婆婆住進來」跟她的胃痛有關,所以不會提;她不覺得「兩個月前換了主管」需要講給醫師聽。老練的醫師會在三兩句話裡把這些問出來,這是經驗真正在做的事。

中醫這裡還有那條時間軸的問題。AI 給的是靜態標籤,辨證是動態的。病人上禮拜開始加班,證就換了地方,而那件事沒有進到任何一個對話框裡。

輸入這一端,本身就是判斷

就算讓 AI 一起看診,中間還是隔著一個人:我看到什麼、我認為那代表什麼、我決定把哪些字打進去。

同一個病人,輸入寫「疲倦」,跟輸入寫「睡足八小時起來還是累、下午三點特別沉、吃飽之後更明顯」,會得到兩份完全不同的東西。決定要寫哪一種的,是經驗。

中醫看診其實很像辦案。摸到一個地方不對,就要往下追一題;那一題的答案又決定下一題往哪裡去。而且用什麼方式問也是手藝——問「你會不會怕冷」,得到的多半是「還好」;問「冬天在辦公室,你是不是比同事早穿上外套」,答案才有東西。

問卷跟量表接不住的正是這個。量表的題目在印出來的那一刻就固定了,偵探的價值卻在於下一題由上一題長出來。

還有一個很少被講的迴圈:病人越覺得自己像某個答案,講出來的內容就越往那邊靠。 AI 收到的是已經被染過色的敘述,於是輸出更像那個答案,病人更確信,下一輪講得更偏。這個圈會自己轉,而且轉得很快。門診的工作有一部分就是把它停下來,做法通常很輕:先接住她觀察到的那幾點,再把她沒注意到的那幾條拉回檯面上。

另外一件事講出來有點殘忍,但它每週都在發生:同樣一個問題,用免費版問、用沒有受過訓練的問法問,得到的答案有時候會很好笑。好笑的地方在於它錯得很有自信,而問的人看不出來哪裡好笑。

責任層:交不出去的是三週後

責任層常常被講成「經驗」,但真正在運作的東西比經驗具體得多。

三週後我還在。藥吃了兩週沒有改善的時候,重新解釋、調方、承認上一次的判斷需要修正的,是我。出現預期外反應的時候,接電話的是我。病人開始懷疑自己是不是白花了錢的時候,坐在對面的是我。

法規認人,醫療糾紛認人,病人的信任也認人。這三件事目前都沒有把演算法放進被告席或被信任者的位置。

這一層在健康產業裡是最常被跳過的。想引進 AI 的保健品公司、體質檢測 App、預防醫學團隊,我看過的多數只把資訊層做得很漂亮:輸出很快、界面很好看、話說得很有把握。至於哪些輸出必須有人查核、出錯的時候誰負責、使用者隨時找不找得到真人,通常沒有答案。

誰把責任層設計清楚,誰才拿得到進醫療現場的門票。

我把資訊層交出去之後,時間去了哪裡

這是我兩年下來最想誠實講的一段。

我原本以為,把資訊層交給 AI,日子會變輕鬆。文獻整理從幾小時變成幾分鐘,病歷與紀錄的搬運我幾乎不再自己做,檔案系統會自己長,這些都成真了。

然後那些時間去了哪裡?全部被情境層跟責任層吃掉了。

問診問得比以前久,因為我知道螢幕拿不到的東西只能在這裡拿。回診追蹤變密,因為證會動。每一個判斷我現在都會寫下當初為什麼這樣決定,因為三週後我要跟自己對帳,而不是憑印象說「我覺得有比較好」。

心法二

AI 沒有讓我少做事。它讓我做的事變貴了,而變貴的那幾件,剛好都是交不出去的那幾件。

一張可以複製帶走的三層盤點卡

手上任何一件想交給 AI 的事,交出去之前先拆三層,十個問題。

三層盤點卡

資訊層|決定可以交多少

情境層|決定誰來補

責任層|決定能不能交

三層都答得出來,交出去;責任層答不出來,先不要交。

三個紅燈

紅燈它在提醒你什麼
說不出誰接「應該不會出事」不算答案。責任層的第一題答不出來,這件事還沒準備好被交出去。
看起來對就過如果查核的方式是把輸出讀一遍覺得順就通過,那你交出去的其實是責任層。這種查核擋不住寫得很漂亮的錯誤。
拿自信當正確第四節那個試驗測的就是這件事,而且受試者全都受過訓練。語氣篤定跟結論正確之間沒有關係。

兩篇對照著讀

AI 醫療決策的三層架構這個切法是張益豪醫師的,我做的是把它拿回中醫診間裡走一遍,加上第三個試驗,再補上「交出去之後兩年」那段實際紀錄。

他寫的是從耳鼻喉科與診所經營的位置看到的形狀,我這裡留的是把資訊層真的交出去以後,情境層跟責任層怎麼變重的紀錄。兩邊對照著讀會比單看一邊完整。

明天回診間,還是會有人把手機推到我面前。我大概還是會先說那句:「你會這樣想很合理,這幾點你觀察得很準。」然後再說:「不過有兩件事,螢幕上看不到,要在這裡確認。」

答案變便宜了。AI 醫療決策裡剩下那些變貴的,我們得自己扛。

常見問題

AI 給的體質判讀完全不能參考嗎?

可以參考,用法要對。它整理症狀、幫你把想講的事情講清楚,這很有用,我甚至歡迎病人先做這件事,門診溝通會快很多。它做不到的是把脈、看舌、按壓,也不知道你上禮拜開始加班。把它當成一份帶進診間的筆記,不要當成結論。

同一個問題,為什麼我問 AI 跟醫師問 AI 會差那麼多?

差別在輸入。醫師打進去的是「睡足八小時起來還是累、下午三點特別沉、吃飽之後更明顯」,一般人打進去的多半是「疲倦」。加上免費版與沒受過訓練的問法,答案會漂得更遠。真正吃虧的地方在於,那種錯誤通常錯得很有自信,看的人不容易發現。

把病歷或病人的話交給 AI,安全嗎?

先脫敏再說。姓名、病歷號、生日、身分證、聯絡方式、任職單位不進對話框,這是基本;更容易漏的是組合型識別——少見職業加明確日期加小地區,湊起來就能指認出人。我的固定做法是人用代號、日期改成相對時間、年齡改成級距、罕見特徵改寫。成本不對稱:資訊層交錯了頂多重做,個資交出去收不回來。

受過 AI 訓練的醫師還是會被錯誤建議影響,那訓練還要做嗎?

要。訓練確實提升了合作的表現,只是它擋不住自信而錯誤的輸出。真正的解法是把查核寫進流程,例如規定哪幾類輸出一定要有第二個獨立來源、哪幾類一律不採用。個人的警覺心在疲憊的時候會失效,流程不會。

診所要導入 AI,第一步做什麼?

先別急著碰 AI 醫療決策本身,從資訊層裡挑一件最重複、最耗你注意力、而且錯了很容易被發現的事開始。發現錯誤的成本,比省下的時間更值得先看。這一篇寫給剛起步的人。

中醫因為資料難數位化,是不是特別不適合用 AI?

剛好相反。正因為關鍵資料握在人手上,AI 接不走的部分很清楚,界線反而好畫。文獻、紀錄、方義比對、藥物禁忌交給它,四診跟判斷留在自己身上。

健康產業想做 AI 產品,最容易漏掉哪一層?

責任層。多數團隊會把資訊層做得很漂亮,卻說不出「哪些輸出必須有人查核、出錯誰負責、使用者找不找得到真人」。這三題答不出來,就進不了醫療現場。

參考文獻
  1. Goh E, Gallo R, Hom J, et al. Large Language Model Influence on Diagnostic Reasoning: A Randomized Clinical Trial. JAMA Netw Open. 2024;7(10):e2440969.
  2. Large language model diagnostic assistance for physicians in a lower-middle-income country: a randomized controlled trial. Nature Health. 2026. 連結
  3. Qazi IA, Ali A, Khawaja AU, et al. Automation Bias in Large Language Model–Assisted Diagnostic Reasoning among Physicians Trained in AI Literacy: A Randomized Clinical Trial. NEJM AI. 2026;3(5). NCT06963957.
  4. 張益豪醫師。〈AI 給了十個答案之後:醫療決策的三層架構,與診間裡最貴的那一層〉。2026-08-25。
李宜靜中醫師|原生顏
李宜靜中醫師,中西醫雙證照,雲玖中醫診所創辦人,台灣顏面針灸醫學會美顏針專業醫師。
把修復力養回來.研究臉怎麼老,也研究人怎麼活得更好。
本文為專業觀點與工作方法分享,不提供個別診斷或治療建議;文中研究結果為特定情境下的試驗數據,不宜直接推論到個別臨床決策。本文更新日期:2026-08-26
Youtube
Line
Facebook
返回頂端