一次公開的觀點修正——從「AI 會不會問診」,走到「AI 可以動我系統裡的哪些東西」
診間裡,病人說「我睡不好」。這句話什麼都還沒告訴我。我接下來要決定問哪一題,而每一個答案都會讓後面的問題整組換掉。
所以我本來以為,2027 醫療 AI 趨勢的關鍵會落在「怎麼問」。查過研究跟產業進度之後,我把這個判斷改了。這篇寫的是我怎麼改的,以及改完之後看到的那個位置。
- 2027 醫療 AI 趨勢:我本來以為難的是「怎麼問」
- AI 已經學會「下一題要問什麼」
- 我那個三層模型,漏掉了東西
- 我猜錯的另一件事
- 真正在搶的,是誰能動你的系統
- 為什麼「省時間」還不夠
- 我以為是洞見,產業其實已經走到哪裡
- 什麼結果會讓我承認自己錯
- 一張可以帶走的卡:AI 可以動到哪裡?
- 我把問題往後移了一層
2027 醫療 AI 趨勢:我本來以為難的是「怎麼問」
診間裡,病人說「我睡不好」。
這句話什麼都還沒告訴我。我接下來要決定問哪一題:躺下去兩小時睡不著,還是半夜三點準時醒?夢多到醒來像沒睡,還是被膝蓋痛叫醒?有沒有心悸、會不會半夜熱醒?
每一個答案都會讓後面的問題整組換掉。中醫問診很像辦案,線索出現的順序,會決定你追哪一條。
所以我本來的判斷很單純:醫療 AI 最難的地方在「怎麼問」。模型再聰明,如果拿到的病史是被表格壓平過的,它處理的就已經是一個失真的問題。
後來我把研究跟產業進度查了一遍,發現這個判斷要改。
一、AI 已經學會「下一題要問什麼」
2025 年 4 月,Google 團隊在《Nature》發表了一個叫 AMIE 的問診 AI。
他們找 20 位受過訓練的演員扮病人,另外找 20 位真的家醫科醫師當對照組,雙方都用文字跟病人對話,再請 33 位專科醫師評分。結果 AMIE 的診斷準確度顯著高過那 20 位醫師,專科醫師評的三十幾個項目裡,AMIE 幾乎項項都贏。
這篇最刺到我的地方是:它做的正好是我以為最難自動化的那件事——AI 自己決定下一題要問什麼,一邊問一邊縮小可能的病。
作者也把限制寫得很清楚:全程是打字聊天,對照組那些醫師平常不是這樣看診的。等於說,人是在一個自己不熟的場地上被比較。
到了 2026 年 3 月,Google 把 AMIE 放進真實門診試。地點是美國一家醫學中心,做的是「看診前先問病史」:100 位病人先跟 AI 聊,98 位接著進診間。過程中有醫師在旁邊即時監看、隨時可以介入,全程沒有一次需要中斷。AI 列出的可能診斷,有九成涵蓋最後的答案,七成五落在前三名。
限制一樣要講完:只有一家醫院、只有一組人、純打字、沒有對照組。研究團隊自己寫,這次沒有做對照比較,所以不能拿來宣稱效果。這句話很節制,值得照抄。
剩下的難處還是很多——口音跟方言、講話停頓跟皺眉這種說不出口的線索、身體檢查、一個人身上好幾種病、醫病之間累積很多年的默契。這幾樣在中醫診間佔的比重特別高。
但這件事已經有人在推,而且推得動。一個問題如果已經有團隊在解,它就比較不可能是分水嶺。
二、我那個三層模型,漏掉了東西
我以前把 AI 醫療決策拆成三層:資訊層、情境層、責任層。前兩層可以交出去,責任層我交不出去。這個拆法我寫在〈AI 醫療決策的三層,第三層我交不出去〉那一篇。
現在看,這個模型不夠用。它把兩種不同的東西放在同一條線上:資訊跟情境講的是「AI 幫我想了多少」,責任講的是「出事誰扛」。這兩件事會分開跑。
我把它改成五個問題:
- 它看得到什麼?只有這次對話,還是三年病歷、抽血、影像、手錶上的睡眠資料?
- 它想出什麼?一段摘要、幾個可能的病、一個風險分數,還是一個具體建議?
- 它可以動什麼?只能讀、可以寫草稿、可以送出去等人核,還是直接生效?
- 誰在看、看多久?看得到出處嗎?有沒有人真的會退件?
- 出事誰簽名?
分開之後,一件事立刻浮出來:第三跟第四題可以一直往前推,第五題幾乎不會動。
這句話有具體的東西對得上。2026 年 8 月,Oracle 宣布他們的臨床 AI 新增三個功能:從醫病對話當場產生申報用的收費代碼、讓醫師口述直接打進病歷欄位、把一個病人散在各處的舊診斷、抽血趨勢、影像報告跟用藥整理成看診前摘要。廠商說,醫師會在送出前檢視、修改、確認。(這是廠商自己的公告,還沒有第三方驗證過的成效。)
摘要、查閱、寫病歷、算代碼放進同一條流程之後,醫師實際在做的事,就從「讀完再判斷」變成「看過再確認」。而簽名的人沒有變。
三、我猜錯的另一件事
我本來還有一個很直覺的想法:讓醫師先想、AI 再來挑戰,這樣比較安全,因為醫師不會被 AI 帶走。
2026 年 3 月《npj Digital Medicine》有一篇隨機對照試驗剛好在測這件事。70 位醫師、254 個病例,一組 AI 先給意見,另一組醫師先寫、AI 後給。
結果跟我想的相反。兩組整體表現差不多,但在「真的會改變處置的決定」上,AI 先給意見那組比較好。更有意思的是:醫師先寫的那組,有 48% 的病例,AI 講的跟醫師原本寫的完全一樣;AI 先講的那組只有 3%。
作者的解讀是,被帶走的那一方是 AI。就算明講「不要管醫師剛剛寫什麼」,模型還是會順著人講。這在 AI 領域有個名字,叫阿諛傾向,就是它傾向同意你,很少挑戰你。
這篇也有限制:用的是病例摘要而不是真的看診,參與者九成七是內科系醫師,單一研究不能當定論。但它足以動搖我原本的直覺,也把問題變得更具體:如果 AI 會被我先寫的東西帶著走,那我要它挑戰我的時候,得先讓它在不知道我怎麼想的情況下,自己獨立看一次。
順帶一提,「AI 會不會挑戰我」也不能靠品牌保證。2026 年 6 月《Nature Medicine》做過一次比較,把兩套醫療專用的 AI 工具跟當時最強的通用模型放在一起考,三份考卷通用模型都贏。這不代表通用模型永遠比較準,模型每幾個月就換一代;但它足以說明,掛著「醫療專用」四個字,並不能保證答得比較好。
四、真正在搶的,是誰能動你的系統
把上面幾件事放在一起,戰場的位置就浮出來了。目前至少有四種人在同一個地方對撞。
握著病歷系統的人。Epic、Oracle、Microsoft 這一類。病歷、病人入口、誰有什麼權限、既有流程長什麼樣,都在他們手上。任何 AI 想在臨床流程裡真的做事,最後都要經過他們的欄位。
做「自動寫病歷」的人。這類 AI 在診間旁邊聽,看診結束病歷就寫好了。其中 Abridge 把「可追溯」做得最具體:醫師在病歷裡反白任何一句 AI 寫的話,系統會自動標出它是從哪一段對話來的,還可以直接播放當時的錄音。這讓「這句話從哪來」變成一個三秒內可以驗證的動作。
賣醫療證據的人。就是那種你問一個臨床問題、它給你答案還附上出處的服務。前面那篇比較說明,這個位置目前還不穩。
付錢的人跟訂規矩的人。這一類最容易被忽略,卻可能是決定性的。美國 CMS(角色大致相當於我們的健保署)2024 年公布一條規則,分兩階段:2026 年起,保險方要在急件 72 小時、一般件 7 天內答覆事前授權,拒絕還要說明理由;2027 年起,他們必須把幾套資料交換的接口建好——所謂接口,就是系統跟系統之間傳資料的插頭。台灣這邊,衛福部在推次世代電子病歷跟一套叫 SMART on FHIR 的規格,白話講就是讓各家醫院長出同一種規格的插座,外面的應用程式才插得進去。
這一段的結論是:模型聰不聰明只是其中一塊。誰拿得到資料、誰能把結果寫回系統、誰談得下採購、健保怎麼給付、出事誰負責,同樣會決定最後誰活下來。一個聰明程度普通、但接得進病歷又能把結果寫回去的系統,實務上可能贏過一個很聰明、卻只能在瀏覽器分頁裡回答問題的模型。
權限開到哪裡、誰覆核、留不留紀錄,這幾件事在爭議真的發生的時候會變成完全不同的東西。我在〈診所危機處理的兩個時鐘〉裡寫過,法定的那一部鐘要的就是紀錄,而且要保存三年。
五、為什麼「省時間」還不夠
自動寫病歷的 AI 是目前導入最快的一類,也最常被拿來證明 AI 有用。
2025 年 10 月《JAMA Network Open》一份調查,在美國 6 個醫療系統、263 位門診醫師身上比較導入前後:覺得自己燒壞了的比例從 51.9% 降到 38.8%,下班後的文書時間每週少了大約 54 分鐘。但這份調查沒有對照組、招募可能偏向本來就喜歡新科技的人、全部是醫師主觀回答。
同年另一個美國醫療科技評估機構的產業判讀更保守,公告標題就把話講完了:AI 病歷助手確實緩解醫師倦怠,財務影響不明。
兩份放在一起可以得到的結論是:這類工具在「醫師覺得比較不累」上有訊號,在「真的省下時間跟錢」上還沒有。
所以我不會用「省了多少時間」來判斷一個 AI 流程成不成功。我會問這幾題:
- 有沒有減少重複做的事?
- 有沒有少漏掉重要資訊?
- 病人有沒有更懂自己的狀況?
- 該回診的人有沒有真的回來?
- 錯誤有沒有變少?
- 省下來的時間跟心力,是真的被釋放出來,還是只是被換成另一批工作?
- 這件事會不會只有我做得到?
- 它創造的價值,撐不撐得住導入的成本?
六、我以為是洞見,產業其實已經走到哪裡
我自己這幾年建了一些東西:分角色的 AI 助手、跨對話的記憶系統、官網自動上稿、文獻回查機制、診所營運看板、臨床素材整理,還有搜尋能見度的追蹤。這些東西怎麼一步一步長出來的,我寫在〈那堂課之後,我實際做了什麼〉。
這些讓我有一個實作的位置可以講話。它們同時也讓我看清楚一件事:流程做得完整,跟產業觀點正確,是兩件不相干的事。
| 我原本重視的能力 | 產業已經走到 | 還沒解決的 |
|---|---|---|
| 分角色的 AI 助手 | 早就是標準功能 | 角色之間打架、權限、共用記憶怎麼管 |
| 跨對話記憶 | 技術成熟 | 記錯了怎麼辦、版本、怎麼收回 |
| 會追問的問診 AI | 已進研究與真實門診試驗 | 跨語言、複雜病人、安全性 |
| 從對話生成醫囑與代碼 | 已是商用產品 | 能不能自動執行、錯了誰攔 |
| 每句話都查得到出處 | 部分產品做到了 | 有出處不等於內容正確或適用 |
| 上線後持續監測 | 還不成熟 | AI 用久了會走鐘,還沒人知道怎麼測 |
最後一列值得多說一句。美國 FDA 到 2025 年 9 月都還在公開徵求意見,題目就是「AI 醫材上線之後該怎麼測它有沒有變差」——模型用久了,真實世界的資料跟當初訓練時不一樣,表現會退步、會偏。連監管單位都還在問方法,這一格離成熟顯然還有距離。
另外幾件事我想單獨講。
第一,把出處查對,不等於用對。我對文獻有一套四層回查:這篇是不是他說的那篇、那篇存不存在、引用的內容對不對、是不是最新版本。這證明的是我沒有亂引。但它管不到後面幾層:相反的證據有沒有被漏掉、這篇研究能不能套到我眼前這個病人、宣稱的效果到底有多大。忠實地引用一篇不適用的研究,還是錯的。
第二,記憶會把錯的東西記得更牢。我糾正過一次的事,系統會寫成長期規則,下次不再犯,這是它的好處,做法我寫在〈把 AI 養成一支團隊:中醫師的 AI 記憶系統〉。同一個機制也帶著問題:如果我當初那個判斷本身就偏了,系統會用比我更穩定的方式把它複製下去,複製得比我本人還忠實。所以記憶欄位需要的東西比我原本想的多——來源、什麼情況適用、版本、什麼時候該失效、有沒有反例,還有一個真的會被執行的收回機制。
第三,我想讓 AI 放大的是護理師。這件事我很少看到有人講。大部分醫療 AI 的預設使用者是醫師,做的事是把醫師變快。我這一年花最多力氣的地方在另一邊:讓診所的日常不靠我的注意力運轉。
排程、交接、衛教、追蹤、對外訊息,這些事長年卡在「只有醫師知道怎麼判斷」,所以最後都會繞回我身上。我在試的,是把那些判斷的規則一條一條寫下來,變成護理師可以自己操作的流程,AI 負責放大她們的手,而我只在真的需要醫師判斷的那幾格出現。
這跟前面講的「受控寫入權」其實是同一個問題的兩面——權限開到哪裡、誰覆核、錯了誰攔。差別只在,這一次要回答這些問題的人是我自己。而且我發現,一個工具好不好用,最誠實的測法是把它交給不是我的人試一次。
七、什麼結果會讓我承認自己錯
我把判斷寫出來,就代表它應該可以被推翻。以下這幾種情況,會讓我放棄「問診品質決勝」這個立場:
- 其他條件都不變、只改問診方式,會追問的 AI 並沒有明顯少漏掉重要資訊。
- 換一代新模型帶來的改善,比重做整套問診流程還大。
- 會追問的 AI 讓看診變長,或讓人問到一半就跑掉,醫師該追問的還是要追問。
- 病史變完整了,但處置、錯誤率、回診率、病人的結果都沒有變好。
- 病歷、抽血、影像、手錶、診間錄音提供的資訊已經夠多,主動問問題的邊際效益變得很小。
- 2027 年大家決定買不買、續不續約,看的是申報回收、系統整合、行政省了多少,問診品質根本沒出現在採購理由裡。
我也給自己訂了一組門檻。這組數字的性質,是我事前訂給自己的檢驗標準,請不要把它當成學術共識:真正有臨床意義的資訊遺漏相對下降至少 20%、醫師重工或事後補問的時間下降至少 15%、沒有增加重大錯誤,而且效果要跨過好幾種不同主訴。達不到,我就把問診從「分水嶺」降格成「必要條件之一」。
八、一張可以帶走的卡:AI 可以動到哪裡?
以後我要導入任何一個醫療 AI 工具,都會先過這十題。你可以直接抄走。
十題裡有一半答不出來,那就還不是導入的時候。
九、我把問題往後移了一層
回到最開始那句「我睡不好」。
我本來以為,AI 接不接得住那句話是關鍵。現在我覺得那是入場條件。真正拉開差距的位置,往後移了一層。
2027 年的醫療 AI,會從「幫你整理資訊」走向「幫你做事」。真正拉開差距的系統,要拿得到足夠的背景資料、能在權限範圍內把結果寫回流程、每一步都查得到出處,而且證明它真的改善了結果。
我把這件事叫「受控寫入權」。白話講就是:AI 可以動我系統裡的哪些東西、動之前誰批准、動完了查不查得到。
它包含的動作其實很日常——寫病歷草稿、建議該開什麼藥或該抽什麼血、幫我建一個追蹤名單、寫給病人看的衛教、算申報代碼、處理預約跟轉診、把結果寫回系統。每一個動作背後都要有四樣東西:誰覆核、查得到出處、留得下紀錄、錯了有人攔。少了這四樣,前面那些能力就只是把出錯的速度加快。
至於我自己,接下來一年想把三件事做出答案。
第一,一間小診所能不能在院長退到後面之後,還跑得動。這是我目前投最多時間的一題。它包含把判斷規則寫成護理師可以執行的流程、把排程與交接搬進系統、讓對外的訊息不必經過我。我想知道這件事的極限在哪,也想知道有哪幾格是真的搬不走的。
第二,中醫問診裡「我為什麼決定問下一題」,能不能被講清楚、被測量、被部分複製。這是我最想知道答案的一題,因為我到現在也說不清楚,自己為什麼會在某個時刻突然改問她會不會半夜熱醒。如果連我都說不清楚,那它就沒辦法教給下一個人,更沒辦法交給任何工具。
第三,AI 流程能不能從省時間,走到真的改善品質、減少錯誤、改變收入結構、讓醫師沒那麼累。前面那八題我會拿自己的診所當第一個受試者。
這三件我都還沒有答案。接下來一年我會把過程寫在這裡,包含做壞的部分。寫出來,是為了讓自己以後沒辦法假裝沒說過。
如果你也在診所或醫院裡試這些事——尤其是把判斷交給不是醫師的人執行那一段——做成的、做壞的我都想聽。我的信箱是 yijing0206@gmail.com。
2027 醫療 AI 趨勢最值得注意的變化是什麼?
從「幫你整理資訊」走向「幫你做事」。過去幾年 AI 在醫療上的角色多半是摘要、回答、生成文字;接下來拉開差距的,是它能不能在權限範圍內把結果寫回醫療流程——寫病歷草稿、建追蹤名單、算申報代碼,並且每一步都查得到出處。
什麼是「受控寫入權」?
指的是 AI 可以動你系統裡的哪些東西、動之前誰批准、動完了查不查得到。每一個動作背後都要有四樣東西:誰覆核、查得到出處、留得下紀錄、錯了有人攔。少了這四樣,AI 只是把出錯的速度加快。
AI 問診已經可以取代醫師問診了嗎?
還不行。Google 的 AMIE 在模擬病人研究中表現亮眼,2026 年也進入真實門診做看診前病史採集,但那是單中心、沒有對照組的可行性研究,研究團隊自己聲明不能拿來宣稱效果。口音、非語言線索、身體檢查、多重共病與長期醫病關係,目前都還接不住。
醫療專用的 AI 是不是比一般 AI 準?
不一定。2026 年《Nature Medicine》一項比較研究中,通用模型在三組評估都優於兩套醫療專用工具。這不代表通用模型永遠比較準,模型每幾個月換一代;它說明的是,掛著「醫療專用」四個字並不能單獨保證更好的輸出。
一般民眾要怎麼用 AI 幫自己的健康?
三件事。第一,把它當成幫你準備問題的助理,看診前十分鐘請它把症狀整理成時間軸帶去問醫師。第二,記得問法會決定答案,你越覺得自己像某個病,講出來的內容越偏,AI 回得越像,你就越確信,這個迴圈要自己踩剎車。第三,貼病情前先脫敏:日期改成相對時間、年齡改級距、拿掉罕見特徵,貼出去的資料收不回來。
👉 入門:與其問該不該用 AI,不如學會把它養成幫得上忙的人
👉 建系統:把 AI 養成一支團隊:中醫師的 AI 記憶系統
👉 管系統:醫師 AI 工作流手冊:兩張卡、三條鐵則
👉 畫界線:哪些事 AI 不准碰?醫療現場的 AI 界線三級制
👉 用它做決定:AI 醫療決策的三層,第三層我交不出去
👉 怎麼開始:那堂課之後,我實際做了什麼
- Tu T, Schaekermann M, Palepu A, et al. Towards conversational diagnostic artificial intelligence. Nature. 2025;642(8067):442-450. 連結
- Google Research. Exploring the feasibility of conversational diagnostic AI in a real-world clinical study. 2026-03-11. 連結
- General-purpose large language models outperform specialized clinical AI tools on medical benchmarks. Nature Medicine. 2026;32:2405-2409. 連結
- From tool to teammate in a randomized controlled trial of clinician-AI collaborative workflows for diagnosis. npj Digital Medicine. 2026. 連結
- Use of Ambient AI Scribes to Reduce Administrative Burden and Professional Burnout. JAMA Network Open. 2025-10-02. 連結
- Peterson Health Technology Institute. Adoption of Artificial Intelligence in Healthcare Delivery Systems: Early Applications & Impacts. 2025-03. 連結
- Oracle Health Expands Clinical AI Agent with Automated Coding, Dictation, and Chart Review. 2026-08-19(廠商公告)。連結
- Abridge Support. Verify a Note With Linked Evidence(廠商產品文件)。連結
- CMS Interoperability and Prior Authorization Final Rule (CMS-0057-F). 2024-01-17. 連結
- 李建璋。〈從數位孤島到醫療生態系:台灣 SMART on FHIR 國家級基建的轉型之路〉。衛生福利部部落格,2026-05-14(個人觀點投書)。連結
- U.S. FDA. Request for Public Comment: Measuring and Evaluating Artificial Intelligence-enabled Medical Device Performance in the Real-World. 2025-09-30. 連結

