2026 年 2 月,《自然醫學》(Nature Medicine)登出一篇研究:1,298 位一般民眾被隨機分派,面對十個醫療情境,要判斷這可能是什麼問題、接下來該怎麼辦。模型單獨作答時,找出病況的正確率高達 94.9%;但把同一批模型交到真人手上,正確率掉到三成出頭,跟完全沒用 AI 的對照組沒有差別。模型很強,但人問不出來。數位時代創新長黃亮崢 James 邀請 杜克健康創新研究所葉俊廷醫師,拆解一般人到底該怎麼問AI健康問題,才有機會問得好。
聽完這集,你可以學到
1. 先講你是台灣人、幾歲、男生女生,這 30 秒決定了答案品質:模型的訓練資料以英文與西方世界為主,研究圈把這群人稱作 WEIRD。你不講清楚,它就預設你是一位在美國的白人大學生。但鼻咽癌在華人族群的發生率遠高於西方白人,臺灣過去有大量 B 型肝炎與肺結核病史,這些都會改變鑑別診斷的排序。葉俊廷建議開頭直接說「我是臺灣人、我幾歲、我有什麼病史、現在在吃什麼藥」。
2. 問「有哪些可能」,不要問「我得了什麼病」:AI 的強項是飽讀詩書、把可能性窮盡列舉,不是一槍命中。葉醫師提醒,帶著答案去問(「我是不是闌尾炎?」)會觸發它的討好傾向,它會順著你把說法合理化。改成請它列出所有可能,再逐項追問「要做什麼檢查才能排除這一個」,你拿到的就是一張清單,而不是一個結論。
3. 報告先擷取成表格,核對過再解讀:拍照上傳最大的風險不是幻覺。醫院做過統計,AI 真正產生幻覺的比率大約 2% 到 5%,但漏掉重要資訊的比例可以到 20%。做法是先叫它「只把數值、單位、參考範圍整理成表格,不要解讀」,自己數過筆數對得上,再請它解讀。更根本的解法,是直接從健康存摺下載可被數位辨認的電子版報告。
4. 判斷急不急最最最不能交給 AI,要改問警訊(紅旗清單):就連 OpenAI 專為健康情境訓練的 ChatGPT Health,在急症的檢傷判斷上仍有明顯失誤。葉俊廷分析模型被訓練得越來越保守,你直接問「我現在該怎麼辦」只會拿到罐頭答案。
正確的問法是「請列出哪些情況我應該立刻掛急診、哪些可以等門診」,再加一句「請把最緊急的警訊(紅旗)症狀也寫出來」。
5. ISBAR:把小抄整理成醫師習慣閱讀的格式:俊廷把醫護交班用的口訣改寫給一般人用。I 是我是誰(年齡、生理性別),
S 是現在的狀況與持續多久,
B 是過去病史、用藥、手術、過敏與家族史,最後
把醫護版的 A 與 R 換成 Q,也就是你最想問的三個問題。
請 AI 依這個順序整理成兩頁以內的條列,醫師看到會很開心,因為那正是他寫病歷的思考流程。
6. 模型有價值觀,重要的事情要問兩家:哈佛醫學院生醫資訊學系的 Isaac Kohane 用 50 個臨床兩難發現各家模型在尊重病人自主、行善、不傷害、公平這四個原則上的權重都不一樣。俊廷提醒,飽讀西方文獻的模型最優先的往往是病人自主,但這在東方文化脈絡下不一定成立,答案不一致本身就是一個訊號。
7. 三層分類法:越深的對話越要保守:
-第一層是術語翻譯與報告白話化,幾乎沒有風險;
-第二層是加上你的個人脈絡去推論可能性,價值最高,但成果完全取決於你怎麼問;
-第三層是換不換藥、該不該開刀這種臨床決策,目前建議不要交給 AI。
俊廷的判準很清楚,越需要價值判斷的問題,背後潛在的偏誤風險就越大。
8. AI 公司免費送你健康服務,要的是它拿不到的資料:俊廷從商業角度提醒,網路上的文字大概都被訓練完了,而心跳、影像這類醫學資料極難取得,又全鎖在醫療系統裡。智慧戒指記錄基礎體溫、另一個 App 記月經週期、你再跟 AI 說最近有點頭暈,三筆看似獨立的資料串起來就可能推論出你懷孕,甚至比你自己更早知道。
俊廷的提醒:
一、讓 AI 真正了解你是誰,不是身分證字號,而是你作為一個人的樣子:我是臺灣人、在臺灣長大、現在在美國、幾歲、有什麼運動習慣、有什麼病史、在吃什麼藥。
二、不要把自己的判斷放進去,把「會不會是闌尾炎」的問題換成「請列出所有可能」,再一輪一輪追問下去。
三、是主動要警訊(紅旗清單),問清楚什麼情況必須立刻就醫。最後,如果真的決定要看醫生,請 AI 用「我是誰、現在狀況、過去病史、我想問的問題」整理成一兩頁印出來帶去。他強調,這是目前跟 AI 互動比較安全、而且每個環節都有研究支持的做法。而醫師不能被取代的,從來不是資訊不足時的判斷,是最後有一個人願意為那個判斷負責。
---
補充資料:
1. 以撒·科漢 Isaac Kohane:哈佛醫學院生醫資訊學系(Department of Biomedical Informatics)系主任,醫療 AI 領域的奠基者之一。本集中被引述為 Human Values Project 的主持人。
2. Human Values Project(HVP):由 Isaac Kohane 主持的國際研究計畫,以 50 個經臨床醫師驗證的醫療兩難情境,測試各家前沿模型在醫學倫理四原則(自主、行善、不傷害、正義)上的權重分布,並以千位以上臨床醫師的共識作為對照基準。合作單位包含 OpenAI、Google DeepMind、Epic、以色列 Clalit Health Services 等。網址:https://hvp.global
3. 鑑別診斷 Differential Diagnosis:面對一組症狀時,醫師列出所有可能疾病並逐一排除的思考流程。俊廷指出 AI 的強項正是把這張清單列得比人更完整。
4. can't miss/警訊症狀 Red Flags:機率未必高、但一旦錯過後果極嚴重或極緊急的病症,醫師受訓時被要求無論如何都要先排除。經典例子是胸痛必須先排除心肌梗塞。
5. 檢傷 Triage:判斷病人有多緊急、應該立刻急診還是可以等門診的分類流程。本集指出這是目前 AI 最不可靠的環節之一。
6. 脈絡化醫療 Contextualized Medicine:強調病人在疾病之外的生活處境會直接影響醫療成效的取向。本集阿嬤與孫子開學的例子即屬此類。
7. 競爭的責任關係 Competing Responsibility:脈絡化醫療中的概念,指病人或照顧者因為承擔其他責任(工作、就學、照顧他人)而無法完成醫囑。
8. ISBAR:醫護人員交班使用的結構化溝通口訣:Introduction(我是誰)、Situation(現在狀況)、Background(背景病史)、Assessment(評估)、Recommendation(建議)。俊廷建議一般人把 A 與 R 換成 Q(你想問的問題)。
9. WEIRD:Western、Educated、Industrialized、Rich、Democratic 的縮寫,指行為科學研究樣本長期過度集中於西方、受過教育、工業化、富裕與民主社會的人口。本集用以說明大語言模型訓練資料的預設偏差。
10. 定錨效應 Anchoring:在對話開頭提供身分與背景資訊,使模型後續的機率排序向你的實際情境靠攏。
11. 健康存摺 My Health Bank:衛生福利部中央健康保險署提供的個人健康資料下載平台,可取得近三年門診、住診、用藥與檢驗結果。俊廷建議直接下載電子版報告,避免拍照辨識造成的錯誤。網址:https://myhealthbank.nhi.gov.tw
12. OpenEvidence:面向醫療專業人員的醫學文獻查詢 AI 工具。本集用以說明即使是醫療專用工具,其文獻庫仍以英文與歐美學會指引為主體。網址:https://www.openevidence.com
13. ChatGPT Health:OpenAI 於 2026 年 1 月推出、專為健康情境設計的版本,可連結電子病歷與 Apple Health。網址:https://openai.com
本集引用的研究與文獻
Bean, A. M., et al. (2026). Reliability of LLMs as medical assistants for the general public: A randomized preregistered study. Nature Medicine, 32, 609–615. https://doi.org/10.1038/s41591-025-04074-y
Goh, E., Gallo, R., Hom, J., et al. (2024). Large language model influence on diagnostic reasoning: A randomized clinical trial. JAMA Network Open, 7(10), e2440969. https://doi.org/10.1001/jamanetworkopen.2024.40969
Brodeur, P. G., Buckley, T. A., Kanjee, Z., et al. (2026). Performance of a large language model on the reasoning tasks of a physician. Science, 392, 524–527. https://doi.org/10.1126/science.adz4433
Ramaswamy, A., et al. (2026). ChatGPT Health performance in a structured test of triage recommendations. Nature Medicine. https://doi.org/10.1038/s41591-026-04297-7
Costa-Gomes, B., Tolmachev, P., Taysom, E., et al. (2026). How people use Copilot for Health. Microsoft AI.
KFF. (2026). KFF Health Information and Trust Tracking Poll. Kaiser Family Foundation. https://www.kff.org
Henrich, J., Heine, S. J., & Norenzayan, A. (2010). The weirdest people in the world? Behavioral and Brain Sciences, 33(2–3), 61–83. https://doi.org/10.1017/S0140525X0999152X
Weiner, S. J., Schwartz, A., Weaver, F., et al. (2010). Contextual errors and failures in individualizing patient care: A multicenter study. Annals of Internal Medicine, 153(2), 69–75. https://doi.org/10.7326/0003-4819-153-2-201007200-00002
Marshall, S., Harrison, J., & Flanagan, B. (2009). The teaching of a structured tool improves the clarity and content of interprofessional clinical communication. Quality & Safety in Health Care, 18(2), 137–140. https://doi.org/10.1136/qshc.2007.025247
- Sweeney, L. (2002). k-anonymity: A model for protecting privacy. International Journal of Uncertainty, Fuzziness and Knowledge-Based Systems, 10(5), 557–570. https://doi.org/10.1142/S0218488502001648
法規與公共資源
中華民國醫師法第 11 條|醫師非親自診察,不得施行治療、開給方劑或交付診斷書。本集用以說明 AI 不具醫事人員身分,其輸出沒有法律地位。全國法規資料庫:https://law.moj.gov.tw/LawClass/LawAll.aspx?pcode=L0020001
個人資料保護法|臺灣目前規範個人資料蒐集、處理與利用的通用性法律,並非專為健康資料設計。全國法規資料庫:https://law.moj.gov.tw/LawClass/LawAll.aspx?pcode=I0050021
憲法法庭 111 年憲判字第 13 號判決【健保資料庫案】|2022 年 8 月 12 日宣判。認定健保資料由中央健康保險署提供作健保目的外之利用時,其主體、目的、要件、範圍、方式及監督與程序保障機制欠缺明確法律規範,不符法律保留原則,違反憲法對資訊隱私權的保障,並要求三年內修法。判決全文:https://cons.judicial.gov.tw/docdata.aspx?fid=38&id=309956
HIPAA(Health Insurance Portability and Accountability Act)|美國健康資料保護與隱私規範。本集用以對照臺灣目前缺乏統一健康資料保護專法的現況,並說明 ChatGPT Health 所稱之 HIPAA compliant 的意義。美國衛生及公共服務部:https://www.hhs.gov/hipaa
Powered by Firstory Hosting