一項名為 NOHARM 的獨立醫療AI基準研究,近日針對多款主流臨床AI工具進行評估,結果顯示,無論系統在整體排名中的表現如何,所有受測工具在臨床情境下都可能產生錯誤。研究尤其指出,AI造成的有害錯誤,有高達76.6%源自遺漏重要資訊,而不是捏造或誤述事實。
本次評測涵蓋 Doximity、OpenEvidence、OpenAI 的 GPT-5.6 Sol,以及 Anthropic 的 Claude Fable 5。研究團隊表示,這項結果反映醫療AI目前更深層的風險:系統即使沒有明顯說錯,也可能因未列出關鍵病史、風險或處置資訊,導致使用者低估病患面臨的危險。
NOHARM以真實案例與醫師註解進行評估
NOHARM研究由史丹佛大學、哈佛大學及 ARISE 網絡的研究團隊共同執行。測試資料包含1,100個真實臨床案例,並蒐集約13,000筆醫師註解,用於評估不同AI系統回應對病患可能造成的風險。
根據研究結果,Doximity的臨床工具 Ask 在參測系統中表現居前。不過,研究排名隨即引發其他業者質疑,顯示這類醫療AI評測除了涉及技術表現,也牽涉測試設計、評分標準及結果重現等方法論問題。
OpenEvidence質疑研究尚未經同儕審查
OpenEvidence執行長丹尼爾·納德勒(Daniel Nadler)對評測分數提出強烈質疑。他指出,這項研究尚未通過學術界標準的同儕審查,並認為研究方法存在瑕疵;他也批評不應允許AI業者針對結果提出「重測」要求。
因此,目前公開資訊可確認的是研究團隊所公布的測試結果,以及相關業者對研究程序的反駁;至於評測方法是否足以代表各系統在更廣泛臨床環境中的實際表現,仍有待進一步審查與獨立重複驗證。
資訊遺漏可能比明顯誤述更難察覺
NOHARM研究團隊強調,報告的重點不在於判定哪一個系統取得第一名,而是所有受測系統都仍會犯錯。研究數據顯示,在AI產生的有害錯誤中,76.6%屬於「遺漏」,也就是漏答、漏列或未提醒關鍵資訊;相較之下,直接給出錯誤資訊或捏造內容的「誤述」占比較低。
Scripps Research心臟科醫師、同時擔任Doximity PeerCheck計畫共同主持人的艾瑞克·托波爾(Eric Topol)警告,醫療AI必須盡可能降低這類遺漏錯誤。當系統回應看起來流暢且具備一定準確度時,醫療人員可能因此產生過度信賴,反而忽略AI沒有提及的風險。
醫療AI監管與責任歸屬仍存在落差
NOHARM發布之際,美國醫療AI監管政策正快速變動,也凸顯聯邦與地方規範之間的落差。
- 聯邦與州級規範不同調:來源指出,美國食品藥物管理局(FDA)在2026年放寬對AI臨床決策支援工具的態度,若醫師能夠獨立檢查AI的推理,相關工具即可獲准使用。然而,各州政府的監管方向則較為嚴格;截至2026年前,已有十多項與醫療AI相關的新法通過,多數要求AI輔助決策在送達病患前,必須經過人類簽核。
- 醫療過失責任尚未明確:如果AI建議出錯並造成病患損害,責任究竟應由開立處方的醫師、導入系統的醫院,或開發技術的AI供應商承擔,目前仍沒有一致答案。相關法院案件與監管討論仍在釐清這個法律灰色地帶。
評測結果對臨床導入的啟示
這項研究並未證明任何單一醫療AI工具必然不適合臨床使用,也不能僅憑一次評測就完整代表各產品的實際能力。不過,研究結果確實指出,醫療機構在導入AI時,不能只檢查系統是否提供正確答案,也需要評估它是否完整列出必要資訊、是否能標示不確定性,以及醫師能否有效發現遺漏。
在監管與責任框架尚未完全成熟的情況下,人類審核仍是重要防線。對醫療AI業者而言,如何降低遺漏、建立可追溯的推理與審核流程,可能比單純追求回答正確率更關鍵;對醫療人員而言,則需要將AI視為輔助工具,而非可取代臨床判斷的獨立決策者。




