醫療 AI 的第三條路:不做診斷、只做把關——這才是今年真正落地的那一批
大家都在等 AI 醫生,結果真正裝進醫院的是 AI 品管員。這個落差不是技術不夠,而是醫療系統對「誰負責」這件事有非常清楚的答案——而把關型 AI 剛好不碰那條線。
醫療 AI 的第三條路:不做診斷、只做把關——這才是今年真正落地的那一批
一位在中部婦產科診所執業十二年的醫師,一個下午要看三十多位孕婦。超音波是他自己掃的,圖是他自己判的,報告也是他自己打的。他跟我說過一句話我一直記得:「我不怕看不出問題,我怕的是那張圖我根本沒拍到。」
這句話大概解釋了今年醫療 AI 真正的落地方向——而它跟大眾以為的方向不一樣。
為什麼診斷型 AI 一直卡住
過去幾年醫療 AI 的敘事一直是「AI 能不能比醫師準」。這個問題本身沒錯,卻很難換成可以採購的產品,原因不在準確率,在責任。
當 AI 說「這是惡性」,誰負責?如果醫師照著做而錯了,責任在醫師還是廠商?如果醫師不照做而 AI 對了,那算不算醫療疏失?這些問題沒有答案之前,任何診斷型 AI 的採購案都會在醫院的法務與醫療品質委員會卡住。這不是保守,是制度在運作——醫療體系對責任歸屬的要求本來就比其他產業嚴格得多。
於是這一年最實際的一批產品,選了完全不同的切點。
把關型 AI 的三種形態
第一種:檢查完整性把關。 產前超音波是最典型的例子。漏診的最大來源往往不是醫師看不懂,而是那個標準切面沒拍到——而事後補不回來。Sonio 在檢查過程中即時提示影像品質與缺少的切面,Diagnoly 用本機運算做即時的解剖標記確認,BioticsAI 把品質保證放在異常偵測之前。這三家的產品邏輯都不是「我看到了異常」,而是「你還沒看完」。
第二種:判讀一致性把關。 同一批胚胎給不同胚胎師評分會有差異,同一份精液檢體給不同技術員數出來的濃度也不一樣——這種人與人之間的變異,長期被當成「經驗差異」接受,但它讓治療前後的比較失去意義。MIM Fertility 的卵泡監測、Life Whisperer 的胚胎評估、Hamilton Thorne 把 AI 放進精子分析儀,做的都是同一件事:把數字穩下來。它們不聲稱比胚胎師厲害,只聲稱不會累、不會因人而異。
第三種:文件與流程把關。 Theator 從手術影像自動生成手術紀錄,官方說自動報告的準確率約九成五、人工約七成三。這個數字對台灣讀者要換個角度看——它在美國的價值是少漏帳,在台灣健保體系下這一段用不到,但「手術紀錄寫得完整」本身對品質檢討與教學是實質價值。
為什麼把關型 AI 過得了關
把這三種形態放在一起看,共同點很清楚:它們都不取代醫師的判斷,只保證醫師有機會做判斷。
這個定位在制度上的意義很大。AI 提示「第四腔室切面還沒拍」,這不是診斷意見,是流程檢查;醫師拍了、看了、判了,責任結構完全沒變。所以它不必等法規釐清責任歸屬,也不必說服醫師讓出決定權——它賣的是一個少出錯的機會。
也因此,這類產品的效益比較容易算:漏拍率降低多少、判讀變異縮小多少、文件完整度提高多少。這些都是醫院本來就在管的品質指標,不需要為了 AI 另外發明一套衡量方式。
但把關型 AI 也有它自己的陷阱,而這一點很少被講。當 AI 說「你拍完了」,醫師會不會就真的相信? 這叫自動化偏誤(automation bias),在放射科的研究裡已經被反覆證實。把關工具設計得越可靠,使用者對它的依賴就越深,而它漏掉的那幾個百分比,剛好會落在最沒人複查的地方。這是把關型 AI 最需要被監測的風險,而且它不會出現在任何一份效能報告裡。
台灣醫療機構評估時該問的五個問題
第一,法規狀態是什麼? FDA 清除或 CE 標誌都不等於在台灣可以合法用於臨床。TFDA 的許可狀態要直接向原廠或代理確認,不要拿國外新聞當依據。
第二,跟我們的機器接得起來嗎? 這一題常被低估。不同品牌超音波的影像輸出格式差異很大,官網寫「相容主要品牌」不等於你那台十年前的機器可以用。用實機驗證,不是看規格表。
第三,報告能不能進我們的系統? 台灣醫院的 HIS 客製程度極高,自動產出的報告若不能直接進病歷,醫師還是要複製貼上,效益就折半。POC 一定要把 IT 整合含進去。
第四,中文的表現如何? 語音類與文件類的 AI 尤其要問。台灣的臨床對話混雜國台語與英文術語,英文訓練的模型直接套用沒有保證。
第五,我們怎麼監測自動化偏誤? 這是我認為最該問但幾乎沒人問的一題。合理的做法是保留一定比例的隨機人工複查,並持續追蹤「AI 說沒問題但人工發現異常」的案例數,而不是等出事才回頭查。
給不同角色的建議
診所端:這類工具對一人作業的診所價值可能比醫學中心更大,因為醫學中心有充足的專科醫師覆核機制,診所往往就是醫師自己掃、自己判、自己打報告。先從有免費試用的(例如 Diagnoly)開始,用自己的實際案例測一輪。
醫學中心:談合約時要把「我們用得到什麼」跟「原廠賣什麼」分清楚。以 Theator 為例,它最賺錢的計費功能在台灣沒有價值,真正值錢的是教學與品質分析——重點放對,議價空間就出來了。
一般讀者:如果你的產檢報告上出現了 AI 輔助的字樣,合理的理解是「這次檢查的完整度有多一層確認」,不是「AI 保證寶寶健康」。看到任何陰性結果,它的意思永遠是「本次檢查未發現」,而不是「沒有問題」。這個差別在醫療上很重要。
TheAI學院 總結與評語
我覺得今年醫療 AI 最值得記下來的一件事,不是哪個模型準確率又破紀錄,而是產業終於找到一個不必先解決責任歸屬就能落地的位置。
評語:把關型 AI 之所以跑得比診斷型 AI 快,不是因為它比較聰明,是因為它比較有自知之明——它知道自己該站在醫師前面遞工具,而不是站在醫師位置上下判斷。
具體建議收在一句話:評估這類工具時,別問它「準不準」,問它「漏掉的時候會發生什麼事」。前者是行銷問題,後者才是臨床問題。
資料來源
本文依各廠商公開資訊與官方網站說明整理,效能數字均為官方自述,實際臨床表現需由各機構自行驗證。文中內容為產業趨勢分析,不構成醫療建議;任何檢查與治療決策請與您的醫師討論。
常見問題
什麼是「把關型」醫療 AI?
指不做診斷、只確保流程與品質的 AI。三種常見形態是檢查完整性把關(提示還沒拍到的標準切面)、判讀一致性把關(讓不同人評出來的分數趨於一致)、以及文件流程把關(自動產出完整紀錄)。它們的共同點是不取代醫師判斷,只保證醫師有機會做判斷。
為什麼診斷型 AI 比較難落地?
核心問題是責任歸屬。當 AI 說某個病灶是惡性,醫師照做而錯了誰負責、不照做而 AI 對了算不算疏失,這些在法規與實務上都沒有乾淨答案,採購案因此常卡在法務與醫療品質委員會。把關型 AI 不碰這條線,所以走得比較快。
把關型 AI 有什麼風險?
最被低估的是自動化偏誤——當工具越可靠,使用者對它的依賴越深,而它漏掉的那幾個百分比會落在最沒人複查的地方。這在放射科研究中已被反覆證實。導入時應保留隨機人工複查比例,並持續追蹤「AI 說沒問題但人工發現異常」的案例數。
台灣的診所評估這類工具最該注意什麼?
五件事:TFDA 法規狀態(FDA 清除不等於台灣可用)、與現有機器的實機相容性、報告能不能直接進院內系統、中文與台語的表現、以及如何監測自動化偏誤。其中第三項在台灣最常卡死專案,因為國內 HIS 客製程度很高。