AI醫療怎麼驗證?我會先看預期用途、在地病人資料、醫師工作流與上線後監測,準確率只是其中一格。IMDRF 2025 年發布的 10 項 GMLP 原則,已把代表性資料、獨立測試、人機互動與部署後監測放進同一條產品生命週期;TFDA 技術指引也要求交代訓練、驗證、測試與更新資料。IMDRF 的 GMLP 文件TFDA AI/ML 醫療器材軟體技術指引都把驗證拉出了實驗室。

醫院若正在排導入順序,可先對照醫療 AI 合規上線前的六個坑,再把下面這套驗證框架放進採購、試辦與上線後管理。我的判斷很簡單:沒有獨立測試資料與停用流程的 AI,準確率再高,也還沒到臨床驗收線。

AI醫療驗證是什麼

醫療團隊檢視 AI 模型的預期用途、病人族群與驗證結果

驗證要回答的是「這個系統在指定用途、指定族群、指定環境裡,輸出能不能支持安全的醫療工作」。TFDA 要求申請資料說明產品功能、演算法架構、預期用途、適應症、禁忌症與使用限制,並提出檢出率、偽陽性率、偽陰性率、檢測時間等目標功能值。TFDA 技術指引提供了這些欄位,醫院驗收時也該照著問。

因此,單一準確率沒有辦法獨立成立。胸部影像的偽陰性、急診分流的漏掉率、病歷摘要的遺漏欄位,對臨床工作的代價各不相同;指標必須綁定預期用途與可接受風險。IMDRF 要求臨床評估使用能代表預期病人族群的資料,並把年齡、性別、地理位置、疾病狀況、使用環境與量測輸入納入資料設計。IMDRF GMLP 原則 3 與 6

參考標準也要先講清楚。影像標註由誰完成、病歷摘要以哪一份定稿病歷為準、風險預測的結果追蹤多久,這些都會改變驗證結果。IMDRF 將「適合用途的參考標準」列為獨立原則,要求說明標準選擇的理由與限制。IMDRF GMLP 原則 5

AI醫療驗證怎麼運作

AI 醫療驗證流程從資料分流、獨立測試到臨床工作流監測

我會把驗證拆成五道關卡,順序也很重要。

先鎖定預期用途

先寫清楚誰用、何時用、輸入哪些資料、輸出是提醒還是建議,以及哪些病人不在適用範圍。IMDRF 將預期用途、臨床工作流、病人風險與多專業參與放在第一項原則;這會決定後面該收哪些資料、找誰判讀與設多少人工覆核。IMDRF GMLP 原則 1

把訓練、驗證、測試切開

TFDA 要求說明訓練方法、資料來源、驗證資料、測試資料與更新方式;IMDRF 進一步要求訓練資料與測試資料保持適當獨立,還要處理病人、院所與資料取得方式造成的相依性,外部驗證程度則按風險決定。TFDA 技術指引IMDRF GMLP 原則 4都支持這個分流。

實務上,醫院至少要問三件事:測試集是否來自不同時間或院所、病人是否與訓練資料重疊、資料取得設備和參數是否相同。若廠商只給一份內部切分的測試表,外部效能仍然沒有被回答。

測人機團隊,不只測模型

同一個模型放在放射科工作站、急診分流畫面或病房側欄,使用結果可能完全不同。IMDRF 要求在預期使用環境中評估人與 AI 的互動,包含使用者技能、對輸出的理解、過度依賴與使用錯誤;測試也要放進臨床條件、輸入變異與混淆因素。IMDRF GMLP 原則 7 與 8

介面驗收要看醫師能否知道輸入缺了什麼、模型何時沒有把握、建議依據在哪裡,以及如何退回人工流程。這也是AI 醫材能自己更新嗎?PCCP 與臨床責任談版本管理時,我認為最容易漏掉的現場細節。

把上線後監測寫進流程

模型上線後,病人族群、臨床做法、資料輸入、醫療基礎設施與使用行為都可能變動。FDA 2025 年公開徵詢文件把這些變動與資料漂移、效能下降、偏差和可靠度降低連在一起,也明確指出回溯測試與靜態基準無法預測動態臨床環境。FDA 真實世界 AI 醫材效能文件

監測不必一開始就追蹤所有指標,但要先定義觸發條件:輸入缺失率上升、特定族群表現下滑、人工覆核推翻比例增加、版本更新後輸出分布改變,或服務中斷超過容許時間。觸發後要有重新評估、通知、回復舊版本與暫停使用的責任人。

台灣現況:TFDA、衛福部與醫院各自要管什麼

台灣 AI 醫療治理文件對照:TFDA 醫材驗證、PCCP 與衛福部生成式 AI 指引

台灣目前已經有兩條文件路線。涉及 AI/ML 醫療器材軟體,TFDA 技術指引要求交代演算法、資料、功能性驗證、使用環境與資訊安全;2024 年公告的PCCP 申請要點則處理核准後、在限定範圍內規畫模型與資料變更的方式。PCCP 的邊界包含預期用途、適應症、使用情境、適用族群與適用部位,這些條件變動時,不能把原計畫當成通行證。

TFDA 也把搭配 AI 演算法的醫材列為新興技術範例。對高風險、新興技術或無類似品且有臨床安全與功效疑慮的產品,官方說明除臨床前測試資料外,還要提供臨床證據,並可能交由醫療器材諮議會審議。TFDA 醫療器材諮議會說明

醫院導入生成式 AI,又是另一層管理。衛福部 2026 年 5 月 29 日函頒的指引適用公私立醫院與診所,場景包含病歷撰寫、臨床決策支援、行政文書與病人溝通;文件明載它屬行政指導性質,提供醫療機構參考,涉及醫療器材仍要回到醫療器材法規處理。衛福部醫療機構應用生成式人工智慧指引

這份指引要求導入前做資料保護評估,確認系統能與既有醫療資訊系統及臨床工作流整合,並追蹤輸出與使用軌跡;系統失效、供應鏈中斷或緊急停用時,也要先規畫替代流程與責任分工。衛福部指引的核心實施原則

官方另有 AI/ML 醫療器材輔助診斷軟體驗證程序計畫,規畫蒐集國內外標準、期刊、指引與公開資料,研析模型驗證流程,並提出共通性檢測程序建議;計畫至少媒合 2 家國內廠商實際應用。這代表台灣的驗證能力仍在建置,醫院不該把廠商自評表當成在地臨床證據的終點。TFDA 計畫摘要

導入前的資料與責任檢查表

醫院採購 AI 前檢查版本、資料流、FHIR 介接、人工覆核與停用回復流程

先驗資料流,再談模型串接

FHIR 是 HL7 發布的健康照護資料交換標準,規格涵蓋 Patient、Observation、Report、ImagingStudy、Medication、Task 與 AuditEvent 等資源。HL7 FHIR R5可作為 EHR、影像、裝置紀錄與 AI 服務之間的交換層,但它不會替醫院判斷欄位是否完整、代碼是否一致,也不會證明模型在台灣病人身上有效。

採購文件應要求廠商畫出資料進出路徑:哪些欄位從 EHR 讀取、哪些資料送到外部服務、保存多久、誰能看輸出、模型回傳如何寫回病歷、每次推論用的模型版本如何留痕。FDA 在真實世界效能徵詢中,同樣把電子病歷、裝置紀錄、病人回報結果、資料品質與互通性列為監測問題。FDA 真實世界 AI 醫材效能文件

合約要寫四個停損點

第一,版本變更前後的通知與驗證責任。第二,輸入品質不符時的提示與拒答。第三,人工覆核與異常通報的時限。第四,模型或雲端服務停用時的替代流程。IMDRF 要求使用者知道產品限制、資料特性、輸出解讀、更新範圍與時間;衛福部指引則要求醫療機構規畫失效、停用與復原程序。IMDRF GMLP 原則 9 與 10衛福部生成式 AI 指引可作為合約條款的依據。

FDA 2025 年 PCCP 最終指引也要求計畫描述預定變更、發展/驗證/實作方法與影響評估,適用 510(k)、De Novo 與 PMA 路徑的 AI 醫材送件。FDA AI 醫材 PCCP 最終指引對醫院的啟示是:更新頻率可以談,更新後如何驗收更要先談。

我的取捨是把「準確率」放在採購表的中段,把「適用族群、測試獨立性、資料流、人工覆核與停用回復」放到前段。臨床導入的成本,常常花在介接、教育、紀錄與異常處理;這些環節沒有被驗證,模型就很難穩定地成為醫療工作流的一部分。

常見問題

AI醫療驗證只看準確率可以嗎?

不行,準確率必須和預期用途、病人族群、參考標準與錯誤代價一起看。TFDA 與 IMDRF 都要求說明資料來源、驗證方法、測試資料與臨床使用限制,單一數字無法涵蓋這些條件。

外部驗證和內部測試差在哪裡?

內部測試通常來自同一套開發資料流程,外部驗證則要處理不同院所、時間、設備或病人族群的資料差異。IMDRF 要求訓練與測試資料適當獨立,並依風險決定外部驗證程度。

FHIR 介接完成,就代表 AI 可以上線嗎?

不代表。FHIR 解決健康資料交換格式與資源描述,醫院仍要驗收資料完整性、權限、模型效能、人工覆核、版本追蹤與失效時的替代流程。