醫療人工智能在準確率方面的提升速度已經超過了其在改善患者預後方面所取得的進展。
2026 年的大量研究表明,醫療人工智能領域存在一個持續的差距:這些系統可以影響醫生的選擇並取得令人印象深刻的診斷結果,但卻無法證明患者實際上變得更健康。.
這對於購買這些系統的醫院、試圖展示其用途的公司以及在醫生診所採用人工智能後確定應考慮哪些證據的機構來說都很重要。.
監管機構開始審查的證據問題
人工智能的卓越性能與已證實的臨牀療效之間的差距似乎越來越大,不容忽視。《 金融時報》 在其標題中概括了這種情況:
“醫療人工智能存在證據證明問題。”
這個問題如今已不再侷限於學術討論。美國食品藥品監督管理局(FDA)也在研究如何評估這些人工智能醫療設備在使用前後的安全性,並提出了許多類似的問題。這份於 8月18日發佈的討論文件(公衆意見徵集截止日期爲10月19日)涵蓋了風險評估、上市前評估和上市後監測等議題。
美國食品藥品監督管理局 (FDA) 特意聲明,本文僅爲討論文件,並非指導方針草案、政策變更提案或對未來監管預期的任何指示。.
此前 FDA對實際應用性能的調查 也考慮到了模型漂移問題以及使用靜態指標的侷限性。這引出了一個不容忽視的更重要的問題:一旦人工智能解決方案走出實驗室,我們該如何衡量其安全性和有效性?
在肯尼亞,人工智能支持並未降低治療失敗率。
6月26日發表在《自然醫學》雜誌上的一項研究中,來自 內羅畢和基安布 兩縣彭達健康中心16家醫療機構的103名臨牀醫生分別在有或沒有大型語言模型(LLM)輔助決策的情況下爲患者提供治療。在9691名登記患者中,有9347名患者被納入主要分析。
AI組14天治療失敗率爲2.2%,對照組爲2%,調整後的比值比爲0.77,但差異無統計學意義(P=0.13)。干預措施未發生嚴重不良事件。.
使用人工智能的小組確實擁有更完善的文檔記錄、更恰當的診斷和治療方案。然而,這一結果的意義在於,改進的流程措施並未帶來患者預後的任何改善。.
這一趨勢與2024年的RAPIDx AI試驗結果相似。在對3029名患者進行的主要分析中,接受人工智能治療的患者發生心血管死亡、心肌梗死或非計劃心血管再入院的6個月複合終點事件的比例爲26%,而接受標準治療的患者該比例爲26.4%。然而,在非1型心肌梗死患者組中,接受人工智能輔助治療的患者進行有創冠狀動脈造影的頻率降低了47%。
分數持續攀升; 但實際效果卻滯後。
一項 多國隨機試驗 發現,GPT-4o 使 249 名醫生的臨牀情景題表現分別在肯尼亞提高了 18%,在印度尼西亞提高了 10.7%,在荷蘭提高了 7.2%(P<0.001)。
然而,這些都是模擬案例,並非真實世界的情況,對照組的參與者無法使用互聯網或臨牀方案,也沒有評估任何不良後果。這項研究證實,人工智能在受控環境下可以提高績效,但並未說明對患者預後的影響。.
由李章、雅各布·尼古拉斯·凱瑟及其同事開展的另一項發表在《自然醫學》上的研究表明,針對 七種疾病的基準測試,。該研究引入一致性閾值後,現場診斷系統保留了49.4%的病例,準確率達到98.9%,其餘病例則需由專業人員進行復核。然而,作者指出,還需要在真實的臨牀環境中開展試驗來進一步驗證這些結果。

爲什麼知情醫生也無法解決問題
根據 證據圖 ,智能體人工智能現在不僅應用於行政管理,還應用於診斷、管理和其他醫療保健任務,因此,能夠管理和審計此類系統變得越來越重要。
另一篇 發表在《npj數字醫學》上的評論文章 指出,臨牀醫生的存在本身並不能保證充分的監督和管理。自動化偏見可能導致人們更容易接受有缺陷的建議,而有效的監督則需要足夠的知識、時間和權限來質疑係統並進行干預。
作者警告說,如果沒有這些條件,人爲監督就可能淪爲一種責任保障:
責任可能會落到臨牀醫生身上,他們被期望發現並糾正他們無法發現或糾正的錯誤……這是一個道德崩潰區。.
這使得爭論的焦點從人類是否在技術上“參與其中”,轉移到該人是否真的有能力在必要時質疑、推翻和停止系統。.
謹慎背後的商業利益
MarketsandMarkets 預測,醫療保健人工智能市場規模將從2026年的366.7億美元增長到2031年的1947.9億美元,複合年增長率達39.7%。如果這一增長趨勢得以實現,醫院將在人工智能採購決策中做出更多選擇,但目前患者療效方面的證據仍然參差不齊。
這可能會將競爭壓力轉移到更難推廣但對供應商更有價值的東西上:可實際審計的前瞻性驗證、本地績效監控和監督。.
最頂尖的加密貨幣專家都在閱讀我們的簡報。想 加入他們?










