醫療AI業者長期主張,臨床資料訓練或檢索增強生成(RAG)可讓專用工具比通用模型更可靠。這項研究直接比較OpenEvidence、UpToDate Expert AI與OpenAI、Google及Anthropic的前沿模型;若通用產品持續勝出,醫療專用AI的定價、技術護城河與醫院採購依據都須重估,但基準測試仍不等同病患照護成效。
《Nature Medicine》於2026年6月12日發表結果:500題MedQA中,Gemini準確率97.4%,GPT為94.2%、Claude為90.2%,OpenEvidence與UpToDate則為89.6%及88.4%。研究另由12名美國臨床人員盲評100筆真實醫師查詢,三款通用模型仍全面領先。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡這個訊號沒有歷史回聲
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。