←新聞 10 / 12→

垂直產業

Fully Open Meditron:醫療 LLM 的完全開放和可審計管道

Fully Open Meditron: An Auditable Pipeline for Clinical LLMs

Fully Open Meditron:醫療 LLM 的完全開放和可審計管道

arXiv cs.AI · 2026-05-18

摘要

研究團隊推出首個完全開放的臨床 LLM 系統 Fully Open Meditron,涵蓋經臨床醫生審核的訓練語料庫、可重現的數據構建框架及使用對齊評估協議。該系統整合 8 個公開醫學 QA 資料集,並透過臨床醫生驗證的合成擴展(包含 46,469 份臨床實踐指南)來強化覆蓋範圍,旨在打造醫療臨床決策支持系統的透明、可審計解決方案。

臨床決策支援系統(CDSS)需要可審計且可重現的管道,以便進行嚴謹驗證,但現有的基於大型語言模型(LLM)的 CDSS 大多不透明。目前的「開放」模型通常僅開放權重,卻隱藏了數據來源、策展程序及生成管道。在醫療領域,目前尚無完全開放(Fully Open, FO)的模型能暴露完整的訓練堆疊。研究團隊因此推出 Fully Open Meditron,這是首個完全開放的 LLM-CDSS 建構管道,包含經臨床醫生審核的訓練語料庫、可重現的數據構建與訓練框架,以及使用對齊評估協議。

該語料庫整合了八個公開的醫療問答(QA)資料集,並透過三種經臨床醫生驗證的合成擴展來擴大覆蓋範圍:考試型 QA、源自 46,469 份臨床實踐指南的指南 grounded QA,以及臨床病例描述。管道系統強制執行全域去汙染、教師生成的黃金標籤重採樣,並由四人醫師小組進行端到端驗證。評估採用「LLM-as-a-judge」協議,針對專家撰寫的臨床病例描述進行,並與 204 名人類評審進行校準。

研究將此方法應用於五個 FO 基礎模型,包括 Apertus-70B/8B-Instruct、OLMo-2-32B-SFT 以及 EuroLLM-22B/9B-Instruct。所有 MeditronFO 變體均優於其基礎模型。其中,Apertus-70B-MeditronFO 在綜合醫療基準測試中比基礎模型提升了 6.6 分(從 47.2% 提升至 53.8%),建立了新的 FO 狀態最佳(SoTA)。Gemma-3-27B-MeditronFO 在 LLM-as-a-judge 比較中以 58.6% 的勝率優於 MedGemma,並在 HealthBench 上表現更佳(58% 對 55.9%)。結果顯示,完全開放的管道能在不犧牲可審計性或可重現性的前提下,實現領域特定的狀態最佳效能。

●開發者:可參考完全透明的 LLM 訓練堆疊設計,用於構建醫療決策支持系統

●投資人:醫療 AI 領域朝向可審計和合規方向發展,降低法律和監管風險

●一般用戶:醫療 AI 系統將變得更透明可靠,有助於建立對臨床決策支持工具的信任

重要性評分

76/100

🟠 值得關注

臨床 LLM醫療 AI可審計管道
原文出處
上一則← 智能體自主設計神經網絡架構:AIRA-Compose 和 AIRA-Design 框架下一則量化破壞對齐性:Qwen、Mistral 等多款 LLM 在不同精度下偏見涌現研究 →

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。