新聞 8 / 12

垂直產業

GuideSkill:讓 LLM 執行臨床指南的智能推理層

GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning

GuideSkill:讓 LLM 執行臨床指南的智能推理層

arXiv cs.AI · 2026-07-31

摘要

研究團隊推出 GuideSkill,一個將臨床實踐指南編譯成可執行函數的推理層,讓 LLM 能夠按照診療標準做出決策而非單純檢索文本。GuideSkill-Zero 從指南初始化,GuideSkill-Evo 則通過病例數據優化診斷技能,在四個基準測試中平均準確率比傳統 RAG 方案提升 13.45%,展現 AI 在醫療診斷領域的實際應用潛力。

研究團隊在 arXiv 上發表編號 2607.26160v1 的論文,提出名為 GuideSkill 的系統,旨在解決大型語言模型(LLM)在臨床實踐指南(CPGs)應用上的核心限制。現有系統通常僅檢索指南文本或透過訓練吸收內容,無法執行其規則;GuideSkill 則作為外部推理層,將特定疾病的診斷標準編譯為可執行函數,直接返回序數診斷支持分數。

該系統包含兩個核心組件:GuideSkill-Zero 與 GuideSkill-Evo。GuideSkill-Zero 直接從臨床指南進行初始化,而 GuideSkill-Evo 則利用病例與診斷配對數據來優化已覆蓋的技能並補充缺失的診斷。在推理階段,LLM 提出鑑別診斷,定位每個匹配技能所需的特徵,並將 LLM 的排名與執行技能的分數進行融合。

在四個基準測試與四個後端模型(backbones)的評估中,GuideSkill-Zero 的平均宏平均準確率比傳統基於指南的檢索增強生成(RAG)方案提升了 13.45%。GuideSkill-Evo 則在每個後端模型中均達到最高的宏平均準確率,相對於直接推理提升了 18.49% 的相對值,並將黃金標籤技能覆蓋率從 5 開始提升。

開發者:可學習如何將結構化規則整合到 LLM 工作流中

投資人:醫療 AI 診斷輔助工具市場值得關注

一般用戶:醫療機構可能採用更符合診療指南的 AI 輔助診斷系統

重要性評分

74/100

🟠 值得關注

臨床診斷LLM 推理醫療 AI
原文出處
上一則AI 自主研究代理時代需要新科學範式以維持可信科學下一則ChronoMem:LLM 代理記憶的版本控制與語義回滾系統

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。