垂直產業
GuideSkill:讓 LLM 執行臨床指南的智能推理層
GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning

arXiv cs.AI · 2026-07-31
摘要
研究團隊推出 GuideSkill,一個將臨床實踐指南編譯成可執行函數的推理層,讓 LLM 能夠按照診療標準做出決策而非單純檢索文本。GuideSkill-Zero 從指南初始化,GuideSkill-Evo 則通過病例數據優化診斷技能,在四個基準測試中平均準確率比傳統 RAG 方案提升 13.45%,展現 AI 在醫療診斷領域的實際應用潛力。
研究團隊在 arXiv 上發表編號 2607.26160v1 的論文,提出名為 GuideSkill 的系統,旨在解決大型語言模型(LLM)在臨床實踐指南(CPGs)應用上的核心限制。現有系統通常僅檢索指南文本或透過訓練吸收內容,無法執行其規則;GuideSkill 則作為外部推理層,將特定疾病的診斷標準編譯為可執行函數,直接返回序數診斷支持分數。
該系統包含兩個核心組件:GuideSkill-Zero 與 GuideSkill-Evo。GuideSkill-Zero 直接從臨床指南進行初始化,而 GuideSkill-Evo 則利用病例與診斷配對數據來優化已覆蓋的技能並補充缺失的診斷。在推理階段,LLM 提出鑑別診斷,定位每個匹配技能所需的特徵,並將 LLM 的排名與執行技能的分數進行融合。
在四個基準測試與四個後端模型(backbones)的評估中,GuideSkill-Zero 的平均宏平均準確率比傳統基於指南的檢索增強生成(RAG)方案提升了 13.45%。GuideSkill-Evo 則在每個後端模型中均達到最高的宏平均準確率,相對於直接推理提升了 18.49% 的相對值,並將黃金標籤技能覆蓋率從 5 開始提升。
●開發者:可學習如何將結構化規則整合到 LLM 工作流中
●投資人:醫療 AI 診斷輔助工具市場值得關注
●一般用戶:醫療機構可能採用更符合診療指南的 AI 輔助診斷系統
重要性評分
🟠 值得關注
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。
相關指南

AI聲稱解開400年密碼「Cyphral Distich」:我們調閱原件逐字核對的結果
Vals AI 宣稱用 Fable 5.1 解開 Thomas Urquhart 400 年前密碼 Cyphral Distich,Reticuli 隨即提出反駁指其「未解」。我們調閱大英圖書館、1834年版與傳記三份原件逐字核對,找出雙方都沒點出的關鍵差異:兩邊用的是不同版本的底本。
閱讀指南 →
ChatGPT 小型企業工具集(Small Business Collection):16 個官方工具怎麼用、台灣店家該注意什麼
OpenAI 官方 ChatGPT 小型企業工具集共 16 個外掛,我們逐一核對官方目錄頁與工具詳情頁,整理成台灣店家看得懂的用法與注意事項——包含最容易被忽略的 Mercury 銀行外掛,以及方案、地區限制官方沒有講清楚的地方。
閱讀指南 →
TypeSafe 的 Jev 是什麼:不會寫文章、只做判斷的「System One」模型,對開發者與小團隊的意義
TypeSafe AI 推出的 Jev 不寫文章、不生成文字,只做「從固定選項裡挑一個」的判斷——我們核對官方 blog 與文件原文,把速度、價格、「不會幻覺」這句話的真正意思,以及對小團隊的實際用法,一次講清楚。
閱讀指南 →🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。