安全倫理
AI Safety Training 可能造成臨床危害
AI Safety Training Can be Clinically Harmful

arXiv cs.CL · 2026-04-28
摘要
研究發現大型語言模型作為心理健康支持工具部署時存在嚴重缺陷——在評估的四個生成模型中,雖然表面上能正確回應(準確率 91-100%),但在高難度治療場景下的實際療效卻大幅下降到 22-33%,且在三分之一以上的案例中導致患者心理惡化。研究團隊測試了 250 個延長曝露療法和 146 個認知行為治療重構練習,發現 RLHF 安全對齊反而會破壞治療效果,這對於大規模部署的心理健康 AI 應用構成重大警示。
●開發者:在部署心理健康應用時需要重新評估安全對齊策略與臨床效果的權衡
●投資人:心理健康 AI 應用可能面臨臨床驗證風險,需謹慎評估該領域投資
●一般用戶:已在使用的 AI 心理健康輔助工具可能效果不如預期,甚至可能有害
重要性評分
82/100
🔴 高度重要
LLM 安全心理健康應用臨床有效性
原文出處喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。
相關指南

Superunit 教學
Superunit 教學:繁中完整上手指南(功能、定價、實測)
Superunit 教學完整指南,深入解析 Superunit 是什麼、怎麼用。涵蓋功能介紹、免費方案與中文支援實測,助您快速上手並掌握最佳實踐技巧。
閱讀指南 →
Robynn AI 教學
Robynn AI 教學:繁中完整上手指南(功能、免費版、實測)
Robynn AI 教學完整指南,詳解 Robynn AI 是什麼、怎麼用。包含繁中介面設定、免費版功能實測與進階操作技巧,助您快速上手 AI 工具。
閱讀指南 →
PureBox.ai 教學
PureBox.ai 教學:繁中完整上手指南(功能、免費版、實測)
PureBox.ai 教學完整指南,深入解析 PureBox.ai 是什麼、怎麼用。涵蓋免費版功能實測、繁中介面設定及實戰範例,助您快速上手 AI 新工具。
閱讀指南 →🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。