新聞 10 / 12

研究突破

為什麼 LLMs 在策略性遊戲中表現不佳?觀察、信念與行動之間的斷裂

Why Do LLMs Struggle in Strategic Play? Broken Links Between Observations, Beliefs, and Actions

為什麼 LLMs 在策略性遊戲中表現不佳?觀察、信念與行動之間的斷裂

arXiv cs.CL · 2026-05-04

摘要

研究發現 LLMs 在不完全資訊遊戲(如談判、政策制定)中存在兩個根本性缺陷:觀察-信念差距和信念-行動差距。LLMs 內部對遊戲狀態的信念比表面陳述更準確,但這些信念容易受多步推理、偏見和相互作用漂移的影響,導致決策能力受損。這項發現揭示了 LLMs 在複雜決策任務中的內部機制限制。

大型語言模型(LLMs)正被越來越多地用於處理不完全資訊下的策略性決策任務,例如談判和政策制定。儘管這些模型在許多此類任務中表現優異,但它們失敗的方式卻鮮為人知。研究透過使用開放權重模型 Llama 3.1、Qwen3 和 gpt-oss 進行的實驗,揭示了 LLMs 在不完全資訊遊戲中決策機制背後存在的兩個根本性差距。

第一個差距是觀察與信念之間的斷裂(observation-belief gap)。LLMs 對潛在遊戲狀態的內部信念編碼,實際上比它們自己的口語報告要準確得多。然而,這些信念非常脆弱:隨著多步推理的進行,信念準確度會下降;同時,信念會受到首因效應(primacy)和近因效應(recency)偏見的影響;在長時間的互動過程中,信念還會偏離貝葉斯一致性(Bayesian coherence)。

第二個差距是信念與行動之間的斷裂(belief-action gap)。將內部信念隱式轉換為行動的能力,比將信念外化到提示(prompt)中的轉換能力更弱。研究發現,無論是內部信念還是外化信念,都沒有一致地帶來更高的遊戲收益。這些結果表明,分析 LLMs 的內部過程可以暴露系統性的弱點,在部署 LLMs 進入策略領域之前,若缺乏堅固的防護措施,必須保持謹慎。

開發者:需重新評估 LLMs 用於談判、政策制定等策略決策場景的可靠性,並開發補償性架構

投資人:策略決策 AI 應用的市場風險值得關注,技術成熟度有待提升

一般用戶:不應過度信任 LLMs 在複雜談判或決策輔助中的建議

重要性評分

74/100

🟠 值得關注

LLM策略決策認知偏差
原文出處
上一則被破解的 Frontier 模型仍能保持性能下一則RadLite:小型語言模型的多任務 LoRA 微調,實現 CPU 可部署的放射科 AI

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。