研究突破
針對大型語言模型在複雜任務中需要長序列調用工具的問題,研究指...
Choosing Before Acting: Comparative Value Estimation for Long-Horizon Tool-Use Agents

arxiv.org · 2026-10-05
摘要
針對大型語言模型在複雜任務中需要長序列調用工具的問題,研究指出傳統的最終結果獎勵難以有效評估每一步的貢獻。為此,研究團隊提出 CITA(Comparative Inference for Tool-use Agents)方法,讓代理模型在執行工具前,先比較不同選項的長期價值,以提升決策的精確度與效率。
長序列工具調用的信用分配難題
大型語言模型處理複雜任務時,往往要依賴一長串的工具調用。每次調用都會改變任務狀態,也會影響後續決策。但傳統強化學習方法碰上這種長交互軌跡,會遇到信用分配困難。最終結果獎勵雖然容易定義,卻要等整條軌跡結束才有回饋,序列一長,就很難判斷是哪一步工具調用造成成功或失敗。步驟級獎勵能給出更直接的回饋,但在工具使用環境中,要取得可靠的步驟監督非常困難。人工標註無法大規模擴展,基於大型語言模型的判斷可能不穩定,基於 rollout 的估計則要額外執行工具調用,成本高、噪聲也大。
提出比較推論模型 CITA
針對這些問題,研究團隊提出比較推論工具使用代理框架(Comparative Inference for Tool-use Agents, CITA)。這套方法的核心觀點是:有效的工具使用代理,應該在執行工具前,先評估各個候選的下一步工具調用的長期價值。這需要對相同上下文下的替代調用做比較監督。研究團隊設計了比較推論模型(Comparative Inference Model, CIM),用來估計在當前上下文下,某個候選工具調用支持最終任務成功的機率。CIM 除了預測價值,還會輸出置信度分數,用來衡量估計是否可靠。
三種來源的資料建構訓練信號
記錄下來的軌跡只包含實際執行過的工具調用,沒被選中的替代方案缺乏價值資訊。因此 CITA 採用三種互補的資料來源,建構配對訓練信號來訓練 CIM:
1. 觀察軌跡配對:從真實的工具使用軌跡中提取。系統比對相似的決策上下文,比較不同的下一步工具,並以其下游結果作為監督信號。這讓訓練信號貼近真實的工具使用行為。 2. 貝葉斯模擬器配對:以工具轉換圖建構沙盒環境。這個模擬器不執行真實 API,而是從貝葉斯先驗中取樣工具成功機率與轉換可靠性機率。它能提供可控的叉點比較,擴大訓練資料的覆蓋範圍。 3. 基於大型語言模型的比較配對:針對記錄中罕見、或模擬器難以涵蓋的替代方案,用大型語言模型做語義比較。模型會模擬每個選項後續的工具調用與狀態變化,再判斷任務是否可完成,藉此提供語義比較信號。
研究採用分階段的混合策略:早期訓練較依賴模擬器配對,中期平衡各種來源,後期則提高觀察軌跡與基於大型語言模型配對的權重,以更貼近真實的工具使用上下文。
實驗結果與效能提升
研究在 Toolathlon、TOUCAN 和 TRAJECT-Bench 三個工具使用基準測試上評估 CITA,並以 Qwen2.5-7B 和 Llama3.1-8B 作為骨幹模型。結果顯示,在全部六種資料集與骨幹模型的組合中,CITA 的 Tool F1 和任務成功率(TSR)都是最佳。和最強的先前方法相比,CITA 的 Tool F1 平均高出 7.55 分,TSR 平均高出 9.93 分。
消融實驗進一步驗證各個組件的重要性。移除顯式的價值差距監督($\mathcal{L}_{gap}$)後,效能大幅下降,證明比較價值估計是 CIM 的核心。移除貝葉斯模擬器配對也造成明顯損失,顯示結構化叉點比較的重要性。此外,CIM 的置信度校準實驗顯示,完整目標函數能明顯降低預期校準誤差,讓置信度分數更準確地反映預測的可靠程度。
推論效率與應用前景
推論階段,CITA 利用 CIM 為候選工具調用評分,並選出分數最高者,不需要更新策略。引入 CIM 評分會帶來一定的推論開銷,但因為它是直接估計價值,而不是反覆模擬未來狀態,CITA 的推論速度遠快於基於線上模擬的方法。另外,由於任務成功率提高,CITA 取得成功軌跡的預期時間成本最低。這項研究為長序列工具使用提供了更可靠的決策信號,有助於提升代理在複雜環境中完成任務的能力。
●開發者:可關注 CITA 演算法如何優化 Agent 的決策邏輯
●投資人:AI Agent 技術在複雜任務處理上的突破值得留意
●一般用戶:未來 AI 助手處理多步驟任務的準確度有望提升
重要性評分
🟠 值得關注
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。
相關指南

LLM 模型安全與倫理實戰:2026 年企業合規與風險管理指南
2026 年企業如何確保 LLM 模型安全?本指南涵蓋 AI 倫理規範、企業 AI 合規策略及模型紅隊測試實戰步驟,協助建立安全的 AI 部署環境。
閱讀指南 →
LLM 是什麼?5 分鐘白話文解釋大型語言模型運作原理
LLM(大型語言模型)是什麼?本文用白話文解釋:LLM 是怎麼「學會」語言的、預測下一個字是怎麼回事、ChatGPT 和 Claude 都是 LLM,5 分鐘看懂核心原理。
閱讀指南 →
TypeSafe Jev 實際上手:三種情境,看「只做判斷的 AI」能替你省掉哪些 if
用新聞分類、社群選題、讀者來信路由三種情境,示範 TypeSafe Jev 這種「只做判斷的 AI」能替你省掉哪些 if,外加幾個它做不到的邊界測試、422 拒絕原文,以及三個必須自己補的坑。
閱讀指南 →🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。