←新聞 10 / 12→

研究突破

Forecast-Dojo:用於基準測試和訓練 LLM 預測代理的可重放環境

Forecast-Dojo: Replayable Environments for Benchmarking and Training LLM Forecasting Agents

Forecast-Dojo:用於基準測試和訓練 LLM 預測代理的可重放環境

arxiv.org · 2026-09-25

摘要

研究團隊推出 Forecast-Dojo,一個結合已解決預測市場問題與時間標記新聞的環境,讓 LLM 代理能夠研究事件並在不同歷史時間點重新評估預測。該平台包含 1,568 個 Polymarket 事件和 1,880 萬篇時間標記新聞,支持無需等待新事件就能進行反覆評估、訓練數據收集和基于實際結果的反饋,為 LLM 預測能力的開發和評估提供了關鍵基礎設施。

開源研究環境助力 LLM 預測能力評估

一支研究團隊推出 Forecast-Dojo,一個用來測試與訓練大型語言模型預測代理的可重放環境。這個平台由 Liqin Ye 及其他 10 位作者共同開發,已於 2026 年 9 月 24 日提交到 arXiv。

資料規模與環境設計

Forecast-Dojo 整合了已確認結果的預測市場問題,以及帶時間標記的新聞資料。環境內含 1,568 個 Polymarket 事件,按時間切分為訓練期與評估期,並搭配 1,880 萬篇帶日期的新聞文章。這樣的組合讓 LLM 代理可以針對同一事件在不同歷史時間點做研究,並在各個時間節點重新評估自己的預測。

重複評估與訓練的優勢

這個環境的關鍵設計是可以反覆評估,不必等新事件真的發生結果才能測試。平台同時提供互動軌跡與實際結果的回饋,讓代理拿來學習。這樣一來,研究人員既能蒐集訓練資料,也能拿已記錄的真實結果做回饋,不用等真實世界即時發生新事件。

模型評估結果

研究團隊評估了 12 個模型。結果顯示,配備研究工具的模型在 Brier 分數上都有改善。隨著事件逐步展開,預測品質也跟著提升,在出現較多新時間標記證據的步驟中效果最明顯。

不過,這 12 個模型的表現全數落後歷史預測市場的結果,在 Brier 分數與準確度兩項指標上都有差距。

信念記筆本的有限效果

研究中測試了一種叫「信念記筆本」的方法,可以在不同時間點之間傳遞資訊。結果顯示這個方法確實降低了研究成本,但沒能穩定地提升預測品質。

後續應用探索

除了拿來評估之外,Forecast-Dojo 也提供互動軌跡和結果回饋,供代理學習使用。研究團隊以監督式微調做為概念驗證,展示這個環境在訓練應用上的潛力。

●開發者:掌握 LLM 代理訓練與評估的標準化環境,加速預測類應用開發

●投資人:預測市場和決策支持系統領域的技術基礎逐漸成熟

●一般用戶:未來的預測工具和決策助手會變得更準確可靠

重要性評分

85/100

🔴 高度重要

LLM 代理預測市場基準測試
原文出處
上一則← Zuck 拒絕加入 AI 緩慢發展陣營,Meta 選擇加速路線下一則自主研究代理的獎勵黑客問題:LLM 模型如何規避評估機制 →

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。