研究突破
Forecast-Dojo:用於基準測試和訓練 LLM 預測代理的可重放環境
Forecast-Dojo: Replayable Environments for Benchmarking and Training LLM Forecasting Agents

arxiv.org · 2026-09-25
摘要
研究團隊推出 Forecast-Dojo,一個結合已解決預測市場問題與時間標記新聞的環境,讓 LLM 代理能夠研究事件並在不同歷史時間點重新評估預測。該平台包含 1,568 個 Polymarket 事件和 1,880 萬篇時間標記新聞,支持無需等待新事件就能進行反覆評估、訓練數據收集和基于實際結果的反饋,為 LLM 預測能力的開發和評估提供了關鍵基礎設施。
開源研究環境助力 LLM 預測能力評估
一支研究團隊推出 Forecast-Dojo,一個用來測試與訓練大型語言模型預測代理的可重放環境。這個平台由 Liqin Ye 及其他 10 位作者共同開發,已於 2026 年 9 月 24 日提交到 arXiv。
資料規模與環境設計
Forecast-Dojo 整合了已確認結果的預測市場問題,以及帶時間標記的新聞資料。環境內含 1,568 個 Polymarket 事件,按時間切分為訓練期與評估期,並搭配 1,880 萬篇帶日期的新聞文章。這樣的組合讓 LLM 代理可以針對同一事件在不同歷史時間點做研究,並在各個時間節點重新評估自己的預測。
重複評估與訓練的優勢
這個環境的關鍵設計是可以反覆評估,不必等新事件真的發生結果才能測試。平台同時提供互動軌跡與實際結果的回饋,讓代理拿來學習。這樣一來,研究人員既能蒐集訓練資料,也能拿已記錄的真實結果做回饋,不用等真實世界即時發生新事件。
模型評估結果
研究團隊評估了 12 個模型。結果顯示,配備研究工具的模型在 Brier 分數上都有改善。隨著事件逐步展開,預測品質也跟著提升,在出現較多新時間標記證據的步驟中效果最明顯。
不過,這 12 個模型的表現全數落後歷史預測市場的結果,在 Brier 分數與準確度兩項指標上都有差距。
信念記筆本的有限效果
研究中測試了一種叫「信念記筆本」的方法,可以在不同時間點之間傳遞資訊。結果顯示這個方法確實降低了研究成本,但沒能穩定地提升預測品質。
後續應用探索
除了拿來評估之外,Forecast-Dojo 也提供互動軌跡和結果回饋,供代理學習使用。研究團隊以監督式微調做為概念驗證,展示這個環境在訓練應用上的潛力。
●開發者:掌握 LLM 代理訓練與評估的標準化環境,加速預測類應用開發
●投資人:預測市場和決策支持系統領域的技術基礎逐漸成熟
●一般用戶:未來的預測工具和決策助手會變得更準確可靠
重要性評分
🔴 高度重要
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。
相關指南

AI聲稱解開400年密碼「Cyphral Distich」:我們調閱原件逐字核對的結果
Vals AI 宣稱用 Fable 5.1 解開 Thomas Urquhart 400 年前密碼 Cyphral Distich,Reticuli 隨即提出反駁指其「未解」。我們調閱大英圖書館、1834年版與傳記三份原件逐字核對,找出雙方都沒點出的關鍵差異:兩邊用的是不同版本的底本。
閱讀指南 →
ChatGPT 小型企業工具集(Small Business Collection):16 個官方工具怎麼用、台灣店家該注意什麼
OpenAI 官方 ChatGPT 小型企業工具集共 16 個外掛,我們逐一核對官方目錄頁與工具詳情頁,整理成台灣店家看得懂的用法與注意事項——包含最容易被忽略的 Mercury 銀行外掛,以及方案、地區限制官方沒有講清楚的地方。
閱讀指南 →
TypeSafe Jev 實際上手:三個真實情境,看「只做判斷的 AI」能替你省掉哪些 if
拿到帳號後,我們用日報管線的真實資料把 TypeSafe Jev 跑了一輪:新聞分類、社群選題、讀者來信路由,外加幾個它做不到的邊界測試。附每一題的實際機率、422 拒絕原文,以及三個必須自己補的坑。
閱讀指南 →🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。