←新聞 9 / 10→

開發工具

AutoSynthData:為企業級 Agent 生成訓練數據

AutoSynthData: Generating Training Data for Enterprise Agents

AutoSynthData:為企業級 Agent 生成訓練數據

huggingface.co · 2026-10-02

摘要

Hugging Face Blog 介紹了 AutoSynthData 技術,旨在解決企業級 AI Agent 訓練數據匱乏的問題。該方法透過自動化生成高品質的訓練資料,協助開發者更有效地構建與優化專屬的企業應用模型。

解決企業 AI Agent 訓練數據匱乏

ServiceNow CoreAI 團隊開發了 AutoSynthData 技術,要解決企業級 AI Agent 在特定環境中訓練數據不足的問題。企業環境中的系統規則、數據狀態和工作流各不相同,通用模型放到實際場景裡,常出現工具誤用或違反約束等弱點。

定義高品質的 Agent 任務

AutoSynthData 認為,一個有效的 Agent 任務由系統規範、使用者提示與驗證器三部分組成。系統規範必須明確界定約束條件,且要與環境中的工具及狀態相容。使用者提示則需具備可行性、真實性與難度三項特性。可行性確保任務在當前環境中可以執行;真實性要求提示符合用戶實際會提出的請求;難度則是要暴露當前 Agent 的弱點,避免生成已能可靠解決的簡單任務。

驗證器同樣要滿足一致性、健全性與完整性。一致性指驗證結果必須與提示及規範相符;健全性要求拒絕不符合任務或違反約束的軌跡;完整性則確保接受所有有效解,而不是只認單一參考軌跡。過於寬鬆的驗證器可能獎勵錯誤行為,過於嚴格的驗證器則可能懲罰有效的解決方案,這些特性在訓練中直接相關。

從模型失敗到課程生成

這項技術先評估目標模型在環境中的表現,找出它難以完成的任務模式。團隊比較目標模型與更強的教師模型的執行結果,提取出能力測試維度、涉及的工具與工作流結構、失敗原因及成功特徵。這些發現被濃縮成「能力規範卡」,用來指導新任務的生成。生成器只接收規範卡,不接觸原始評估任務的細節,因此能產出提示、狀態及解決路徑都不同的新任務。

兩階段數據生成與擴展

AutoSynthData 的數據構建分為「目標」與「倍增」兩個階段。在目標階段,系統依據能力規範平行生成核心訓練樣本,每個候選任務都要經過驗證、執行、求解器評估及修復流程。在倍增階段,系統以已接受的目標樣本為基礎,擴展出 novel 變體。每個變體都有獨立的用戶請求、環境狀態及參考軌跡,但不能作為其他倍增樣本的種子,藉此限制生成漂移。

嚴格的品質控制與修復機制

生成 plausible 的請求,並不足以確保數據品質,因此 AutoSynthData 採用樣本級與批次級的雙重審查。樣本級驗證包含正向與負向檢查:正向驗證會執行參考軌跡,確認解決方案有效;負向驗證則變異預期結果,確保驗證器不會錯誤地獎勵失敗狀態。失敗的樣本會進入批評與修復循環,由批評者分析狀態不一致、工作流不可能或驗證器邏輯薄弱等問題,再針對性修復,而不是直接丟棄。

批次級審查看的是數據覆蓋率與多樣性。元審查(meta-review)會檢視已接受與拒絕的樣本以及生成行為,找出過度代表的任務家族或缺失的能力維度;控制器則追蹤已接受數據集的覆蓋率,減少過度代表區域的生成,並把更多工作導向缺口。這些調整會在可用的生成預算與數據集規模要求內,平衡有用的學習信號、任務品質、覆蓋率、多樣性與低冗餘。

EnterpriseOps Gym 實驗結果

團隊在 EnterpriseOps Gym 的 Hybrid 與 ITSM 環境中驗證了這套方法。在 Hybrid 領域,目標模型是 Gemma-4-26B-A4B-it,教師模型是 Qwen3.8-27B,AutoSynthData 約 18 小時內生成了 2,000 個合成訓練樣本。經過監督式微調(SFT)後,最佳檢查點的 Pass@1 提升 7.2 個百分點,相對改善 35%,驗證器成功率從 63.01% 升至 68.55%,並縮小了與參考模型之間 59% 的原始差距。

在 ITSM 領域,目標模型相同,教師模型換成 DeepSeek-V4.1-Flash,系統在 66 小時內生成了 1,994 個樣本。生成時間較長,主要歸因於使用了更大的教師模型,以及管道吞吐量尚未優化。實驗顯示,合成 SFT 將 Pass@1 從 18.77% 提升到 27.18%,證明這套方法在第二個領域同樣有效。

動態調整訓練邊界

AutoSynthData 把合成數據生成視為在目標模型能力邊界附近的搜索過程。模型經過微調後會進步,原本困難的任務變得容易,下一輪生成就會聚焦在模型仍無法可靠解決的持久失敗點。這套機制不只適用於 SFT,未來也計劃測試在強化學習(RL)中的應用,透過動態調整難度來校準邊界,持續為模型提供可靠的學習信號。

●開發者:可參考此技術解決企業 Agent 訓練數據不足的問題

●投資人:關注企業級 AI 工具鏈與數據生成領域的進展

重要性評分

65/100

🟠 值得關注

AutoSynthData企業 Agent訓練數據Hugging FaceAI 生成
原文出處
上一則← 在 Muse AI 讀取 iPhone 和 Mac 私訊後,Apple 緊縮對完整磁碟存取權的監管下一則Hugging Face Blog 發表文章探討 MCP A... →

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。