開發工具
Google Developers 推出 autofinet...
Autonomous LLM post-training with Tunix on TPUs

developers.googleblog.com · 2026-10-06
摘要
Google Developers 推出 autofinetune 專案,利用 Tunix 與 Cloud TPUs 實現 LLM 後訓練(SFT 與 GRPO)的完全自動化。開發者只需透過 Markdown 定義邊界與評估指標,AI 代理即可自動迭代調整超參數並提交優化結果,成功在函數呼叫與數學推理任務中實現免手動調校的效能提升。
自動化後訓練新範例:autofinetune 專案登場
團隊於 2026 年 9 月 11 日發布 autofinetune 專案,目標是用 AI 代理(AI Agent)把大型語言模型(LLM)的後訓練流程全部自動化。專案結合 Tunix 框架、Gemma 模型系列與 Cloud TPUs 硬體資源,由 Antigravity CLI 與 Gemini Flash 3.7 負責調度。它的核心目標,是把原本靠人手動調校超參數的做法,改成由 AI 代理自動反覆優化的自主研究循環,並涵蓋監督式微調(SFT)與基於 GRPO 的強化學習(RL)兩種訓練模式。
從手動調校到自主循環的範式轉移
傳統微調通常要重複做一連串耗時的手動步驟:提出假設、編輯訓練腳本與超參數、在加速器上啟動作業、監控損失曲線與基準評估,再手動記錄成敗。autofinetune 引入 AI 代理來自動化這些步驟,並把流程簡化為三個階段。第一,開發者設計「競技場」(Arena),也就是在 `program.md` 文件中定義循環邏輯、邊界條件、評估標準與約束。第二,提供單一且自包含的微調腳本 `run.py`。第三,讓 AI 代理依照 `program.md` 的指示反覆迭代:修改腳本、執行訓練、測量目標指標,保留表現較好的提交記錄,或復原造成退步的變更,並把結果記錄在 `results.tsv`。
案例一:FunctionGemma 的監督式微調
第一個案例研究是在 google/mobile-actions 資料集上,對 google/functiongemma-270m-it 模型做監督式微調,目的是提高函數呼叫生成的準確率。實驗使用 Cloud TPU v5e-1 硬體,每次運行只需幾分鐘,總共在數小時內完成 20 次自動化實驗。
`program.md` 設定的邊界條件允許 AI 代理調整 LoRA rank/alpha、目標投影層、學習率、暖身/衰減調度、優化器(如 AdamW/Muon)、梯度裁剪、批次大小與種子,但禁止更改資料集、訓練輪數或模型架構。實驗結果顯示,代理能自動調整 LoRA rank/alpha、優化器與學習率等參數,讓模型生成正確函數呼叫的準確率持續提升,不需要手動調校。
案例二:Gemma 3 的強化學習微調
第二個案例研究難度更高,是在 GSM8K 資料集上,對 Gemma 3 1B 模型做數學推理的強化學習微調。實驗使用 Cloud TPU v6e-1 硬體,每次運行需要數小時,總共在 2 至 3 天內執行 40 次實驗。強化學習對超參數敏感,執行時間也較長,因此這項任務比監督式微調更複雜。
為了簡化外部優化循環,團隊選了一個人工評估指標 Post_RL_metric,也就是數值準確率與格式準確率的總和。AI 代理在過程中找出更好的 LoRA 配置、rollout 溫度、KL 懲罰項與系統提示等參數,最終把總獎勵提升約 10%。
開放原始碼與未來展望
autofinetune 專案的程式碼、範例運行記錄與 `program.md` 模板已開放於 GitHub 儲存庫。團隊希望透過這個專案展示 AI 代理在 LLM 後訓練領域的潛力,也鼓勵開發者利用 Tunix 與 TPUs 建立自己的自主後訓練實驗室,自動化微調工作流程。這個專案延續先前 autoresearch 專案在自主探索預訓練上的成功範例,進一步把自主研究循環應用到後訓練階段。
●開發者:可採用 Tunix 框架自動化 LLM 微調流程,減少手動調參成本
●投資人:Google 持續強化其 AI 開發者生態系與雲端算力優勢
●一般用戶:此技術主要影響模型開發效率,間接提升 AI 服務品質
重要性評分
🟠 值得關注
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。
相關指南

LLM 模型安全與倫理實戰:2026 年企業合規與風險管理指南
2026 年企業如何確保 LLM 模型安全?本指南涵蓋 AI 倫理規範、企業 AI 合規策略及模型紅隊測試實戰步驟,協助建立安全的 AI 部署環境。
閱讀指南 →
LLM 是什麼?5 分鐘白話文解釋大型語言模型運作原理
LLM(大型語言模型)是什麼?本文用白話文解釋:LLM 是怎麼「學會」語言的、預測下一個字是怎麼回事、ChatGPT 和 Claude 都是 LLM,5 分鐘看懂核心原理。
閱讀指南 →
TypeSafe Jev 實際上手:三種情境,看「只做判斷的 AI」能替你省掉哪些 if
用新聞分類、社群選題、讀者來信路由三種情境,示範 TypeSafe Jev 這種「只做判斷的 AI」能替你省掉哪些 if,外加幾個它做不到的邊界測試、422 拒絕原文,以及三個必須自己補的坑。
閱讀指南 →🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。