開發工具
Google 推出 Tunix 自動化 LLM 後訓練框架,在 TPU 上實現端到端微調
Autonomous LLM post-training with Tunix on TPUs

developers.googleblog.com · 2026-09-24
摘要
Google 發布「autofinetune」專案,透過單一 Markdown 規格定義邊界條件與評估指標,自動化部署 AI 代理來迭代編輯訓練腳本、啟動實驗並驗證超參數優化。整合 Tunix、Gemma 與 Cloud TPU,框架消除手動調優循環,已在函式呼叫與數學推理模型上驗證效能提升。
Google 近期發布了一個名為 autofinetune 的專案,整合 Tunix、Gemma 與 Cloud TPU,把大型語言模型的後訓練流程自動化。這套框架用 AI 代理程式,讓開發者寫一份 Markdown 規格文件,就能自動迭代跑數十場微調實驗。
從手動調優到自動化循環
傳統後訓練流程要重複做一堆手動步驟:開發者提出假設、改訓練腳本、在加速器上跑任務、盯著損失曲線與基準評估看,還要手動記下哪次成功哪次失敗。Google 這套方案把整個流程自動化,靠三個核心要素組成:
第一是設計競技場(program.md),由人類定義循環邊界、評估準則與約束條件。第二是執行程式碼(run.py),也就是一份單一、自洽的微調腳本。第三則是讓 AI 代理照 program.md 的指示去迭代:改 run.py、跑訓練任務、量測目標指標,成功就保留提交、失敗就回復,最後把結果記到 results.tsv 檔案裡。
函式呼叫模型的有監督微調案例
第一個實驗中,Google 針對 google/functiongemma-270m-it 模型在 google/mobile-actions 資料集上做有監督微調(SFT)優化。
實驗用 Cloud TPU v5e-1 跑,每次執行只要幾分鐘,數小時內就完成了 20 項自動化實驗。評估指標是函式呼叫生成的準確度。
AI 代理在 program.md 裡可以調整的範圍包括 LoRA 秩與 alpha 值、目標投影層、學習率、預熱與衰減時程表、優化器(AdamW 或 Muon)、批次大小與隨機種子。但不能動資料集、訓練週期數或模型架構。
從實驗軌跡看,代理程式自動調整 LoRA 秩、alpha 值、優化器與學習率等參數,持續改進模型在函式呼叫生成上的準確度。
數學推理模型的強化學習案例
第二個案例用在強化學習(GRPO)模式上。Google 以 Tunix 儲存庫裡的官方 GRPO 範例為基礎,用 Gemma 3 1B 模型在 GSM8K 資料集上做數學推理訓練,該模型在數值準確度和答案格式準確度上表現更好。
這項實驗跑在 Cloud TPU v6e-1 上,每次迭代要幾小時,總共跑了 40 次實驗,花了 2 到 3 天。因為評估要簡化,Google 選了單一的人工評估指標 Post_RL_metric,也就是數值準確度加上格式準確度的組合。
從記錄下來的實驗軌跡看,AI 代理找出了更好的 LoRA 配置、rollout 溫度、KL 懲罰、系統提示等參數,最終把總獎勵提升了約 10%。
技術整合與後續應用
這套框架透過 Antigravity CLI 與 Gemini Flash 3.7 協調,整合 Google 完整的 AI 堆疊。Google 已在 autofinetune GitHub 儲存庫提供完整程式碼、範例執行結果與 program.md 範本,讓開發者可以用 Tunix 在 TPU 上打造自己的自動化後訓練系統。
●開發者:可直接應用 Tunix 框架加速 SFT 與 GRPO 工作流,減少手動微調時間
●投資人:Google AI 基礎設施生態整合度提升,TPU 利用場景擴大
●一般用戶:後訓練自動化將加速模型迭代,間接改善下游應用品質
重要性評分
🟠 值得關注
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。
相關指南

AI聲稱解開400年密碼「Cyphral Distich」:我們調閱原件逐字核對的結果
Vals AI 宣稱用 Fable 5.1 解開 Thomas Urquhart 400 年前密碼 Cyphral Distich,Reticuli 隨即提出反駁指其「未解」。我們調閱大英圖書館、1834年版與傳記三份原件逐字核對,找出雙方都沒點出的關鍵差異:兩邊用的是不同版本的底本。
閱讀指南 →
ChatGPT 小型企業工具集(Small Business Collection):16 個官方工具怎麼用、台灣店家該注意什麼
OpenAI 官方 ChatGPT 小型企業工具集共 16 個外掛,我們逐一核對官方目錄頁與工具詳情頁,整理成台灣店家看得懂的用法與注意事項——包含最容易被忽略的 Mercury 銀行外掛,以及方案、地區限制官方沒有講清楚的地方。
閱讀指南 →
TypeSafe Jev 實際上手:三個真實情境,看「只做判斷的 AI」能替你省掉哪些 if
拿到帳號後,我們用日報管線的真實資料把 TypeSafe Jev 跑了一輪:新聞分類、社群選題、讀者來信路由,外加幾個它做不到的邊界測試。附每一題的實際機率、422 拒絕原文,以及三個必須自己補的坑。
閱讀指南 →🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。