新聞 12 / 12

開發工具

Google 推出 Tunix 自動化 LLM 後訓練框架,在 TPU 上實現端到端微調

Autonomous LLM post-training with Tunix on TPUs

Google 推出 Tunix 自動化 LLM 後訓練框架,在 TPU 上實現端到端微調

developers.googleblog.com · 2026-09-24

摘要

Google 發布「autofinetune」專案,透過單一 Markdown 規格定義邊界條件與評估指標,自動化部署 AI 代理來迭代編輯訓練腳本、啟動實驗並驗證超參數優化。整合 Tunix、Gemma 與 Cloud TPU,框架消除手動調優循環,已在函式呼叫與數學推理模型上驗證效能提升。

Google 近期發布了一個名為 autofinetune 的專案,整合 Tunix、Gemma 與 Cloud TPU,把大型語言模型的後訓練流程自動化。這套框架用 AI 代理程式,讓開發者寫一份 Markdown 規格文件,就能自動迭代跑數十場微調實驗。

從手動調優到自動化循環

傳統後訓練流程要重複做一堆手動步驟:開發者提出假設、改訓練腳本、在加速器上跑任務、盯著損失曲線與基準評估看,還要手動記下哪次成功哪次失敗。Google 這套方案把整個流程自動化,靠三個核心要素組成:

第一是設計競技場(program.md),由人類定義循環邊界、評估準則與約束條件。第二是執行程式碼(run.py),也就是一份單一、自洽的微調腳本。第三則是讓 AI 代理照 program.md 的指示去迭代:改 run.py、跑訓練任務、量測目標指標,成功就保留提交、失敗就回復,最後把結果記到 results.tsv 檔案裡。

函式呼叫模型的有監督微調案例

第一個實驗中,Google 針對 google/functiongemma-270m-it 模型在 google/mobile-actions 資料集上做有監督微調(SFT)優化。

實驗用 Cloud TPU v5e-1 跑,每次執行只要幾分鐘,數小時內就完成了 20 項自動化實驗。評估指標是函式呼叫生成的準確度。

AI 代理在 program.md 裡可以調整的範圍包括 LoRA 秩與 alpha 值、目標投影層、學習率、預熱與衰減時程表、優化器(AdamW 或 Muon)、批次大小與隨機種子。但不能動資料集、訓練週期數或模型架構。

從實驗軌跡看,代理程式自動調整 LoRA 秩、alpha 值、優化器與學習率等參數,持續改進模型在函式呼叫生成上的準確度。

數學推理模型的強化學習案例

第二個案例用在強化學習(GRPO)模式上。Google 以 Tunix 儲存庫裡的官方 GRPO 範例為基礎,用 Gemma 3 1B 模型在 GSM8K 資料集上做數學推理訓練,該模型在數值準確度和答案格式準確度上表現更好。

這項實驗跑在 Cloud TPU v6e-1 上,每次迭代要幾小時,總共跑了 40 次實驗,花了 2 到 3 天。因為評估要簡化,Google 選了單一的人工評估指標 Post_RL_metric,也就是數值準確度加上格式準確度的組合。

從記錄下來的實驗軌跡看,AI 代理找出了更好的 LoRA 配置、rollout 溫度、KL 懲罰、系統提示等參數,最終把總獎勵提升了約 10%。

技術整合與後續應用

這套框架透過 Antigravity CLI 與 Gemini Flash 3.7 協調,整合 Google 完整的 AI 堆疊。Google 已在 autofinetune GitHub 儲存庫提供完整程式碼、範例執行結果與 program.md 範本,讓開發者可以用 Tunix 在 TPU 上打造自己的自動化後訓練系統。

開發者:可直接應用 Tunix 框架加速 SFT 與 GRPO 工作流,減少手動微調時間

投資人:Google AI 基礎設施生態整合度提升,TPU 利用場景擴大

一般用戶:後訓練自動化將加速模型迭代,間接改善下游應用品質

重要性評分

78/100

🟠 值得關注

LLM 後訓練自動化Tunix 框架TPU
原文出處
上一則Google 推出 Gemini 3.8 TTS 文字轉語音系列!支援 30 秒複製人聲、自創聲線、逐句控制演繹風格

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。