←新聞 6 / 9→

硬體基建

MaxText 成功在 Google Cloud TPUs 上復現 Olmo 3 7B 預訓練

Reproducing Olmo 3 7B Pre-training in MaxText: case study of large scale training on TPUs

MaxText 成功在 Google Cloud TPUs 上復現 Olmo 3 7B 預訓練

Google Developers · 2026-10-05

摘要

MaxText 團隊利用 JAX/XLA 在 Google Cloud TPUs 上從頭成功復現了 Ai2 的 Olmo 3 7B 語言模型,其預訓練與中訓練階段的表現精確匹配了原始的 PyTorch-on-GPU 參考實現。該實作不僅達到了高達 57.4% 的模型浮點運算利用率(MFU),更展現了強大的基礎設施可移植性,能在不修改訓練配方下應對集群調整與跨代 TPU 遷移。此次實驗也證實了全面保留驗證集的重要性,成功揪出一個會導致訓練損失虛低、掩蓋真實效能的資料載入器記憶錯誤。

MaxText 團隊利用 JAX 與 XLA 技術,在 Google Cloud TPUs 環境中從頭成功復現了由 Ai2 開發的 Olmo 3 7B 語言模型。這項實作嚴格對齊了原始的 PyTorch-on-GPU 參考實現,在預訓練與中訓練這兩個關鍵階段,所有保留驗證集(held-out evaluations)上的表現數據均精確匹配原始結果,證明了訓練精度上的高度一致性。

在效能方面,該實作達成了高達 57.4% 的模型浮點運算利用率(MFU)。系統在訓練過程中經歷了中途的集群調整(mid-run cluster resizes)以及跨代 TPU 遷移,在此類基礎設施變動下,系統依然穩定運作,且完全無需對訓練配方(recipe)進行任何修改或調整,展現了極高的架構韌性與硬體資源的有效運用。

此次實驗在工程實踐上驗證了全面保留驗證集的必要性。透過嚴格的驗證流程,團隊成功揪出一個靜默的資料載入器記憶錯誤(data-loader memorization bug)。這個錯誤會導致訓練損失數值虛低,若未被發現將掩蓋模型真實效能並造成性能提升的假象。這起錯誤的發現,凸顯了在大型語言模型訓練中,對訓練過程數據完整性進行嚴格監控的關鍵價值。

●開發者:可參考 MaxText 在 TPU 上高效復現模型與處理集群變動的實務經驗

●投資人:Google Cloud TPU 的基礎設施穩定性與效率獲得實證

●一般用戶:無直接影響

重要性評分

65/100

🟠 值得關注

MaxTextGoogle Cloud TPUOlmo 3JAX模型復現
原文出處
上一則← Gemini 使用權再度縮水!免費版只能用 Flash-Lite,AI Plus 不再享有 Pro 模型下一則別被騙了——LLM 並不具備推理能力 →

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。