新聞 12 / 12

硬體基建

HeyGen x Google Cloud:Avatar IV 模型移植至 TPU 實現 1.86 倍加速

HeyGen x Google Cloud: Bringing Avatar IV to TPUs

HeyGen x Google Cloud:Avatar IV 模型移植至 TPU 實現 1.86 倍加速

Google Developers · 2026-09-23

摘要

HeyGen 與 Google Cloud 合作,將其 18B+ 參數的 Avatar IV 影片生成模型移植至 Trillium TPU,透過 FSDP 和 Ulysses 序列平行化等優化技術,實現了實時串流 1.86 倍的效能提升。團隊使用自訂 Pallas 核心和編譯器最佳化,並通過嚴格的二層品質驗證確保輸出結果的準確性,標誌著大規模生成式 AI 模型在專用硬體上的實際運用突破。

HeyGen 與 Google Cloud 合作,將 Avatar IV 模型移植至 Trillium (v6e) TPU。Avatar IV 是一個包含 18B+ 參數的擴散堆疊,用於生成說話頭像影片,輸出 720p 或 1080p、25 幀率的影片,分塊串流以支持邊渲染邊播放。優化後的性能達到 1.86 倍加速,相比首個可運作版本。

優化工作涉及三個主要技術瓶頸。首先是隱藏全對全集合通信。Ulysses 序列平行化在自注意力層內產生兩個全對全通信用於交換序列分片和頭分片,初始狀態下這些通信完全暴露於關鍵路徑。通過將注意力頭分組並讓每組運行獨立的全對全-注意力-全對全模式,使得傳輸能隱藏在相鄰頭組的注意力計算後面,將通信足跡從計算流中減少約 5 倍。

其次是刪除稀疏注意力掩碼。超分辨率階段的稀疏注意力核心原本以 128 的倍數分塊序列,而遮罩按幀對齊,導致約五分之一的分塊邊界不齊。HeyGen 放寬分塊大小約束至 16 的倍數(硬體在序列維度上支持的最細 bf16 分塊),使每個分塊要麼完全在掩碼內,要麼完全在掩碼外。這樣掩碼謂詞、第二遍處理和填充全部消失,單次密集注意力內迴圈即可覆蓋整個掩碼。後續重構核心體,通過調整 softmax 歸約以減少暖迴圈的暫存器流量,將該階段性能從天花板的約一半提升至三分之二,最終接近 86%。

第三是消除 softmax 序列依賴。Flash 注意力的在線 softmax 在追蹤運行最大值時產生序列依賴。團隊用預計算的上界取代運行最大值,利用 Cauchy-Schwarz 不等式證明查詢的最大邏輯值受其範數與最大鍵範數乘積的約束。通過標量預取將預計算範數傳入核心,每行能在開始時推導其上界,消除重新縮放及其序列鏈。頭選擇性檢查,98-99% 的頭符合條件,其餘回退至標準在線路徑。此外,內鍵

開發者:可深入了解如何在 TPU 上最佳化大型影片生成模型,以及 Pallas 核心與編譯器層級的優化技巧

投資人:Google Cloud 生成式 AI 基礎設施競爭力進一步強化,TPU 應用場景擴大

一般用戶:Avatar 相關應用的回應速度與成本效益將逐漸改善

重要性評分

78/100

🟠 值得關注

影片生成TPU 最佳化生成式 AI
原文出處
上一則Meta 開源 Rebalancer:通用高效能資源分配最佳化引擎

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。