硬體基建
HeyGen x Google Cloud:Avatar IV 模型移植至 TPU 實現 1.86 倍加速
HeyGen x Google Cloud: Bringing Avatar IV to TPUs

Google Developers · 2026-09-23
摘要
HeyGen 與 Google Cloud 合作,將其 18B+ 參數的 Avatar IV 影片生成模型移植至 Trillium TPU,透過 FSDP 和 Ulysses 序列平行化等優化技術,實現了實時串流 1.86 倍的效能提升。團隊使用自訂 Pallas 核心和編譯器最佳化,並通過嚴格的二層品質驗證確保輸出結果的準確性,標誌著大規模生成式 AI 模型在專用硬體上的實際運用突破。
HeyGen 與 Google Cloud 合作,將 Avatar IV 模型移植至 Trillium (v6e) TPU。Avatar IV 是一個包含 18B+ 參數的擴散堆疊,用於生成說話頭像影片,輸出 720p 或 1080p、25 幀率的影片,分塊串流以支持邊渲染邊播放。優化後的性能達到 1.86 倍加速,相比首個可運作版本。
優化工作涉及三個主要技術瓶頸。首先是隱藏全對全集合通信。Ulysses 序列平行化在自注意力層內產生兩個全對全通信用於交換序列分片和頭分片,初始狀態下這些通信完全暴露於關鍵路徑。通過將注意力頭分組並讓每組運行獨立的全對全-注意力-全對全模式,使得傳輸能隱藏在相鄰頭組的注意力計算後面,將通信足跡從計算流中減少約 5 倍。
其次是刪除稀疏注意力掩碼。超分辨率階段的稀疏注意力核心原本以 128 的倍數分塊序列,而遮罩按幀對齊,導致約五分之一的分塊邊界不齊。HeyGen 放寬分塊大小約束至 16 的倍數(硬體在序列維度上支持的最細 bf16 分塊),使每個分塊要麼完全在掩碼內,要麼完全在掩碼外。這樣掩碼謂詞、第二遍處理和填充全部消失,單次密集注意力內迴圈即可覆蓋整個掩碼。後續重構核心體,通過調整 softmax 歸約以減少暖迴圈的暫存器流量,將該階段性能從天花板的約一半提升至三分之二,最終接近 86%。
第三是消除 softmax 序列依賴。Flash 注意力的在線 softmax 在追蹤運行最大值時產生序列依賴。團隊用預計算的上界取代運行最大值,利用 Cauchy-Schwarz 不等式證明查詢的最大邏輯值受其範數與最大鍵範數乘積的約束。通過標量預取將預計算範數傳入核心,每行能在開始時推導其上界,消除重新縮放及其序列鏈。頭選擇性檢查,98-99% 的頭符合條件,其餘回退至標準在線路徑。此外,內鍵
●開發者:可深入了解如何在 TPU 上最佳化大型影片生成模型,以及 Pallas 核心與編譯器層級的優化技巧
●投資人:Google Cloud 生成式 AI 基礎設施競爭力進一步強化,TPU 應用場景擴大
●一般用戶:Avatar 相關應用的回應速度與成本效益將逐漸改善
重要性評分
🟠 值得關注
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。
相關指南

Veo 與 Kling 2026 影片生成比較:生成品質、價格與使用限制解析
深入解析 2026 年 Veo 與 Kling 的影片生成能力。比較 Veo vs seedance vs kling 的品質、價格與限制,提供詳細的 Kling 使用教學與 Veo 定價分析,助您選擇最佳工具。
閱讀指南 →
Gemini 教學:4 步生成 AI 手繪旅遊地圖與實戰應用
透過 Gemini 教學 4 步生成 AI 手繪旅遊地圖,掌握從概念到實作的完整流程。本文涵蓋 Gemini Developer API 定價分析、Google AI Studio 與 Gemini Canvas 對比,以及生成式 AI 在旅遊規劃中的實戰應用技巧。
閱讀指南 →
2026 生成式 AI 安全實戰:企業防範與倫理指南
深入解析 2026 AI 安全策略,提供企業防範生成式 AI 風險的實戰步驟,涵蓋安全合規檢查與 AI 倫理規範落地指南,助您構建可信 AI 生態。
閱讀指南 →🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。