新聞 5 / 12

硬體基建

Google Cloud 原生整合 TPU 支援至 vLLM,優化長上下文多模態嵌入推論

Enterprise-Grade Precision for Long-Context Multimodal Embedding Inference on Cloud TPU

Google Cloud 原生整合 TPU 支援至 vLLM,優化長上下文多模態嵌入推論

Google Developers · 2026-09-23

摘要

Google Cloud 將 TPU 支援原生整合進 vLLM 推理引擎,並透過 GKE 實現彈性擴展。針對 Qwen3-Embedding-8B 等模型的 15K+ token 長上下文,團隊實作了硬體張量對齊與 JAX/XLA 編譯預熱等優化,達成與 GPU 基準相近的數值精度,並已開源設定範例供開發者使用。

Google Cloud 將 vLLM 推理引擎原生整合至 Cloud TPU,並透過 Google Kubernetes Engine (GKE) 的 Custom Compute Classes 實現自動化節點自動擴展,當主要 TPU 保留容量耗盡時,基礎設施可自動回退至次要 GPU 空閒或按需資源池,確保推論流量不中斷。

針對 Qwen3-Embedding-8B 等模型處理 4K+ 至 15K+ token 的長上下文多模態輸入,團隊實作了三項關鍵優化:首先採用硬體安全的詞彙填充策略以確保張量並行下的精確對齊;其次透過屬性提升與分片感知預熱機制,消除冷啟動延遲並鎖定 JAX/XLA 編譯快取;最後設計混合 StepPool 架構,將中繼資料遷移至 CachedRequestState,防止高頻寬記憶體 (HBM) 耗盡導致的狀態丟失。

在精度驗證方面,TPU 生成的密集嵌入向量與參考基準相比,文字輸入的餘弦相似度目標值 ≥0.999,多模態輸入 ≥0.995,確認維持黃金參考精度。在 Ironwood TPU 上以 bf16 精度、16K+ 序列長度及張量並行數 4 執行 Qwen3-Embedding-8B 時,吞吐量達到每秒 83,996 個 token 及每秒 5.13 個請求。相關設定範例與部署腳本已於 AI-Hypercomputer 公共儲存庫開源。

開發者:可立即利用開源設定在 GKE 上部署高效能嵌入服務

投資人:Google Cloud 在 AI 基礎設施與雲端整合上的競爭力持續強化

一般用戶:此技術主要影響後端服務效能,間接提升相關 AI 應用的回應速度與穩定性

重要性評分

68/100

🟠 值得關注

Google CloudTPUvLLM嵌入推論長上下文
原文出處
上一則Transformers 現在支援 llama.cpp 量化模型下一則MCP 協議更新:轉向無狀態架構以支援 AI Agent 基礎設施擴展

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。