新聞 11 / 12

硬體基建

SLAI T-Rex:昇騰 SuperPOD 上 DeepSeek-V4 全參數後訓練優化

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

SLAI T-Rex:昇騰 SuperPOD 上 DeepSeek-V4 全參數後訓練優化

arXiv cs.CL · 2026-07-23

摘要

研究團隊在華為昇騰 NPU 超級計算集群上成功完成了 DeepSeek-V4 兆參數級 MoE 模型的全參數後訓練,開發了涵蓋模型並行、計算通信協調和低層核心執行的分層優化框架。相比開源基線方案,該系統將模型浮點運算利用率(MFU)提升至 34.22%,性能提升了 2.93 倍,並在此基礎上建立了複雜運籌最佳化任務的 CPT 和 SFT 工作流。

開發者:可參考該優化框架提升大規模 MoE 模型訓練效率

投資人:國產 NPU 芯片在大模型訓練中的競爭力持續增強

一般用戶:推動國內高效能 AI 基礎設施發展,有助於降低大模型部署成本

重要性評分

76/100

🟠 值得關注

大模型訓練MoE 架構NPU 優化
原文出處
上一則OpenAI 推進美國科學研究新時代下一則護欄成替罪羊:審計工具增強型 LLM 代理中的不誠實安全拒絕

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。