←新聞 5 / 8→

開發工具

GLM5.3-Flash-E224-DGX-Spark:針對 NVIDIA DGX Spark 優化的非官方模型部署指南

autotrust/GLM5.3-Flash-E224-DGX-Spark

GLM5.3-Flash-E224-DGX-Spark:針對 NVIDIA DGX Spark 優化的非官方模型部署指南

Hugging Face · 2026-10-06

摘要

autotrust 發布了基於 zai-org/GLM-5.3-Flash 的壓縮版本,專為 NVIDIA DGX Spark 桌面系統設計。該模型透過神經架構搜尋(NAS)保留 224 個專家,並採用 NVFP4 技術,在僅激活 180 億參數的情況下,將權重大小控制在 141 GiB,適合雙卡 DGX Spark 部署。官方同步提供了完整的部署 Runbook,涵蓋網路設定、記憶體配置及效能基準測試數據。

autotrust 發布基於 zai-org/GLM-5.3-Flash 的非官方壓縮版本 GLM5.3-Flash-E224-DGX-Spark,專為 NVIDIA DGX Spark 等桌面 Blackwell 系統設計。該模型透過神經架構搜尋(NAS)將每層路由專家從 288 個精簡至 224 個,並採用 NVFP4 格式儲存專家權重,在維持每 token 180 億活躍參數的前提下,將權重大小壓縮至 141 GiB。此配置適合雙卡 DGX Spark 部署,兩節點總計 256 GiB 統一記憶體中,每節點約佔用 70 GiB 權重,剩餘約 40 GiB 可用於 KV 快取,支援 128K+ 推理追蹤。

部署指南提供 vLLM 0.31.0 設定,使用 Tensor Parallelism (TP=2) 透過 ConnectX-7 連接兩節點,並啟用 FP8 KV 快取。在單顆 B200 GPU 上的基準測試顯示,單流吞吐量為 15.7 tok/s,8 路並發下達 71.8 tok/s,兩顆 GPU 利用率約 96%。效能方面,在 GPQA-Diamond 與 AIME 2025 等基準測試中,其表現與未剪枝的 NVFP4 參考模型相當,誤差在噪音範圍內。

模型保留完整 154,880 詞彙表及視覺塔,支援 BFCL v4 工具使用測試,整體準確率達 88.3%。

●開發者:可參考針對 DGX Spark 的 vLLM 部署與效能優化實戰經驗

●投資人:關注邊緣 AI 硬體與高效能模型壓縮技術的商業化潛力

●一般用戶:此為底層技術更新,短期無直接影響

重要性評分

71/100

🟠 值得關注

GLM-5.3NVIDIA DGX Spark模型壓縮vLLM部署指南
原文出處
上一則← Google AI Agents Challenge 四大工程模式解析下一則Google 將 OpenAPI 程式碼生成工具開源,支援多語言 SDK 與 CI/CD 整合 →

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。