←新聞 9 / 12→

研究突破

研究團隊提出一種名為 Latent Factorizatio...

Sub-1-Bit LLM Compression via Latent Factorization

研究團隊提出一種名為 Latent Factorizatio...

github.com · 2026-10-08

摘要

研究團隊提出一種名為 Latent Factorization 的新技術,成功將大型語言模型(LLM)的壓縮率推至低於 1-bit 的極限。這項突破意味著模型權重可以被極度精簡,大幅降低儲存與運算需求,為在資源受限的裝置上運行高效能 AI 模型帶來新的可能性。

來自 Banseok Lee、Dongkyu Kim、Youngcheon You 與 Youngmin Kim 等研究者的 LittleBit 專案,目標是把大型語言模型壓縮到「低於 1 bit」的範圍。根據其公開的專案說明頁,此方法已發表於 NeurIPS 2025,後續改良版 LittleBit-2 則列為 ICML 2026 論文。

壓縮方法的基本流程

依專案說明,LittleBit 處理每個稠密權重矩陣的方式分為三步:先將矩陣分解為低秩的潛在因子,接著把這些因子轉為二值表示,最後以輕量、可學習的縮放係數補回數值的大小資訊。由於推論時仍保留原本的模型架構,部署端不需改動結構。

專案提到,此設定可達到每權重 0.1 bit 的極端壓縮比例,適用範圍則標示為每權重 1.0 至 0.1 bit。

LittleBit-2 針對初始化的改良

LittleBit-2 的重點在初始化階段。作者指出,原本經奇異值分解(SVD)得到的潛在因子,其幾何分布與二值超立方體並不吻合,因此提出「內部潛在旋轉」結合「聯合迭代量化」(Joint-ITQ)的做法,讓潛在因子在量化感知訓練(QAT)之前先對齊到二值超立方體。

此改良為選擇性功能,使用者可透過 `--use_itq` 參數啟用;專案強調它不會增加推論時的額外負擔,部署的分解層結構也維持不變。

訓練與支援模型

專案支援以量化感知訓練方式進行壓縮,並可搭配 SmoothSign 量化函式與選用的殘差分解。說明頁中的範例以 Llama-2-7b 為對象,使用 c4_wiki 資料集訓練 5 個epoch,並把有效位元數設為 1.0。

目前列出的支援模型包括 OPT、Llama 與 Llama 2/3、Phi-4、Qwen2.5 與 QwQ、Gemma 2 與 Gemma 3,以及 Qwen3。

評估方式與資訊缺口

專案提供評估指令,可用來測量 wikitext2 與 c4 的困惑度,也可測試 BoolQ、PIQA、HellaSwag 等多項零樣本任務。不過,這份專案說明頁本身沒有列出任何實際的評估結果數字,因此無法從中判斷壓縮後的模型品質、記憶體節省幅度或推論速度。說明頁同時提醒,重現論文結果需使用 transformers 4.51.x 版本。

授權條款

專案採用 CC BY-NC 4.0 授權。

●開發者:可關注超低壓縮演算法以優化模型部署

●投資人:AI 邊緣運算與硬體效率領域值得留意

●一般用戶:未來手機或 IoT 裝置可能內建更輕量且強大的 AI 功能

重要性評分

79/100

🟠 值得關注

LLM 壓縮Latent Factorization模型優化邊緣運算AI 硬體效率
原文出處
上一則← 熱門 AI 排行榜 LMArena 估值在 10 個月內幾乎翻倍至 31 億美元下一則GPT-6 全球上線並推出 Intelligent UI →

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。

相關指南

🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。