研究突破
研究團隊提出一種名為 Latent Factorizatio...
Sub-1-Bit LLM Compression via Latent Factorization

github.com · 2026-10-08
摘要
研究團隊提出一種名為 Latent Factorization 的新技術,成功將大型語言模型(LLM)的壓縮率推至低於 1-bit 的極限。這項突破意味著模型權重可以被極度精簡,大幅降低儲存與運算需求,為在資源受限的裝置上運行高效能 AI 模型帶來新的可能性。
來自 Banseok Lee、Dongkyu Kim、Youngcheon You 與 Youngmin Kim 等研究者的 LittleBit 專案,目標是把大型語言模型壓縮到「低於 1 bit」的範圍。根據其公開的專案說明頁,此方法已發表於 NeurIPS 2025,後續改良版 LittleBit-2 則列為 ICML 2026 論文。
壓縮方法的基本流程
依專案說明,LittleBit 處理每個稠密權重矩陣的方式分為三步:先將矩陣分解為低秩的潛在因子,接著把這些因子轉為二值表示,最後以輕量、可學習的縮放係數補回數值的大小資訊。由於推論時仍保留原本的模型架構,部署端不需改動結構。
專案提到,此設定可達到每權重 0.1 bit 的極端壓縮比例,適用範圍則標示為每權重 1.0 至 0.1 bit。
LittleBit-2 針對初始化的改良
LittleBit-2 的重點在初始化階段。作者指出,原本經奇異值分解(SVD)得到的潛在因子,其幾何分布與二值超立方體並不吻合,因此提出「內部潛在旋轉」結合「聯合迭代量化」(Joint-ITQ)的做法,讓潛在因子在量化感知訓練(QAT)之前先對齊到二值超立方體。
此改良為選擇性功能,使用者可透過 `--use_itq` 參數啟用;專案強調它不會增加推論時的額外負擔,部署的分解層結構也維持不變。
訓練與支援模型
專案支援以量化感知訓練方式進行壓縮,並可搭配 SmoothSign 量化函式與選用的殘差分解。說明頁中的範例以 Llama-2-7b 為對象,使用 c4_wiki 資料集訓練 5 個epoch,並把有效位元數設為 1.0。
目前列出的支援模型包括 OPT、Llama 與 Llama 2/3、Phi-4、Qwen2.5 與 QwQ、Gemma 2 與 Gemma 3,以及 Qwen3。
評估方式與資訊缺口
專案提供評估指令,可用來測量 wikitext2 與 c4 的困惑度,也可測試 BoolQ、PIQA、HellaSwag 等多項零樣本任務。不過,這份專案說明頁本身沒有列出任何實際的評估結果數字,因此無法從中判斷壓縮後的模型品質、記憶體節省幅度或推論速度。說明頁同時提醒,重現論文結果需使用 transformers 4.51.x 版本。
授權條款
專案採用 CC BY-NC 4.0 授權。
●開發者:可關注超低壓縮演算法以優化模型部署
●投資人:AI 邊緣運算與硬體效率領域值得留意
●一般用戶:未來手機或 IoT 裝置可能內建更輕量且強大的 AI 功能
重要性評分
🟠 值得關注
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。
相關指南

Perplexity vs ChatGPT:2026 搜尋與對話 AI 工具比較
深入比較 Perplexity vs ChatGPT 2026 版本,分析 perplexity 和 chatgpt 差異,解答 perplexity 好用嗎,並提供最佳 ai 搜尋工具推薦與選擇建議。
閱讀指南 →
Laya 開源決策模型中文實測:零樣本 53 題判斷題結果
Laya 是 Apache 2.0 的開源決策模型,不生成文字、只做選擇題。我們用 53 題中文長文判斷題零樣本實測,記錄結果、設定陷阱與使用建議。
閱讀指南 →
AI聲稱解開400年密碼「Cyphral Distich」:我們調閱原件逐字核對的結果
Vals AI 宣稱用 Fable 5.1 解開 Thomas Urquhart 400 年前密碼 Cyphral Distich,Reticuli 隨即提出反駁指其「未解」。我們調閱大英圖書館、1834年版與傳記三份原件逐字核對,找出雙方都沒點出的關鍵差異:兩邊用的是不同版本的底本。
閱讀指南 →🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。