研究突破
智能體自主設計神經網絡架構:AIRA-Compose 和 AIRA-Design 框架
Agentic Discovery of Neural Architectures: AIRA-Compose and AIRA-Design

arXiv cs.AI · 2026-05-18
摘要
研究團隊開發了 AIRA 雙框架系統,讓 LLM 智能體能夠自主設計超越標準 Transformer 的基礎模型。AIRA-Compose 用 11 個智能體進行高級架構搜索,AIRA-Design 負責低層機制實現,在 24 小時預算內探索百萬參數候選模型,並將最優設計擴展到 350M、1B、3B 規模。新發現的 AIRAformer 和 AIRAhybrid 架構在 1B 規模預訓練後,相比 Llama 3.2 下游任務準確率分別提升 2.4% 和 3.8%,同時展現出更高效的擴展速度。
研究團隊提出 AIRA 雙框架系統,旨在讓 LLM 智能體自主設計超越標準 Transformer 的基礎模型。該系統包含 AIRA-Compose 與 AIRA-Design 兩個部分,前者負責高層架構搜索,後者負責低層機制實現。AIRA-Compose 調用 11 個智能體,在 24 小時預算內探索百萬參數候選模型,並將最優設計外推至 350M、1B 及 3B 規模,最終產出 14 種架構,分為 AIRAformers(基於 Transformer)與 AIRAhybrids(Transformer-Mamba)兩大類。
在 1B 規模預訓練後,新架構在下游任務中表現優異。AIRAformer-D 與 AIRAhybrid-D 相對於 Llama 3.2 的準確率分別提升了 2.4% 和 3.8%,同時優於 Composer 發現的基線模型。擴展效率方面,AIRAformer-C 的擴展速度比 Llama 3.2 快 54%、比 Composer 的最佳 Transformer 快 71%;AIRAhybrid-C 則比 Nemotron-2 快 23%、比 Composer 的最佳混合模型快 37%。
AIRA-Design 則指派 20 個智能體撰寫針對長距離依賴的新型注意力機制及高效訓練腳本。在 Long Range Arena 基準測試中,智能體設計的架構在文檔匹配與文本分類任務上,分別達到人類最優水平的 2.3% 與 2.6% 差距。此外,在 Autoresearch 基準測試中,Greedy Opus 4.5 在固定時間預算下達到 0.968 驗證比特/字節,超過了已發表的最小值。這些結果顯示 AI 智能體能自主發現匹配或超越手動設計基線的架構與演算法優化。
●開發者:可探索用智能體自動化架構搜索的新範式,加速模型開發流程
●投資人:自動模型設計技術可降低開發成本,提高研發效率
●一般用戶:未來模型可能更高效、更經濟地部署
重要性評分
🟠 值得關注
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。
相關指南

Perplexity vs ChatGPT:2026 搜尋與對話 AI 工具比較
深入比較 Perplexity vs ChatGPT 2026 版本,分析 perplexity 和 chatgpt 差異,解答 perplexity 好用嗎,並提供最佳 ai 搜尋工具推薦與選擇建議。
閱讀指南 →
Laya 開源決策模型中文實測:零樣本 53 題判斷題結果
Laya 是 Apache 2.0 的開源決策模型,不生成文字、只做選擇題。我們用 53 題中文長文判斷題零樣本實測,記錄結果、設定陷阱與使用建議。
閱讀指南 →
AI聲稱解開400年密碼「Cyphral Distich」:我們調閱原件逐字核對的結果
Vals AI 宣稱用 Fable 5.1 解開 Thomas Urquhart 400 年前密碼 Cyphral Distich,Reticuli 隨即提出反駁指其「未解」。我們調閱大英圖書館、1834年版與傳記三份原件逐字核對,找出雙方都沒點出的關鍵差異:兩邊用的是不同版本的底本。
閱讀指南 →🤖 本文摘要由 AI 自動生成,內容源自原始報導。如有疑慮,請參閱關於我們。
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。