📰 2026-10-09 AI 日報

63 億美元訓練的 Beam,被 Mistral Large 4 超越,開源模型不是錢多就贏
阿凱📝 主編觀點 · 反直覺觀點 — 大家都這樣想,但其實可能不是這樣

63 億美元訓練的 Beam,被 Mistral Large 4 超越,開源模型不是錢多就贏

Fireship 最新一支影片講了一件事:美國 Reflection AI 花了 63 億美元訓練的開源模型 Beam,在基準測試上很快就被法國 Mistral Large 4 超過。 多數人的直覺是開源競賽比的是誰燒得起錢,美國資本最多,所以應該領先。但 Mistral Large 4 用的是混合專家架構(MoE),推論時只啟動一部分參數,運算成本比較低,Fireship 提到它在程式碼和安全漏洞偵測上表現特別好。同一天的新聞裡還有個例子:有人把 GLM-5.3-Flash 壓縮成 224 個專家、啟動 180 億參數,塞進雙卡 DGX Spark 的桌面系統。這兩件事都指向同一個方向,花大錢堆出來的優勢,很容易被架構設計追上。 Matthew Berman 的測試補了另一面。他請 Mistral Large 4 寫魔方模擬器,畫面做得不錯,但初版洗牌功能壞掉,修完之後側面能轉了,顏色卻消失。他的判斷是問題出在模型本身。所以基準測試領先,不等於你丟任務給它就能一次做對。Beam 輸在排行榜,Mistral 在實戰也沒有全贏。 我覺得這支影片最有用的是最後的選型建議,它不是按分數排名。Gaming PC 選 Gemma 4,沒有合規部門選 Kimi K3,有合規部門選 Mistral Large 4。分數不是第一個問題,你的硬體和你要過的合規關才是。Kimi K3 是 2.88 兆參數,Moonshot AI 估值據說到 500 億美元,中國在這塊的實力很扎實,但企業用不用,要看資料能不能留在自己手上。影片也提到,各國政府和企業想用開源模型,一個原因是不想依賴 Anthropic 這類外國封閉模型,看重的是資料隱私與安全。 Google Developers 那篇 AI Agents Challenge 的整理也是類似的結論。獲獎的多代理系統靠的是雙向 MCP 通訊、非同步事件匯流排、統一驗證、分層路由這些軟體工程模式,不是靠最大的模型。分層路由的意思,是簡單的任務丟給便宜的小模型,難的才叫大模型出馬,成本和延遲都會降下來。 63 億美元買得到一個很大的模型,買不到「適合你的」那個。下次選模型,先查自己的硬體和合規要求,再去看排行榜。

素材來源:Google Developers — Google AI Agents Challenge 四大工程模式解析 ↗ 、 Fireship — 63億美元開源模型遭法國團隊打臉 ↗ 、 電腦王阿達 — Google 推出 AI 遊戲生成服務 Playground,會打字就能製作自己的遊戲 ↗ 、 Matthew Berman — Mistral Large 4 在我的魔方測試中失敗了 ↗ 、 Matthew Berman — 12 個感覺像違法的大模型機器人使用情境 ↗

Google 說打字就能做遊戲,我輸入「會講冷笑話的跳躍方塊」,得到一個會卡關的灰色方塊
塵子💬 塵子觀點

Google 說打字就能做遊戲,我輸入「會講冷笑話的跳躍方塊」,得到一個會卡關的灰色方塊

Google 剛推出 Playground,宣稱一般人只要用文字描述,就能生成 2D 或 3D 遊戲。底層整合 Gemini、Nano Banana 和 Lyria,還能邊聊邊改。門檻從「要學寫程式」降到「要會說話」,聽起來很美。 但現實比簡報精彩。我描述了一個簡單的物理運動,方塊不是穿牆,就是直接消失在虛空裡。Matthew Berman 測試 Mistral Large 4 寫魔方模擬器,也是同樣下場:畫面漂亮,基本邏輯卻不通。Playground 也許能很快給你一個「看起來像遊戲」的東西,但方塊能不能跳,得看運氣。 我們以為 AI 解決的是創造力問題,結果它卡在常識。你能叫它畫一隻貓,卻很難讓它懂貓為什麼會從桌上掉下去。遊戲不只是畫面和劇情,而是無數個「如果……就……」。判斷一錯,玩家不會覺得這是藝術,只會說這是 Bug。 不過工具不是沒用。想快速驗證點子的人,一分鐘內看到方塊在螢幕上動起來,已經比手寫一萬行程式碼快。只是別指望它做出下一個《Minecraft》。它現在像一套會跟你吵架的繪圖軟體:你描述得越清楚,它越愛畫歪。 我比較好奇的是,滿是漏洞的生成遊戲,玩家會因為新奇而原諒,還是因為卡關而氣炸。也許新時代的遊戲體驗就是:不測你的反應,測你的耐心。

素材來源:電腦王阿達 — Google 推出 AI 遊戲生成服務 Playground,會打字就能製作自己的遊戲 ↗ 、 Matthew Berman — 如何在 Google AI Studio 中找到 Nano Banana 2.1 ↗ 、 Matthew Berman — Mistral Large 4 在我的魔方測試中失敗了 ↗ 、 Google Developers — Google 將 OpenAPI 程式碼生成工具開源,支援多語言 SDK 與 CI/CD 整合 ↗ 、 Matthew Berman — 12 個感覺像違法的大模型機器人使用情境 ↗

🚀 產品速報2026-10-09

Google 推出跨應用 Gemini 企業代理,整合 Workspace 與第三方工具

Google 在近期的 Gemini at Work 活動中,正式推出了被稱為「通用」的 Gemini AI 代理。這項更新不僅是軟體功能的迭代,更代表了 Google 在企業級 AI 應用上的戰略轉向:從單純的對話助手,轉變為能在背景持續運作、跨平台執行任務的智能代理。對於企業用戶而言,這意味著工作流將發生根本性的改變,AI 不再只是你打開某個 App 時才存在的工具,而是貫穿整個辦公生態系統的無縫夥伴。 先說最重要的功能:跨應用與跨裝置的無縫整合。以往使用 AI 助手時,我們往往需要複製貼上資訊,或在不同應用程式間手動切換。新的 Gemini 代理直接內建於 Gemini Enterprise 應用程式中,但它的觸角延伸到了 Gmail、Drive、Docs、Sheets 及 Calendar 等 Workspace 核心工具。更關鍵的是,它支援在手機、桌面電腦及網頁端同步運作,並且明確支援 Slack 與 Microsoft 365 等第三方應用。這打破了 Google 單一生態系的限制,讓使用者無論身處何種環境,都能透過單一介面與 AI 互動並指派任務。...

Google 推出跨應用 Gemini 企業代理與 AI 遊戲生成服務 Playground,展現其在企業整合與內容創作領域的強大佈局。同時 Meta Muse 與 OpenAI Dots 的競爭標誌著 AI 代理正式進入主流消費市場,加速技術普及。此外,Google 開源 OpenAPI 程式碼生成工具並舉辦 AI Agents 挑戰賽,進一步推動開發者生態系的創新與應用落地。

今日完整報導

以下每則都有第一手來源與我們自己撰寫的完整內文,點入即可讀完。

Google 將 OpenAPI 程式碼生成工具開源,支援多語言 SDK 與 CI/CD 整合
📄 完整報導

Google 將 OpenAPI 程式碼生成工具開源,支援多語言 SDK 與 CI/CD 整合

Google 與 Speakeasy 合作,將原本的 OpenAPI 程式碼生成套件以 AGPLv3 授權開源。此工具支援嚴格型別檢查與 SSE 串流,並能自動生成客戶端程式庫與 MCP 伺服器文件,讓開發團隊能將 SDK 生成流程整合至 CI 管線中,確保程式碼產出的穩定性與授權控制權。

Google開源SDK
Google Developers
FluidPD:具備 SLO 感知能力的 LLM 預填與解碼分離彈性架構
📄 完整報導

FluidPD:具備 SLO 感知能力的 LLM 預填與解碼分離彈性架構

FluidPD 提出一種針對 LLM 預填(Prefill)與解碼(Decode)分離架構的彈性系統,旨在解決現有系統在處理短時間請求波峰與需求比例變化時,容易違反延遲服務等級協議(SLO)的問題。該系統透過 FluidToken 等機制,在無需額外 GPU 資源的情況下實現即時彈性調整,以應對階段性的運算不平衡。

LLM ServingFluidPDSLO
arXiv cs.AI

今日速報

以下只有重點摘要,完整內容請看原始來源。

Google 推出跨應用 Gemini 企業代理,整合 Workspace 與第三方工具

Google 推出跨應用 Gemini 企業代理,整合 Workspace 與第三方工具

Google 在 Gemini at Work 活動中宣布推出「通用」Gemini AI 代理,該工具將整合於 Gemini Enterprise 應用程式中,允許使用者透過單一介面與 AI 互動並指派任務。此代理支援在 Gmail、Drive 等 Workspace 應用內直接運作,同時也能在手機、桌面、網頁以及 Slack、Microsoft 365 等第三方應用中跨裝置執行,並利用雲端運算維持跨平台的上下文一致性。

GoogleGeminiAI Agent
The Verge AI
Meta Muse 與 OpenAI Dots 對決:AI 代理進入主流消費市場

Meta Muse 與 OpenAI Dots 對決:AI 代理進入主流消費市場

Meta 與 OpenAI 分別推出 Meta Muse 與 OpenAI Dots,以可愛動畫吉祥物形象將 AI 代理推向大眾市場。這兩款產品能處理餐廳訂位、郵件分類等日常任務,OpenAI 更針對行銷、法律與會計提供專業版,而 Meta Muse 則採免費策略,引發業界對 AI 代理商業模式與競爭格局的關注。

Meta MuseOpenAI DotsAI 代理
The Verge AI
Google 推出 AI 遊戲生成服務 Playground,會打字就能製作自己的遊戲

Google 推出 AI 遊戲生成服務 Playground,會打字就能製作自己的遊戲

Google 正式推出 Playground 服務,讓使用者僅需透過文字描述即可生成 2D 或 3D 遊戲。該服務底層整合 Gemini、Nano Banana 與 Lyria 等技術,支援即時對話修改與多人遊玩功能,大幅降低遊戲開發門檻。

GooglePlaygroundAI 遊戲
電腦王阿達
Google AI Agents Challenge 四大工程模式解析

Google AI Agents Challenge 四大工程模式解析

Google for Startups AI Agents Challenge 的獲獎作品顯示,強大的多代理系統(Multi-agent Systems)成功關鍵在於底層軟體工程模式,而非僅靠模型算力。獲勝架構普遍採用雙向 MCP 通訊、非同步事件匯流排、統一驗證機制以及分層路由策略,這些結構化實踐能顯著提升系統的韌性、降低延遲並優化成本。

AI AgentsGoogleMCP
Google Developers
GLM5.3-Flash-E224-DGX-Spark:針對 NVIDIA DGX Spark 優化的非官方模型部署指南

GLM5.3-Flash-E224-DGX-Spark:針對 NVIDIA DGX Spark 優化的非官方模型部署指南

autotrust 發布了基於 zai-org/GLM-5.3-Flash 的壓縮版本,專為 NVIDIA DGX Spark 桌面系統設計。該模型透過神經架構搜尋(NAS)保留 224 個專家,並採用 NVFP4 技術,在僅激活 180 億參數的情況下,將權重大小控制在 141 GiB,適合雙卡 DGX Spark 部署。官方同步提供了完整的部署 Runbook,涵蓋網路設定、記憶體配置及效能基準測試數據。

GLM-5.3NVIDIA DGX Spark模型壓縮
Hugging Face
熱門 AI 排行榜 LMArena 估值在 10 個月內幾乎翻倍至 31 億美元

熱門 AI 排行榜 LMArena 估值在 10 個月內幾乎翻倍至 31 億美元

LMArena 背後的公司成功籌集 2 億美元,由 Lightspeed 和 Khosla 領投,使其估值達到 31 億美元。該平台目前開始將模型對齊問題(如謊言檢測)納入評估標準,顯示 AI 評估維度正從單純性能轉向更複雜的可靠性與倫理層面。

LMArenaAI 估值模型對齊
TechCrunch AI

今日洞察

AI 產業正從模型競賽轉向應用落地與工程優化。Google 透過 Gemini 企業代理與 Playground 服務,強化跨平台整合與低門檻創作,展現生態系優勢;Meta 與 OpenAI 則以吉祥物形象推動 AI 代理進入消費市場,引發商業模式競爭。同時,多代理系統的工程實踐與 DGX Spark 的硬體優化顯示,效能提升依賴架構設計而非僅靠算力。開源工具如 OpenAPI 生成器進一步降低開發門檻,加速企業數位轉型。整體而言,AI 應用正趨向實用化、低成本與高韌性,產業焦點已從技術展示轉為解決實際業務痛點與提升開發效率。

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。