
Stratego 被 AI 打穿了,而且只用了 16 張 GPU
素材來源:Ars Technica AI — AI 攻克隱藏資訊經典遊戲 Stratego,Ataraxos 擊敗人類最強選手 ↗ 、 arXiv cs.AI — AREX-2:透過長程反思任務推進自我改進型 AI 代理 ↗

素材來源:Ars Technica AI — AI 攻克隱藏資訊經典遊戲 Stratego,Ataraxos 擊敗人類最強選手 ↗ 、 arXiv cs.AI — AREX-2:透過長程反思任務推進自我改進型 AI 代理 ↗

素材來源:The Verge AI — OpenAI 推出 AI 助手 Dots 挑戰 Meta,但免費策略成關鍵變數 ↗ 、 Fireship — 唯一能讓你賺錢的 OpenAI 公告 ↗ 、 Google Developers — Google Antigravity SDK 新增本地 AI 模型支援 ↗
Google 發布被宣稱為最強模型的 Gemini 4 Argon,並透過 Antigravity SDK 強化本地 AI 支援,展現其在基礎模型與開發工具上的雙重佈局。OpenAI 則在 DevDay 2026 推出由 GPT-6 Astra 驅動、挑戰 Meta 的 AI 助手 Dots,但 Dots 僅限付費方案,面對免費的 Muse,價格成為市場競爭的關鍵變數。此外,AI 在策略遊戲 Stratego 中擊敗人類最強選手,以及自我改進型代理 AREX-2 的進展,標誌著 AI 在複雜推理與自主能力上的重大突破。
以下每則都有第一手來源與我們自己撰寫的完整內文,點入即可讀完。

Google 正式推出最新一代 Gemini 模型 Gemini 4 Argon,並將其定位為專為程式開發與資安工作設計的強大工具。作為 Google 宣稱的「最強模型」,此次更新主要聚焦於提升 AI 在技術領域的實用性與效能。

卡內基美隆、MIT 等大學研究團隊開發出 AI Ataraxos,在經典遊戲 Stratego 中以 15 勝 1 敗 4 和的成績擊敗被譽為最強的人類選手 Pim Niemeijer。這項突破解決了長期以來因大量隱藏資訊而難以被 AI 破解的不完全資訊賽局難題,且僅需 16 張 GPU 與數千美元即可完成訓練。

研究團隊提出 AREX-2,旨在提升 LLM 代理在測試階段自我改進的能力,核心機制結合了產生更優解的「反思」與維持多輪迭代效果的「長程執行」。該模型基於 Qwen3.8-27B 訓練,在 MLE-bench Lite 與 Frontier-CS 等基準測試中表現優異,並成功轉移應用於深度研究任務,展現出跨領域的泛化潛力。
以下只有重點摘要,完整內容請看原始來源。

OpenAI 在 DevDay 2026 上發布了超過 20 項公告,涵蓋 ChatGPT、Codex 與模型,包括全天候運作的 AI 代理 Dots 與新模型 GPT-6.1 Sol。此次活動也推出 Codex 與 API 的開發者新工具,並把 ChatGPT 開放成開發者可直接推出原生體驗的平台,顯示 OpenAI 持續強化其生態系與開發者支援。

OpenAI 在 DevDay 2026 上發布全新 AI 助手 Dots,搭載 GPT-6 Astra 模型,以可愛視覺風格與建構虛擬世界的能力直接對標 Meta 的 Muse。儘管 OpenAI 試圖透過技術創新與體驗差異化來競爭,但市場關注焦點仍集中在其能否在免費工具盛行的環境中取得優勢。

Google 宣布 Antigravity SDK 現已支援在本地執行離線 AI 工作流,可透過 LiteRT 運行 Gemma 4 26B A4B 等模型。此更新允許開發者建立混合架構,由雲端模型擔任輕量級規劃者,而本地模型則在裝置上安全處理程式碼審查等敏感任務。SDK 同時提供對 Ollama 和 vLLM 等 OpenAI 相容推理伺服器的即插即用支援,便於打造注重隱私的本地自動化工具。

Google 宣布將 Colab 納入 Google AI 方案,訂閱者可優先使用更快的加速器與更強大的機器,Google AI Ultra 訂閱者另可使用 Premium GPU 與不中斷的背景執行,長時間訓練不必一直開著瀏覽器分頁。這項更新讓使用者能更順暢地進行模型訓練與運算任務。

CoreWeave 宣布在 Fully Connected 活動中提供基於 NVIDIA Vera Rubin NVL72 系統與 Spectrum-X 網路的雲端服務,並將提供 NVIDIA 專為 AI 代理設計的 Vera CPU。Cognition 成為首家在生產環境運行 Vera Rubin 的客戶,同時 CoreWeave 也推出了整合模型訓練與評估的 CoreWeave Forge 平台,旨在縮短從訓練到生產的 AI 開發週期。

Ai2(艾倫人工智慧研究所)發布 Olmo-core 3,這是一個專為大型混合專家(MoE)模型設計的開源訓練基礎設施。該更新強調了開源架構在處理大規模模型訓練時的擴展能力,為開發者提供了更靈活的訓練選項。
AI 產業正邁向技術深化與應用場景擴散的關鍵階段。Google 與 OpenAI 分別推出 Gemini 4 Argon 及 GPT-6 Astra,聚焦程式開發與資安,顯示大模型競爭已從通用能力轉向垂直領域的實用性與生態系建構。同時,本地化部署成為隱私保護新趨勢,Google Antigravity SDK 支援離線模型,滿足企業對數據安全的嚴苛需求。此外,AI 在隱藏資訊遊戲與自我改進代理的突破,標誌著推理與自主決策能力的顯著提升。儘管對手的免費策略可能壓縮付費 AI 代理的市場空間,但技術邊界的拓展與混合架構的成熟,將持續驅動產業向更高效、更安全的方向演進。
喜歡這篇?每天早晨還有更多。
訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。