📰 2026-10-02 AI 日報

Stratego 被 AI 打穿了,而且只用了 16 張 GPU
阿凱📝 主編觀點 · 反直覺觀點 — 大家都這樣想,但其實可能不是這樣

Stratego 被 AI 打穿了,而且只用了 16 張 GPU

Ataraxos 在 Stratego 對上被視為人類最強的 Pim Niemeijer,戰績是 15 勝 1 敗 4 和。研究團隊來自卡內基美隆和 MIT 等學校,訓練成本是 16 張 GPU、數千美元。這個數字比戰績本身更值得細看。 Stratego 是一種棋子身分全程蓋住的棋類遊戲,你不知道對面那顆是地雷還是元帥。這類不完全資訊賽局的難度,長期被認為比圍棋高出一截,因為可能的局面數量遠超圍棋,而且你得一邊猜對手、一邊騙對手。 一般人的直覺是:AI 打贏人類,一定是靠砸錢堆算力。AlphaGo 那一代確實如此,當年訓練用了大量 TPU。但這次反過來,一個學術團隊只用 16 張 GPU 訓練一週就辦到了。 這跟我們前陣子一直在講的「算力軍備競賽」是兩條不同的路線。大公司在搶電力和機房,是因為通用模型要什麼都會。但特定問題如果演算法選對,成本可以掉兩三個數量級。賽局類問題尤其如此,因為搜尋與自我對弈的結構本來就能被針對性優化。 另一則 arXiv 的 AREX-2 也有類似味道。它用 Qwen3.8-27B 這種中等尺寸模型,靠「反思」加上「長程執行」,在 MLE-bench Lite 上拿到不錯成績,還能轉移到深度研究任務。兩則放在一起看,訊號是一致的:進步的來源不只是模型更大,而是訓練方法和推理流程更聰明。 對做產品的人來說,這個差別很實際。如果你的場景是定價談判、資安攻防、拍賣競標這類「對手資訊不透明」的決策,過去會覺得是大廠才碰得起的領域。現在一個小團隊帶著幾張 GPU,就有機會做出能打的東西。我自己會把 Stratego 當成一個前哨:隱藏資訊的賽局被破解後,下一批被盯上的,是真實世界裡那些你看不到對手底牌的商業場景。 護城河正在從「誰的機房大」慢慢轉向「誰的問題定義得準」。

素材來源:Ars Technica AI — AI 攻克隱藏資訊經典遊戲 Stratego,Ataraxos 擊敗人類最強選手 ↗ 、 arXiv cs.AI — AREX-2:透過長程反思任務推進自我改進型 AI 代理 ↗

OpenAI 的 AI 助手長得像你的寵物,但其實是在搶你的工作
塵子💬 塵子觀點

OpenAI 的 AI 助手長得像你的寵物,但其實是在搶你的工作

OpenAI 在 DevDay 發布了搭載 GPT-6 Astra 的 Dots。造型可愛,還能建構虛擬世界,明顯是衝著 Meta 的 Muse 來的。但看完功能你會發現,它不是聊天機器人,而是想接管你數位生活的代理。 真正的重點是商業邏輯。OpenAI 同時推出「Sign in with ChatGPT」,讓第三方應用程式能用 ChatGPT 帳號授權登入。聽起來方便,其實是把 ChatGPT 變成流量入口。身分驗證、訂閱、個人代理全綁在 OpenAI 身上,第三方開發者就得繳過路費。 過去的 AI 是工具,拿來寫信、做圖。現在的 AI 是平台,想當你進入其他應用的大門。Pages、Space 和 Slack 裡的 @ChatGPT 這幾個展示的工具,都是要把代理塞進辦公流程。流程被接管,你就從使用者變成監督者。 Dots 先只給付費用戶也是算計好的:目前限每月 100 美元的 Pro 方案等付費用戶使用,Altman 說之後才會做給數十億人用的大眾版。套路不新,但放在 AI 代理上就是資料壟斷。所有互動都經過 Dots,OpenAI 就握有你最真實的行為資料。 搜尋引擎給連結,你自己決定點哪個;代理直接給答案,還順手做完。當 Dots 開始回訊息、排會議、處理財務,你還覺得它只是寵物嗎? Dots 的可愛,只是讓你更輕易交出控制權。工作、社交、生活都被接管後,你還剩什麼?大概只剩一顆被養得很好的心,和一顆不用思考的腦。

素材來源:The Verge AI — OpenAI 推出 AI 助手 Dots 挑戰 Meta,但免費策略成關鍵變數 ↗ 、 Fireship — 唯一能讓你賺錢的 OpenAI 公告 ↗ 、 Google Developers — Google Antigravity SDK 新增本地 AI 模型支援 ↗

🚀 產品速報2026-10-02

Google 發布 Gemini 4 Argon,宣稱是最強模型

Google 正式推出最新一代前沿模型 Gemini 4 Argon,並將其定位為專為程式開發、企業知識工作以及網路安全防禦設計的強大工具。作為 Google 宣稱的「最強模型」,此次更新主要聚焦於提升 AI 在技術領域的實用性與效能,特別是在處理複雜、長期且高專業度的任務上展現出顯著優勢。 先說最重要的技術突破:輸出能力大幅提升。Gemini 4 Argon 支援最高 100 萬個 token 的輸出,相較於前代的 64,000 個 token,增幅驚人。這意味著模型能在單一軌跡中生成數十萬個 token,進行更深入的推理與多步驟問題處理。...

Google 發布被宣稱為最強模型的 Gemini 4 Argon,並透過 Antigravity SDK 強化本地 AI 支援,展現其在基礎模型與開發工具上的雙重佈局。OpenAI 則在 DevDay 2026 推出由 GPT-6 Astra 驅動、挑戰 Meta 的 AI 助手 Dots,但 Dots 僅限付費方案,面對免費的 Muse,價格成為市場競爭的關鍵變數。此外,AI 在策略遊戲 Stratego 中擊敗人類最強選手,以及自我改進型代理 AREX-2 的進展,標誌著 AI 在複雜推理與自主能力上的重大突破。

今日完整報導

以下每則都有第一手來源與我們自己撰寫的完整內文,點入即可讀完。

Google 發布 Gemini 4 Argon,宣稱是最強模型
📄 完整報導

Google 發布 Gemini 4 Argon,宣稱是最強模型

Google 正式推出最新一代 Gemini 模型 Gemini 4 Argon,並將其定位為專為程式開發與資安工作設計的強大工具。作為 Google 宣稱的「最強模型」,此次更新主要聚焦於提升 AI 在技術領域的實用性與效能。

GoogleGemini 4 ArgonAI 模型
TechCrunch AI
AI 攻克隱藏資訊經典遊戲 Stratego,Ataraxos 擊敗人類最強選手
📄 完整報導

AI 攻克隱藏資訊經典遊戲 Stratego,Ataraxos 擊敗人類最強選手

卡內基美隆、MIT 等大學研究團隊開發出 AI Ataraxos,在經典遊戲 Stratego 中以 15 勝 1 敗 4 和的成績擊敗被譽為最強的人類選手 Pim Niemeijer。這項突破解決了長期以來因大量隱藏資訊而難以被 AI 破解的不完全資訊賽局難題,且僅需 16 張 GPU 與數千美元即可完成訓練。

StrategoAtaraxosAI 突破
Ars Technica AI
AREX-2:透過長程反思任務推進自我改進型 AI 代理
📄 完整報導

AREX-2:透過長程反思任務推進自我改進型 AI 代理

研究團隊提出 AREX-2,旨在提升 LLM 代理在測試階段自我改進的能力,核心機制結合了產生更優解的「反思」與維持多輪迭代效果的「長程執行」。該模型基於 Qwen3.8-27B 訓練,在 MLE-bench Lite 與 Frontier-CS 等基準測試中表現優異,並成功轉移應用於深度研究任務,展現出跨領域的泛化潛力。

LLM Agents自我改進長程反思
arXiv cs.AI

今日速報

以下只有重點摘要,完整內容請看原始來源。

OpenAI DevDay 2026 回顧:AI 代理 Dots、GPT-6.1 Sol 與開發者工具更新

OpenAI DevDay 2026 回顧:AI 代理 Dots、GPT-6.1 Sol 與開發者工具更新

OpenAI 在 DevDay 2026 上發布了超過 20 項公告,涵蓋 ChatGPT、Codex 與模型,包括全天候運作的 AI 代理 Dots 與新模型 GPT-6.1 Sol。此次活動也推出 Codex 與 API 的開發者新工具,並把 ChatGPT 開放成開發者可直接推出原生體驗的平台,顯示 OpenAI 持續強化其生態系與開發者支援。

OpenAIGPT-6 AstraDevDay 2026
OpenAI Blog
OpenAI 推出 AI 助手 Dots 挑戰 Meta,但僅限付費方案成關鍵弱點

OpenAI 推出 AI 助手 Dots 挑戰 Meta,但僅限付費方案成關鍵弱點

OpenAI 在 DevDay 2026 上發布全新 AI 助手 Dots,搭載 GPT-6 Astra 模型,以可愛視覺風格與建構虛擬世界的能力直接對標 Meta 的 Muse。儘管 OpenAI 試圖透過技術創新與體驗差異化來競爭,但市場關注焦點仍集中在其能否在免費工具盛行的環境中取得優勢。

OpenAIDotsGPT-6 Astra
The Verge AI
Google Antigravity SDK 新增本地 AI 模型支援

Google Antigravity SDK 新增本地 AI 模型支援

Google 宣布 Antigravity SDK 現已支援在本地執行離線 AI 工作流,可透過 LiteRT 運行 Gemma 4 26B A4B 等模型。此更新允許開發者建立混合架構,由雲端模型擔任輕量級規劃者,而本地模型則在裝置上安全處理程式碼審查等敏感任務。SDK 同時提供對 Ollama 和 vLLM 等 OpenAI 相容推理伺服器的即插即用支援,便於打造注重隱私的本地自動化工具。

GoogleAntigravity SDK本地 AI
Google Developers
Google AI 方案現已整合 Colab 服務

Google AI 方案現已整合 Colab 服務

Google 宣布將 Colab 納入 Google AI 方案,訂閱者可優先使用更快的加速器與更強大的機器,Google AI Ultra 訂閱者另可使用 Premium GPU 與不中斷的背景執行,長時間訓練不必一直開著瀏覽器分頁。這項更新讓使用者能更順暢地進行模型訓練與運算任務。

Google AIColabGPU
Google Developers
NVIDIA 與 CoreWeave 合作推出 Vera Rubin NVL72 系統,加速 Agentic AI 生產環境部署

NVIDIA 與 CoreWeave 合作推出 Vera Rubin NVL72 系統,加速 Agentic AI 生產環境部署

CoreWeave 宣布在 Fully Connected 活動中提供基於 NVIDIA Vera Rubin NVL72 系統與 Spectrum-X 網路的雲端服務,並將提供 NVIDIA 專為 AI 代理設計的 Vera CPU。Cognition 成為首家在生產環境運行 Vera Rubin 的客戶,同時 CoreWeave 也推出了整合模型訓練與評估的 CoreWeave Forge 平台,旨在縮短從訓練到生產的 AI 開發週期。

NVIDIACoreWeaveVera Rubin
NVIDIA Blog
Ai2 發布 Olmo-core 3,開源大型 MoE 模型訓練基礎設施

Ai2 發布 Olmo-core 3,開源大型 MoE 模型訓練基礎設施

Ai2(艾倫人工智慧研究所)發布 Olmo-core 3,這是一個專為大型混合專家(MoE)模型設計的開源訓練基礎設施。該更新強調了開源架構在處理大規模模型訓練時的擴展能力,為開發者提供了更靈活的訓練選項。

Hugging FaceOlmo-core 3MoE
Hugging Face Blog

今日洞察

AI 產業正邁向技術深化與應用場景擴散的關鍵階段。Google 與 OpenAI 分別推出 Gemini 4 Argon 及 GPT-6 Astra,聚焦程式開發與資安,顯示大模型競爭已從通用能力轉向垂直領域的實用性與生態系建構。同時,本地化部署成為隱私保護新趨勢,Google Antigravity SDK 支援離線模型,滿足企業對數據安全的嚴苛需求。此外,AI 在隱藏資訊遊戲與自我改進代理的突破,標誌著推理與自主決策能力的顯著提升。儘管對手的免費策略可能壓縮付費 AI 代理的市場空間,但技術邊界的拓展與混合架構的成熟,將持續驅動產業向更高效、更安全的方向演進。

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。