📰 2026-09-03 AI 日報

通義千問跑分贏過 Claude Opus,但沒人在問「所以呢?」
阿凱📝 主編觀點 · 產品思維 — 哪個 AI 產品做對了什麼,我們能學到什麼

通義千問跑分贏過 Claude Opus,但沒人在問「所以呢?」

阿里巴巴通義千問團隊 9 月 2 日推出 Qwen3.8-Max-0902,用的方法很樸實:純後訓練升級,沒有重新預訓練,跑分結果卻超越 Claude Opus 5 與 Kimi K3。電腦王阿達的報導把重點放在「中國大模型推理能力持續升溫」,這句話本身沒錯,但我看完第一反應是:又一個跑分贏家,然後呢? 這幾個月類似劇本重播太多次了。GLM-5.3 Flash 匿名發布,價格是 Claude 的 1/40,Fireship 實測完直呼香。Kimi K3、DeepSeek,一個接一個號稱在某個 benchmark 上超車。每次都是「跑分勝過某某頂尖模型」當標題,但跑分這件事本身,今天已經開始被質疑了——Hugging Face Blog 今天就發文在問「LLM 基準測試究竟在測量什麼」,arXiv 也有研究指出現有評估方式難以隔離「長程狀態追蹤」的真實難度,錯誤會一路累積到最後一步才爆炸,但你光看最終分數看不出來。 換句話說,跑分本身的信度正在被業界自己戳破,同一週卻還在用跑分當武器互相宣戰。這不是說 Qwen3.8-Max 不強,而是「贏過 Claude Opus」這句話的含金量,已經跟去年不一樣了。後訓練能拉高分數是真的,但後訓練優化的往往是「考題型」能力,不見得等於代理任務裡那種要撐 64 輪、196 次工具呼叫不出錯的穩定性。 Anthropic 自己這幾天也在打成本牌,Fable 5.1 主打快取讀取降 75%、代理任務成本省 45%,玩的是另一套敘事:我不跟你比單題分數,我跟你比長任務下來你錢包剩多少。這其實比跑分誠實,因為代理任務燒的是真金白銀的 token,不是排行榜名次。 跑分賽局玩到現在,真正該問的問題不是「誰贏了」,而是「這個分數在下一次 64 輪工具呼叫裡還撐不撐得住」。

素材來源:電腦王阿達僅靠後訓練大升級!通義千問 Qwen3.8-Max-0902 跑分勝過 Claude Opus 5 與 Kimi K3電腦王阿達Anthropic 發布 Claude Fable 5.1 與 Mythos 5.1:快取讀取降價 75%,代理任務成本最高省 45%Hugging Face BlogBenchMIRT:LLM 基準測試究竟在測量什麼?arXiv cs.AILLM 長程狀態追蹤研究:透過 MD5 計算驗證依賴性工具呼叫的準確性TechCrunch AIAnthropic 推出 Fable 5.1:成本更低、限制更少

Anthropic 把 Claude 變得更便宜,但我們好像變得更貴了。
塵子💬 塵子觀點

Anthropic 把 Claude 變得更便宜,但我們好像變得更貴了。

Anthropic 剛推出 Fable 5.1,宣稱透過技術優化讓成本降低。快取讀取費用砍了 75%,代理任務成本最高省 45%。聽起來很划算,像是超市大減價。但仔細看定價表,每百萬 token 的單價其實沒變。省下的錢來自於「少讀取」,而不是「單價降」。這就像是你去餐廳吃飯,老闆說:「我們現在不收服務費了,但菜價沒變。」你覺得賺到了,其實只是把帳單拆得更細。 更有趣的是,Anthropic 同時推出了 Mythos 5.1。這個版本為了追求極致性能,放寬了安全限制。結果在編碼和推理測試中,它比那個小心翼翼的 Fable 5.1 表現更好。這揭示了一個荒謬的現實:AI 變聰明,往往是以犧牲安全防護為代價。企業想要便宜,就要忍受 Fable 5.1 的保守;想要強大,就要面對 Mythos 5.1 的野性。 這讓我想起了公司裡的兩個同事。一個是永遠按表操課、從不犯錯但也從不創新的老鳥;另一個是想法天馬行空、偶爾會搞砸專案但能提出驚人的點子的新人。以前我們只能選一個,現在 Anthropic 把這兩個人塞進同一個產品線裡,讓你根據預算決定要誰。 但問題不在於 Anthropic 怎麼定價,而在於我們怎麼使用。當 AI 變得更便宜、更強大,我們對它的期待也變得更不合理。我們開始要求它像 Mythos 一樣聰明,卻希望它像 Fable 一樣安全且便宜。這是不可能的三角。 最後,Anthropic 強調新模型能防範「獎勵黑客」和「蒸餻攻擊」。這些術語聽起來很專業,但翻譯成人話就是:「我們努力防止你作弊,但也請你不要真的去試。」這就像學校老師說:「考試可以重考,但請不要每次都重考。」我們都在這個遊戲裡,只是現在連作弊的成本都降低了。

素材來源:電腦王阿達Anthropic 發布 Claude Fable 5.1 與 Mythos 5.1:快取讀取降價 75%,代理任務成本最高省 45%Matthew BermanAnthropic 推出 Fable 5.1 與 Mythos 5.1:性能大幅提升與成本爭議TheAIGRID10 件用 Claude Fable 5.1 創作的瘋狂事物(Fable 5.1 使用案例)AnthropicClaude 5.1 發布TechCrunch AIAnthropic 推出 Fable 5.1:成本更低、限制更少

🚀 產品速報2026-09-03

Anthropic 推出 Fable 5.1:成本更低、限制更少,AI 應用進入精打細算時代

今天 AI 圈最引人注目的動態,來自 Anthropic 發布的 Fable 5.1 與 Mythos 5.1 模型更新。這次更新不僅帶來了性能的提升,更直接觸及開發者最關心的成本與隱私問題。簡單來說,Anthropic 試圖在「更安全」與「更便宜」之間找到新的平衡點,讓企業在部署 AI 時不再那麼猶豫。 先說最重要的功能:成本大幅降低。這次更新最實用的亮點在於快取讀取費用下降了 75%。對於依賴大量重複查詢或長上下文對話的應用來說,這意味著直接的成本節省。此外,代理任務(Agent tasks)的成本最高可節省 45%。雖然每百萬 token 的基礎定價看似未變,但透過減少快取讀取的次數,實際完成任務的總成本下降了約 25%。對於需要頻繁調用 API 的開發者而言,這是一筆可觀的節省。...

Anthropic 推出成本更低的 Fable 5.1 並大幅降低快取讀取費用,Google 則發布效能提升的 Gemini 3.8 Flash 模型,引發市場對成本與效能平衡的關注。法律方面,川普政府介入支持 OpenAI 的合理使用主張,為大型語言模型侵權訴訟帶來關鍵轉折。同時學術界透過 BenchMIRT 等研究深入探討 LLM 基準測試的本質與長程狀態追蹤的準確性驗證。

Anthropic 推出 Fable 5.1:成本更低、限制更少

Anthropic 推出 Fable 5.1:成本更低、限制更少

Anthropic 發布了 Fable 5.1 版本,主要針對模型的安全防護機制進行調整。此次更新旨在降低 token 使用成本,並減少因安全過濾機制過嚴而產生的誤判(false-positive)情況,讓模型在保持安全的同時更具實用性。

AnthropicFable模型更新
TechCrunch AI
Google 推出 Gemini 3.8 Flash 模型:效能提升但可能增加 Token 消耗

Google 推出 Gemini 3.8 Flash 模型:效能提升但可能增加 Token 消耗

Google 發布了新一代 Gemini 3.8 Flash 模型,宣稱透過更多推理步驟與迭代調用工具,在複雜任務上比前代 Gemini 3.7 Flash 表現更強。雖然初期定價維持不變,但 Google 警告該模型為追求效能可能會消耗更多 Token,開發者若需控制成本仍可選擇舊版。

GeminiGoogleAI 模型
The Verge AI
Anthropic 發布 Claude Fable 5.1 與 Mythos 5.1:快取讀取降價 75%,代理任務成本最高省 45%

Anthropic 發布 Claude Fable 5.1 與 Mythos 5.1:快取讀取降價 75%,代理任務成本最高省 45%

Anthropic 於 9 月 1 日同步推出 Claude Fable 5.1 與 Mythos 5.1 模型更新。此次更新的重點在於大幅降低 API 使用成本,其中快取讀取費用下降 75%,代理任務(Agent tasks)成本最高可節省 45%。

AnthropicClaude模型更新
電腦王阿達
僅靠後訓練大升級!通義千問 Qwen3.8-Max-0902 跑分勝過 Claude Opus 5 與 Kimi K3

僅靠後訓練大升級!通義千問 Qwen3.8-Max-0902 跑分勝過 Claude Opus 5 與 Kimi K3

阿里巴巴通義千問團隊於 9 月 2 日推出 Qwen3.8-Max-0902 模型,該版本主要透過後訓練技術進行大幅升級。根據報導,其基準測試表現已超越 Claude Opus 5 與 Kimi K3,顯示中國大模型在推理能力上的競爭態勢持續升溫。

通義千問Qwen3.8-Max後訓練
電腦王阿達
LLM 長程狀態追蹤研究:透過 MD5 計算驗證依賴性工具呼叫的準確性

LLM 長程狀態追蹤研究:透過 MD5 計算驗證依賴性工具呼叫的準確性

研究指出,現有 LLM 評估難以隔離「狀態追蹤」的難度,因為錯誤會隨步驟累積並導致最終失敗。研究團隊設計了一項測試,要求模型在 64 輪、196 次依賴性工具呼叫中,精確傳遞 MD5 雜湊計算的中间狀態,以驗證 LLM 在長序列任務中維持精確上下文的能力。這項研究揭示了當前 Agentic 基準測試的盲點,並為提升模型在多步驟任務中的可靠性提供了新的評估標準。

LLM狀態追蹤工具呼叫
arXiv cs.AI
川普政府介入《紐約時報》控告 OpenAI 侵權案,支持合理使用主張

川普政府介入《紐約時報》控告 OpenAI 侵權案,支持合理使用主張

川普政府正式介入《紐約時報》對 OpenAI 的版權訴訟,提交意見書支持 OpenAI 使用受版權保護內容訓練 AI 模型屬於「合理使用」。此舉可能對 AI 產業的數據訓練法律框架產生重大影響,並為 OpenAI 在訴訟中提供強有力的政府立場背書。

OpenAI版權訴訟合理使用
The Verge AI
BenchMIRT:LLM 基準測試究竟在測量什麼?

BenchMIRT:LLM 基準測試究竟在測量什麼?

Hugging Face Blog 發表文章探討 LLM 基準測試的本質,質疑現有評估指標是否真正反映了模型能力。此議題對於理解 AI 模型真實表現與評估方法論具有重要參考價值。

LLM基準測試模型評估
Hugging Face Blog
WebLLM:高效能的瀏覽器內 LLM 推理引擎

WebLLM:高效能的瀏覽器內 LLM 推理引擎

WebLLM 是一個在瀏覽器端直接執行大型語言模型(LLM)推理的引擎,主打高效能表現。這項技術讓 AI 模型無需依賴雲端伺服器即可在本地環境運行,為開發者提供了新的部署選項。

WebLLMLLM瀏覽器推理
Hacker News

今日洞察

AI 產業正經歷成本優化與效能提升的雙重演進。Anthropic 透過 Fable 5.1 大幅降低快取與代理任務成本,並放寬安全限制以提升實用性;Google 則推出 Gemini 3.8 Flash,以犧牲部分 Token 效率換取複雜任務效能。這顯示廠商競逐點在於平衡成本與能力。同時,川普政府介入 OpenAI 侵權案,支持合理使用主張,為數據訓練法律框架帶來關鍵轉折。此外,研究指出現有基準測試難以隔離狀態追蹤難度,呼籲重新檢視評估標準。整體而言,產業焦點已從單純模型競賽,轉向成本控制、法律合規與真實能力驗證的綜合博弈。

🔮 趨勢雷達

未來三至六個月,AI 產業將從單純的效能競賽轉向成本與合規的雙重博弈。Anthropic 大幅降低快取與代理任務成本,將迫使競爭對手跟進價格戰,促使企業級 AI 應用從實驗階段全面進入實戰部署,特別是具備長程狀態追蹤能力的 Agent 系統將成為 Q3 主流。同時,川普政府介入版權訴訟並支持合理使用,將為大模型訓練數據獲取掃清法律障礙,加速數據壟斷格局形成。然而,Google Gemini 3.8 Flash 增加 Token 消耗的特性警示開發者,盲目追求推理效能將導致成本失控,市場將出現對高性價比模型的強烈需求,投資熱點將從基礎模型轉向優化推理效率與降低運營成本的基礎設施領域。

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。