
通義千問跑分贏過 Claude Opus,但沒人在問「所以呢?」
素材來源:電腦王阿達 — 僅靠後訓練大升級!通義千問 Qwen3.8-Max-0902 跑分勝過 Claude Opus 5 與 Kimi K3 ↗ 、 電腦王阿達 — Anthropic 發布 Claude Fable 5.1 與 Mythos 5.1:快取讀取降價 75%,代理任務成本最高省 45% ↗ 、 Hugging Face Blog — BenchMIRT:LLM 基準測試究竟在測量什麼? ↗ 、 arXiv cs.AI — LLM 長程狀態追蹤研究:透過 MD5 計算驗證依賴性工具呼叫的準確性 ↗ 、 TechCrunch AI — Anthropic 推出 Fable 5.1:成本更低、限制更少 ↗








