Anthropic 與 OpenAI 同日發佈新模型,價格戰升溫
Anthropic 推出 Claude Opus 5.5,在 Intelligence Index 排名第一且價格下降 40%;OpenAI 緊接著推出 GPT-6 Sol 和 Luna,將前沿模型價格砍半。兩家廠商在短短 90 分鐘內先後出手,標誌著 AI 業界進入激烈的「配速競速」新時代,邊界模型的成本與可用性都在快速演變。
Claude Opus 5.5GPT-6模型價格戰
The Rundown AIHeyGen x Google Cloud:Avatar IV 模型移植至 TPU 實現 1.86 倍加速
HeyGen 與 Google Cloud 合作,將其 18B+ 參數的 Avatar IV 影片生成模型移植至 Trillium TPU,透過 FSDP 和 Ulysses 序列平行化等優化技術,實現了實時串流 1.86 倍的效能提升。團隊使用自訂 Pallas 核心和編譯器最佳化,並通過嚴格的二層品質驗證確保輸出結果的準確性,標誌著大規模生成式 AI 模型在專用硬體上的實際運用突破。
影片生成TPU 最佳化生成式 AI
Google DevelopersOpenAI 推出 GPT-6 Sol 與 Luna 模型
OpenAI 正式發布 GPT-6 Sol 與 Luna 兩款新模型,旨在將前沿 AI 能力應用於日常工作中。這兩款模型在性能與成本之間提供了不同的平衡選項,讓使用者能依據需求選擇最適合的模型。
OpenAIGPT-6Sol
OpenAI BlogGPT-6 提示詞快取效能優化:降低延遲與成本
OpenAI 宣布 GPT-6 在提示詞快取(prompt caching)上進行多項改進,包含提升快取命中率、新增診斷工具以及提供明確的斷點控制。這些更新旨在顯著降低 API 呼叫的延遲與使用成本,讓開發者能更高效地運用 GPT-6 模型。
GPT-6OpenAIprompt caching
OpenAI BlogTransformers 現在支援 llama.cpp 量化模型
Hugging Face 宣布其 Transformers 函式庫已整合對 llama.cpp 量化模型的原生支援。這項更新讓開發者能更直接地在 Transformers 生態系中載入與使用經過量化的 LLM,無需額外的轉換步驟。
Hugging FaceTransformersllama.cpp
Hugging Face BlogGoogle Cloud 原生整合 TPU 支援至 vLLM,優化長上下文多模態嵌入推論
Google Cloud 將 TPU 支援原生整合進 vLLM 推理引擎,並透過 GKE 實現彈性擴展。針對 Qwen3-Embedding-8B 等模型的 15K+ token 長上下文,團隊實作了硬體張量對齊與 JAX/XLA 編譯預熱等優化,達成與 GPU 基準相近的數值精度,並已開源設定範例供開發者使用。
Google CloudTPUvLLM
Google DevelopersMCP 協議更新:轉向無狀態架構以支援 AI Agent 基礎設施擴展
Model Context Protocol (MCP) 規範已更新,將核心架構從有狀態改為完全無狀態,以支援雲端原生擴展與 Serverless 部署。此次更新引入了標準化 HTTP 標頭與 Multi Round-Trip Requests (MRTR) 機制,解決了互動式與長時間任務的阻塞問題。開發者現可使用 Python、TypeScript 等語言的 Beta SDK 進行遷移。
MCPAI Agent無狀態架構
Google DevelopersRBS-Attention:半徑限制稀疏預填充技術加速長上下文大語言模型推理
針對長上下文大語言模型推理中預填充階段計算成本過高的問題,研究提出 RBS-Attention 方法。該技術透過結合平均相關性與最大鍵塊半徑的雙分支選擇機制,有效解決傳統稀疏區塊選擇可能遺漏關鍵資訊的缺陷,在 H100 GPU 上實現顯著的速度提升。
長上下文大語言模型稀疏注意力
arXiv cs.AIStepKV:針對 LLM Agent 的步驟感知 KV Cache 壓縮技術
研究提出 StepKV 演算法,解決大型語言模型(LLM)在執行多步驟 Agent 任務時,KV Cache 隨上下文線性增長導致的儲存與解碼成本問題。現有方法多將快取視為扁平的 token 序列,StepKV 則根據推理步驟的結構進行壓縮,更精準地保留對後續決策至關重要的資訊,提升 Agent 運行的效率。
LLM AgentKV Cache壓縮技術
arXiv cs.LG