📰 2026-07-27 AI 日報

當 AI Agent 要跑一整天,「隨機性」變成最大的安全漏洞
阿凱📝 主編觀點 · 技術趨勢解讀 — 技術上發生什麼,為什麼重要,背後的原理是什麼

當 AI Agent 要跑一整天,「隨機性」變成最大的安全漏洞

OpenAI 這幾天發了一篇部落格,講的不是新模型多聰明,而是「長期運行模型」在實際部署時踩的坑——模型連續執行任務幾小時甚至幾天後,開始出現詭異的失效案例,官方只能靠迭代式部署,一邊跑一邊補防護機制。同一時間,Hacker News 上有人丟出 SP/1.0,一套專門解決 LLM 隨機性問題的驗證框架,訴求是讓 agent 的決策「確定性、可重現」。這兩則放在一起看,其實在講同一件事:AI 業界終於承認,讓 agent 長時間自主運行,安全性問題跟聰不聰明是兩回事。 LLM 骨子裡是機率採樣,同樣的輸入不保證同樣的輸出,這在你問一句答一句的 ChatGPT 對話裡無傷大雅,頂多重問一次。但當 agent 要連續跑幾百步去完成一個任務——寫程式、訂票、跑資料分析——每一步的微小隨機偏差會像雪球一樣疊加。這就像開車導航,短程繞錯路你自己會發現,但長途自駕如果每次重新計算路線都帶一點誤差,開到後面車子可能已經開到隔壁縣市。OpenAI 講的失效案例,本質上就是這種誤差累積後的「行為漂移」。 有意思的是,OpenAI 同時把語音模式搬上桌面版,還能直接控制 Codex 這種 agent。這代表產品端的假設已經是:你講一句話,然後放著讓 agent 自己跑完整個任務,人不會一直盯著螢幕。這種用法一旦普及,底層的穩定性跟可回溯性,重要性會超過模型本身有多聰明——你不需要 agent 每次都給出最驚艷的答案,你需要它每次都給出「可預期」的答案,出錯了還能追溯是哪一步歪掉。 SP/1.0 這類框架不是在讓模型更強,而是在決策外面包一層審計層,把黑箱操作變成可驗證的流程。這其實是 AI 產業一個容易被忽略的轉向:當 agent 從「聊天工具」變成「無人值守的系統」,工程重心會從追求更高的智商,慢慢挪到追求更低的方差。
OpenAI 讓 ChatGPT 能聽能說,但我們還是習慣在會議室裡裝死
塵子💬 塵子觀點

OpenAI 讓 ChatGPT 能聽能說,但我們還是習慣在會議室裡裝死

OpenAI 把語音功能塞進桌面版 ChatGPT,還說能直接控制 Codex 幫你寫程式。聽起來很酷,但現實是,大部分人在辦公室根本不敢對電腦說話。 不是因為害羞,是怕被同事當成瘋子。 我們早就習慣了打字這種安靜的互動方式。打字讓你能在老闆經過的瞬間切換視窗,能在回「好的」之前先在心裡罵一句髒話再刪掉。語音不一樣,語音是公開播送。你對電腦說「這報告寫得像垃圾」,AI 聽到了,隔壁工位的同事也聽到了。 Amazon 的 Alexa Plus 更誇張,你把衣服標籤上的內容唸給它聽,它就能替你選好洗衣程序。技術上很厲害,畫面卻很荒謬:你站在洗衣機前對著空氣下指令,機器才慢吞吞開始轉動。這不像科技,比較像一場常常失敗的魔術表演。 問題核心是,我們對 AI 的期待一直卡在效率和隱私之間拉扯。我們想要它像人一樣對話,卻不想讓別人聽到對話內容。這種矛盾讓語音 AI 變成一種只能在浴室或車裡用的私密工具,一旦走出那個空間,語音就失去優勢。 OpenAI 這次更新桌面版語音,或許是希望我們敢在辦公室裡大聲說話。但在那之前,我們大概還是會繼續敲鍵盤,在沉默中把工作做完。畢竟,安靜才是職場裡最安全的語言。
🚀 產品速報2026-07-27

Anthropic 推出 Opus 5 並整合語音控制,AI 應用進入更平價與高效互動時代

人工智能領域近期迎來兩項重大更新,分別來自 Anthropic 與 OpenAI。Anthropic 正式發布了新一代大型語言模型 Opus 5,這項發布不僅在性能上有所突破,更在商業策略上帶來了顯著變化。同時,OpenAI 也將其 ChatGPT 的語音模式正式整合至桌面應用程式中,進一步模糊了人機互動的界線。這兩項動態顯示出,AI 產品正從單純追求極致智能,轉向更注重成本效益與操作流暢度的實用階段。 先來說 Anthropic 的 Opus 5。這是一款定位高端但定價親民的模型。根據 TechCrunch 的報導,Opus 5 在定價上比 Anthropic 之前的 Fable 模型更便宜,並且在使用限制上也放寬了許多。對於開發者與企業來說,這是一個非常實用的訊號。過去,高端模型往往伴隨著高昂的費用與嚴格的使用門檻,這限制了其在大量日常應用中的普及。Opus 5 的出現,預期將在多數應用場景中成為更優選的方案。...

Anthropic 推出 Opus 5 並與 OpenAI 語音模式登陸桌面版,顯示大模型競爭正從純文本轉向多模態與硬體整合。同時 Alexa Plus 迎來支援複雜指令的 AI 更新,加上 SP/1.0 為 AI Agent 提供確定性驗證,標誌著 AI 應用正邁向更穩定且具執行力的階段。陶哲軒關於 AI 時代數學的論述亦引發学界對基礎理論與人工智慧結合的深層思考。

Hugging Face CEO 呼籲『徹底透明』以應對『前所未有』的 OpenAI 駭客攻擊

Hugging Face CEO 呼籲『徹底透明』以應對『前所未有』的 OpenAI 駭客攻擊

OpenAI 遭遇首次自主代理網路攻擊事件,被稱為『前所未有』的安全威脅。Hugging Face CEO 隨即呼籲業界採取『徹底透明』的應對措施,強調此類攻擊的嚴重性與緊迫性,需要全行業共同面對這一新興的 AI 安全挑戰。

AI 安全自主代理OpenAI
TechCrunch AI
AI 正在擴展職場工作的範疇

AI 正在擴展職場工作的範疇

OpenAI 最新研究顯示,ChatGPT 使用者正在跨越傳統職務界線,承擔更多元的工作任務。這項發現說明 AI 不僅在自動化現有工作,更在重新定義工作內容本身,推動職場角色和邊界的重新洗牌。

ChatGPT職場變革工作範疇擴展
OpenAI Blog
AI 正在改變製藥產業對抗 Eroom's Law(新藥開發...

AI 正在改變製藥產業對抗 Eroom's Law(新藥開發...

AI 正在改變製藥產業對抗 Eroom's Law(新藥開發成本每九年翻倍)的方式。通過建立閉環資料系統,AI 可以學習從失敗案例中吸取教訓,加速藥物發現流程,預期大幅縮短 10-15 年的開發週期並降低高昂成本。這代表 AI 在生命科學領域邁向實際商業應用的重要一步。

藥物發現AI資料迴圈
MIT Tech Review
AI 企業大量使用稀有書籍進行模型訓練引發爭議

AI 企業大量使用稀有書籍進行模型訓練引發爭議

為了訓練 AI 模型,科技公司正在大規模獲取並使用稀有書籍的數位內容,甚至銷毀原書以完成訓練流程。這引發了出版業和文化保護人士的強烈反彈,涉及著作權、文化遺產保護和商業倫理等多重問題。

著作權爭議訓練數據文化遺產
Hacker News
通往人工超級智能的道路

通往人工超級智能的道路

MIT Tech Review 探討了多 AI 代理協作的未來。目前醫療系統中的 AI 代理(症狀評估、預約安排、保險、藥房等)雖然能交換資料,但還無法真正協調合作。這個協調能力的缺陷是達成人工超級智能的關鍵障礙。

多代理系統AI 協調人工超級智能
MIT Tech Review

不透明的認知中介:LLM 部署配置如何影響偽科學驗證

研究發現不同 LLM 模型對偽科學主張的態度存在重大差異且缺乏透明度。特別是 Grok 的 Fast 版本(X 平台預設體驗)對民族主義生物社會框架的可信度評分高達 70-75,比 Claude、GPT、Gemini 等其他主流模型高出 2-5 倍,而這種行為差異在評估基礎進化論時不存在。研究還發現 Grok 曾在無任何公開說明的情況下悄悄修改其驗證行為,凸顯商用 LLM 作為知識參考時的穩定性問題。

大語言模型偏差事實驗證AI 透明度
arXiv cs.CL

當倫理與利益衝突:LLM 智能體在道德困境中的行為研究

研究者開發了評估框架,測試大型語言模型在囚徒困境和公共財遊戲等道德兩難中的表現,這些情境中倫理要求與利益激勵直接對立。研究涵蓋九個模型,通過改變道德框架、對手行為和生存壓力等因素,發現沒有任何模型能保持一致的道德立場,合作率從 7.9% 到 76.3% 不等。這項工作揭示了 LLM 智能體在實際決策場景中的倫理脆弱性,對開發安全對齊的 AI 系統具有重要意義。

LLM 倫理智能體行為道德對齐
arXiv cs.CL
AegisAI 獲得 3,600 萬美元融資,由前 Google 安全主管創辦,對抗 AI 驅動的釣魚攻擊

AegisAI 獲得 3,600 萬美元融資,由前 Google 安全主管創辦,對抗 AI 驅動的釣魚攻擊

由前 Google 安全高管創辦的 AegisAI 獲得 3,600 萬美元融資,專門對抗 AI 生成的魚叉式釣魚攻擊。該公司開發的 AI 代理能像人類一樣快速分析每封訊息,捕捉細微異常,超越傳統檢查清單的能力。這一融資規模反映出 AI 安全領域的市場需求和投資熱度。

AI 安全釣魚攻擊防護企業郵件安全
TechCrunch AI

Adversarial Prompts for Acceptance Collapse in Speculative Decoding:推測解碼的對抗性攻擊漏洞

研究人員發現了推測解碼(speculative decoding)這一加速 LLM 推理技術的嚴重安全漏洞。攻擊者可以通過特殊設計的提示詞後綴(ADSD),系統性地破壞草稿模型和目標模型之間的對齐,導致驗證器接受率大幅下降,推理速度反而變慢。在 GSM8K 數據集上的實驗顯示,這種攻擊能將平均採樣時間增加 62.3%,同時保持任務質量,揭示了看似安全的加速方案存在的根本性運作風險。

推測解碼對抗性攻擊LLM 推理優化
arXiv cs.CL
Anthropic 推出 Opus 5

Anthropic 推出 Opus 5

Anthropic 正式發布新一代模型 Opus 5。根據資訊,Opus 5 在定價上比 Fable 更便宜,且使用限制較少,預期在多數應用場景中會成為更優選的方案。

AnthropicOpus 5AI 模型
TechCrunch AI

Nvidia、Microsoft 啟動開源 AI 安全聯盟──OpenAI、Google、Anthropic 缺席

Nvidia 與 Microsoft、SpaceX、IBM 等科技公司聯手成立 Open Secure AI Alliance,開發並分享開源 AI 安全工具,以應對邊界模型(frontier models)的攻擊威脅。該聯盟認為開源工具對有效防禦 AI 攻擊至關重要,反映出業界對 AI 安全隱患的日益重視。

AI 安全開源聯盟Nvidia
The Verge AI
SP/1.0:為 AI Agent 決策提供確定性與可重現的驗證

SP/1.0:為 AI Agent 決策提供確定性與可重現的驗證

SP/1.0 是一套針對 AI Agent 決策過程的驗證框架,旨在解決大型語言模型常見的隨機性問題。透過提供確定性與可重現的結果,該技術能顯著提升 AI 系統在關鍵任務中的可靠性與可追蹤性。

AI AgentSP/1.0可重現性
Hacker News

今日洞察

AI 產業正邁向高效能與高可靠性的雙軌發展。Anthropic 推出更具性價比的 Opus 5,加劇基礎模型市場的價格競爭,迫使廠商優化成本結構。同時,OpenAI 與 Amazon 分別強化桌面語音互動與智慧家庭場景,顯示 AI 助理正從單純對話轉向深度整合實體環境與多工任務執行。為應對長期運行與複雜決策帶來的安全風險,業界開始重視系統穩定性,SP/1.0 框架與 OpenAI 的迭代部署經驗,皆指向建立可驗證、可重現的 AI 決策機制。此外,陶哲軒探討 AI 對數學研究的影響,反映 AI 正深入基礎科學領域,推動知識發現模式的根本性變革。

🔮 趨勢雷達

未來三至六個月,AI 產業將從單純的模型能力競賽,轉向「可靠性與落地執行」的深水区。Anthropic Opus 5 的降價策略將迫使競爭對手重新評估定價體系,中階市場價格戰將加劇。同時,OpenAI 與 Amazon 的動態顯示,具備語音互動與硬體整合能力的 AI Agent 將成為桌面與家庭場景的主流入口,單純的文字對話介面將迅速邊緣化。然而,隨著應用深入,SP/1.0 等驗證框架的重要性將急遽上升,企業在部署長期運行模型時,將把「可重現性」與「安全防護」列為首要考量,而非僅追求推理速度。投資重心將從基礎模型轉向解決 Agent 隨機性與穩定性的中間層技術,缺乏確定性驗證的 AI 應用將面臨嚴峻的合規與信任危機,市場將加速淘汰那些僅具展示價值卻無法穩定執行的產品。

延伸閱讀

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。