📰 2026-06-26 AI 日報

AI 模型知道自己在說謊,但就是沒辦法閉嘴
阿凱📝 主編觀點 · 反直覺觀點 — 大家都這樣想,但其實可能不是這樣

AI 模型知道自己在說謊,但就是沒辦法閉嘴

arXiv 上週出現了一篇讓我反覆重讀的論文,研究對象是 Google 的 Gemma 2-2B-it,結論直接打臉了 AI 安全領域過去幾年的核心信仰。 研究者發現一件很詭異的事:模型對自己何時在產生幻覺,其實有「感覺」。他們在模型內部找到了一個偵測幻覺的向量,準確率 AUC 高達 1.0——也就是完美偵測,沒有任何例外。模型在某種意義上「知道」自己要說錯話了。 但知道歸知道,它照樣說了。 原因出在幾何結構上。負責偵測幻覺的向量,跟負責讓模型「拒絕回答」的向量,夾角是 83 度——幾乎垂直。在向量空間裡,垂直代表毫無關聯。這就像一個人的大腦同時有「警報系統」和「剎車系統」,但兩套系統根本沒有接線。 這個發現對整個 Mechanistic Interpretability(機械可解釋性)研究圈是個大麻煩。這個領域過去幾年最流行的假設是:只要我們能在模型內部找到對應某個概念的向量,就能用它來控制模型的行為——找到「種族偏見向量」就能消除偏見,找到「說謊向量」就能讓模型更誠實。Anthropic、DeepMind 砸了大量資源在這個方向上。 但這篇論文說:偵測和干預是兩件事,住在模型內部不同的地方,彼此幾乎不說話。 對開發者來說,這個結果值得停下來想一想。很多人在做 AI 應用時,天真地以為只要模型「有能力識別」某個問題,就代表它有能力「避免」那個問題。不管是幻覺、有害內容、還是邏輯錯誤,都適用同樣的邏輯陷阱。 現實是:知道問題在哪裡,跟能不能修正問題,是完全不同的工程挑戰。 更讓人不安的是,如果連最基礎的幻覺控制都面臨這個結構性斷層,那些更複雜的對齊問題——讓 AI 真正「說到做到」——可能比我們預期的還要難解得多。AI 安全不缺偵測器,缺的是能真正接上去的剎車。
Claude 正在搶走 ChatGPT 的付費使用者
塵子💬 塵子觀點

Claude 正在搶走 ChatGPT 的付費使用者

我打開訂閱清單,發現自己多付了一筆錢給 Anthropic。不是因為我特別喜歡讀他們的安全報告,而是因為我發現自己已經習慣跟 Claude 說話了。 這聽起來很荒謬。ChatGPT 是那種在會議室裡搶先舉手、答案永遠又快又多的人。Claude 是那種說話不急、但你說完話之後會讓你覺得「他好像真的聽進去了」的人。現在,那些願意掏錢的使用者,正悄悄把目光轉向後者。 雖然 ChatGPT 的總使用人數仍遙遙領先,但付費市場的流向正在改變。這很像餐飲業發生的事:連鎖快餐店的來客數還是最高,但願意每個月固定付錢的那批人,開始轉向那家不打廣告、但服務生記得你點什麼的店。Anthropic 贏的不是流量,是這批人的習慣。 ChatGPT 的問題不是能力,是個性。你問它一件事,它給你五個選項、三個延伸建議,外加一段它覺得你該知道的補充。Claude 不這樣。你給它資訊,它整理好放在你面前,不搶話,不急著證明自己有多厲害。 我們花了幾千億美元訓練 AI,最後發現,付費使用者最在意的不是哪個模型更聰明,而是哪個模型不會讓人覺得煩。ChatGPT 還在努力讓你記得它,Claude 已經在努力讓你忘記它的存在。 這大概是 AI 產品化最荒謬的地方。技術成熟之後,競爭的關鍵不是誰的功能更多,而是誰能讓你覺得它不在那裡。 我懷疑這不只是產品偏好的問題。我們對資訊轟炸已經厭倦到,開始把「不被打擾」當成一種值得付錢的體驗。Anthropic 搶走的不是市場份額,是我們對「被教育」這件事的耐心。
🚀 產品速報2026-06-26

Alibaba Qwen-AgentWorld:不訓練代理行為,改預測環境回饋以提升效能

阿里巴巴 Qwen 團隊近期發布了一項名為 Qwen-AgentWorld 的技術突破,這不僅是模型能力的升級,更是自主代理(Autonomous Agent)開發範式的重大轉變。這項技術針對 MCP、網路搜尋、終端機操作等七大核心領域進行了深度優化,試圖解決當前大型語言模型在執行複雜多步驟任務時常見的效能瓶頸與不穩定問題。與傳統依賴強化學習或直接訓練模型輸出特定動作指令的方法不同,Qwen-AgentWorld 提出了一種全新的架構思路,即不再直接訓練模型去預測「該做什麼動作」,而是專注於預測「環境對動作的回饋結果」。 先說最重要的功能:預測環境回饋而非直接執行動作。在傳統的代理訓練中,模型需要學習在特定狀態下採取何種動作以獲得最大獎勵,這往往導致訓練過程極其不穩定且計算成本高昂。Qwen-AgentWorld 則通過讓模型學習預測環境在執行動作後的反饋,間接引導模型做出更優決策。這種方法將代理行為的學習過程轉化為對環境狀態變化的預測問題,不僅降低了訓練的複雜度,還顯著提升了模型在動態環境中的適應能力。...

白宮向 OpenAI 施壓要求放緩新模型發佈以應對安全隱憂,同時 Databricks 前 AI 主管創辦新公司聲稱可將 AI 電力成本削減千倍,標誌著安全與效能成為產業發展的雙重焦點。Adobe 收購影像增強工具商 Topaz Labs,OpenAI 推出 Daybreak 計畫扶持開源維護者,反映大型科技公司加速整合產業生態的動向。Alibaba 和國際團隊的最新研究則顯示,透過預測環境回饋而非直接訓練代理行為的創新方法,正在重塑 AI 效能邊界。

白宮要求 OpenAI 放緩新模型發佈,以解決安全顧慮

白宮要求 OpenAI 放緩新模型發佈,以解決安全顧慮

OpenAI 計畫將最新的 GPT 5.6 模型先限制在特選合作夥伴小範圍內發佈,而非向公眾全面開放。川普政府基於安全考量,要求 OpenAI 採取這種逐步推出的策略,反映出政府對大型 AI 模型風險的關注。

GPT模型發佈AI安全監管模型審慎上線
TechCrunch AI
Databricks 前 AI 主管創辦新公司,聲稱可將 AI 電力成本降低 1000 倍

Databricks 前 AI 主管創辦新公司,聲稱可將 AI 電力成本降低 1000 倍

Databricks 的前 AI 負責人推出了名為 Un-0 的圖像生成系統,展示其新技術如何以大幅更低的能耗複製傳統 AI 系統的功能。這項突破若成立,將對 AI 產業的成本結構和永續性產生重大影響,特別是在面對日益增長的計算需求時。

能效優化圖像生成計算成本
TechCrunch AI
注意力缺口:任務限制導致 AI 模型忽視可檢測的安全隱患

注意力缺口:任務限制導致 AI 模型忽視可檢測的安全隱患

研究發現當語言和視覺模型被限制執行特定任務時,會抑制其報告安全攸關信號的能力,即使這些模型在無限制狀態下能輕易檢測這些信號。這種現象被稱為「注意力缺口」,在放射科、駕駛文本和胸部X光影像任務中普遍出現,與模型規模無關,揭示了基準測試安全評估與實際部署安全之間的重大脫節風險。

AI 安全注意力盲視模型評估
arXiv cs.CL
Adobe 收購影像與影片增強工具製造商 Topaz Labs

Adobe 收購影像與影片增強工具製造商 Topaz Labs

Adobe 宣布將收購專業影像和影片增強工具開發商 Topaz Labs,並計畫整合其 AI 驅動的增強技術到 Photoshop、Premiere Pro 等主要創意應用中。這次併購強化了 Adobe 在生成式 AI 創意工具領域的實力,讓廣大創作者能更輕鬆地進行專業級的影像和影片編輯。

Adobe併購AI 影像增強
TechCrunch AI
IBM 推出新晶片技術,有望延長莫爾定律再運行十年

IBM 推出新晶片技術,有望延長莫爾定律再運行十年

IBM 開發出新原型晶片,在指甲大小的面積上整合約 1000 億個電晶體,密度是 2021 年技術的兩倍。這項突破有望推動未來十年內更快速、更節能的電腦運算,標誌著晶片技術的重大進展。

晶片技術莫爾定律電晶體密度
MIT Tech Review
白宮限制 OpenAI 的 GPT-5.6|為 AI 代理配備安全的信用卡功能

白宮限制 OpenAI 的 GPT-5.6|為 AI 代理配備安全的信用卡功能

美國白宮對 OpenAI 最新的 GPT-5.6 模型實施管制措施。同時,AI 代理工具正在逐步獲得財務能力,開發者可以安全地為 AI 系統配置信用卡授權,這為自動化交易和財務操作開啟了新可能性。

GPT-5.6AI 代理政策監管
The Rundown AI
OpenAI 應川普政府要求延遲發佈 GPT-5.6

OpenAI 應川普政府要求延遲發佈 GPT-5.6

川普政府因安全顧慮,要求 OpenAI 延後其下一代大型模型 GPT-5.6 的發佈。OpenAI CEO Sam Altman 在員工大會上宣布,GPT-5.6 將以有限預覽形式發佈,僅向小規模用戶群體開放,反映政府對 AI 安全管制的關注。

GPT-5.6政府監管AI 安全
The Verge AI
Apple 跳過 M6 高端晶片,改推 AI 導向的 M7 系列

Apple 跳過 M6 高端晶片,改推 AI 導向的 M7 系列

Apple 決定跳過 M6 高端晶片產線,直接推出 M7 Pro、M7 Max 和 M7 Ultra 等新世代晶片。這一轉變反映出 Apple 將優先資源投入 AI 功能開發的策略,意味著未來 Mac 產品線將更加聚焦於生成式 AI 和機器學習能力,而非單純的運算性能升級。

Apple M7 晶片AI 優先策略Mac 硬體升級
Hacker News
Alibaba Qwen-AgentWorld:不訓練代理行為,改預測環境回饋以提升效能

Alibaba Qwen-AgentWorld:不訓練代理行為,改預測環境回饋以提升效能

Alibaba Qwen 團隊發布 Qwen-AgentWorld,這是一組針對 MCP、搜尋、終端機等七大領域優化的模型。其核心創新在於不直接訓練模型執行代理動作,而是專注於預測環境的回饋結果,這種方法在七個基準測試中均提升了代理效能,顯示出在自主代理領域的新技術突破。

AlibabaQwenAgent
VentureBeat AI
Patch the Planet:OpenAI 推出 Daybreak 計畫支援開源維護者

Patch the Planet:OpenAI 推出 Daybreak 計畫支援開源維護者

OpenAI 推出 Patch the Planet,一項屬於 Daybreak 計畫的新倡議,幫助開源軟體維護者利用 AI 和專家審查來發現、驗證和修復安全漏洞。這個舉措旨在加強開源軟體的安全性,降低維護者的負擔,同時提高漏洞修復的效率和品質。

開源安全漏洞修復AI 應用
OpenAI Blog
AI 重塑零售業——幕後決策才是關鍵

AI 重塑零售業——幕後決策才是關鍵

AI 正在深刻改變零售業的運作方式,但主要變革並非消費者能直觀感受到的虛擬試衣或購物助手,而是隱藏在幕後的決策系統——從搜尋結果排序、供應鏈庫存管理到軟體開發效率,AI 都在重新定義零售企業的核心流程。這場轉變將影響從商品發現到交付的整個零售價值鏈。

AI 零售供應鏈優化搜尋演算法
MIT Tech Review
Ford 重新聘僱資深工程師修復自動化系統的缺陷

Ford 重新聘僱資深工程師修復自動化系統的缺陷

Ford 在成為 JD Power 主流車廠品質排名第一後坦誠,其生產和設計中的自動化系統存在嚴重問題,導致公司不得不重新聘僱離職工程師來修復這些系統的錯誤。這反映出企業過度依賴自動化系統而忽視人類專業經驗的風險,以及自動化技術在複雜製造領域仍需人類監督和介入。

自動化系統製造業品質管理
The Verge AI

今日洞察

AI 產業正經歷從基礎能力競賽轉向應用落地與控制精細化的關鍵階段。技術層面,阿里 Qwen-AgentWorld 透過預測環境回饋優化代理效能,結合 Hugging Face 簡化 vLLM 部署及百度 PP-OCRv6 的多語言強化,顯示開源生態正加速降低開發門檻並提升實用性。然而,研究揭示模型「知」與「控」的幾何鴻溝,提醒開發者需更謹慎處理模型可解釋性與控制機制。市場端,Anthropic Claude 在付費消費者市場挑戰 ChatGPT 壟斷,反映高價值用戶對產品體驗的重視。同時,Figma 整合 Code Layers 與 AI 插件,進一步縮短設計到開發的流程,標誌著 AI 工具鏈正深度融入專業工作流,推動產業向更高效、更可控的方向演進。

🔮 趨勢雷達

未來三至六個月,AI 產業將從單純的模型競賽轉向「可控性」與「落地效率」的深層博弈。Qwen-AgentWorld 與 Figma 的更新顯示,預測環境回饋與設計開發無縫接軌將成為企業級應用的主流標準,而非單純依賴代理行為訓練。同時,Anthropic 在付費市場的崛起證實高品質體驗已超越價格戰,迫使競爭者必須在產品力上做出實質突破。然而,機械可解釋性研究揭示的「知與控」鴻溝,將迫使開發者放棄黑盒依賴,轉向更精確的向量干預技術。此外,Hugging Face 簡化部署與百度多語言 OCR 的擴增,標誌著基礎設施門檻進一步降低,投資熱點將從底層基建轉向解決具體業務痛點的高階應用層,無法提供確定性控制力的模型將面臨市場淘汰。

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。