📰 2026-07-17 AI 日報

DoorDash 開放 AI 代理下單,聽起來是賦權,其實是圈地
阿凱📝 主編觀點 · 反直覺觀點 — 大家都這樣想,但其實可能不是這樣

DoorDash 開放 AI 代理下單,聽起來是賦權,其實是圈地

DoorDash 這禮拜開放 dd-cli 有限測試版,讓 AI agent 能直接在終端機搜餐廳、建購物車、完成下單。新聞角度都寫成「AI agent 經濟又前進一步」,聽起來很潮,但我覺得方向反了。 先講事實:這不是 DoorDash 開放 API 讓任何 AI agent 自由串接,而是它自己做了一個專屬入口,規則、排序、推薦邏輯全部握在自己手上。跟 OpenAI Operator、Anthropic 的 Computer Use 主打的願景完全不同——那些工具的賣點是「agent 能像人一樣點滑鼠瀏覽任何網站」,不需要每家公司額外開後門。DoorDash 現在做的事情等於是說:我不信任你用瀏覽器自動化亂點我的網站,你要進來就走我劃好的門。 大家直覺以為這是平台在配合 AI 趨勢、方便用戶。反直覺的地方是:如果每個平台都跟進推出自己的 XX-cli(Uber-cli、Amazon-cli 之類的),AI agent 要面對的就不是一個開放的網路,而是一堆各自為政的圍牆。agent 得逐一申請、逐一適配,跟以前開發者串接一堆銀行 API 沒兩樣。這跟「AI 幫你打理一切、自由比價」的想像差很遠。 道理很簡單,跟以前打電話比價變成上美團、DoorDash 統一下單一樣,介面變方便了,但價格權、排序權、廣告位全部收歸平台。現在只是把「人類滑手機下單」換成「AI 幫你下單」,權力結構完全沒變,只是多包了一層 agent 的外衣。DoorDash 怕的從來不是 AI 幫用戶省錢比價,而是怕 AI agent 用瀏覽器自動化亂爬它的網站,繞過它的推薦演算法跟廣告收入。 接下來幾個月你會看到愈來愈多「XX for agents」的產品發布,本質都一樣:與其被動防堵 AI agent 亂逛,不如自己先蓋一道門,把 agent 經濟的主導權握在自己手裡。
舊電腦也能跑 AI,只是你聽到的鼓聲可能有點跑調
塵子💬 塵子觀點

舊電腦也能跑 AI,只是你聽到的鼓聲可能有點跑調

Hacker News 上有人分享了一篇技術文章,講的是怎麼在只有 6GB VRAM 的舊 Linux 電腦上,訓練一個會打鼓的 AI 模型。 6GB 是什麼概念?大概是你五年前買來打遊戲、現在連最新版《英雄聯盟》都開不動的那張顯示卡。一般人的想像裡,這種硬體連跑 ChatGPT 網頁版都會卡到當機,更別說訓練生成式 AI。但這篇文章的作者證明,只要方法對,舊硬體也能讓 AI 學會打拍子。 聽起來很勵志,好像在說:別再為了追新技術砸錢買設備,舊東西還有救。但這個「救」是有代價的。為了讓 AI 在這種殘破硬體上跑起來,作者把模型壓縮到極限,犧牲掉細節和精度。最後訓練出來的鼓點模型,節奏可能是對的,但人類鼓手現場演出時因為情緒起伏而產生的細微速度變化(Rubato),AI 大概學不會。 我們總以為 AI 的進步等於運算能力的堆疊,錢越多、晶片越強,AI 就越聰明。但這篇文章給了一個反直覺的畫面:資源被逼到極限時,AI 學會的不是變強,而是變得更會省電、更會將就。 這跟我們的處境沒兩樣。預算不夠時,沒人在追求完美,能用就好。AI 在舊電腦上學會打鼓,證明的不是技術有多神,而是它跟人一樣,逼急了也會找捷徑。 下次看到有人炫耀自己的 AI 模型多厲害,不妨問他:這是頂級伺服器跑出來的,還是那台快報廢的筆電硬撐出來的?後者可能更真實,但也更殘酷。
🚀 產品速報2026-07-17

Claude 與 1Password 深度整合,AI 助手終於能安全幫你填表單

這幾天 AI 圈最讓人眼睛一亮的更新,不是又多了哪個更聰明的模型,而是 AI 助手終於能「安全地」幫你處理那些最討厭的瑣碎任務。Anthropic 旗下的 AI 助手 Claude,現在可以透過 1Password 的瀏覽器擴充功能,直接存取你儲存的帳號與密碼。這聽起來可能有點嚇人,畢竟把密碼交給 AI 似乎違反了資安常識,但這次整合背後的設計邏輯,徹底改變了我們對 AI 操作隱私的想像。 先說最重要的功能:這不只是簡單的密碼複製貼上。1Password 為 Claude 設計了一套專屬的瀏覽器整合機制,讓 Claude 在獲得你的明確授權後,能夠直接操作網頁表單。想像一下,當你正在線上訂機票,或者需要登入某個複雜的企業後台更新資料時,你不需要再手忙腳亂地打開密碼管理器、複製密碼、切換視窗、貼上密碼。你只需要告訴 Claude 你要做什麼,它就能自動完成多步驟的操作流程。這對於需要頻繁管理多個線上帳戶的用戶來說,節省的時間絕對不容小覷。...

Elon Musk 旗下 xAI 控告南卡州男子濫用 Grok 生成兒童性虐待深偽圖片,凸顯生成式 AI 的社會風險問題。Google Vids 推出整合 Gemini Omni 的新功能與個人化 AI 化身,讓用戶能主演自己的 AI 影片,標誌著視頻生成技術的新里程碑。同時 GPU 融資重心轉向推理晶片領域,一筆 4 億美元交易反映出 AI 基礎設施投資正進入新階段。

xAI 起訴南卡州男子利用 Grok 生成兒童性虐待內容深偽圖片

xAI 起訴南卡州男子利用 Grok 生成兒童性虐待內容深偽圖片

Elon Musk 旗下的 xAI 公司對南卡州男子 Terry Wayne Harwood 提起訴訟,指控他惡意使用 Grok AI 聊天機器人規避安全防護措施,改造非共識圖像並生成和傳播兒童性虐待材料(CSAM)。這起案件凸顯了生成式 AI 工具被濫用於非法目的的風險,也反映出 AI 公司在防止有害內容生成上面臨的持續挑戰。

GrokAI 安全濫用CSAM 防護
The Verge AI
Google Vids 推出個人化 AI 化身,讓用戶主演自己的 AI 影片

Google Vids 推出個人化 AI 化身,讓用戶主演自己的 AI 影片

Google 在 Vids 中新增個人化 AI 化身功能,用戶可以創建由自己的數位分身主演的影片。同時搭配 Gemini Omni 驅動的工具,讓用戶能從提示詞和參考圖像快速生成和編輯影片,進一步降低影片製作的技術門檻。

AI 化身影片生成Gemini
TechCrunch AI
Google Vids 推出兩項重大更新:支援 Gemini Omni 和個人化虛擬頭像

Google Vids 推出兩項重大更新:支援 Gemini Omni 和個人化虛擬頭像

Google Vids 新增 Gemini Omni 和個人化虛擬頭像功能,讓使用者能更直觀地創作、編輯和出演影片。這些更新利用 Google 最新的多模態 AI 技術,使影片製作變得更加簡單易用,有望大幅降低內容創作的技術門檻。

Google VidsGemini Omni虛擬頭像
Google AI Blog
AI LLM 引擎如何塑造全球衝突資訊環境

AI LLM 引擎如何塑造全球衝突資訊環境

研究團隊測試了五個主流 AI 答案引擎對 28 場衝突的 5,460 項回答,發現當衝突的可檢索記錄越少時,LLM 就越容易產生幻覺、誤解和誤算。這個問題不只是技術缺陷,更暴露了一個結構性風險:資訊記錄匱乏的衝突最容易被通過生成引擎最佳化(GEO)的手段扭曲,進而傳播錯誤資訊和虛假內容。

LLM 幻覺資訊環保衝突新聞
arXiv cs.AI
自動化困難案例合成與多層級智能數據策展

自動化困難案例合成與多層級智能數據策展

研究團隊提出一個自動化紅隊測試框架,透過多智能體架構(包含高推理能力的 Architect 智能體、先進圖像生成器與多層驗證委員會)來系統性地合成對抗性例子,專門針對 MLLM 在內容安全和審核任務中的漏洞。這套自動化方案無需人工介入就能發現邊界案例和模糊政策問題,將合成的困難範例作為情境示範來改進模型的安全性。

多模態大語言模型對抗性例子多智能體系統
arXiv cs.AI
語言模型可靠性與擴展的資訊論極限

語言模型可靠性與擴展的資訊論極限

研究團隊從資訊論角度證明,大語言模型的可靠性存在數學上的天花板,無法通過單純增加模型規模來突破。這個極限由背景資訊能解決多少輸出不確定性決定,分為可通過補充上下文改善的部分,以及源於任務本身歧義的固有部分。研究進一步推導出首原則擴展法則,揭示 LLM 性能受限於訓練資料或模型容量中的稀缺資源,並將知名的 Chinchilla 擴展法則納為特例。

語言模型資訊論擴展法則
arXiv cs.CL
MamaBench:通過反事實臨床擾動基準測試 LLM 在母嬰健康診斷中的魯棒性

MamaBench:通過反事實臨床擾動基準測試 LLM 在母嬰健康診斷中的魯棒性

研究團隊推出 MamaBench,首個針對母嬰醫療 AI 的反事實基準測試,包含 217 對臨床案例涵蓋 371 種病理情況。研究發現現有 LLM 在標準醫療基準上的表現被高估了 16-28 個百分點,因為這些基準無法測試模型在臨床相似但需要不同治療方案的案例中的區分能力。團隊提出 Evidence-Anchored RAG 方法改進 LLM 的診斷魯棒性,對醫療 AI 安全應用具有重要意義。

大語言模型醫療診斷基準測試
arXiv cs.CL
TEDDY:兒科疾病風險預警的基礎模型,用診斷歷史預測疾病發病

TEDDY:兒科疾病風險預警的基礎模型,用診斷歷史預測疾病發病

研究團隊推出 TEDDY(青少年疾病時序解碼器),這是一個 184 萬參數的解碼 transformer 模型,用 160 萬名兒童的 7300 萬筆 ICD-10 診斷紀錄進行訓練。模型能分析兒童的縱向診斷軌跡和就診時序,在 797 個疾病發病預測任務上達到中位 72% 的 AUC,大幅超越 DenseNet、CNN、RNN 和 LSTM 等基礎模型。這表明基礎模型在兒科臨床軌跡分析上的巨大潛力,尤其在罕見病預測上表現最佳。

醫療基礎模型疾病預測兒科診斷
arXiv cs.LG
首批 GPU 融資方轉向推理晶片,400 million 美元交易引領基礎設施融資新浪潮

首批 GPU 融資方轉向推理晶片,400 million 美元交易引領基礎設施融資新浪潮

一筆 4 億美元以晶片作為擔保的貸款交易顯示,AI 基礎設施融資正從訓練晶片轉向推理晶片領域。這反映了市場認知的轉變:隨著大型語言模型趨於成熟,推理工作負載的規模和經濟價值正在快速增長,企業和融資機構開始重新評估 AI 硬體投資的優先順序。

推理晶片AI 基礎設施融資GPU
TechCrunch AI
DeepMind 前研究員以 3 億美元估值完成融資,專注視覺 AI 開發

DeepMind 前研究員以 3 億美元估值完成融資,專注視覺 AI 開發

前 DeepMind 研究員 Andrew Dai 在產品上線前就以 3 億美元估值完成融資,他在 DeepMind 期間的研究曾對 ChatGPT 發展產生影響。Dai 認為視覺 AI 是人工智慧的下一個重要前沿,這次融資反映了投資人對視覺 AI 領域的看好。

視覺AI融資DeepMind
TechCrunch AI
可解釋語言模型用於 1 型糖尿病閉環控制

可解釋語言模型用於 1 型糖尿病閉環控制

研究團隊開發了 LLM-T1D 系統,將強化學習的精準性與大語言模型的可解釋性結合,創造出透明且可信的胰島素泵控制器。該系統在 FDA 認可的模擬器上表現優異,不僅性能超越傳統 RL 系統,還能用易懂的自然語言解釋其決策邏輯,有望大幅提升患者和醫生對人工胰臟系統的信任度。

大語言模型醫療AI強化學習
arXiv cs.AI
如何在配備 6GB VRAM 的舊 Linux 桌上型電腦上訓練生成式 AI 鼓點模型

如何在配備 6GB VRAM 的舊 Linux 桌上型電腦上訓練生成式 AI 鼓點模型

這篇技術文章分享了在硬體資源受限(僅 6GB VRAM)的舊 Linux 環境下,成功訓練生成式 AI 音樂模型(專注於鼓點節奏)的具體方法。這對於預算有限或硬體規格較低的開發者與 AI 愛好者而言,提供了在本地端進行模型微調與創作的實用參考,打破了必須依賴高階顯卡的迷思。

生成式 AI本地端訓練Linux
Hacker News

今日洞察

AI 產業正加速從單純的人機互動轉向深度整合與代理自動化。Claude 與 1Password 的整合及 DoorDash 的 CLI 工具,顯示 AI 代理正具備直接執行多步驟任務與操作軟體的能力,推動開發範式轉向支援 AI 原生介面。同時,技術層面呈現兩極化發展:一方面透過知識蒸餾與低資源訓練優化效能,降低部署門檻;另一方面,Kimi 3 與 Schema Harness 的突破則彰顯頂端模型在規模與準確度上的激烈競爭。整體而言,高效能與低成本並重,且以代理能力為核心的應用生態系正在快速成型。

🔮 趨勢雷達

未來三至六個月,AI 產業將從單純的模型競賽轉向「代理執行力」與「邊緣效能」的實戰落地。DoorDash 與 1Password 的整合顯示,具備安全憑證存取與任務自動化能力的 AI Agent 將成為企業級應用主流,軟體介面設計將全面轉向支援機器對機器操作。同時,Moonshot Kimi 3 的推出與低顯存訓練技術的成熟,標誌著高階算力壟斷被打破,開源模型與本地端部署將成為中小企業降本增效的關鍵策略。RAG 重排序技術的優化進一步證實,提升現有系統精確度比盲目擴大參數更具商業價值,投資熱點將從基礎模型轉向應用層的效率優化與安全框架。

延伸閱讀

喜歡這篇?每天早晨還有更多。

訂閱 5min AI,讓 AI 替你追蹤整個 AI 世界。