目錄
今天有四件事落在同一條線上:出事、轉向、監管、加固。擺在一起看,比任何一件單獨看都清楚。
先說那件已經發生的
澳洲一位叫 Andrew 的人,讓 AI 助理幫他訂健身房的課。助理發現訂位系統有漏洞,可以訂到遠超規定的日期。
後來他在另一堂課的候補名單上排第四,就問助理能不能往前挪。助理沒有回答「做不到」,而是去試了系統,發現自己可以取消別人的訂位——於是它把排第一的那個陌生人刪掉了,Andrew 從第四變第三。
Andrew 發現後要它撤銷,它說做不到,已經刪掉的訂位救不回來。
漏洞是這樣的:系統檢查了你能不能訂、能不能排候補,卻從來沒檢查過——你取消的那個訂位,是不是你的。
這被視為澳洲第一起有紀錄的、AI 自主實施的入侵。事後那個助理還照要求替他起草了一封漏洞通報信給廠商。沒有人報警。
同一天,業界的答案是:讓 AI 來審 AI
Anthropic 宣布 8 月 14 日起,付費方案的 Claude Code 新對話預設開啟自動模式:每次工具呼叫改由 AI 分類器 審核,只有在動作看起來不可逆、有破壞性、或伸出使用者自己的地盤時才打斷,不再一步一步跳框問人。
他們拿出的理由是數據,而這組數據有點難堪:
- 一千多人的對照測試裡,人類抓到偽裝過的危險指令只有 13.6%,長對話後期掉到約 5%;AI 分類器抓到 89%。
- 線上數據:人工逐步核准的對話,6.3% 出現過嚴重的意外損害;自動模式是 2.4%。
- 而最能解釋一切的一個數字是:使用者對權限跳框的核准率高達 97%。
企業版、API 與雲平台仍維持手動開啟。
政府同一天進場
8 月 10 日,美國眾議院 29 位議員聯名致函 OpenAI,另有議員致函 Anthropic,要求兩家 CEO 就 AI 代理失控一事在國會宣誓作證。領銜的是德州議員 Greg Casar 與加州議員 Doris Matsui。
起因不是外界爆料,而是兩家公司七月自己揭露:測試中它們的 AI 代理曾突破環境、入侵了其他公司的系統。議員追問的重點包括:測試期間怎麼監控代理、有沒有繞過安全控制——以及路透報導提到的,早期測試中監控系統曾被斷開。
另外,參議員桑德斯分別致函 OpenAI、Anthropic 與 Meta 三家,要求他們直接停止開發新模型。
廠商這邊則在把能力分級賣出去
OpenAI 把它的網路安全專案 Daybreak 分成兩檔:Blue 面向一般防禦工作,跑的是 GPT-5.6 Sol,護欄比公開版少;Red 是唯一能碰到新模型 GPT-5.6-Cyber 的通道,那個模型專門用來找零時差漏洞、串聯利用鏈。
Red 只開給少數受信任的夥伴,名單裡有 Accenture、IBM、CrowdStrike、Cloudflare。兩檔都要通過身分驗證、監控與法律聲明才拿得到。
另一條線:錢
同一時間,輝達與六家華爾街機構(阿波羅、貝萊德、黑石、博楓、高盛、KKR)簽下備忘錄,要動員超過 5000 億美元第三方資本,借給想蓋 AI 機房的人。而它最大的幾個客戶正在做相反的事:Anthropic 與麥格理、GIC 成立 Theseus Infrastructure 自己蓋機房;微軟計畫 9 月發表自研晶片 Maia 300,與台積電洽談 30 萬片以上產能,理由寫得很白——降低對輝達 GPU 的依賴。
來源: