本週 AI 大事:同一天,兩家實驗室把閘門往相反方向調
8 月 7 日,OpenAI 因為可能的網路攻擊能力把 Astra 往後壓,Anthropic 同一天把 Fable 5 的生物閘門鬆開 85%。方向相反,但都是模型商自己說了算。而同一週唯一對企業有法律效力的,是 8 月 2 日生效的歐盟 AI 法第 50 條——它管的不是模型商,是你。

這週真正改變的,不是又多了一個更強的模型,而是「誰在決定 AI 能做什麼」這件事,被攤在同一天的兩則公告裡看得一清二楚。
8 月 7 日,OpenAI 說它把即將發布的 Astra 往後壓,因為評測顯示它可能自己發動網路攻擊。同一天,Anthropic 說它把 Fable 5 的生物安全閘門鬆開,因為擋錯的太多。一邊收緊、一邊放寬,兩邊都是自己說了算,也隨時可以再改一次。
而同一週,唯一對企業有法律效力的那件事,是 8 月 2 日生效的歐盟 AI 法第 50 條——它管的不是模型商,是你。
先看這週擺在桌上的三個訊號。
訊號一|OpenAI 為了「模型會打人」,把自己的旗艦往後壓

OpenAI 在 8 月 7 日公開表示,未發布的 Astra 模型在初步評測中,它「無法排除」其達到 Preparedness Framework 定義的 Critical 網路安全能力等級——白話講,就是這個模型可能自行找出並對「傳統上防護良好的真實系統」發動攻擊。它也說明正在與相關政府機構及「部分 AI 安全組織」合作測試這項能力(TechCrunch 8/7)。
注意措辭:OpenAI 說的是「無法排除」,不是「已確認跨過門檻」,測試仍在進行。它同時澄清 Astra 與先前 Hugging Face 遭入侵的事件無關。
它採取的動作是具體的:暫停內部所有缺乏新管控的 Astra 使用、隔離測試環境、限制網路與工具存取、強化模型權重的保護與加密,並對所有 agentic 應用做全面的風險行為監控(The Register 8/7)。
把它擺回企業現場來看:這份清單其實就是一份 agent 部署的最低安全需求書。差別只在,OpenAI 是對自己的實驗環境做這件事,而你的 agent 正在正式環境跑。
訊號二|同一天,Anthropic 把 Fable 5 的生物閘門鬆開 85%

也是 8 月 7 日,Anthropic 公布它重寫了 Fable 5 生物安全分類器的 constitution 並用新資料重訓,實測結果是生物相關的「降級回退」減少約 85%(Anthropic 8/7)。
它同時預期整體回退(不限生物類)也會跟著下降,分產品面的預估差很多:Claude.ai 約 67%、Cowork 約 55%、Claude Code 約 17%、Claude Platform 約 7%(同上)。要分清楚:85% 是實測,這四個數字是官方預估。這個落差本身就是訊號——愈接近一般對話的介面,原本擋錯得愈兇。
值得抄的是它的機制:被判定為受管制的請求,不是被拒答,而是改由能力較低的 Opus 5 承接。病毒學、毒理學、分子設計等 dual-use 請求仍然會回退——Anthropic 自己的說法是「Fable still falls back to Opus 5 for requests we consider dual-use」,並明講因此它還不適用於專業生物研究與藥物開發。
兩件事並排看,方向完全相反:
| OpenAI / Astra | Anthropic / Fable 5 | |
|---|---|---|
| 日期 | 2026/8/7 | 2026/8/7 |
| 方向 | 收緊 | 放寬 |
| 理由 | 可能具備 Critical 網路攻擊能力 | 誤擋太多(生物類回退實測 −85%) |
| 機制 | 暫停使用、隔離環境、限縮權限、全面監控 | 重寫分類器規則並重訓,改判標準放寬 |
| 誰決定 | 模型商自己 | 模型商自己 |
訊號三|8 月 2 日起,「你在跟 AI 講話」變成法律義務

歐盟 AI 法第 50 條的透明度義務自 2026 年 8 月 2 日起可執行,適用對象是在歐盟市場提供、或其輸出在歐盟境內被使用的 AI 系統的 provider 與 deployer——不是歐盟公司也算(Cooley 8/3)。
四項義務,例外要一起記:
- 直接與人互動的 AI(聊天機器人、語音助理、agent)要讓對方知道自己在跟 AI 互動,除非這件事已經顯而易見。
- 生成或竄改的合成內容要嵌入機器可讀標記並提供偵測機制,有有限的例外(一般編輯、非實質性的修改)。
- 情緒辨識與生物特徵分類的部署者要告知當事人。
- 深偽內容要揭露它是人工生成或竄改的。
第 4 項有個容易抄錯的地方:Cooley 把深偽和「就公共利益事項告知大眾的 AI 生成文字」寫在同一條,而「經過實質人工編輯審查、且有自然人或法人承擔編輯責任就免揭露」這個豁免,只給後者那類文字,不給深偽(以上四項與例外皆見同一份 Cooley 分析)。
罰則是最高 1,500 萬歐元或全球年營業額 3%,取高者;不過對中小企業與新創,AI 法另有取低者的規定。有兩個緩衝:既有生成式系統的標記與偵測義務寬限到 2026 年 12 月 2 日,2026 年 8 月 2 日之前產出的內容不需回溯標記(同上)。
要留意一個常見的誤讀:Digital Omnibus on AI 已於 2026 年 7 月 27 日生效,它把 Annex III 獨立高風險系統的適用日從 8 月 2 日延到 2027 年 12 月 2 日——但這個延期「不及於 AI 法大部分的透明度義務」,第 50 條 8 月 2 日照常上路(K&L Gates 7/31;另見 Lumenova)。如果你的團隊因為「聽說延期了」而把整包合規往後排,排錯了。
落地樣板|把「拒答」改成「降級」,並且量出誤擋率

Anthropic 這次公布的做法,比它放寬了多少更值得抄,因為它把一個做不好的內部治理題變成了可測量的工程題。
拆成三步:第一,護欄的判斷不寫死在提示詞裡,而是獨立的分類器,規則(constitution)可以單獨重寫、單獨重訓。第二,被擋下的請求不是丟一句拒絕,而是路由到能力較低但安全的備援模型,使用者仍拿得到答案。第三,效果用「回退率」量,而且分產品面量——所以它才講得出 Claude.ai、Claude Code 各降多少這種數字,也才知道該修哪一面。
多數企業的 AI 護欄卡在第三步:擋得對不對,只有客訴才知道。而只要沒有數字,護欄就只能一路加嚴,直到沒人想用。
這週,企業可以做的三件事

一、盤點「哪些對外介面在用 AI」,然後補上揭露。 第 50 條的第一項義務門檻最低,也最容易漏——客服機器人、網站上的問答框、外撥語音、產品內的建議功能都算。**本週可做的第一步:**列出所有會被歐盟使用者接觸到的 AI 介面,各標一句「有沒有告知對方這是 AI」。
二、把 agent 的網路與工具權限,當成資安邊界重新看一次。 OpenAI 對 Astra 列的那份管控清單(隔離環境、限縮網路與工具、監控 agentic 行為),是它對「可能會打人的模型」的處置;你的 agent 沒那麼強,但它跑在正式環境。**本週可做的第一步:**進權限最高的那個 agent 的執行環境,實際連一個外部網址,看攔不攔得住。
三、給你的 AI 護欄裝一個回退率儀表板。 抄 Anthropic 的三步:護欄獨立於提示詞、擋下來要有降級路徑而不是死路、按介面分別量誤擋。**本週可做的第一步:**先只做量測——把過去一個月被護欄擋下的請求撈出來,人工抽樣 50 筆,數一數有幾筆其實該放行。
模型商的安全政策是他們的商業判斷,不是你的合規基準;這週該補的,是你自己這一側說得清、量得出、審計得了的那幾件事。