AI 第一次被自家公司標為「網攻能力達臨界」:Astra 跨線,三大廠同週把鑰匙收回去

AI 第一次被自家公司標為「網攻能力達臨界」:Astra 跨線,三大廠同週把鑰匙收回去

2026 年 9 月第一週,OpenAI 宣布 Astra 是第一個達到自家 Preparedness Framework「Critical」網路安全等級的模型;同一週 Google 與 Anthropic 也把最強的資安模型改成審核制發放。這條線一旦跨過,前沿 AI 的發布邏輯就變了。

週二上午九點,台北一家中型軟體公司的資安工程師打開信箱,看到主管轉來一則英文新聞,只加了一句話:「這個要不要看一下?」

新聞講的是一件聽起來很遠的事:OpenAI 說,它即將推出的模型 Astra,是第一個達到自家「Critical」網路安全能力等級的模型。工程師滑了兩下,看到其中一句——這個模型在評測中自己找出了兩個零時差漏洞,還從瀏覽器沙箱逃逸、在強化過的作業系統上串接多個漏洞拿到 root 權限。

他把咖啡放下了。

事件背景

先把時間軸講清楚。

2026 年 9 月 1 日到 2 日之間,OpenAI 發表了「Path to Astra: critical capabilities and frontier safeguards」,確認 Astra(GPT-6 Astra)已達到其 Preparedness Framework 中的 Critical 門檻——這是該公司第一個跨過這條線的模型。依 OpenAI 的定義,Critical 指的是模型能在沒有人類介入下,於許多經過強化的真實關鍵系統中辨識並開發出可運作的零時差漏洞利用程式;或僅給一個高階目標,就能設計並執行針對強化目標的端到端新型攻擊策略。

評測結果被多家媒體引述:Astra 在 ExploitBench(衡量把已知漏洞轉成可運作攻擊程式的基準)上拿到滿分;在另一項針對近期揭露漏洞的評估中,它自行發現了兩個零時差漏洞。安全面的數字則是,它在測試中拒絕了 91.5% 的網路安全類越獄請求,前代 GPT-5.6 Sol 是 59%。

OpenAI 的處置方式是限流:最進階的網路安全能力不會在推出時全面開放,而是先給一批測試者,後續透過名為 Daybreak 的資安聯盟擴大。Daybreak 這個名字對本站讀者不陌生——我們在 OpenAI 推出資安計畫 Daybreak 就寫過它的雛形。

有意思的是,同一週另外兩家也動了。

9 月 2 日,Google 在官方部落格發布 Gemini 3.8 Flash 與 Gemini 3.8 Flash Cyber。後者是資安特化版本,只透過新設的 Fairwind 計畫提供給「受信任的政府機關、關鍵基礎設施營運者與軟體維護者」。Google 說它在 CyberGym 這個業界標準的漏洞偵測基準上,表現超越前一代 3.5 Flash Cyber,也超越了規模顯著更大的前沿模型。官方文章裡舉了一個具體案例:Google 自家的雲端漏洞研究團隊用 3.8 Flash Cyber,在不到兩小時內找到一個關鍵的基礎性漏洞——而這種漏洞通常要研究好幾個月。

Anthropic 則在 9 月 1 日同時上線 Claude Fable 5.1 與 Claude Mythos 5.1,並發布「與客戶共同開發企業前沿防護(Enterprise Frontier Safeguards)」。9 月 10 日,它又公布了一份威脅情報報告,記錄其威脅情報團隊在八個月期間辨識並中斷了哪些濫用 Claude 的惡意行動。

三家公司,一週之內,同一個方向。

本次重點

  • OpenAI Astra 成為首個被自評為 Critical 網安等級的模型;ExploitBench 滿分、自行發現兩個零時差、越獄拒絕率 91.5%(前代 59%)。
  • 存取限流:Astra 最強的資安能力不隨產品全面開放,改由 Daybreak 聯盟分層發放。
  • Google Gemini 3.8 Flash Cyber(9/2 發布)只透過 Fairwind 計畫給經核可的防守方;官方案例稱兩小時內找到原需數月的關鍵漏洞。
  • Anthropic 9/1 推出 Fable 5.1 與 Mythos 5.1 並揭露企業前沿防護,9/10 發布八個月期間的濫用偵測與中斷報告。
  • 三家的共通點是:能力照發,但鑰匙收回去——從「發布即開放」轉成「審核制發放」。

市場影響分析

對台灣使用者:日常幾乎感受不到。你在 ChatGPT 或 Claude 裡問怎麼寫一個爬蟲,行為跟上週一樣。真正改變的是背景噪音——當自動化漏洞挖掘的成本下降,被掃到的機率就會上升,而你家的路由器、NAS、那台沒人記得的舊伺服器,全都在那個掃描範圍裡。個人層級能做的事很土:把還在跑的裝置韌體更新、把不用的對外埠關掉、重要帳號開啟多因素驗證。土,但有效。

對企業應用:這是最該認真看的一段。三大廠不約而同採審核制,意味著**「誰算是防守方」變成一個要被審核的身分**。如果你的公司做滲透測試、資安顧問或紅隊演練,未來要用到最強的資安模型,可能得先通過供應商的驗證程序——這會影響你的服務能力與報價結構。另一頭,對一般企業的資安團隊,務實的重點只有兩個:修補時效與資產可見度。我看過太多公司的漏洞掃描報告躺在信箱裡兩個月沒人處理,而攻擊側的自動化速度正在以月為單位進步。這個落差是實質風險,不是理論風險。

對開發者:兩件事要記住。第一,你拿到的 API 版本跟評測報告裡的版本不是同一個東西——行銷說「Astra 能挖零時差」,但你的 API key 打過去的那個模型,能力是被限制過的。做技術選型時別把發表會的數字當成規格書。第二,如果你在做資安工具,「能不能取得前沿模型的資安權限」會變成產品的競爭壁壘之一,這是新的供應鏈依賴,值得提早規劃備案。

未來發展趨勢

我的判斷是三個方向。

其一,分層存取會成為前沿模型的常態,而且不會只停在資安。生物、化學、關鍵基礎設施,只要某個能力被評為高風險,同樣的模式就會複製過去。這對開放社群是壞消息,對監理機關則是求之不得的著力點。

其二,審核制會催生一個新的中間層:誰來認證「這家公司是防守方」?現在是 AI 公司自己認,長期看,這件事會被推給政府或產業聯盟。美國白宮今年八月已經召集四家業者談前沿模型的網安測試框架(我們寫過那場會議的來龍去脈),歐盟的路徑則更早開始(見 GPT-5.5-Cyber 開放給歐盟)。

其三,開源會追上來,而且不會太久。這是過去三年一再重演的模式:前沿閉源模型展示某個能力,十二到十八個月內開源社群做出堪用的版本。上鎖能買到的是時間,不是安全。

TheAI學院 總結與評語

老實說,我對這週的新聞最在意的不是「AI 會不會被拿去攻擊」——那件事已經在發生,不需要新聞提醒。我在意的是敘事的轉變:這是第一次,一家 AI 公司主動在產品發表時說「這個能力我們不敢隨便給」。

過去兩年,產業界對 AI 資安的標準說法是「雙面刃」,聽起來很中立,實際上是一句什麼都沒承諾的話。這週三家公司用行動把話說死了:能力照做,但發放方式改變。這是一個產業從「我們只是做工具」往「我們要為分發負責」移動的訊號。

對台灣讀者,我給三個具體建議。

第一,別把這當國際新聞看完就算。去查一下你公司對外服務的資產清單多久沒更新了。自動化漏洞挖掘最先吃掉的,就是那些沒人記得的資產。

第二,把修補時效當成 KPI。不是「我們有做漏洞掃描」,而是「高風險漏洞從發現到修補平均幾天」。這個數字如果還是兩位數,攻擊側的自動化速度已經在你前面了。

第三,如果你在資安產業,現在就去了解 Daybreak 與 Fairwind 的申請條件。當最強的工具改成審核制發放,越早排進隊伍,未來的服務能力差距就越大。

想理解 AI 攻防兩端現在各自的工具長什麼樣,可以看站上的 AI 隱私與安全分類,也可以從我們整理的任務情境頁找到對應的實作起點。

評語:真正的分水嶺不是 AI 學會了駭客技能,而是做 AI 的人第一次公開承認「這把鑰匙不能隨便給」。上鎖買到的是時間——台灣企業該做的,是把這段時間拿去補資產盤點與修補時效,而不是拿去觀望。

資料來源

本文依公開資訊整理,數據以各公司官方公告為準。文中所引評測分數均為廠商自評或自行引用之基準成績,非獨立第三方驗證。

常見問題

什麼是 Preparedness Framework 的「Critical」等級?

那是 OpenAI 自訂的能力分級。依其定義,模型若能在沒有人類介入的情況下,於許多經過強化的真實關鍵系統中辨識並開發出可運作的各級零時差漏洞利用程式,或僅憑一個高階目標就能設計並執行針對強化目標的端到端新型攻擊策略,就算跨過 Critical 門檻。要注意這是廠商自評的框架,不是政府或國際標準。

Astra 已經可以用了嗎?

OpenAI 表示會「很快」推出,但最進階的網路安全能力不會全面開放,而是限定給其資安聯盟 Daybreak 的一批對象。換句話說,一般開發者拿到的版本,跟評測報告裡那個能自己挖出零時差的版本並不相同。

這件事對台灣企業有什麼直接影響?

短期內最現實的影響是攻擊側的成本下降。就算前沿模型上鎖,開源模型與微調技術仍在追趕,過去需要資深滲透測試人員才做得到的漏洞利用開發,門檻正在往下掉。務實的作法是把修補時效(patch SLA)從「月」壓到「週」,並確認對外服務的資產清單是完整的。

「上鎖」真的擋得住濫用嗎?

只能拖延,不能根除。審核制提高了取得成本,也讓濫用行為留下可追查的紀錄,這對防守方是有價值的;但它擋不住有國家資源的對手,也擋不住開源社群把能力複製出來。把它理解成「延長防守方的準備時間」比較準確。

資料來源:TheAI學院編輯團隊原創