How AI guardrails are impeding the work of offensive cybersecurity researchers
https://techcrunch.com/2026/07/23/how-ai-guardrails-are-impeding-the-work-of-offensive-cybersecurity-researchers/這是一篇針對產業新聞進行轉寫的技術部落格文章。
📌 【產業觀察】AI 安全護欄(Guardrails)正成為資安研究員的阻礙
TL;DR:AI 巨頭為防範駭客設定的嚴格護欄,正讓合法資安研究與防禦工作變得更困難。
🎣 當「安全」變成一種門檻,防禦者也難以發揮
為了防止惡意駭客利用大型語言模型(LLM)發動網路攻擊,AI 巨頭們開發了各種審核機制與嚴格的護欄(guardrails)。然而,這些旨在限制風險的機制,現在卻正在阻礙合法的網路防禦者,以及致力於攻擊性資安研究(offensive cybersecurity research)的專業人員。
🤔 政府介入與模型限制的拉鋸戰
今年 6 月,美國政府對 Anthropic 備受關注的 AI 模型 Mythos 與 Fable 實施了出口管制。這項舉措部分原因源於一份報告,該報告聲稱使用者可以繞過這些模型原有的護欄,進而利用它們來構建並執行惡意的網路攻擊。
儘管此舉是否純粹是出於對「越獄」(jailbreak)風險的擔憂尚有討論空間,但事實是,Anthropic 先前多次將 Mythos 標榜為一種「末日級網路機器」,僅能提供給經過嚴格審核的使用者,且必須在嚴密的護欄下使用。
📊 受限的存取許可權與現況
目前相關模型的存取狀態如下:
- Fable 5:已於 7 月 1 日恢復對一般大眾開放。
- Mythos 5:目前僅限經過審核的美國組織,且須配合政府的審核程式才能使用。
🧩 大廠掌握著資安定義的「生殺大權」
這種門檻並不侷限於 Mythos。Anthropic 與 OpenAI 都針對資安研究員提供了申請機制,通過審核後,才能使用限制較少的模型。例如 OpenAI 的「Trusted Access for Cyber」計畫,以及 Anthropic 的「Cyber Verification Program」。
這種做法已遭到廣泛批評,特別是對於那些工作目標是「在犯罪分子之前,找出系統未知漏洞並設計攻擊方式」的研究員來說。知名資安研究員 Mark Dowd 在近期的一次資安播客中表示:「由這些隨機的大型企業來對資安議題做出『什麼是安全、什麼不是安全』的任意決定,這讓我感到很不踏實。」
🎯 實務啟示
對於資安研究人員而言,AI 模型的安全性限制(Guardrails)已不再僅僅是技術問題,更演變成一種准入障礙。當模型被過度限制以防止攻擊時,研究人員在模擬攻擊路徑以強化系統防禦的能力,也可能因此受到限制。
🔗 來源
- 標題:How AI guardrails are impeding the work of offensive cybersecurity researchers
- 作者/機構:Lorenzo Franceschi-Bicchierai @ TechCrunch AI
- 連結:https://techcrunch.com/2026/07/23/how-ai-guardrails-are-impeding-the-work-of-offensive-cybersecurity-researchers/
#AI #Cybersecurity #Anthropic #OpenAI #LLM #Guardrails #InfoSec #CyberAttack #TechNews #ZeroDay
由 tencent/hy3:free 自動生成