超越OpenAI、Anthropic!國產AI安全智慧體殺進全球前四、國內第一
https://www.qbitai.com/2026/07/462447.html📌 【深信服 Sangfor AI】超越 OpenAI 與 Anthropic,國產安全智慧體登頂 CyberGym 全球前四
TL;DR:Sangfor AI 採用 Agent Swarm 架構,在 CyberGym 漏洞挑戰中取得 86.3% 成功率,位列全球前四。
在 AI 爭奪戰進入白熱化的今天,當大家都在關注模型參數規模時,安全領域的實戰能力正在拉開差距。近期,深信服(Sangfor)公佈其 AI 安全智慧體 Sangfor AI 在 CyberGym 評測中的最新成績,以純國產大模型底座(GLM-5.2)實現對 OpenAI 與 Anthropic 的成績超越,位列全球前四,並取得國內參評團隊第一的佳績。
🤔 實戰靶場 CyberGym:從靜態測試轉向動態漏洞推演
傳統的安全測試多依賴靜態理論檢測,而 CyberGym 是一個針對程式碼安全大模型的實戰靶場。它不只看理論知識,更著重考核 AI 智慧體在真實工業場景下的能力,包含:
- 自主原始碼分析
- 多階段漏洞推演
- 漏洞復現與 PoC(Proof of Concept)驗證
📊 複雜場景下的穩定表現:成功率達 86.3%
在面對涵蓋 ARVO 與 OSS-Fuzz 的 1507 項漏洞挑戰任務時,Sangfor AI 展現了極高的穩定性:
- 整體成功率:86.3%(成功完成 1301 項任務)
- ARVO 相關任務:87.2% 成功率
- OSS-Fuzz 任務:77.7% 成功率
🧩 Agent Swarm 協同與證據管治:解決長鏈路推理難題
為了處理漏洞挖掘中複雜的「長鏈路推理」、「多假設探索」與「持續驗證」問題,Sangfor AI 捨棄了單一模型的思考模式,轉而採用「智慧體群體(Agent Swarm)協同作戰」架構,並引入「證據管治」機制,透過四大核心邏輯確保調查過程清晰可信:
- 有界探索:針對不同安全假設開啟獨立、邊界清晰的調查分支,讓多個解釋可以並行推進,避免假設間相互汙染。
- 證據持久化:分支間透過「證據」而非完整對話歷史協同,保留已驗證的觀察與已證偽的路徑,避免重複試錯。
- 動態假設裁決:由協調層根據證據狀態,判斷假設是否成立或需繼續投入,從而有效收窄搜尋空間。
- 對抗式候選評審:當證據支持某個方案時,系統會構造候選輸入並進行「對抗式評審」,挑戰其「崩潰是否可復現」以及「是否對應目標漏洞」,只有通過檢驗的結果才會作為最終結論。
🎯 從 SAST 升級到自主推理的安全 Agent
這項技術正將傳統的靜態應用安全測試(SAST)轉型為具備業務理解能力的 Security Agent。相比傳統規則匹配,新一代 Agent 具備以下價值:
- 突破檢出盲區:除了常見的 SQL 隱碼攻擊與命令執行,還能分析複雜業務邏輯,發現越權訪問與認證繞過等傳統工具難以覆蓋的風險。
- 降低人工成本:自動化完成程式碼理解、跨檔案關聯分析與攻擊路徑推理,大幅解放安全專家。
- 降低誤報率:透過多階段推理與嚴格的證據驗證機制,讓研發人員能聚焦於真正的風險,減少無效整改。
- 加速研發交付:將安全檢測前移至 CI/CD 流水線,實現「程式碼提交即自動審計」。
🔗 來源
- 標題:超越OpenAI、Anthropic!國產AI安全智慧體殺進全球前四、國內第一
- 作者/機構:深信服 @ 量子位
- 連結:https://www.qbitai.com/2026/07/462447.html
#AI #CyberSecurity #AgentSwarm #Sangfor #CyberGym #LLM #VulnerabilityDetection #AppSec #MachineLearning #DeepLearning
原始資料 量子位 · 收集於 2026-07-30
摘要原文
超越OpenAI、Anthropic!國產AI安全智慧體殺進全球前四、國內第一 思邈 2026-07-29 16:13:03 來源: 量子位 AI開始組團“挖漏洞” 允中 發自 凹非寺 量子位 | 公眾號 QbitAI 7月29日訊息, 深信服 公佈其AI安全智慧體Sangfor AI在AI安全評測CyberGym中的最新成績。 據瞭解,在基於國產大模型 GLM-5.2 的固定模型配置下,Sangfor AI面對涵蓋ARVO與OSS-Fuzz的1507項漏洞挑戰任務,成功完成1301項,整體成功率達到 86.3% ,最終躋身 全球前四 、位列 國內參評團隊第一 ,Sangfor AI以純國產底座實現對 OpenAI、Anthropic 兩大海外AI巨頭的成績超越。 CyberGym是目前全球含金量較高的程式碼安全大模型實戰靶場,區別於傳統靜態理論測試,整套評測體系完全貼合工業真實場景,以海量開源軟體歷史高危漏洞為考題,重點考核AI智慧體自主原始碼分析、多階段漏洞推演、漏洞復現與PoC驗證全鏈路能力,評測標準嚴苛,結果具備較強行業參考價值。 本次測試中,Sangfor AI細分場景表現均衡,ARVO相關任務成功率87.2%,OSS-Fuzz任務成功率77.7%,驗證了國產大模型在複雜程式碼對抗場景下的穩定實戰能力。 將模型能力轉化為可驗證的安全能力 深信服方面介紹,為解決漏洞挖掘過程中長鏈路推理、多假設探索和持續驗證等問題,Sangfor AI採用“ 智慧體群體(Agent Swarm)協同作戰 ”架構,並引入“證據管治”機制,整套技術框架分為 四大核心執行邏輯 ,確保每一步漏洞調查步驟都清晰可信: 有界探索 :圍繞不同的安全假設分別開啟獨立、邊界清晰的調查分支,讓多個可能的解釋可以並行推進,而不會互相汙染、也不會讓某個未經證實的假設悄悄變成集體共識; 證據持久化 :各調查分支之間通過“證據”而非完整對話歷史來協同——已被驗證的觀察和已被證偽的路徑都會被保留下來,避免同一條錯誤路徑被反覆重新試錯; 動態假設裁決 :一個協調層持續基於不斷演化的證據狀態,判斷哪些假設仍然成立、哪些問題尚待解決、哪裡還值得繼續投入,讓每一輪探索都成為對搜尋空間的有效收窄; 對抗式候選評審 :當證據支援某個具體的觸發方案時,系統才會構造候選輸入並提交“對抗式評審”——評審會同時挑戰“這次崩潰是否可復現”,以及“這次崩潰是否真的對應目標漏洞”,未通過評審的候選會被打回、用於修正下一步探索方向。只有真正經受住檢驗的候選,才會成為系統最終提交的安全結論。 深信服技術團隊將這套機制總結為“ 以假設拓展探索,以證據裁定結論 ”,以此保證AI能夠大範圍排查潛在風險的同時,更能通過多層校驗,壓低誤判機率。 創新成果如何真正走進企業研發流程 深信服表示,相關技術已逐步應用於企業程式碼安全場景,推動傳統靜態應用安全測試(SAST)向 具備自主推理和業務理解能力的安全Agent 升級。 相比傳統規則匹配方式,新一代安全Agent不僅能夠識別SQL隱碼攻擊、命令執行等常見漏洞,還可分析複雜業務邏輯,發現越權訪問、認證繞過等傳統工具難以覆蓋的安全風險。 據介紹,相關能力已開始賦能深信服產品體系,將為企業級使用者帶來切實的價值質變: 提升漏洞檢出能力 :有效攻克傳統SAST盲區,全面識別業務邏輯漏洞、越權與認證繞過,大幅拓寬程式碼安全覆蓋率。 降低人工審計成本 :憑藉AI自動化完成程式碼理解、跨檔案關聯分析、攻擊路徑推理與風險驗證,大幅解放安全專家的繁重人工勞動力。 減少誤報、提升效率 :依靠多階段推理與嚴苛的證據驗證機制壓降誤報率,使研發人員能夠聚焦真正亟需修復的風險,告別無效整改。 縮短研發交付週期 :將安全檢測前移至研發編寫與CI/CD流水線中,實現“程式碼提交即自動審計”,大幅降低後期返工成本,加速業務高效上線。 提升企業整體安全能力 :幫助企業在更早階段築牢防線,遏制因資料洩露、業務中斷帶來的合規與經濟風險。 對於廣大企業使用者而言,AI安全Agent的核心價值遠不止於“發現更多漏洞”,更在於以極高準確率、極低人工成本與極快響應速度,實現研發效率與程式碼安全的同步跨越。 深信服方面表示,後續將持續深耕大模型安全技術創新,不斷迭代安全Agent能力,把國際評測驗證的前沿技術轉化為企業可落地的安全能力,持續踐行“ 讓每個使用者的數智化更簡單、更安全 ”的承諾。 CyberGym榜單地址:https://www.cybergym.io/cybergym/ 版權所有,未經授權
由 tencent/hy3:free 自動生成