AI最尷尬的短板,中國科學院出手了
https://www.qbitai.com/2026/07/461160.html📌 【中國科學院研究】解決 AI 社交尷尬:Zing 系統將「社會心智」轉化為可訓練工程
TL;DR:中國科學院推出 Zing 系統,透過 SoMBench 評測與 FLARE 訓練機制,解決 LLM 缺乏社會心智的問題。
面對 GPT-5.5 或 DeepSeek-V4-Pro 等強大的語言與工具智慧,AI 在處理專業論文或程式碼時表現卓越,但在面對家庭聚餐、團隊會議或醫患對話等社交場景時,往往表現得生硬且不合時宜。這並非知識不足,而是缺乏「社會心智」(Social Intelligence),導致 AI 從「任務執行」轉向「社會協作」時面臨困境。
🤔 社會心智是 AI 的「無人區」
為了精準診斷 AI 的社交短板,中國科學院計算技術研究所「知境」團隊建立了 SoMBench 評測體系。
🧩 SoMBench:為 AI 做「社會心智 CT」
- 精細化維度:將「懂不懂人」拆解為 3 大一級維度、17 個二級維度、71 項細粒度任務。
- 能力地圖:包含 3481 道由人類專家評審的例項,涵蓋基礎信念推斷、高階情緒理解、社會規範與關係建模。
- 診斷功能:不僅提供分數,還能透過選項擾動與捷徑檢測,精準定位模型是「推理鏈斷裂」還是「靠表面模式蒙對」。
- 測試結果:在 20 個頂級大模型測試中,最強模型正確率僅 72.08%,無一達到 90% 分數。
🧩 Zing 訓練系統:讓目標隨能力一起進化
針對社會心智難以建模的問題,知境團隊開發了 Zing 系統,這是一套具備自我進化能力的訓練架構,而非單純堆疊算力的做法。
📊 三大核心技術密碼
-
FLARE 資料飛輪:針對弱點合成新題 當模型在 SoMBench 暴露短板時,FLARE 會定位該認知維度,並合成語義與推理路徑完全不同、但瞄準同一能力缺陷的新樣本。這確保了模型是在「練新題」而非重複做同一張卷子。
-
兩階段訓練:從通識到專精
- 第一階段(通用打底):利用多教師蒸餾構建高質量資料,並採用 Mixed-Reward GRPO 強化學習框架,根據任務類型與推理質量動態組合獎勵。
- 第二階段(專項強化):針對情緒理解、意圖推斷等薄弱環節,透過監督微調(SFT)注入領域知識,並用困難樣本持續校準,避免丟失通用推理能力。
-
OPD 線上蒸餾:邊學新招,邊不忘老本 為瞭解決強化學習中「學新忘舊」的風險,OPD 在線上軌跡引入教師模型的 token 級分佈約束。GRPO 負責鼓勵探索,OPD 則負責守住有效推理模式的邊界。
🎯 實務啟示
對於 AI 工程師而言,Zing 的研究方向提示我們:當模型進入效能高原期時,單純增加參數規模可能不足以解決複雜行為問題。將「社會規範」與「情緒理解」轉化為可量化、可自動化合成訓練樣本的工程流程,將是實現具身智能與高可靠性 AI 協作的關鍵。
🔗 來源
- 標題:AI最尷尬的短板,中國科學院出手了
- 作者/機構:思邈 @ 量子位
- 連結:https://www.qbitai.com/2026/07/461160.html
#AI #SocialIntelligence #LLM #MachineLearning #Zing #SoMBench #ArtificialIntelligence #DeepLearning #ReinforcementLearning #ChinaScienceAcademy
由 tencent/hy3:free 自動生成