中國NeoLab時刻:EverMind用3篇論文,交出全棧自進化首份答卷
https://www.qbitai.com/2026/08/468555.html📌 【EverMind 技術解析】從任務、腳手架到權重:解構自進化 AI 的全棧技術路徑
TL;DR:EverMind 透過三篇論文,系統性地解決了 Agent 腳手架改寫、技能管理與模型權重自進化的技術難題。
當全球 NeoLab(新一代 AI 實驗室)都在探索如何讓 AI 從「靜態模型」轉變為「持續進化實體」時,中國團隊 EverMind(由盛大集團孵花)透過連續三篇研究論文,針對自進化 AI(Self-Evolving AI)提出了從任務層到模型權重層的完整技術解答。
🤔 為什麼「自進化」是 AI 的終極難題?
目前的 LLM 一旦部署,其能力便會被凍結。要實現「遞迴自我改進」(Recursive Self-Improvement),業界面臨三大關卡:
- 腳手架(Harness)的過擬合:如何讓 Agent 修改執行邏輯而不僅僅是針對特定測試集進行過擬合?
- 技能(Skills)的規模化管理:當技能量爆炸式增長,如何進行精準檢索與品質控制?
- 模型權重(Weights)的訊號分配:在自我蒸餾時,如何避免粗粒度的監督訊號導致學習效率低下?
🧩 HarnessBank:讓 Agent 安全地改寫執行邏輯
為了讓 Agent 能自主診斷失敗並重寫「腳手架」(提示詞、控制邏輯等),EverMind 提出了 HarnessBank 框架。
- 核心設計:將「提出變更」與「歸因變更」分離。語言模型僅負責診斷並提出補丁(Patch),而所有的測量與驗證則交由「確定性的程式碼邏輯」控制,從根本上避免了模型在自我評估時產生的幻覺。
- 裝備基因庫 (HGB):不同於傳統以「任務」為鍵的儲存方式,HGB 以「WHERE × WHY」(改動作用於何處與為何引入)作為語義座標,讓系統學到的是「如何修復病理」而非「如何解這題」,具備強大的抗過擬合能力。
- 實驗結果:在凍結任務 Agent 權重的情況下,該方法在七個基準測試(如 SWE-bench、Omni-MATH)上取得了 5.1% 到 15.4% 的性能提升。
🧩 SkillCorpus:管理 10 萬項技能的數位淘金
技能是 Agent 經驗的載體。EverMind 透過 SkillCorpus 框架,解決了開放技能生態碎片化與品質不一的問題。
- 規模化策展:從約 82.1 萬個原始技能中,透過多維度策略精選出 96,401 個高質量技能。
- 維度控制:從實用性(Utility)、魯棒性(Robustness)與安全性(Safety)三個維度進行質量控制。
- 動態演進:技能庫並非靜態,而是透過 EverOS 根據任務成敗進行強化、複用或修正,形成隨任務不斷進化的資產。
🧩 DASH:精準分配模型訓練的監督訊號
在最底層的模型權重迭代階段,EverMind 提出了 DASH 演算法,解決了傳統同策略自我蒸餾(OPSD)中監督訊號分配不均的問題。
- 自適應傳播門 (Propagation Gate):研究發現局部散度(學生與教師的差異)與未來演變關聯極弱。DASH 利用局部散度與序列均值的差距來控制訊號傳播,當出現「高風險分叉點」時,會開啟更大的門來強化監督訊果。
- 效能表現:在 AIME 等高難度數學推理基準上,DASH 在不同規模的模型(Qwen3-1.7B 至 8B)上均取得了最高分,且無需額外的計算開銷。
💡 EverMind 的四層自進化技術棧
EverMind 將自進化過程拆解為四個層層遞進的維度:
- 任務層:優化單次任務執行質量(記憶提取與技能沉澱)。
- 腳手架層:優化 Code 與 Policy(行為資產的持續積累)。
- 模型層:優化模型本身(個性化專屬能力)。
- 元改進層:優化「提出—選擇—驗證」的整個迴圈(讓進化能力本身持續升級)。
🎯 實務啟示
對於工程師而言,EverMind 的研究證明了「自進化」並非單一技術點的突破,而是需要從「執行邏輯(Harness)」、「經驗存儲(Skills)」到「底層權重(Weights)」進行系統性的工程設計,才能建立起真正的技術閉環。
🔗 來源
- 標題:中國NeoLab時刻:EverMind用3篇論文,交出全棧自進化首份答卷
- 連結:https://www.qbitai.com/2026/08/468555.html
#AI #MachineLearning #SelfEvolvingAI #Agent #EverMind #LLM #ArtificialIntelligence #DeepLearning #RecursiveSelfImprovement #TechTrends
原始資料 量子位 · 收集於 2026-08-09
摘要原文
中國NeoLab時刻:EverMind用3篇論文,交出全棧自進化首份答卷 Jay 2026-08-08 15:56:09 來源: 量子位 海外團隊紛紛下注,NeoLab浪潮狂飆 允中 發自 凹非寺 量子位 | 公眾號 QbitAI 2026年夏天,註定是 自進化AI 的歷史一刻。 當海外NeoLab還忙於靠敘事拿下數億美元融資時,一家中國團隊用連續三篇論文,交出了自進化AI領域 第一份 全棧答案。 它就是 EverMind ,由盛大集團孵化,延襲當年創新院研究基因。 其實回顧中國網際網路史,盛大創新院的存在幾乎算得上 「異類」 。 2008年,陳天橋在盛大集團內部創立該機構,其定位不是做產品、也不追KPI,就是純粹地探索技術前沿。 這在那個流量為王、變現至上的網際網路時代,其實是一種極為罕見的企業內研究文化。 彼時,這種模式在中國企業界幾乎是開創性的。 十餘年後,時代的底色已經從網際網路切換到了AI。 而盛大集團的戰略佈局,也已經集中到更為前沿的腦科學和人工智慧方向—— 近三年來, 盛大All in AI ,在原有風險投資體系基礎上,通過內部孵化機制在全球範圍內廣泛吸引頂尖AI人才,陸續孵化出多支專注於不同AI方向的研究型團隊。 EverMind,正是其中一支。 如果說盛大創新院開創了中國企業內研究型組織的先河,那麼EverMind的出現,則是這一基因在AI時代的延續與昇華。 也正因如此,這支團隊從一開始便選擇了一條在商業上看似“最難”、在技術上卻“最根本”的路: 解決AI的長期記憶問題,並在此基礎上,探索AI的自進化之路。 放至2026年的AI版圖上,這個模式有了一個更為響亮的名字—— NeoLab (新一代AI實驗室)。 海外團隊紛紛下注,NeoLab浪潮狂飆 NeoLab 這個詞,最早是被用來描述那批從OpenAI、Google DeepMind、Meta等頂級AI機構出走、押注前沿技術方向獨立創業的研究型團隊。 他們的共同特徵是: 面向下一代AI技術、研究驅動和長期主義。 2026年,這股浪潮已經洶湧到了無法忽視的程度: 比如,前Salesforce首席科學家Richard Socher與前Meta FAIR科學家總監田淵棟聯合創立的 Recursive Superintelligence (RSI)。 其在團隊不足30人、尚無任何產品的情況下,拿到了6.5億美元融資,估值高達46.5億美元,並隨即與AWS簽署了4.1億美元的多年算力合作協議。 DeepMind的AlphaGo之父David Silver帶著 Ineffable Intelligence 以51億美元估值殺入戰局。 Engram 以6億美元估值完成了9800萬美元A輪融資, Adaption Labs 以10億美元估值拿到了5000萬美元種子輪, Core Automation 的估值目標直指40億美元…… 這些團隊押注的核心命題,都指向同一個方向: 如何讓AI在部署後不再是一成不變的靜物,而是能夠通過自我迭代實現持續進化 。 這個方向,在學術上被稱為 遞迴自我改進 (Recursive Self-Improvement),在產業上被稱為 自進化AI (Self-Evolving AI)。 然而,當我們仔細審視這些估值驚人的NeoLab時,會發現他們大多仍停留在單點突破的理論探索階段: RSI:初步分享了先進的理念和路線設計,但尚未公佈具體方案或成果; Engram:專注於參數化權重記憶,但缺乏腳手架層的靈活進化機制; Adaption Labs:主攻推理時適應,但沒有長期技能沉澱體系; Core Automation:方向最為接近,但也還沒有公開的論文和開源生態。 就在海外團隊還在各自的細分領域摸索時,EverMind悄然完成了一件令人矚目的事: 連續釋出三篇重量級論文,從 技能層 、 腳手架層 到 模型權重層 ,系統性地給出了一套完整的自進化AI技術答案。 一次對話,兩個入口:當RSI遇上EverMind 在深入這三篇論文之前,有一個細節值得單獨記錄。 今年四月,EverMind主辦了一場名為 “記憶起源” (Memory Origins)的Hackathon活動。 在這場活動上,出現了一位特別的嘉賓——Recursive Superintelligence(RSI)的聯合創始人之一, 田淵棟 。 田淵棟在活動上分享了他對AI記憶工作的深度理解,而彼時RSI融資的相關進展尚未披露。 在活動結束後,田淵棟與EverMind負責人 鄧亞峰 共同接受了「矽谷創見匯」播客的採訪,兩人就AI行業的發展走向和記憶相關技術的前景進行了深入對談。 在這次對話中,鄧亞峰提出了一個核心判斷,也透露了EverMind技術戰略的脈絡: 從長期記憶,結合持續學習,走向自我進化是下一代AI的核心技術路線。 這句話值得細細品味。 記憶,是Agent積累經驗的 載體 ;自進化,是把經驗轉化為能力躍升的 路徑 。 沒有高質量的記憶,自進化就是無源之水;沒有自進化作為目標,記憶就只是一個越來越大的檔案館。 EverMind從EverOS(記憶作業系統)到Raven(自進化Agent框架),再到三篇自進化論文所構建的完整技術棧,正是這一判斷的系統性實踐。 田淵棟與鄧亞峰在同一個舞臺上的相遇,某種程度上也是一個隱喻: 當海外最頂尖的自進化研究者,與中國最具研究深度的記憶AI團隊相遇,他們發現彼此正在從不同的入口,攀登同一座山峰。 為什麼「自進化」重要且難? 在深入EverMind的技術細節之前,還需想清楚一件事: 為什麼“讓AI自我進化”既是必答題,又是一道難題。 傳統大語言模型一旦完成訓練並部署,能力就被凍結了,不再隨使用而增長。可人類智慧最迷人的地方恰恰相反——每一次交流、每一次思考,我們都在悄然進化。 下一代AI 也理應如此:能夠通過持續學習不斷變得更聰明,而不是停在出廠那一刻。 而且這條路正在變得現實。 隨著大模型能力的躍升,越來越多的案例表明, “AI自主改進AI” 已經從設想走向可行,在某些環節甚至開始超越人類專家。 一旦AI能夠穩定地自我改進,隨之而來的很可能是一場生產力的躍遷。 但要真正做到這一點並不容易。業界通常有三條路徑,每一條都橫著一道難關。 腳手架 (Harness) 的自我改進 ,是第一道關卡。 一個Agent的實際表現,不僅取決於模型本身,更取決於包裹在模型外圍的 「腳手架」 ——提示詞、注入的知識、執行時控制邏輯等。 讓模型自己修改這些程式碼看似簡單,真正的難點卻在於如何避免過擬合:模型自我生成的反饋往往充滿噪聲,一個看似有效的修改,可能只是針對特定測試集的過擬合,換個場景就會導致 災難性崩潰 。 技能 (Skills) 的規模化管理 ,是第二道關卡。 當Agent把成功經驗固化為可複用的技能檔案,技能數量會爆炸式增長,那麼如何管理這些碎片化、冗餘、質量參差不齊的技能?又如何在一個數十萬量級的技能庫中,精準檢索出當前任務真正需要的那幾個? 這類工程問題長期被學術界忽視,卻恰恰是 產品能否落地的關鍵 。 模型權重 (Weights) 的訓練訊號分配 ,是第三道關卡。 在最底層的模型訓練階段, 同策略自我蒸餾 (On-Policy Self-Distillation,OPSD)是提升推理能力的有效手段。 但傳統OPSD在處理長序列推理時,會把相同的監督權重均勻分配給每一個生成步驟,完全忽略了錯誤發生的時序上下文。這就像長跑時,無論你在起跑摔倒還是在終點前摔倒,教練的懲罰都一模一樣。 如此粗顆粒度的訊號分配,嚴重拖累了模型的學習效率。 EverMind的三篇論文 ,正是分別瞄準這三道難關,各自給出了嚴謹的解法。 HarnessBank:讓Agent學會安全改寫「腳手架」 在實際部署中,模型權重往往是凍結的, 修改Agent外圍的Harness 成為了提升效能的最直接手段。 EverMind在《HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution》(https://arxiv.org/abs/2607.13683)一文中,提出了一套全新的框架: 它能夠讓Agent自主診斷失敗並重寫自己的執行邏輯,同時從根本上解決了自我改進中的過擬合問題。 這套框架的核心創新在於將 “提出變更” 與 “歸因變更” 徹底分離。 在過去的研究中,模型既當運動員又當裁判,自己寫程式碼自己評估,極易產生幻覺式的效能提升。 而在EverMind的方案中,語言模型只負責診斷失敗原因並提出補丁(Patch),所有的取樣、測量和顯著性檢驗全部交由 確定性的程式碼邏輯 來控制。 這一設計確保了每一個被系統認可的效能提升,在統計意義上都是絕對可靠的,而非測量誤差或隨機波動。 更有創新性的是其引入的 裝備基因庫 (Harness Gene Bank, HGB) 機制 。 傳統的自進化系統往往以“任務”為鍵(Key)來儲存改進,這極易導致系統只學會瞭如何解決特定的幾道題,換一個場景便原形畢露。 EverMind則將每一份高效能腳手架以 “WHERE × WHY” (改動作用在哪個環節、又是為何被引入)作為語義座標存檔,並支援通過故障診斷進行“重新發明”,或跨單元進行“機制重組”,防止搜尋過程陷入崩潰或原地打轉。 這種設計引入了強大的 抗過擬合歸納偏置 ——系統學到的不是“如何解決這道題”,而是“如何修復這類病理”。 為了從大量候選後代腳手架中高效挑出真正有效的改進,團隊還設計了 分級裝備篩選 (Gated Harness Screening)機制,用有效性、啟用、配對顯著性、增益四道順序閘門層層過濾,兼顧了評估成本與結果的可信度。 實驗結果證明了這一設計的有效性。 團隊預設以Qwen3.6-27B作為任務Agent、Claude Opus 4.8作為進化Agent,在Terminal-Bench-2、LiveCode、Omni-MATH、BrowseComp+、GDPval、AppWorld、SWE-bench七個多樣化基準上評測,並與GEPA、DGM(Darwin Gödel Machine)兩種當前最先進的自進化方法對比。 結果顯示,在凍結任務Agent權重的情況下,HarnessBank在全部七個基準上取得了 5.1% 到 15.4% 的一致性能提升。 同時所有增益均通過了配對顯著性檢驗(z≥1.96),證明這些提升在統計意義上絕對可靠,而非測量誤差或隨機波動。 論文中還有一個極具啟發性的發現: 跨模型實驗證實,這些效能提升來自 模型特異性的自進化過程 ,而不是存在某個放之四海而皆準的“萬能腳手架”。 獲勝的補丁追蹤的是 模型的主導“病理” ,而不是模型的大小或家族。 也就是說,當你更換一個不同的基礎模型時,主導病理會改變,對應的最優腳手架也會隨之改變;但同樣的病理-補丁匹配關係,會在不同的模型家族中重複出現。 這意味著,EverMind構建的這套 “診斷-歸因”迴圈機制 ,是一種可以跨模型遷移的元能力,證明了AI for AI的技術可行性。 SkillCorpus:10萬技能庫背後的工程與科學 如果說Harness的自進化賦予了Agent重寫邏輯的能力,那麼 “技能” (Skills)則是Agent沉澱經驗的具體載體。 在EverMind的Raven框架中,內建了高達 10萬項 開箱即用的技能。 這並非簡單的數量堆砌,其背後的工程與科學支撐,正出自《SkillCorpus: Aggregating, Curating, and Evaluating the Open Skill.md Ecosystem》(https://arxiv.org/abs/2607.15557)。 隨著開源社群中技能檔案(如Skill.md格式)的爆發式增長,這些資產呈現出嚴重的碎片化、冗餘和質量不均。 EverMind團隊構建了一個名為 SkillCorpus 的框架,首次在規模化層面上對開放技能生態進行了聚合、策展、匹配和評估。 這個過程堪稱一場浩大的數字淘金。 團隊從爬取的大約82.1萬個原始技能中,通過多階段多維度策略過濾,最終精選出96401個高質量技能。 為了管理這些技能,他們建立了一個包含16個類別的分類法,並從 實用性 (Utility)、 魯棒性 (Robustness)和 安全性 (Safety)三個維度進行了嚴格的質量控制。 僅僅有庫還不夠,關鍵在於 檢索 。 EverMind配合這個龐大的語料庫,微調了一套專門的檢索與選擇技術棧,確保Agent在執行任務時能夠精準匹配到相關的技能。 SkillsBench、GDPVal和QwenClawBench三個基準測試中的端到端評估顯示,自研的Raven Harness整合SkillCorpus後,Agent在所有基準上均獲得了 穩定的效能提升 ,其中在SkillsBench上的提升最大,達到了7.5個百分點。 通過深入的運營分析,團隊還識別出了技能帶來的增益邊界—— 覆蓋邊界 (技能庫是否覆蓋了任務所需的知識)和 Harness邊界 (Agent的腳手架是否能有效呼叫技能),這為未來如何進一步最佳化技能檢索和應用指明瞭方向。 這篇論文不僅是對Raven 10萬技能庫的技術解密,更是業界 首個 關於“經過策展和檢索服務的社群技能庫如何在真實Agent任務中發揮作用”的端到端系統性研究。 更進一步,技能並非一入庫就固定不變。 無論是人工編寫的技能,還是AI自動生成的技能,EverOS都能依據任務執行的成敗經驗對其持續打磨。 用得好的被強化、被複用,用得差的被修正、被淘汰。 技能庫因此不是一份靜態清單,而是一個 隨任務不斷自我進化、越用越強 的資產,這也正是技能沉澱歸屬於任務層的原因所在。 DASH:讓模型看清哪裡出了錯 自進化的最深層,是 模型權重的自我迭代 。 EverMind的最新論文《DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models》(https://arxiv.org/pdf/2608.06243v1),展示了其在底層演算法上的深厚功底。 傳統的同策略自我蒸餾(OPSD)存在一個致命的時間盲區: 它對所有局部散度(即學生與教師的差異)分配相同的係數,完全忽略了錯誤發生的時間順序和上下文。 EverMind的研究團隊通過對大量真實推理軌跡的分析,發現了一個關鍵現象:在一個推理序列中,局部散度值的大小與未來散度的演變之間, 存在極弱的關聯 。 這意味著,用同一個係數來處理所有時間步的散度,本質上是在用一把尺子量所有不同形狀的錯誤,必然導致監督訊號的嚴重失真。 為了解決這一問題,EverMind提出了 DASH (Divergence-Adaptive Supervision Horizons)。 DASH的核心思想是將每個局部蒸餾訊號與序列級均值之間的差距,轉化為一個 自適應的傳播門 (Propagation Gate),然後利用這些門控制向後的多步聚合。 當一個時間步的局部散度高於序列均值時,說明這裡是一個 高風險分叉點 ,DASH會開啟一個更大的傳播門,讓這個時間步的監督訊號向前傳播更遠;反之,傳播門收窄,避免無關緊要的步驟干擾整體學習。 實驗結果令人印象深刻。 在AIME 2024、AIME 2025和HMMT 2025三個極具挑戰性的數學推理基準上,DASH在Qwen3-1.7B、Qwen3-4B和Qwen3-8B三個模型規模上均取得了所有對比方法中的 最高分 。 在Qwen3-1.7B上,DASH將三個基準的平均得分從vanilla OPSD的41.87提升至45.07;在Qwen3-8B上,從65.00提升至66.40。 更重要的是,DASH不需要引入任何額外的教師或學生前向傳遞開銷,這意味著這種效能提升幾乎是 免費的 。 EverMind的自進化框架全景 在長期記憶領域已經貢獻了數篇ACL、KDD等頂會高質量論文,並取得開源庫1.8萬star後,EverMind繼續分享對自進化演進的研究成果—— 將自進化的完整路徑,概括為一個 從任務層到元改進層的四層遞進體系 。 上述三篇論文構成的技術棧,與EverMind內部的產品和研究框架之間,存在著精密的對映關係: 1、任務層: 任務層是最直接的進化層次,進化在單次任務中即時發生。 最佳化物件是 單次任務的執行質量 ,既包括記憶的提取與回寫,也包括技能(Skills)的即時沉澱與複用;經驗來源是 Context、Trace 與使用者反饋,更新動作是即時回寫,驗證方式是結果與反饋。 這一層的能力複利是 “記得更牢、用得更順、單次任務做得更好” ,價值定位是沉澱任務級、可複用的記憶與技能資產。 這正是EverOS與SkillCorpus所覆蓋的核心場景。 2、腳手架層: 腳手架層(Harness)最佳化物件是 Code與Policy ,即Agent外圍的執行邏輯與控制策略;經驗來源是Eval與Reflection,更新動作是腳手架的版本迭代,驗證方式是Agent Evals覆盤。 這一層的能力複利是 “更會執行” ,價值定位是可複用行為資產的持續積累。 這正是Raven框架與Self-Evolving Harness論文所對應的工作。 3、模型層: 模型層最佳化物件是 模型本身 ,經驗來源是高價值軌跡、偏好與失敗樣本,更新動作是LoRA與端側模型的驗證後灰度,驗證方式是離線集加灰度測試。 這一層的能力複利是 “更準、更省” ,價值定位是個性化的專屬模型能力。DASH論文正是這一層的核心演算法支撐。 4、元改進層: 元改進層是整個框架最令人興奮的頂層。 最佳化物件是 Evaluator 、 Data 與 Training Recipe 本身,經驗來源是多輪實驗與Benchmark,更新動作是最佳化“提出—選擇—驗證”的整個迴圈,驗證方式是版本門檻加評測體系。 這一層的能力複利是 “下一輪進化更快、更可靠” ,價值定位是讓改進能力本身也持續升級。 這個四層框架的深刻之處在於,它把自進化拆成了 四個層層遞進又彼此支撐的環節 ,併為每一層都配備了具體的技術路徑與驗證機制。 它不是一張空洞的願景圖,而是一個有工程細節、有學術支撐的完整路線圖。 其實在今年4月,團隊就率先提出了針對Agent自進化的評測基準 EvoAgentBench ,當月在Hugging Face同類benchmark上下載量第一。 這是一套用於衡量智慧體從既往執行中提取並遷移能力效果的評測方法,為技能沉澱、腳手架迭代和模型最佳化提供統一、可比較的驗證框架。 結合三篇論文從技術、腳手架到模型權重的系統性探索,EverMind已將自進化能力建設由方法研究延伸至評測體系,形成更完整的 技術閉環 。
由 tencent/hy3:free 自動生成