量子位 ★ 95 4 min

當題庫追不上模型,AI開始給自己出題:中國這支團隊跑通了資料層RSI

資訊

🔗 https://www.qbitai.com/2026/08/468782.html

📌 【無盡前沿】35B 跑贏 1T 大模型:BigBang-V1 實現資料層 RSI,讓 AI 自主出題與演進

TL;DR:BigBang-V1 透過資料層的遞迴自我改進 (RSI),用 100% AI 合成數據達成科研任務多項第一。

當模型進化速度遠超人類出題速度,高品質訓練資料的荒漠化成為 AI 發展的瓶種。如果題庫追不上模型,那讓 AI 開始為自己出題。

🚀 打破資料瓶頸:從「人類出題」轉向「資料生產系統的自我演進」

目前大模型訓練常面臨兩個困境:一是僅在模型外層套用工具(如 harness),未觸及訓練底層;二是使用人類預設規則進行資料篩選,導致模型變強後,舊的評比標準會迅速失效。

無盡前沿 (Endless Frontier) 團隊提出的 BigBang-V1 採取了不同的路徑:將「資料生產系統」本身視為最佳化物件。該系統要求任務必須同時具備兩個關鍵屬性:

  • 前沿性:任務必須位於當前知識邊界,確保不會被模型迅速「背完」。
  • 可驗證性:方案必須能透過程式執行、數值計算或模擬器進行客觀檢查,確保訓練訊號可靠。

🧩 雙 Agent 協同:模擬 AlphaGo 的自我對弈機制

BigBang 的核心在於一套能持續修改自身生產策略的自演化合成資料管線,透過兩類 Agent 進行對抗與協作:

  1. Generator Agent (生成者):不只是套用 Prompt,它更像是一個程式碼 Agent,能直接修改、執行並除錯資料合成程式。它能決定任務領域、推理鏈長度以及是否需要使用模擬工具,並記錄失敗經驗以供後續探索。
  2. Critic Agent (審查者):負責從對抗角度審查資料。第一層檢查格式與約束滿足;第二層則判斷任務是否具備足夠的難度、多樣性與訓練價值。

為了防止 Generator 為了迎合 Critic 而產生「表面複雜但無用」的資料,系統還建立了一層外迴圈:利用真實研究任務的結果來反向校準 Critic 的評價標準,確保資料能真正轉化為模型的實質能力。

📊 35B 規模展現超越 1T 級模型的科研實力

BigBang-V1 參數規模為 35B,推理時啟用約 3B 參數,支援 262K 長上下文。其後訓練資料 100% 由 AI 自主合成,並在多項高難度任務中表現卓越:

評測指標 / 任務BigBang-V1 表現
科研任務 (FrontierScience / PaperBench)超越 1T 級 DeepSeek V4 Pro Preview
長程搜尋 / 程式碼 / 科研任務拿下該規模 (35B) 內 10 項第一
論文復現 (LBCS 論文案例)透過自我糾錯與梯度恢復,達成 0.7657 評分
軟體工程 (SWE-Bench Pro)54.2
程式碼能力 (BrowseComp)76.5

💡 從生物資訊到遊戲開發:能力的廣泛遷移

BigBang 的能力不僅限於科學領域。在生物資訊任務中,它能精準定位轉座子插入位點,並確保座標符合 RefSeq 規範;在軟體工程中,它展現出類似工程師的自我糾錯能力,能主動發現並修正程式碼中的邏輯錯誤。此外,其能力也成功遷移至長程搜尋(需多次檢索與交叉驗證)與複雜程式碼生成(如帶有 UI 與粒子特效的小遊戲)。

🎯 實務啟示

對於 AI 工程師而言,BigBang-V1 證明了「資料品質與驗證機制」比單純擴大數據規模更重要。當訓練資料能夠隨著模型能力提升而動態演進,並透過可驗證的閉環(Closed-loop)避免合成數據坍縮時,AI 才能真正突破人類知識邊界的限制。

🔗 來源

  • 標題:當題庫追不上模型,AI開始給自己出題:中國這支團隊跑通了資料層RSI
  • 作者/機構:聞樂 @ 量子位 (由 上海交大人工智慧學院、深勢科技、上海演算法創新研究院 組成)
  • 連結:https://www.qbitai.com/2026/08/468782.html

#AI #MachineLearning #RecursiveSelfImprovement #BigBangV1 #EndlessFrontier #SyntheticData #AIforScience #LLM #DeepLearning #ArtificialIntelligence

原始資料 量子位 · 收集於 2026-08-09
來源原標題
當題庫追不上模型,AI開始給自己出題:中國這支團隊跑通了資料層RSI
作者
闻乐
原始標籤
資訊
原始連結
https://www.qbitai.com/2026/08/468782.html

摘要原文

當題庫追不上模型,AI開始給自己出題:中國這支團隊跑通了資料層RSI 聞樂 2026-08-09 11:40:25 來源: 量子位 AI參與創造下一代AI 聞樂 發自 凹非寺 量子位 | 公眾號 QbitAI 矽谷今年最貴的詞,叫 Recursive Self-Improving 。 它就是指讓AI參與迭代自身的模型、演算法、資料和研發流程。 這個概念有多火呢? Jeff Dean 離職創辦的Discovery Loop,方向就是探索AI自動化科學研究。 不只姐夫,AlphaGo締造者 David Silver 等一眾大牛也在同一條賽道上。 看得出來,這些頂級AI研究者正在形成一個共識: 讓AI參與創造下一代AI,讓AI持續自我改進並構建更強的AI 。 在這個共識之下,一個更棘手的問題出現了。 模型越強,能給AI出題、解題、驗證的人越少,高質量訓練資料該從哪來? 一支中國團隊給出了他們的答案。 由 上海交大人工智慧學院、深勢科技、上海演算法創新研究院 組成的 無盡前沿團隊 釋出 BigBang-V1 —— 這是首個基於recursive self-improving原生方式訓練出的基座模型。 在訓練過程中,出題、解題、驗證都交給AI把控,通過可驗證前沿任務持續生成高質量自演進合成數據,全程無需人類逐題參與。 35B跑贏1T大模型 模型已開源,技術報告也同步公開。 BigBang-V1參數規模35B,推理時啟用約3B參數,支援262K長上下文。 它的 後訓練資料100%由AI自主合成,以科學前沿任務為核心 。 在這樣的條件下,模型在長程搜尋、程式碼、科學研究、AI研究等評測中, 拿下全部35B模型裡的10項第一 。 不僅如此,在FrontierScience Research、PaperBench等多項高難度科研任務上,成績甚至超過了1T級的DeepSeek V4 Pro Preview。 基準分數之外,具體任務裡的表現更能說明BigBang-V1解決複雜問題的水平。 先看一個高難度生物資訊學任務。 轉座子定位 要求在全基因組測序資料裡定位一個47bp的轉座子插入位點,模型不僅要識別相關序列,還得遵守RefSeq染色體命名和1-based座標約定。 BigBang沒有去猜座標,而是利用轉座子與染色體之間的連線證據做約束對映: 一個junction對應一個座標,最終把斷點鎖定在4144431,每一步證據都可追溯。 在論文復現任務裡,BigBang的表現又像一個會自我糾錯的工程師。 任務要求 把LBCS論文復現為可執行的程式碼倉庫 ,它在通讀完論文之後沒有急著交卷,而是在冒煙測試裡發現自己寫出的實現違反了論文的核心主張: 樣本量被固定死了,核心集根本沒法收縮。 它推算了擾動規模,發現無法越過觸發閾值,於是連續否決了三個候選修複方案,最終把連續擾動改成二進位制掩碼翻轉,問題才真正解決。 第二輪它又發現一個梯度項從計算圖中脫離,主動恢復了梯度流,最終復現評分0.7657,全部485個評分點通過331個。 這些案例體現的並不只是分數。 BigBang真正展現出的是 把多步證據組織成可驗證結論 的能力,以及 在失敗中發現問題、修正方案 的本事。 對科研AI來說,這兩種能力恰恰最要緊。 畢竟,科研不是背答案,而是從噪聲裡找證據,在出錯時改方案。 不過,以科研任務為核心構建的資料,並沒有把BigBang-V1訓練成只會答科學題的垂直模型。 BrowseComp基準達到76.5,SWE-Bench Pro拿到54.2,能力增益同時遷移到了長程搜尋、軟體工程、程式碼等場景。 我們也拿它實測了一把長程搜尋。 讓它盤點8月第一週AI圈的大事。它一天一天連著檢索了二十多輪、翻了十幾個來源。 先用定位候選事件,再逐條開啟信源交叉驗證,最後還專門找到一手頁面核對細節,連發布日期都逐個確認才給出結論。 而且它現搜列出的來源全部真實可訪問。 然後我們又讓它寫了一個太空射擊小遊戲。 程式碼寫得非常絲滑,打中後爆炸產生粒子特效,左上角還展示了分數、生命、等級遊戲UI。 100%純AI合成的訓練資料,為什麼能有這樣的表現? 要解開這個疑問,得先從訓練資料本身說起。 訓練資料生產,也可以成為AI最佳化物件 Recursive Self-Improving火熱,業界也都在談論,但大多數探索還僅僅徘徊在概念層,真正跑通完整閉環的落地案例並不多。 落到實際工作裡,現在常見的有兩類嘗試。 一部分方案只是給模型套上一層工具外殼,比如harness,讓模型自己調調工具、改改提示詞。 但這樣相當於只是把模型的呼叫方式做了增強,底層的訓練管線幾乎原封不動,並沒有觸動模型自我迭代的根源。 還有一類做法則是用大模型對生成的資料做打分篩選。 但這套評判標準是人類預先寫死的規則,篩選邏輯本身不會跟著模型能力成長而自我演化。 模型變強之後,舊的評判標尺很快就會失效,依然源源不斷產出低價值樣本。 單純靠擴大數據集規模、對已有資料反覆清洗過濾,已經很難再撬動能力的進一步躍升。 訓練資料仍由人類逐題生產, 模型的進化速度被人類出題的速度卡住 ,這是Recursive Self-Improving落地的核心問題之一。 BigBang團隊換了一個角度思考這個問題。 如果模型可以自我改進,那麼能不能讓訓練資料的生產系統本身,也成為被最佳化的物件? 於是,問題從「如何收集更多科學資料」,變成了「如何讓資料生產系統,隨著模型能力一起持續進化」。 要解決它,就要回到資料質量這一源頭,資料質量不是清洗洗出來的,是任務本身的屬性決定的。 如果想要搭建一套能持續自我進化的資料系統,任務必須同時滿足兩個條件。 首先是 前沿性 。 任務要位於當前知識或模型能力的邊界,甚至沒有已知最優答案。 新理論、新資料、新工具不斷出現,科學前沿就會持續產生新問題,不會像靜態題庫一樣被模型迅速耗盡。 其次是 可驗證性 。 候選方案要能通過形式化方法、程式執行、數值計算、模擬器、實驗反饋或領域工具做客觀檢查。 只有前沿而無法驗證,系統拿不到可靠訓練訊號;只有驗證但缺乏難度,任務又會迅速落後於模型能力。 二者缺一,資料都會快速貶值。 BigBang團隊將科學領域作為模型的訓練載體,恰好同時滿足前沿性與可驗證性兩大條件。 它天然組合了搜尋、閱讀、提出假設、數學推導、程式碼開發、工具呼叫、實驗分析和結果寫作,相當於一套面向通用智慧的綜合課程。 Jeff Dean說Discovery Loop這條路線適用於有可衡量目標的科學和工程領域,BigBang選科學當訓練場,底層邏輯同源。 用可驗證的前沿任務牽引資料生產,讓資料生產系統跟著模型一起進化,這就是BigBang給出的回答: AI advancing science, and science advancing AI.(AI推動科學,科學推動AI) AI開始決定,下一代AI學什麼 把理論答案落為工程實現,BigBang的關鍵是一套 能持續修改和改進自身生產策略的自演化合成資料管線 。 它把RSI機制嵌入了訓練管線內部,讓AI直接參與任務構造、求解、驗證、篩選,以及下一輪資料生產策略的最佳化。 △BigBang整體框架 系統的核心,是兩類Agent協同工作。 Generator Agent 負責不斷提出並解決科學、技術及AI研究中的高難度任務。 並非照著固定Prompt出題的生成器,它是作為程式碼Agent,直接修改、執行和除錯資料合成程式。 並且,它還可以調整任務來自哪些科學領域、問題需要多長的推理鏈、該用搜索還是計算還是程式碼還是模擬工具,甚至決定哪些樣本保留、哪些淘汰、哪些生成策略失敗了下輪不再重複。 每一輪實驗結束,它還會記錄修改動機、實驗結果和失敗原因,讓後續探索繼承此前的經驗。 Critic Agent 則從對抗角度審查候選資料。 第一層看格式、工具執行、資料完整性和約束滿足; 第二層進一步判斷任務是否正確、可驗證、足夠困難、多樣,並且真正具備訓練價值。 過不了審查的任務就被拒絕或回爐,通過的才進入合成數據集。 Generator負責造,Critic負責挑,這套對抗與協作就像 AlphaGo的自我對弈 ,只不過棋盤換成了開放的科學任務空間。 以上是系統的自迭代內迴圈,但這種快速內迴圈還有一個隱患。 Generator可能逐漸學會迎合Critic,造出一些表面複雜、評分很高、訓練後卻無法遷移到真實任務的資料。 因此BigBang在快速迴圈之外,又加了一層由真實訓練結果驅動的外迴圈。 △BigBang的兩層共同演化框架 系統會生成不同版本的資料生產管線,分別訓練模型,再放到留出的真實研究任務裡評測。 如果Critic認為某類資料價值很高,訓練後的模型卻沒有真正變強,說明評價標準存在偏差,系統就用真實結果反向校準Critic,並調整Generator下一輪的任務領域和難度; 反過來,如果某類看似狹窄的科學任務帶來了搜尋、推理或工具上的廣泛提升,系統也會加大對該方向的探索。 內外雙迴圈轉起來,資料和模型開始一起變強。 但模型越強,原本困難的任務就可能“越來越不值錢”,所以模型過去無法處理的問題又變得可解。 因此,資料管線必須是動態的,它得跟著模型一起變化。 這就是BigBang的資料層RSI閉環: 上一輪模型和實驗產生的結果,影響下一輪訓練資料的生成與篩選方式。 100%純AI合成數據,靠這個閉環打破了「合成數據會坍縮」的魔咒,錯誤的答案不會被當成正確答案繼續喂回訓練,因為驗證鏈一直在兜底。 當然,這也並不意味著人類退出研發。研發目標、資源預算、風險邊界、最終驗收標準,仍然由人類定義。 AI不能自行修改評測標準,也不能因為自己的Critic打了高分就直接批准某個方案進入下一輪訓練。 人類負責確定方向和定義什麼是有效進步,AI負責大規模探索、執行實驗、整理失敗經驗、生產下一輪訓練所需的資料。 可以說,這是訓練資料生產關係的一次重新分工。 無盡前沿 BigBang-V1背後的無盡前沿團隊,是學術與產業的結合。 團隊創始成員之一是上海交大人工智慧學院副教授 陳思衡 。 這位CMU博士曾任職於Uber ATG自動駕駛部門,回國後帶領團隊打造出通用科研智慧體 SciMaster 。 SciMaster曾登頂OpenAI FrontierScience榜單,實現了“搜、讀、算、做、寫”完整科研閉環。 另一位核心成員是上海交大助理教授 張林峰 。 這位年輕博導主攻 模型壓縮與資料蒸餾 ,他提出的大模型資料蒸餾方法拿過CVPR滿分,一直在探索怎麼更科學地合成數據、怎麼讓模型用更少的資料變得更高效。 產業一側, 深勢科技創始人張林峰 與 中國科學院院士鄂維南 為這支團隊補上了AI for Science的產業縱深。 無盡前沿要做的是依託可驗證前沿任務的自進化合成體系,實現開放式通用智慧,搭建完整AI自我迭代訓練飛輪。 當訓練資料的生產不再依賴人類逐題產出、當AI開始參與決定下一代AI應該學習什麼,AI進步的天花板,就被自己抬高了。 或許,下一個賽點的關鍵不在算力堆疊,而在資料智慧。 模型主頁:https://huggingface.co/endless-frontier/BigBang-v1 程式碼地址:https://github.com/endless-frontier/BigBang-v1 團隊主頁:https://endlessfrontier.tech 版權所有,未經授權不得以任何形式轉載及使用,違者必究。 聞樂 奧特曼也逃不過刷TikTok上癮,Sora背後最抓馬的一段來了 2026-08-01 企業出海,被中國信通院和騰訊重新定義了一次 2026-07-27 晶片賣了56萬片之後,阿里平頭哥把最值錢的東西開源了 2026-07-23 清華系團隊釋出國產Token優化工廠:相容10餘種國產晶片,日吞吐千億Token 2026-07-18

tencent/hy3:free 自動生成