GPT-5.6自己最佳化自己實錘了,新的左腳踩右腳已經出現
https://www.qbitai.com/2026/07/463297.html📌 【OpenAI 技術報告】GPT-5.6 進入遞迴自進化階段:從改寫 Kernel 到優化生產環境
TL;DR:GPT-5.6 已投入生產環境,透過改寫底層 Kernel 與優化路由,實現服務成本降低 20% 及效率提升 15%。
當 AI 不再只是被動呼叫的工具,而是開始親自改造執行自身的系統時,我們正接近所謂的 RSI(AI 遞迴自進化)。根據 OpenAI 最新的技術報告,GPT-5.6 已經展現出「左腳踩右腳」的特質,開始介入底層工程流程來優化自身。
🧩 從教人類寫 Kernel,到讓模型自己改 Kernel
這項進展的技術深度極高,其中一位技術報告作者正是 Triton 之父 Philippe Tillet。過去 Triton 的目標是讓不懂 CUDA 的人也能寫出專家級的 GPU 程式碼;而現在,GPT-5.6 已經開始利用 Triton 來改寫運行在 GPU 上的底層程式碼。
這種「遞迴式自我改進」的邏輯,讓模型不僅是執行任務,更成為了優化系統的工程師。
📊 四項核心工程實踐:如何實現自我最佳化
根據報告,GPT-5.6 透過以下四種方式參與真實的工程反饋迴路:
- 分析生產流量:尋找不同機器與服務節點間的負載不均,並測試新的路由策略,優化請求分配。
- 重寫與最佳化生產 Kernel:深入模型的 forward pass,尋找可提前計算或並行執行的部分,並透過 Codex 改寫生產環境中的 Triton 與 Gluon Kernel。
- 優化推測解碼系統 (Speculative Decoding):為 draft model 設計方案,並自動執行數百次實驗來測試模型大小、結構與特徵。
- 自動搜尋部署參數:針對短對話、長上下文、程式碼任務等不同負載,自動尋找 batching、sharding 與 KV Cache 管理的最佳組合。
這套流程實現了「觀察系統 $\rightarrow$ 尋找瓶頸 $\rightarrow$ 提出方案 $\rightarrow$ 執行實驗 $\rightarrow$ 部署改進」的完整閉環。
📈 實測數據:端到端成本與效率的提升
透過這套自我最佳化的連招,OpenAI 取得了顯著的工程成效:
- 服務成本:端到端 (end-to-end) 服務成本降低了 20%。
- 生成效率:Token 生成效率提升了 15% 以上。
⚠️ 人類仍是迴路中的關鍵:Human in the Loop
儘管模型已能參與改造,但目前仍未達到「完全自動訓練下一代 GPT」的程度。最佳化目標、工具權限、評測指標,以及程式碼能否正式進入生產環境,目前仍由人類決定。
此外,針對 Agent 在複雜任務中頻繁「思考 $\rightarrow$ 呼叫工具 $\rightarrow$ 讀取結果」產生的重複開銷,OpenAI 採用了由 Rust 編寫的 Agent Harness 來進行優化:
- 延遲發現 (Lazy Discovery):不再一次將所有工具說明塞入上下文,而是在需要時才展示對應工具,且限制工具返回內容在 1 萬 Token 以內。
- 只追加、不回寫:確保 Prompt 快取 (Prompt Cache) 能夠有效複用,新的訊息與工具結果僅接在末尾,避免改動已計算過的上下文首部。
🎯 實務啟示
當模型開始介入底層硬體與系統層級的最佳化(如 Kernel 改寫),AI 的演進將從「模型規模的競爭」轉向「模型與系統協同演進的競爭」。工程師應關注模型如何透過自動化實驗來優化推理架構,這將是未來大規模部署 LLM 時降低成本的關鍵。
🔗 來源
- 標題:GPT-5.6自己最佳化自己實錘了,新的左腳踩右腳已經出現
- 作者/機構:henry @ 量子位
- 連結:https://www.qbitai.com/2026/07/463297.html
#OpenAI #GPT5 #RSI #MachineLearning #Triton #GPU #Kernel #LLM #Engineering #AIOptimization
原始資料 量子位 · 收集於 2026-07-31
摘要原文
GPT-5.6自己最佳化自己實錘了,新的左腳踩右腳已經出現 henry 2026-07-30 15:51:14 來源: 量子位 OpenAI的RSI焚訣,它來了! henry 發自 凹非寺 量子位 | 公眾號 QbitAI OpenAI的RSI焚訣,它來了! 就在老黃開推搖旗吶喊、呼籲開放權重之後,OpenAI也突然Open了起來~ 在最新技術報告中,他們老實交代了一部分RSI(AI遞迴自進化)心法: 讓GPT-5.6左腳踩右腳,開始自己動手改造供自己執行的系統。 據報告透露,GPT-5.6已經被投入OpenAI的真實生產環境,用來分析線上流量、調整請求路由,甚至親自下場改寫底層Kernel、最佳化推測解碼模型。 一套小連招下來,OpenAI的端到端服務成本降低了 20% ,Token生成效率也提升了 15%以上 。 而且,值得一提的是,在披露這套工程的五名作者裡,還有大名鼎鼎的Triton之父 Philippe Tillet 。 2021年,OpenAI釋出Triton 1.0時,目標還是讓不懂CUDA的人也能寫出接近專家水平的GPU程式。 五年後,GPT-5.6已經開始用Triton改寫自己跑在GPU上的底層程式碼。 從教人類寫Kernel,到讓模型給自己改Kernel,味兒確實越來越像RSI了。 (你別說,也難怪翁荔回老東家。搞RSI,還得在OpenAI吶) RSI焚決,先從底層最佳化開始 這件事之所以值得關注,就在於它已經有了幾分RSI的味道。 所謂RSI,也就是遞迴式自我改進,說白了就是: 讓AI進入一個“改進AI”的反饋迴路——這一輪能力變強之後,再反過來加速下一輪升級。 當然,GPT-5.6現在還遠沒有完全實現GPT自動訓練下一代GPT的RSI。 但它已經開始參與最佳化自己的執行環境:模型不僅是被工程師部署和呼叫的工具,也逐漸變成了改造模型系統本身的工程師。 具體來說,它幹了四件事。 1、分析OpenAI真實的生產流量。 GPT-5.6會尋找不同機器和服務節點之間的負載不均,並測試新的路由策略,把請求分配到更合適的位置。 2、重寫和最佳化生產Kernel。 GPT-5.6會深入模型的forward pass,尋找可以提前計算、省略或並行執行的部分,再通過Codex改寫生產環境中的Triton和Gluon Kernel。 3、最佳化自己的推測解碼系統。 GPT-5.6為自己的draft model設計方案,並自動執行數百次實驗,測試不同的模型大小、結構和特徵。 在訓練過程中,它還會持續監控實驗,並在發生硬體故障或訓練不穩定時主動介入。 4、針對不同任務,自己尋找最優部署參數。 面對短對話、長上下文、程式碼任務等不同負載,GPT-5.6會自動搜尋batching、sharding和KV Cache管理的更優組合。 四件事連起來,GPT-5.6參與的已經不再是某個孤立的程式碼任務,而是一條真實的工程反饋迴路: 觀察生產系統、尋找瓶頸、提出方案、執行實驗、處理故障,再把有效改進部署回承載自己執行的系統。 人類依舊站在圈裡 當然,RSI也沒那麼快,人類依舊站在圈裡,也就是human in the loop。 GPT-5.6雖然開始參與改造自己,但最佳化目標、工具許可權、評測指標,以及程式碼能否進入生產環境,仍然由人類決定。 而且,模型內部省完了,模型外面還有大量重複開銷。 比如,ChatGPT Work和Codex執行複雜任務時,往往要不斷經歷: 模型思考—呼叫工具—讀取結果—繼續思考。 一次使用者請求,背後可能迴圈十幾輪甚至幾十輪。 假如一個任務需要呼叫模型30次,每次只額外浪費1秒,累計起來就是30秒。 上下文、工具說明和歷史結果也會在每輪迴圈中反覆傳輸和計算。 為此,OpenAI搭建了一層由Rust編寫的 Agent Harness ,連線模型、工具和使用者環境,專門減少Agent迴圈裡的重複工作。 這裡最關鍵的有兩項最佳化。 1、延遲發現:別一上來就把所有工具塞給模型 今天的Agent可以使用大量工具、Skill、外掛和自定義MCP,但單個任務通常只需要其中很少一部分。 OpenAI不再一開始就把所有說明書塞進上下文,而是在真正需要時,才向模型展示對應工具。 工具返回的內容預設也被限制在1萬Token以內,需要更多時,再由模型主動申請。 2、只追加、不回寫:讓Prompt快取一直有效 Prompt快取可以複用已經計算過的上下文字首,但前提是這段字首必須原樣不動。 因此,新的訊息和工具結果只會接在上下文末尾,不再插回舊內
由 tencent/hy3:free 自動生成