量子位 ★ 92 3 min

Show me《指環王》!卡帕西強推大模型評測新基準

資訊

🔗 https://www.qbitai.com/2026/08/467663.html

📌 【Karpathy 強推】從「鵜鶘騎腳踏車」到「中土世界」:大模型評測進入 3D 空間推理時代

TL;DR:Karpathy 提出以《指環王》為例的 Three.js 測試,將評測重心從單張圖片轉向複雜的 3D 空間與程式碼規劃能力。

隨著模型能力不斷攀升,過去用單張 SVG 圖片測試模型空間理解能力的「鵜鶘騎腳踏車」測試(Pelican riding a bicycle)已逐漸失去區別度。AI 大神 Karpathy 最近指出,我們需要更難、更具規模化的基準來衡量模型,而現在,這項任務變成了:讓模型「手搓一個中土世界」。

🤔 從單張圖到複雜工程:為什麼需要新基準?

過去開發者常用「生成一張鵜鶘騎腳踏車的 SVG」來測試模型對幾何結構與空間關係的理解。但隨著 DeepSeek 等模型已能輕鬆應對,這種一次性的輸出已無法測試出模型處理複雜專案、連續工作與自我修正錯誤的能力。

Karpathy 認為,新的測試基準應該考察模型能否將抽象的文學文本,轉化為一套真正可執行的結構化程式碼,並在長達數千行的程式碼中維持邏輯一致性。

🧩 以 Three.js 搭建《指環王》:Opus 5 的大規模挑戰

這項測試的核心邏輯是:輸入文學經典(如《指環王》第一章),要求模型使用 JavaScript 的 3D 繪圖庫 Three.js,在瀏覽器中即時渲染出一個 3D 場景。

這與單純的影片生成完全不同,這是一個嚴謹的程式碼工程,模型必須完成以下步驟:

  • 理解文本:讀懂《指環王》中關於場景、人物與動作的描述。
  • 建立物件:利用多邊形拼出人物、建築與道具,並將其放入 x、y、z 座標系。
  • 定義邏輯:用程式碼定義攝像機(Camera)、燈光(Light)以及物體的運動與互動動畫。

📊 Opus 5 的實驗數據與現況

根據 Karpathy 展示的 Demo,Opus 5 在完成這個任務時展現了驚人的資源消耗與複雜度:

  • Token 消耗:100 萬 token
  • 執行時間:2 小時
  • 程式碼規模:5500 行

雖然目前生成的畫面仍顯粗糙,且存在穿模(clipping)或人物漂浮等問題,但它展示了模型具備了「規劃複雜專案」與「維持空間關係」的潛力。

💡 混合工作流:程式碼骨架 + 影片模型渲染

面對目前 3D 渲染效果不夠精緻的問題,Karpathy 提出了一種極具實務價值的混合工作流(Hybrid Workflow):

  1. 程式碼負責骨架:利用 Three.js 定義分鏡、鏡頭運動與劇情推進。
  2. 影片模型負責細節:將 Three.js 的錄屏交給 Video-to-Video 模型(如 Seedance),補上高品質的紋理、光影與細節。
  3. 音訊模型負責配音:例如使用 ElevenLabs 提供高品質旁白。

🎯 實務啟示:空間推理成為新的競爭力

這項測試的出現,預示著大模型的能力正在從單純的「文字生成」延伸到「空間推理」。開發者可以從中觀察模型是否真正理解「前後、內外、遠近、遮擋」等物理規律。

對於工程師而言,這代表未來的 AI 應用可能不再是單一的 Prompt 輸出,而是由 LLM 作為「導演」,協同 Three.js、影片模型與音訊 API,共同構建出一個可互動、可玩、且具備一致性的虛擬世界。

🔗 來源

#AI #MachineLearning #LLM #Anthropic #Karpathy #Threejs #3DGeneration #SpatialReasoning #ComputerGraphics #AIResearch

原始資料 量子位 · 收集於 2026-08-07
來源原標題
Show me《指環王》!卡帕西強推大模型評測新基準
作者
henry
原始標籤
資訊
原始連結
https://www.qbitai.com/2026/08/467663.html

摘要原文

Show me《指環王》!卡帕西強推大模型評測新基準 henry 2026-08-07 09:15:42 來源: 量子位 指環王成為大模型新基準 henry 發自 凹非寺 量子位 | 公眾號 QbitAI 話不多說,直接開始每日癱坐(doge)! 就在剛剛,大神卡帕西宣佈,“我們”Anthropic已經開始用一種全新的方式,給大模型上強度—— 《指環王》。 據卡帕西介紹,這套“指環王基準”,正在接替過去風靡一時的“鵜鶘騎腳踏車”SVG測試。 具體來說,卡帕西直接把《指環王》的開頭丟給Opus 5,讓模型用Three.js現場搓出一整個“中土世界”。 至於最終效果嘛,多少有點像上世紀90年代末、21世紀初的國產3D動畫片:很粗糙,也很抽象。 但客觀來說,仔細看上一會兒,如果你又恰好熟悉坐落在紐西蘭的《指環王》取景地霍比屯,倒也確實能看出那麼一絲味道~ 不過,就是這麼個看起來不太精緻的玩意,卻實打實地花掉了Opus 5: 100萬token , 2個小時 以及 5500行程式碼 。 當然,舞臺上也並非只有Claude一模獨自美麗。 最搞笑的,還得是網友新端上來的一碗DeepSeek V4 Flash版本。 直接一整個“中國人能飛”,畫面人物全員漂浮。 面對這些目前肉眼可見的穿幫,卡帕西倒也相當中肯。 他指出,Opus 5目前還無法真正“進入”自己生成的世界,只能在不同時間點不斷截圖,再慢慢檢查哪裡出了問題。 而這恰恰暴露了當前大模型的一塊明顯短板: 它們已經能寫程式碼、搭場景、生成遊戲,卻還不能真正看懂影片,也不會親自玩一遍自己做出來的遊戲。 兩小時,手搓一箇中土 咱們先來看這個“指環王”測試具體是怎麼做的。 如果按照卡帕西推文的字面意思,這次輸入給Opus 5的主要提示詞,應該就是《指環王》正文第一章《期待已久的宴會》的開頭。 袋底洞的比爾博·巴金斯宣佈要舉辦盛大的111歲生日宴會,霍比屯立刻議論紛紛…… 有興趣的朋友可以自己試一下。 除此之外,卡帕西還在提示詞裡指定了Three.js,也就是一個用程式碼搭建3D場景的JavaScript庫。 由此,Opus 5要完成的任務,就是先讀懂《指環王》開頭的文字,再把它翻譯成一個能夠在瀏覽器中即時執行的3D世界。 整個過程中,Opus 5需要用多邊形拼出人物、建築和道具,把它們逐個放進x、y、z座標系,再安排好攝像機、燈光和動畫。 人物什麼時候移動,鏡頭往哪裡轉,燈光如何變化,場景中的物體又該如何互動,全部需要模型用程式碼定義。 雖然最後的畫面稱不上精緻,而且經常出現穿模、漂浮等問題,比如人物的身體和腦袋分離……但整套場景好歹被真正搭了起來。 需要注意的是,這和影片模型直接生成一幀幀畫素並不是一回事。 Three.js需要先把人物、物體和場景作為三維物件建立起來,再根據程式碼即時計算它們的位置、角度和運動狀態。 所以,我們看到的Demo並不是一段普通的AI生成影片,而是一個3D網頁場景執行時的錄屏。 不過,卡帕西在評論區也提到,程式化3D和影片生成並不是二選一。 有網友提議,可以把這個粗糙的Three.js錄屏交給Seedance充當參考影片,再讓影片模型用更高的畫質重新渲染一遍。 卡帕西很快表示贊同。 按照他的設想,程式化程式碼可以負責分鏡和控制,先把人物站在哪裡、鏡頭怎麼運動、劇情如何推進這些骨架敲定。 接下來再把錄屏交給Video-to-Video模型,讓它補上紋理、光影和細節,把整個中土世界的“賣相”拉滿。 至於音訊,Opus 5這次倒沒有一起包圓。 卡帕西表示,出於個人對音質的要求,最終使用的是ElevenLabs。 於是,開頭那段有畫面、有鏡頭、還有旁白的《指環王》Demo,就這麼橫空出世了。 卡帕西也已經將整個專案開源,具體連結可以參考文末。 網友比卡帕西有意思多了 就在卡帕西放出Demo後,不少網友也趕來測試了一番。 整體看下來,只能說: 這屆網友比卡帕西有想像力多了。 有人用Claude啟動了一個「Earth Online」專案,目標是靠一群AI Agent,把整個地球一點點搭出來。 目前,Agent還沒造完整個地球,只搭出了一個低多邊形風格的舊金山濱水區。但從現有畫面來看,建築比例、人物尺度和整體風格都保持得相當統一。 這個效果有點像那種樂高世界的動畫片。畫風不複雜,但人物、場景和動作能在同一個世界裡穩定執行。 照這個方向繼續走,簡單畫風的動畫和輕量遊戲,已經有了點AI原生的雛形。 還有網友用Fable 5和GPT-5.6 Sol搭出了紐約市的3D數字模型,並在其中接入即時資料。 模型不僅要把紐約的街道和建築擺對,還要維持不同區域之間的空間關係。作者也因此提出,這種生成虛擬世界的任務,或許可以成為一種新的空間推理Benchmark。 更誇張的還在後面。 有網友沒買到Kanye West的演唱會門票,乾脆用AI在瀏覽器裡給自己補辦了一場。 整個專案依舊由Three.js搭建。只有一個HTML檔案,沒有呼叫任何現成的3D模型,舞臺、人物和燈光全部由程式碼生成。 整場演唱會一共準備了14首歌,每首歌都有獨立的燈光設計和一套專屬的球形舞臺視覺。 普通使用者可以試聽片段,連線Spotify Premium後,還能播放完整曲目和整場演出。 沒搶到票,直接給自己生成一個包場,太虧賊了! 還沒完!!! 卡帕西在原帖末尾還暢想,後續可以給這些3D世界加入玩法,讓玩家以旁觀者、NPC甚至故事角色的身份進入其中。 結果遊戲版本還沒等卡帕西安排,網友已經做出來了。 這個專案同樣使用Opus 5和Three.js,不僅能執行和互動,連音訊都配上了。 更多3D設計案例也在不斷出現。從建築比例、空間佈局到場景風格,Opus 5已經能在規模不小的專案裡維持相對穩定的一致性。 類似例項還有很多,這裡就不逐個展示了。 客觀來講,這些作品距離真正成熟的遊戲仍有距離。 眼花繚亂的玩法是否有趣、長時間執行是否穩定、玩家會不會真的願意在裡面待上15分鐘,目前都還沒有答案。 但即時3D內容和可玩原型的製作門檻,確實被向下推了一大截。 更何況,能有一種新的方法測試模型能力,同時又足夠有趣、好玩,豈不美哉? 鵜鶘,騎到頭了 那麼,為啥突然要讓大模型生成《指環王》呢? 這還得從前幾年爆火的“鵜鶘騎腳踏車”測試說起。 這道題最早來自開發者Simon Willison,要求只有一句話: 生成一張鵜鶘騎腳踏車的SVG圖片。 雖然這題目看起來簡單,但其實它相當考驗模型。 因為SVG看起來是一張圖片,底層卻是一串程式碼。 模型不僅要知道鵜鶘和腳踏車分別長什麼樣,還得把它們拆成線條、圓形和多邊形,再用座標安排好每個部件的位置關係。 更關鍵的是,鵜鶘和腳踏車本身就不怎麼般配。 腳踏車的車架、輪胎和踏板必須保持正確的幾何結構;鵜鶘則長著大嘴、短腿,以及一副怎麼看都不像會蹬車的身材。 兩者一組合,模型到底有沒有理解空間關係,幾乎一眼就能看出來: 輪子歪沒歪、腳踩沒踩到踏板、鳥到底是在騎車,還是被車架當場肢解。 看看上面這些24年年底的demo吧~ 正因如此,“鵜鶘騎腳踏車”一度成了民間觀察大模型空間理解、物體組合和程式碼生成能力的經典測試。 但隨著模型越來越強,這隻鵜鶘也快騎到頭了。 看看下面DeepSeek R1和DeepSeek V4的表現就知道,如今的模型已經能把這道題完成得相當像樣。 更重要的是,一張SVG只能考察模型的一次性輸出。 它測不出模型能不能規劃一個複雜專案、連續工作幾個小時,並在幾千行程式碼裡反覆檢查和修正自己的錯誤。 於是,卡帕西把一道“畫張圖”的小題,換成了“搭個世界”的大工程—— 鵜鶘可以下車了,中土世界正式接棒。 卡帕西的鵜鶘 很快,卡帕西準備給“鵜鶘測試”換題的訊息,也傳到了各大社群。 Hacker News的高贊評論認為,雖然這些Demo的畫面質量都很一般,但這恰恰說明,我們需要一個比生成單張圖片更難的新測試。 新的基準不該只看模型能不能把圖畫對,還要考察它能不能理解一個世界。 畢竟,“鵜鶘騎腳踏車”已經用了太久。 模型不斷針對這類任務刷榜,彼此之間的差距越來越難看出來。 相比之下,生成一個完整的3D世界,需要模型理解人物和物體之間的空間關係,處理鏡頭、動作和場景變化,而不是簡單呼叫影片生成模型吐出一段畫面。 當然,也有人提出反對意見。 鵜鶘測試足夠簡潔,成本低,結果也容易比較。 為了測一次模型,消耗那麼多Token生成整個3D世界,多少有點拿算力放煙花的意思。 與此同時,Three.js本身能不能衡量大模型的綜合能力,也遭到了質疑。 有人認為,這類Demo最多隻能證明Anthropic在Three.js程式碼上訓練得不錯,不能說明模型真的理解了空間和物理世界。 但很快就有網友反駁: 把一段抽象、含義模糊的文學文本轉化成3D動畫,模型需要同時處理空間關係、物理規律、日常物體,以及3D變換和計算機圖形學中的數學問題。 如果這還只能算“會寫Three.js”,多少有點低估這5500行程式碼了。 還有網友提出了一個更開放的問題: 所謂“空間推理”,真的和大模型平時處理文字、程式碼時的推理不同嗎? 一種觀點認為,畫面能否成立,取決於模型是否理解“前後、內外、遠近、遮擋”等空間關係,以及物體在不同視角下的距離、角度和相對大小。 但另一種觀點認為,無論模型處理的是“石頭旁邊”,還是“數組裡面”,做的可能都是同一件事:根據上下文逐個生成Token,並在這個過程中完成推理。 如果是這樣,那麼,Opus 5展示的就不只是一項突然冒出來的“空間能力”。 更可能的情況是,大語言模型原本用於理解文字和程式碼的通用推理能力,已經開始自然延伸到三維世界。 從畫一隻鵜鶘,到搭出一箇中土世界,題目看起來變了,但背後測試的或許始終是同一個問題: 模型能不能把自己對世界的理解,轉化成一套真正能夠執行的結構。 而在最後,也許還有一個更加離譜的問題—— 如果通用大模型已經能夠自己寫程式碼搭建3D世界,再呼叫Seedance、ElevenLabs等API完成畫面和聲音,那麼使用者還有多少必要,親自開啟一個專門的影片生成產品輸入Prompt? 參考連結 [1]https://karpathy.ai/lotr-movie/ [2]https://simonwillison.net/2025/Jun/6/six-months-in-llms/ [3] https://x.com/wizardbrainz/status/2083012159341203708 [4]https://x.com/aniketjart/status/2083645765097033845 [5]https://x.com/davidfromkansas/status/2075691129899528254 [6]https://x.com/MindaugasLT/status/2083488027343470939 版權所有,未經授權不得以任何形式轉載及使用,違者必究。 henry 智元下架了首席科學家羅劍嵐 2026-08-07 全新統一流式架構,Vivix靈動時刻正式釋出首個即時互動模型 2026-07-25 GPT-5.6自己最佳化自己實錘了,新的左腳踩右腳已經出現 2026-07-30 李飛飛的世界模型,終於開始訓練機器人了 2026-07-30

tencent/hy3:free 自動生成