Latent Space ★ 65 2 min

[AINews] Claude Opus 5: Fable-level performance at Opus price (half Fable)

🔗 https://www.latent.space/p/ainews-claude-opus-5-fable-level

這是一篇針對「產業新聞」型別的技術報導。

📌 【Anthropic 新動態】Claude Opus 5 發布:以半價效能直逼 Fable

TL;DR:Claude Opus 5 正式推出,實測表現與 Fable 旗鼓相當,引發對評估基準(Evals)有效性的討論。

🎣 Opus 5 登場:是技術突破還是評估基準的侷限?

Anthropic 釋出的 Claude Opus 5 在社群中引發熱議。雖然官方對外的說法是「接近 Fable」,但從目前的基準測試來看,Opus 5 在技術指標上已略微超越了 Fable。這反映出當前 AI 評估(Evals)的困境:目前的測試可能難以完全捕捉到模型在實際應用中的強大能力。

🧩 基準測試與實際體感存在落差

根據 Epoch 的資料顯示,Claude Opus 5 的 ECI 指標為 159,略低於 Fable 5 的 161;但在軟體工程基準測試 SWE-ECI 上,Opus 5 則與 Fable 5 同樣達到 161。

📊 使用者反應:實測表現可能被低估

儘管資料顯示僅比前代 Opus 4.8 有微幅提升,但許多使用者在實際使用中給予高度評價,認為它在各方面的表現都「好得多」,並直言目前的基準測試可能低估了 Opus 5 的實際進步,呼籲需要更具挑戰性的公開測試。

💡 測試資料出現異常現象

在 FrontierCode 的測試中,研究者發現了一個有趣的現象:Opus 5 在「中等難度(medium effort)」下的得分,竟然比「高難度(higher effort)」時的得分還要好。

🎯 實務啟示

對於開發者而言,Opus 5 在 Coding Agent(程式碼代理)與工具使用(如瀏覽器自動化)工作流中展現了強大的潛力。面對基準測試與實際體感之間的落差,工程師在評估模型時,除了參考 ECI 等資料,更應關注模型在特定工作流中的實際表現。

🔗 來源

#AI #Anthropic #ClaudeOpus5 #MachineLearning #LLM #Benchmark #SoftwareEngineering #CodingAgent #AIModel #LatentSpace

tencent/hy3:free 自動生成