资讯模型与产品··来源: VentureBeat·原文 →

Nous Research 釋出開原始碼模型 NousCoder-14B,4 天訓練挑戰 Claude Code

獲加密風投 Paradigm 支援的開源 AI 初創公司 Nous Research 釋出 NousCoder-14B 程式設計模型,僅用 48 張輝達 B200 GPU 訓練 4 天即達 67.87% LiveCodeBench 準確率,超越基座模型 7 個百分點。釋出時機恰逢 Anthropic Claude Code 引發社交媒體熱議,開源與閉源程式設計助手競爭白熱化。

Nous Research 釋出開原始碼模型 NousCoder-14B,4 天訓練挑戰 Claude Code
[广告位 · 上线后接 AdSense]

4天訓練吊打閉源巨頭,開源程式設計模型殺瘋了

加密風投Paradigm押注的開源AI新秀Nous Research本週放大招,推出新一代程式設計模型NousCoder-14B——僅用4天時間和48張輝達B200顯示卡,就在程式設計競賽任務中幹翻多個閉源大模型。

這波操作時機很妙。元旦以來,Anthropic的Claude Code持續霸榜熱搜,開發者集體高潮。谷歌Gemini API負責人Jaana Dogan上週在X平臺發帖引爆全網:"我給Claude Code描述需求,1小時就搞定了我們團隊去年肝了一年的分散式智慧體系統!"

效能炸裂:直接碾壓基座模型7個點

技術報告顯示,NousCoder-14B在LiveCodeBench v6評測中拿下67.87%準確率。這個測試用的都是2024年8月到2025年5月的新題,比基座模型阿里的Qwen3-14B直接提升7.08個百分點

開源和閉源的這場Battle暴露了AI程式設計的進化速度:當Anthropic靠炫酷Demo吸粉時,Nous Research賭的是用可驗證問題訓練的開源方案也能打,而且模型透明度比啥都重要。

真·開源:連褲衩都給你看

和那些假開源選手不同,NousCoder-14B這次玩真的:不僅放出模型權重,還把強化學習環境、測試套件和訓練工具鏈全開源了——整套東西都基於自研的Atropos框架,有顯示卡就能復現。

X平臺老哥銳評:"Atropos技術棧開源,相當於給奧賽級推理研究送上了全家桶。"這對學術界意味著什麼,懂的都懂。

模型由Nous Research駐場研究員、前競賽大佬Joe Li操刀。技術報告裡還藏了個彩蛋(原文到這兒斷了,但按慣例會曝訓練過程中的騷操作)。

給中國開發者的啟示

這個案例對中國AI人有兩個暴擊:4天極限訓練工具鏈全開放。在算力貴上天的今天,Nous Research證明中小團隊只要最佳化訓練流程、死磕特定場景(比如程式設計競賽),照樣能搞出能打的模型。開源的Atropos框架更是直接給國內研究者送了套奧賽級訓練裝備,教育、競賽輔導這些場景直接抄作業就行。

業內共識是AI程式設計即將成為基操,這場開源閉源的大亂鬥,好戲才剛開始。

常見問題

NousCoder-14B 的 67.87% 準確率在業內處於什麼水平?

根據原文,該模型在 LiveCodeBench v6 基準上的表現與多個更大規模的專有系統相當或更優,比基座模型 Qwen3-14B 提升 7.08 個百分點。LiveCodeBench 採用 2024-2025 年最新競賽題目,67.87% 的準確率表明模型已具備較強的競爭性程式設計能力,但具體排名需參照同期其他模型的公開評測資料。

4 天訓練時間是否意味著任何團隊都能復現?

原文明確提到使用了 48 張輝達 B200 GPU。B200 是輝達最新一代資料中心 GPU(通常單卡成本數萬美元),48 卡叢集的硬體投入和電力成本仍然不低。不過相比動輒數週的大模型訓練,4 天週期確實大幅降低了時間成本,且 Nous Research 開源了完整訓練工具鏈,具備相應算力的團隊理論上可以復現。

Atropos 框架開源對中國開發者有哪些實際用途?

根據原文,Atropos 是 Nous Research 用於構建強化學習環境、基準測試和訓練工具的完整技術棧。開源後,國內研究者可直接用於:1)競賽程式設計輔導系統開發;2)垂直領域程式碼生成模型訓練(如特定框架或語言);3)教育場景的自動出題與評測;4)在開源基座模型上進行針對性微調實驗,而無需從零搭建訓練基礎設施。


本文基於 VentureBeat 報道, 由 AiDuo123 AI 編輯翻譯改寫。原文連結: https://venturebeat.com/technology/nous-researchs-nouscoder-14b-is-an-open-source-coding-model-landing-right-in

[广告位 · 上线后接 AdSense]
标签:#OpenAI

相关 AI 工具

文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾

浏览全部工具 →

同类资讯 — 由发布时间排序

蘋果手錶新 AI 功能引爭議:環境錄音與隱私的邊界在哪裡

蘋果手錶新 AI 功能引爭議:環境錄音與隱私的邊界在哪裡

蘋果在最新發佈會上為 Apple Watch 引入了 Live Rewind 和 Siri Recap 等即時音訊轉錄功能,允許使用者回溯 15 秒對話並自動生成會議摘要。儘管蘋果強調不儲存原始音訊且支援端到端加密,但這些"始終聆聽"的技術仍引發了關於同意權、法律證據效力及社交行為改變的廣泛討論,標誌著科技巨頭在 AI 競爭壓力下對隱私底線的重新定義。

应用与案例AI 安全
ControlAI 執行董事:超級智慧不是武器而是對手,應立法禁止開發

ControlAI 執行董事:超級智慧不是武器而是對手,應立法禁止開發

AI 安全非營利組織 ControlAI 美國執行董事 Connor Leahy 在 TechCrunch 播客中提出激進觀點:應通過立法完全禁止企業開發超級智慧(superintelligence),而非僅依賴對齊與遏制技術。他認為當 AI 能自主改進 AI 時將觸發失控迴圈,並透露美英兩國已有相關立法推進,包括 Sanders-Casar 提出的"禁止超級智慧法案"。

政策与安全OpenAI
五角大樓要求 OpenAI 提供"低拒絕率"軍用 AI 引發爭議

五角大樓要求 OpenAI 提供"低拒絕率"軍用 AI 引發爭議

據 The Intercept 報道,美國國防部曾要求 OpenAI 提供一個"極少拒絕執行"軍事指令的定製版 AI 系統。OpenAI 否認簽署過包含此類措辭的合同。這一事件再次引發關於 AI 安全護欄與軍事應用邊界的討論,對中國 AI 從業者理解大模型倫理約束具有參考意義。

政策与安全OpenAI
Meta 推出 Muse AI 智慧體,隱私信任成最大挑戰

Meta 推出 Muse AI 智慧體,隱私信任成最大挑戰

Meta 在達成 180 億美元和解協議後不到兩週,推出個人 AI 智慧體 Muse,可連線郵件、日曆、支付等服務代使用者執行任務。產品採用獨立虛擬機器架構保護隱私,但 Meta 多次違反隱私承諾的歷史記錄,令消費者信任成為產品成敗關鍵。

模型与产品Meta