Mistral Large 4 發布:1 兆引數多模態模型
Mistral Large 4
Mistral Large 4 以 1 兆引數的多模態架構,展現編碼、代理工作流與安全領域的領先表現。
- 引數與架構:1 兆引數、49 B 活躍引數,支援文本、影像與多模態輸入。
Mistral Large 4 以 1 兆引數的多模態架構,領先編碼、代理工作流與安全領域,可供企業評估自主管理與安全研究的適用性。
Le Chonk
今天,我們將推出 Mistral Large 4 的 公開預覽。非正式稱為 ML4,正式名稱:le Chonk。ML4 推動開放權重表現的前沿。你可以在 Mistral Studio 今日試用預覽 API。本月末將釋出權重。
前沿效能
ML4 是一個 1 兆引數、原生多模態模型,擁有 490 億個活躍引數。它是我們迄今為止最大的、最強大的模型,並在我們進一步最佳化時持續快速提升。
該模型在編碼、智慧代理工作流程和多模態理解方面展現卓越表現。它已經達到與全球最強大開源模型競爭的水平,並顯著優於在美國或歐洲開發的任何開放權重模型。在包括網路安全、金融與法律等關鍵企業工作負載中,我們發現它在開放模型中屬於最先進。某些領域如視覺定位,它甚至更進一步,超越了前沿封閉模型。
我們將於本月底釋出權重。在此之前,我們正與網路安全領袖、審核過的合作夥伴以及國家機構進行實際環境的紅隊測試,他們將以降低審查、擴充網路能力的方式存取同一模型。
歐洲鍛造。為 AI 主權而建。
ML4 是從零開始在 Mistral 自己位於歐洲的資料中心使用 3,800 臺 NVIDIA Grace Blackwell GPU 訓練的。公開預覽同樣在該基礎設施上提供。這是我們在基礎設施、研究和產品開發方面長期投資的一個重要里程碑:在關鍵垂直領域提供最先進的表現,通過開放權重交付,通過開放權重交付,旨在讓客戶掌控自己的 AI。
這在網路安全領域尤為重要,因為供應商層級的拒絕可能阻礙合法的漏洞研究和事件回應,而在事件進行中失去對某項功能的存取本身就可能成為一項關鍵安全風險。ML4 將頂級網路安全表現與開放權重及自我部署相結合,為組織提供能力與自主權,能在自身政策下執行先進的安全工作。
該模型將在全球多個地區提供服務,包括 Mistral 全程獨立運營、與其他數位服務供應商分離、並遵循歐洲法律的歐洲部署。趣事:ML4 訓練資料中相當大一部分是多語言,涵蓋 160 多種語言,包括歐盟所有官方語言。
我們已與全球領先企業在金融、工程、製造、物流、製藥、科學、航運、公共部門以及其他關鍵產業密切合作,以訓練 ML4。實際上,該模型使用與我們透過 Mistral Forge 提供給客戶的相同訓練、客製化與強化學習環境。
立即試用
還有更多內容即將推出。在我們推進權重釋出過程中,我們將分享更多關於模型架構、額外基準測試以及後續訓練方法的細節。
此模型亦將作為新一代專業化、最佳化 Mistral 模型的基礎。與此同時,我們邀請您 試用預覽 API,並在社群媒體上與我們分享您的回饋。
功能深度剖析
網路安全
ML4 是全球最強的網路安全 AI 模型之一。根據人工分析網路指數(Artificial Analysis Cyber Index),這是一項獨立評估 AI 模型在實際軟體中尋找並修補安全漏洞的效能,它在全球排名前五,並以寬幅領先於中國以外開發的開放權重模型。在該指數的一項測試中,要求模型重現開源軟體中的真實漏洞並進行修補,ML4 得分 82%,為所有模型中最高。它亦解決 Cybench 40 題安全競賽挑戰中的 93%,為開放權重模型報告的最高分之一。
這一高分體現了實際優勢。包括 Claude Opus 5.5、GPT-6 Astra 在內的數個領先封閉模型,在同一測試中得分接近零,因為它們拒絕執行此任務。然而,防禦軟體往往從證明漏洞真實性開始,這正是封閉模型安全過濾器會阻擋的工作。隨著威脅行為者越來越多地越獄同樣的模型以支援攻擊性網路活動,這一問題更加重要:防禦者需要能匹配這些能力但不受同樣拒絕限制的系統。ML4 能完成此工作,其能力還超越了明確訓練範圍:在內部測試中,它證明對分析惡意軟體、優先排序漏洞、撰寫偵測規則皆有幫助。對於需要主權、可審計 AI 的安全運營組織,ML4 可在私有雲或本地環境執行。
ML4 對比現場:高效推理多樣複雜挑戰
惡意軟體逆向工程:解決分佈外調查任務
代理式編碼
ML4 在軟體工程、倉儲理解與複雜終端工作流程上表現卓越,分別在 DeepSWE v1.1、SWE-Atlas-QnA、Terminal-Bench 4 上得到 61.7%、59.4% 與 28.3%。其綜合編碼代理指數 49.8%,高於 DeepSeek V4 Pro 0813 與 Qwen3.8 Max。
我們亦與 Surge AI 進行盲測人類評估,針對編碼品質:專業標註者以 1–5 分級評分模型輸出,且隱藏模型身分。ML4 Preview 在五個模型中排名第二(3.74),高於 Kimi K3(3.59)、GLM-5.3(3.60)與 GLM-5.2(3.40),僅落後 Claude Opus 5(4.22)。
%25201_20jgWu.webp%3Fdpl%3D6ac516f190c69e0008d46233&mode=full&exp=1791504000&sig=408532bbc9ce52f5)
代理式工作流程
ML4 執行通用代理,收集資訊、使用工具並在複雜工作流程中產出完成交付物。在 AutomationBench——涵蓋 Gmail、Google Sheets、Slack、Salesforce 等 657 個商業工作流程——其得分 59.9%,高於 Kimi K3、MiMo-V2.6-Pro 與 DeepSeek V4 Pro。
在知識工作實際產出的專業交付物(試算表、簡報、PDF)上同樣強勢。在 AA-Briefcase(評估長期知識工作)中,它達到 1,393 Elo,領先 DeepSeek V4 Pro。

多模態
ML4 在模型理解影像的能力上實現了突破。它能在複雜檔案、圖表與自然影像中進行強大推理,並將視覺技術帶入對感知至關重要的產業,例如工程、製造與地球觀測。
此模型可進一步結合視覺定位與代理能力:從檢視千兆畫素衛星影像—協助災害應變團隊在時間關鍵時刻行動—到分析工程圖—放大、檢查、驗證直到答案精確。上述示範中,ML4 能定位密集自然場景、驗證技術圖中的機械零件、從 PDF 中提取證據,並掃描龐大地理空間影像尋找最難尋找的物件。
在視覺定位方面,我們發現 ML4 是我們測試的最強模型之一,例如在 Dense 200 上超越 GPT-6-Astra(42% vs 41%)。
科學與數學
ML4 具備強大的科學能力,透過結合 AI 驅動的方法與我們研究人員在數學、物理與化學方面的專業知識打造。
它在代理編碼方面對科學任務(如資料分析、建模與模擬物理現實)極為熟練,讓研究者能專注於問題本身,而非底層實作。在基準測試中,ML4 在開放權重模型中於 SciCode-Verified 取得最先進表現。實際上,它能一次性產生完整的 Hartree–Fock 模擬—一項由多個進階流程組成的複雜化學任務。
ML4 的數學能力亦更強,無論是形式推理還是應用數學。在我們的人類評估中,它的推理更精確、結構更完整,優於 GLM-5.3,並能持續處理長時間、領域特定的應用數學任務,包括與前沿理論物理相關的工作。
綜合這些能力,ML4 成為跨越完整技術工作流程的強大研究助手——從第一個問題到最終結果。
-alt_ZYLgs8.webp%3Fdpl%3D6ac516f190c69e0008d46233&mode=full&exp=1791504000&sig=1c335dc7a2fbc1fc)
SciCode-Verified 測試模型在物理、數學、材料科學與生物學等領域實作複雜科學工作流程的能力。

ML4 與 GLM5.3 在 STEM 任務(數學與物理)上的內部評估
知識工作
ML4 是我們在實務中日常專業人員處理的任務中最強大的模型。它能建立、編輯及修正複雜的試算表與檔案,在法律與財務基準上均展現卓越表現。
值得注意的是,我們透過第三方評估者(vals.ai)在法律與財務代表性任務上評估 ML4,發現模型在兩者上均超越 GPT-6-Astra。在 HarveyAI 的 Legal Agent 基準中,ML4 超越所有開源模型。
FinWorkBench 測試模型在實際財務與會計應用案例中建立/編輯試算表的能力。
財務分析需要精確度與從多個來源綜合資訊的能力,這一過程在許多金融機構仍耗時。於本示篋中,ML4 與其他頂級 OSS 模型一起面對相同的多步企業財務挑戰,搜尋公開公司檔案與財務報告,例如透過 EDGAR 及同等的歐洲資料庫可取得的檔案。動畫語意圖追蹤每個模型尋求解答的過程,突顯沿途取得的每份檔案。每條軌跡的位置反映所收集的證據、計算結果以及仍未解決的問題。觀眾可追蹤調查的展開,並比較各模型在達成最終答案前所採取的不同路徑。
模型安全
ML4 已經在我們關於間接提示注入的穩健性基準上飽和,使其成為 OSS 模型的前沿(與 GLM-5.2、GLM-5.3、Kimi-K2.6、Kimi-K3、DS-V4-Pro-0813 相比)。在 Lakera 的公開 B3 AI Security Benchmark 上,ML4 抵禦了 93.3% 的攻擊——我們在競爭對手中沒有更高的分數。
ML4 也比我們以往的任何模型更負責任地與使用者互動。我們在 KORA Benchmark 上突顯了我們的結果,ML4 再次成為 OSS 模型中測量最高的分數(1.691,2 為最大值,標記為“Exemplary”)。
尤其相關的是模型拒絕有關網路安全的惡意請求的傾向。儘管在網路安全基準上表現強勁,模型在來自 JailbreakBench、StrongREJECT 和 AgentHarm 的網路提示上的平均拒絕率高於所有 OSS 模型。
人類評估
我們進行了一項內部評估,邀請在編碼、電腦輔助設計(CAD)、財務、數學和物理領域的專業標註者將 Mistral Large 4 與 GLM-5.3 進行比較。ML4 在 CAD 和 STEM 領域更受偏好,而在財務和編碼方面則與 GLM-5.3 的表現相當或接近。

大規模強化學習
基礎模型正在快速進步,我們的後訓練也必須跟上。針對昨日模型調校的方案,在今日前沿會留下能力空白,因為曾經推動模型達到極限的真實樣本現在已不再適用。我們使用強化學習(RL)是因為它會隨模型而適應:我們在模型自身嘗試的結果上進行訓練,並可隨著模型變強提升任務的難度與範圍。
我們的 RL 圖書館旨在使新增環境變得簡單且可擴充套件。共享且可組合的介面允許一次訓練執行結合從單回合聊天、複雜科學問題解決,到安全對齊、事實性和長期工具使用等任務。這些環境共用腳手架和資源,例如程式碼沙盒、網路搜尋和外部 API。相同的可組合性也延伸到驗證,將獎勵模型、單元測試、LLM 判斷者和靜態檢查按需結合於每項任務。
執行時,使用自動擴縮的工作者群體並行產生數萬次回放,同時模型訓練以非同步方式進行。產生與訓練管線針對長路徑進行最佳化,支援跨多個壓縮的數百萬 token 回放預算,同時保持陳舊度低。兩階段的創新方法與最佳化最小化離線漂移,並使長期穩定的 RL 成功。
在我們目前的規模(3k GPU)下,一次訓練執行每天大約產生 33 億 token,其中約 16 億是可訓練的完成 token,經過過濾與遮蔽後。透過訓練回放可直接觀察執行進度:隨著策略學習解決越來越複雜的任務,訓練獎勵在多個代表性環境中上升。以下是幾個例子。

改進並非僅針對我們訓練的環境;它們會轉移到下游評估,最終模型的提升歸功於兩個後訓練階段(監督式微調和 RL),如圖表所示。

接下來會怎樣
這只是個開始。ML4 是我們由 €30 億歐元 Series D 資金支援的路線圖上的第一個里程碑 — 迄今為止歐洲科技公司籌得的最大股權募資額。這筆資金已經開始投入使用:我們正大幅擴充自有歐洲資料中心的運算能力,且未來幾個月還會有更多升級投入使用。
更多運算力就意味著更多訓練。這個預覽背後的強化學習作業仍在進行中,模型尚未顯示任何飽和跡象 — 仍有相當的提升空間。隨著我們在擴充後的基礎設施上加速訓練,我們預期在未來數週數月內將迎來顯著且快速的進步。
我們將於本月底釋出權重,並提供更詳細的架構資訊、額外基準測試以及我們的後訓練方法論。ML4 只是一個基礎:它將作為新一代專業化、最佳化的 Mistral 模型的基底,這些模型針對客戶最關心的產業與工作負載而打造。
從現在開始進展速度將會很快。敬請期待。
來源:hackernews100 · mistral.ai