跳到正文

全部動態

RSS
今日 23 則
7月30日週四
  1. Google DeepMind86

    Gemini Robotics ER 2:通過影片理解、任務編排與多機器人協作驅動機器人

    DeepMind 釋出 Gemini Robotics ER 2,作為其最新的“具身推理”模型,支援持續影片理解、任務編排和多機器人協作。該模型可與任何低層 VLA 模型配合,即時呼叫工具(如 Google Search),並在執行過程中保持推理,顯著提升任務完成率和安全性。

    推薦理由:Gemini Robotics ER 2 通過影片理解和多機器人協作提升機器人任務完成率,展示了高效即時推理與安全控制的結合。

  2. Google DeepMind62

    Google Flow Music 推出 Lyria 3.5,提升音樂性、歌詞、聲樂與創作控制

    Google DeepMind 在 Google Flow Music 上釋出了最新音樂生成模型 Lyria 3.5。該模型在旋律結構、歌詞質量、聲樂表現和發音方面都有顯著提升,並新增了對節奏和時長的細粒度控制,幫助使用者更輕鬆地創作符合預期的歌曲。

    推薦理由:Lyria 3.5 在音樂生成方面提升了旋律、歌詞、聲樂質量,並提供更細粒度的節奏與時長控制,幫助創作者更精準地實現創意。

7月27日週一
  1. Hugging Face Blog63

    NVIDIA 釋出 Cosmos-H-Dreams 即時生成式手術機器人模擬器

    NVIDIA 推出 Cosmos-H-Dreams,這是一個針對手術機器人的即時、動作條件生成式模擬器。該模型將 Cosmos-H-Surgical-Simulator 的能力蒸餾為因果學生模型,並通過 FlashDreams 庫在單張 NVIDIA RTX PRO 6000 GPU 上實現每秒約 160 幀的互動式執行,支援在閉環中進行策略評估和資料生成。

    推薦理由:官方推出的即時動作條件生成模擬器展示了手術機器人的互動式環境,讀者可以據此瞭解世界模型在醫療機器人領域的即時推理與應用進展。

7月21日週二
  1. Google DeepMind84

    Google DeepMind 釋出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

    Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 以及 3.5 Flash Cyber 三款新模型,旨在以更高效率和更低延遲支撐大規模 AI 智慧體工作流。

    推薦理由:官方釋出了三個新的 Gemini Flash 系列模型,給出了詳細的效能指標與價格,讀者可以據此評估其在智慧體工作流和高吞吐任務中的成本與效率。

7月17日週五
  1. Google DeepMind63

    Google DeepMind 釋出 Gemini 3.5 Flash Cyber 網路安全模型

    Google DeepMind 推出了基於 3.5 Flash 構建並針對網路安全任務微調的輕量化模型 Gemini 3.5 Flash Cyber,旨在幫助防禦者快速發現、驗證和修補軟體漏洞。

    推薦理由:Google DeepMind 推出了專為網路安全微調的輕量化模型,通過支援高頻率和多輪呼叫,在多個安全基準上展現了優於 mainline 模型和部分競品的漏洞挖掘能力。

7月15日週三
  1. Hugging Face Blog81

    Thinking Machines 釋出 Inkling 與 Inkling‑Small 模型

    Thinking Machines 在 Hugging Face 釋出了 Inkling 與 Inkling‑Small 兩個多模態 LLM。Inkling 是 1T 引數、1M 上下文視窗的開源模型,支援影像、文本、音訊輸入,並具備 agentic 能力。

    推薦理由:Inkling 通過支援 1M 上下文視窗和多模態輸入,提供了大規模開源模型的高效推理與部署方案,幫助開發者快速構建跨模態推理應用。在 Hugging Face 平臺上可一鍵部署,支援多種推理引擎,滿足大規模推理需求,並提供 1M 上下文視窗的高效推理體驗,適合多模態推理與微調場景。

7月8日週三
  1. Mistral AI67

    Mistral AI 釋出首款具身導航模型 Robostral Navigate

    Mistral AI 釋出首款具身導航模型 Robostral Navigate,這是一個 8B 引數量的模型,僅需單個普通 RGB 攝像頭和自然語言指令即可讓機器人在複雜環境中自主導航。該模型在 R2R-CE 未見驗證集上取得 76.6% 的成功率,在完全使用模擬資料和高效字首快取技術訓練的基礎上,結合了基於指向的導航與線上強化學習。

    推薦理由:該模型僅憑單個 RGB 攝像頭和 8B 引數量即在 R2R-CE 基準上取得領先成績,為具身智慧輕量化部署提供了新路徑。

7月2日週四
  1. Mistral AI64

    Mistral AI 釋出 Leanstral 1.5 形式化推理模型

    Mistral AI 釋出 Leanstral 1.5,這是一款採用 Apache-2.0 許可證、擁有 119B 總引數和 6B 啟用引數的開源形式化驗證模型。該模型經過中訓練、監督微調與 CISPO 強化學習,在 miniF2F、PutnamBench 以及 FATE-H 和 FATE-X 等基準測試中取得顯著效能提升,並支援通過 Hugging Face 和免費 API 獲取。

    推薦理由:文章詳細說明了 Leanstral 1.5 的引數規模、訓練階段與測試集表現,讀者可以據此評估該開源形式化驗證模型在數學推理和程式碼驗證上的實際效能。

7月1日週三
  1. Google DeepMind76

    Google DeepMind 釋出 Nano Banana 2 Lite 與 Gemini Omni Flash 模型

    Google DeepMind 推出兩款新模型:速度最快且最具成本效益的影像模型 Nano Banana 2 Lite,以及用於高質量影片生成和對話式編輯的 Gemini Omni Flash。

    推薦理由:Google DeepMind 推出 Nano Banana 2 Lite 與 Gemini Omni Flash 兩款新模型,為開發者串聯影像生成與影片編輯提供了低成本且高效的新方案。

6月30日週二
  1. Google Research63

    Google Research 釋出 TabFM:面向表格資料的零樣本基礎模型

    Google Research 推出了 TabFM,這是一個專為表格資料分類和迴歸設計的零樣本基礎模型。該模型通過將表格預測轉換為上下文學習問題,消除了傳統機器學習中的手動模型訓練、超引數調優和複雜特徵工程,能夠在單次前向傳遞中對未見過的表格生成高質量預測。

    推薦理由:Google Research 釋出了面向表格資料的零樣本基礎模型 TabFM,讀者可以據此瞭解大模型架構如何簡化分類和迴歸的工作流。

6月27日週六
  1. Google Research65

    Google Research:利用凍結的多Token預測技術在 Pixel 裝置上加速 Gemini Nano 模型

    Google Research 宣佈推出一項新架構,將多Token預測(MTP)技術應用到已部署且權重被凍結的 Gemini Nano v3 模型上。該方法採用零複製架構直接利用主模型的鍵值快取,在 Pixel 9 和 10 系列裝置上實現了 50% 或更高的推理速度提升,並減少了能耗。

    推薦理由:谷歌研究團隊通過在已凍結的 Gemini Nano 模型上應用多Token預測架構,在不增加記憶體冗餘的前提下顯著提升了端側裝置的推理速度與能效。

6月11日週四
  1. Google DeepMind75

    Google DeepMind 釋出 DiffusionGemma 開源文本擴散模型

    Google DeepMind 釋出了採用 Apache 2.0 協議開源的實驗性模型 DiffusionGemma,這是一款基於 Gemma 4 家族和 Gemini 擴散研究的 26B MoE 文本擴散模型,可在專用 GPU 上實現高達 4 倍的文本生成速度。

    推薦理由:該模型採用文本擴散架構實現數倍於傳統自迴歸模型的推理速度,為開發者探索本地即時互動工作流提供了新的硬體利用方式與微調路徑。

6月9日週二
  1. Google DeepMind81

    Gemini 3.5 Live Translate 即時語音翻譯實現流暢自然

    Gemini 3.5 Live Translate 是 Google DeepMind 推出的最新音訊模型,支援 70+ 語言的即時語音對語音翻譯。該模型可持續流式處理,幾秒延遲,自動檢測語言並保持語調、節奏與音高。

    推薦理由:Gemini 3.5 Live Translate 提供 70+ 語言的即時語音翻譯,減少停頓,適用於會議、通話等場景,幫助開發者快速構建多語言翻譯應用。支援多語言輸入,無需手動配置,噪聲魯棒性強,適合嘈雜環境。

  2. Google DeepMind86

    推出 Gemma 4 12B:無編碼器統一多模態模型

    DeepMind 推出 Gemma 4 12B,這是一款無編碼器的統一多模態模型,能夠直接在配備 16GB VRAM 的筆記本上執行。它在保持與 26B MoE 近似的推理效能的同時,顯著降低了記憶體佔用,並首次支援原生音訊輸入。

    推薦理由:Gemma 4 12B 以無編碼器的多模態架構實現低記憶體、強推理,適配本地 16GB VRAM 機器,讀者可據此評估在邊緣裝置上的部署可能。

5月22日週五
  1. Mistral AI87

    Mistral AI 釋出 Mistral Medium 3.5 與 Vibe 雲端非同步智慧體

    Mistral AI 推出 128B 開源旗艦模型 Mistral Medium 3.5,具備 256k 上下文視窗、可配置推理強度以及從頭訓練的視覺編碼器,並在 SWE-Bench Verified 上取得 77.6% 的成績。

    推薦理由:Mistral Medium 3.5 的釋出和雲端非同步智慧體能力的上線,展示瞭如何通過長上下文與多工具呼叫降低開發者的任務阻塞成本。

5月18日週一
  1. Google DeepMind86

    Google DeepMind 釋出 Gemini Omni 與首款模型 Gemini Omni Flash

    Google DeepMind 推出了全新多模態模型 Gemini Omni,併發布了該系列首款模型 Gemini Omni Flash,支援通過影像、音訊、影片和文本組合輸入生成及編輯影片。該模型已向 Gemini app、Google Flow 以及 YouTube Shorts 使用者推出,未來還將通過 API 提供給開發者和企業客戶。

    推薦理由:原文介紹了新模型的具體輸入組合和釋出範圍,讀者可以據此評估多模態影片生成與編輯的最新能力邊界。

5月16日週六
  1. Google DeepMind64

    Google DeepMind 介紹 WeatherNext 如何協助美國國家颶風中心預測颶風梅利莎

    Google DeepMind 的天氣模型 WeatherNext 成功提前五天預測了 2025 年颶風梅利莎在牙買加增強至五級強颶風的路徑與強度。該模型通過結合全球天氣模式與極端熱帶氣旋資料集,兼顧了傳統模型難以同時做到的路徑與強度預測能力。

    推薦理由:文章詳細記錄了 AI 天氣模型在颶風預報中的實際表現與提前天數,讀者可以據此評估其在極端氣象預測中的應用潛力。

4月16日週四
  1. Google DeepMind73

    Gemini 3.1 Flash TTS 釋出:下一代表達式 AI 語音模型

    Google DeepMind 推出了 Gemini 3.1 Flash TTS,提升了可控性、表達力和音質,支援 70+ 語言和多說話人對話,並通過細粒度音訊標籤讓開發者可用自然語言控制語音風格。該模型在人工分析 TTS 評測中獲得 1,211 Elo 分,並已在 Gemini API、Vertex AI 及 Google AI Studio 預覽。

    推薦理由:Gemini 3.1 Flash TTS 通過細粒度音訊標籤提升可控性與表達力,支援 70+ 語言,支援多說話人對話,適合企業與開發者構建多語種語音應用,且在人工分析 TTS 評測中獲得 1,211 Elo 分。

4月13日週一
  1. Google DeepMind75

    Gemini Robotics-ER 1.6:通過增強具身推理驅動真實世界機器人任務

    Google DeepMind 推出了 Gemini Robotics-ER 1.6,這是其專為機器人設計的最新模型,提升了空間推理、多視角理解和儀表讀取能力。該版本在安全性和物理約束遵守方面也有顯著改進,並已通過 Gemini API 和 Google AI Studio 對開發者開放。

    推薦理由:Gemini Robotics-ER 1.6 通過增強空間推理和多視角理解,顯著提升機器人在真實環境中的自主決策能力,並首次實現儀表讀取功能,為工業設施監測提供更高精度。該模型在安全性和物理約束遵守方面也表現出顯著改進,幫助機器人更安全地執行任務。

4月3日週五
  1. Google DeepMind69

    Gemma 4 釋出:最強開源模型

    Google DeepMind 推出了 Gemma 4,四種尺寸(E2B、E4B、26B MoE、31B Dense)支援多模態、長上下文(128K–256K)和 140+ 語言,具備高階推理、函式呼叫和程式碼生成能力,並以 Apache 2.0 許可免費開放,適用於從移動端到雲端的多場景部署。

    推薦理由:Gemma 4 以高效引數利用率和多模態能力,成為最強開源模型之一,支援從移動端到雲端的多場景部署,並提供 128K–256K 上下文視窗和 140+ 語言支援,兼具函式呼叫和結構化 JSON 輸出,滿足多行業需求。

3月17日週二
  1. Mistral AI84

    釋出 Mistral Small 4

    Mistral AI 釋出了 Mistral Small 4,這是一款統一推理、多模態與編碼功能的模型,採用 119B 引數、256k 上下文視窗,支援可配置推理強度,提供 40% 的延遲降低和 3 倍的吞吐量提升。該模型採用 Apache 2.0 許可,支援 vLLM、llama.cpp、SGLang 等開源框架,並已加入 NVIDIA Nemotron 聯盟。

    推薦理由:Mistral Small 4 將推理、多模態與編碼功能統一,提供可配置推理強度和高效推理,幫助使用者在單一模型中完成多種任務。

  2. Mistral AI68

    Leanstral 釋出開源可信 Vibe 編碼基礎

    Leanstral 是 Mistral AI 推出的首款專為 Lean 4 設計的開原始碼代理,採用 6B 活躍引數,支援在 Mistral Vibe 中零設定使用,並提供免費 API 端點。

    推薦理由:Leanstral 以 6B 引數實現高效 Lean 4 程式碼生成,成本低於主流模型,展示了開原始碼代理在正式驗證場景中的可行性。

2月5日週四
12月9日週二
12月3日週三
  1. Mistral AI83

    Mistral AI 釋出 Mistral 3 模型系列

    Mistral AI 釋出新一代 Mistral 3 模型系列,包含 14B、8B 和 3B 的 Ministral 3 端側稠密模型,以及採用稀疏 MoE 架構、啟用引數 41B 總引數 675B 的旗艦模型 Mistral Large 3。所有模型均採用 Apache 2.0 許可證開源,支援多模態與多語言能力,推理版本也將很快推出。

    推薦理由:原文釋出了包含稠密小模型與 MoE 旗艦大模型的全新模型系列,並全部採用 Apache 2.0 許可證開源,開發者和企業可直接藉此在多端與雲端部署前沿智慧能力。

7月15日週二
  1. Mistral AI86

    Mistral AI 釋出開源語音理解模型 Voxtral

    Mistral AI 釋出了開源語音理解模型 Voxtral,包含面向生產的 24B 規格與面向端側的 3B 規格,均採用 Apache 2.0 協議開源。該系列模型支援 32k 上下文、長達 30 至 40 分鐘的音訊處理、內建問答與摘要、多語言處理及函式呼叫功能,並在多項語音轉寫和理解基準測試中表現優異。

    推薦理由:該模型提供了兩種尺寸並開源,讀者可以根據自身算力條件選擇合適的版本進行本地部署或呼叫 API。

7月11日週五
  1. Mistral AI62

    Mistral AI 釋出 Devstral Medium 並升級 Devstral Small

    Mistral AI 與 All Hands AI 合作推出了 Devstral Medium 並升級了 Devstral Small 1.1。Devstral Small 1.1 採用 Apache 2.0 協議開源,在 SWE-Bench Verified 上獲得 53.6% 的分數;Devstral Medium 在 API 上線,得分達 61.6%,支援私有化部署與自定義微調。

    推薦理由:該釋出提供了兩款程式碼智慧體新模型的詳細效能和價格資訊,讀者可以藉此評估它們在特定開發任務中的價效比。

6月10日週二
5月28日週三
  1. Mistral AI61

    Mistral AI 釋出首個程式碼專用嵌入模型 Codestral Embed

    Mistral AI 釋出首個專為程式碼最佳化的嵌入模型 Codestral Embed,在真實程式碼資料的檢索任務中表現優於多個市場同類模型。該模型支援多維度與多種精度輸出,可在檢索質量與儲存成本之間進行靈活權衡。Codestral Embed 已在 API 上線,定價為每百萬 token 0.15 美元,同時提供批次 API 折扣及本地部署支援。

    推薦理由:原文公佈了專門針對程式碼檢索最佳化的嵌入模型及其定價和介面資訊,開發者可據此評估其在程式碼庫檢索和智慧體工作流中的效能與成本。

5月21日週三
  1. Mistral AI83

    Mistral AI 釋出 Devstral

    Devstral 是 Mistral AI 與 All Hands AI 合作推出的面向軟體工程的智慧體 LLM,已在 SWE-Bench Verified 上取得 46.8% 的得分。

    推薦理由:Devstral 在 SWE-Bench Verified 上顯著領先開源模型,並可在單張 RTX 4090 上本地部署,適合企業私有程式碼庫。

5月7日週三
  1. Mistral AI86

    Mistral AI 釋出 Mistral Medium 3 模型

    Mistral AI 宣佈推出 Mistral Medium 3 模型,在編碼和多模態理解等專業用例中具備前沿級效能,同時顯著降低了成本。該模型支援混合部署或本地部署、自定義後訓練及企業工具整合,API 定價為每百萬 token 輸入 0.4 美元、輸出 2 美元,現已在 Mistral La Plateforme 和 Amazon Sagemaker 等平臺上線。

    推薦理由:官方公佈了該新模型的具體基準表現和定價,讀者可以據此評估其在企業級應用中的價效比。

3月17日週一
  1. Mistral AI65

    Mistral AI 釋出 Mistral Small 3.1 模型

    Mistral AI 宣佈推出 Mistral Small 3.1,這是一款在其體量級別表現出色的開源模型。該模型帶來改進的文本效能、多模態理解以及高達 128k tokens 的上下文視窗,並以 Apache 2.0 許可證開源。

    推薦理由:原文給出了開源模型的新版本效能與多維度升級,讀者可以據此評估其在端側和多模態任務中的應用潛力。