引入 CARE-X:通過輔助監督、獎勵對齊學習與工具增強測量邁向臨床有用的放射學 VLM
Microsoft Research 推出了研究模型 CARE-X,這是一款旨在兼顧自由文本推理與確定性輸出的統一胸部 X 光 VLM。該模型結合了生成式與判別式能力,並通過強化學習(DAPO)在多工設定中最佳化臨床準確性。研究還線上路實驗中搭配了 Qwen3-VL-4B-Instruct 與確定性測量工具以評估效能。
Microsoft Research 推出了研究模型 CARE-X,這是一款旨在兼顧自由文本推理與確定性輸出的統一胸部 X 光 VLM。該模型結合了生成式與判別式能力,並通過強化學習(DAPO)在多工設定中最佳化臨床準確性。研究還線上路實驗中搭配了 Qwen3-VL-4B-Instruct 與確定性測量工具以評估效能。
Meta 推出了全新的 30B 引數開源多模態模型 Muse Glimmer,採用 Apache 2.0 協議釋出,專門面向本地智慧體和隱私保護應用。該模型結合了 2B 的視覺感知編碼器與 28B 的文本解碼器,支援影像、影片理解以及多模態工具呼叫,並提供 transformers、llama.cpp 和 vLLM 的首日支援。
推薦理由:文章詳細介紹了 Meta 開源多模態模型 Muse Glimmer 的架構設計與本地部署方法,讀者可以據此瞭解其在端側智慧體和多模態任務中的應用潛力。
Mistral AI 釋出了 Shieldstral,這是一款 3B 引數的開源多模態安全分類模型,採用 Apache 2.0 協議開源。該模型將內容稽核轉換為策略自適應的問答任務,允許在推理時通過自然語言指定策略,從而無需重新訓練即可統一處理文本和影像安全評估。
推薦理由:該模型通過將內容稽核轉化為推理時的自然語言問答任務,避免了傳統方案因固定分類體系而需要重新訓練的限制。
DeepMind 釋出 Gemini Robotics ER 2,作為其最新的“具身推理”模型,支援持續影片理解、任務編排和多機器人協作。該模型可與任何低層 VLA 模型配合,即時呼叫工具(如 Google Search),並在執行過程中保持推理,顯著提升任務完成率和安全性。
推薦理由:Gemini Robotics ER 2 通過影片理解和多機器人協作提升機器人任務完成率,展示了高效即時推理與安全控制的結合。
NVIDIA 推出 Cosmos-H-Dreams,這是一個針對手術機器人的即時、動作條件生成式模擬器。該模型將 Cosmos-H-Surgical-Simulator 的能力蒸餾為因果學生模型,並通過 FlashDreams 庫在單張 NVIDIA RTX PRO 6000 GPU 上實現每秒約 160 幀的互動式執行,支援在閉環中進行策略評估和資料生成。
推薦理由:官方推出的即時動作條件生成模擬器展示了手術機器人的互動式環境,讀者可以據此瞭解世界模型在醫療機器人領域的即時推理與應用進展。
Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 以及 3.5 Flash Cyber 三款新模型,旨在以更高效率和更低延遲支撐大規模 AI 智慧體工作流。
推薦理由:官方釋出了三個新的 Gemini Flash 系列模型,給出了詳細的效能指標與價格,讀者可以據此評估其在智慧體工作流和高吞吐任務中的成本與效率。
Google Research 推出了 SensorFM,這是一個在大規模未標註可穿戴感測器資料上預訓練的大型感測器基礎模型。該模型使用超一萬億分鐘的多模態感測器訊號進行自監督訓練,能夠跨越心血管、代謝、睡眠和心理健康等多個領域進行通用表徵,並支援構建更精準的個人健康智慧體。
推薦理由:研究展示瞭如何利用大規模未標註感測器資料訓練通用生理表徵,讀者可以瞭解其在多工泛化和健康智慧體中的表現。
Mistral AI 釋出首款具身導航模型 Robostral Navigate,這是一個 8B 引數量的模型,僅需單個普通 RGB 攝像頭和自然語言指令即可讓機器人在複雜環境中自主導航。該模型在 R2R-CE 未見驗證集上取得 76.6% 的成功率,在完全使用模擬資料和高效字首快取技術訓練的基礎上,結合了基於指向的導航與線上強化學習。
推薦理由:該模型僅憑單個 RGB 攝像頭和 8B 引數量即在 R2R-CE 基準上取得領先成績,為具身智慧輕量化部署提供了新路徑。
LeRobot v0.6.0 引入了世界模型策略、全新的視覺語言動作模型和統一的獎勵模型 API,同時帶來了六大模擬評測基準、全新的部署命令列工具以及深度感知和資料自動標註能力。此次更新還優化了資料集載入速度,實現了完全分片資料並行訓練和雲端訓練支援,並大幅精簡了基礎安裝包的依賴。
推薦理由:該版本閉環了機器人學習流程,使用者可以據此瞭解開源機器人框架在世界模型和評測方面的新能力。
2026 年,Berkeley Artificial Intelligence Research (BAIR) Lab 慶祝其畢業生的成就。他們的研究涵蓋機器人、LLM、計算機視覺、生成模型、AI 安全、人機互動、科學與醫療 AI,並已發表影響力論文、構建實用系統、指導同輩。畢業生正投身學術、工業研究實驗室及創業公司,期待未來發展。
Google Research 釋出了擴充套件後的建築級屋頂反射率資料集,覆蓋全球 50 多個城市,旨在幫助城規劃者實施清涼屋頂解決方案以緩解極端熱浪。該資料集通過全新的高解析度 Heat Resilience Earth Engine App 公開提供,結合衛星資料與機器學習模型實現了 30 釐米的高空間解析度。
Google DeepMind 推出兩款新模型:速度最快且最具成本效益的影像模型 Nano Banana 2 Lite,以及用於高質量影片生成和對話式編輯的 Gemini Omni Flash。
推薦理由:Google DeepMind 推出 Nano Banana 2 Lite 與 Gemini Omni Flash 兩款新模型,為開發者串聯影像生成與影片編輯提供了低成本且高效的新方案。
Mistral AI 釋出 Mistral OCR 4 模型,提供文件解析功能,除提取文本外還返回邊界框、塊分類和行內建信度分數。該模型支援 170 種語言,可在單容器中執行以用於自託管部署,並通過 API 或 Document AI 提供支援。
推薦理由:該模型支援多語言及單容器私有化部署,為企業級檢索和智慧體工作流提供了帶邊界框和置信度的結構化文件解析能力。
Google Research 開發了一個高解析度深度學習框架,將衛星影像轉化為英格蘭全境林籬、石牆和樹叢的向量化資料集。該框架基於在超 3 億張全球衛星影像上預訓練的 ViT Backbone,並結合雙層標註系統與多邊形緊湊度評分,有效解決了複雜空間拓撲與計算規模等技術難題。這一新資源賦能土地所有者與自然保護主義者測量並擴充套件微觀生態特徵,在不損害糧食安全的前提下應對氣候與生物多樣性危機。
Google Research 分享了關於消費者理解皮膚科 AI 工具的研究,指出結構化 AI 輔助能顯著提升使用者識別皮膚狀況的能力與準確率。在一項針對 2,345 名參與者的研究中,使用 AI 工具組的病情命名準確率達到 23%,接近未輔助對照組 8% 的三倍。然而,由於資訊通用性限制,標準 AI 組在確定後續醫療行動時的準確率並未表現出顯著提升。
DeepMind 推出 Gemma 4 12B,這是一款無編碼器的統一多模態模型,能夠直接在配備 16GB VRAM 的筆記本上執行。它在保持與 26B MoE 近似的推理效能的同時,顯著降低了記憶體佔用,並首次支援原生音訊輸入。
推薦理由:Gemma 4 12B 以無編碼器的多模態架構實現低記憶體、強推理,適配本地 16GB VRAM 機器,讀者可據此評估在邊緣裝置上的部署可能。
Google Research 推出了被動心率監測系統(PHRM),利用智慧手機前置攝像頭在日常面部解鎖後進行影片採集,通過深度學習實現全膚色覆蓋的心率與靜息心率精準追蹤。該研究結合實驗室與真實世界評估,在各類膚色上均達到了與穿戴裝置相當的準確率,並同步開源了相關資料集與“PHRM-mini”預訓練模型供合規研究者申請使用。
推薦理由:研究推出了基於智慧手機攝像頭的被動心率監測系統,其準確率達到行業標準並開源了資料集與預訓練模型。
Google Research 在 I/O 2026 上公佈了多款 AI 工具與模型,涵蓋科研加速、健康應用、邊緣計算與氣候預測等領域。
推薦理由:Google Research 在 I/O 2026 上公佈多款 AI 工具與模型,展示了從科研到產品的快速落地與實際影響,凸顯代理式編碼與多模態推理在科學與日常應用中的變革潛力,併為全球科研社群提供了可擴充套件的實驗平臺。
Co-Scientist 幫助生物學家 Omar Abudayyeh 和 Jonathan Gootenberg 在基因篩選實驗中快速識別並驗證了多種可逆轉細胞衰老的基因因素。它掃描數萬篇論文,提出超過20個新穎可行的基因靶點,其中部分已在實驗中證明能使細胞恢復年輕狀態並提升功能。除此之外,Co-Scientist 將資料分析時間從長達六個月壓縮至僅幾天。
Google DeepMind 推出了將 Project Genie 與 Google Street View 結合的新街景接地功能,允許使用者利用真實街景影像生成互動虛擬環境,並面向全球 Google AI Ultra 訂閱者逐步開放。新功能通過 Maps Imagery Grounding 技術支援,目前美國地區的街景影像已可用。
推薦理由:該產品更新將世界模型與街景資料結合,為使用者和智慧體提供了在現實地點基礎上生成互動環境的新能力。
Google DeepMind 推出了全新多模態模型 Gemini Omni,併發布了該系列首款模型 Gemini Omni Flash,支援通過影像、音訊、影片和文本組合輸入生成及編輯影片。該模型已向 Gemini app、Google Flow 以及 YouTube Shorts 使用者推出,未來還將通過 API 提供給開發者和企業客戶。
推薦理由:原文介紹了新模型的具體輸入組合和釋出範圍,讀者可以據此評估多模態影片生成與編輯的最新能力邊界。
Google DeepMind 宣佈與新加坡政府建立全新的國家級 AI 夥伴關係,通過醫療、科研、教育和可持續發展等領域的合作推動經濟增長與公共利益。該合作有望通過加速研發,在 2040 年前創造額外的 33 億新加坡元(合 25 億美元)經濟價值。
Google DeepMind 宣佈推出 AI co-clinician 研究計劃,旨在探索結合多模態能力的醫療人工智慧系統,以輔助醫生並提升遠端醫療和臨床決策的質量。該系統採用雙Agent架構,在多項模擬臨床評估與藥物問答基準測試中展現出處理複雜醫療任務的潛力。
推薦理由:原文介紹了醫用人工智慧研究專案的架構與模擬評估結果,讀者可以瞭解多模態技術在醫療場景中的實際表現與安全性保障。
Google DeepMind 推出了 Gemma 4,四種尺寸(E2B、E4B、26B MoE、31B Dense)支援多模態、長上下文(128K–256K)和 140+ 語言,具備高階推理、函式呼叫和程式碼生成能力,並以 Apache 2.0 許可免費開放,適用於從移動端到雲端的多場景部署。
推薦理由:Gemma 4 以高效引數利用率和多模態能力,成為最強開源模型之一,支援從移動端到雲端的多場景部署,並提供 128K–256K 上下文視窗和 140+ 語言支援,兼具函式呼叫和結構化 JSON 輸出,滿足多行業需求。
Google DeepMind 釋出了由 Gemini 驅動的 AI 滑鼠指標實驗專案與互動原則,旨在讓使用者無需切換視窗即可通過指向和語音在 Chrome 等產品中直接呼叫 AI 能力。
推薦理由:原文介紹了將 AI 融入滑鼠指標的互動理念與實驗功能,讀者可以據此瞭解未來跨應用多模態互動的設計方向。
Google Research 宣佈推出 Vibe Coding XR 工作流,結合 Gemini 的長上下文推理與網路端 XR Blocks 框架,將自然語言直接轉換為物理感知的 Android XR 應用。該系統通過專用系統提示詞和程式碼模板自動處理空間邏輯,讓開發者能夠在短時間內快速構建和測試空間計算原型。
推薦理由:原文公佈了結合大模型與空間計算框架的具體實現方案,讀者可以據此瞭解如何通過自然語言快速生成擴充套件現實應用。
Mistral AI 釋出 4B 引數量的語音生成模型 Voxtral TTS,支援 9 種語言的高質量語音合成與低延遲流式傳輸。該模型具備上下文理解、說話人建模及零樣本跨語言語音適應能力,已通過 API、Mistral Studio 和 Hugging Face 開放。
推薦理由:原文公佈了架構細節和零樣本跨語言能力,讀者可以據此評估它在即時語音工作流中的表現。
Google Research 在 The Check Up 活動上公佈了醫療健康領域的最新研究進展,涵蓋個性化醫療、臨床協作、開發者生態、公共衛生及生物醫學發現。
推薦理由:Google Research 公佈了醫療健康領域的最新研究成果與進展,讀者可以據此瞭解其技術在臨床、公共衛生和生物醫藥方面的實際應用方向。
Mistral AI 釋出了 Mistral Small 4,這是一款統一推理、多模態與編碼功能的模型,採用 119B 引數、256k 上下文視窗,支援可配置推理強度,提供 40% 的延遲降低和 3 倍的吞吐量提升。該模型採用 Apache 2.0 許可,支援 vLLM、llama.cpp、SGLang 等開源框架,並已加入 NVIDIA Nemotron 聯盟。
推薦理由:Mistral Small 4 將推理、多模態與編碼功能統一,提供可配置推理強度和高效推理,幫助使用者在單一模型中完成多種任務。
Mistral AI 釋出新一代 Mistral 3 模型系列,包含 14B、8B 和 3B 的 Ministral 3 端側稠密模型,以及採用稀疏 MoE 架構、啟用引數 41B 總引數 675B 的旗艦模型 Mistral Large 3。所有模型均採用 Apache 2.0 許可證開源,支援多模態與多語言能力,推理版本也將很快推出。
推薦理由:原文釋出了包含稠密小模型與 MoE 旗艦大模型的全新模型系列,並全部採用 Apache 2.0 許可證開源,開發者和企業可直接藉此在多端與雲端部署前沿智慧能力。
Mistral通過對Pixtral-12B進行LoRA微調,在衛星影像分類任務上顯著提升了效能。LoRA僅需少量可訓練引數,避免了完整模型再訓練的高成本。該方法在AID資料集上提升了對細粒度場景類別的識別準確率,減少了模型幻覺。
Mistral AI 為旗下 Le Chat 推出了一系列新功能,包括支援快速生成結構化報告的 Deep Research 預覽模式、基於 Voxtral 模型的語音模式、由 Magistral 驅動的的多語言思考模式、用於組織對話的 Projects 功能,以及與 Black Forest Labs 合作推出的高階影像編輯功能。使用者現可通過網頁端或移動端應用體驗上述功能。
推薦理由:原文集中釋出了多模態助手的一系列新功能,讀者可以據此評估其在深度研究和多模態互動方面的能力擴充套件。
Mistral AI 釋出了開源語音理解模型 Voxtral,包含面向生產的 24B 規格與面向端側的 3B 規格,均採用 Apache 2.0 協議開源。該系列模型支援 32k 上下文、長達 30 至 40 分鐘的音訊處理、內建問答與摘要、多語言處理及函式呼叫功能,並在多項語音轉寫和理解基準測試中表現優異。
推薦理由:該模型提供了兩種尺寸並開源,讀者可以根據自身算力條件選擇合適的版本進行本地部署或呼叫 API。
Mistral AI 釋出首個推理模型 Magistral,推出開源的 Magistral Small(24B)和企業級 Magistral Medium 兩個版本。
推薦理由:原文給出了兩個版本的具體效能指標與開放渠道,讀者可以據此評估其在真實業務和推理任務中的表現。
Mistral AI 宣佈推出 Mistral Medium 3 模型,在編碼和多模態理解等專業用例中具備前沿級效能,同時顯著降低了成本。該模型支援混合部署或本地部署、自定義後訓練及企業工具整合,API 定價為每百萬 token 輸入 0.4 美元、輸出 2 美元,現已在 Mistral La Plateforme 和 Amazon Sagemaker 等平臺上線。
推薦理由:官方公佈了該新模型的具體基準表現和定價,讀者可以據此評估其在企業級應用中的價效比。
Mistral AI 宣佈推出 Mistral Small 3.1,這是一款在其體量級別表現出色的開源模型。該模型帶來改進的文本效能、多模態理解以及高達 128k tokens 的上下文視窗,並以 Apache 2.0 許可證開源。
推薦理由:原文給出了開源模型的新版本效能與多維度升級,讀者可以據此評估其在端側和多模態任務中的應用潛力。
Mistral AI 推出 Mistral OCR 光學字元識別 API,能夠高精度解析複雜文件中的文本、影像、表格和數學公式。該模型原生支援多語言與多模態,已在 Le Chat 中作為預設文件理解模型上線,並在 la Plateforme 提供 API,定價為每美元 1000 頁。
推薦理由:該模型在多項複雜文件基準測試中表現突出,為文件理解與檢索增強生成系統提供了新的高精度處理方案。