跳到正文

#多模態

RSS
今日 2 則
7月1日週三
  1. Berkeley AI Research23

    2026 BAIR 畢業生展示

    2026 年,Berkeley Artificial Intelligence Research (BAIR) Lab 慶祝其畢業生的成就。他們的研究涵蓋機器人、LLM、計算機視覺、生成模型、AI 安全、人機互動、科學與醫療 AI,並已發表影響力論文、構建實用系統、指導同輩。畢業生正投身學術、工業研究實驗室及創業公司,期待未來發展。

  2. Google Research49

    Google Research 將 Heat Resilience 資料擴充套件至全球 50 多個城市

    Google Research 釋出了擴充套件後的建築級屋頂反射率資料集,覆蓋全球 50 多個城市,旨在幫助城規劃者實施清涼屋頂解決方案以緩解極端熱浪。該資料集通過全新的高解析度 Heat Resilience Earth Engine App 公開提供,結合衛星資料與機器學習模型實現了 30 釐米的高空間解析度。

  3. Google DeepMind76

    Google DeepMind 釋出 Nano Banana 2 Lite 與 Gemini Omni Flash 模型

    Google DeepMind 推出兩款新模型:速度最快且最具成本效益的影像模型 Nano Banana 2 Lite,以及用於高質量影片生成和對話式編輯的 Gemini Omni Flash。

    推薦理由:Google DeepMind 推出 Nano Banana 2 Lite 與 Gemini Omni Flash 兩款新模型,為開發者串聯影像生成與影片編輯提供了低成本且高效的新方案。

6月23日週二
  1. Mistral AI81

    Mistral AI 釋出 Mistral OCR 4 文件解析模型

    Mistral AI 釋出 Mistral OCR 4 模型,提供文件解析功能,除提取文本外還返回邊界框、塊分類和行內建信度分數。該模型支援 170 種語言,可在單容器中執行以用於自託管部署,並通過 API 或 Document AI 提供支援。

    推薦理由:該模型支援多語言及單容器私有化部署,為企業級檢索和智慧體工作流提供了帶邊界框和置信度的結構化文件解析能力。

6月17日週三
  1. Google Research41

    從畫素到規劃:用 Earth AI 恢復自然

    Google Research 開發了一個高解析度深度學習框架,將衛星影像轉化為英格蘭全境林籬、石牆和樹叢的向量化資料集。該框架基於在超 3 億張全球衛星影像上預訓練的 ViT Backbone,並結合雙層標註系統與多邊形緊湊度評分,有效解決了複雜空間拓撲與計算規模等技術難題。這一新資源賦能土地所有者與自然保護主義者測量並擴充套件微觀生態特徵,在不損害糧食安全的前提下應對氣候與生物多樣性危機。

6月13日週六
  1. Google Research44

    研究探討 AI 如何幫助使用者理解皮膚狀況

    Google Research 分享了關於消費者理解皮膚科 AI 工具的研究,指出結構化 AI 輔助能顯著提升使用者識別皮膚狀況的能力與準確率。在一項針對 2,345 名參與者的研究中,使用 AI 工具組的病情命名準確率達到 23%,接近未輔助對照組 8% 的三倍。然而,由於資訊通用性限制,標準 AI 組在確定後續醫療行動時的準確率並未表現出顯著提升。

6月9日週二
  1. Google DeepMind86

    推出 Gemma 4 12B:無編碼器統一多模態模型

    DeepMind 推出 Gemma 4 12B,這是一款無編碼器的統一多模態模型,能夠直接在配備 16GB VRAM 的筆記本上執行。它在保持與 26B MoE 近似的推理效能的同時,顯著降低了記憶體佔用,並首次支援原生音訊輸入。

    推薦理由:Gemma 4 12B 以無編碼器的多模態架構實現低記憶體、強推理,適配本地 16GB VRAM 機器,讀者可據此評估在邊緣裝置上的部署可能。

6月5日週五
  1. Google Research71

    Google Research 推出基於智慧手機攝像頭的被動心率與靜息心率監測系統 PHRM

    Google Research 推出了被動心率監測系統(PHRM),利用智慧手機前置攝像頭在日常面部解鎖後進行影片採集,通過深度學習實現全膚色覆蓋的心率與靜息心率精準追蹤。該研究結合實驗室與真實世界評估,在各類膚色上均達到了與穿戴裝置相當的準確率,並同步開源了相關資料集與“PHRM-mini”預訓練模型供合規研究者申請使用。

    推薦理由:研究推出了基於智慧手機攝像頭的被動心率監測系統,其準確率達到行業標準並開源了資料集與預訓練模型。

5月29日週五
  1. Google Research69

    Google Research 在 I/O 2026 上開啟新發現時代

    Google Research 在 I/O 2026 上公佈了多款 AI 工具與模型,涵蓋科研加速、健康應用、邊緣計算與氣候預測等領域。

    推薦理由:Google Research 在 I/O 2026 上公佈多款 AI 工具與模型,展示了從科研到產品的快速落地與實際影響,凸顯代理式編碼與多模態推理在科學與日常應用中的變革潛力,併為全球科研社群提供了可擴充套件的實驗平臺。

5月19日週二
  1. Google DeepMind47

    Co-Scientist 加速基因線索以逆轉細胞衰老

    Co-Scientist 幫助生物學家 Omar Abudayyeh 和 Jonathan Gootenberg 在基因篩選實驗中快速識別並驗證了多種可逆轉細胞衰老的基因因素。它掃描數萬篇論文,提出超過20個新穎可行的基因靶點,其中部分已在實驗中證明能使細胞恢復年輕狀態並提升功能。除此之外,Co-Scientist 將資料分析時間從長達六個月壓縮至僅幾天。

5月18日週一
  1. Google DeepMind63

    Google DeepMind 推出 Project Genie 街景接地功能並擴大訪問範圍

    Google DeepMind 推出了將 Project Genie 與 Google Street View 結合的新街景接地功能,允許使用者利用真實街景影像生成互動虛擬環境,並面向全球 Google AI Ultra 訂閱者逐步開放。新功能通過 Maps Imagery Grounding 技術支援,目前美國地區的街景影像已可用。

    推薦理由:該產品更新將世界模型與街景資料結合,為使用者和智慧體提供了在現實地點基礎上生成互動環境的新能力。

  2. Google DeepMind86

    Google DeepMind 釋出 Gemini Omni 與首款模型 Gemini Omni Flash

    Google DeepMind 推出了全新多模態模型 Gemini Omni,併發布了該系列首款模型 Gemini Omni Flash,支援通過影像、音訊、影片和文本組合輸入生成及編輯影片。該模型已向 Gemini app、Google Flow 以及 YouTube Shorts 使用者推出,未來還將通過 API 提供給開發者和企業客戶。

    推薦理由:原文介紹了新模型的具體輸入組合和釋出範圍,讀者可以據此評估多模態影片生成與編輯的最新能力邊界。

5月16日週六
4月30日週四
  1. Google DeepMind64

    Google DeepMind 釋出 AI co-clinician 醫療人工智慧研究專案

    Google DeepMind 宣佈推出 AI co-clinician 研究計劃,旨在探索結合多模態能力的醫療人工智慧系統,以輔助醫生並提升遠端醫療和臨床決策的質量。該系統採用雙Agent架構,在多項模擬臨床評估與藥物問答基準測試中展現出處理複雜醫療任務的潛力。

    推薦理由:原文介紹了醫用人工智慧研究專案的架構與模擬評估結果,讀者可以瞭解多模態技術在醫療場景中的實際表現與安全性保障。

4月3日週五
  1. Google DeepMind69

    Gemma 4 釋出:最強開源模型

    Google DeepMind 推出了 Gemma 4,四種尺寸(E2B、E4B、26B MoE、31B Dense)支援多模態、長上下文(128K–256K)和 140+ 語言,具備高階推理、函式呼叫和程式碼生成能力,並以 Apache 2.0 許可免費開放,適用於從移動端到雲端的多場景部署。

    推薦理由:Gemma 4 以高效引數利用率和多模態能力,成為最強開源模型之一,支援從移動端到雲端的多場景部署,並提供 128K–256K 上下文視窗和 140+ 語言支援,兼具函式呼叫和結構化 JSON 輸出,滿足多行業需求。

3月29日週日
  1. Google DeepMind63

    Google DeepMind 推出 AI 時代重塑滑鼠指標計劃

    Google DeepMind 釋出了由 Gemini 驅動的 AI 滑鼠指標實驗專案與互動原則,旨在讓使用者無需切換視窗即可通過指向和語音在 Chrome 等產品中直接呼叫 AI 能力。

    推薦理由:原文介紹了將 AI 融入滑鼠指標的互動理念與實驗功能,讀者可以據此瞭解未來跨應用多模態互動的設計方向。

3月25日週三
  1. Google Research66

    Google Research 釋出 Vibe Coding XR,加速 AI 與 XR 原型開發

    Google Research 宣佈推出 Vibe Coding XR 工作流,結合 Gemini 的長上下文推理與網路端 XR Blocks 框架,將自然語言直接轉換為物理感知的 Android XR 應用。該系統通過專用系統提示詞和程式碼模板自動處理空間邏輯,讓開發者能夠在短時間內快速構建和測試空間計算原型。

    推薦理由:原文公佈了結合大模型與空間計算框架的具體實現方案,讀者可以據此瞭解如何通過自然語言快速生成擴充套件現實應用。

3月24日週二
  1. Mistral AI75

    Mistral AI 釋出 Voxtral TTS 語音生成模型

    Mistral AI 釋出 4B 引數量的語音生成模型 Voxtral TTS,支援 9 種語言的高質量語音合成與低延遲流式傳輸。該模型具備上下文理解、說話人建模及零樣本跨語言語音適應能力,已通過 API、Mistral Studio 和 Hugging Face 開放。

    推薦理由:原文公佈了架構細節和零樣本跨語言能力,讀者可以據此評估它在即時語音工作流中的表現。

3月18日週三
  1. Google Research61

    Google Research 在 The Check Up 活動上公佈醫療健康 AI 最新突破

    Google Research 在 The Check Up 活動上公佈了醫療健康領域的最新研究進展,涵蓋個性化醫療、臨床協作、開發者生態、公共衛生及生物醫學發現。

    推薦理由:Google Research 公佈了醫療健康領域的最新研究成果與進展,讀者可以據此瞭解其技術在臨床、公共衛生和生物醫藥方面的實際應用方向。

3月17日週二
  1. Mistral AI84

    釋出 Mistral Small 4

    Mistral AI 釋出了 Mistral Small 4,這是一款統一推理、多模態與編碼功能的模型,採用 119B 引數、256k 上下文視窗,支援可配置推理強度,提供 40% 的延遲降低和 3 倍的吞吐量提升。該模型採用 Apache 2.0 許可,支援 vLLM、llama.cpp、SGLang 等開源框架,並已加入 NVIDIA Nemotron 聯盟。

    推薦理由:Mistral Small 4 將推理、多模態與編碼功能統一,提供可配置推理強度和高效推理,幫助使用者在單一模型中完成多種任務。

12月3日週三
  1. Mistral AI83

    Mistral AI 釋出 Mistral 3 模型系列

    Mistral AI 釋出新一代 Mistral 3 模型系列,包含 14B、8B 和 3B 的 Ministral 3 端側稠密模型,以及採用稀疏 MoE 架構、啟用引數 41B 總引數 675B 的旗艦模型 Mistral Large 3。所有模型均採用 Apache 2.0 許可證開源,支援多模態與多語言能力,推理版本也將很快推出。

    推薦理由:原文釋出了包含稠密小模型與 MoE 旗艦大模型的全新模型系列,並全部採用 Apache 2.0 許可證開源,開發者和企業可直接藉此在多端與雲端部署前沿智慧能力。

8月1日週五
7月17日週四
  1. Mistral AI63

    Mistral AI 為 Le Chat 推出深度研究、語音模式、Magistral 思考模式與專案管理等新功能

    Mistral AI 為旗下 Le Chat 推出了一系列新功能,包括支援快速生成結構化報告的 Deep Research 預覽模式、基於 Voxtral 模型的語音模式、由 Magistral 驅動的的多語言思考模式、用於組織對話的 Projects 功能,以及與 Black Forest Labs 合作推出的高階影像編輯功能。使用者現可通過網頁端或移動端應用體驗上述功能。

    推薦理由:原文集中釋出了多模態助手的一系列新功能,讀者可以據此評估其在深度研究和多模態互動方面的能力擴充套件。

7月15日週二
  1. Mistral AI86

    Mistral AI 釋出開源語音理解模型 Voxtral

    Mistral AI 釋出了開源語音理解模型 Voxtral,包含面向生產的 24B 規格與面向端側的 3B 規格,均採用 Apache 2.0 協議開源。該系列模型支援 32k 上下文、長達 30 至 40 分鐘的音訊處理、內建問答與摘要、多語言處理及函式呼叫功能,並在多項語音轉寫和理解基準測試中表現優異。

    推薦理由:該模型提供了兩種尺寸並開源,讀者可以根據自身算力條件選擇合適的版本進行本地部署或呼叫 API。

6月10日週二
5月7日週三
  1. Mistral AI86

    Mistral AI 釋出 Mistral Medium 3 模型

    Mistral AI 宣佈推出 Mistral Medium 3 模型,在編碼和多模態理解等專業用例中具備前沿級效能,同時顯著降低了成本。該模型支援混合部署或本地部署、自定義後訓練及企業工具整合,API 定價為每百萬 token 輸入 0.4 美元、輸出 2 美元,現已在 Mistral La Plateforme 和 Amazon Sagemaker 等平臺上線。

    推薦理由:官方公佈了該新模型的具體基準表現和定價,讀者可以據此評估其在企業級應用中的價效比。

3月17日週一
  1. Mistral AI65

    Mistral AI 釋出 Mistral Small 3.1 模型

    Mistral AI 宣佈推出 Mistral Small 3.1,這是一款在其體量級別表現出色的開源模型。該模型帶來改進的文本效能、多模態理解以及高達 128k tokens 的上下文視窗,並以 Apache 2.0 許可證開源。

    推薦理由:原文給出了開源模型的新版本效能與多維度升級,讀者可以據此評估其在端側和多模態任務中的應用潛力。

3月7日週五
  1. Mistral AI85

    Mistral AI 釋出 Mistral OCR 文件理解模型與 API

    Mistral AI 推出 Mistral OCR 光學字元識別 API,能夠高精度解析複雜文件中的文本、影像、表格和數學公式。該模型原生支援多語言與多模態,已在 Le Chat 中作為預設文件理解模型上線,並在 la Plateforme 提供 API,定價為每美元 1000 頁。

    推薦理由:該模型在多項複雜文件基準測試中表現突出,為文件理解與檢索增強生成系統提供了新的高精度處理方案。