跳到正文

#多模態

RSS
今日 2 則
今天10月1日週四
  1. Google DeepMind72

    Gemini 4 Argon 釋出:開啟前沿智慧新時代

    Google DeepMind 推出了 Gemini 4 Argon,這是一款具備長推理、跨領域多模態能力的前沿模型。Argon 在軟體工程、金融、法律和網路安全等行業基準上重新整理記錄,並已在內部工作流中提升效率;其 1M token 輸出上限和 $2/百萬輸入、$10/百萬輸出的價格為開發者提供更高性價比。

    推薦理由:Gemini 4 Argon 通過大幅提升推理長度和多模態能力,顯著提升軟體工程、金融與網路安全等領域的工作效率,並在多項行業基準上重新整理記錄,幫助企業加速技術迭代。

  2. AWS Machine Learning Blog62

    在 Amazon Bedrock AgentCore Runtime Instances 上構建多智慧體音樂製作管線

    AWS 介紹瞭如何使用 Amazon Bedrock AgentCore Runtime Instances 部署一個三智慧體協作的音樂製作管線,實現 GPU 音樂生成、音訊處理與合規篩查。文章詳細講解了容量提供者配置、共享會話的多智慧體同機協作、多日持久化儲存以及各智慧體的獨立部署流程。

    推薦理由:文章給出了基於 Amazon Bedrock AgentCore Runtime Instances 部署多智慧體音樂製作管線的具體步驟與架構設計,讀者可以據此瞭解長週期持久化與多智慧體協同的實現方式。

9月29日週二
  1. AWS Machine Learning Blog62

    Grok 4.7 現已登陸 Amazon Bedrock

    xAI 的 Grok 4.7 現已在 Amazon Bedrock 上線,支援 500K 上下文視窗、四級推理努力程度配置及圖文輸入。該模型可通過 Responses、Chat Completions 和 Converse API 進行呼叫,並提供 US 區域和 Global 跨區域推理配置選項。

    推薦理由:原文介紹了 xAI Grok 4.7 在 Amazon Bedrock 上的可用性與整合細節,讀者可以據此瞭解該模型在 Bedrock 上的呼叫方式與配置選項。

9月26日週六
9月25日週五
  1. Google Research71

    Google Research 推出自動化長影片生成的多智慧體框架

    Google Research 介紹了用於自動化長影片生成的多智慧體框架,包含 Co-Director、CANVAS、A²RD 和 VQQA 四個核心元件。該框架通過全域性最佳化和世界狀態追蹤解決語義漂移與級聯失敗問題,能夠將創意轉化為分鐘級、具備多鏡頭敘事一致性的影片。

    推薦理由:該研究通過多智慧體框架解決長影片生成中的視覺一致性問題,為提升影片擴散模型的長時序敘事能力提供了可複用的系統架構參考。

  2. Google DeepMind64

    Google DeepMind 釋出 Gemini 3.8 Live with Live Avatar

    Google DeepMind 釋出 Gemini 3.8 Live with Live Avatar,為對話式 AI 帶來近即時的視覺形象與流媒體影片支援。該功能原生耦合了即時對話與低延遲影片生成,具備精確唇形同步、動態視覺形象、非同步工具呼叫以及跨 97 種語言的原生語音同步能力,現已在 Gemini Enterprise 中可用。

  3. AWS Machine Learning Blog67

    WhisperX 在 SageMaker AI 上實現說話人標註轉寫

    本文介紹了 AWS WhisperX Deep Learning Container(DLC)的使用方法,演示如何在 Amazon SageMaker AI 上部署即時和非同步端點,實現詞級時間戳和說話人標籤的轉寫。

    推薦理由:本文展示瞭如何在 SageMaker 上部署 WhisperX,實現精準的詞級時間戳和說話人標籤,幫助使用者快速構建可搜尋、可稽核的音訊轉寫系統。

9月24日週四
  1. NVIDIA Blog64

    NVIDIA 如何聯合全球研究機構釋出超 2800 種病毒蛋白質複合物的預測 3D 結構

    NVIDIA 聯合 Google DeepMind 及歐洲生物資訊研究所(EMBL-EBI)等全球研究機構,通過 AlphaFold Database 免費釋出了覆蓋超 2,800 種病毒的蛋白質複合物預測 3D 結構資料集。

    推薦理由:原文介紹了由 NVIDIA 與 Google DeepMind 等機構合作開源的病毒蛋白質複合物預測資料集,讀者可以據此瞭解 AI 在生物學研究中的最新應用進展。

9月23日週三
  1. Google DeepMind84

    Google DeepMind 釋出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS 語音生成模型

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 兩款全新語音生成模型,支援超過 100 種語言的自然語言提示詞聲音設計、30 秒聲音復刻以及逐行臺詞精細導演。

    推薦理由:官方釋出的最新語音生成模型提供了細粒度的臺詞導演和聲音定製能力,讀者可以據此評估其在多語言配音與智慧體互動中的實際表現。

  2. Vercel Blog66

    Gemini 3.8 TTS模型現已在AI Gateway上線

    Gemini 3.8 Flash‑Lite TTS 與 Gemini 3.8 Flash TTS 現已在 AI Gateway 上線,支援 100 多種語言的文本轉語音,支援長篇朗讀、交付控制和雙人對話。

    推薦理由:Gemini 3.8 TTS模型已在AI Gateway上線,支援100多種語言、長篇朗讀和雙人對話,開發者可通過AI SDK輕鬆生成語音。

9月21日週一
9月18日週五
9月16日週三
9月8日週二
  1. Google DeepMind89

    Google DeepMind 釋出 AlphaGenome Atlas:人類基因組變異預測圖譜

    Google DeepMind 推出了 AlphaGenome Atlas 平臺,包含人類基因組中 90 億種單核苷酸變異的預測效應,並同步釋出了 AlphaGenome Variant Impact 評分。該平臺提供網站埠、API 以及 Google Antigravity 中的 skill,旨在幫助學術研究人員理解基因變異對分子生物學的影響。

    推薦理由:該平臺預先計算了人類基因組中所有可能單核苷酸變異的分子效應預測併發布了配套評分指標,為研究人員快速評估基因變異影響提供了新資源。

9月3日週四
  1. Google DeepMind84

    Google DeepMind 釋出全球天氣大模型 WeatherNext 3

    Google DeepMind 和 Google Research 釋出全新的全球天氣大模型 WeatherNext 3,支援每小時即時衛星資料輸入並提供高達 5 公里解析度的預測。該模型在降水預測精度上取得顯著提升,並增加了清潔能源變數預測,現已整合至 Search、Gemini、Maps 和 Cloud 等產品中。

    推薦理由:該模型通過融合即時衛星資料與高解析度網格,提升了全球天氣預報的精度和更新頻率,為清潔能源規劃和區域氣象服務提供了更可靠的資料支援。

  2. Hugging Face Blog63

    NeoMME:高效的多模態原生多語言編碼器

    Hugging Face 團隊推出了 NeoMME,這是一個包含 260M 和 800M 引數的多語言多模態基礎編碼器系列。該模型不使用單獨的視覺塔或因果語言模型,而是通過單個雙向 Transformer 同時處理文本 token 和原始影像塊。

    推薦理由:原文釋出了不依賴獨立視覺塔的多模態雙向編碼器,讀者可以瞭解其單塔架構和檢索效能。

9月2日週三
  1. Google DeepMind78

    Google DeepMind 推出 Gemini 智慧體影片理解功能

    Google DeepMind 推出了適用於 Gemini 最新模型的智慧體影片理解功能,通過動態檢索視覺幀、音訊和字幕,將影片分析的 token 消耗降低最高 88%、成本降低最高 66%,並將準確率提升最高 7%。

    推薦理由:原文公佈了功能特性與具體最佳化資料,讀者可以據此瞭解該技術如何降低影片處理成本。

9月1日週二
8月28日週五
  1. Google DeepMind68

    Google DeepMind 釋出 Gemini Omni 1.1 Flash 影片生成模型

    Google DeepMind 推出了 Gemini Omni 1.1 Flash,帶來場景延伸、首尾幀插值、4K 超解析度升級、360p 高效草稿生成及影片參考等多項專業級影片生成與控制功能,現已通過 Gemini API 及 Google AI Studio 面向開發者開放。

    推薦理由:原文給出了新模型的生成能力與接入方式,讀者可以據此瞭解其在影片製作中的具體控制選項。

8月27日週四
  1. Google Research62

    GlucoFM:用於連續血糖監測的基礎模型

    Google Research 推出了 GlucoFM,這是一個用於連續血糖監測的自監督基礎模型,採用雙流設計將較慢的血糖趨勢與短期偏差明確分離。在多項臨床預測任務評估中,GlucoFM 的 PR-AUC 表現優於對比模型,並且在餐後血糖響應預測、跨資料集遷移以及少樣本適應場景中展現出優勢。

    推薦理由:Google Research 推出的 GlucoFM 能夠有效分離動態並提升臨床預測準確率,為研究人員在代謝健康資料建模時提供了可參考的新方法。

8月26日週三
8月21日週五
8月18日週二
  1. Hugging Face Blog68

    Sentence Transformers v6.0 釋出,引入多向量檢索與互動模型支援

    Sentence Transformers 釋出 v6.0 版本,首次引入第四種模型型別 MultiVectorEncoder,用於支援 ColBERT 風格的後期互動檢索。該版本允許開發者通過熟悉的 API 直接載入各類 PyLate、ColBERT 以及 ColPali 視覺文件檢索模型的檢查點,無需經過複雜的格式轉換。

    推薦理由:該版本新增了對多向量檢索模型的原生支援,讀者可以通過標準介面直接載入多種主流模型的檢查點並完成檢索與重排。

8月17日週一
  1. Google Research65

    Google Research 推出 PhotoScan:通過智慧手機影像估算心臟代謝風險

    Google Research 推出了 PhotoScan,這是一個通過標準 2D 智慧手機照片估算 3D 身體成分指標(如體脂率、A/G 比和 V/S 比)的深度學習框架。該模型在英國生物銀行資料上進行預訓練,並利用 677 名成人的佇列進行了微調;獨立驗證顯示其在預測胰島素抵抗方面達到了接近 DXA 掃描的準確度。

    推薦理由:該研究展示了利用普通手機影像估算身體成分和評估胰島素抵抗的新方案,為降低代謝健康篩查門檻提供了技術參考。

8月13日週四
  1. Microsoft Research61

    Microsoft Research 推出 MindTopo 評測 VLM 的空間推理能力

    Microsoft Research 推出了新基準 MindTopo,用於評估多模態大語言模型對連通性、包圍、順序、分離和結等拓撲概念的理解。研究發現,模型在靜態影像識別上的表現明顯優於需要跨動作維持空間關係的互動式規劃任務。

    推薦理由:研究展示了當前多模態模型在靜態拓撲識別與動態規劃之間存在明顯差距,為提升機器人和互動環境中的空間理解能力提供了新的評估基準。

8月12日週三
  1. Google DeepMind62

    Google DeepMind 釋出手語轉文本模型 SL2T

    Google DeepMind 釋出了多語言手語轉文本翻譯模型 SL2T,並將其整合到 Gboard 和 Pixel 11 的 Live Transcribe 中。該模型支援將美國手語直接轉換為英語文本,它基於超過 10 萬小時的資料訓練,通過處理姿勢關節點來保護隱私並實現流式輸出。

    推薦理由:該模型將手語翻譯直接帶入消費級產品,為聽障使用者提供了更自然的手語輸入方式。

  2. Google Research89

    Google Research 推出 AMIE (Video) 即時影片臨床問診系統

    Google Research 推出了 AMIE 的即時影片配置版本 AMIE (Video),能夠基於 Gemini 和 Project Astra 進行同步臨床影片問診,感知非引導性的臨床非語言線索並進行即時診斷推理。

    推薦理由:這項研究展示了多模態醫療AI在影片問診中的專家級表現,為遠端醫療系統的架構設計提供了實證參考。

  3. Microsoft Research45

    引入 CARE-X:通過輔助監督、獎勵對齊學習與工具增強測量邁向臨床有用的放射學 VLM

    Microsoft Research 推出了研究模型 CARE-X,這是一款旨在兼顧自由文本推理與確定性輸出的統一胸部 X 光 VLM。該模型結合了生成式與判別式能力,並通過強化學習(DAPO)在多工設定中最佳化臨床準確性。研究還線上路實驗中搭配了 Qwen3-VL-4B-Instruct 與確定性測量工具以評估效能。

8月10日週一
  1. Hugging Face Blog86

    Meta 釋出開源多模態模型 Muse Glimmer

    Meta 推出了全新的 30B 引數開源多模態模型 Muse Glimmer,採用 Apache 2.0 協議釋出,專門面向本地智慧體和隱私保護應用。該模型結合了 2B 的視覺感知編碼器與 28B 的文本解碼器,支援影像、影片理解以及多模態工具呼叫,並提供 transformers、llama.cpp 和 vLLM 的首日支援。

    推薦理由:文章詳細介紹了 Meta 開源多模態模型 Muse Glimmer 的架構設計與本地部署方法,讀者可以據此瞭解其在端側智慧體和多模態任務中的應用潛力。

8月4日週二
  1. Mistral AI63

    Mistral AI 釋出 3B 開源多模態安全分類模型 Shieldstral

    Mistral AI 釋出了 Shieldstral,這是一款 3B 引數的開源多模態安全分類模型,採用 Apache 2.0 協議開源。該模型將內容稽核轉換為策略自適應的問答任務,允許在推理時通過自然語言指定策略,從而無需重新訓練即可統一處理文本和影像安全評估。

    推薦理由:該模型通過將內容稽核轉化為推理時的自然語言問答任務,避免了傳統方案因固定分類體系而需要重新訓練的限制。

7月30日週四
  1. Google DeepMind86

    Gemini Robotics ER 2:通過影片理解、任務編排與多機器人協作驅動機器人

    DeepMind 釋出 Gemini Robotics ER 2,作為其最新的“具身推理”模型,支援持續影片理解、任務編排和多機器人協作。該模型可與任何低層 VLA 模型配合,即時呼叫工具(如 Google Search),並在執行過程中保持推理,顯著提升任務完成率和安全性。

    推薦理由:Gemini Robotics ER 2 通過影片理解和多機器人協作提升機器人任務完成率,展示了高效即時推理與安全控制的結合。

7月27日週一
  1. Hugging Face Blog63

    NVIDIA 釋出 Cosmos-H-Dreams 即時生成式手術機器人模擬器

    NVIDIA 推出 Cosmos-H-Dreams,這是一個針對手術機器人的即時、動作條件生成式模擬器。該模型將 Cosmos-H-Surgical-Simulator 的能力蒸餾為因果學生模型,並通過 FlashDreams 庫在單張 NVIDIA RTX PRO 6000 GPU 上實現每秒約 160 幀的互動式執行,支援在閉環中進行策略評估和資料生成。

    推薦理由:官方推出的即時動作條件生成模擬器展示了手術機器人的互動式環境,讀者可以據此瞭解世界模型在醫療機器人領域的即時推理與應用進展。

7月21日週二
  1. Google DeepMind84

    Google DeepMind 釋出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

    Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 以及 3.5 Flash Cyber 三款新模型,旨在以更高效率和更低延遲支撐大規模 AI 智慧體工作流。

    推薦理由:官方釋出了三個新的 Gemini Flash 系列模型,給出了詳細的效能指標與價格,讀者可以據此評估其在智慧體工作流和高吞吐任務中的成本與效率。

7月9日週四
  1. Google Research66

    Google Research 推出 SensorFM:面向可穿戴健康資料的通用大模型

    Google Research 推出了 SensorFM,這是一個在大規模未標註可穿戴感測器資料上預訓練的大型感測器基礎模型。該模型使用超一萬億分鐘的多模態感測器訊號進行自監督訓練,能夠跨越心血管、代謝、睡眠和心理健康等多個領域進行通用表徵,並支援構建更精準的個人健康智慧體。

    推薦理由:研究展示瞭如何利用大規模未標註感測器資料訓練通用生理表徵,讀者可以瞭解其在多工泛化和健康智慧體中的表現。

7月8日週三
  1. Mistral AI67

    Mistral AI 釋出首款具身導航模型 Robostral Navigate

    Mistral AI 釋出首款具身導航模型 Robostral Navigate,這是一個 8B 引數量的模型,僅需單個普通 RGB 攝像頭和自然語言指令即可讓機器人在複雜環境中自主導航。該模型在 R2R-CE 未見驗證集上取得 76.6% 的成功率,在完全使用模擬資料和高效字首快取技術訓練的基礎上,結合了基於指向的導航與線上強化學習。

    推薦理由:該模型僅憑單個 RGB 攝像頭和 8B 引數量即在 R2R-CE 基準上取得領先成績,為具身智慧輕量化部署提供了新路徑。

7月7日週二
  1. Hugging Face Blog85

    Hugging Face 釋出 LeRobot v0.6.0:引入世界模型與統一評測

    LeRobot v0.6.0 引入了世界模型策略、全新的視覺語言動作模型和統一的獎勵模型 API,同時帶來了六大模擬評測基準、全新的部署命令列工具以及深度感知和資料自動標註能力。此次更新還優化了資料集載入速度,實現了完全分片資料並行訓練和雲端訓練支援,並大幅精簡了基礎安裝包的依賴。

    推薦理由:該版本閉環了機器人學習流程,使用者可以據此瞭解開源機器人框架在世界模型和評測方面的新能力。