跳到正文

全部動態

RSS
今日 3 則
8月25日週二
  1. Mistral AI61

    Mistral 與 HUMAIN 合作推進中東地區主權 AI

    Mistral 與 HUMAIN 今日宣佈戰略合作,目標在沙烏地阿拉伯及中東地區推進主權 AI。雙方將共同開發本地化的先進 AI 模型,首批關注網路安全與語音領域,並計劃打造在阿拉伯語表現強勁的前沿模型。

    推薦理由:此合作聚焦中東地區主權 AI,強調本地化模型與計算能力,適合關注跨境 AI 合作與本土化部署的讀者。

8月22日週六
  1. Google Research50

    AI工具實現可穿戴感測器資料候選生物標誌物優先順序排序

    Google Research釋出了Biomarker Discovery Framework,一套多代理系統,結合假設生成、統計分析、模型訓練、對抗驗證和文獻推理,在9,279個可穿戴感測器資料樣本中識別出41個精神健康和25個代謝疾病的候選數字生物標誌物,並在與人口統計特徵結合後提升預測效能。專家評估顯示,該框架在質量維度上優於同類AI系統。

8月21日週五
  1. Hugging Face Blog64

    Hugging Face 部落格:衡量語音識別中的基準測試最佳化現象

    Hugging Face 最新研究引入了三項測試,用於量化語音識別模型中的基準測試最佳化(benchmaxxing)現象,評估了 11 個開源 ASR 模型後發現部分高分系統會復現基準測試中的錯誤轉錄、填補被靜音的數字並根據資料集調整拼寫習慣。

    推薦理由:研究指出語音識別模型會利用音訊中的線索復現公開測試集的錯誤和拼寫習慣,這有助於理解如何通過獨立測試集評估模型真實效能。

  2. Hugging Face Blog62

    Hugging Face 升級 Papers with Code 搜尋引擎架構,結合混合檢索與向量服務

    Hugging Face 宣佈重構 Papers with Code 搜尋引擎,採用混合檢索系統結合 PostgreSQL、pgvector 與 reciprocal rank fusion(RRF)演算法,提升論文檢索效果。

    推薦理由:文章詳細拆解了基於混合檢索的論文搜尋引擎架構,展示瞭如何通過離線任務與線上服務的拆分來兼顧吞吐量和低延遲,為類似工程實踐提供了可複用的系統設計範本。

  3. Microsoft Research56

    微軟研究院釋出 Skala 1.1 並拓展其在計算化學軟體中的整合

    微軟研究院釋出深度學習密度泛函理論模型 Skala 1.1,在 GMTKN55 基準測試中表現優異,並宣佈已在 CP2K 中可用,同時正逐步整合至 Psi4、FHI-aims、ORCA 和 VASP 等主流計算化學軟體中。該版本使用比前代多 2.5 倍的資料訓練,在保持半局域泛函效率的同時提升了準確性,並推出了動態效能報告來追蹤跨硬體的計算效率。

8月20日週四
  1. Mistral AI75

    Agentic Search:為 AI 系統提供更準確、更高效的檢索結果

    Mistral AI 推出了 Agentic Search,利用多步檢索迴圈在 FinanceBench 和 OfficeQA Pro 基準上顯著提升檢索準確率,並降低 token 使用和延遲。該功能通過搜尋、開啟、導航、讀取和 grep 五個工具,讓模型在複雜文件中進行迭代檢索,支援敏感領域資料,並可通過 Mistral Search Toolkit 在雲端或本地部署。

    推薦理由:Agentic Search 通過多步檢索迴圈顯著提升金融檔案檢索準確率,幫助企業在敏感資料上實現更高效的 AI 互動,並在複雜文件中實現精準導航。

8月19日週三
  1. Hugging Face Blog65

    智慧體究竟需要多少記憶容量:ALTK-Evolve 評測與劑量校準方法

    Hugging Face 團隊釋出研究探討如何為 AI 智慧體配置自蒸餾記憶,評估了從 30B 到前沿模型的 8 款模型在 AppWorld 基準上的表現。研究發現智慧體記憶效果取決於模型能力層級:強模型適合注入完整記憶,較弱模型適合精選檢索,而已飽和模型則無明顯增益。精選檢索能在僅增加 5% token 的情況下使 gpt-oss-120b 任務完成度提升 16.1 個百分點。

    推薦理由:研究表明智慧體記憶容量需要根據模型能力進行校準而非盲目堆砌,為提升準確率和控制成本提供了實踐參考。

8月18日週二
  1. Hugging Face Blog68

    Sentence Transformers v6.0 釋出,引入多向量檢索與互動模型支援

    Sentence Transformers 釋出 v6.0 版本,首次引入第四種模型型別 MultiVectorEncoder,用於支援 ColBERT 風格的後期互動檢索。該版本允許開發者通過熟悉的 API 直接載入各類 PyLate、ColBERT 以及 ColPali 視覺文件檢索模型的檢查點,無需經過複雜的格式轉換。

    推薦理由:該版本新增了對多向量檢索模型的原生支援,讀者可以通過標準介面直接載入多種主流模型的檢查點並完成檢索與重排。

  2. Hugging Face Blog66

    Dharma AI 推出 GPU 管理排程器:通過最佳化分配順序顯著提升叢集利用率

    Dharma AI 推出一種約束感知 GPU 分配器,通過將即時推理需求建模為動態曲線並結合優先順序排程,在不更換硬體的情況下使叢集利用率提升高達 33 個百分點。該分配器在多個基準測試中展現出更高的吞吐量與優先順序加權產出,同時保持極低的決策延遲。

    推薦理由:原文介紹了約束感知 GPU 分配器的設計與多場景基準測試結果,讀者可以瞭解如何通過最佳化排程順序提升叢集利用率。

8月17日週一
  1. Google Research65

    Google Research 推出 PhotoScan:通過智慧手機影像估算心臟代謝風險

    Google Research 推出了 PhotoScan,這是一個通過標準 2D 智慧手機照片估算 3D 身體成分指標(如體脂率、A/G 比和 V/S 比)的深度學習框架。該模型在英國生物銀行資料上進行預訓練,並利用 677 名成人的佇列進行了微調;獨立驗證顯示其在預測胰島素抵抗方面達到了接近 DXA 掃描的準確度。

    推薦理由:該研究展示了利用普通手機影像估算身體成分和評估胰島素抵抗的新方案,為降低代謝健康篩查門檻提供了技術參考。

8月14日週五
  1. Hugging Face Blog62

    Hugging Face 釋出 2026 夏季開源模型現狀報告

    Hugging Face 釋出了 2026 年夏季開源模型現狀報告,梳理了從 1 月到 8 月期間平臺上的模型規模、下載與點贊分化、開源協議、衍生生態以及智慧體流量變化。報告指出中國實驗室在前端模型規模上領先,Qwen 成為社群衍生基石,同時端側量化和智慧體呼叫正在重塑平臺生態。

    推薦理由:文章基於平臺全量資料分析了開源模型在規模、授權、社群衍生與端側部署上的最新結構性變化。

  2. Hugging Face Blog65

    使用 Strands Agents、LeRobot 與 Hugging Face Storage Buckets 實現錄製、訓練與部署一體化

    本文介紹了 Strands Robots 中的流式資料閉環方案,展示瞭如何通過自然語言指令錄製機器人示範資料、將其同步至 Hugging Face Storage Buckets 並進行基於 Xet 的位元組級去重。隨後,開發者可以直接從 Hub 流式讀取資料集來訓練策略,並將訓練好的檢查點重新部署到硬體上。

    推薦理由:文章介紹了基於 Strands Agents 和 LeRobot 的機器人流式資料閉環方案,讀者可以據此瞭解如何通過雲端儲存桶實現無本地下載的高效訓練。

  3. Google DeepMind74

    Gemini 3.7 Flash 推出

    Google DeepMind 推出了 Gemini 3.7 Flash,這是其 Flash 系列最新的工作模型,專為編碼和智慧體設計。該模型在 FrontierCode、DeepSWE、WebDev Arena 等基準上顯著提升準確率,且每百萬輸入 token 價格僅 $0.75,輸出 $3.75,成本更低。

    推薦理由:Gemini 3.7 Flash 在編碼、網頁開發和知識工作等領域顯著提升準確率,並以更低成本提供高效工作流。

8月13日週四
  1. Hugging Face Blog74

    Hugging Face 部落格:復現 2,200 篇 ICML 論文的經驗與發現

    Hugging Face 舉辦了一場使用編碼智慧體逐條復現 ICML 2026 論文的駭客松,1,221 名參與者在 19 天內釋出了 6,816 份日誌並嘗試復現了 2,226 篇論文。

    推薦理由:文章公佈了大規模智慧體復現學術論文的成果與發現,讀者可以從中瞭解自動化復現對檢驗科研質量的實際效果與侷限。

  2. Microsoft Research61

    Microsoft Research 推出 MindTopo 評測 VLM 的空間推理能力

    Microsoft Research 推出了新基準 MindTopo,用於評估多模態大語言模型對連通性、包圍、順序、分離和結等拓撲概念的理解。研究發現,模型在靜態影像識別上的表現明顯優於需要跨動作維持空間關係的互動式規劃任務。

    推薦理由:研究展示了當前多模態模型在靜態拓撲識別與動態規劃之間存在明顯差距,為提升機器人和互動環境中的空間理解能力提供了新的評估基準。

8月12日週三
  1. Google DeepMind62

    Google DeepMind 釋出手語轉文本模型 SL2T

    Google DeepMind 釋出了多語言手語轉文本翻譯模型 SL2T,並將其整合到 Gboard 和 Pixel 11 的 Live Transcribe 中。該模型支援將美國手語直接轉換為英語文本,它基於超過 10 萬小時的資料訓練,通過處理姿勢關節點來保護隱私並實現流式輸出。

    推薦理由:該模型將手語翻譯直接帶入消費級產品,為聽障使用者提供了更自然的手語輸入方式。

  2. Google Research63

    空書架還是丟了鑰匙?研究稱檢索是大語言模型引數化真實性的瓶頸

    Google Research 介紹了知識 profiling 行為框架和 WikiProfile 基準,用以衡量大語言模型的編碼與檢索能力。研究表明,在 Gemini 3 和 GPT-5 等前沿大模型中,95% 至 98% 的事實已被編碼,但模型仍無法直接檢索其中 26% 至 34% 的事實。這說明事實性錯誤主要源於知識無法可靠呼叫的檢索失敗,而非知識未被編碼的儲存缺失。

    推薦理由:研究指出前沿大語言模型的知識編碼已接近飽和,準確率瓶頸在於檢索而非儲存,為後續訓練與推理最佳化提供了新方向。

  3. Google Research89

    Google Research 推出 AMIE (Video) 即時影片臨床問診系統

    Google Research 推出了 AMIE 的即時影片配置版本 AMIE (Video),能夠基於 Gemini 和 Project Astra 進行同步臨床影片問診,感知非引導性的臨床非語言線索並進行即時診斷推理。

    推薦理由:這項研究展示了多模態醫療AI在影片問診中的專家級表現,為遠端醫療系統的架構設計提供了實證參考。

  4. Microsoft Research45

    引入 CARE-X:通過輔助監督、獎勵對齊學習與工具增強測量邁向臨床有用的放射學 VLM

    Microsoft Research 推出了研究模型 CARE-X,這是一款旨在兼顧自由文本推理與確定性輸出的統一胸部 X 光 VLM。該模型結合了生成式與判別式能力,並通過強化學習(DAPO)在多工設定中最佳化臨床準確性。研究還線上路實驗中搭配了 Qwen3-VL-4B-Instruct 與確定性測量工具以評估效能。

8月11日週二
  1. Hugging Face Blog68

    想用 ACE 嗎?ALTK-Evolve 用更少 Token 實現

    Hugging Face 部落格介紹了 ALTK-Evolve 庫,該庫通過高效的記憶檢索實現與 ACE 相比更低的 Token 消耗,同時保持或提升準確率。ALTK-Evolve 與 ACE 都利用代理自身軌跡學習,但在記憶構建和交付方式上不同:ACE 採用完整的 playbook 注入,而 ALTK-Evolve 只檢索模型可用的指導原則,從而顯著降低推理 token。

    推薦理由:ALTK-Evolve 在保持或提升準確率的同時,顯著降低推理 token 消耗,展示了高效記憶檢索的可行性。

  2. Mistral AI73

    Mistral 推出區域推理、開放模型與歐洲主權 AI 基礎設施

    Mistral AI 宣佈推出區域推理端點和優先服務層,支援在歐洲或美國執行推理,並提供 1 GW 計算容量目標。公司還將平臺開放給第三方模型,首批支援 Z.ai 的 GLM‑5.2,所有模型均在同一基礎設施下滿足區域控制與 SLA。為保障歐洲長期 AI 計算需求,Mistral 正與企業組建聯盟,形成歐洲計算單元(ECU)以鎖定多年容量。

    推薦理由:Mistral 推出區域推理端點和開放模型支援,幫助企業實現 AI 主權與合規。

  3. Hugging Face Blog77

    構建低延遲多語種語音代理:NVIDIA Magpie TTS 開放權重與完整部署控制

    NVIDIA 釋出了 Magpie TTS 多語種文本轉語音模型,支援12種語言,並提供開放權重與本地部署能力。該模型在單流 GPU 上可實現 32–79 ms 的首音延遲,64 併發流下可達 239 ms,吞吐率高達 320× 即時。

    推薦理由:開放權重與低延遲讓企業可在本地部署多語種語音代理,支援12種語言並提供高質量音訊,幫助企業實現低延遲、可定製的多語種語音代理。

8月10日週一
  1. Hugging Face Blog64

    讓知識蒸餾足夠低成本以實現規模化執行

    Multiverse Computing 在其最新論文《Efficient Knowledge Distillation for LLMs: Offline Top‑K Logits and a Fused Chunked KL Loss》中提出離線 Top‑100 logits 快取與分塊 KL 損失兩項改進。

    推薦理由:本文提出的離線Top‑K logits快取和分塊KL損失顯著降低視訊記憶體需求,使大規模LLM蒸餾可在單GPU上完成,降低成本並提升實驗效率。

  2. Hugging Face Blog86

    Meta 釋出開源多模態模型 Muse Glimmer

    Meta 推出了全新的 30B 引數開源多模態模型 Muse Glimmer,採用 Apache 2.0 協議釋出,專門面向本地智慧體和隱私保護應用。該模型結合了 2B 的視覺感知編碼器與 28B 的文本解碼器,支援影像、影片理解以及多模態工具呼叫,並提供 transformers、llama.cpp 和 vLLM 的首日支援。

    推薦理由:文章詳細介紹了 Meta 開源多模態模型 Muse Glimmer 的架構設計與本地部署方法,讀者可以據此瞭解其在端側智慧體和多模態任務中的應用潛力。

8月6日週四
  1. Google DeepMind66

    Google DeepMind 釋出 WeatherNext AI 模型並實現氣旋預測突破

    Google DeepMind 推出了 WeatherNext AI 模型,在氣旋的路徑、強度和風力結構預測上達到了 SOTA 精度,平均可提供額外一天的預警時間。該研究成果已在 Nature 發表,團隊宣佈開源 WeatherNext 2 與 WeatherNext Cyclones 模型程式碼及權重。

    推薦理由:該模型實現了氣旋路徑和強度預測的大幅準確率提升,並開源了程式碼與權重,為氣象研究和防災減災提供了新工具。

  2. Hugging Face Blog53

    Baseten 接入 Hugging Face Inference Providers

    Baseten 現已成為 Hugging Face Hub 的推理提供商,支援在模型頁面和 JS/Python 客戶端 SDK 中直接呼叫無伺服器推理服務。首批上線支援對話和文本生成任務,涵蓋 DeepSeek V4 Flash、GLM-5.2 等開源權重模型。使用者可通過自定義 API 金鑰或由 Hugging Face 路由兩種模式呼叫,並已整合至多個主流 Agent 框架中。

8月4日週二
  1. Mistral AI63

    Mistral AI 釋出 3B 開源多模態安全分類模型 Shieldstral

    Mistral AI 釋出了 Shieldstral,這是一款 3B 引數的開源多模態安全分類模型,採用 Apache 2.0 協議開源。該模型將內容稽核轉換為策略自適應的問答任務,允許在推理時通過自然語言指定策略,從而無需重新訓練即可統一處理文本和影像安全評估。

    推薦理由:該模型通過將內容稽核轉化為推理時的自然語言問答任務,避免了傳統方案因固定分類體系而需要重新訓練的限制。

  2. Microsoft Research86

    Microsoft Research 釋出開源智慧體框架 Orchard

    Microsoft Research 推出了開源的可擴充套件智慧體框架 Orchard,其核心是提供可重用環境服務的 Kubernetes 架構 Orchard Env,支援在真實部署 harnesses 中直接訓練智慧體。專案同步開源了三個領域的訓練方案與資料,其中 Orchard-SWE 在 SWE-bench Verified 上取得了 69.7% 的表現。

    推薦理由:微軟研究院開源了可擴充套件智慧體框架 Orchard,並提供覆蓋軟體工程、網頁瀏覽和個人助理的完整訓練方案,降低了智慧體研究的基建門檻。

7月31日週五
  1. Google Research66

    Google Research 推出可驗證自主研究框架 Science One 與證據鏈機制

    Google Research 推出了基於 Chain-of-Evidence 架構的自主科研框架 Science One,通過構建即時證據鏈與 CoE Audit 評估協議解決 AI 生成論文中的幻覺與不可復現問題。結果顯示該框架在 MLE-Bench 等基準測試中實現了零幻覺引用與完全可驗證的分數,同時達到了 SOTA 效能。

    推薦理由:原文介紹了通過證據鏈確保 AI 科研成果可驗證的新框架,讀者可以據此評估自主研究系統的可靠性邊界。

  2. Microsoft Research84

    微軟釋出 Echoverse:用於計算機操作智慧體的深度演化環境

    微軟研究團隊推出了 Echoverse,這是一個包含 10 個深度領域世界和 2 個能力世界的訓練環境集合,旨在為計算機操作智慧體提供高保真、狀態相干且具備可信資料庫驗證的合成訓練世界。

    推薦理由:微軟開源了用於訓練計算機操作智慧體的深度演化環境 Echoverse,通過提供高保真和可複用的訓練世界,為提升模型在複雜閉環工作流中的泛化能力提供了新途徑。

7月30日週四
  1. Hugging Face Blog18

    GPU 管理:為什麼閒置的 GPU 就像停飛的飛機

    企業 AI 領域的下一個真正限制是硬體利用率而非模型智慧,正如航空業的生存取決於飛機在空中的時間。GPU 的成本按日曆小時累積,擁有更多 GPU 並不能保證業務成功,企業經濟效益正日益取決於硬體在任意時刻的利用率。從模型質量競爭轉向算力基礎設施部署後,如何保持硬體持續運轉已成為決定投入成敗的關鍵。

  2. Google DeepMind86

    Gemini Robotics ER 2:通過影片理解、任務編排與多機器人協作驅動機器人

    DeepMind 釋出 Gemini Robotics ER 2,作為其最新的“具身推理”模型,支援持續影片理解、任務編排和多機器人協作。該模型可與任何低層 VLA 模型配合,即時呼叫工具(如 Google Search),並在執行過程中保持推理,顯著提升任務完成率和安全性。

    推薦理由:Gemini Robotics ER 2 通過影片理解和多機器人協作提升機器人任務完成率,展示了高效即時推理與安全控制的結合。

  3. Google DeepMind62

    Google Flow Music 推出 Lyria 3.5,提升音樂性、歌詞、聲樂與創作控制

    Google DeepMind 在 Google Flow Music 上釋出了最新音樂生成模型 Lyria 3.5。該模型在旋律結構、歌詞質量、聲樂表現和發音方面都有顯著提升,並新增了對節奏和時長的細粒度控制,幫助使用者更輕鬆地創作符合預期的歌曲。

    推薦理由:Lyria 3.5 在音樂生成方面提升了旋律、歌詞、聲樂質量,並提供更細粒度的節奏與時長控制,幫助創作者更精準地實現創意。

7月29日週三
  1. Berkeley AI Research65

    從 CUDA 到 MLX:K-Search 如何將數十年核心最佳化經驗引入 Apple Silicon

    研究團隊擴充套件了 K-Search 進化核心搜尋框架併為其增加了 MLX 後端,通過結構化 CUDA 到 MLX 翻譯層將 NVIDIA 生態的核心最佳化經驗自動遷移至 Apple Silicon。實驗表明,該方法在注意力核心上實現了接近專家的效能,在 Mamba SSM 核心的預填充階段取得了約 20 倍的吞吐量提升。

    推薦理由:研究展示瞭如何通過結構化翻譯層將 CUDA 最佳化經驗遷移至 Apple Silicon,為異構硬體的高效能核心開發提供了可複用的方法。

7月28日週二
  1. Google DeepMind86

    Gemini Robotics 2 為機器人帶來全身智慧

    DeepMind 在部落格中釋出 Gemini Robotics 2,推出三款模型:Gemini Robotics 2(全身視覺‑語言‑動作模型)、Gemini Robotics ER 2(具身推理模型)和 Gemini Robotics On‑Device 2(高效本地化模型)。

    推薦理由:Gemini Robotics 2 通過全身控制、精細操作和多機器人協作,展示了在複雜任務中的智慧執行能力,並能在數小時內適配新機器人身體。

7月27日週一
  1. Hugging Face Blog63

    NVIDIA 釋出 Cosmos-H-Dreams 即時生成式手術機器人模擬器

    NVIDIA 推出 Cosmos-H-Dreams,這是一個針對手術機器人的即時、動作條件生成式模擬器。該模型將 Cosmos-H-Surgical-Simulator 的能力蒸餾為因果學生模型,並通過 FlashDreams 庫在單張 NVIDIA RTX PRO 6000 GPU 上實現每秒約 160 幀的互動式執行,支援在閉環中進行策略評估和資料生成。

    推薦理由:官方推出的即時動作條件生成模擬器展示了手術機器人的互動式環境,讀者可以據此瞭解世界模型在醫療機器人領域的即時推理與應用進展。