跳到正文

#產品更新

RSS
今日 19 則
8月11日週二
  1. Hugging Face Blog68

    想用 ACE 嗎?ALTK-Evolve 用更少 Token 實現

    Hugging Face 部落格介紹了 ALTK-Evolve 庫,該庫通過高效的記憶檢索實現與 ACE 相比更低的 Token 消耗,同時保持或提升準確率。ALTK-Evolve 與 ACE 都利用代理自身軌跡學習,但在記憶構建和交付方式上不同:ACE 採用完整的 playbook 注入,而 ALTK-Evolve 只檢索模型可用的指導原則,從而顯著降低推理 token。

    推薦理由:ALTK-Evolve 在保持或提升準確率的同時,顯著降低推理 token 消耗,展示了高效記憶檢索的可行性。

  2. Mistral AI73

    Mistral 推出區域推理、開放模型與歐洲主權 AI 基礎設施

    Mistral AI 宣佈推出區域推理端點和優先服務層,支援在歐洲或美國執行推理,並提供 1 GW 計算容量目標。公司還將平臺開放給第三方模型,首批支援 Z.ai 的 GLM‑5.2,所有模型均在同一基礎設施下滿足區域控制與 SLA。為保障歐洲長期 AI 計算需求,Mistral 正與企業組建聯盟,形成歐洲計算單元(ECU)以鎖定多年容量。

    推薦理由:Mistral 推出區域推理端點和開放模型支援,幫助企業實現 AI 主權與合規。

  3. Hugging Face Blog77

    構建低延遲多語種語音代理:NVIDIA Magpie TTS 開放權重與完整部署控制

    NVIDIA 釋出了 Magpie TTS 多語種文本轉語音模型,支援12種語言,並提供開放權重與本地部署能力。該模型在單流 GPU 上可實現 32–79 ms 的首音延遲,64 併發流下可達 239 ms,吞吐率高達 320× 即時。

    推薦理由:開放權重與低延遲讓企業可在本地部署多語種語音代理,支援12種語言並提供高質量音訊,幫助企業實現低延遲、可定製的多語種語音代理。

8月6日週四
  1. Hugging Face Blog53

    Baseten 接入 Hugging Face Inference Providers

    Baseten 現已成為 Hugging Face Hub 的推理提供商,支援在模型頁面和 JS/Python 客戶端 SDK 中直接呼叫無伺服器推理服務。首批上線支援對話和文本生成任務,涵蓋 DeepSeek V4 Flash、GLM-5.2 等開源權重模型。使用者可通過自定義 API 金鑰或由 Hugging Face 路由兩種模式呼叫,並已整合至多個主流 Agent 框架中。

8月4日週二
  1. Microsoft Research86

    Microsoft Research 釋出開源智慧體框架 Orchard

    Microsoft Research 推出了開源的可擴充套件智慧體框架 Orchard,其核心是提供可重用環境服務的 Kubernetes 架構 Orchard Env,支援在真實部署 harnesses 中直接訓練智慧體。專案同步開源了三個領域的訓練方案與資料,其中 Orchard-SWE 在 SWE-bench Verified 上取得了 69.7% 的表現。

    推薦理由:微軟研究院開源了可擴充套件智慧體框架 Orchard,並提供覆蓋軟體工程、網頁瀏覽和個人助理的完整訓練方案,降低了智慧體研究的基建門檻。

7月30日週四
  1. Google DeepMind86

    Gemini Robotics ER 2:通過影片理解、任務編排與多機器人協作驅動機器人

    DeepMind 釋出 Gemini Robotics ER 2,作為其最新的“具身推理”模型,支援持續影片理解、任務編排和多機器人協作。該模型可與任何低層 VLA 模型配合,即時呼叫工具(如 Google Search),並在執行過程中保持推理,顯著提升任務完成率和安全性。

    推薦理由:Gemini Robotics ER 2 通過影片理解和多機器人協作提升機器人任務完成率,展示了高效即時推理與安全控制的結合。

  2. Google DeepMind62

    Google Flow Music 推出 Lyria 3.5,提升音樂性、歌詞、聲樂與創作控制

    Google DeepMind 在 Google Flow Music 上釋出了最新音樂生成模型 Lyria 3.5。該模型在旋律結構、歌詞質量、聲樂表現和發音方面都有顯著提升,並新增了對節奏和時長的細粒度控制,幫助使用者更輕鬆地創作符合預期的歌曲。

    推薦理由:Lyria 3.5 在音樂生成方面提升了旋律、歌詞、聲樂質量,並提供更細粒度的節奏與時長控制,幫助創作者更精準地實現創意。

7月28日週二
  1. Google DeepMind86

    Gemini Robotics 2 為機器人帶來全身智慧

    DeepMind 在部落格中釋出 Gemini Robotics 2,推出三款模型:Gemini Robotics 2(全身視覺‑語言‑動作模型)、Gemini Robotics ER 2(具身推理模型)和 Gemini Robotics On‑Device 2(高效本地化模型)。

    推薦理由:Gemini Robotics 2 通過全身控制、精細操作和多機器人協作,展示了在複雜任務中的智慧執行能力,並能在數小時內適配新機器人身體。

7月23日週四
  1. Hugging Face Blog65

    Hugging Face Diffusers 現已原生支援 Nunchaku 4 位元擴散模型推理

    Hugging Face 釋出了對 Nunchaku 4 位元擴散推理的原生支援,允許使用者通過標準 from_pretrained 方法直接載入量化檢查點,無需本地 CUDA 編譯。

    推薦理由:原文介紹瞭如何在主流擴散模型庫中原生載入 4 位元量化檢查點,這為在消費級硬體上執行大模型提供了輕量化方案。

7月21日週二
  1. Hugging Face Blog65

    Hugging Face 釋出開源機器人運算元據採集系統 Grabette

    Hugging Face 推出開源、低成本的機器人運算元據採集系統 Grabette,允許使用者通過手持夾爪和相機快速錄製任務並自動生成機器人就緒的資料集。該系統包含手持錄製裝置 Grabette 與配套的機器人夾爪端側執行器 Gripette,採用模組化標準感測器構建,並已接入 Hugging Face Hub 與 LeRobot 訓練生態。

    推薦理由:該開源系統降低了機器人運算元據的採集門檻,為社群協作收集具身智慧訓練資料提供了低成本方案。

7月15日週三
  1. Hugging Face Blog75

    推出 Real World VoiceEQ:衡量語音 AI 的人類質量

    Hugging Face 釋出了 Real World VoiceEQ,一個評估語音 AI 人類質量的基準,涵蓋 60 多項指標,覆蓋 40 多個模型。該基準基於 100 萬條人類評分,評估 15+ 維度的 ASR、TTS、S2S 和 Speech Understanding,幫助開發者識別情感、背景噪聲等細粒度缺陷。

    推薦理由:Real World VoiceEQ 提供了超過 60 項指標的真實人類評估,幫助開發者識別模型在情感、背景噪聲等方面的細粒度缺陷。

7月13日週一
7月9日週四
7月8日週三
  1. Hugging Face Blog61

    Hugging Face 釋出原生速度的 vLLM transformers 建模後端

    Hugging Face 宣佈 vLLM 的 transformers 建模後端在多項架構測試中達到或超過 vLLM 手動編寫的原生實現速度。該後端通過 torch.fx 進行模型圖靜態分析並在執行時動態應用特定層融合,使模型作者無需編寫額外程式碼即可直接獲得原生級推理吞吐量。

    推薦理由:原文提供了將原生模型直接應用於高效能推理的具體方法與效能對比,讀者可以據此評估新後端在實際部署中的收益。

7月7日週二
  1. Hugging Face Blog63

    Hugging Face 攜手微軟在 Microsoft Foundry 中推出託管計算與模型精選目錄

    Hugging Face 與微軟在 Microsoft Build 2026 上宣佈推出 Foundry Managed Compute 以及 Hugging Face 模型的精選目錄,每週更新並支援一鍵部署到託管計算平臺。該平臺提供企業級安全治理、多模態支援、統一端點和自動化執行時升級,讓企業能夠在 Azure 中安全、便捷地執行開源模型。

    推薦理由:微軟與 Hugging Face 合作在 Microsoft Foundry 中推出了託管計算與精選開源模型目錄,讀者可以藉此瞭解開源模型在企業級雲平臺中的部署與運維方案。

  2. Hugging Face Blog85

    Hugging Face 釋出 LeRobot v0.6.0:引入世界模型與統一評測

    LeRobot v0.6.0 引入了世界模型策略、全新的視覺語言動作模型和統一的獎勵模型 API,同時帶來了六大模擬評測基準、全新的部署命令列工具以及深度感知和資料自動標註能力。此次更新還優化了資料集載入速度,實現了完全分片資料並行訓練和雲端訓練支援,並大幅精簡了基礎安裝包的依賴。

    推薦理由:該版本閉環了機器人學習流程,使用者可以據此瞭解開源機器人框架在世界模型和評測方面的新能力。

  3. Hugging Face Blog75

    Hugging Face 與 SkyPilot 聯合推出零出口費用雲端儲存後端

    Hugging Face 與 SkyPilot 共同推出原生的 Hugging Face Storage 儲存後端,支援通過單一 hf:// 統一方案在任意雲端或叢集上掛載 Hub 上的模型與資料集。該方案具備零資料出口費、基於 Xet 的重複資料刪除以及按需惰性讀取等特性,可將模型直接載入至異構 GPU 資源中進行開發、訓練或推理。

    推薦理由:原文介紹了 Hugging Face Storage 作為 SkyPilot 儲存後端的具體接入方式,讀者可以據此評估跨雲訓練和零出口費用的實際收益。

7月6日週一
  1. Hugging Face Blog63

    Hugging Face 宣佈 🤗 Kernels 專案重大更新

    Hugging Face 推出了 🤗 Kernels 專案的重大更新,新增了名為 kernel 的 Hub 倉庫型別,並帶來改進的安全機制、重構的 CLI、更廣泛的框架與後端支援,以及對智慧體核心開發的基礎支援。

    推薦理由:官方對自定義核心專案進行了重大改版並引入了新的倉庫型別,為開發者瞭解核心分發與安全機制提供了參考。

7月1日週三
  1. Hugging Face Blog68

    Hugging Face 與 Cerebras 推出基於 Gemma 4 的即時語音 AI

    Hugging Face 與 Cerebras 聯合推出將開源語音 AI 架構與高速推理相結合的即時語音方案,實現自然的語音到語音互動。該開源級聯語音堆疊由 Nvidia Parakeet 進行語音識別、Cerebras 執行 Google DeepMind 的 Gemma 4 31B 模型進行推理、以及 Alibaba 的 Qwen3TTS 生成語音,並已應用於 Reachy Mini 機器人。

    推薦理由:原文展示了開源語音流水線如何結合硬體推理速度,讀者可以評估這種架構在低延遲互動中的表現。

  2. Google Research49

    Google Research 將 Heat Resilience 資料擴充套件至全球 50 多個城市

    Google Research 釋出了擴充套件後的建築級屋頂反射率資料集,覆蓋全球 50 多個城市,旨在幫助城規劃者實施清涼屋頂解決方案以緩解極端熱浪。該資料集通過全新的高解析度 Heat Resilience Earth Engine App 公開提供,結合衛星資料與機器學習模型實現了 30 釐米的高空間解析度。

6月30日週二
  1. Hugging Face Blog62

    Every Eval Ever 結果現已支援在 Hugging Face 模型頁面展示

    Every Eval Ever 與 Hugging Face Community Evals 達成互通,通過推出的轉換工具支援將評估結果同步至 Hugging Face 模型頁面並自動關聯完整記錄。該工具包含格式轉換、衝突審計與本地預覽功能,目前已支援 MMLU-Pro、GPQA、HLE 和 GSM8K 等官方基準。

    推薦理由:原文介紹了 Every Eval Ever 與 Hugging Face Community Evals 的互通方案,為評估結果的跨平臺展示和溯源提供了可複用的自動化工具。

6月25日週四
  1. Google DeepMind64

    Google DeepMind 推出 Gemini 3.5 Flash 內建 computer use 功能

    Google DeepMind 宣佈在 Gemini 3.5 Flash 中內建 computer use 功能,使其能夠跨瀏覽器、移動端和桌面環境執行智慧體任務。該功能支援長週期和企業自動化場景,並通過對抗性訓練與可選的企業安全保護系統來降低提示詞注入等風險。開發者現可通過 Gemini API 和 Gemini Enterprise Agent Platform 開始構建相關應用。

    推薦理由:官方將 computer use 能力直接整合至主模型,開發者可據此構建能跨平臺操作的自定義智慧體。

6月24日週三
6月17日週三
6月9日週二
  1. Google DeepMind81

    Gemini 3.5 Live Translate 即時語音翻譯實現流暢自然

    Gemini 3.5 Live Translate 是 Google DeepMind 推出的最新音訊模型,支援 70+ 語言的即時語音對語音翻譯。該模型可持續流式處理,幾秒延遲,自動檢測語言並保持語調、節奏與音高。

    推薦理由:Gemini 3.5 Live Translate 提供 70+ 語言的即時語音翻譯,減少停頓,適用於會議、通話等場景,幫助開發者快速構建多語言翻譯應用。支援多語言輸入,無需手動配置,噪聲魯棒性強,適合嘈雜環境。

6月5日週五
  1. Google Research64

    Gemini Enterprise Agent Platform 釋出 Agentic RAG 提升可靠響應

    Google Research 推出了 Gemini Enterprise Agent Platform 的 Agentic RAG,利用多代理協同、規劃與足夠上下文機制,提升多源多跳查詢的準確率至 34%,在跨語料庫實驗中保持 90.1% 的高準確率,且延遲與單語料庫版本相近。該功能已作為公開預覽提供。

    推薦理由:該系統在多源多跳查詢中將準確率提升至 34%,為企業工作流提供更可靠的答案,並在跨語料庫場景下保持 90.1% 的高準確率。

6月4日週四
  1. Google Research72

    Google開源水文框架,開啟洪水韌性新篇章

    Google Research公開了其水文模型框架,供各國氣象機構在GitHub上使用和構建AI洪水預報模型。該框架基於PyTorch實現LSTM網路,支援使用Caravan資料集訓練,並已在Czech Hydrometeorological Institute驗證,提升預測時效6天。

    推薦理由:Google公開的水文框架讓各國氣象機構可自行訓練AI洪水預報模型,提升預測時效並降低技術門檻。

5月29日週五
  1. Google Research69

    Google Research 在 I/O 2026 上開啟新發現時代

    Google Research 在 I/O 2026 上公佈了多款 AI 工具與模型,涵蓋科研加速、健康應用、邊緣計算與氣候預測等領域。

    推薦理由:Google Research 在 I/O 2026 上公佈多款 AI 工具與模型,展示了從科研到產品的快速落地與實際影響,凸顯代理式編碼與多模態推理在科學與日常應用中的變革潛力,併為全球科研社群提供了可擴充套件的實驗平臺。

5月28日週四
  1. Mistral AI68

    Mistral AI 在 AI Now Summit 2026 釋出工業工程 AI 堆疊與 Vibe 代理

    Mistral AI 在 AI Now Summit 2026 釋出面向工業工程的全棧 AI 解決方案,並與空中客車、BMW集團和 ASML 合作,支援從設計到生產的安全高效工作流。新推出的 Vibe 代理可處理長週期任務,如編碼與研究;法國 Les Ulis 10 MW 資料中心將於 2026 年第三季度投入使用,提升推理與安全控制。

    推薦理由:Mistral 推出面向工業工程的 AI 堆疊和 Vibe 代理,展示如何在航空、汽車和半導體領域實現安全、高效的設計與生產。

  2. Mistral AI74

    Vibe 開始工作

    Vibe 是 Mistral 推出的統一 AI 代理,兼顧工作與編碼。它提供 Work Mode 處理多步企業任務(如收件箱、日曆、研究、文件起草)以及 Code Mode 進行遠端編碼(從功能開發到拉取請求),並可通過 VS Code、CLI 和 Web 進行無縫協作。

    推薦理由:Vibe 將工作與編碼整合為單一智慧體,支援多步任務、視覺化推理與可擴充套件部署,適合企業與個人使用

  3. Mistral AI74

    推出 Search Toolkit 搜尋工具包

    Mistral AI 公佈 Search Toolkit,開源框架整合搜尋、檢索與評估,支援多源索引、即時資料拉取,相容 BM25、向量檢索及混合模式,內建 recall、precision、MRR、NDCG 等指標,適用於 RAG 與智慧體場景,可在雲端、本地或邊緣部署。

    推薦理由:Search Toolkit 將搜尋、檢索和評估整合到單一框架,幫助企業減少工程時間並提升檢索質量;其可在雲端、邊緣或本地部署,支援多源索引與即時資料拉取,適用於 RAG 與智慧體場景。

5月27日週三
  1. Mistral AI62

    Mistral AI 推出面向工程加速的物理 AI

    Mistral AI 宣佈推出物理 AI 基礎能力,將 Emmi AI 整合至企業級產品棧中。該能力旨在通過資料驅動的模型在單張 GPU 上於數秒內直接預測物理行為,從而實現加速產品設計、加速工裝流程設計以及構建即時數字孿生。

    推薦理由:該產品將物理 AI 引入企業解決方案,讀者可以瞭解其如何通過單次前向傳播將模擬模擬時間從數小時縮短至數秒。

5月22日週五
  1. Mistral AI83

    Mistral AI 釋出 Studio 平臺 Connectors 功能

    Mistral AI 在 Studio 中推出 Connectors 功能,支援開發者使用內建與自定義 MCP 構建企業級 AI 應用。該功能提供 API/SDK 接入、直接工具呼叫、人機協同審批流及統一的集中註冊管理,適用於各類對話、智慧體及複雜工作流。

    推薦理由:該功能將企業級資料整合統一封裝為可重用的 MCP 實體,減少了重複開發和鑑權成本,為構建複雜智慧體工作流提供了標準化方案。

5月20日週三
  1. Google Research74

    Google 釋出科研輔助工具 Empirical Research Assistance 並推出 Computational Discovery

    Google 釋出由 Gemini 驅動的科研輔助工具 Empirical Research Assistance(ERA),可用於編寫和最佳化科學程式碼,並在《Nature》雜誌上發表了相關論文。

    推薦理由:Google 推出基於 Gemini 的科研輔助工具 Empirical Research Assistance,讀者可以瞭解其在多學科科學發現中的應用例項和開放入口。

5月19日週二
  1. Google DeepMind47

    Co-Scientist 加速基因線索以逆轉細胞衰老

    Co-Scientist 幫助生物學家 Omar Abudayyeh 和 Jonathan Gootenberg 在基因篩選實驗中快速識別並驗證了多種可逆轉細胞衰老的基因因素。它掃描數萬篇論文,提出超過20個新穎可行的基因靶點,其中部分已在實驗中證明能使細胞恢復年輕狀態並提升功能。除此之外,Co-Scientist 將資料分析時間從長達六個月壓縮至僅幾天。

5月18日週一
  1. Google DeepMind63

    Google DeepMind 推出 Project Genie 街景接地功能並擴大訪問範圍

    Google DeepMind 推出了將 Project Genie 與 Google Street View 結合的新街景接地功能,允許使用者利用真實街景影像生成互動虛擬環境,並面向全球 Google AI Ultra 訂閱者逐步開放。新功能通過 Maps Imagery Grounding 技術支援,目前美國地區的街景影像已可用。

    推薦理由:該產品更新將世界模型與街景資料結合,為使用者和智慧體提供了在現實地點基礎上生成互動環境的新能力。

  2. Google DeepMind86

    Google DeepMind 釋出 Antigravity 2.0 獨立桌面應用

    Google DeepMind 推出了全新獨立桌面應用 Google Antigravity 2.0,專為智慧體最佳化的體驗而設計,擺脫了傳統整合開發環境的束縛。該應用由 Gemini 模型驅動,引入了動態子代理、非同步任務管理、JSON 鉤子、定時任務以及基於專案的許可權管理等核心功能。

    推薦理由:該版本脫離了傳統開發環境並引入了獨立桌面應用形態,讀者可以據此瞭解智慧體工具如何向通用知識工作擴充套件。

5月17日週日