跳到正文

#產品更新

RSS
今日 0 則
9月30日週三
9月25日週五
  1. Latent Space66

    Runway 的 WorldPrompt 與即時世界的工程實現

    Runway 介紹了其最新的世界模型 GWM Worlds 2 以及提出的輸入格式 WorldPrompt,並闡述了其如何通過自迴歸擴散和蒸餾方法實現 720p 24fps 的即時互動式影片和音訊生成。文章還探討了真實物理模擬、長上下文、誤差累積等工程挑戰,以及在遊戲、機器人和智慧體模擬等領域的潛在應用。

9月24日週四
8月21日週五
  1. Microsoft Research56

    微軟研究院釋出 Skala 1.1 並拓展其在計算化學軟體中的整合

    微軟研究院釋出深度學習密度泛函理論模型 Skala 1.1,在 GMTKN55 基準測試中表現優異,並宣佈已在 CP2K 中可用,同時正逐步整合至 Psi4、FHI-aims、ORCA 和 VASP 等主流計算化學軟體中。該版本使用比前代多 2.5 倍的資料訓練,在保持半局域泛函效率的同時提升了準確性,並推出了動態效能報告來追蹤跨硬體的計算效率。

8月18日週二
  1. Hugging Face Blog68

    Sentence Transformers v6.0 釋出,引入多向量檢索與互動模型支援

    Sentence Transformers 釋出 v6.0 版本,首次引入第四種模型型別 MultiVectorEncoder,用於支援 ColBERT 風格的後期互動檢索。該版本允許開發者通過熟悉的 API 直接載入各類 PyLate、ColBERT 以及 ColPali 視覺文件檢索模型的檢查點,無需經過複雜的格式轉換。

    推薦理由:該版本新增了對多向量檢索模型的原生支援,讀者可以通過標準介面直接載入多種主流模型的檢查點並完成檢索與重排。

8月14日週五
  1. Google DeepMind74

    Gemini 3.7 Flash 推出

    Google DeepMind 推出了 Gemini 3.7 Flash,這是其 Flash 系列最新的工作模型,專為編碼和智慧體設計。該模型在 FrontierCode、DeepSWE、WebDev Arena 等基準上顯著提升準確率,且每百萬輸入 token 價格僅 $0.75,輸出 $3.75,成本更低。

    推薦理由:Gemini 3.7 Flash 在編碼、網頁開發和知識工作等領域顯著提升準確率,並以更低成本提供高效工作流。

8月11日週二
  1. Hugging Face Blog77

    構建低延遲多語種語音代理:NVIDIA Magpie TTS 開放權重與完整部署控制

    NVIDIA 釋出了 Magpie TTS 多語種文本轉語音模型,支援12種語言,並提供開放權重與本地部署能力。該模型在單流 GPU 上可實現 32–79 ms 的首音延遲,64 併發流下可達 239 ms,吞吐率高達 320× 即時。

    推薦理由:開放權重與低延遲讓企業可在本地部署多語種語音代理,支援12種語言並提供高質量音訊,幫助企業實現低延遲、可定製的多語種語音代理。

7月30日週四
  1. Google DeepMind86

    Gemini Robotics ER 2:通過影片理解、任務編排與多機器人協作驅動機器人

    DeepMind 釋出 Gemini Robotics ER 2,作為其最新的“具身推理”模型,支援持續影片理解、任務編排和多機器人協作。該模型可與任何低層 VLA 模型配合,即時呼叫工具(如 Google Search),並在執行過程中保持推理,顯著提升任務完成率和安全性。

    推薦理由:Gemini Robotics ER 2 通過影片理解和多機器人協作提升機器人任務完成率,展示了高效即時推理與安全控制的結合。

  2. Google DeepMind62

    Google Flow Music 推出 Lyria 3.5,提升音樂性、歌詞、聲樂與創作控制

    Google DeepMind 在 Google Flow Music 上釋出了最新音樂生成模型 Lyria 3.5。該模型在旋律結構、歌詞質量、聲樂表現和發音方面都有顯著提升,並新增了對節奏和時長的細粒度控制,幫助使用者更輕鬆地創作符合預期的歌曲。

    推薦理由:Lyria 3.5 在音樂生成方面提升了旋律、歌詞、聲樂質量,並提供更細粒度的節奏與時長控制,幫助創作者更精準地實現創意。

6月9日週二
  1. Google DeepMind81

    Gemini 3.5 Live Translate 即時語音翻譯實現流暢自然

    Gemini 3.5 Live Translate 是 Google DeepMind 推出的最新音訊模型,支援 70+ 語言的即時語音對語音翻譯。該模型可持續流式處理,幾秒延遲,自動檢測語言並保持語調、節奏與音高。

    推薦理由:Gemini 3.5 Live Translate 提供 70+ 語言的即時語音翻譯,減少停頓,適用於會議、通話等場景,幫助開發者快速構建多語言翻譯應用。支援多語言輸入,無需手動配置,噪聲魯棒性強,適合嘈雜環境。

5月16日週六
  1. Google DeepMind64

    Google DeepMind 介紹 WeatherNext 如何協助美國國家颶風中心預測颶風梅利莎

    Google DeepMind 的天氣模型 WeatherNext 成功提前五天預測了 2025 年颶風梅利莎在牙買加增強至五級強颶風的路徑與強度。該模型通過結合全球天氣模式與極端熱帶氣旋資料集,兼顧了傳統模型難以同時做到的路徑與強度預測能力。

    推薦理由:文章詳細記錄了 AI 天氣模型在颶風預報中的實際表現與提前天數,讀者可以據此評估其在極端氣象預測中的應用潛力。