跳到正文

全部動態

RSS
今日 23 則
9月25日週五
  1. Latent Space66

    Runway 的 WorldPrompt 與即時世界的工程實現

    Runway 介紹了其最新的世界模型 GWM Worlds 2 以及提出的輸入格式 WorldPrompt,並闡述了其如何通過自迴歸擴散和蒸餾方法實現 720p 24fps 的即時互動式影片和音訊生成。文章還探討了真實物理模擬、長上下文、誤差累積等工程挑戰,以及在遊戲、機器人和智慧體模擬等領域的潛在應用。

9月24日週四
  1. Simon Willison42

    Gemini 3.8 TTS Playground 演示平臺

    Google 釋出了 Gemini 3.8 TTS 的兩個新模型 gemini-3.8-flash-tts 與 gemini-3.8-flash-lite-tts,支援 2,000+ 語音並可通過 30 秒樣本建立自定義聲音。Gemini 3.8 TTS Playground 允許使用者在瀏覽器中構建單聲道或多說話人對話,生成 1m18s 音訊僅需約 20 秒,成本 2.74 美分。

9月23日週三
  1. Latent Space95

    Anthropic 釋出 Claude Opus 5.5 與 OpenAI 推出 GPT-6 Sol 和 Luna 模型

    Anthropic 釋出了 Claude Opus 5.5,主打 Fable 5.1 級能力與更低執行成本,隨後 OpenAI 推出了降價幅度和價效比更高的 GPT-6 Sol 與 Luna 模型。兩家實驗室均在效率最佳化與定價上展開競爭,同時社群也圍繞基準評測和多Agent擴充套件展開了廣泛討論。

    推薦理由:文章梳理了兩家頭部廠商最新旗艦及平價模型的效能與定價策略,讀者可據此對比當前前沿模型的綜合性價比。

  2. Simon Willison86

    Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna 與新一輪價格戰

    Anthropic 釋出了 Claude Opus 5.5,其輸入輸出價格較前代降低 20%,快取讀取價格降低 60%,並在高思考級別下遇到了超出最大輸出 token 限制的問題;隨後 OpenAI 釋出了 GPT-6 Sol 與 GPT-6 Luna,價格降至同級前代型號的一半。兩家廠商通過密集釋出新模型和大幅降價,進一步加劇了 AI 模型的市場價格戰。

    推薦理由:文章記錄了多款旗艦模型密集釋出與降價的情況,讀者可以據此瞭解當前各大廠商在推理模型定價與效能上的最新競爭格局。

9月22日週二
  1. Vercel Blog67

    GPT‑6 Sol 與 Luna 在 AI Gateway 上線

    OpenAI 的 GPT‑6 Sol 與 GPT‑6 Luna 現已在 AI Gateway 上線,價格低於 GPT‑6 Astra。Sol 適用於複雜編碼與持續性探究的 agent 工作流,Luna 則是低成本的高頻重複工作選項。兩者相較 GPT‑5.6 在事實可靠性、直白溝通和減少誤導性編碼宣告方面都有提升。使用時只需傳入模型 ID,即可在模型演練區體驗。

    推薦理由:GPT‑6 Sol 與 Luna 在 AI Gateway 上線,價格更低且在程式碼與專業工作中提升事實可靠性,讀者可評估其高頻工作流價值。

  2. Vercel Blog78

    Claude Opus 5.5 在 AI Gateway 上可用

    Anthropic 的 Claude Opus 5.5 已在 AI Gateway 上上線,支援 1M-token 上下文視窗和 128K 輸出 token。與 Opus 5 相比,速度提升約 30%,成本降低約 40%。

    推薦理由:Opus 5.5 在速度和成本上相較前代提升顯著,適合需要大上下文和長任務的智慧體工作,其 1M-token 上下文視窗和 128K 輸出令長任務更易監督,且支援自動工具選擇,提升開發效率。對開發者而言,Opus 5.5 的速度與成本優勢可顯著降低專案迭代週期。

9月21日週一
  1. Microsoft Research66

    RetroChimera 提升大規模小分子合成預測

    微軟研究團隊釋出 RetroChimera,一種用於大規模小分子合成預測的框架,並在 Nature 論文中展示其效能。RetroChimera 結合 R‑SMILES 2 與 NeuralLoc 兩種模型,通過學習式重排序實現更準確的合成路線預測。其開源實現已在 GitHub 上釋出,旨在加速藥物與材料研發。

    推薦理由:RetroChimera 通過融合兩種模型提升化學合成預測,公開原始碼可加速藥物與材料研發。

9月18日週五
  1. Vercel Blog72

    Jev 是 AI Gateway 歷史上最快被採用的模型

    Jev 在 AI Gateway 上的首日採用率突破 GPT‑5.6 兩倍,證明專門化決策模型能迅速進入實際工作流程。 - 首日採用率:24 小時內已達 13% 的付費團隊使用,超過 GPT‑5.6 兩倍、Fable 5.1 六倍。

    推薦理由:Jev 在 AI Gateway 上的首日採用率突破 GPT‑5.6 兩倍,證明專門化決策模型能迅速進入實際工作流程。

9月16日週三
  1. Google DeepMind66

    Google DeepMind 釋出 Gemini 3.8 Live 與 3.8 Live Extended Thinking 語音模型

    Google DeepMind 推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款先進的即時對話模型,帶來並行推理與近即時語音互動升級。

    推薦理由:Google DeepMind 推出了 Gemini 3.8 Live 與 3.8 Live Extended Thinking,通過並行推理與近即時語音互動能力在多項語音基準測試中表現突出,讀者可藉此評估其在複雜語音智慧體開發和企業級工作流中的應用潛力。

9月15日週二
  1. Vercel Blog78

    Gemini 3.8 Live 模型現已可於 AI Gateway 使用

    Gemini 3.8 Live 及 Gemini 3.8 Live Extended Thinking 現已可於 AI Gateway 使用,支援即時語音互動與多模態功能。

    推薦理由:Gemini 3.8 Live 及其擴充套件思考功能可即時語音互動,開發者可透過 AI Gateway 直接使用 WebSocket 進行即時對話,提升語音助手與多模態應用的互動體驗。

9月9日週三
  1. OpenAI News86

    OpenAI 釋出 GPT-6 Astra 模型

    OpenAI 推出 GPT-6 Astra,作為其迄今為止最具智慧與對齊能力的模型,現已在 ChatGPT Work、Codex 及 API 中可用。該模型在計算機使用、瀏覽、軟體工程及網路安全等專業任務上表現領先,API 定價為每百萬輸入 token 10 美元、每百萬輸出 token 50 美元。

    推薦理由:原文公佈了新模型的各項能力基準、定價及企業級安全控制,讀者可以據此評估其在複雜工作流中的成本效益。

9月3日週四
  1. Google DeepMind84

    Google DeepMind 釋出全球天氣大模型 WeatherNext 3

    Google DeepMind 和 Google Research 釋出全新的全球天氣大模型 WeatherNext 3,支援每小時即時衛星資料輸入並提供高達 5 公里解析度的預測。該模型在降水預測精度上取得顯著提升,並增加了清潔能源變數預測,現已整合至 Search、Gemini、Maps 和 Cloud 等產品中。

    推薦理由:該模型通過融合即時衛星資料與高解析度網格,提升了全球天氣預報的精度和更新頻率,為清潔能源規劃和區域氣象服務提供了更可靠的資料支援。

  2. Hugging Face Blog63

    NeoMME:高效的多模態原生多語言編碼器

    Hugging Face 團隊推出了 NeoMME,這是一個包含 260M 和 800M 引數的多語言多模態基礎編碼器系列。該模型不使用單獨的視覺塔或因果語言模型,而是通過單個雙向 Transformer 同時處理文本 token 和原始影像塊。

    推薦理由:原文釋出了不依賴獨立視覺塔的多模態雙向編碼器,讀者可以瞭解其單塔架構和檢索效能。

  3. Hugging Face Blog66

    如何用 TRL 和 OpenEnv 訓練程式碼模型繪製水彩畫

    作者基於開源方案復現了讓大語言模型通過編寫 JavaScript 程式碼繪製水彩畫的強化學習流程,並公開了參考影像池、強化學習環境、訓練指令碼及訓練好的模型。文章對比了不同美學獎勵權重配置下的多項實驗結果,詳細記錄了基礎設施搭建及訓練調優過程中的發現。

    推薦理由:文章復現並開源了使用強化學習訓練程式碼模型繪製水彩畫的完整流程,為讀者提供了基於美學偏好進行對齊的具體實現與多重實驗對比。

9月1日週二
  1. Google Research63

    Google Research 釋出 TimesFM-3:支援多變數預測的零樣本時間序列基座模型

    Google Research 推出 TimesFM-3,這是一個擁有 3.3 億引數、原生支援多變數預測的零樣本時間序列基座模型。該模型採用解碼器架構與交替注意力機制,支援單次前向傳遞生成整個預測區間,在 Gift-Eval、FEV-Bench 和 Time 等基準測試中表現優於其他預訓練基座模型,目前已在 GitHub 和 Hugging Face 上線。

    推薦理由:谷歌釋出了面向多變數時間序列預測的基座模型 TimesFM-3,它通過交替注意力架構和單次前向傳遞實現了零樣本預測,在多項公開基準測試中表現領先。

8月28日週五
  1. Google DeepMind68

    Google DeepMind 釋出 Gemini Omni 1.1 Flash 影片生成模型

    Google DeepMind 推出了 Gemini Omni 1.1 Flash,帶來場景延伸、首尾幀插值、4K 超解析度升級、360p 高效草稿生成及影片參考等多項專業級影片生成與控制功能,現已通過 Gemini API 及 Google AI Studio 面向開發者開放。

    推薦理由:原文給出了新模型的生成能力與接入方式,讀者可以據此瞭解其在影片製作中的具體控制選項。

8月27日週四
  1. Google DeepMind75

    Google DeepMind 釋出語音轉文本模型 Gemini 3.5 Transcribe

    Google DeepMind 推出 Gemini 3.5 Transcribe,這是其迄今最精準的語音轉文本模型,支援即時流式傳輸與預錄音頻處理,字錯誤率在流式傳輸和非流式場景下分別達到 4.0% 和 2.6%。該模型支援超過 85 種語言的自動檢測與轉錄,具備智慧糾錯、自定義詞彙識別及多說話人識別等功能,目前已在 Google AI Studio 等平臺面向開發者開放公測。

    推薦理由:官方推出的最新語音轉文本模型給出了具體的錯誤率和多語言支援資料,讀者可以據此評估其實際語音互動效能。

8月25日週二
  1. Hugging Face Blog74

    Granite 4.2 LLM:構建過程

    Granite 4.2 是 IBM 推出的三種規模(3B、8B、30B)的稠密解碼器推理 LLM,基於 Granite‑4.1 預訓練模型,使用約 15T 令牌的五階段訓練策略,擴充套件上下文視窗至 512K,並通過監督微調和多階段強化學習(包括 agentic RL)實現鏈式思考、工具呼叫與低成本思考模式。

    推薦理由:Granite 4.2 通過多階段 RL 訓練實現強推理與工具呼叫能力,讀者可瞭解其技術細節與效能提升。

8月21日週五
  1. Microsoft Research56

    微軟研究院釋出 Skala 1.1 並拓展其在計算化學軟體中的整合

    微軟研究院釋出深度學習密度泛函理論模型 Skala 1.1,在 GMTKN55 基準測試中表現優異,並宣佈已在 CP2K 中可用,同時正逐步整合至 Psi4、FHI-aims、ORCA 和 VASP 等主流計算化學軟體中。該版本使用比前代多 2.5 倍的資料訓練,在保持半局域泛函效率的同時提升了準確性,並推出了動態效能報告來追蹤跨硬體的計算效率。

8月18日週二
  1. Hugging Face Blog68

    Sentence Transformers v6.0 釋出,引入多向量檢索與互動模型支援

    Sentence Transformers 釋出 v6.0 版本,首次引入第四種模型型別 MultiVectorEncoder,用於支援 ColBERT 風格的後期互動檢索。該版本允許開發者通過熟悉的 API 直接載入各類 PyLate、ColBERT 以及 ColPali 視覺文件檢索模型的檢查點,無需經過複雜的格式轉換。

    推薦理由:該版本新增了對多向量檢索模型的原生支援,讀者可以通過標準介面直接載入多種主流模型的檢查點並完成檢索與重排。

8月14日週五
  1. Google DeepMind74

    Gemini 3.7 Flash 推出

    Google DeepMind 推出了 Gemini 3.7 Flash,這是其 Flash 系列最新的工作模型,專為編碼和智慧體設計。該模型在 FrontierCode、DeepSWE、WebDev Arena 等基準上顯著提升準確率,且每百萬輸入 token 價格僅 $0.75,輸出 $3.75,成本更低。

    推薦理由:Gemini 3.7 Flash 在編碼、網頁開發和知識工作等領域顯著提升準確率,並以更低成本提供高效工作流。

8月12日週三
  1. Google DeepMind62

    Google DeepMind 釋出手語轉文本模型 SL2T

    Google DeepMind 釋出了多語言手語轉文本翻譯模型 SL2T,並將其整合到 Gboard 和 Pixel 11 的 Live Transcribe 中。該模型支援將美國手語直接轉換為英語文本,它基於超過 10 萬小時的資料訓練,通過處理姿勢關節點來保護隱私並實現流式輸出。

    推薦理由:該模型將手語翻譯直接帶入消費級產品,為聽障使用者提供了更自然的手語輸入方式。

  2. Microsoft Research45

    引入 CARE-X:通過輔助監督、獎勵對齊學習與工具增強測量邁向臨床有用的放射學 VLM

    Microsoft Research 推出了研究模型 CARE-X,這是一款旨在兼顧自由文本推理與確定性輸出的統一胸部 X 光 VLM。該模型結合了生成式與判別式能力,並通過強化學習(DAPO)在多工設定中最佳化臨床準確性。研究還線上路實驗中搭配了 Qwen3-VL-4B-Instruct 與確定性測量工具以評估效能。

8月11日週二
  1. Hugging Face Blog77

    構建低延遲多語種語音代理:NVIDIA Magpie TTS 開放權重與完整部署控制

    NVIDIA 釋出了 Magpie TTS 多語種文本轉語音模型,支援12種語言,並提供開放權重與本地部署能力。該模型在單流 GPU 上可實現 32–79 ms 的首音延遲,64 併發流下可達 239 ms,吞吐率高達 320× 即時。

    推薦理由:開放權重與低延遲讓企業可在本地部署多語種語音代理,支援12種語言並提供高質量音訊,幫助企業實現低延遲、可定製的多語種語音代理。

8月10日週一
  1. Hugging Face Blog86

    Meta 釋出開源多模態模型 Muse Glimmer

    Meta 推出了全新的 30B 引數開源多模態模型 Muse Glimmer,採用 Apache 2.0 協議釋出,專門面向本地智慧體和隱私保護應用。該模型結合了 2B 的視覺感知編碼器與 28B 的文本解碼器,支援影像、影片理解以及多模態工具呼叫,並提供 transformers、llama.cpp 和 vLLM 的首日支援。

    推薦理由:文章詳細介紹了 Meta 開源多模態模型 Muse Glimmer 的架構設計與本地部署方法,讀者可以據此瞭解其在端側智慧體和多模態任務中的應用潛力。

8月6日週四
  1. Google DeepMind66

    Google DeepMind 釋出 WeatherNext AI 模型並實現氣旋預測突破

    Google DeepMind 推出了 WeatherNext AI 模型,在氣旋的路徑、強度和風力結構預測上達到了 SOTA 精度,平均可提供額外一天的預警時間。該研究成果已在 Nature 發表,團隊宣佈開源 WeatherNext 2 與 WeatherNext Cyclones 模型程式碼及權重。

    推薦理由:該模型實現了氣旋路徑和強度預測的大幅準確率提升,並開源了程式碼與權重,為氣象研究和防災減災提供了新工具。

8月4日週二
  1. Mistral AI63

    Mistral AI 釋出 3B 開源多模態安全分類模型 Shieldstral

    Mistral AI 釋出了 Shieldstral,這是一款 3B 引數的開源多模態安全分類模型,採用 Apache 2.0 協議開源。該模型將內容稽核轉換為策略自適應的問答任務,允許在推理時通過自然語言指定策略,從而無需重新訓練即可統一處理文本和影像安全評估。

    推薦理由:該模型通過將內容稽核轉化為推理時的自然語言問答任務,避免了傳統方案因固定分類體系而需要重新訓練的限制。