OpenAI 推出 GPT-6.1 Sol,幾乎匹配 GPT-6 Astra,成本更低
OpenAI 在 DevDay 事件中釋出 GPT-6.1 Sol,聲稱其在代理式編碼、計算機使用和專業工作中的智慧水平幾乎與 GPT-6 Astra 相當,但標準輸入輸出 token 價格僅為其五分之一。
推薦理由:GPT-6.1 Sol 以五分之一的成本接近 GPT-6 Astra 的效能,為開發者提供更經濟的高效代理模型。
OpenAI 在 DevDay 事件中釋出 GPT-6.1 Sol,聲稱其在代理式編碼、計算機使用和專業工作中的智慧水平幾乎與 GPT-6 Astra 相當,但標準輸入輸出 token 價格僅為其五分之一。
推薦理由:GPT-6.1 Sol 以五分之一的成本接近 GPT-6 Astra 的效能,為開發者提供更經濟的高效代理模型。
Runway 介紹了其最新的世界模型 GWM Worlds 2 以及提出的輸入格式 WorldPrompt,並闡述了其如何通過自迴歸擴散和蒸餾方法實現 720p 24fps 的即時互動式影片和音訊生成。文章還探討了真實物理模擬、長上下文、誤差累積等工程挑戰,以及在遊戲、機器人和智慧體模擬等領域的潛在應用。
Liquid AI 針對視覺語言模型 LFM2.5-VL-3B 釋出了實驗性的 DSpark 草稿模型,通過引入投機解碼路徑實現推理加速。該草稿模型包含 2.8 億引數(增量 8.9%),在端側和 GPU 上解碼速度最高可提升 3.13 倍,並且首日即整合支援 llama.cpp、MLX-VLM 和 SGLang。
Liquid AI 針對 LFM2.5 模型家族釋出了 DSpark 草稿模型檢查點,通過引入推測解碼路徑,在不改變輸出質量的情況下實現了最高 3.2 倍的吞吐量提升。
推薦理由:該方案在保持輸出質量不變的前提下提升了吞吐量,為端側和雲端推理效能最佳化提供了可複用的技術實踐。
微軟研究院釋出深度學習密度泛函理論模型 Skala 1.1,在 GMTKN55 基準測試中表現優異,並宣佈已在 CP2K 中可用,同時正逐步整合至 Psi4、FHI-aims、ORCA 和 VASP 等主流計算化學軟體中。該版本使用比前代多 2.5 倍的資料訓練,在保持半局域泛函效率的同時提升了準確性,並推出了動態效能報告來追蹤跨硬體的計算效率。
Sentence Transformers 釋出 v6.0 版本,首次引入第四種模型型別 MultiVectorEncoder,用於支援 ColBERT 風格的後期互動檢索。該版本允許開發者通過熟悉的 API 直接載入各類 PyLate、ColBERT 以及 ColPali 視覺文件檢索模型的檢查點,無需經過複雜的格式轉換。
推薦理由:該版本新增了對多向量檢索模型的原生支援,讀者可以通過標準介面直接載入多種主流模型的檢查點並完成檢索與重排。
Google DeepMind 推出了 Gemini 3.7 Flash,這是其 Flash 系列最新的工作模型,專為編碼和智慧體設計。該模型在 FrontierCode、DeepSWE、WebDev Arena 等基準上顯著提升準確率,且每百萬輸入 token 價格僅 $0.75,輸出 $3.75,成本更低。
推薦理由:Gemini 3.7 Flash 在編碼、網頁開發和知識工作等領域顯著提升準確率,並以更低成本提供高效工作流。
NVIDIA 釋出了 Magpie TTS 多語種文本轉語音模型,支援12種語言,並提供開放權重與本地部署能力。該模型在單流 GPU 上可實現 32–79 ms 的首音延遲,64 併發流下可達 239 ms,吞吐率高達 320× 即時。
推薦理由:開放權重與低延遲讓企業可在本地部署多語種語音代理,支援12種語言並提供高質量音訊,幫助企業實現低延遲、可定製的多語種語音代理。
DeepMind 釋出 Gemini Robotics ER 2,作為其最新的“具身推理”模型,支援持續影片理解、任務編排和多機器人協作。該模型可與任何低層 VLA 模型配合,即時呼叫工具(如 Google Search),並在執行過程中保持推理,顯著提升任務完成率和安全性。
推薦理由:Gemini Robotics ER 2 通過影片理解和多機器人協作提升機器人任務完成率,展示了高效即時推理與安全控制的結合。
Google DeepMind 在 Google Flow Music 上釋出了最新音樂生成模型 Lyria 3.5。該模型在旋律結構、歌詞質量、聲樂表現和發音方面都有顯著提升,並新增了對節奏和時長的細粒度控制,幫助使用者更輕鬆地創作符合預期的歌曲。
推薦理由:Lyria 3.5 在音樂生成方面提升了旋律、歌詞、聲樂質量,並提供更細粒度的節奏與時長控制,幫助創作者更精準地實現創意。
Gemini 3.5 Live Translate 是 Google DeepMind 推出的最新音訊模型,支援 70+ 語言的即時語音對語音翻譯。該模型可持續流式處理,幾秒延遲,自動檢測語言並保持語調、節奏與音高。
推薦理由:Gemini 3.5 Live Translate 提供 70+ 語言的即時語音翻譯,減少停頓,適用於會議、通話等場景,幫助開發者快速構建多語言翻譯應用。支援多語言輸入,無需手動配置,噪聲魯棒性強,適合嘈雜環境。
Google DeepMind 的天氣模型 WeatherNext 成功提前五天預測了 2025 年颶風梅利莎在牙買加增強至五級強颶風的路徑與強度。該模型通過結合全球天氣模式與極端熱帶氣旋資料集,兼顧了傳統模型難以同時做到的路徑與強度預測能力。
推薦理由:文章詳細記錄了 AI 天氣模型在颶風預報中的實際表現與提前天數,讀者可以據此評估其在極端氣象預測中的應用潛力。