跳到正文

#模型釋出

RSS
今日 2 則
今天10月1日週四
  1. Google DeepMind72

    Gemini 4 Argon 釋出:開啟前沿智慧新時代

    Google DeepMind 推出了 Gemini 4 Argon,這是一款具備長推理、跨領域多模態能力的前沿模型。Argon 在軟體工程、金融、法律和網路安全等行業基準上重新整理記錄,並已在內部工作流中提升效率;其 1M token 輸出上限和 $2/百萬輸入、$10/百萬輸出的價格為開發者提供更高性價比。

    推薦理由:Gemini 4 Argon 通過大幅提升推理長度和多模態能力,顯著提升軟體工程、金融與網路安全等領域的工作效率,並在多項行業基準上重新整理記錄,幫助企業加速技術迭代。

  2. Google DeepMind63

    Google DeepMind 釋出 SynthID Bio 為生成式生物學引入水印技術

    Google DeepMind 推出了 SynthID Bio,這是一種專為合成生物學開發的水印技術,可在保持蛋白質生物功能的同時,將不可見的標記直接嵌入胺基酸序列和預測的 3D 結構中。該技術通過了溼實驗室對靶向蛋白質的測試,並對 AlphaFold 3 的擴散網路及 Evo 2 基因組模型進行了適配,旨在加強生物安全性並確保科學資料的完整性。

9月30日週三
  1. AWS Machine Learning Blog66

    AWS 推出 Claude Sonnet 5.5

    AWS 宣佈 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform 上可用,具備更高的編碼與知識工作效率及更低的單任務成本。該模型適合處理範圍明確的持續工作負載,支援與 Claude Opus 5.5 搭配使用以兼顧複雜判斷與快速執行,使用者可通過控制台或 API 進行呼叫。

    推薦理由:原文公佈了該模型在特定平臺上的可用性與技術改進,讀者可以據此評估其在自動化任務中的成本與效能表現。

  2. Vercel Blog65

    Ling 3.1 Flash 現已在 AI Gateway 上可用

    Ling 3.1 Flash 是 InclusionAI 推出的混合推理語言模型,現已在 AI Gateway 上免費使用至 2026 年 10 月 13 日。

    推薦理由:Ling 3.1 Flash 提供 262K token 上下文視窗和 560B 引數的混合推理能力,專為編碼與多步分析設計,讀者可評估其在 AI Gateway 上的應用潛力與成本優勢。

  3. AWS Machine Learning Blog66

    GPT-6.1 Sol 現已登陸 Amazon Bedrock

    GPT-6.1 Sol 現已在 Amazon Bedrock 上全面可用,為編碼、計算機使用和專業工作負載帶來更強的推理能力。該模型在 DeepSWE v1.1 上以約五分之一的單任務成本實現了接近 GPT-6 Astra 的表現,並在複雜文件分析和多步驟工作流上超越了 GPT-6 Sol。

    推薦理由:原文公佈了模型在亞馬遜雲科技平臺上的可用性和基準表現,讀者可以據此評估其在自動化工作流中的價效比與落地可行性。

9月29日週二
  1. Hugging Face Blog64

    NVIDIA 釋出開源表格基礎模型 Kumo Tabular

    NVIDIA 釋出開源表格基礎模型 Kumo Tabular,採用 Transformer 架構,無需訓練、調參或特徵工程即可在單次前向傳播中完成分類與迴歸預測。該模型提供 28M 到 215M 三種引數規模,完全基於人工合成數據進行預訓練,並在 TabArena、BeyondArena、TALENT 和 ScoringBench 四個基準測試中排名第一。

    推薦理由:該模型不經微調即可直接預測表格資料,讀者可以據此評估它在企業級結構化資料預測任務中的應用潛力。

  2. OpenAI News86

    OpenAI 釋出 GPT-6.1 Sol

    OpenAI 釋出 GPT-6.1 Sol,具備接近 Astra 的編碼、電腦操作和專業工作智慧,且 API 輸入輸出 token 價格降至 Astra 標準價格的五分之一。

    推薦理由:原文給出了新模型的定位、核心能力與價格降幅,讀者可以據此判斷它會怎樣改變日常開發與專業工作流。

  3. Vercel Blog71

    GPT-6.1 Sol 在 AI Gateway 上可用

    OpenAI 的 GPT-6.1 Sol 現已在 Vercel AI Gateway 上上線。該模型在編碼、電腦使用和專業工作方面相較 GPT-6 Sol 有顯著提升,能夠更好地閱讀複雜文件、執行多步工作流、除錯程式碼、處理業務任務,並從包含表格和圖表的 PDF 中提取答案。

    推薦理由:GPT-6.1 Sol 在 AI Gateway 上提供更精準的編碼與文件處理能力,並以更低成本滿足多步工作流需求。

9月28日週一
  1. Hugging Face Blog83

    Hcompany 釋出 Holo4 系列智慧體模型與 Holotron4 Nano

    Hcompany 釋出全新智慧體模型系列 Holo4,包含 27B dense 與 35B-A3B Mixture of Experts 兩個尺寸,並同步推出更新版 Holotron4 Nano。該系列模型支援 GUI、程式碼、MCP 與 API 等多種互動介面,在 OSWorld 2.0 等基準測試中表現優異,相關權重與軌跡資料已在 Hugging Face 開源。

    推薦理由:文章公佈了新模型的大小、介面和基準測試表現,讀者可以據此瞭解其在複雜工作流中的表現。

9月27日週日
9月25日週五
9月23日週三
  1. Google DeepMind84

    Google DeepMind 釋出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS 語音生成模型

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 兩款全新語音生成模型,支援超過 100 種語言的自然語言提示詞聲音設計、30 秒聲音復刻以及逐行臺詞精細導演。

    推薦理由:官方釋出的最新語音生成模型提供了細粒度的臺詞導演和聲音定製能力,讀者可以據此評估其在多語言配音與智慧體互動中的實際表現。

  2. Vercel Blog66

    Gemini 3.8 TTS模型現已在AI Gateway上線

    Gemini 3.8 Flash‑Lite TTS 與 Gemini 3.8 Flash TTS 現已在 AI Gateway 上線,支援 100 多種語言的文本轉語音,支援長篇朗讀、交付控制和雙人對話。

    推薦理由:Gemini 3.8 TTS模型已在AI Gateway上線,支援100多種語言、長篇朗讀和雙人對話,開發者可通過AI SDK輕鬆生成語音。

9月22日週二
  1. Vercel Blog67

    GPT‑6 Sol 與 Luna 在 AI Gateway 上線

    OpenAI 的 GPT‑6 Sol 與 GPT‑6 Luna 現已在 AI Gateway 上線,價格低於 GPT‑6 Astra。Sol 適用於複雜編碼與持續性探究的 agent 工作流,Luna 則是低成本的高頻重複工作選項。兩者相較 GPT‑5.6 在事實可靠性、直白溝通和減少誤導性編碼宣告方面都有提升。使用時只需傳入模型 ID,即可在模型演練區體驗。

    推薦理由:GPT‑6 Sol 與 Luna 在 AI Gateway 上線,價格更低且在程式碼與專業工作中提升事實可靠性,讀者可評估其高頻工作流價值。

  2. Vercel Blog78

    Claude Opus 5.5 在 AI Gateway 上可用

    Anthropic 的 Claude Opus 5.5 已在 AI Gateway 上上線,支援 1M-token 上下文視窗和 128K 輸出 token。與 Opus 5 相比,速度提升約 30%,成本降低約 40%。

    推薦理由:Opus 5.5 在速度和成本上相較前代提升顯著,適合需要大上下文和長任務的智慧體工作,其 1M-token 上下文視窗和 128K 輸出令長任務更易監督,且支援自動工具選擇,提升開發效率。對開發者而言,Opus 5.5 的速度與成本優勢可顯著降低專案迭代週期。

9月18日週五
  1. Vercel Blog72

    Jev 是 AI Gateway 歷史上最快被採用的模型

    Jev 在 AI Gateway 上的首日採用率突破 GPT‑5.6 兩倍,證明專門化決策模型能迅速進入實際工作流程。 - 首日採用率:24 小時內已達 13% 的付費團隊使用,超過 GPT‑5.6 兩倍、Fable 5.1 六倍。

    推薦理由:Jev 在 AI Gateway 上的首日採用率突破 GPT‑5.6 兩倍,證明專門化決策模型能迅速進入實際工作流程。

9月16日週三
  1. Google DeepMind66

    Google DeepMind 釋出 Gemini 3.8 Live 與 3.8 Live Extended Thinking 語音模型

    Google DeepMind 推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款先進的即時對話模型,帶來並行推理與近即時語音互動升級。

    推薦理由:Google DeepMind 推出了 Gemini 3.8 Live 與 3.8 Live Extended Thinking,通過並行推理與近即時語音互動能力在多項語音基準測試中表現突出,讀者可藉此評估其在複雜語音智慧體開發和企業級工作流中的應用潛力。

  2. NVIDIA Blog72

    NVIDIA 釋出 Vera Rubin 架構與 DSX 平臺,展示 AI 工廠能效與吞吐量提升

    NVIDIA 在 AI Infra Summit 上釋出了 Vera Rubin 架構與 DSX 平臺,其中 Vera Rubin NVL72 系統在 MLPerf Inference v6.1 預覽測試中展現出顯著的吞吐量優勢。多項生態合作與基準測試顯示,新平臺通過電源最佳化和軟體協同,大幅提升了每瓦 tokens 產出與 agentic ワークロード的執行效率。

    推薦理由:原文公佈了 Vera Rubin 架構在多個基準測試中的效能表現,讀者可以據此評估新一代 AI 基礎設施在能效和吞吐量上的提升幅度。

9月15日週二
  1. Vercel Blog78

    Gemini 3.8 Live 模型現已可於 AI Gateway 使用

    Gemini 3.8 Live 及 Gemini 3.8 Live Extended Thinking 現已可於 AI Gateway 使用,支援即時語音互動與多模態功能。

    推薦理由:Gemini 3.8 Live 及其擴充套件思考功能可即時語音互動,開發者可透過 AI Gateway 直接使用 WebSocket 進行即時對話,提升語音助手與多模態應用的互動體驗。

9月12日週六
  1. OpenAI News61

    Cognition 讓 Devin 用 GPT‑6 Astra 進行自測

    GPT‑6 Astra 提升 Devin 的軟體測試能力,幫助工程師減少程式碼審查量並加速交付。Cognition 通過 GPT‑6 Astra 讓 Devin 能夠自動測試其自身工作並驗證其正確性。

    推薦理由:GPT‑6 Astra 提升 Devin 的軟體測試能力,幫助工程師減少程式碼審查量並加速交付。

9月10日週四
  1. OpenAI News86

    OpenAI 在 API 中釋出 GPT-Live-1 語音模型

    OpenAI 在 API 中推出 GPT-Live-1,支援同時聆聽與說話的全雙工語音互動,並可將深度推理與工具呼叫委託給後端模型。該模型在 API 中的定價為每分鐘 0.05 美元,具備平滑的中斷處理、語氣與風格控制以及電話網路支援等特性。

9月9日週三
  1. OpenAI News86

    OpenAI 釋出 GPT-6 Astra 模型

    OpenAI 推出 GPT-6 Astra,作為其迄今為止最具智慧與對齊能力的模型,現已在 ChatGPT Work、Codex 及 API 中可用。該模型在計算機使用、瀏覽、軟體工程及網路安全等專業任務上表現領先,API 定價為每百萬輸入 token 10 美元、每百萬輸出 token 50 美元。

    推薦理由:原文公佈了新模型的各項能力基準、定價及企業級安全控制,讀者可以據此評估其在複雜工作流中的成本效益。

9月3日週四
  1. Google DeepMind84

    Google DeepMind 釋出全球天氣大模型 WeatherNext 3

    Google DeepMind 和 Google Research 釋出全新的全球天氣大模型 WeatherNext 3,支援每小時即時衛星資料輸入並提供高達 5 公里解析度的預測。該模型在降水預測精度上取得顯著提升,並增加了清潔能源變數預測,現已整合至 Search、Gemini、Maps 和 Cloud 等產品中。

    推薦理由:該模型通過融合即時衛星資料與高解析度網格,提升了全球天氣預報的精度和更新頻率,為清潔能源規劃和區域氣象服務提供了更可靠的資料支援。

  2. Hugging Face Blog63

    NeoMME:高效的多模態原生多語言編碼器

    Hugging Face 團隊推出了 NeoMME,這是一個包含 260M 和 800M 引數的多語言多模態基礎編碼器系列。該模型不使用單獨的視覺塔或因果語言模型,而是通過單個雙向 Transformer 同時處理文本 token 和原始影像塊。

    推薦理由:原文釋出了不依賴獨立視覺塔的多模態雙向編碼器,讀者可以瞭解其單塔架構和檢索效能。

9月2日週三
  1. Google DeepMind78

    Google DeepMind 推出 Gemini 智慧體影片理解功能

    Google DeepMind 推出了適用於 Gemini 最新模型的智慧體影片理解功能,通過動態檢索視覺幀、音訊和字幕,將影片分析的 token 消耗降低最高 88%、成本降低最高 66%,並將準確率提升最高 7%。

    推薦理由:原文公佈了功能特性與具體最佳化資料,讀者可以據此瞭解該技術如何降低影片處理成本。

9月1日週二
  1. Google Research63

    Google Research 釋出 TimesFM-3:支援多變數預測的零樣本時間序列基座模型

    Google Research 推出 TimesFM-3,這是一個擁有 3.3 億引數、原生支援多變數預測的零樣本時間序列基座模型。該模型採用解碼器架構與交替注意力機制,支援單次前向傳遞生成整個預測區間,在 Gift-Eval、FEV-Bench 和 Time 等基準測試中表現優於其他預訓練基座模型,目前已在 GitHub 和 Hugging Face 上線。

    推薦理由:谷歌釋出了面向多變數時間序列預測的基座模型 TimesFM-3,它通過交替注意力架構和單次前向傳遞實現了零樣本預測,在多項公開基準測試中表現領先。

8月28日週五
  1. Google DeepMind68

    Google DeepMind 釋出 Gemini Omni 1.1 Flash 影片生成模型

    Google DeepMind 推出了 Gemini Omni 1.1 Flash,帶來場景延伸、首尾幀插值、4K 超解析度升級、360p 高效草稿生成及影片參考等多項專業級影片生成與控制功能,現已通過 Gemini API 及 Google AI Studio 面向開發者開放。

    推薦理由:原文給出了新模型的生成能力與接入方式,讀者可以據此瞭解其在影片製作中的具體控制選項。

8月27日週四
  1. Google DeepMind75

    Google DeepMind 釋出語音轉文本模型 Gemini 3.5 Transcribe

    Google DeepMind 推出 Gemini 3.5 Transcribe,這是其迄今最精準的語音轉文本模型,支援即時流式傳輸與預錄音頻處理,字錯誤率在流式傳輸和非流式場景下分別達到 4.0% 和 2.6%。該模型支援超過 85 種語言的自動檢測與轉錄,具備智慧糾錯、自定義詞彙識別及多說話人識別等功能,目前已在 Google AI Studio 等平臺面向開發者開放公測。

    推薦理由:官方推出的最新語音轉文本模型給出了具體的錯誤率和多語言支援資料,讀者可以據此評估其實際語音互動效能。

8月25日週二
  1. Hugging Face Blog74

    Granite 4.2 LLM:構建過程

    Granite 4.2 是 IBM 推出的三種規模(3B、8B、30B)的稠密解碼器推理 LLM,基於 Granite‑4.1 預訓練模型,使用約 15T 令牌的五階段訓練策略,擴充套件上下文視窗至 512K,並通過監督微調和多階段強化學習(包括 agentic RL)實現鏈式思考、工具呼叫與低成本思考模式。

    推薦理由:Granite 4.2 通過多階段 RL 訓練實現強推理與工具呼叫能力,讀者可瞭解其技術細節與效能提升。

8月12日週三
  1. Google DeepMind62

    Google DeepMind 釋出手語轉文本模型 SL2T

    Google DeepMind 釋出了多語言手語轉文本翻譯模型 SL2T,並將其整合到 Gboard 和 Pixel 11 的 Live Transcribe 中。該模型支援將美國手語直接轉換為英語文本,它基於超過 10 萬小時的資料訓練,通過處理姿勢關節點來保護隱私並實現流式輸出。

    推薦理由:該模型將手語翻譯直接帶入消費級產品,為聽障使用者提供了更自然的手語輸入方式。

  2. Microsoft Research45

    引入 CARE-X:通過輔助監督、獎勵對齊學習與工具增強測量邁向臨床有用的放射學 VLM

    Microsoft Research 推出了研究模型 CARE-X,這是一款旨在兼顧自由文本推理與確定性輸出的統一胸部 X 光 VLM。該模型結合了生成式與判別式能力,並通過強化學習(DAPO)在多工設定中最佳化臨床準確性。研究還線上路實驗中搭配了 Qwen3-VL-4B-Instruct 與確定性測量工具以評估效能。

8月10日週一
  1. Hugging Face Blog86

    Meta 釋出開源多模態模型 Muse Glimmer

    Meta 推出了全新的 30B 引數開源多模態模型 Muse Glimmer,採用 Apache 2.0 協議釋出,專門面向本地智慧體和隱私保護應用。該模型結合了 2B 的視覺感知編碼器與 28B 的文本解碼器,支援影像、影片理解以及多模態工具呼叫,並提供 transformers、llama.cpp 和 vLLM 的首日支援。

    推薦理由:文章詳細介紹了 Meta 開源多模態模型 Muse Glimmer 的架構設計與本地部署方法,讀者可以據此瞭解其在端側智慧體和多模態任務中的應用潛力。