跳到正文

全部動態

RSS
今日 3 則
9月9日週三
  1. OpenAI News86

    OpenAI 釋出 GPT-6 Astra 模型

    OpenAI 推出 GPT-6 Astra,作為其迄今為止最具智慧與對齊能力的模型,現已在 ChatGPT Work、Codex 及 API 中可用。該模型在計算機使用、瀏覽、軟體工程及網路安全等專業任務上表現領先,API 定價為每百萬輸入 token 10 美元、每百萬輸出 token 50 美元。

    推薦理由:原文公佈了新模型的各項能力基準、定價及企業級安全控制,讀者可以據此評估其在複雜工作流中的成本效益。

9月8日週二
  1. Google DeepMind89

    Google DeepMind 釋出 AlphaGenome Atlas:人類基因組變異預測圖譜

    Google DeepMind 推出了 AlphaGenome Atlas 平臺,包含人類基因組中 90 億種單核苷酸變異的預測效應,並同步釋出了 AlphaGenome Variant Impact 評分。該平臺提供網站埠、API 以及 Google Antigravity 中的 skill,旨在幫助學術研究人員理解基因變異對分子生物學的影響。

    推薦理由:該平臺預先計算了人類基因組中所有可能單核苷酸變異的分子效應預測併發布了配套評分指標,為研究人員快速評估基因變異影響提供了新資源。

  2. Mistral AI78

    Mistral 以30億歐元融資,推動主權開放權重 AI 成為技術前沿

    Mistral AI 近日完成 30 億歐元 Series D 融資,後市估值逾 210 億歐元,創歐洲科技公司最大融資紀錄。融資由三星電子領投,Scaleup Europe Fund、PSG Equity 等跟投,資金將用於擴充套件前沿研究、提升訓練算力、加速商業化與國際佈局。Mistral 目前已在 20 個國家運營,支援 125 家全球企業的關鍵 AI 轉型。

    推薦理由:Mistral 通過 30 億歐元融資,進一步加速其全棧開放權重 AI 的研發與商業化,凸顯企業對自主 AI 解決方案的需求增長。

  3. OpenAI News61

    推出 ChatGPT Images 2.5 影像生成功能

    ChatGPT Images 2.5 讓使用者將想法、草圖和參考照片轉化為更個性化、精細的影像。該功能支援多種風格和細節調整,顯著提升創作效率和視覺表達質量,並可直接嵌入聊天介面進行即時反饋,幫助設計師快速迭代並獲得更精準的視覺效果。

    推薦理由:ChatGPT Images 2.5 讓使用者能把草圖和參考照片轉化為更個性化、精細的影像,支援多種風格和細節調整,顯著提升創作效率和視覺表達質量,並可直接嵌入聊天介面進行即時反饋,幫助設計師快速迭代並獲得更精準的視覺效果。

9月7日週一
9月6日週日
9月5日週六
  1. GitHub Blog · AI & ML73

    Project HydraFusion:多模型編排實現前沿質量

    GitHub Copilot 推出了 Project HydraFusion,一個研究預覽,利用多模型編排在執行時實現前沿智慧。開發者只需像選擇單一模型一樣呼叫 HydraFusion,系統會在本地、雲端和複合模型之間自動路由,平衡效能、成本與延遲。

    推薦理由:HydraFusion 通過多模型編排實現前沿質量,顯著降低成本,適合需要高質量程式碼的開發者,並提供視覺化工作流與成本追蹤

9月4日週五
  1. Google Research57

    Google Research 評估代表性不足群體中基因組預測的遷移學習

    Google Research 評估了多基因風險評分(PRS)在非歐洲目標群體中的表現,發現當目標群體樣本量較小時,利用歐洲群體進行遷移學習可提升統計效能,但隨著目標群體樣本量增大,外部資料池化的收益反而會減弱。研究表明,這一臨界點取決於具體性狀的遺傳保守性,且先進的多源群體方法需要相當規模的目標群體樣本才能超越簡單方法。

  2. GitHub Blog · AI & ML74

    GitHub Copilot app 並行執行多 AI 代理功能

    GitHub Copilot app 現在支援在同一專案中並行執行多個 AI 代理。每個代理會話在獨立的 Git worktree 上執行,彼此不干擾,保持各自上下文,開發者可同時啟動多項任務並隨時檢視進度。

    推薦理由:GitHub Copilot app 允許在同一專案中並行執行多個 AI 代理,提升開發效率並減少上下文切換。

  3. Google Research74

    Google Research 釋出雄性果蠅完整大腦連線圖譜

    Google Research 與 HHMI Janelia 及多所高校合作,釋出了包含超過 16.6 萬個神經元和 1.25 億個突觸連線的雄性果蠅完整大腦及中樞神經系統連線圖譜。該圖譜利用 AI 技術將電子顯微鏡影像重建為 3D 結構,並經過人工校對驗證,為研究大腦工作機制提供了重要資源。相關成果已發表在 Cell 期刊上。

    推薦理由:該研究釋出了迄今規模最大的完整雄性果蠅大腦及中樞神經系統連線圖譜,為神經科學研究提供了重要基礎資源。

9月3日週四
  1. Google DeepMind84

    Google DeepMind 釋出全球天氣大模型 WeatherNext 3

    Google DeepMind 和 Google Research 釋出全新的全球天氣大模型 WeatherNext 3,支援每小時即時衛星資料輸入並提供高達 5 公里解析度的預測。該模型在降水預測精度上取得顯著提升,並增加了清潔能源變數預測,現已整合至 Search、Gemini、Maps 和 Cloud 等產品中。

    推薦理由:該模型通過融合即時衛星資料與高解析度網格,提升了全球天氣預報的精度和更新頻率,為清潔能源規劃和區域氣象服務提供了更可靠的資料支援。

  2. Hugging Face Blog63

    NeoMME:高效的多模態原生多語言編碼器

    Hugging Face 團隊推出了 NeoMME,這是一個包含 260M 和 800M 引數的多語言多模態基礎編碼器系列。該模型不使用單獨的視覺塔或因果語言模型,而是通過單個雙向 Transformer 同時處理文本 token 和原始影像塊。

    推薦理由:原文釋出了不依賴獨立視覺塔的多模態雙向編碼器,讀者可以瞭解其單塔架構和檢索效能。

  3. Hugging Face Blog66

    如何用 TRL 和 OpenEnv 訓練程式碼模型繪製水彩畫

    作者基於開源方案復現了讓大語言模型通過編寫 JavaScript 程式碼繪製水彩畫的強化學習流程,並公開了參考影像池、強化學習環境、訓練指令碼及訓練好的模型。文章對比了不同美學獎勵權重配置下的多項實驗結果,詳細記錄了基礎設施搭建及訓練調優過程中的發現。

    推薦理由:文章復現並開源了使用強化學習訓練程式碼模型繪製水彩畫的完整流程,為讀者提供了基於美學偏好進行對齊的具體實現與多重實驗對比。

  4. Hugging Face Blog62

    如何微調 350M 模型以在 100 個 GRPO 步驟中實現更好的結構化輸出

    本文介紹了使用 TRL 庫和 GRPO 對 LFM2.5-350M 模型進行輕量化微調的開源教程,展示了僅需約 500 個樣本和 100 個訓練步驟即可將模型在 IFStruct 基準測試中的整體表現從 22.6% 提升至 29.7% 的具體方法。

    推薦理由:文章提供了在免費 GPU 環境下用 GRPO 最佳化小模型結構化輸出的完整開源配方,讀者可以藉此評估低成本對齊對模型輸出合規性的實際提升效果。

  5. Google DeepMind63

    Google DeepMind 推出 Fairwind Program 計劃

    Google DeepMind 宣佈推出 Fairwind Program,這是一個面向政府機構和可信合作伙伴的有限訪問計劃,旨在通過 Gemini 3.8 Flash Cyber 與 CodeMender 框架提供自主發現和修復漏洞的先進網路安全能力。該計劃首批覆蓋全球 650 多個合作伙伴,支援在組織的安全雲環境中幾分鐘內生成經過驗證的修復補丁。

    推薦理由:Google DeepMind 推出的 Fairwind Program 為政府和企業提供了基於特定 Gemini 模型的自動化漏洞修復能力,讀者可以藉此瞭解大模型在網路安全防護中的具體落地形態。

9月2日週三
  1. Hugging Face Blog55

    BenchMIRT:大模型基準測試究竟在測量什麼?

    Allen Institute for AI 介紹了 BenchMIRT,這是一種用於在單個提示詞層面審計大模型基準測試的新方法。該方法將多維專案反應理論應用於 100 個大模型在 16 個基準測試中的表現,獨立恢復出安全與通用推理兩個主導維度,發現部分基準測試的實際測量結果與其宣稱的目標存在偏差。

  2. Google DeepMind78

    Google DeepMind 推出 Gemini 智慧體影片理解功能

    Google DeepMind 推出了適用於 Gemini 最新模型的智慧體影片理解功能,通過動態檢索視覺幀、音訊和字幕,將影片分析的 token 消耗降低最高 88%、成本降低最高 66%,並將準確率提升最高 7%。

    推薦理由:原文公佈了功能特性與具體最佳化資料,讀者可以據此瞭解該技術如何降低影片處理成本。

9月1日週二
  1. Hugging Face Blog64

    Hugging Face 釋出包含 207 個 WebGPU 運算元的本地 AI 庫與測試套件

    Hugging Face 宣佈推出 @huggingface/kernels,這是一個用於從 Hub 載入和執行最佳化版 WebGPU 運算元的最小化庫,首發包含 207 個覆蓋多種機器學習架構的運算元。同時,官方還推出了瀏覽器端 GPU 效能基準測試與評估套件 Fleet,用於收集跨真實硬體的效能與正確性資料以最佳化運算元。

    推薦理由:Hugging Face 推出了包含 207 個 WebGPU 運算元的底層庫與瀏覽器評測工具,讀者可以瞭解其在本地 AI 推理上的效能表現與實現方式。

  2. Google Research63

    Google Research 釋出 TimesFM-3:支援多變數預測的零樣本時間序列基座模型

    Google Research 推出 TimesFM-3,這是一個擁有 3.3 億引數、原生支援多變數預測的零樣本時間序列基座模型。該模型採用解碼器架構與交替注意力機制,支援單次前向傳遞生成整個預測區間,在 Gift-Eval、FEV-Bench 和 Time 等基準測試中表現優於其他預訓練基座模型,目前已在 GitHub 和 Hugging Face 上線。

    推薦理由:谷歌釋出了面向多變數時間序列預測的基座模型 TimesFM-3,它通過交替注意力架構和單次前向傳遞實現了零樣本預測,在多項公開基準測試中表現領先。

8月28日週五
  1. Google Research62

    Google Research 推出行星預測引擎自動化全球地理空間建模

    Google Research 推出了行星預測引擎(PPE),這是一種作為 Google Earth AI 一部分的新型實驗性研究功能,能夠根據自然語言查詢自主執行從資料發現到模型訓練的完整地理空間預測工作流。該系統通過智慧地理空間資料選擇、多模態資料集策劃以及自動化模型構建三個模組化階段運作,在公共衛生、糧食安全、環境風險和社會經濟等多項預測任務的基準測試中超越了人工專家基線。

    推薦理由:原文介紹了該系統如何將地理空間建模流程縮短至數分鐘並提升多項預測任務的準確率,讀者可以據此評估其在複雜環境和人道主義應對中的應用潛力。

  2. Google DeepMind68

    Google DeepMind 釋出 Gemini Omni 1.1 Flash 影片生成模型

    Google DeepMind 推出了 Gemini Omni 1.1 Flash,帶來場景延伸、首尾幀插值、4K 超解析度升級、360p 高效草稿生成及影片參考等多項專業級影片生成與控制功能,現已通過 Gemini API 及 Google AI Studio 面向開發者開放。

    推薦理由:原文給出了新模型的生成能力與接入方式,讀者可以據此瞭解其在影片製作中的具體控制選項。

8月27日週四
  1. Google DeepMind60

    Google DeepMind 推出全球首個雙盲 AI 評測機制

    Google DeepMind 推出全球首個專有前沿級別 AI 模型的雙盲評測,通過密碼學安全環境防止模型在測試前接觸到評測問題。該機制與新加坡人工智慧安全研究所、OpenMined、AVERI 及 MLCommons 合作,在隱私保護環境中對 Gemini Flash Lite 模型進行保密基準測試,以提升評測的完整性。

    推薦理由:原文給出了基於密碼學環境開展模型評測的方案,讀者可以據此評估它將如何解決行業中普遍存在的基準汙染問題。

  2. Google Research62

    GlucoFM:用於連續血糖監測的基礎模型

    Google Research 推出了 GlucoFM,這是一個用於連續血糖監測的自監督基礎模型,採用雙流設計將較慢的血糖趨勢與短期偏差明確分離。在多項臨床預測任務評估中,GlucoFM 的 PR-AUC 表現優於對比模型,並且在餐後血糖響應預測、跨資料集遷移以及少樣本適應場景中展現出優勢。

    推薦理由:Google Research 推出的 GlucoFM 能夠有效分離動態並提升臨床預測準確率,為研究人員在代謝健康資料建模時提供了可參考的新方法。

  3. Google DeepMind75

    Google DeepMind 釋出語音轉文本模型 Gemini 3.5 Transcribe

    Google DeepMind 推出 Gemini 3.5 Transcribe,這是其迄今最精準的語音轉文本模型,支援即時流式傳輸與預錄音頻處理,字錯誤率在流式傳輸和非流式場景下分別達到 4.0% 和 2.6%。該模型支援超過 85 種語言的自動檢測與轉錄,具備智慧糾錯、自定義詞彙識別及多說話人識別等功能,目前已在 Google AI Studio 等平臺面向開發者開放公測。

    推薦理由:官方推出的最新語音轉文本模型給出了具體的錯誤率和多語言支援資料,讀者可以據此評估其實際語音互動效能。

8月26日週三
  1. Hugging Face Blog77

    使用 Sentence Transformers 訓練和微調多向量嵌入模型

    Sentence Transformers v6.0 版本引入了多向量檢索模型和完整的訓練方法。作者以醫療檢索領域為例,展示瞭如何在一塊消費級 GPU 上微調出一個超越各大通用檢索模型的領域專用模型。微調方法涵蓋了模型選擇、資料集格式、損失函式、訓練引數以及評估器等核心元件。

    推薦理由:文章給出了多向量嵌入模型的完整訓練與微調步驟,讀者可以據此在特定領域獲得超越通用檢索模型的效果。

8月25日週二
  1. Hugging Face Blog74

    Granite 4.2 LLM:構建過程

    Granite 4.2 是 IBM 推出的三種規模(3B、8B、30B)的稠密解碼器推理 LLM,基於 Granite‑4.1 預訓練模型,使用約 15T 令牌的五階段訓練策略,擴充套件上下文視窗至 512K,並通過監督微調和多階段強化學習(包括 agentic RL)實現鏈式思考、工具呼叫與低成本思考模式。

    推薦理由:Granite 4.2 通過多階段 RL 訓練實現強推理與工具呼叫能力,讀者可瞭解其技術細節與效能提升。

  2. Hugging Face Blog63

    Gradio 釋出 gr.Workflow 功能,將 AI 流水線轉為視覺化畫布與 API

    Gradio 推出內建的 gr.Workflow 功能,允許開發者將 AI 應用步驟描述為型別化節點的圖,提供可執行的拖拽畫布、即時中間結果展示及一鍵部署到 Hugging Face Spaces 的能力。該工作流同時自動生成 REST API,支援通過 Python 客戶端或 cURL 直接呼叫。

    推薦理由:G gradio 推出了內建的 gr.Workflow 功能,把複雜的 AI 流水線變成視覺化的拖拽畫布,同時自動生成 REST API 並在 Hugging Face Spaces 上線。