GitHub Copilot 現已可於 AI SDK harness 層使用
summary_zh: GitHub Copilot 現已可透過官方 @ai-sdk/harness-github-copilot 連線至 AI SDK harness 層,讓開發者能以同一 HarnessAgent 介面執行多種 coding agents,無需改動程式碼。
summary_zh: GitHub Copilot 現已可透過官方 @ai-sdk/harness-github-copilot 連線至 AI SDK harness 層,讓開發者能以同一 HarnessAgent 介面執行多種 coding agents,無需改動程式碼。
OpenAI 在 ChatGPT Work 中推出 Data agent,支援連線公司資料、用自然語言查詢並生成互動式儀表盤。該功能讓使用者無需編寫程式碼即可獲取洞察,提升資料視覺化效率。
推薦理由:官方釋出的 Data agent 讓企業能用自然語言直接查詢資料並生成互動式儀表盤,降低資料分析門檻,提升決策效率,並支援多維度資料視覺化。
OpenAI 推出 ChatGPT for Financial Services,結合內建金融資料與 GPT-6 Astra 模型,用於研究、建模和客戶交付材料的準備。
推薦理由:原文給出了 ChatGPT for Financial Services 的內建資料與模型配置,讀者可以據此判斷它會怎樣改變金融領域的日常工作流。
OpenAI 宣佈與 GSA 合作,為符合條件的聯邦、州、地方和部族政府提供零許可費、使用費五折優惠以及擴大的網路安全支援。
推薦理由:原文公佈了面向美國各級政府的費用減免和網路安全支援方案,讀者可以據此瞭解 AI 服務在公共部門的落地政策。
OpenAI 推出了 Agents API 託管服務,支援基於 Codex 框架進行任務編排、長會話和工具呼叫,幫助開發者構建和部署雲端智慧體。
推薦理由:官方推出的託管服務直接面向雲端智慧體開發需求,開發者可藉此獲得編排與長會話支援。
summary_zh: Tako Search 在 AI Gateway 免費使用至 9 月 30 日,允許 AI 模型搜尋 Tako 的精選資料與即時網路,並以篩選域名或釋出日期的結果回答問題,附上引用與視覺化。
summary_zh: 現在可以在 Vercel 上使用 OpenAI Agents API 建置並部署長時間執行、使用工具的代理程式。 - 代理迴圈與會話狀態:由 OpenAI 管理,確保代理持續運作。
Graidio 團隊釋出了 Workflow1111,這是一個基於 Gradio Workflow 重構 AUTOMATIC1111 功能集的單工作流畫布,包含由 73 個節點和 11 條媒體管線組成的圖表。
推薦理由:文章展示瞭如何用視覺化節點把多個媒體管線組合在一起,並自動生成介面和協議,為開發者搭建複雜多模態應用提供了新方案。
Google DeepMind 推出了 AlphaGenome Atlas 平臺,包含人類基因組中 90 億種單核苷酸變異的預測效應,並同步釋出了 AlphaGenome Variant Impact 評分。該平臺提供網站埠、API 以及 Google Antigravity 中的 skill,旨在幫助學術研究人員理解基因變異對分子生物學的影響。
推薦理由:該平臺預先計算了人類基因組中所有可能單核苷酸變異的分子效應預測併發布了配套評分指標,為研究人員快速評估基因變異影響提供了新資源。
OpenAI AI 通過更強大、更實惠的技術,幫助個人和企業擴大可完成的工作量,並提升增長效率。該技術旨在降低成本並提高生產力。
ChatGPT Images 2.5 讓使用者將想法、草圖和參考照片轉化為更個性化、精細的影像。該功能支援多種風格和細節調整,顯著提升創作效率和視覺表達質量,並可直接嵌入聊天介面進行即時反饋,幫助設計師快速迭代並獲得更精準的視覺效果。
推薦理由:ChatGPT Images 2.5 讓使用者能把草圖和參考照片轉化為更個性化、精細的影像,支援多種風格和細節調整,顯著提升創作效率和視覺表達質量,並可直接嵌入聊天介面進行即時反饋,幫助設計師快速迭代並獲得更精準的視覺效果。
1Password 的工程師使用 Codex 快速構建新功能和內部工具,在保持嚴格安全策略的同時達到了生產就緒狀態,使工程生產力提升了 21%。
GitHub Copilot 推出了 Project HydraFusion,一個研究預覽,利用多模型編排在執行時實現前沿智慧。開發者只需像選擇單一模型一樣呼叫 HydraFusion,系統會在本地、雲端和複合模型之間自動路由,平衡效能、成本與延遲。
推薦理由:HydraFusion 通過多模型編排實現前沿質量,顯著降低成本,適合需要高質量程式碼的開發者,並提供視覺化工作流與成本追蹤
GitHub Copilot app 現在支援在同一專案中並行執行多個 AI 代理。每個代理會話在獨立的 Git worktree 上執行,彼此不干擾,保持各自上下文,開發者可同時啟動多項任務並隨時檢視進度。
推薦理由:GitHub Copilot app 允許在同一專案中並行執行多個 AI 代理,提升開發效率並減少上下文切換。
funes 是為 Claude Code、Codex、pi 和 Hermes 等編碼代理提供持久記憶層的工具。
推薦理由:funes 讓編碼代理在不同機器和會話間共享持久記憶,顯著降低重做成本並提升工作流效率。
Google DeepMind 宣佈推出 Fairwind Program,這是一個面向政府機構和可信合作伙伴的有限訪問計劃,旨在通過 Gemini 3.8 Flash Cyber 與 CodeMender 框架提供自主發現和修復漏洞的先進網路安全能力。該計劃首批覆蓋全球 650 多個合作伙伴,支援在組織的安全雲環境中幾分鐘內生成經過驗證的修復補丁。
推薦理由:Google DeepMind 推出的 Fairwind Program 為政府和企業提供了基於特定 Gemini 模型的自動化漏洞修復能力,讀者可以藉此瞭解大模型在網路安全防護中的具體落地形態。
Hugging Face 宣佈推出 @huggingface/kernels,這是一個用於從 Hub 載入和執行最佳化版 WebGPU 運算元的最小化庫,首發包含 207 個覆蓋多種機器學習架構的運算元。同時,官方還推出了瀏覽器端 GPU 效能基準測試與評估套件 Fleet,用於收集跨真實硬體的效能與正確性資料以最佳化運算元。
推薦理由:Hugging Face 推出了包含 207 個 WebGPU 運算元的底層庫與瀏覽器評測工具,讀者可以瞭解其在本地 AI 推理上的效能表現與實現方式。
Open ASR Leaderboard 近日新增首個全球南方語言評測集,包含 Hindi 與 Indian English 兩個 Monsoon 資料集,公開與私有四個 speaker‑disjoint split,覆蓋 4,888 名說話人並記錄 12 個屬性。
Google Research 推出了行星預測引擎(PPE),這是一種作為 Google Earth AI 一部分的新型實驗性研究功能,能夠根據自然語言查詢自主執行從資料發現到模型訓練的完整地理空間預測工作流。該系統通過智慧地理空間資料選擇、多模態資料集策劃以及自動化模型構建三個模組化階段運作,在公共衛生、糧食安全、環境風險和社會經濟等多項預測任務的基準測試中超越了人工專家基線。
推薦理由:原文介紹了該系統如何將地理空間建模流程縮短至數分鐘並提升多項預測任務的準確率,讀者可以據此評估其在複雜環境和人道主義應對中的應用潛力。
Google DeepMind 推出全球首個專有前沿級別 AI 模型的雙盲評測,通過密碼學安全環境防止模型在測試前接觸到評測問題。該機制與新加坡人工智慧安全研究所、OpenMined、AVERI 及 MLCommons 合作,在隱私保護環境中對 Gemini Flash Lite 模型進行保密基準測試,以提升評測的完整性。
推薦理由:原文給出了基於密碼學環境開展模型評測的方案,讀者可以據此評估它將如何解決行業中普遍存在的基準汙染問題。
Gradio 推出內建的 gr.Workflow 功能,允許開發者將 AI 應用步驟描述為型別化節點的圖,提供可執行的拖拽畫布、即時中間結果展示及一鍵部署到 Hugging Face Spaces 的能力。該工作流同時自動生成 REST API,支援通過 Python 客戶端或 cURL 直接呼叫。
推薦理由:G gradio 推出了內建的 gr.Workflow 功能,把複雜的 AI 流水線變成視覺化的拖拽畫布,同時自動生成 REST API 並在 Hugging Face Spaces 上線。
Google Research釋出了Biomarker Discovery Framework,一套多代理系統,結合假設生成、統計分析、模型訓練、對抗驗證和文獻推理,在9,279個可穿戴感測器資料樣本中識別出41個精神健康和25個代謝疾病的候選數字生物標誌物,並在與人口統計特徵結合後提升預測效能。專家評估顯示,該框架在質量維度上優於同類AI系統。
Hugging Face 宣佈重構 Papers with Code 搜尋引擎,採用混合檢索系統結合 PostgreSQL、pgvector 與 reciprocal rank fusion(RRF)演算法,提升論文檢索效果。
推薦理由:文章詳細拆解了基於混合檢索的論文搜尋引擎架構,展示瞭如何通過離線任務與線上服務的拆分來兼顧吞吐量和低延遲,為類似工程實踐提供了可複用的系統設計範本。
Liquid AI 針對 LFM2.5 模型家族釋出了 DSpark 草稿模型檢查點,通過引入推測解碼路徑,在不改變輸出質量的情況下實現了最高 3.2 倍的吞吐量提升。
推薦理由:該方案在保持輸出質量不變的前提下提升了吞吐量,為端側和雲端推理效能最佳化提供了可複用的技術實踐。
微軟研究院釋出深度學習密度泛函理論模型 Skala 1.1,在 GMTKN55 基準測試中表現優異,並宣佈已在 CP2K 中可用,同時正逐步整合至 Psi4、FHI-aims、ORCA 和 VASP 等主流計算化學軟體中。該版本使用比前代多 2.5 倍的資料訓練,在保持半局域泛函效率的同時提升了準確性,並推出了動態效能報告來追蹤跨硬體的計算效率。
Mistral AI 推出了 Agentic Search,利用多步檢索迴圈在 FinanceBench 和 OfficeQA Pro 基準上顯著提升檢索準確率,並降低 token 使用和延遲。該功能通過搜尋、開啟、導航、讀取和 grep 五個工具,讓模型在複雜文件中進行迭代檢索,支援敏感領域資料,並可通過 Mistral Search Toolkit 在雲端或本地部署。
推薦理由:Agentic Search 通過多步檢索迴圈顯著提升金融檔案檢索準確率,幫助企業在敏感資料上實現更高效的 AI 互動,並在複雜文件中實現精準導航。
Sentence Transformers 釋出 v6.0 版本,首次引入第四種模型型別 MultiVectorEncoder,用於支援 ColBERT 風格的後期互動檢索。該版本允許開發者通過熟悉的 API 直接載入各類 PyLate、ColBERT 以及 ColPali 視覺文件檢索模型的檢查點,無需經過複雜的格式轉換。
推薦理由:該版本新增了對多向量檢索模型的原生支援,讀者可以通過標準介面直接載入多種主流模型的檢查點並完成檢索與重排。
Dharma AI 推出一種約束感知 GPU 分配器,通過將即時推理需求建模為動態曲線並結合優先順序排程,在不更換硬體的情況下使叢集利用率提升高達 33 個百分點。該分配器在多個基準測試中展現出更高的吞吐量與優先順序加權產出,同時保持極低的決策延遲。
推薦理由:原文介紹了約束感知 GPU 分配器的設計與多場景基準測試結果,讀者可以瞭解如何通過最佳化排程順序提升叢集利用率。
Google Research 推出了 PhotoScan,這是一個通過標準 2D 智慧手機照片估算 3D 身體成分指標(如體脂率、A/G 比和 V/S 比)的深度學習框架。該模型在英國生物銀行資料上進行預訓練,並利用 677 名成人的佇列進行了微調;獨立驗證顯示其在預測胰島素抵抗方面達到了接近 DXA 掃描的準確度。
推薦理由:該研究展示了利用普通手機影像估算身體成分和評估胰島素抵抗的新方案,為降低代謝健康篩查門檻提供了技術參考。
Google DeepMind 推出了 Gemini 3.7 Flash,這是其 Flash 系列最新的工作模型,專為編碼和智慧體設計。該模型在 FrontierCode、DeepSWE、WebDev Arena 等基準上顯著提升準確率,且每百萬輸入 token 價格僅 $0.75,輸出 $3.75,成本更低。
推薦理由:Gemini 3.7 Flash 在編碼、網頁開發和知識工作等領域顯著提升準確率,並以更低成本提供高效工作流。
OlmoEarth Studio 推出自定義嵌入向量匯出功能,支援使用者從其開源地球觀測基礎模型計算並匯出緊湊的數值表示。該功能允許通過介面或 API 按需生成輕量級 Cloud-Optimized GeoTIFFs,適用於相似性檢索、少樣本分割、變化檢測和無監督探索等下游任務。
Hugging Face 部落格介紹了 ALTK-Evolve 庫,該庫通過高效的記憶檢索實現與 ACE 相比更低的 Token 消耗,同時保持或提升準確率。ALTK-Evolve 與 ACE 都利用代理自身軌跡學習,但在記憶構建和交付方式上不同:ACE 採用完整的 playbook 注入,而 ALTK-Evolve 只檢索模型可用的指導原則,從而顯著降低推理 token。
推薦理由:ALTK-Evolve 在保持或提升準確率的同時,顯著降低推理 token 消耗,展示了高效記憶檢索的可行性。
Mistral AI 宣佈推出區域推理端點和優先服務層,支援在歐洲或美國執行推理,並提供 1 GW 計算容量目標。公司還將平臺開放給第三方模型,首批支援 Z.ai 的 GLM‑5.2,所有模型均在同一基礎設施下滿足區域控制與 SLA。為保障歐洲長期 AI 計算需求,Mistral 正與企業組建聯盟,形成歐洲計算單元(ECU)以鎖定多年容量。
推薦理由:Mistral 推出區域推理端點和開放模型支援,幫助企業實現 AI 主權與合規。
NVIDIA 釋出了 Magpie TTS 多語種文本轉語音模型,支援12種語言,並提供開放權重與本地部署能力。該模型在單流 GPU 上可實現 32–79 ms 的首音延遲,64 併發流下可達 239 ms,吞吐率高達 320× 即時。
推薦理由:開放權重與低延遲讓企業可在本地部署多語種語音代理,支援12種語言並提供高質量音訊,幫助企業實現低延遲、可定製的多語種語音代理。
Baseten 現已成為 Hugging Face Hub 的推理提供商,支援在模型頁面和 JS/Python 客戶端 SDK 中直接呼叫無伺服器推理服務。首批上線支援對話和文本生成任務,涵蓋 DeepSeek V4 Flash、GLM-5.2 等開源權重模型。使用者可通過自定義 API 金鑰或由 Hugging Face 路由兩種模式呼叫,並已整合至多個主流 Agent 框架中。
Microsoft Research 推出了開源的可擴充套件智慧體框架 Orchard,其核心是提供可重用環境服務的 Kubernetes 架構 Orchard Env,支援在真實部署 harnesses 中直接訓練智慧體。專案同步開源了三個領域的訓練方案與資料,其中 Orchard-SWE 在 SWE-bench Verified 上取得了 69.7% 的表現。
推薦理由:微軟研究院開源了可擴充套件智慧體框架 Orchard,並提供覆蓋軟體工程、網頁瀏覽和個人助理的完整訓練方案,降低了智慧體研究的基建門檻。
DeepMind 釋出 Gemini Robotics ER 2,作為其最新的“具身推理”模型,支援持續影片理解、任務編排和多機器人協作。該模型可與任何低層 VLA 模型配合,即時呼叫工具(如 Google Search),並在執行過程中保持推理,顯著提升任務完成率和安全性。
推薦理由:Gemini Robotics ER 2 通過影片理解和多機器人協作提升機器人任務完成率,展示了高效即時推理與安全控制的結合。
Google DeepMind 在 Google Flow Music 上釋出了最新音樂生成模型 Lyria 3.5。該模型在旋律結構、歌詞質量、聲樂表現和發音方面都有顯著提升,並新增了對節奏和時長的細粒度控制,幫助使用者更輕鬆地創作符合預期的歌曲。
推薦理由:Lyria 3.5 在音樂生成方面提升了旋律、歌詞、聲樂質量,並提供更細粒度的節奏與時長控制,幫助創作者更精準地實現創意。
DeepMind 在部落格中釋出 Gemini Robotics 2,推出三款模型:Gemini Robotics 2(全身視覺‑語言‑動作模型)、Gemini Robotics ER 2(具身推理模型)和 Gemini Robotics On‑Device 2(高效本地化模型)。
推薦理由:Gemini Robotics 2 通過全身控制、精細操作和多機器人協作,展示了在複雜任務中的智慧執行能力,並能在數小時內適配新機器人身體。
Hugging Face 釋出了對 Nunchaku 4 位元擴散推理的原生支援,允許使用者通過標準 from_pretrained 方法直接載入量化檢查點,無需本地 CUDA 編譯。
推薦理由:原文介紹瞭如何在主流擴散模型庫中原生載入 4 位元量化檢查點,這為在消費級硬體上執行大模型提供了輕量化方案。