跳到正文

全部動態

RSS
今日 23 則
9月25日週五
  1. Google Research71

    Google Research 推出自動化長影片生成的多智慧體框架

    Google Research 介紹了用於自動化長影片生成的多智慧體框架,包含 Co-Director、CANVAS、A²RD 和 VQQA 四個核心元件。該框架通過全域性最佳化和世界狀態追蹤解決語義漂移與級聯失敗問題,能夠將創意轉化為分鐘級、具備多鏡頭敘事一致性的影片。

    推薦理由:該研究通過多智慧體框架解決長影片生成中的視覺一致性問題,為提升影片擴散模型的長時序敘事能力提供了可複用的系統架構參考。

  2. GitHub Blog · AI & ML86

    GitHub Security Lab 推出基於 AI 的 Fuzzing Taskflow 自動化測試管道

    GitHub Security Lab 推出了基於 Taskflow Agent 的自動化 fuzzing 管道,能夠自主分析 C/C++ 專案、編寫 harness、執行 AFL++ 並生成漏洞報告。該工具採用 agent 負責決策、MCP 工具負責執行的設計,通過覆蓋率反饋迴圈和動態字典生成來提升測試效率。

    推薦理由:文章介紹了開源自主 fuzzing 管道的具體架構和執行邏輯,讀者可以藉此瞭解如何利用智慧體自動化完成程式碼覆蓋率分析和漏洞排查。

  3. Google DeepMind64

    Google DeepMind 釋出 Gemini 3.8 Live with Live Avatar

    Google DeepMind 釋出 Gemini 3.8 Live with Live Avatar,為對話式 AI 帶來近即時的視覺形象與流媒體影片支援。該功能原生耦合了即時對話與低延遲影片生成,具備精確唇形同步、動態視覺形象、非同步工具呼叫以及跨 97 種語言的原生語音同步能力,現已在 Gemini Enterprise 中可用。

  4. AWS Machine Learning Blog67

    WhisperX 在 SageMaker AI 上實現說話人標註轉寫

    本文介紹了 AWS WhisperX Deep Learning Container(DLC)的使用方法,演示如何在 Amazon SageMaker AI 上部署即時和非同步端點,實現詞級時間戳和說話人標籤的轉寫。

    推薦理由:本文展示瞭如何在 SageMaker 上部署 WhisperX,實現精準的詞級時間戳和說話人標籤,幫助使用者快速構建可搜尋、可稽核的音訊轉寫系統。

9月24日週四
  1. NVIDIA Blog64

    NVIDIA 如何聯合全球研究機構釋出超 2800 種病毒蛋白質複合物的預測 3D 結構

    NVIDIA 聯合 Google DeepMind 及歐洲生物資訊研究所(EMBL-EBI)等全球研究機構,通過 AlphaFold Database 免費釋出了覆蓋超 2,800 種病毒的蛋白質複合物預測 3D 結構資料集。

    推薦理由:原文介紹了由 NVIDIA 與 Google DeepMind 等機構合作開源的病毒蛋白質複合物預測資料集,讀者可以據此瞭解 AI 在生物學研究中的最新應用進展。

  2. Vercel Blog31

    Vercel Bug Bounty Program 現已公開可用

    Vercel 將私有與 OSS 漏洞賞金計劃合併為單一公開的 Vercel Bug Bounty Program。AI 的普及使報告數量激增,Vercel 通過改進 triage、修復驗證流程,確保快速響應並評估報告價值。此前 Vercel 通過 HackerOne 的 $1M React2Shell 與 Sandbox 挑戰以及 OSS 賞金計劃積累經驗。

  3. GitHub Blog · AI & ML42

    GitHub Copilot app 如何渲染巨大的 pull request

    GitHub Copilot app 重構了 pull request 檢視,通過將文件高度拆分為確定性的程式碼高度與動態塊高度,並在極端負載下最佳化資料管道和虛擬化渲染,實現了在處理包含 2,200 個檔案、逾百萬改行及超過 400 條行內評論的巨大 pull request 時,依然保持快速流暢的審查體驗。

  4. Microsoft Research69

    將推理遷移到雲端提升物理 AI 機器人效能

    Microsoft Research 在其 Physical AI Toolchain 中新增了將機器人推理遷移到雲端的功能,能夠顯著提升任務成功率、延長續航並支援更大模型。

    推薦理由:文章展示了將機器人推理遷移到雲端可顯著提升任務成功率和續航,幫助讀者評估分散式推理方案對工業機器人的影響。

  5. Google DeepMind62

    Google DeepMind 釋出帶有安全伺服器端記憶體的 Private AI Compute 技術更新

    Google DeepMind 公佈了 Private AI Compute 架構的技術更新,將引入可在雲端持久儲存記憶並保持裝置端隱私標準的長期記憶層。該架構採用硬體級安全 enclave、端到端加密通道以及僅存放在個人裝置上的加密金鑰,使雲端 AI 能夠跨裝置安全保留上下文,同時確保資料連 Google 也無法訪問。

9月23日週三
  1. Google DeepMind84

    Google DeepMind 釋出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS 語音生成模型

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 兩款全新語音生成模型,支援超過 100 種語言的自然語言提示詞聲音設計、30 秒聲音復刻以及逐行臺詞精細導演。

    推薦理由:官方釋出的最新語音生成模型提供了細粒度的臺詞導演和聲音定製能力,讀者可以據此評估其在多語言配音與智慧體互動中的實際表現。

  2. NVIDIA Blog13

    Sakeena Fiza 如何協助 NVIDIA 硬體實現大規模成功

    NVIDIA 驗證工程師 Sakeena Fiza 負責在產品大規模量產前,對系統進行極限壓力測試以確保硬體正常執行。她和團隊在實驗室中見證了 NVIDIA Rubin GPU 首次在系統級別成功列舉的時刻。其日常工作涵蓋排查從高速訊號到熱效能等複雜的軟硬體故障,以保障 AI 工廠的大規模部署。

  3. OpenAI News60

    OpenAI 執行長 Sam Altman 在聯合國安理會的發言

    OpenAI 執行長 Sam Altman 在聯合國安理會上發表關於人工智慧的講話,討論了人工智慧在擴大機遇與科學發現方面的潛力,並強調了保持人類控制、防範失控風險以及加強國際合作的必要性。

    推薦理由:原文完整記錄了 OpenAI 負責人向聯合國安全理事會發表的關於人工智慧安全與治理的發言,讀者可以據此瞭解官方對技術風險與國際合作的立場。

  4. OpenAI News70

    推出 MentalHealthBench 心理健康評測基準

    OpenAI推出MentalHealthBench,一個多語言、多情境的心理健康對話評測基準。該基準由80多名全球心理健康專家共同制定,覆蓋從日常對話到危機情境的多種場景,並提供專家評估標準和自動化評分工具。

    推薦理由:OpenAI釋出MentalHealthBench,提供多語言、多情境的心理健康評測基準,幫助研究者評估模型安全性與實用性。

  5. NVIDIA Blog62

    NVIDIA 與合作伙伴在新加坡 AI Day 展示東南亞 AI 進展並宣佈 Vera Rubin 平臺落地

    NVIDIA 在新加坡 AI Day 宣佈多項東南亞 AI 進展,其中 Sea Limited 成為東盟首家採用 NVIDIA Vera Rubin 平臺的企業,同時新加坡 HTX、NCS、ST Engineering 及馬來西亞、越南等地的合作伙伴正利用 NVIDIA Nemotron 模型與開發工具推進本地化 AI 應用。

    推薦理由:文章盤點多家機構和企業在東南亞落地的具體技術棧與應用場景,讀者可以據此瞭解開源模型在區域本地化部署中的實際進展。

  6. Vercel Blog61

    Vercel Sandbox Drives 進入公開測試版

    Vercel 公開測試版推出了 Drives 功能,允許在 Sandbox 中掛載持久化儲存目錄。Drives 可跨沙箱例項共享,支援讀寫掛載和只讀快照,最大容量可配置至 16 TiB。每個 Sandbox 可掛載四個 Drives,Hobby 計劃包含 15 GB 儲存、30 GB 讀寫配額。價格按儲存、讀寫計費,Hobby 計劃免費提供。

  7. Vercel Blog66

    Gemini 3.8 TTS模型現已在AI Gateway上線

    Gemini 3.8 Flash‑Lite TTS 與 Gemini 3.8 Flash TTS 現已在 AI Gateway 上線,支援 100 多種語言的文本轉語音,支援長篇朗讀、交付控制和雙人對話。

    推薦理由:Gemini 3.8 TTS模型已在AI Gateway上線,支援100多種語言、長篇朗讀和雙人對話,開發者可通過AI SDK輕鬆生成語音。

  8. OpenAI News60

    OpenAI 釋出 GPT-6 的提示詞快取最佳化功能

    OpenAI 釋出了 GPT-6 的提示詞快取改進功能,通過更高的快取命中率、新診斷工具、顯式斷點和控制選項來降低延遲與成本。

    推薦理由:官方更新了提示詞快取機制,讀者可以根據具體的命中率最佳化和診斷手段來評估開發成本。

9月22日週二
  1. NVIDIA Blog63

    NVIDIA 釋出 Isaac ROS 5.0,推進具身智慧與開源機器人開發

    NVIDIA 釋出 Isaac ROS 5.0,這是一個基於 ROS 的 GPU 加速軟體包集合,旨在幫助人類與 AI 智慧體共同構建機器人。新版本引入了全新的智慧體工作流、對 ROS Lyrical 和 Ubuntu 24.04 的支援,以及用於設定和操縱的 NVIDIA Isaac 技能。

    推薦理由:該版本引入了面向智慧體的工作流和新平臺支援,為開發者構建物理AI機器人應用提供了GPU加速能力。

  2. Vercel Blog67

    GPT‑6 Sol 與 Luna 在 AI Gateway 上線

    OpenAI 的 GPT‑6 Sol 與 GPT‑6 Luna 現已在 AI Gateway 上線,價格低於 GPT‑6 Astra。Sol 適用於複雜編碼與持續性探究的 agent 工作流,Luna 則是低成本的高頻重複工作選項。兩者相較 GPT‑5.6 在事實可靠性、直白溝通和減少誤導性編碼宣告方面都有提升。使用時只需傳入模型 ID,即可在模型演練區體驗。

    推薦理由:GPT‑6 Sol 與 Luna 在 AI Gateway 上線,價格更低且在程式碼與專業工作中提升事實可靠性,讀者可評估其高頻工作流價值。

  3. Hugging Face Blog74

    Transformers 現在支援執行 llama.cpp 量化模型

    Hugging Face 的 transformers 庫新增對 GGUF 模型的支援,允許使用者通過熟悉的 API 在本地高效載入和執行量化模型。該整合通過複用 ggml 的 Metal 核心並在 Apple Silicon 上最佳化生成迴圈,使 transformers 能夠直接執行諸如 Qwen3.5 等架構的量化權重。

    推薦理由:原文介紹了 transformers 對 GGUF 模型的支援及底層最佳化,讀者可以瞭解如何在熟悉的介面中直接載入和執行本地量化模型。

  4. Hugging Face Blog59

    英國 AI 安全研究所與 EvalEval 如何讓評測結果可復現

    英國 AI 安全研究所正使用 EvalEval 的 Evaluation Cards 基礎設施公開分享評估結果,以支援更具可復現性和可驗證性的評估科學。此次釋出包含了五項基準測試和兩項安全評測的驗證結果、上下文及配置資訊,涵蓋了 Claude Opus 系列與 GPT-5 系列等六款前沿模型,並配合其關於推理計算如何塑造前沿 LLM 評測的研究論文一同釋出。

  5. Vercel Blog78

    Claude Opus 5.5 在 AI Gateway 上可用

    Anthropic 的 Claude Opus 5.5 已在 AI Gateway 上上線,支援 1M-token 上下文視窗和 128K 輸出 token。與 Opus 5 相比,速度提升約 30%,成本降低約 40%。

    推薦理由:Opus 5.5 在速度和成本上相較前代提升顯著,適合需要大上下文和長任務的智慧體工作,其 1M-token 上下文視窗和 128K 輸出令長任務更易監督,且支援自動工具選擇,提升開發效率。對開發者而言,Opus 5.5 的速度與成本優勢可顯著降低專案迭代週期。