全部AI 動態
RSS 訂閱全部動態
RSSAndrej Karpathy (@karpathy)@karpathyAI 評分3434 Greg Brockman (@gdb)@gdbAI 評分1111 AWS Machine Learning Blog精選AI 評分6262 在 Amazon Bedrock AgentCore Runtime Instances 上構建多智慧體音樂製作管線
AWS 介紹瞭如何使用 Amazon Bedrock AgentCore Runtime Instances 部署一個三智慧體協作的音樂製作管線,實現 GPU 音樂生成、音訊處理與合規篩查。文章詳細講解了容量提供者配置、共享會話的多智慧體同機協作、多日持久化儲存以及各智慧體的獨立部署流程。
推薦理由:文章給出了基於 Amazon Bedrock AgentCore Runtime Instances 部署多智慧體音樂製作管線的具體步驟與架構設計,讀者可以據此瞭解長週期持久化與多智慧體協同的實現方式。
AWS Machine Learning Blog精選AI 評分6161 如何使用 Amazon Bedrock Knowledge Bases 以自然語言查詢理賠資料
本文介紹瞭如何使用 Amazon Bedrock Knowledge Bases 構建具備自然語言查詢、後設資料過濾、對話記憶和上下文安全護欄的理賠助手。文章詳細給出了將 S3 中的理賠文件與後設資料同步至託管知識庫、呼叫 AgenticRetrieveStream API 處理多步問題、渲染引用以及配置防護欄的具體實現步驟與程式碼示例。
推薦理由:文章提供了構建帶有引用和後設資料過濾的智慧檢索助手的完整程式碼與架構,讀者可以據此在實際工作流中實現可追溯的文件查詢。
AWS Machine Learning BlogAI 評分3131 Amazon Textract 介面卡生命週期管理跨賬戶自動化
Amazon Textract 通過將介面卡 ID 外部化到 AWS Systems Manager Parameter Store,實現跨賬戶推廣與零停機更新。文中提供 CloudFormation 與 Terraform 模板、預分類路由流程以及網路隔離、IAM 最小許可權等安全措施,幫助企業在受監管環境下快速落地。
AWS Machine Learning BlogAI 評分4747 如何在 SageMaker AI 上使用 vLLM-Omni 生成影像和影片(第二部分)
本文介紹瞭如何在 Amazon SageMaker AI 上使用 vLLM-Omni Deep Learning Container 部署 FLUX.2-klein-4B 即時影像生成端點與 Wan2.1-VACE-1.3B 非同步影片生成端點。工作流通過傳送文本提示詞生成靜態影像,隨後將其作為條件輸入並結合運動提示詞傳輸至影片端點,最終從 Amazon S3 獲取生成的 MP4 影片。
AWS Machine Learning BlogAI 評分5959 在 SageMaker AI 上使用 vLLM-Omni 構建即時語音應用
本文介紹瞭如何在 Amazon SageMaker AI 上使用 AWS vLLM-Omni 深度學習容器部署 Qwen3-TTS 模型,並通過雙向 WebSocket 連線實現文本輸入與流式語音輸出。文章給出了完整的程式碼示例、例項池配置方法以及 Gradio 客戶端的部署與測試步驟。
AWS Machine Learning BlogAI 評分2424 Amazon Quick 的提示詞工程基礎指南
Amazon Quick 平臺的提示詞工程通過明確具體性、提供業務背景以及採用示例教學等核心原則,幫助使用者獲得更高質量的 AI 響應結果。該方法通過減少反覆除錯並實現複雜工作流程的自動化,從而提升團隊在各種 AI 功能上的協作效率。文章作為系列的第一部分,詳細介紹了適用於所有 Quick 元件的通用原理與結構化框架。
AWS Machine Learning BlogAI 評分5454 Amazon Quick 元件化提示詞工程:模式與避坑指南
本文介紹了 Amazon Quick 各核心元件的提示詞編寫模式與常見誤區。針對 Quick Research、Quick Flows、Quick Sight 及 chat agents 等模組,文章給出了明確目標設定、邏輯拆解、引數規範與身份定義等具體實踐方法。
AWS Machine Learning BlogAI 評分4242 如何用 Amazon Quick 和 Amazon Bedrock AgentCore 構建 AI 驅動的合同智慧平臺
AWS 介紹了一種結合 AI 智慧體、多模型驗證與嵌入式分析的合同智慧平臺架構,可解決傳統 RAG 無法處理的大規模合同跨文件聚合查詢難題。該平臺利用 Amazon S3 儲存合同 PDF,通過 Claude Sonnet 提取欄位、Claude Haiku 驗證結果,並以 Amazon Aurora PostgreSQL 儲存結構化資料,實現秒級處理與精準問答。
OpenAI NewsAI 評分3939 邁向前沿 AI 訓練的安全案例
OpenAI 釋出的早期前沿 AI 訓練安全案例指南,涵蓋技術防護、運營實踐以及對模型對齊偏差事件的調查。該指南旨在為前沿 AI 系統的安全訓練提供系統性框架。
Simon WillisonAI 評分6262 Simon Willison 推出 Bluesky 回覆機器人檢測工具
Simon Willison 藉助 Opus 5.5 開發了一款 Bluesky 回覆機器人檢測工具,用於檢查 Bluesky 個人資料中是否存在可能的自動化回覆機器人。該工具通過分析秒級快速回復、缺乏原創內容且持續回覆高粉絲使用者、以及包含問號等特徵來識別可疑賬號。
Simon WillisonAI 評分6666 Simon Willison 分享使用 Claude Opus 5.5 與 Claude Code 製作 Kākāpō Party 動畫與影片的流程
Simon Willison 在 WeAreDevelopers 閉幕演講中,利用 Claude Opus 5.5 結合照片生成了 HTML5 畫素風鸚鵡派對動畫,並通過 Claude Code 配合 Playwright 自動點選錄製了演示影片。文章分享了完整的提示詞、生成過程以及 Playwright 自動化指令碼。
GitHub Blog · AI & ML精選AI 評分6262 GitHub Copilot 如何使用 canvases 構建自定義工作流
GitHub Copilot app 推出了 canvases 功能,允許使用者通過 /create-canvas 技能與自然語言描述,免編碼生成支援雙向互動的自定義工作流介面。畫布可作為共享白板即時更新,支援團隊共享或儲存為個人擴充套件,使用者也可直接安裝 Awesome Copilot 中的現成擴充套件進行定製。
推薦理由:文章介紹了 GitHub Copilot app 中使用 canvases 自定義工作流的方法,讀者可以學習如何通過描述直接生成雙向互動介面。
AWS Machine Learning BlogAI 評分4646 如何在 Amazon SageMaker HyperPod 上使用 SkyRL 加速多模態強化學習訓練
本文介紹瞭如何在 Amazon SageMaker HyperPod 上使用開源強化學習框架 SkyRL,配合 GRPO 演算法對 Qwen3-VL-8B 視覺語言模型進行多模態強化學習後訓練。
AWS Machine Learning Blog精選AI 評分6565 AWS 詳解基於 Amazon Bedrock 構建生產級大語言模型質量保障體系
AWS 團隊詳細介紹了面向生產環境的大語言模型質量保障架構,通過自適應管道編排、跨賬戶多模型故障轉移、即時流式評估、複合評估框架以及資料準確性驗證五項技術,在 Amazon Bedrock 上實現了約 99% 的數值準確率並支援即時流式響應。文章重點闡述瞭如何通過三階段自適應處理、獨立配額空間網格、生產者消費者併發模式及兩階段級聯驗證來解決模型幻覺、API 限流和驗證延遲等工程挑戰。
推薦理由:文章詳細拆解了五項用於保障大語言模型生產環境質量的技術實現,幫助開發者在實際業務中平衡準確率與響應延遲。
AWS Machine Learning BlogAI 評分4949 如何在 Amazon SageMaker AI 上部署 Qwen3-TTS 實現即時個性化語音克隆
阿里雲千問團隊開發的 Qwen3-TTS-12Hz-1.7B-Base 語音模型現已上線 Amazon SageMaker JumpStart,支援通過託管的即時推理端點實現語音克隆與流式生成。該模型僅需數秒的使用者音訊片段與文本,即可在保持說話人聲音特徵的同時跨語言合成目標語音,並允許使用者在 AWS 環境中控制成本與資料安全。
AWS Machine Learning Blog精選AI 評分6767 WhisperX 在 SageMaker AI 上實現說話人標註轉寫
本文介紹了 AWS WhisperX Deep Learning Container(DLC)的使用方法,演示如何在 Amazon SageMaker AI 上部署即時和非同步端點,實現詞級時間戳和說話人標籤的轉寫。
推薦理由:本文展示瞭如何在 SageMaker 上部署 WhisperX,實現精準的詞級時間戳和說話人標籤,幫助使用者快速構建可搜尋、可稽核的音訊轉寫系統。
Simon WillisonAI 評分5353 Shadow roots, explained with live examples
通過互動示例介紹了 Shadow DOM 的工作原理,展示了樣式封裝、繼承、slots、parts 以及 JavaScript 訪問方式,探討了 Shadow roots 如何建立帶有私有樣式表的隔離 DOM 樹。
NVIDIA Blog精選AI 評分6262 NVIDIA 撰文談 AI 安全的工程化挑戰與智慧體棧防護方案
NVIDIA 釋出文章指出 AI 安全本質上是一個工程問題,並從智慧體棧的全棧防護、可執行邊界、測試驗證及開源協作等方面闡述了應對策略。文章介紹了 NVIDIA OpenShell 等開源執行時及合作伙伴的安全工具,強調企業需要通過明確的策略、獨立沙箱和可追溯的身份憑證來保障智慧體在複雜環境下的執行安全。
推薦理由:文章探討了智慧體棧各層的安全治理原則與開源實踐,讀者可以據此瞭解企業在多層架構中部署智慧體時的安全邊界與防護方案。
OpenAI NewsAI 評分1919 如何將 AI 使用情況與業務價值掛鉤
ChatGPT Team 和 Codex 分析功能可幫助團隊瞭解 AI 的使用情況與開支,識別培訓需求,並將工具的普及與業務成果聯絡起來。
Hugging Face Blog精選AI 評分6363 AI 智慧體的任務一致性與 Consistency Analyzer 診斷方法
IBM Research 團隊指出當前基準測試中的平均準確率掩蓋了智慧體的可靠性問題,並推出了用於測量和改善該問題的 Consistency Analyzer 與一致性指南。實驗表明,該方法在 AppWorld 測試中將一致性差距從 24.4 個百分點縮小至 12.0 個百分點,且未降低平均準確率。相關開原始碼與技術報告已釋出。
推薦理由:文章提出了一種測量和緩解智慧體執行不一致性的方法,對評估和提升智慧體在生產環境中的可靠性有參考價值。
GitHub Blog · AI & ML精選AI 評分6262 Marketing ops as code:在 GitHub 上將活動從規劃到跟進全流程自動化
GitHub 營銷負責人分享瞭如何利用 GitHub Copilot、GitHub Actions 及 API/CLI 工具將亞太區的活動運營流程實現程式碼化與自動化。通過將執行手冊轉化為 Markdown 技能並結合 Issue 觸發器,系統能夠自動生成落地頁、分發 UTM 連結、每日篩查註冊名單以及在活動後執行跟進。
推薦理由:作者通過自身實踐展示瞭如何用自然語言和平臺原生功能自動化營銷運營,為非技術背景人員提供了可複用的工作流改造方法。
OpenAI NewsAI 評分2525 研究者如何用 Codex 與 ChatGPT 搜尋新抗菌分子
César de la Fuente 的實驗室利用 Codex 與 ChatGPT 在活體與滅絕基因組中搜索抗菌候選分子,以對抗耐藥感染。
Hugging Face Blog精選AI 評分7373 基於 Hugging Face Jobs 與儲存桶跨節點非同步訓練 LoRA
Hugging Face 官方介紹瞭如何使用 TRL v1.14 中的 AsyncGRPOTrainer 在不同機器上非同步訓練 LoRA 介面卡並同步至 vLLM。通過將兆位元組大小的 rank-1 介面卡寫入儲存桶並藉助代理路由 KV 快取字首,該方案省去了 NCCL 跨節點通訊,使 500 步訓練耗時縮短至原來的四分之一。
推薦理由:文章展示瞭如何在不同機器上執行訓練與推理,通過儲存桶同步 LoRA 介面卡,為分散式強化學習提供了可複用的工程方案。
Hugging Face Blog精選AI 評分6666 Graidio Workflow 推出 Workflow1111
Graidio 團隊釋出了 Workflow1111,這是一個基於 Gradio Workflow 重構 AUTOMATIC1111 功能集的單工作流畫布,包含由 73 個節點和 11 條媒體管線組成的圖表。
推薦理由:文章展示瞭如何用視覺化節點把多個媒體管線組合在一起,並自動生成介面和協議,為開發者搭建複雜多模態應用提供了新方案。
Hugging Face Blog精選AI 評分6262 如何微調 350M 模型以在 100 個 GRPO 步驟中實現更好的結構化輸出
本文介紹了使用 TRL 庫和 GRPO 對 LFM2.5-350M 模型進行輕量化微調的開源教程,展示了僅需約 500 個樣本和 100 個訓練步驟即可將模型在 IFStruct 基準測試中的整體表現從 22.6% 提升至 29.7% 的具體方法。
推薦理由:文章提供了在免費 GPU 環境下用 GRPO 最佳化小模型結構化輸出的完整開源配方,讀者可以藉此評估低成本對齊對模型輸出合規性的實際提升效果。
Hugging Face Blog精選AI 評分6262 Hugging Face 升級 Papers with Code 搜尋引擎架構,結合混合檢索與向量服務
Hugging Face 宣佈重構 Papers with Code 搜尋引擎,採用混合檢索系統結合 PostgreSQL、pgvector 與 reciprocal rank fusion(RRF)演算法,提升論文檢索效果。
推薦理由:文章詳細拆解了基於混合檢索的論文搜尋引擎架構,展示瞭如何通過離線任務與線上服務的拆分來兼顧吞吐量和低延遲,為類似工程實踐提供了可複用的系統設計範本。
Hugging Face Blog精選AI 評分6666 Dharma AI 推出 GPU 管理排程器:通過最佳化分配順序顯著提升叢集利用率
Dharma AI 推出一種約束感知 GPU 分配器,通過將即時推理需求建模為動態曲線並結合優先順序排程,在不更換硬體的情況下使叢集利用率提升高達 33 個百分點。該分配器在多個基準測試中展現出更高的吞吐量與優先順序加權產出,同時保持極低的決策延遲。
推薦理由:原文介紹了約束感知 GPU 分配器的設計與多場景基準測試結果,讀者可以瞭解如何通過最佳化排程順序提升叢集利用率。
Hugging Face Blog精選AI 評分6868 想用 ACE 嗎?ALTK-Evolve 用更少 Token 實現
Hugging Face 部落格介紹了 ALTK-Evolve 庫,該庫通過高效的記憶檢索實現與 ACE 相比更低的 Token 消耗,同時保持或提升準確率。ALTK-Evolve 與 ACE 都利用代理自身軌跡學習,但在記憶構建和交付方式上不同:ACE 採用完整的 playbook 注入,而 ALTK-Evolve 只檢索模型可用的指導原則,從而顯著降低推理 token。
推薦理由:ALTK-Evolve 在保持或提升準確率的同時,顯著降低推理 token 消耗,展示了高效記憶檢索的可行性。
Hugging Face BlogAI 評分3131 Newer Models, Same Advantage:DharmaOCR 如何憑領域專注度擊敗更新的模型
儘管架構更新,但憑藉領域專注度和針對性訓練,DharmaOCR 在巴西葡萄牙語處理上依然表現優於 Mistral OCR4 和 Unlimited-OCR。在葡萄牙語專屬評估基準中,DharmaOCR 取得了 0.925 的分數,而 Mistral OCR4 為 0.798,Unlimited-OCR 為 0.7587。這種效能優勢源於其引數資源完全集中於單一語言領域,而非分散在多語言空間中。
Hugging Face BlogAI 評分3131 PyTorch 效能分析(第三部分):Attention 機制分析
本文介紹了在 PyTorch 效能分析系列中如何對 Transformer 架構核心的 attention 機制進行剖析。文章通過對比原生 attention 與使用 masked_fill_ 等原地操作的程式碼,展示瞭如何通過單行修改消除 GPU 上的記憶體複製(Memcpy)kernel。
Hugging Face BlogAI 評分4747 PRX 第 4 部分:資料策略
PRX 團隊公開了 7B 模型的預訓練資料策略,詳細闡述了結合公共與內部資料集、利用 VLM 重新加長文本標註以及通過 Mosaic Streaming(MDS)和 Lance 格式進行分散式訓練的完整資料流水線。該團隊放棄了預計算文本潛變數,轉而在訓練迴圈中動態執行 Qwen3-VL 文本編碼器,僅帶來約 3-4% 的吞吐量成本。
Mistral AI精選AI 評分6666 Mistral AI 推出自主 Rails 測試智慧體:為不願寫測試的開發者自動編寫 RSpec
Mistral AI 推出了基於開源編碼助手 Vibe 構建的自主測試智慧體,能夠自動為 Ruby on Rails 程式碼庫生成、驗證和改進 RSpec 測試。該智慧體通過倉庫級上下文、分類技能檔案以及 RuboCop 和 SimpleCov 自定義工具,在包含 275 個檔案的真實程式碼庫測試中實現了 100% 的程式碼覆蓋率和通過率。
推薦理由:原文介紹了團隊如何基於開源編碼助手構建自主測試生成智慧體,讀者可以瞭解如何通過上下文工程、專用技能和自定義工具來擴充套件智慧體能力。
Mistral AI精選AI 評分6666 Mistral AI:排查 vLLM 中的記憶體洩漏
Mistral AI 團隊詳細復盤了在 vLLM 分離部署測試中發現並解決隱蔽記憶體洩漏的完整過程。通過結合 pmap、BPFtrace 與 GDB 自動化指令碼,團隊最終定位到根源在於 UCX 記憶體管理模組的 mmap 鉤子機制與註冊快取佇列。通過設定環境變數 UCX_MEM_MMAP_HOOK_MODE=none 或限制未釋放區域數量,成功解決了該記憶體洩漏問題。
推薦理由:文章詳細記錄了排查 vllm 分離部署中隱蔽記憶體洩漏的過程,讀者可以學習如何通過 pmap 與 GDB 組合定位底層系統呼叫問題。
Berkeley AI ResearchAI 評分5858 RL without TD learning
作者介紹了一種基於分治範式的強化學習演算法 Transitive RL,旨在解決傳統時序差分學習在長步數任務中的誤差累積與擴充套件難題。該方法通過在目標條件強化學習中應用可傳遞的貝爾曼更新規則,將軌跡分割為兩段,並利用資料集中的狀態和期望迴歸來計算軟最大值,從而在複雜長步數任務中取得了良好效能且無需手動調整超引數。
Mistral AIAI 評分4343 Fine-tuning Pixtral-12B 釋放衛星影像視覺語言模型潛能
Mistral通過對Pixtral-12B進行LoRA微調,在衛星影像分類任務上顯著提升了效能。LoRA僅需少量可訓練引數,避免了完整模型再訓練的高成本。該方法在AID資料集上提升了對細粒度場景類別的識別準確率,減少了模型幻覺。
Mistral AIAI 評分5656 Mistral AI 探討如何使用 LLM 作為裁判評估 RAG 系統
Mistral AI 介紹瞭如何利用大語言模型作為裁判來評估 RAG 系統,重點探討了 RAG 三元組的概念,並結合結構化輸出功能給出了具體的實現程式碼和評估框架。
Mistral AI精選AI 評分6161 Mistral AI 釋出面向產品開發的智慧體工作流
Mistral AI 推出基於 Mistral Large 2 的 TranscriptToPRDTicket 智慧體工作流,能夠將會議記錄自動轉化為產品需求文件(PRD)並在 Linear 或 Jira 等專案管理工具中生成開發任務。
推薦理由:官方通過公開的端到端實現方案展示瞭如何利用大模型將會議紀要轉化為產品需求文件和開發任務,為團隊最佳化產品開發流程提供了可複用的工程參考。