Meta將AI資料中心歸類實驗,躲避數十億美元美國稅收
Meta通過將其AI資料中心歸類為“試點模型”,利用聯邦研究稅收抵免在2025年節省了39億美元,成為公開上市公司中受益最多的企業。該做法被視為對稅法的大膽利用,Meta的會計師已將不確定稅務位置準備金上調45%至187.4億美元。
Meta通過將其AI資料中心歸類為“試點模型”,利用聯邦研究稅收抵免在2025年節省了39億美元,成為公開上市公司中受益最多的企業。該做法被視為對稅法的大膽利用,Meta的會計師已將不確定稅務位置準備金上調45%至187.4億美元。
AWS 介紹瞭如何使用 Amazon Bedrock AgentCore Runtime Instances 部署一個三智慧體協作的音樂製作管線,實現 GPU 音樂生成、音訊處理與合規篩查。文章詳細講解了容量提供者配置、共享會話的多智慧體同機協作、多日持久化儲存以及各智慧體的獨立部署流程。
推薦理由:文章給出了基於 Amazon Bedrock AgentCore Runtime Instances 部署多智慧體音樂製作管線的具體步驟與架構設計,讀者可以據此瞭解長週期持久化與多智慧體協同的實現方式。
Amazon Textract 通過將介面卡 ID 外部化到 AWS Systems Manager Parameter Store,實現跨賬戶推廣與零停機更新。文中提供 CloudFormation 與 Terraform 模板、預分類路由流程以及網路隔離、IAM 最小許可權等安全措施,幫助企業在受監管環境下快速落地。
本文介紹瞭如何在 Amazon SageMaker AI 上使用 vLLM-Omni Deep Learning Container 部署 FLUX.2-klein-4B 即時影像生成端點與 Wan2.1-VACE-1.3B 非同步影片生成端點。工作流通過傳送文本提示詞生成靜態影像,隨後將其作為條件輸入並結合運動提示詞傳輸至影片端點,最終從 Amazon S3 獲取生成的 MP4 影片。
Cloudflare 團隊通過讓 LLM 模擬駭客進行動態測試,評估了自身 WAF 在六個攻擊類別下對 1,107 次嘗試的防護表現。測試表明,絕大多數攻擊均被 Cloudflare WAF 成功攔截,未被攔截的請求則幫助團隊建立了新的檢測機制以強化安全性。
Cloudflare 推出 Vinext 1.0,幫助開發者將 Next.js 應用遷移到 Vite,並在 Cloudflare Workers、Netlify、AWS Lambda 等平臺部署。新版相容率超過 99%,支援 App Router 與 Pages Router、ISR、快取、觀察等功能,並提供自動化測試與社群驅動的持續改進。
推薦理由:Vinext 1.0 讓 Next.js 應用可在 Cloudflare Workers、Netlify、AWS Lambda 等多平臺部署,相容率已超過 99%,並提供統一快取、觀察與自動化測試,幫助高流量動態網站實現穩定可靠的執行。
本文介紹瞭如何利用 Amazon EKS、EFA 與 DeepEP 在大規模 MoE RL 訓練中實現 40% 以上吞吐提升。
推薦理由:本文詳細闡述瞭如何利用 Amazon EKS、EFA 與 DeepEP 在大規模 MoE RL 訓練中實現 40% 以上吞吐提升,幫助讀者快速搭建高效、成本友好的分散式 RL 基礎設施。
本文介紹瞭如何在 Amazon SageMaker HyperPod 上使用開源強化學習框架 SkyRL,配合 GRPO 演算法對 Qwen3-VL-8B 視覺語言模型進行多模態強化學習後訓練。
AWS 團隊詳細介紹了面向生產環境的大語言模型質量保障架構,通過自適應管道編排、跨賬戶多模型故障轉移、即時流式評估、複合評估框架以及資料準確性驗證五項技術,在 Amazon Bedrock 上實現了約 99% 的數值準確率並支援即時流式響應。文章重點闡述瞭如何通過三階段自適應處理、獨立配額空間網格、生產者消費者併發模式及兩階段級聯驗證來解決模型幻覺、API 限流和驗證延遲等工程挑戰。
推薦理由:文章詳細拆解了五項用於保障大語言模型生產環境質量的技術實現,幫助開發者在實際業務中平衡準確率與響應延遲。
阿里雲千問團隊開發的 Qwen3-TTS-12Hz-1.7B-Base 語音模型現已上線 Amazon SageMaker JumpStart,支援通過託管的即時推理端點實現語音克隆與流式生成。該模型僅需數秒的使用者音訊片段與文本,即可在保持說話人聲音特徵的同時跨語言合成目標語音,並允許使用者在 AWS 環境中控制成本與資料安全。
本文介紹瞭如何使用 Amazon SageMaker HyperPod 與 Qumulo 的 Cloud Native 解決方案,在不同 AWS 區域間進行大規模 AI 模型訓練,並給出了跨區域訓練的效能驗證結果。
推薦理由:文章詳細說明如何使用 SageMaker HyperPod 與 Qumulo 進行跨區域訓練,並給出驗證結果,幫助讀者評估跨區域訓練的效能與成本。
GitHub Copilot app 重構了 pull request 檢視,通過將文件高度拆分為確定性的程式碼高度與動態塊高度,並在極端負載下最佳化資料管道和虛擬化渲染,實現了在處理包含 2,200 個檔案、逾百萬改行及超過 400 條行內評論的巨大 pull request 時,依然保持快速流暢的審查體驗。
Vercel 公開測試版推出了 Drives 功能,允許在 Sandbox 中掛載持久化儲存目錄。Drives 可跨沙箱例項共享,支援讀寫掛載和只讀快照,最大容量可配置至 16 TiB。每個 Sandbox 可掛載四個 Drives,Hobby 計劃包含 15 GB 儲存、30 GB 讀寫配額。價格按儲存、讀寫計費,Hobby 計劃免費提供。
曼徹斯特大學聯合 NVIDIA 團隊,利用 NVIDIA Earth-2 生成式降尺度模型 CorrDiff 在 Isambard-AI 超算上僅用兩天時間完成了英國全境空氣汙染模型的訓練。該模型基於一年的小時級模擬資料構建,空間解析度達 2 至 3 平方公里,未來還將整合更多開源資料以實現街道級別的預測。
NVIDIA 推出旨在最佳化 AI 工廠每兆瓦 token 吞吐量的技術套件 NVIDIA DSX,涵蓋動態功耗分配、網格協同排程及生命週期管理等功能。Lambda 的實測結果顯示,在固定電源預算下利用 NVIDIA DSX MaxLPS 執行叢集可提升 24% 的 token 吞吐量。該平臺通過智慧化排程與即時監控,有效釋放了傳統靜態配置下的閒置算力。
summary_zh: Delphi 在 Vercel 上以 Python 後端每天釋出 100+ 次,透過 Vercel Workflows 與 Queues 讓部署流程簡化,並支援即時 A/B 測試與異常偵測。
OpenAI 將 Habitat 從 Python 庫演進為全球分散式儲存平臺,支援 10 億 ChatGPT 使用者和 22M 請求/秒。
summary_zh: - **Featured 的使用者每月透過 Vercel 傳送超過 100,000 筆媒體投遞,並在一年內傳送超過 1 億封 Help A Reporter Out (HARO) 電子郵件。
Tailscale 利用 Vercel AI Gateway 快速搭建了客戶面向的模型路由器,並提供零資料保留與低延遲的安全執行環境。 - 核心功能:透過單一 API 管理數百個模型,並自動回傳成本與使用量。
summary_zh: 現在可以在 Vercel 上使用 OpenAI Agents API 建置並部署長時間執行、使用工具的代理程式。 - 代理迴圈與會話狀態:由 OpenAI 管理,確保代理持續運作。
Mistral AI 近日完成 30 億歐元 Series D 融資,後市估值逾 210 億歐元,創歐洲科技公司最大融資紀錄。融資由三星電子領投,Scaleup Europe Fund、PSG Equity 等跟投,資金將用於擴充套件前沿研究、提升訓練算力、加速商業化與國際佈局。Mistral 目前已在 20 個國家運營,支援 125 家全球企業的關鍵 AI 轉型。
推薦理由:Mistral 通過 30 億歐元融資,進一步加速其全棧開放權重 AI 的研發與商業化,凸顯企業對自主 AI 解決方案的需求增長。
Dharma AI 推出一種約束感知 GPU 分配器,通過將即時推理需求建模為動態曲線並結合優先順序排程,在不更換硬體的情況下使叢集利用率提升高達 33 個百分點。該分配器在多個基準測試中展現出更高的吞吐量與優先順序加權產出,同時保持極低的決策延遲。
推薦理由:原文介紹了約束感知 GPU 分配器的設計與多場景基準測試結果,讀者可以瞭解如何通過最佳化排程順序提升叢集利用率。
Mistral AI 宣佈推出區域推理端點和優先服務層,支援在歐洲或美國執行推理,並提供 1 GW 計算容量目標。公司還將平臺開放給第三方模型,首批支援 Z.ai 的 GLM‑5.2,所有模型均在同一基礎設施下滿足區域控制與 SLA。為保障歐洲長期 AI 計算需求,Mistral 正與企業組建聯盟,形成歐洲計算單元(ECU)以鎖定多年容量。
推薦理由:Mistral 推出區域推理端點和開放模型支援,幫助企業實現 AI 主權與合規。
企業 AI 領域的下一個真正限制是硬體利用率而非模型智慧,正如航空業的生存取決於飛機在空中的時間。GPU 的成本按日曆小時累積,擁有更多 GPU 並不能保證業務成功,企業經濟效益正日益取決於硬體在任意時刻的利用率。從模型質量競爭轉向算力基礎設施部署後,如何保持硬體持續運轉已成為決定投入成敗的關鍵。
本文介紹了在 PyTorch 效能分析系列中如何對 Transformer 架構核心的 attention 機制進行剖析。文章通過對比原生 attention 與使用 masked_fill_ 等原地操作的程式碼,展示瞭如何通過單行修改消除 GPU 上的記憶體複製(Memcpy)kernel。
Google Research 在部落格中公佈了一種零信任聚合方案,利用單次加密提交和TEE硬體隔離,提供了更高效的隱私分析。該方案基於晶格加密,客戶端可在單條訊息中提交資料,伺服器僅能解密聚合結果;TEE 進一步驗證協議執行。Google 已將此技術用於 SafetyCore、Pixel Recorder、Gboard 等 Android 裝置,以在不洩露使用者內容的前提下評估模型效能並提升安全性。
Mistral AI 團隊詳細復盤了在 vLLM 分離部署測試中發現並解決隱蔽記憶體洩漏的完整過程。通過結合 pmap、BPFtrace 與 GDB 自動化指令碼,團隊最終定位到根源在於 UCX 記憶體管理模組的 mmap 鉤子機制與註冊快取佇列。通過設定環境變數 UCX_MEM_MMAP_HOOK_MODE=none 或限制未釋放區域數量,成功解決了該記憶體洩漏問題。
推薦理由:文章詳細記錄了排查 vllm 分離部署中隱蔽記憶體洩漏的過程,讀者可以學習如何通過 pmap 與 GDB 組合定位底層系統呼叫問題。
Mistral AI 宣佈以 17 億歐元完成 Series C 輪融資,融資後估值 11.7 億歐元。此次融資由半導體裝置巨頭 ASML 領投,其他投資方包括 DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 以及 NVIDIA。
推薦理由:Mistral AI 通過 17 億歐元融資,進一步加速在半導體行業的 AI 研發與合作,凸顯其在技術鏈條中的獨立與協同潛力,併為未來的半導體與 AI 價值鏈提供創新解決方案。