跳到正文

#部署/工程

RSS
今日 2 則
今天10月1日週四
  1. AWS Machine Learning Blog62

    在 Amazon Bedrock AgentCore Runtime Instances 上構建多智慧體音樂製作管線

    AWS 介紹瞭如何使用 Amazon Bedrock AgentCore Runtime Instances 部署一個三智慧體協作的音樂製作管線,實現 GPU 音樂生成、音訊處理與合規篩查。文章詳細講解了容量提供者配置、共享會話的多智慧體同機協作、多日持久化儲存以及各智慧體的獨立部署流程。

    推薦理由:文章給出了基於 Amazon Bedrock AgentCore Runtime Instances 部署多智慧體音樂製作管線的具體步驟與架構設計,讀者可以據此瞭解長週期持久化與多智慧體協同的實現方式。

9月30日週三
  1. AWS Machine Learning Blog47

    如何在 SageMaker AI 上使用 vLLM-Omni 生成影像和影片(第二部分)

    本文介紹瞭如何在 Amazon SageMaker AI 上使用 vLLM-Omni Deep Learning Container 部署 FLUX.2-klein-4B 即時影像生成端點與 Wan2.1-VACE-1.3B 非同步影片生成端點。工作流通過傳送文本提示詞生成靜態影像,隨後將其作為條件輸入並結合運動提示詞傳輸至影片端點,最終從 Amazon S3 獲取生成的 MP4 影片。

9月29日週二
9月28日週一
  1. cloudflare blog67

    Vite 驅動的 Next.js 應用:Vinext 1.0 釋出

    Cloudflare 推出 Vinext 1.0,幫助開發者將 Next.js 應用遷移到 Vite,並在 Cloudflare Workers、Netlify、AWS Lambda 等平臺部署。新版相容率超過 99%,支援 App Router 與 Pages Router、ISR、快取、觀察等功能,並提供自動化測試與社群驅動的持續改進。

    推薦理由:Vinext 1.0 讓 Next.js 應用可在 Cloudflare Workers、Netlify、AWS Lambda 等多平臺部署,相容率已超過 99%,並提供統一快取、觀察與自動化測試,幫助高流量動態網站實現穩定可靠的執行。

9月26日週六
  1. AWS Machine Learning Blog65

    AWS 詳解基於 Amazon Bedrock 構建生產級大語言模型質量保障體系

    AWS 團隊詳細介紹了面向生產環境的大語言模型質量保障架構,通過自適應管道編排、跨賬戶多模型故障轉移、即時流式評估、複合評估框架以及資料準確性驗證五項技術,在 Amazon Bedrock 上實現了約 99% 的數值準確率並支援即時流式響應。文章重點闡述瞭如何通過三階段自適應處理、獨立配額空間網格、生產者消費者併發模式及兩階段級聯驗證來解決模型幻覺、API 限流和驗證延遲等工程挑戰。

    推薦理由:文章詳細拆解了五項用於保障大語言模型生產環境質量的技術實現,幫助開發者在實際業務中平衡準確率與響應延遲。

  2. AWS Machine Learning Blog49

    如何在 Amazon SageMaker AI 上部署 Qwen3-TTS 實現即時個性化語音克隆

    阿里雲千問團隊開發的 Qwen3-TTS-12Hz-1.7B-Base 語音模型現已上線 Amazon SageMaker JumpStart,支援通過託管的即時推理端點實現語音克隆與流式生成。該模型僅需數秒的使用者音訊片段與文本,即可在保持說話人聲音特徵的同時跨語言合成目標語音,並允許使用者在 AWS 環境中控制成本與資料安全。

9月25日週五
  1. AWS Machine Learning Blog70

    Amazon SageMaker HyperPod 與 Qumulo 實現多區域訓練

    本文介紹瞭如何使用 Amazon SageMaker HyperPod 與 Qumulo 的 Cloud Native 解決方案,在不同 AWS 區域間進行大規模 AI 模型訓練,並給出了跨區域訓練的效能驗證結果。

    推薦理由:文章詳細說明如何使用 SageMaker HyperPod 與 Qumulo 進行跨區域訓練,並給出驗證結果,幫助讀者評估跨區域訓練的效能與成本。

9月24日週四
  1. GitHub Blog · AI & ML42

    GitHub Copilot app 如何渲染巨大的 pull request

    GitHub Copilot app 重構了 pull request 檢視,通過將文件高度拆分為確定性的程式碼高度與動態塊高度,並在極端負載下最佳化資料管道和虛擬化渲染,實現了在處理包含 2,200 個檔案、逾百萬改行及超過 400 條行內評論的巨大 pull request 時,依然保持快速流暢的審查體驗。

9月23日週三
  1. Vercel Blog61

    Vercel Sandbox Drives 進入公開測試版

    Vercel 公開測試版推出了 Drives 功能,允許在 Sandbox 中掛載持久化儲存目錄。Drives 可跨沙箱例項共享,支援讀寫掛載和只讀快照,最大容量可配置至 16 TiB。每個 Sandbox 可掛載四個 Drives,Hobby 計劃包含 15 GB 儲存、30 GB 讀寫配額。價格按儲存、讀寫計費,Hobby 計劃免費提供。

9月16日週三
  1. NVIDIA Blog49

    NVIDIA 如何通過 DSX 最大化 AI 工廠產能:從兆瓦到 token

    NVIDIA 推出旨在最佳化 AI 工廠每兆瓦 token 吞吐量的技術套件 NVIDIA DSX,涵蓋動態功耗分配、網格協同排程及生命週期管理等功能。Lambda 的實測結果顯示,在固定電源預算下利用 NVIDIA DSX MaxLPS 執行叢集可提升 24% 的 token 吞吐量。該平臺通過智慧化排程與即時監控,有效釋放了傳統靜態配置下的閒置算力。

9月15日週二
9月11日週五
9月10日週四
9月8日週二
  1. Mistral AI78

    Mistral 以30億歐元融資,推動主權開放權重 AI 成為技術前沿

    Mistral AI 近日完成 30 億歐元 Series D 融資,後市估值逾 210 億歐元,創歐洲科技公司最大融資紀錄。融資由三星電子領投,Scaleup Europe Fund、PSG Equity 等跟投,資金將用於擴充套件前沿研究、提升訓練算力、加速商業化與國際佈局。Mistral 目前已在 20 個國家運營,支援 125 家全球企業的關鍵 AI 轉型。

    推薦理由:Mistral 通過 30 億歐元融資,進一步加速其全棧開放權重 AI 的研發與商業化,凸顯企業對自主 AI 解決方案的需求增長。

8月18日週二
  1. Hugging Face Blog66

    Dharma AI 推出 GPU 管理排程器:通過最佳化分配順序顯著提升叢集利用率

    Dharma AI 推出一種約束感知 GPU 分配器,通過將即時推理需求建模為動態曲線並結合優先順序排程,在不更換硬體的情況下使叢集利用率提升高達 33 個百分點。該分配器在多個基準測試中展現出更高的吞吐量與優先順序加權產出,同時保持極低的決策延遲。

    推薦理由:原文介紹了約束感知 GPU 分配器的設計與多場景基準測試結果,讀者可以瞭解如何通過最佳化排程順序提升叢集利用率。

8月11日週二
  1. Mistral AI73

    Mistral 推出區域推理、開放模型與歐洲主權 AI 基礎設施

    Mistral AI 宣佈推出區域推理端點和優先服務層,支援在歐洲或美國執行推理,並提供 1 GW 計算容量目標。公司還將平臺開放給第三方模型,首批支援 Z.ai 的 GLM‑5.2,所有模型均在同一基礎設施下滿足區域控制與 SLA。為保障歐洲長期 AI 計算需求,Mistral 正與企業組建聯盟,形成歐洲計算單元(ECU)以鎖定多年容量。

    推薦理由:Mistral 推出區域推理端點和開放模型支援,幫助企業實現 AI 主權與合規。

7月30日週四
  1. Hugging Face Blog18

    GPU 管理:為什麼閒置的 GPU 就像停飛的飛機

    企業 AI 領域的下一個真正限制是硬體利用率而非模型智慧,正如航空業的生存取決於飛機在空中的時間。GPU 的成本按日曆小時累積,擁有更多 GPU 並不能保證業務成功,企業經濟效益正日益取決於硬體在任意時刻的利用率。從模型質量競爭轉向算力基礎設施部署後,如何保持硬體持續運轉已成為決定投入成敗的關鍵。

7月10日週五
5月28日週四
  1. Google Research59

    零信任聚合實現私有分析

    Google Research 在部落格中公佈了一種零信任聚合方案,利用單次加密提交和TEE硬體隔離,提供了更高效的隱私分析。該方案基於晶格加密,客戶端可在單條訊息中提交資料,伺服器僅能解密聚合結果;TEE 進一步驗證協議執行。Google 已將此技術用於 SafetyCore、Pixel Recorder、Gboard 等 Android 裝置,以在不洩露使用者內容的前提下評估模型效能並提升安全性。

1月22日週四
  1. Mistral AI66

    Mistral AI:排查 vLLM 中的記憶體洩漏

    Mistral AI 團隊詳細復盤了在 vLLM 分離部署測試中發現並解決隱蔽記憶體洩漏的完整過程。通過結合 pmap、BPFtrace 與 GDB 自動化指令碼,團隊最終定位到根源在於 UCX 記憶體管理模組的 mmap 鉤子機制與註冊快取佇列。通過設定環境變數 UCX_MEM_MMAP_HOOK_MODE=none 或限制未釋放區域數量,成功解決了該記憶體洩漏問題。

    推薦理由:文章詳細記錄了排查 vllm 分離部署中隱蔽記憶體洩漏的過程,讀者可以學習如何通過 pmap 與 GDB 組合定位底層系統呼叫問題。

9月9日週二
  1. Mistral AI65

    Mistral AI 以 17 億歐元融資加速 AI 技術進步

    Mistral AI 宣佈以 17 億歐元完成 Series C 輪融資,融資後估值 11.7 億歐元。此次融資由半導體裝置巨頭 ASML 領投,其他投資方包括 DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 以及 NVIDIA。

    推薦理由:Mistral AI 通過 17 億歐元融資,進一步加速在半導體行業的 AI 研發與合作,凸顯其在技術鏈條中的獨立與協同潛力,併為未來的半導體與 AI 價值鏈提供創新解決方案。