跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精選

第 1–10 條 · 共 10 條
今天10月1日週四
  1. AWS Machine Learning Blog62

    在 Amazon Bedrock AgentCore Runtime Instances 上构建多智能体音乐制作管线

    AWS 介绍了如何使用 Amazon Bedrock AgentCore Runtime Instances 部署一个三智能体协作的音乐制作管线,实现 GPU 音乐生成、音频处理与合规筛查。文章详细讲解了容量提供者配置、共享会话的多智能体同机协作、多日持久化存储以及各智能体的独立部署流程。

    推薦理由:文章给出了基于 Amazon Bedrock AgentCore Runtime Instances 部署多智能体音乐制作管线的具体步骤与架构设计,读者可以据此了解长周期持久化与多智能体协同的实现方式。

9月28日週一
  1. cloudflare blog67

    Vite 驱动的 Next.js 应用:Vinext 1.0 发布

    Cloudflare 推出 Vinext 1.0,帮助开发者将 Next.js 应用迁移到 Vite,并在 Cloudflare Workers、Netlify、AWS Lambda 等平台部署。新版兼容率超过 99%,支持 App Router 与 Pages Router、ISR、缓存、观察等功能,并提供自动化测试与社区驱动的持续改进。

    推薦理由:Vinext 1.0 让 Next.js 应用可在 Cloudflare Workers、Netlify、AWS Lambda 等多平台部署,兼容率已超过 99%,并提供统一缓存、观察与自动化测试,帮助高流量动态网站实现稳定可靠的运行。

9月26日週六
  1. AWS Machine Learning Blog65

    AWS 详解基于 Amazon Bedrock 构建生产级大语言模型质量保障体系

    AWS 团队详细介绍了面向生产环境的大语言模型质量保障架构,通过自适应管道编排、跨账户多模型故障转移、实时流式评估、复合评估框架以及数据准确性验证五项技术,在 Amazon Bedrock 上实现了约 99% 的数值准确率并支持实时流式响应。文章重点阐述了如何通过三阶段自适应处理、独立配额空间网格、生产者消费者并发模式及两阶段级联验证来解决模型幻觉、API 限流和验证延迟等工程挑战。

    推薦理由:文章详细拆解了五项用于保障大语言模型生产环境质量的技术实现,帮助开发者在实际业务中平衡准确率与响应延迟。

9月25日週五
  1. AWS Machine Learning Blog70

    Amazon SageMaker HyperPod 与 Qumulo 实现多区域训练

    本文介绍了如何使用 Amazon SageMaker HyperPod 与 Qumulo 的 Cloud Native 解决方案,在不同 AWS 区域间进行大规模 AI 模型训练,并给出了跨区域训练的性能验证结果。

    推薦理由:文章详细说明如何使用 SageMaker HyperPod 与 Qumulo 进行跨区域训练,并给出验证结果,帮助读者评估跨区域训练的性能与成本。

9月8日週二
  1. Mistral AI78

    Mistral 以30亿欧元融资,推动主权开放权重 AI 成为技术前沿

    Mistral AI 近日完成 30 亿欧元 Series D 融资,后市估值逾 210 亿欧元,创欧洲科技公司最大融资纪录。融资由三星电子领投,Scaleup Europe Fund、PSG Equity 等跟投,资金将用于扩展前沿研究、提升训练算力、加速商业化与国际布局。Mistral 目前已在 20 个国家运营,支持 125 家全球企业的关键 AI 转型。

    推薦理由:Mistral 通过 30 亿欧元融资,进一步加速其全栈开放权重 AI 的研发与商业化,凸显企业对自主 AI 解决方案的需求增长。

8月18日週二
  1. Hugging Face Blog66

    Dharma AI 推出 GPU 管理调度器:通过优化分配顺序显著提升集群利用率

    Dharma AI 推出一种约束感知 GPU 分配器,通过将实时推理需求建模为动态曲线并结合优先级调度,在不更换硬件的情况下使集群利用率提升高达 33 个百分点。该分配器在多个基准测试中展现出更高的吞吐量与优先级加权产出,同时保持极低的决策延迟。

    推薦理由:原文介绍了约束感知 GPU 分配器的设计与多场景基准测试结果,读者可以了解如何通过优化调度顺序提升集群利用率。

8月11日週二
  1. Mistral AI73

    Mistral 推出区域推理、开放模型与欧洲主权 AI 基础设施

    Mistral AI 宣布推出区域推理端点和优先服务层,支持在欧洲或美国运行推理,并提供 1 GW 计算容量目标。公司还将平台开放给第三方模型,首批支持 Z.ai 的 GLM‑5.2,所有模型均在同一基础设施下满足区域控制与 SLA。为保障欧洲长期 AI 计算需求,Mistral 正与企业组建联盟,形成欧洲计算单元(ECU)以锁定多年容量。

    推薦理由:Mistral 推出区域推理端点和开放模型支持,帮助企业实现 AI 主权与合规。

1月22日週四
  1. Mistral AI66

    Mistral AI:排查 vLLM 中的内存泄漏

    Mistral AI 团队详细复盘了在 vLLM 分离部署测试中发现并解决隐蔽内存泄漏的完整过程。通过结合 pmap、BPFtrace 与 GDB 自动化脚本,团队最终定位到根源在于 UCX 内存管理模块的 mmap 钩子机制与注册缓存队列。通过设置环境变量 UCX_MEM_MMAP_HOOK_MODE=none 或限制未释放区域数量,成功解决了该内存泄漏问题。

    推薦理由:文章详细记录了排查 vllm 分离部署中隐蔽内存泄漏的过程,读者可以学习如何通过 pmap 与 GDB 组合定位底层系统调用问题。

9月9日週二
  1. Mistral AI65

    Mistral AI 以 17 亿欧元融资加速 AI 技术进步

    Mistral AI 宣布以 17 亿欧元完成 Series C 轮融资,融资后估值 11.7 亿欧元。此次融资由半导体设备巨头 ASML 领投,其他投资方包括 DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 以及 NVIDIA。

    推薦理由:Mistral AI 通过 17 亿欧元融资,进一步加速在半导体行业的 AI 研发与合作,凸显其在技术链条中的独立与协同潜力,并为未来的半导体与 AI 价值链提供创新解决方案。