跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

最新精選

第 21–26 條 · 共 26 條
9月8日週二
  1. Mistral AI78

    Mistral 以30亿欧元融资,推动主权开放权重 AI 成为技术前沿

    Mistral AI 近日完成 30 亿欧元 Series D 融资,后市估值逾 210 亿欧元,创欧洲科技公司最大融资纪录。融资由三星电子领投,Scaleup Europe Fund、PSG Equity 等跟投,资金将用于扩展前沿研究、提升训练算力、加速商业化与国际布局。Mistral 目前已在 20 个国家运营,支持 125 家全球企业的关键 AI 转型。

    推薦理由:Mistral 通过 30 亿欧元融资,进一步加速其全栈开放权重 AI 的研发与商业化,凸显企业对自主 AI 解决方案的需求增长。

8月25日週二
  1. openrouter blog67

    OpenRouter 影片生成 API:程式碼優先指引

    OpenRouter 透過統一的非同步影片生成 API,讓開發者一次提交、輪詢、下載即可支援 Seedance、Veo、Wan 等多款模型。 - 工作流程:POST /api/v1/videos 提交工作 → 監控 job‑status → 下載 MP4。

    推薦理由:統一的非同步 API 讓多模型影片生成變簡單,利於快速測試與成本掌控。

8月18日週二
  1. Hugging Face Blog66

    Dharma AI 推出 GPU 管理调度器:通过优化分配顺序显著提升集群利用率

    Dharma AI 推出一种约束感知 GPU 分配器,通过将实时推理需求建模为动态曲线并结合优先级调度,在不更换硬件的情况下使集群利用率提升高达 33 个百分点。该分配器在多个基准测试中展现出更高的吞吐量与优先级加权产出,同时保持极低的决策延迟。

    推薦理由:原文介绍了约束感知 GPU 分配器的设计与多场景基准测试结果,读者可以了解如何通过优化调度顺序提升集群利用率。

8月11日週二
  1. Mistral AI73

    Mistral 推出区域推理、开放模型与欧洲主权 AI 基础设施

    Mistral AI 宣布推出区域推理端点和优先服务层,支持在欧洲或美国运行推理,并提供 1 GW 计算容量目标。公司还将平台开放给第三方模型,首批支持 Z.ai 的 GLM‑5.2,所有模型均在同一基础设施下满足区域控制与 SLA。为保障欧洲长期 AI 计算需求,Mistral 正与企业组建联盟,形成欧洲计算单元(ECU)以锁定多年容量。

    推薦理由:Mistral 推出区域推理端点和开放模型支持,帮助企业实现 AI 主权与合规。

1月22日週四
  1. Mistral AI66

    Mistral AI:排查 vLLM 中的内存泄漏

    Mistral AI 团队详细复盘了在 vLLM 分离部署测试中发现并解决隐蔽内存泄漏的完整过程。通过结合 pmap、BPFtrace 与 GDB 自动化脚本,团队最终定位到根源在于 UCX 内存管理模块的 mmap 钩子机制与注册缓存队列。通过设置环境变量 UCX_MEM_MMAP_HOOK_MODE=none 或限制未释放区域数量,成功解决了该内存泄漏问题。

    推薦理由:文章详细记录了排查 vllm 分离部署中隐蔽内存泄漏的过程,读者可以学习如何通过 pmap 与 GDB 组合定位底层系统调用问题。

9月9日週二
  1. Mistral AI65

    Mistral AI 以 17 亿欧元融资加速 AI 技术进步

    Mistral AI 宣布以 17 亿欧元完成 Series C 轮融资,融资后估值 11.7 亿欧元。此次融资由半导体设备巨头 ASML 领投,其他投资方包括 DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 以及 NVIDIA。

    推薦理由:Mistral AI 通过 17 亿欧元融资,进一步加速在半导体行业的 AI 研发与合作,凸显其在技术链条中的独立与协同潜力,并为未来的半导体与 AI 价值链提供创新解决方案。