跳到正文

端侧 AI

跑在手机、电脑与边缘设备上的 AI:小模型、本地推理与端侧芯片的进展。

最新精選

第 1–6 條 · 共 6 條
9月24日週四
  1. Microsoft Research69

    将推理迁移到云端提升物理 AI 机器人性能

    Microsoft Research 在其 Physical AI Toolchain 中新增了将机器人推理迁移到云端的功能,能够显著提升任务成功率、延长续航并支持更大模型。

    推薦理由:文章展示了将机器人推理迁移到云端可显著提升任务成功率和续航,帮助读者评估分布式推理方案对工业机器人的影响。

6月27日週六
  1. Google Research65

    Google Research:利用冻结的多Token预测技术在 Pixel 设备上加速 Gemini Nano 模型

    Google Research 宣布推出一项新架构,将多Token预测(MTP)技术应用到已部署且权重被冻结的 Gemini Nano v3 模型上。该方法采用零拷贝架构直接利用主模型的键值缓存,在 Pixel 9 和 10 系列设备上实现了 50% 或更高的推理速度提升,并减少了能耗。

    推薦理由:谷歌研究团队通过在已冻结的 Gemini Nano 模型上应用多Token预测架构,在不增加内存冗余的前提下显著提升了端侧设备的推理速度与能效。

5月29日週五
  1. Google Research69

    Google Research 在 I/O 2026 上开启新发现时代

    Google Research 在 I/O 2026 上公布了多款 AI 工具与模型,涵盖科研加速、健康应用、边缘计算与气候预测等领域。

    推薦理由:Google Research 在 I/O 2026 上公布多款 AI 工具与模型,展示了从科研到产品的快速落地与实际影响,凸显代理式编码与多模态推理在科学与日常应用中的变革潜力,并为全球科研社区提供了可扩展的实验平台。

5月28日週四
  1. Mistral AI74

    推出 Search Toolkit 搜索工具包

    Mistral AI 公布 Search Toolkit,开源框架整合搜索、检索与评估,支持多源索引、实时数据拉取,兼容 BM25、向量检索及混合模式,内置 recall、precision、MRR、NDCG 等指标,适用于 RAG 与智能体场景,可在云端、本地或边缘部署。

    推薦理由:Search Toolkit 将搜索、检索和评估整合到单一框架,帮助企业减少工程时间并提升检索质量;其可在云端、边缘或本地部署,支持多源索引与实时数据拉取,适用于 RAG 与智能体场景。

4月3日週五
  1. Google DeepMind69

    Gemma 4 发布:最强开源模型

    Google DeepMind 推出了 Gemma 4,四种尺寸(E2B、E4B、26B MoE、31B Dense)支持多模态、长上下文(128K–256K)和 140+ 语言,具备高级推理、函数调用和代码生成能力,并以 Apache 2.0 许可免费开放,适用于从移动端到云端的多场景部署。

    推薦理由:Gemma 4 以高效参数利用率和多模态能力,成为最强开源模型之一,支持从移动端到云端的多场景部署,并提供 128K–256K 上下文窗口和 140+ 语言支持,兼具函数调用和结构化 JSON 输出,满足多行业需求。

3月17日週一
  1. Mistral AI65

    Mistral AI 发布 Mistral Small 3.1 模型

    Mistral AI 宣布推出 Mistral Small 3.1,这是一款在其体量级别表现出色的开源模型。该模型带来改进的文本性能、多模态理解以及高达 128k tokens 的上下文窗口,并以 Apache 2.0 许可证开源。

    推薦理由:原文给出了开源模型的新版本性能与多维度升级,读者可以据此评估其在端侧和多模态任务中的应用潜力。