跳到正文

#端側

RSS
今日 0 則
6月27日週六
  1. Google Research65

    Google Research:利用凍結的多Token預測技術在 Pixel 裝置上加速 Gemini Nano 模型

    Google Research 宣佈推出一項新架構,將多Token預測(MTP)技術應用到已部署且權重被凍結的 Gemini Nano v3 模型上。該方法採用零複製架構直接利用主模型的鍵值快取,在 Pixel 9 和 10 系列裝置上實現了 50% 或更高的推理速度提升,並減少了能耗。

    推薦理由:谷歌研究團隊通過在已凍結的 Gemini Nano 模型上應用多Token預測架構,在不增加記憶體冗餘的前提下顯著提升了端側裝置的推理速度與能效。

4月3日週五
  1. Google DeepMind69

    Gemma 4 釋出:最強開源模型

    Google DeepMind 推出了 Gemma 4,四種尺寸(E2B、E4B、26B MoE、31B Dense)支援多模態、長上下文(128K–256K)和 140+ 語言,具備高階推理、函式呼叫和程式碼生成能力,並以 Apache 2.0 許可免費開放,適用於從移動端到雲端的多場景部署。

    推薦理由:Gemma 4 以高效引數利用率和多模態能力,成為最強開源模型之一,支援從移動端到雲端的多場景部署,並提供 128K–256K 上下文視窗和 140+ 語言支援,兼具函式呼叫和結構化 JSON 輸出,滿足多行業需求。

3月17日週一
  1. Mistral AI65

    Mistral AI 釋出 Mistral Small 3.1 模型

    Mistral AI 宣佈推出 Mistral Small 3.1,這是一款在其體量級別表現出色的開源模型。該模型帶來改進的文本效能、多模態理解以及高達 128k tokens 的上下文視窗,並以 Apache 2.0 許可證開源。

    推薦理由:原文給出了開源模型的新版本效能與多維度升級,讀者可以據此評估其在端側和多模態任務中的應用潛力。