跳到正文

#arXiv

RSS
今日 0 則
9月25日週五
9月3日週四
  1. Hugging Face Blog63

    NeoMME:高效的多模態原生多語言編碼器

    Hugging Face 團隊推出了 NeoMME,這是一個包含 260M 和 800M 引數的多語言多模態基礎編碼器系列。該模型不使用單獨的視覺塔或因果語言模型,而是通過單個雙向 Transformer 同時處理文本 token 和原始影像塊。

    推薦理由:原文釋出了不依賴獨立視覺塔的多模態雙向編碼器,讀者可以瞭解其單塔架構和檢索效能。

6月11日週四
  1. Google DeepMind75

    Google DeepMind 釋出 DiffusionGemma 開源文本擴散模型

    Google DeepMind 釋出了採用 Apache 2.0 協議開源的實驗性模型 DiffusionGemma,這是一款基於 Gemma 4 家族和 Gemini 擴散研究的 26B MoE 文本擴散模型,可在專用 GPU 上實現高達 4 倍的文本生成速度。

    推薦理由:該模型採用文本擴散架構實現數倍於傳統自迴歸模型的推理速度,為開發者探索本地即時互動工作流提供了新的硬體利用方式與微調路徑。