跳到正文

多模態

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精選

第 61–62 條 · 共 62 條
3月17日週一
  1. Mistral AI65

    Mistral AI 发布 Mistral Small 3.1 模型

    Mistral AI 宣布推出 Mistral Small 3.1,这是一款在其体量级别表现出色的开源模型。该模型带来改进的文本性能、多模态理解以及高达 128k tokens 的上下文窗口,并以 Apache 2.0 许可证开源。

    推薦理由:原文给出了开源模型的新版本性能与多维度升级,读者可以据此评估其在端侧和多模态任务中的应用潜力。

3月7日週五
  1. Mistral AI85

    Mistral AI 发布 Mistral OCR 文档理解模型与 API

    Mistral AI 推出 Mistral OCR 光学字符识别 API,能够高精度解析复杂文档中的文本、图像、表格和数学公式。该模型原生支持多语言与多模态,已在 Le Chat 中作为默认文档理解模型上线,并在 la Plateforme 提供 API,定价为每美元 1000 页。

    推薦理由:该模型在多项复杂文档基准测试中表现突出,为文档理解与检索增强生成系统提供了新的高精度处理方案。