跳到正文

多模態

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精選

第 81–81 條 · 共 81 條
3月7日週五
  1. Mistral AI85

    Mistral AI 发布 Mistral OCR 文档理解模型与 API

    Mistral AI 推出 Mistral OCR 光学字符识别 API,能够高精度解析复杂文档中的文本、图像、表格和数学公式。该模型原生支持多语言与多模态,已在 Le Chat 中作为默认文档理解模型上线,并在 la Plateforme 提供 API,定价为每美元 1000 页。

    推薦理由:该模型在多项复杂文档基准测试中表现突出,为文档理解与检索增强生成系统提供了新的高精度处理方案。