跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

14條精選相關主題多模态AI 视频产品更新

最新精選

第 1–14 條 · 共 14 條
9月23日週三
  1. Google DeepMind84

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款全新语音生成模型,支持超过 100 种语言的自然语言提示词声音设计、30 秒声音复刻以及逐行台词精细导演。

    推薦理由:官方发布的最新语音生成模型提供了细粒度的台词导演和声音定制能力,读者可以据此评估其在多语言配音与智能体交互中的实际表现。

9月16日週三
  1. Google DeepMind66

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

    Google DeepMind 推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款先进的实时对话模型,带来并行推理与近实时语音交互升级。

    推薦理由:Google DeepMind 推出了 Gemini 3.8 Live 与 3.8 Live Extended Thinking,通过并行推理与近实时语音交互能力在多项语音基准测试中表现突出,读者可借此评估其在复杂语音智能体开发和企业级工作流中的应用潜力。

9月10日週四
  1. OpenAI News86

    OpenAI 在 API 中发布 GPT-Live-1 语音模型

    OpenAI 在 API 中推出 GPT-Live-1,支持同时聆听与说话的全双工语音交互,并可将深度推理与工具调用委托给后端模型。该模型在 API 中的定价为每分钟 0.05 美元,具备平滑的中断处理、语气与风格控制以及电话网络支持等特性。

8月27日週四
  1. Google DeepMind75

    Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe

    Google DeepMind 推出 Gemini 3.5 Transcribe,这是其迄今最精准的语音转文本模型,支持实时流式传输与预录音频处理,字错误率在流式传输和非流式场景下分别达到 4.0% 和 2.6%。该模型支持超过 85 种语言的自动检测与转录,具备智能纠错、自定义词汇识别及多说话人识别等功能,目前已在 Google AI Studio 等平台面向开发者开放公测。

    推薦理由:官方推出的最新语音转文本模型给出了具体的错误率和多语言支持数据,读者可以据此评估其实际语音交互性能。

8月21日週五
  1. Hugging Face Blog64

    Hugging Face 博客:衡量语音识别中的基准测试优化现象

    Hugging Face 最新研究引入了三项测试,用于量化语音识别模型中的基准测试优化(benchmaxxing)现象,评估了 11 个开源 ASR 模型后发现部分高分系统会复现基准测试中的错误转录、填补被静音的数字并根据数据集调整拼写习惯。

    推薦理由:研究指出语音识别模型会利用音频中的线索复现公开测试集的错误和拼写习惯,这有助于理解如何通过独立测试集评估模型真实性能。

8月11日週二
  1. Hugging Face Blog77

    构建低延迟多语种语音代理:NVIDIA Magpie TTS 开放权重与完整部署控制

    NVIDIA 发布了 Magpie TTS 多语种文本转语音模型,支持12种语言,并提供开放权重与本地部署能力。该模型在单流 GPU 上可实现 32–79 ms 的首音延迟,64 并发流下可达 239 ms,吞吐率高达 320× 实时。

    推薦理由:开放权重与低延迟让企业可在本地部署多语种语音代理,支持12种语言并提供高质量音频,帮助企业实现低延迟、可定制的多语种语音代理。

7月15日週三
  1. Hugging Face Blog75

    推出 Real World VoiceEQ:衡量语音 AI 的人类质量

    Hugging Face 发布了 Real World VoiceEQ,一个评估语音 AI 人类质量的基准,涵盖 60 多项指标,覆盖 40 多个模型。该基准基于 100 万条人类评分,评估 15+ 维度的 ASR、TTS、S2S 和 Speech Understanding,帮助开发者识别情感、背景噪声等细粒度缺陷。

    推薦理由:Real World VoiceEQ 提供了超过 60 项指标的真实人类评估,帮助开发者识别模型在情感、背景噪声等方面的细粒度缺陷。

7月1日週三
  1. Hugging Face Blog68

    Hugging Face 与 Cerebras 推出基于 Gemma 4 的实时语音 AI

    Hugging Face 与 Cerebras 联合推出将开源语音 AI 架构与高速推理相结合的实时语音方案,实现自然的语音到语音交互。该开源级联语音堆栈由 Nvidia Parakeet 进行语音识别、Cerebras 运行 Google DeepMind 的 Gemma 4 31B 模型进行推理、以及 Alibaba 的 Qwen3TTS 生成语音,并已应用于 Reachy Mini 机器人。

    推薦理由:原文展示了开源语音流水线如何结合硬件推理速度,读者可以评估这种架构在低延迟交互中的表现。

6月9日週二
  1. Google DeepMind81

    Gemini 3.5 Live Translate 实时语音翻译实现流畅自然

    Gemini 3.5 Live Translate 是 Google DeepMind 推出的最新音频模型,支持 70+ 语言的实时语音对语音翻译。该模型可持续流式处理,几秒延迟,自动检测语言并保持语调、节奏与音高。

    推薦理由:Gemini 3.5 Live Translate 提供 70+ 语言的实时语音翻译,减少停顿,适用于会议、通话等场景,帮助开发者快速构建多语言翻译应用。支持多语言输入,无需手动配置,噪声鲁棒性强,适合嘈杂环境。

4月16日週四
  1. Google DeepMind73

    Gemini 3.1 Flash TTS 发布:下一代表达式 AI 语音模型

    Google DeepMind 推出了 Gemini 3.1 Flash TTS,提升了可控性、表达力和音质,支持 70+ 语言和多说话人对话,并通过细粒度音频标签让开发者可用自然语言控制语音风格。该模型在人工分析 TTS 评测中获得 1,211 Elo 分,并已在 Gemini API、Vertex AI 及 Google AI Studio 预览。

    推薦理由:Gemini 3.1 Flash TTS 通过细粒度音频标签提升可控性与表达力,支持 70+ 语言,支持多说话人对话,适合企业与开发者构建多语种语音应用,且在人工分析 TTS 评测中获得 1,211 Elo 分。

3月24日週二
  1. Mistral AI75

    Mistral AI 发布 Voxtral TTS 语音生成模型

    Mistral AI 发布 4B 参数量的语音生成模型 Voxtral TTS,支持 9 种语言的高质量语音合成与低延迟流式传输。该模型具备上下文理解、说话人建模及零样本跨语言语音适应能力,已通过 API、Mistral Studio 和 Hugging Face 开放。

    推薦理由:原文公布了架构细节和零样本跨语言能力,读者可以据此评估它在实时语音工作流中的表现。

2月5日週四
7月17日週四
  1. Mistral AI63

    Mistral AI 为 Le Chat 推出深度研究、语音模式、Magistral 思考模式与项目管理等新功能

    Mistral AI 为旗下 Le Chat 推出了一系列新功能,包括支持快速生成结构化报告的 Deep Research 预览模式、基于 Voxtral 模型的语音模式、由 Magistral 驱动的的多语言思考模式、用于组织对话的 Projects 功能,以及与 Black Forest Labs 合作推出的高级图像编辑功能。用户现可通过网页端或移动端应用体验上述功能。

    推薦理由:原文集中发布了多模态助手的一系列新功能,读者可以据此评估其在深度研究和多模态交互方面的能力扩展。

7月15日週二
  1. Mistral AI86

    Mistral AI 发布开源语音理解模型 Voxtral

    Mistral AI 发布了开源语音理解模型 Voxtral,包含面向生产的 24B 规格与面向端侧的 3B 规格,均采用 Apache 2.0 协议开源。该系列模型支持 32k 上下文、长达 30 至 40 分钟的音频处理、内置问答与摘要、多语言处理及函数调用功能,并在多项语音转写和理解基准测试中表现优异。

    推薦理由:该模型提供了两种尺寸并开源,读者可以根据自身算力条件选择合适的版本进行本地部署或调用 API。