AI 語音初創公司 ElevenLabs 估值翻倍至 220 億美元
語音 AI 初創公司 ElevenLabs 通過新一輪 3.08 億美元的要約收購將估值推高至 220 億美元,較 2 月融資時的 110 億美元實現翻倍。此次由 Wellington 和 T. Rowe Price 共同領投的交易允許員工兌現部分已歸屬股權,旨在作為留才工具防止員工流失。這是該公司成立四年以來第二次授權員工進行二級市場交易。
語音 AI 初創公司 ElevenLabs 通過新一輪 3.08 億美元的要約收購將估值推高至 220 億美元,較 2 月融資時的 110 億美元實現翻倍。此次由 Wellington 和 T. Rowe Price 共同領投的交易允許員工兌現部分已歸屬股權,旨在作為留才工具防止員工流失。這是該公司成立四年以來第二次授權員工進行二級市場交易。
Hugging Face 推出了 Open TTS Leaderboard,旨在通過可擴充套件的客觀指標(如 WER、CER、推理速度和說話人相似度)來評估多語言語音合成與聲音克隆模型。該排行榜提供多語言評測、支援聲音克隆對比、內建音訊試聽與投票功能,並針對 GPU 和 CPU 環境對流式效能(TTFA)進行了基準測試。
本文介紹瞭如何在 Amazon SageMaker AI 上使用 AWS vLLM-Omni 深度學習容器部署 Qwen3-TTS 模型,並通過雙向 WebSocket 連線實現文本輸入與流式語音輸出。文章給出了完整的程式碼示例、例項池配置方法以及 Gradio 客戶端的部署與測試步驟。
阿里雲千問團隊開發的 Qwen3-TTS-12Hz-1.7B-Base 語音模型現已上線 Amazon SageMaker JumpStart,支援通過託管的即時推理端點實現語音克隆與流式生成。該模型僅需數秒的使用者音訊片段與文本,即可在保持說話人聲音特徵的同時跨語言合成目標語音,並允許使用者在 AWS 環境中控制成本與資料安全。
Google 釋出了 Gemini 3.8 TTS 的兩個新模型 gemini-3.8-flash-tts 與 gemini-3.8-flash-lite-tts,支援 2,000+ 語音並可通過 30 秒樣本建立自定義聲音。Gemini 3.8 TTS Playground 允許使用者在瀏覽器中構建單聲道或多說話人對話,生成 1m18s 音訊僅需約 20 秒,成本 2.74 美分。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 兩款全新語音生成模型,支援超過 100 種語言的自然語言提示詞聲音設計、30 秒聲音復刻以及逐行臺詞精細導演。
推薦理由:官方釋出的最新語音生成模型提供了細粒度的臺詞導演和聲音定製能力,讀者可以據此評估其在多語言配音與智慧體互動中的實際表現。
Google DeepMind 推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款先進的即時對話模型,帶來並行推理與近即時語音互動升級。
推薦理由:Google DeepMind 推出了 Gemini 3.8 Live 與 3.8 Live Extended Thinking,通過並行推理與近即時語音互動能力在多項語音基準測試中表現突出,讀者可藉此評估其在複雜語音智慧體開發和企業級工作流中的應用潛力。
OpenAI 在 API 中推出 GPT-Live-1,支援同時聆聽與說話的全雙工語音互動,並可將深度推理與工具呼叫委託給後端模型。該模型在 API 中的定價為每分鐘 0.05 美元,具備平滑的中斷處理、語氣與風格控制以及電話網路支援等特性。
Open ASR Leaderboard 近日新增首個全球南方語言評測集,包含 Hindi 與 Indian English 兩個 Monsoon 資料集,公開與私有四個 speaker‑disjoint split,覆蓋 4,888 名說話人並記錄 12 個屬性。
Google DeepMind 推出 Gemini 3.5 Transcribe,這是其迄今最精準的語音轉文本模型,支援即時流式傳輸與預錄音頻處理,字錯誤率在流式傳輸和非流式場景下分別達到 4.0% 和 2.6%。該模型支援超過 85 種語言的自動檢測與轉錄,具備智慧糾錯、自定義詞彙識別及多說話人識別等功能,目前已在 Google AI Studio 等平臺面向開發者開放公測。
推薦理由:官方推出的最新語音轉文本模型給出了具體的錯誤率和多語言支援資料,讀者可以據此評估其實際語音互動效能。
Hugging Face 最新研究引入了三項測試,用於量化語音識別模型中的基準測試最佳化(benchmaxxing)現象,評估了 11 個開源 ASR 模型後發現部分高分系統會復現基準測試中的錯誤轉錄、填補被靜音的數字並根據資料集調整拼寫習慣。
推薦理由:研究指出語音識別模型會利用音訊中的線索復現公開測試集的錯誤和拼寫習慣,這有助於理解如何通過獨立測試集評估模型真實效能。
NVIDIA 釋出了 Magpie TTS 多語種文本轉語音模型,支援12種語言,並提供開放權重與本地部署能力。該模型在單流 GPU 上可實現 32–79 ms 的首音延遲,64 併發流下可達 239 ms,吞吐率高達 320× 即時。
推薦理由:開放權重與低延遲讓企業可在本地部署多語種語音代理,支援12種語言並提供高質量音訊,幫助企業實現低延遲、可定製的多語種語音代理。
Hugging Face 釋出了 Real World VoiceEQ,一個評估語音 AI 人類質量的基準,涵蓋 60 多項指標,覆蓋 40 多個模型。該基準基於 100 萬條人類評分,評估 15+ 維度的 ASR、TTS、S2S 和 Speech Understanding,幫助開發者識別情感、背景噪聲等細粒度缺陷。
推薦理由:Real World VoiceEQ 提供了超過 60 項指標的真實人類評估,幫助開發者識別模型在情感、背景噪聲等方面的細粒度缺陷。
Hugging Face 與 Cerebras 聯合推出將開源語音 AI 架構與高速推理相結合的即時語音方案,實現自然的語音到語音互動。該開源級聯語音堆疊由 Nvidia Parakeet 進行語音識別、Cerebras 執行 Google DeepMind 的 Gemma 4 31B 模型進行推理、以及 Alibaba 的 Qwen3TTS 生成語音,並已應用於 Reachy Mini 機器人。
推薦理由:原文展示了開源語音流水線如何結合硬體推理速度,讀者可以評估這種架構在低延遲互動中的表現。
Gemini 3.5 Live Translate 是 Google DeepMind 推出的最新音訊模型,支援 70+ 語言的即時語音對語音翻譯。該模型可持續流式處理,幾秒延遲,自動檢測語言並保持語調、節奏與音高。
推薦理由:Gemini 3.5 Live Translate 提供 70+ 語言的即時語音翻譯,減少停頓,適用於會議、通話等場景,幫助開發者快速構建多語言翻譯應用。支援多語言輸入,無需手動配置,噪聲魯棒性強,適合嘈雜環境。
Google DeepMind 推出了 Gemini 3.1 Flash TTS,提升了可控性、表達力和音質,支援 70+ 語言和多說話人對話,並通過細粒度音訊標籤讓開發者可用自然語言控制語音風格。該模型在人工分析 TTS 評測中獲得 1,211 Elo 分,並已在 Gemini API、Vertex AI 及 Google AI Studio 預覽。
推薦理由:Gemini 3.1 Flash TTS 通過細粒度音訊標籤提升可控性與表達力,支援 70+ 語言,支援多說話人對話,適合企業與開發者構建多語種語音應用,且在人工分析 TTS 評測中獲得 1,211 Elo 分。
Mistral AI 釋出 4B 引數量的語音生成模型 Voxtral TTS,支援 9 種語言的高質量語音合成與低延遲流式傳輸。該模型具備上下文理解、說話人建模及零樣本跨語言語音適應能力,已通過 API、Mistral Studio 和 Hugging Face 開放。
推薦理由:原文公佈了架構細節和零樣本跨語言能力,讀者可以據此評估它在即時語音工作流中的表現。
Mistral AI 釋出了 Voxtral Transcribe 2 語音模型系列,包含用於批次轉寫的 Voxtral Mini Transcribe V2 和用於即時應用的 Voxtral Realtime。
推薦理由:Mistral 釋出了 Voxtral Transcribe 2 語音模型系列,並開源了 Voxtral Realtime 權重,讀者可以據此瞭解其在即時性與多語言轉寫上的新進展。
Mistral AI 為旗下 Le Chat 推出了一系列新功能,包括支援快速生成結構化報告的 Deep Research 預覽模式、基於 Voxtral 模型的語音模式、由 Magistral 驅動的的多語言思考模式、用於組織對話的 Projects 功能,以及與 Black Forest Labs 合作推出的高階影像編輯功能。使用者現可通過網頁端或移動端應用體驗上述功能。
推薦理由:原文集中釋出了多模態助手的一系列新功能,讀者可以據此評估其在深度研究和多模態互動方面的能力擴充套件。
Mistral AI 釋出了開源語音理解模型 Voxtral,包含面向生產的 24B 規格與面向端側的 3B 規格,均採用 Apache 2.0 協議開源。該系列模型支援 32k 上下文、長達 30 至 40 分鐘的音訊處理、內建問答與摘要、多語言處理及函式呼叫功能,並在多項語音轉寫和理解基準測試中表現優異。
推薦理由:該模型提供了兩種尺寸並開源,讀者可以根據自身算力條件選擇合適的版本進行本地部署或呼叫 API。