Gemini 3.8 TTS Playground 演示平臺
Google 釋出了 Gemini 3.8 TTS 的兩個新模型 gemini-3.8-flash-tts 與 gemini-3.8-flash-lite-tts,支援 2,000+ 語音並可通過 30 秒樣本建立自定義聲音。Gemini 3.8 TTS Playground 允許使用者在瀏覽器中構建單聲道或多說話人對話,生成 1m18s 音訊僅需約 20 秒,成本 2.74 美分。
Google 釋出了 Gemini 3.8 TTS 的兩個新模型 gemini-3.8-flash-tts 與 gemini-3.8-flash-lite-tts,支援 2,000+ 語音並可通過 30 秒樣本建立自定義聲音。Gemini 3.8 TTS Playground 允許使用者在瀏覽器中構建單聲道或多說話人對話,生成 1m18s 音訊僅需約 20 秒,成本 2.74 美分。
Google DeepMind 推出 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 兩款先進的即時對話模型,帶來並行推理與近即時語音互動升級。
推薦理由:Google DeepMind 推出了 Gemini 3.8 Live 與 3.8 Live Extended Thinking,通過並行推理與近即時語音互動能力在多項語音基準測試中表現突出,讀者可藉此評估其在複雜語音智慧體開發和企業級工作流中的應用潛力。
Google DeepMind 推出 Gemini 3.5 Transcribe,這是其迄今最精準的語音轉文本模型,支援即時流式傳輸與預錄音頻處理,字錯誤率在流式傳輸和非流式場景下分別達到 4.0% 和 2.6%。該模型支援超過 85 種語言的自動檢測與轉錄,具備智慧糾錯、自定義詞彙識別及多說話人識別等功能,目前已在 Google AI Studio 等平臺面向開發者開放公測。
推薦理由:官方推出的最新語音轉文本模型給出了具體的錯誤率和多語言支援資料,讀者可以據此評估其實際語音互動效能。
NVIDIA 釋出了 Magpie TTS 多語種文本轉語音模型,支援12種語言,並提供開放權重與本地部署能力。該模型在單流 GPU 上可實現 32–79 ms 的首音延遲,64 併發流下可達 239 ms,吞吐率高達 320× 即時。
推薦理由:開放權重與低延遲讓企業可在本地部署多語種語音代理,支援12種語言並提供高質量音訊,幫助企業實現低延遲、可定製的多語種語音代理。
Gemini 3.5 Live Translate 是 Google DeepMind 推出的最新音訊模型,支援 70+ 語言的即時語音對語音翻譯。該模型可持續流式處理,幾秒延遲,自動檢測語言並保持語調、節奏與音高。
推薦理由:Gemini 3.5 Live Translate 提供 70+ 語言的即時語音翻譯,減少停頓,適用於會議、通話等場景,幫助開發者快速構建多語言翻譯應用。支援多語言輸入,無需手動配置,噪聲魯棒性強,適合嘈雜環境。
Google DeepMind 推出了 Gemini 3.1 Flash TTS,提升了可控性、表達力和音質,支援 70+ 語言和多說話人對話,並通過細粒度音訊標籤讓開發者可用自然語言控制語音風格。該模型在人工分析 TTS 評測中獲得 1,211 Elo 分,並已在 Gemini API、Vertex AI 及 Google AI Studio 預覽。
推薦理由:Gemini 3.1 Flash TTS 通過細粒度音訊標籤提升可控性與表達力,支援 70+ 語言,支援多說話人對話,適合企業與開發者構建多語種語音應用,且在人工分析 TTS 評測中獲得 1,211 Elo 分。
Mistral AI 釋出了 Voxtral Transcribe 2 語音模型系列,包含用於批次轉寫的 Voxtral Mini Transcribe V2 和用於即時應用的 Voxtral Realtime。
推薦理由:Mistral 釋出了 Voxtral Transcribe 2 語音模型系列,並開源了 Voxtral Realtime 權重,讀者可以據此瞭解其在即時性與多語言轉寫上的新進展。
Mistral AI 釋出了開源語音理解模型 Voxtral,包含面向生產的 24B 規格與面向端側的 3B 規格,均採用 Apache 2.0 協議開源。該系列模型支援 32k 上下文、長達 30 至 40 分鐘的音訊處理、內建問答與摘要、多語言處理及函式呼叫功能,並在多項語音轉寫和理解基準測試中表現優異。
推薦理由:該模型提供了兩種尺寸並開源,讀者可以根據自身算力條件選擇合適的版本進行本地部署或呼叫 API。