Google DeepMind 发布 Gemini Omni 与首款模型 Gemini Omni Flash
Google DeepMind 推出了全新多模态模型 Gemini Omni,并发布了该系列首款模型 Gemini Omni Flash,支持通过图像、音频、视频和文本组合输入生成及编辑视频。该模型已向 Gemini app、Google Flow 以及 YouTube Shorts 用户推出,未来还将通过 API 提供给开发者和企业客户。
Why Recommended: 原文介绍了新模型的具体输入组合和发布范围,读者可以据此评估多模态视频生成与编辑的最新能力边界。