跳到正文

图像生成

AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。

5條精選相關主題AI 视频多模态产品更新

最新精選

第 1–5 條 · 共 5 條
9月30日週三
  1. Google Research60

    Google Research 推出 Diffusion Controller:统一并简化 AI 图像生成的连续控制框架

    Google Research 推出了 Diffusion Controller 框架,将扩散模型的去噪过程重构为连续控制问题,用轻量级附加网络实现了对图像生成轨迹的平滑动态调整。实验表明,其轻量级灰盒版本在匹配人类偏好的指标上表现优异,而白盒微调版本则取得了更高的胜率。

    推薦理由:原文介绍了将图像生成去噪过程建模为连续控制问题的框架,并展示了其在灰盒和白盒环境下的性能表现,读者可以据此了解如何兼顾生成画质与对齐控制。

9月8日週二
  1. OpenAI News61

    推出 ChatGPT Images 2.5 图像生成功能

    ChatGPT Images 2.5 让用户将想法、草图和参考照片转化为更个性化、精细的图像。该功能支持多种风格和细节调整,显著提升创作效率和视觉表达质量,并可直接嵌入聊天界面进行即时反馈,帮助设计师快速迭代并获得更精准的视觉效果。

    推薦理由:ChatGPT Images 2.5 让用户能把草图和参考照片转化为更个性化、精细的图像,支持多种风格和细节调整,显著提升创作效率和视觉表达质量,并可直接嵌入聊天界面进行即时反馈,帮助设计师快速迭代并获得更精准的视觉效果。

7月16日週四
  1. Google Research62

    揭示扩散模型创造力的奥秘

    Google Research 通过数学分析解释了扩散模型的创造力来源,指出正则化导致的分数平滑使模型在去噪过程中产生插值,从而生成新颖图像。文章以一维示例说明分数平滑如何软化梯度,并通过实验验证权重衰减对其影响;在多维情形下,分数平滑帮助模型在数据流形上平衡质量与新颖性。作者已公开实验代码。

    推薦理由:本文阐释扩散模型创造力来源,揭示正则化导致的分数平滑如何产生新颖图像,并指出可通过调节正则化实现更具创造性的生成。

4月23日週四
  1. Google Research62

    Google 推出基于三维场景理解与生成式 AI 的照片视角重构功能

    Google 宣布在 Google Photos 的 Auto frame 功能中推出全新的照片视角重构方案,利用机器学习模型理解场景空间布局并借助生成式 AI 从新视角生成图像。该方法分为三维场景与相机估计、生成式补全与修饰两个阶段,通过估计三维点 map 并调整相机内外参来修复广角畸变和调整构图。

    推薦理由:Google Research 公布了一种将照片解释为三维场景并自动调整相机视角与焦距的新方法,通过结合三维点图估计与生成式扩散模型,在 Google Photos 的 Auto frame 功能中实现了拍照后的视角重构与畸变修正。

7月17日週四
  1. Mistral AI63

    Mistral AI 为 Le Chat 推出深度研究、语音模式、Magistral 思考模式与项目管理等新功能

    Mistral AI 为旗下 Le Chat 推出了一系列新功能,包括支持快速生成结构化报告的 Deep Research 预览模式、基于 Voxtral 模型的语音模式、由 Magistral 驱动的的多语言思考模式、用于组织对话的 Projects 功能,以及与 Black Forest Labs 合作推出的高级图像编辑功能。用户现可通过网页端或移动端应用体验上述功能。

    推薦理由:原文集中发布了多模态助手的一系列新功能,读者可以据此评估其在深度研究和多模态交互方面的能力扩展。