跳到正文

#影像生成

RSS
今日 0 則
9月30日週三
  1. AWS Machine Learning Blog47

    如何在 SageMaker AI 上使用 vLLM-Omni 生成影像和影片(第二部分)

    本文介紹瞭如何在 Amazon SageMaker AI 上使用 vLLM-Omni Deep Learning Container 部署 FLUX.2-klein-4B 即時影像生成端點與 Wan2.1-VACE-1.3B 非同步影片生成端點。工作流通過傳送文本提示詞生成靜態影像,隨後將其作為條件輸入並結合運動提示詞傳輸至影片端點,最終從 Amazon S3 獲取生成的 MP4 影片。

  2. Google Research60

    Google Research 推出 Diffusion Controller:統一併簡化 AI 影像生成的連續控制框架

    Google Research 推出了 Diffusion Controller 框架,將擴散模型的去噪過程重構為連續控制問題,用輕量級附加網路實現了對影像生成軌跡的平滑動態調整。實驗表明,其輕量級灰盒版本在匹配人類偏好的指標上表現優異,而白盒微調版本則取得了更高的勝率。

    推薦理由:原文介紹了將影像生成去噪過程建模為連續控制問題的框架,並展示了其在灰盒和白盒環境下的效能表現,讀者可以據此瞭解如何兼顧生成畫質與對齊控制。

9月8日週二
  1. OpenAI News61

    推出 ChatGPT Images 2.5 影像生成功能

    ChatGPT Images 2.5 讓使用者將想法、草圖和參考照片轉化為更個性化、精細的影像。該功能支援多種風格和細節調整,顯著提升創作效率和視覺表達質量,並可直接嵌入聊天介面進行即時反饋,幫助設計師快速迭代並獲得更精準的視覺效果。

    推薦理由:ChatGPT Images 2.5 讓使用者能把草圖和參考照片轉化為更個性化、精細的影像,支援多種風格和細節調整,顯著提升創作效率和視覺表達質量,並可直接嵌入聊天介面進行即時反饋,幫助設計師快速迭代並獲得更精準的視覺效果。

7月16日週四
  1. Google Research62

    揭示擴散模型創造力的奧秘

    Google Research 通過數學分析解釋了擴散模型的創造力來源,指出正則化導致的分數平滑使模型在去噪過程中產生插值,從而生成新穎影像。文章以一維示例說明分數平滑如何軟化梯度,並通過實驗驗證權重衰減對其影響;在多維情形下,分數平滑幫助模型在資料流形上平衡質量與新穎性。作者已公開實驗程式碼。

    推薦理由:本文闡釋擴散模型創造力來源,揭示正則化導致的分數平滑如何產生新穎影像,並指出可通過調節正則化實現更具創造性的生成。

7月6日週一
  1. Hugging Face Blog47

    PRX 第 4 部分:資料策略

    PRX 團隊公開了 7B 模型的預訓練資料策略,詳細闡述了結合公共與內部資料集、利用 VLM 重新加長文本標註以及通過 Mosaic Streaming(MDS)和 Lance 格式進行分散式訓練的完整資料流水線。該團隊放棄了預計算文本潛變數,轉而在訓練迴圈中動態執行 Qwen3-VL 文本編碼器,僅帶來約 3-4% 的吞吐量成本。

4月23日週四
  1. Google Research62

    Google 推出基於三維場景理解與生成式 AI 的照片視角重構功能

    Google 宣佈在 Google Photos 的 Auto frame 功能中推出全新的照片視角重構方案,利用機器學習模型理解場景空間佈局並藉助生成式 AI 從新視角生成影像。該方法分為三維場景與相機估計、生成式補全與修飾兩個階段,通過估計三維點 map 並調整相機內外參來修復廣角畸變和調整構圖。

    推薦理由:Google Research 公佈了一種將照片解釋為三維場景並自動調整相機視角與焦距的新方法,通過結合三維點圖估計與生成式擴散模型,在 Google Photos 的 Auto frame 功能中實現了拍照後的視角重構與畸變修正。

7月17日週四
  1. Mistral AI63

    Mistral AI 為 Le Chat 推出深度研究、語音模式、Magistral 思考模式與專案管理等新功能

    Mistral AI 為旗下 Le Chat 推出了一系列新功能,包括支援快速生成結構化報告的 Deep Research 預覽模式、基於 Voxtral 模型的語音模式、由 Magistral 驅動的的多語言思考模式、用於組織對話的 Projects 功能,以及與 Black Forest Labs 合作推出的高階影像編輯功能。使用者現可通過網頁端或移動端應用體驗上述功能。

    推薦理由:原文集中釋出了多模態助手的一系列新功能,讀者可以據此評估其在深度研究和多模態互動方面的能力擴充套件。