跳到正文
Hacker News (官方 RSS)·· 3 天前精選AI 評分81

無 VAE 的文本到影像模型:Pyramid‑JiT 方法

Training Text-to-Image Models Without a VAE

AI 導讀

Pyramid‑JiT 是一種無 VAE 的畫素空間文本到影像模型,透過多解析度預測顯著縮減訓練樣本與 GPU 時間。

  • 訓練樣本:比 Linum v2 少 11.3 倍,僅 138M。
推薦理由

本文提出無 VAE 的畫素空間模型,透過 Pyramid‑JiT 大幅縮減訓練樣本與 GPU 時間,逼近實際影像分佈指標,為未來影片生成提供可擴充套件方法。

來源:Hacker News (官方 RSS) · linum.ai