@tianshuihanyun关于AI生图技术的一些想法 中发帖

最近一直在琢磨AI生图这块的发展,也是因为我本来是学设计的,了解了一下AI生图,发现技术路线的演变比想象中有意思得多,想跟大家聊聊。 
现在主流的是扩散模型,像Stable Diffusion、DALL-E、FLUX这些都算吧,它们的思路是从随机噪声开始,一步步去噪,最后生成出图像,效果确实很好,生成的图像质量高、细节丰富,也是目前视觉生成领域的主流 
但有一个问题我一直觉得别扭,扩散模型对所有样本一视同仁,不管画面简单还是复杂,都走同样的迭代步数.打个比方,画一个圆和画一幅清明上河图耗时差不多,这个逻辑本身就有点怪.而且它生成速度慢,即便优化过的采样器也要2050步 
扩散模型之外,我很看好的自回归模型是另一条重要的技术路线.最早可以追溯到PixelCNN、VQ-VAE这些,思路差不多是把图像拆成一个个词(像素或图像块),然后逐个预测下一个.过去大家普遍觉得自回归生成质量不如扩散,但现...
 
 
Back to Top