专栏名称: arXiv每日学术速递
跟踪计算机视觉、人工智能、机器学习、NLP、语音识别、量化金融等热门方向学术信息
今天看啥  ›  专栏  ›  arXiv每日学术速递

超分辨图像无限生成!清华甩出Inf-DiT:Diffusion Transformer 任意分辨率上采样

arXiv每日学术速递  · 公众号  ·  · 2024-06-04 13:37
    

文章预览

作者丨科技猛兽 编辑丨极市平台 极市   综合实验表明,Inf-DiT 在生成超高分辨率图像方面取得了 SOTA 性能。与常用的 UNet 结构相比,Inf-DiT 在生成 4096×4096 图像时可以节省超过5倍显存。 本文目录 1 Inf-DiT:Diffusion Transformer 任意分辨率上采样 (来自清华大学,唐杰团队) 1 Inf-DiT 论文解读 1.1 超高分辨率图像生成问题的挑战:GPU 显存需求 1.2 单向块注意力机制 1.3 O(N) 显存消耗的推理过程 1.4 Inf-DiT 架构 1.5 全局和局部一致性 1.6 实验结果 太长不看版 扩散模型在图像生成方面表现出了很显著的性能。然而对于生成超高分辨率的图像 (比如 4096 ×4096) 而言,由于其 Memory 也会二次方增加,因此生成的图像的分辨率通常限制在 1024×1024。在这项工作中。作者提出了一种单向块注意力机制,可以在推理过程中自适应地调整显存开销并处理全局依赖关系。在这个模块 ………………………………

原文地址:访问原文地址
快照地址: 访问文章快照
总结与预览地址:访问总结与预览