开云kaiyun登录入口登录APP下载(中国)官方网站

开云登录入口登录APP下载(中国)官方网站但其检修过程需要在压缩率和重建质料之间得回精妙均衡-开云kaiyun登录入口登录APP下载(中国)官方网站

发布日期:2026-09-23 00:20    点击次数:141

开云登录入口登录APP下载(中国)官方网站但其检修过程需要在压缩率和重建质料之间得回精妙均衡-开云kaiyun登录入口登录APP下载(中国)官方网站

连年来,基于扩散模子的图像生成时代发展迅猛,催生了 Stable Diffusion、Midjourney 等一系列巨大的文生图应用。联系词,现时主流的检修范式多数依赖一个中枢组件——变分自编码器(VAE),这也带来了始终以来困扰有计划者们的几个问题:

检建造杂性:VAE 旨在将高维图像压缩至低维隐空间,并能从中重建图像。但其检修过程需要在压缩率和重建质料之间得回精妙均衡,自己就极具挑战。

崇高的微调老本:当需要在新的界限(域外数据集)上微调生成模子时,若是预检修的 VAE 在该界限弘扬欠安,则必须连同生成模子全部微调,这无疑会权臣增多检修老本和劝诱周期。

为了从根蒂上处分 VAE 带来的诸多功令,EPG 中提议通过自监督预检修(SSL Pre-training)与端到端微调(End-to-End Fine-tuning)相聚集的模式,透彻去除了生成模子对 VAE 的依赖。

其中枢上风在于:

检修遵循与生成成果双重打破:在 ImageNet-256 和 512 数据集上,EPG 在检修遵循远超基于 VAE 的主流模子 DiT/SiT 的同期,只是通过 75 次模子前向猜度就得回了更优的生成质料,FID 分袂达到了 2.04 和 2.35。

初次杀青像素空间的一致性模子检修:在不依赖 VAE 及预检修的扩散模子权重的前提下,EPG 初次得胜在像素空间中端到端地检修了一致性模子(Consistency Model),在 ImageNet-256 上仅需单步即可得回 8.82 的 FID。

△在 8xH200 上测得的检修支出。*: 基于官方代码预估检修步调:"像检修图像分类器同样检修生成模子"

EPG 的中枢念念想鉴戒了猜度机视觉界限经典的"预检修 - 微调"范式,将复杂的生成任务解耦为两个更易于处理的阶段。

第一阶段:自监督预检修 ( SSL Pre-training ) —— 解耦表征学习与像素重建

EPG 的中枢瞻念察在于,生成模子本体上需要从带噪图像中学习高质料的视觉表征。受此启发,EPG 立他乡将学习表征与重建像素解耦为两个零丁的学习阶段。

在第一阶段,模子仅需运用自监督表征学习算法,从带噪图像中提真金不怕火高质料的视觉特征。这一阶段只检修模子的前半部分积蓄——编码器(Encoder)。联系词,现存表征学习步调难以奏凯应用于噪声图像,尤其当噪声十足隐敝图像内容时。

为处分此问题,EPG 提议了一种精真金不怕火而高效的处分决议:让模子在干净图像上学习"圭臬"表征,再通过一致性亏空将该表征对皆(传递)给带噪图像的表征。具体地,文中中式 ODE 采样旅途上的相邻两点四肢带噪图像对,以保证每个带噪版块都能学习到独一的、与干净图像对皆的表征。

此阶段的预检修亏空函数包含两部分:

a. 对比亏空 ( Contrastive Loss ) :从干净图像中学习高质料的运转表征。 b. 表征一致性亏空 ( Representation Consistency Loss ) :将带噪图像的表征与干净图像的表征对皆。

△检修步调总览。

(左图)预检修步调。c 是一个可学习表征,t0, tn, tn-1 为时刻步条款,y1,y2 为每一次检修所采样图片 x0 进行数据增强后的图像,xtn, x_tn-1 为 ODE 采样旅途上时序上相邻的两点。θ 是积蓄参数,θ ^- 是 theta 的 EMA 版块,sg 示意 stop gradient 操作。(右图)端到端微调步调。预检修停止后,仅使用 E θ  加立地运振荡的解码器 D_ θ 进行端到端微调。

第二阶段:端到端微调 ( End-to-End Fine-tuning ) —— 无缝相连卑劣生成任务

预检修阶段完成后,EPG 的微调过程相配奏凯:将预检修好的编码器(E θ)与一个立地运振荡的解码器(D θ)拼接,然后奏凯使用扩散模子或一致性模子的亏空函数进行端到端微调。

EPG 的检修框架与经典的图像分类任务框架高度相似,这极地面简化了生成模子的检修经过,缩短了劝诱和应用卑劣生成任务的门槛。

实际

EPG 在 ImageNet-256 和 ImageNet-512 两大圭臬数据集上考据了其有用性。

将去噪检修四肢微调指标(扩散模子)的生成成果:

将一致性检修四肢微调指标(单步生成)的生成成果:

检修遵循与生成质料:

实考据明,EPG 框架不仅十足弥补了以往像素空间检修与隐空间检修在遵循和成果上的差距,更在同等猜度资源下杀青了特等。这为改日在更高分辨率、更大数据集上的检修,乃至视频生成等界限,提供了极具参考价值的处分决议。

推感性能:

基于 EPG 检修的扩散模子,在推理时仅需 75 次模子前向猜度即可达到最优成果,步数远低于其他步调。此外,EPG 的主干积蓄领受 Vision Transformer(ViT)且 Patch Size 为 16x16,在 256x256 图像上的单张生成速率可失色 DiT;在 512x512 图像上(使用 32x32 的 Patch Size),其生成速率照旧能和在 256x256 的速率保抓一致,展现了优异的可膨大性。

回来

EPG 框架的提议,为像素空间生成模子的检修提供了一条精真金不怕火、高效且不依赖 VAE 的全新旅途。

通过"自监督预检修 + 端到端微调"的两阶段政策,EPG 得胜地将复杂的生成任务剖判为指表明确的表征学习和像素重建两个身手。这不仅使其在检修遵循和最终身成质料(FID 低至 2.04)上全面特等了依赖 VAE 的 DiT 等主流模子,更垂危的是,EPG 初次在十足不依赖任何外部预检修模子(如 VAE 或 DINO)的情况下,杀青了像素空间内一致性模子的端到端检修,得回了单步生成 8.82 FID 的优异获利。

这项责任不仅为图像生成界限带来了性能与遵循的双重进步,也为视频生成、多模态协调模子等前沿标的提供了极具后劲的基础框架。EPG 所代表的"去 VAE 化"、端到端的检修范式,将进一步鼓舞生成式 AI 的探索与应用,缩短劝诱门槛,引发更多立异。

论文联结:

https://arxiv.org/pdf/2510.12586

代码仓库联结:

https://github.com/AMAP-ML/EPG

一键三连「点赞」「转发」「留神心」

接待在驳斥区留住你的见地!

—  完  —

咱们正在招聘又名眼疾手快、心思 AI 的学术裁剪实习生  � �

感深嗜深嗜的小伙伴接待心思 � �  了解笃定

� � 点亮星标 � �

科技前沿进展逐日见开云登录入口登录APP下载(中国)官方网站