MotionCraft
MotionCraft: Physics-based Zero-Shot Video Generation阅读笔记
motivation
发现对于视频中的任意两帧,其在像素空间中估算的光流,与在 Stable Diffusion(SD)相应噪声潜空间中估算的光流具有强相关性。
在MSU Video Frame Interpolation Benchmark数据集上进行实验,对原始图像与加了400步噪声的潜变量上的光流计算了余弦相似度,得到0.727,证明二者有着强相关性。

整体框架

- 使用自回归方式,利用第一帧
和 生成当前帧 - 先利用VAE编码至隐空间,并利用DDIM分别加噪至
得到 - 分别在
上应用光流扭曲算子 (根据不同的物理现象分类使用不同的库)得到 - 对
进行反向去噪得到第 帧图像
整体伪代码如下:

创新模块1:Multiple Cross-Frame Attention(MCFA)
- 由跨帧注意力发展而来。
- 通过改变自注意模块的Key、Value,允许当前帧生成时还关注到第一帧和上一帧的信息。
- 消融实验表明,只关注第一帧会使得视频缺少运动信息;只关注上一帧会降低视频颜色的连贯性。
创新模块2:Spatial Noise Map Weighting(Spatial- )
- 逐像素的选择是用DDIM还是DDPM策略。在需要保持连贯性的地方使用DDIM,在需要创新性(如新物体进入视频区域)的地方使用DDPM。
其它
这里的zero-shot侧重于:
- 既不训练也不微调I2V扩散模型的任何组件
- 也没有使用参考视频作为指导或者利用光流估计器来计算运动轨迹
本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 由本自性清净故,令诸爱染悉无垢!
