MotionCraft: Physics-based Zero-Shot Video Generation阅读笔记

motivation

  • 发现对于视频中的任意两帧,其在像素空间中估算的光流,与在 Stable Diffusion(SD)相应噪声潜空间中估算的光流具有强相关性。

  • 在MSU Video Frame Interpolation Benchmark数据集上进行实验,对原始图像与加了400步噪声的潜变量上的光流计算了余弦相似度,得到0.727,证明二者有着强相关性。

    屏幕截图2025-06-06145925.png

整体框架

屏幕截图2025-06-06151443.png

  • 使用自回归方式,利用第一帧生成当前帧
  • 先利用VAE编码至隐空间,并利用DDIM分别加噪至得到
  • 分别在上应用光流扭曲算子(根据不同的物理现象分类使用不同的库)得到
  • 进行反向去噪得到第帧图像

整体伪代码如下:

屏幕截图2025-06-06153833.png

创新模块1:Multiple Cross-Frame Attention(MCFA)

  • 由跨帧注意力发展而来。
  • 通过改变自注意模块的Key、Value,允许当前帧生成时还关注到第一帧和上一帧的信息。
  • 消融实验表明,只关注第一帧会使得视频缺少运动信息;只关注上一帧会降低视频颜色的连贯性。

创新模块2:Spatial Noise Map Weighting(Spatial-

  • 逐像素的选择是用DDIM还是DDPM策略。在需要保持连贯性的地方使用DDIM,在需要创新性(如新物体进入视频区域)的地方使用DDPM。

其它

这里的zero-shot侧重于:

  • 既不训练也不微调I2V扩散模型的任何组件
  • 也没有使用参考视频作为指导或者利用光流估计器来计算运动轨迹