FlowMimic

Paper:FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry

视频编辑训练数据的收集极其昂贵——目前主流做法依赖物体掩码标注、I2V 模型合成、VLM 质量过滤等繁琐流程,导致视频编辑任务的多样性远低于图像编辑。

于是论文提出像素对时序扭曲流场(pixel-pair temporal warped flow field),可以从已有的图像编辑样本实时在线生成视频编辑训练样本,无需任何专门收集的视频编辑数据。

image.png

简单来说,就是有两张处理前后的图,然后进行同样的扭曲操作,构造伪视频。

损失有三种:

  • Flow Matching Loss
  • Mimic Loss
    • 作者发现生成单帧的时候,质量很低。于是想让生成单帧的时候质量也跟视频一样高。
    • 作者取一个视频,然后加噪声,然后取第一帧。视频和图像分别去噪,然后用 KL 散度让两个分布拉近。
  • Sence Loss
    • 为了让模型能够找到需要修改的地方,防止修改其他的地方。
    • 数据集会给一个mask,代表要修改的地方。然后模型会计算mask内区域的误差,作为加强。
    • 然后模型还会计算cross attention 的注意力,让mask内的注意力大于mask外的注意力。
    • 这两个loss一个负责最后的结果,一个负责中间的过程。

FlowMimic
https://d4wnnn.github.io/2026/08/31/Notion/FlowMimic/
作者
D4wn
发布于
2026年8月31日
许可协议