JEPA 系列论文
I-JEPA
Paper:Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture
TLDR:如何不依赖人为设计的数据增强,也能从图像中学到适合分类、迁移及局部视觉任务的高语义表征。它认为对像素进行遮挡重建容易迫使模型关注纹理等低层细节,而跨视图对齐又引入了增强策略的强先验;因此改为从可见上下文直接预测被遮挡区域的特征表示,而非预测像素。
I-JEPA 将输入图像切分为 patch,并随机保留较大范围的 context patches 送入在线 ViT 编码器,得到可见区域的语义特征;同时用一个参数由在线编码器经指数滑动平均(EMA)更新的 target encoder 对完整图像编码,将其中多个被遮挡 target block 的 patch 特征作为训练目标。随后,一个带目标块位置编码的轻量 ViT predictor 根据 context 特征,分别预测各 target block 的表示,训练时最小化预测表示与 target encoder 表示之间的 L2 距离;因此模型学习的不是补全像素,而是从上下文推断缺失区域的高层语义与空间结构。
V-JEPA
Paper:Revisiting Feature Prediction for Learning Visual Representations from Video
与 I-JEPA 类似,只不过换成了 Video。
V-JEPA 2
Paper:V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning
进行了更大规模的预训练,然后加入了 action。
JEPA 系列论文
https://d4wnnn.github.io/2026/09/02/Notion/JEPA 系列论文/