780 字
4 分钟
生成式视觉预训练

定义#

生成式视觉预训练(Generative Vision Pretraining) 指在大规模图像生成任务上预训练模型,使其学到通用视觉表示,然后通过 instruction-tuning 将这些表示对齐到下游视觉理解任务。与传统的判别式预训练(对比学习、自编码等)不同,生成式预训练以「创造」视觉内容为目标,训练中学到的表示也可用于视觉理解。

为什么重要#

从图像生成到视觉理解#

常见的视觉表示学习方法包括:

  • 监督判别学习(ImageNet 分类)
  • 对比学习(CLIP、MoCo、SimCLR)
  • 自举法(DINO、BYOL)
  • 自编码(MAE、BEiT)

生成式预训练长期以来效果落后于判别式方法。但 Vision Banana 的结果表明这一格局正在改变。

与 LLM 范式的类比#

阶段LLM 范式视觉生成范式
预训练文本生成(GPT)图像生成(Nano Banana Pro 等)
涌现能力语言理解、推理视觉理解、几何推理
对齐Instruction-tuning视觉 instruction-tuning
统一接口文本生成RGB 图像生成

核心优势#

  1. 统一接口:所有视觉任务输出编码为 RGB 图像,自然语言提示指定任务,不需要任务专用架构
  2. 处理多解歧义:生成模型学习数据分布,不需要判别模型的定制损失来避免模糊均值
  3. 世界知识:大规模生成预训练带来的物体尺度、空间关系的先验知识,超越窄域专家
  4. 能力保持:instruction-tuning 不牺牲基座模型的生成能力

实现方式#

RGB 作为通用输出空间#

任务RGB 编码方式
语义分割类别→纯色映射(开放词汇)
实例分割每实例自动分配不同颜色 + 多阶段聚类解析
度量深度Power transform 非线性变换 + RGB 立方体边缘双射
表面法线方向向量直接映射 RGB 通道

Instruction-Tuning 要点#

  • 在原始训练数据中混入少量视觉任务数据
  • 严格零样本迁移:不使用任何 benchmark 训练集
  • 不需要任务专用损失或架构修改

与相关概念对比#

预训练范式代表方法学习什么局限
监督判别ViT, ResNet类别判别需要标注,泛化受限
对比学习CLIP, SigLIP图文对齐依赖文本监督
自编码MAE, BEiT重建掩码重建损失≠理解
生成式预训练NBP→Vision Banana生成完整图像计算开销大

潜在应用#

  • 通用视觉基座模型:一个模型同时做分割、深度、法线、生成、编辑
  • 机器人与自动驾驶:深度估计不需要相机内参,纯视觉推断绝对尺度
  • AGI-V:生成式视觉预训练可能是通向视觉 AGI 的路径

开放问题#

  • 视频生成器是否包含更丰富的时空理解表示?
  • 如何降低推理计算开销?
  • 更多任务的 instruction-tuning 是否会涌现跨任务泛化(类似 LLM 的涌现能力)?
  • 与 LLM 的深度融合如何实现跨模态推理?
生成式视觉预训练
https://blog.lpkt.cn/posts/concepts/generative-vision-pretraining/
作者
lollipopkit
发布于
2026-06-10
许可协议
CC BY-NC-SA 4.0