跳转至

02 技术架构与核心方法

最后更新: 2026-04-26 | 技术架构深度解析

本文档对所有主流世界模型架构进行拆解:层数、参数、组件、连接方式、训练数据、复现路径。每个架构附带 Mermaid 结构图 + 关键超参表。


一、JEPA 家族(Joint Embedding Predictive Architecture)

LeCun 主导路线:不在像素空间预测,而在 latent embedding 空间预测。绕开生成式 reconstruction loss 的细节噪声 + 计算成本。共同范式:encoder 提 latent → predictor 学条件 latent → 用稀疏 mask(图像 / tubelet)形成 self-supervised 目标。

1.1 I-JEPA(图像 JEPA,Meta 2023)

论文: arXiv:2301.08243(CVPR 2023) | 代码: github.com/facebookresearch/ijepa

flowchart LR
    img["Image<br/>224×224"]
    enc["Context<br/>Encoder ViT-H"]
    tgtenc["Target Encoder<br/>EMA of Context"]
    pred["Predictor<br/>narrow ViT"]
    loss["L2 latent loss"]

    img --> enc
    img --> tgtenc
    enc --> pred --> loss
    tgtenc --> loss

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class img,enc,tgtenc,pred,loss stage

关键超参数

Backbone ViT-H/14(embed 1280, depth 32)
输入分辨率 224×224
Patch grid 14×14 = 196 patches
Context block 1 个,覆盖 ~85% 图
Target blocks 4 个,每个覆盖 15-20%
Target encoder EMA copy of context(momentum 0.996→1.0)
Predictor 6-layer ViT, embed 384
Loss L2 in latent space
Optimizer AdamW(lr 1e-3, warmup 40 epoch)

训练与复现

  • 数据:ImageNet-22k(14M 图)
  • 训练步:300 epoch ≈ 600 H100·hr
  • 复现:Meta 官方仓,单 V100 8GB 起步可跑 ViT-S
  • 预训练后用 linear probe / fine-tune 评 ImageNet-1K top-1 ≈ 76.5%(ViT-H/14)

1.2 V-JEPA 2(视频 JEPA,Meta 2025.06)

论文: arXiv:2506.09985 | 1.2B 参数 + 动作条件训练

flowchart LR
    vid["Video<br/>64×384²"]
    tubelet["3D Tubelet<br/>Embed t=2,h=16,w=16"]
    enc["Context Enc<br/>ViT-1.2B"]
    tgt["Target Enc<br/>EMA"]
    pred["Predictor<br/>+ action cond"]
    act["Action<br/>(GR-2 etc)"]
    loss["L2 latent"]

    vid --> tubelet --> enc --> pred
    vid --> tgt
    act --> pred
    pred --> loss
    tgt --> loss

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class vid,tubelet,enc,tgt,pred,act,loss stage

V-JEPA → V-JEPA 2 对比

维度 V-JEPA (2024) V-JEPA 2 (2025)
参数 600M 1.2B
输入 16 帧@224² 64 帧@384²(渐进)
动作条件 ✅ AC-Predictor 第二阶段加入
训练时长 90K 迭代 90K → 252K(两阶段)
直觉物理 IntPhys 71.5% 86.3%
下游 robot manipulation 直接做 Goal-Conditioned MPC

训练流程(两阶段)

  • 阶段一(无动作 SSL):90K → 252K 迭代,16 帧@256² → 64 帧@384² 渐进(节省 8.4× GPU 时间)
  • 阶段二(动作条件):冻结 encoder,训练 AC-Predictor,教师强制 + 多步展开损失(T=2)
  • 规划:Goal-Conditioned MPC + CEM 采样,16 秒/动作

1.3 LeWorldModel (LeWM, 2026.03)

论文: arXiv:2603.19312 | LeCun/AMI Labs 首个端到端 JEPA, 15M 参数单 GPU

flowchart LR
    obs["Observation"]
    enc["Encoder<br/>ResNet-18"]
    pred["Latent<br/>Predictor"]
    sigreg["SIGReg<br/>(no collapse)"]
    plan["Planning<br/>(latent MPC)"]

    obs --> enc --> pred --> sigreg
    pred --> plan

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class obs,enc,pred,sigreg,plan stage

SIGReg 核心创新

JEPA 训练老问题是 representation collapse(encoder 学到全 0 / 常数 latent 也能让 predictor loss 为 0)。常规解:EMA target encoder 制造非对称性;VICReg 加方差/协方差正则。

LeWM 提出 SIGReg (Spectral Information Gap Regularizer)

  • 直接约束 latent 的奇异值谱接近均匀分布
  • 不需要 EMA target,不需要预测器对称
  • 单 GPU 15M 参数也能训稳

意义:JEPA 的"小 model 也能 work"路径,Meta 之前都需要 ViT-H/L 大 backbone。


二、Dreamer 家族(Model-Based RL)

Dreamer 路线:在 latent space 学 RSSM 世界模型 + 用 imagination rollout 训 actor-critic。跟 JEPA 区别在于为 RL 设计(有 reward / value head)而非 SSL pretext。

2.1 Dreamer V3 (2023 Nature)

论文: arXiv:2301.04104 | 代码: github.com/danijar/dreamerv3 | 单配置跨 150+ 任务

flowchart LR
    obs["Obs"]
    enc["CNN Enc"]
    rssm["RSSM<br/>h_t = GRU<br/>z_t = Categorical"]
    head["Reward / Value /<br/>Cont / Decoder"]
    actor["Actor"]
    img["Imagination<br/>H=15"]

    obs --> enc --> rssm --> head
    rssm --> img --> actor

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class obs,enc,rssm,head,actor,img stage

模型尺寸选项

尺寸 params RSSM hidden latent dim 适用
XS 8M 256 32×32 玩具任务
S 18M 512 32×32 DMC / Atari
M 37M 768 32×32 DMC Hard / Crafter
L 77M 1024 32×32 Atari-100k 完整
XL 200M 1536 32×32 Minecraft Diamond

关键训练超参(所有任务共享)

Imagination horizon 15
KL balance dyn 0.5, rep 0.1
Reward / value loss symlog two-hot
Actor entropy η=3e-4
Optimizer LaProp
Learning rate 1e-4
Replay ratio 1(DMC)/ 32(Atari)

Symlog 变换

symlog(x) = sign(x) · ln(|x| + 1)
symexp(x) = sign(x) · (exp(|x|) - 1)

# Two-Hot 编码(reward / value 输出离散化):
#   给定目标 v, 找相邻桶 b_k ≤ v ≤ b_{k+1}
#   w_k     = (b_{k+1} - v) / (b_{k+1} - b_k)
#   w_{k+1} = 1 - w_k
#   预测 v̂ = Σ_i p_i · symexp(b_i)

2.2 Dreamer V4 (2025.10)

论文: arXiv:2509.24527 | 2B 参数, 首次大规模预训练 WM, 纯离线解决 Minecraft Diamond

flowchart LR
    vid["Video<br/>+ action"]
    tok["VQ-VAE<br/>tokenize"]
    bct["Block-Causal<br/>Transformer 192L"]
    flow["Flow Matching<br/>decoder"]
    rl["RL via<br/>imagination"]

    vid --> tok --> bct --> flow
    bct --> rl

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class vid,tok,bct,flow,rl stage

V3 → V4 对比

维度 V3 V4
Backbone RSSM (GRU) Block-Causal Transformer 192 层
参数 200M (XL) 2B
Tokenizer CNN encoder VQ-VAE patch token
Decoder MSE reconstruction Flow Matching
Attention GQA (Q=16, KV=4)
训练范式 online RL 纯离线 + RL via imagination
Minecraft Diamond 需 online 纯离线 4-shot
推理速度 50ms/step 13ms/step(H100, ~50× 加速)

2.3 TD-MPC2(2024)

论文: arXiv:2310.16828 | 官网: tdmpc2.com | 无解码器, 潜空间 MPPI 规划

flowchart LR
    s["State"]
    enc["Encoder"]
    z["Latent z"]
    dyn["Dynamics<br/>z_{t+1} = f(z, a)"]
    Q["Q-function"]
    plan["MPPI<br/>plan in z"]

    s --> enc --> z --> dyn
    z --> Q
    dyn --> plan

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class s,enc,z,dyn,Q,plan stage

特色:

  • 无解码器 —— 不需要重建观察,pure latent dynamics
  • 潜空间用 MPPI (Model Predictive Path Integral) 采样规划
  • 单一架构 + hyperparam 跨 100+ 任务(DMC / Meta-World / ManiSkill)
  • 5M-317M 参数全 scale,公开权重

2.4 IRIS (ICLR 2023)

论文: arXiv:2209.00588

flowchart LR
    obs["Image obs"]
    vqvae["VQ-VAE<br/>tokenize"]
    trans["Transformer<br/>autoregress"]
    rl["Actor + Critic"]

    obs --> vqvae --> trans --> rl

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class obs,vqvae,trans,rl stage

特色:

  • 把世界模型当成 autoregressive next-token 任务(VQ-VAE token 化 + GPT-2 small)
  • Atari-100k 中位 HNS 0.289,9/26 超人类
  • 在低数据制度(100k frames)优于 Dreamer V3,是 Dreamer V4 的灵感来源之一

三、NVIDIA Cosmos 平台

论文: arXiv:2501.03575 | 开源: github.com/nvidia-cosmos | 9000 万亿 token / 2000 万小时视频

NVIDIA 把"为机器人 / 自动驾驶训练"作为目标,自上而下做整套世界模型 stack(tokenizer + predictor + transfer + reasoner)。

3.1 Cosmos Tokenizer

flowchart LR
    vid["Video<br/>HxWxT"]
    enc["3D Causal CNN<br/>Encoder"]
    quant["FSQ / Continuous<br/>(8-bit)"]
    dec["3D CNN<br/>Decoder"]
    out["Reconstructed"]

    vid --> enc --> quant --> dec --> out

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class vid,enc,quant,dec,out stage

Tokenizer 规格与性能

变体 压缩比 rFVD ↓ 用途
CV8x8x8 512× 13.4 连续 latent,feed predictor
DV8x8x8 512× 17.8 discrete token, 用于 AR 模型
CV4x8x8 256× 6.9 高质量 reconstruction
DV4x16x16 1024× 32.1 极致压缩(端侧)

vs OpenSora / WALT / VideoLDM 等公开 tokenizer,rFVD 普遍下降 30-50%。

3.2 Cosmos-Predict

flowchart LR
    cond["Cond<br/>(text/img/action)"]
    tok["Token-level<br/>diffusion"]
    pred["Future<br/>tokens"]
    detok["Detokenize<br/>→ video"]

    cond --> tok --> pred --> detok

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class cond,tok,pred,detok stage

Cosmos-Predict 模型矩阵

版本 参数 输入条件 用途
Predict1-7B 7B 文本 / 单帧图 通用视频生成
Predict1-14B 14B 同上 高质量
Predict2-2B 2B + action 机器人小模型
Predict2.5-7B 7B + LiDAR / map 自动驾驶

3.3 Cosmos-Transfer(结构控制)

flowchart LR
    src["Source video"]
    edge["Edge / Depth /<br/>Segmentation"]
    cond["Conditioning"]
    tgt["Stylized<br/>output"]

    src --> edge --> cond --> tgt

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class src,edge,cond,tgt stage

Transfer2.5-2B vs Transfer1-7B: 模型缩小 3.5×, 自动驾驶检测精度提升最高 60%。

3.4 Cosmos-Reason 系列

flowchart LR
    vid["Video"]
    enc["Vid Encoder"]
    llm["LLM Decoder<br/>(56B)"]
    out["Physical /<br/>Embodied reasoning"]

    vid --> enc --> llm --> out

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class vid,enc,llm,out stage

Reason1 四阶段训练

  1. 视频-文本对齐预训练(CLIP-style)
  2. Vision-language SFT(COCO / VQA / 物理 QA)
  3. Reasoning RL(rule-based reward on physics QA)
  4. Embodied SFT(机器人/驾驶场景任务)

Reason1-56B: 物理常识 60.2% vs OpenAI o1 59.9%; 具身推理 63.7%。

3.5 训练基础设施

维度 详情
原始数据 2000 万小时视频
Token 总量 9000 万亿 tokens
片段数 1 亿 (2-60 秒)
Predict2.5 额外 2 亿精选片段
数据管线 NeMo Curator
吞吐 PyNvideoCodec + Ray 提升 6.5×
训练算力 10,000 × H100 × 3 个月

四、DeepMind Genie 系列

DeepMind 路线:纯生成式世界模型用作可玩游戏环境。Genie 是 Google "playable video model" 路线代表。

4.1 Genie 1 (2024.02)

论文: arXiv:2402.15391

flowchart LR
    vid["Video<br/>frames"]
    st_vit["ST-ViViT<br/>spatial-temp"]
    lam["LAM<br/>Latent Action<br/>(8 codebook)"]
    dyn["Dynamics<br/>MaskGIT"]
    out["Next frame"]

    vid --> st_vit --> dyn
    vid --> lam --> dyn
    dyn --> out

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class vid,st_vit,lam,dyn,out stage

Genie 1 规格

参数 11B
训练数据 2D platformer 视频,~942B token
输出 1 frame autoregressive
Latent action codebook 8 个离散动作
推理 MaskGIT 离散 + cosine schedule
任务 输入 1 帧 + latent action → 生成下一帧

4.2 Genie 2 (2024.12) / Genie 3 (2025.08)

⚠️ DeepMind 未公开完整技术论文,以下基于公开博客 / 演示。

flowchart LR
    img["Single image<br/>(scene)"]
    g["Genie 2/3"]
    play["Playable<br/>1-min env"]

    img --> g --> play

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class img,g,play stage

Genie 1→2→3 演进

维度 Genie 1 Genie 2 Genie 3
输入 单帧 + action 单图 → 3D world 文本 + 单图
输出 2D 平台游戏 任意场景互动 高清持久世界
持续时长 ~10 秒 ~30 秒 1 分钟
分辨率 256² 720p 720p+
公开度 paper blog only blog + demo

五、扩散路线(视频/驾驶世界模型)

跟 Cosmos / Genie 一样的"生成式"路线,但用扩散模型作为核心 architecture。重点覆盖自动驾驶场景。

5.1 GAIA-2 (Wayve 2025.03)

论文: arXiv:2503.20523

flowchart LR
    cam["6-cam input"]
    vae["3D VAE"]
    diff["Diffusion<br/>Transformer"]
    rec["Reconstruction<br/>+ multi-view"]

    cam --> vae --> diff --> rec

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class cam,vae,diff,rec stage

GAIA-2 多视角一致性

  • 训练时 6 个 camera 视角联合采样
  • 视角间通过 cross-attention 共享 latent
  • 推理时支持任意视角组合(前后左右等)

GAIA-2 训练参数

视频源 25M 真实驾驶视频
时长 平均 30 秒 / clip
分辨率 256×512 (per cam)
训练算力 2500+ GPU·days
主要场景 英国 + 美国 + 德国驾驶

5.2 GAIA-3 (2025.12)

GAIA-3 新能力:

  • World-on-Rails:固定场景只改自车(评测专用)
  • 反事实碰撞生成:LiDAR 对齐
  • 体化迁移:从仿真迁移到真实
  • 受控视觉多样性:天气 / 时间显式控制
  • 罕见失败模式扩增:合成 long-tail 场景

5.3 DIAMOND (NeurIPS 2024)

论文: arXiv:2405.12399

flowchart LR
    s["State / Action"]
    edm["EDM Diffusion<br/>(Heun n=3)"]
    next["Next obs"]
    rl["Train policy<br/>in dream"]

    s --> edm --> next --> rl

    classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
    class s,edm,next,rl stage

DIAMOND vs GameNGen 对比

维度 GameNGen (DDPM) DIAMOND (EDM)
扩散核心 DDPM EDM(Karras 2022 改进)
推理步 ~50 3(Heun 求解器)
Atari-100k HNS 1.06 1.46
训练能力 atari 部分游戏 11 个游戏超人类
FPS ~10 ~30

DIAMOND 是世界模型训练智能体中最优。


六、训练范式总览与复现资源

训练范式对比

路线 代表 输入 输出 核心 loss 是否需要 reward
JEPA SSL I-JEPA / V-JEPA 2 / LeWM 图像 / 视频 latent L2 (latent)
Dreamer RL Dreamer V3/V4 / TD-MPC2 obs + reward + action latent + Q KL + BCE
Token AR IRIS / Genie discrete token next token CE 仅 RL phase
Diffusion GAIA-⅔ / DIAMOND / Cosmos 视频 视频 denoising MSE 仅 RL phase

复现资源索引

架构 公开权重 公开训练代码 单 GPU 可跑
I-JEPA ✅ ViT-H/14 ❌(需 8×A100)
V-JEPA 2 ✅ 1.2B 部分
LeWM ✅ 15M ✅(消费级 GPU)
Dreamer V3 ✅ 全 size ✅(XS/S 单 GPU)
Dreamer V4 部分 待公开 ❌(2B 需多卡)
TD-MPC2 ✅ 全 size
IRIS
Cosmos ✅ tokenizer + Predict1 部分
Genie 1
GAIA-2
DIAMOND

实操起步建议

  • 想做 SSL → V-JEPA 2 base + 单 8×A100,1 周训出 small variant
  • 想做 RL → Dreamer V3 S 配置 + DMC,单 V100 8GB 三天
  • 想做生成 → DIAMOND 玩具版(Atari),单 GPU 一周
  • 想做工业级 driving → Cosmos Predict2.5 finetune(公开权重 + 自家数据)

上级 · World Model