// 项目
进行中共同开发者
机器人世界视频分解模型
World ModelSimulationSAPIENIsaac Lab
项目简介
- 评估单图层分解(layer decomposition)方法,作为机器人操作视频分层流水线的基础,服务于三视角分层世界动作模型(World Action Model,WAM)。
- 对比了 See-through、LayerD、RevealLayer、Qwen-Image-Layered 四种候选方法,从领域对齐、语义固定性和遮挡恢复三个维度进行评估。
阶段性进展
- 选定 See-through(基于 SDXL + 一致性模块,最多可生成 23 层 RGBA)作为主要候选方案,LayerD(BiRefNet + LaMa)作为轻量级基线做合理性校验。
- 排除了在机器人层上表现不佳的 Qwen-Image-Layered,RevealLayer(基于 FLUX.1-dev)暂缓评估。
- 目前正在 12–20 张精选机器人图像上验证 See-through 效果,生成阶段的主力候选骨干网络是 Cosmos Predict 2.5(2B)。