随笔

论文阅读:Qwen-RobotWorld — 语言作为世界模型的通用动作接口

2026年6月21日

今天读了 Qwen-RobotWorld 技术报告(Qwen 团队,2026年6月)。它是一个语言驱动的视频世界模型,面向具身智能:不再使用各机器人专用的动作格式(关节角度、航点、转向指令),而是用自然语言作为统一的动作接口,根据当前观测和一条指令预测未来的视频序列。

最吸引我的地方是这种统一性 — 一个模型覆盖了机器人操作、自动驾驶、室内导航以及人机迁移四个场景,联合训练使每个领域的物理知识相互增强。

Qwen-RobotWorld architecture — Double-Stream MMDiT

架构 (图4):冻结的 Qwen2.5-VL 编码指令(作为动作),VAE 编码视觉状态,两条流在每个 Double-Stream MMDiT 块内通过逐层联合注意力融合,预测未来帧。

要点

EWK data processing pipeline

数据流水线 (图2):五类原始数据源 → 质量过滤 → 预处理 → 五层分层标注 →标注质量过滤,产出 860万对 EWK 语料。

Generalization across embodiments, tasks, and viewpoints

泛化能力 (图6):(A) 一条指令驱动四种机器人形态,(B) 同一技能跨任务和场景迁移,(C) 同步相机视角保持相互一致。

为什么关注

“语言作为通用动作空间”的框架值得深思 — 一种将截然不同的具身形态统一到一个骨干模型下的简洁思路。而人机视频迁移(从人类演示视频自动合成机器人执行,无需机器人专用提示)则暗示了一条真正可行的路径:将具身训练数据的规模扩展到物理机器人收集能力之上。

← 返回随笔列表