今天读了 Qwen-RobotWorld 技术报告(Qwen 团队,2026年6月)。它是一个语言驱动的视频世界模型,面向具身智能:不再使用各机器人专用的动作格式(关节角度、航点、转向指令),而是用自然语言作为统一的动作接口,根据当前观测和一条指令预测未来的视频序列。
最吸引我的地方是这种统一性 — 一个模型覆盖了机器人操作、自动驾驶、室内导航以及人机迁移四个场景,联合训练使每个领域的物理知识相互增强。

架构 (图4):冻结的 Qwen2.5-VL 编码指令(作为动作),VAE 编码视觉状态,两条流在每个 Double-Stream MMDiT 块内通过逐层联合注意力融合,预测未来帧。
要点
- 语言即动作。 状态转移模型
s_{t+1} = f(s_t, a_t)中的动作a_t就是一条如 “拿起红色杯子放到架子上” 的指令 — 无需任何机器人专用 API。- 架构 — 双流 MMDiT。 60 层双流扩散 Transformer:理解流(冻结的Qwen2.5-VL 编码指令)和生成流(视频 VAE 隐变量 = 视觉状态),通过逐层联合注意力融合。用 MLLM 而非 T5/CLIP 编码动作的优势在于:MLLM 内化的世界知识(如机械臂是刚体、连杆长度固定等)能约束生成结果,使状态转移在物理上更合理。- 数据 — EWK 语料库。 约 860万 视频-文本对(2亿+帧),建立了覆盖20+ 种类机器人和 500+ 种动作类型 的动作-语言映射,采用五层分层标注加 LLM + 人工质量过滤。约 160 万样本包含同步的 2-4 视角拼接。- 训练 — 通用+专家渐进课程。 两阶段:先学习通用视觉先验,再在共享的语言接口下注入具身专业化知识。非对称 3D RoPE + 多视角拼接实现跨相机几何一致性,无需修改架构。- 三大应用方向。 (1) 策略训练的合成数据引擎,(2) 策略评估的虚拟环境,(3) 下游机器人控制的语言引导规划信号。- 结果。 EWMBench 总体第一(4.60),DreamGen Bench 总体第一(4.952);WorldModelBench(8.99)和 PBench(0.804)上超越所有开源模型;物理遵循度接近满分;RoboTwin-IF 上额外验证了零样本泛化能力。

数据流水线 (图2):五类原始数据源 → 质量过滤 → 预处理 → 五层分层标注 →标注质量过滤,产出 860万对 EWK 语料。

泛化能力 (图6):(A) 一条指令驱动四种机器人形态,(B) 同一技能跨任务和场景迁移,(C) 同步相机视角保持相互一致。
为什么关注
“语言作为通用动作空间”的框架值得深思 — 一种将截然不同的具身形态统一到一个骨干模型下的简洁思路。而人机视频迁移(从人类演示视频自动合成机器人执行,无需机器人专用提示)则暗示了一条真正可行的路径:将具身训练数据的规模扩展到物理机器人收集能力之上。