刘昊
视启未来联合创始人、世界模型与具身智能负责人
刘昊,现任视启未来联合创始人/世界模型与具身方向负责人,行业首个万物泛化抓取大脑(DINO-X-Grasp),行业领先的生成 + 理解统一世界模型。曾任滴滴量产智驾算法负责人,行业首个舱驾一体算法量产落地(小鹏MONA);曾任文远知行L4感知负责人,行业首个低算力激光多模态感知算法,文远知行AI推理框架和中间件0到1;前百度AI Infra负责人,AI推理框架Anakin/AI分布式训练PaddlePaddle通信库,百度公司统一AI异构计算集群等,2017百度百万美金最高奖(孔明团队)。
演讲主题
世界模型需要理解物体与动作:统一架构与具身落地实战
世界模型的目标是学习物理规律和因果交互规律。视启未来认为,所有的物理规律是作用在物体上的,因此世界模型需要先理解物体再学习物理规律;因果交互规律在具身领域本质是动作交互引起的,因此世界模型需要先理解动作再学习因果交互规律。 本议题将基于视启未来“生成 + 理解”统一世界模型(视觉原生基模 DINO-X),分享在物理规律和因果交互规律学习中的最新进展。同时结合“万物泛化抓取大脑”的实际落地,探讨如何从第一性原理出发破解模型的“物理幻觉”,并分享背后的架构设计与工程优化经验。 大纲: 1. 当前痛点:世界模型为什么是视觉原生的?(简要回顾发展史,探讨为何单纯视频生成难以真正掌握物理规律) 2. 第一性原理:世界模型为什么需要先理解物体/理解动作? 3. 架构解析:视启未来“生成 + 理解”统一世界模型(DINO-X)的核心网络设计与训练数据构造实践。 4. 具身实战与工程优化:多视角能力在复杂物理交互中的表现,以及结合底层硬件的推理框架部署经验。 5. 案例与复盘:视频生成与具身抓取 DEMO 演示,及典型实战 Bad Case 避坑分享。 听众收益: 1. 从第一性原理角度了解世界模型如何学好物理规律和因果交互规律,看清世界模型前沿和趋势。 2. 了解“生成+理解”统一多模态架构的设计思路。 3. 获取前沿模型在具身智能场景(泛化抓取)中从训练到推理部署的实战落地经验。