核心技术
多模态智驾大模型
多模态智驾大模型融合世界模型与 VLA(视觉-语言-动作)框架:世界模型负责驾驶场景的生成与推演,VLA 负责物理因果与常识的理解和动作输出。系统不仅看见当下,更能预见变化。
MOTOVIS VLA基础大模型框架,是认知模型的基础,是以视觉编码器,视觉语言模型,动作策略模型为基础,以世界模型为强化学习环境,以4D数据集,VQA数据集,法规数据集,物理交互数据集作Fine Tune。