文远知行发布物理AI大模型WITT:单卡日处理1万分钟视频,聚焦自动驾驶长尾场景闭环

文远知行正式发布面向自动驾驶的物理AI大模型WITT(World Intelligence for Transportation and Traffic),支持单张NVIDIA A100 GPU日处理10,000分钟车载视频,在真实道路长尾场景(如异形障碍物、极端天气、无标线路口)中实现端到端感知-决策-规划联合建模,已接入WeRide ONE全栈系统并进入量产车型前装验证阶段。
WITT不是通用大模型,而是专为物理世界交通系统构建的‘具身推理引擎’
WITT(World Intelligence for Transportation and Traffic)由文远知行(WeRide)自研,定位为首个将多模态基础模型能力与高精时空物理约束深度融合的自动驾驶专用大模型。其核心差异在于:不依赖传统模块化pipeline(如独立检测+跟踪+预测+规划),而是以视频流+高精地图+车辆动力学参数为输入,通过统一Transformer架构联合建模交通参与者的三维运动轨迹、交互意图及环境物理可行性。模型参数量未公开,但训练数据覆盖超500万公里真实道路视频(含30%长尾场景标注),以及1200万组仿真物理碰撞/摩擦/惯性约束样本。
单卡日处理1万分钟视频:工程级实时性突破源于三层协同优化
该指标(10,000分钟/卡/天)指在A100 80GB GPU上完成端到端推理(含前后处理)的吞吐量,较行业常见BEVFormer类方案提升4.2倍。实现关键在于:
- 动态token压缩:基于道路结构熵值自动裁剪非关键帧区域(如天空、静态护栏),视频token密度降低67%,但保留全部动态交通实体;
- 物理感知KV缓存:将车辆运动学状态(加速度、转向角、轮速)编码为key-value cache的偏置项,使历史帧特征复用率提升至89%;
- 轻量化时空解耦头:分离处理空间几何(Lidar+Camera融合BEV)与时序动力学(LSTM-enhanced trajectory decoder),避免全注意力跨帧计算爆炸。
长尾场景闭环验证:从‘识别失败’到‘可解释归因’
WITT已在广州、深圳、北京等12城开放道路实测中验证对典型长尾问题的解决能力:
- 在暴雨导致车道线消失场景下,规划成功率从传统方案的63.2%提升至91.7%(基于ISO 21448 SOTIF测试集);
- 对快递三轮车突然斜向切入(非标准轨迹)的响应延迟≤280ms,且生成3种符合车辆动力学的避让轨迹供安全员审核;
- 首次实现对‘施工锥桶阵列’的语义-物理联合理解——不仅识别为障碍物,更输出其倾倒概率(基于材料力学仿真)与推荐绕行半径(≥1.8m)。
已接入WeRide ONE全栈系统,进入前装量产验证阶段
WITT并非实验室原型,而是深度集成于文远知行第四代全栈自动驾驶系统WeRide ONE。当前部署形态为:模型权重量化至INT4,推理引擎基于自研WeRide Inference Runtime(WIR),运行于Orin-X芯片(254 TOPS)。已与广汽埃安、博世达成合作,搭载WITT的AION LX Plus改装车正进行L4级无人接驳服务商业化试运营;同步推进满足UN-R157 ALKS法规的L3级功能落地,目标2025Q2通过欧盟型式认证。值得注意的是,WITT训练框架完全基于PyTorch + Hugging Face Transformers生态,所有仿真数据生成工具链已开源至GitHub(仓库名:we-ride/witt-sim)。
行业意义:物理AI范式正在重构自动驾驶技术路线图
WITT的发布标志着自动驾驶研发重心从‘数据驱动’向‘物理引导的数据驱动’迁移。相比Wayve LINGO-1强调语言指令对齐、Mobileye Chauffeur侧重多任务统一表征,WITT首次将经典车辆动力学方程(如Bicycle Model)、道路曲率约束、轮胎-路面摩擦系数μ作为不可学习的硬性归纳偏置嵌入模型架构。这种设计使模型在零样本迁移至新城市时,长尾场景F1-score下降仅4.3%(对比纯数据驱动模型的22.6%)。业内专家指出,该路径或加速L3/L4功能在复杂城区的规模化落地,但也对车规级算力平台提出更高确定性时延要求。