日期:2026-07-27 17:48:56
来源:中国汽车趋势网
访问量:26602 次
2026年7月21日至23日,2026中国汽车论坛在上海嘉定举办。本届论坛由中国汽车工业协会主办,以“新开局,新机遇,新征程——共绘汽车产业高质量发展新蓝图”为主题,设置“1场闭门峰会、1个大会论坛、1场技术领袖峰会、13个主题专题论坛、N场行业发布”等16场会议及若干配套活动,围绕汽车行业热点和重点议题,探索方向、引领未来。7月23日上午,在“【主题论坛十】AI驱动智能网联新能源汽车产业数智新发展”上,文远知行上海研发中心总经理霍达发表主题演讲。以下内容为现场发言实录:
大家好,我是霍达。文远知行在L2++和L4领域做了大量工作。今天,我主要向大家汇报我们在云端大模型方面的最新进展。此前,我们也在WAIC上发布过相关成果。
今天也借这个机会向各位作进一步汇报。这里有几段视频,大家可以看一看,是否能很快从中找到变道场景。刚才郭总和申院士都提到,对自动驾驶来说,一个重要问题是如何发现长尾场景,找到那些更难处理的问题。比如,在海量视频中识别长尾场景,本身就非常困难。我们的思路是,既然现在大家都在讨论用AI解决问题,包括ChatGPT、Anthropic以及国内的一些大模型,那么是否也可以让AI来分析这些场景。
但在实际分析过程中,大家会看到不少问题,其中最主要的是幻觉和不够精准。有时模型会无中生有,或者说,本质上它对视频的理解还不够到位,与真实场景之间仍有差距。
自动驾驶本身是物理AI最大规模落地的场景之一,因此我们在这一方向上投入了大量工作。目前我们观察到几个突出问题。第一,是运营闭环还不完整。
虽然我们采集了大量数据,包括L2++和L4的数据,但这些数据拿来使用并不容易,其中包含很多噪声和干扰。
大部分L2++数据来自个人私家车。这类数据中,有相当一部分对算法训练的价值较低,比如大量等红灯或常规行驶场景。对我们当前的算法迭代而言,这些数据的边际价值相对有限。
第二,海量数据也很难被充分利用。以L2++车辆为例,一辆车每天可能产生约300GB数据;L4车辆的数据量更大,每辆车每天可达到TB级。数据量确实非常庞大,但如何更好地把这些数据用起来,仍然是行业面临的痛点。
第三,AI仍然缺乏面向真实物理世界的可信锚点。简单来说,现在大家与AI对话、沟通,或者让它完成一些coding agent相关任务,
这些事情已经做得不错。但面对真正的物理世界,尤其是自动驾驶所处的复杂交通环境,AI的理解仍然缺少足够可靠的锚点。
这里我们引用一位著名哲学家的观点:世界是事实的总和,而不是事物的总和。也就是说,我们希望解决的不只是障碍物检测或路牌检测,更重要的是理解这个世界,理解各个事物之间存在的多种关系。
我们需要理解这些事实,并围绕事实开展工作。基于这一思路,文远知行发布了大模型WITT,即World Intelligence Toward Truth。我们认为,这是一个具备物理认知能力的AI基础大模型。
这个大模型基于文远知行多年积累的数据训练而成,尤其充分利用了自动驾驶数据,因此能够更好地理解真实世界。我们也正式向社会和行业发布这一面向物理AI的基础大模型。
我们提出了一个概念,叫“最小物理事实单元”。在交通环境中,很多事情都非常复杂。比如车辆通过一个红绿灯路口、经过一个十字路口,或者完成一次右转,背后都包含大量事实单元。它并不是一个粗粒度的整体事件。因此,我们要做的是把最小物理事实单元定义出来。
这个大模型本质上要做的,就是提取这些最小事实单元。它具备四项能力。第一是事实提取,即识别道路上正在发生什么,以及其中的最小事实单元是什么。例如,当前正在下雨,或者行人正在穿过马路,我们都把它视为最小事实的提取。这是大模型要完成的第一件事。
第二是事实推理。比如,当我们看到一个人走在马路边时,大模型能够推测他下一步可能会穿过斑马线,可能会右转,甚至可能进入非机动车道。因此,这个大模型可以围绕事实做进一步推理。
第三是事实验证。大模型有时也会产生幻觉或错误判断,我们如何处理这一问题?我们的做法是依托自动驾驶车辆本身,收集大量来自真实事件、可依靠且可信赖的物理特征。
例如GPS信息、道路信息以及道路结构化信息。我们会利用这些物理特征,验证大模型给出的结论和判断是否符合真实世界的运行规律。后面我还会进一步展开。
最后是事实编排。我们不仅要理解世界,还要让这种事实理解能力与云端生成式大模型有效编排,进入整体数据飞轮。
这就是WITT的四大核心能力。第一项是事实提取。常见的事实大致可以分为几类:第一类是标准驾驶事实,包括直行、转弯、三点掉头、变道、停车等。
这些问题目前相对容易被自动驾驶传感器、算法或我们的这个大模型提取出来。第二类是动态交互事实,比如在停车场寻找出口、识别突出货物、处理雪天防滑等场景。
第三类是更典型的长尾场景,比如黑夜或雨后避让自行车,夜间工地中较差的路面条件,以及能见度较低、画面模糊的复杂场景。
目前,WITT已经能够较好地提取这些不同类型的事实,这将极大帮助我们在海量数据中找到真正需要的数据。整体来看,这是非常重要的第一步能力。在文远知行内部,我们已经定义了100多种这样的事实,也可以理解为100多种标签,并能够通过WITT模型快速检索相关数据。
第二项是事实推理。它不仅能够分析视频中或车辆当前正在处理的事实状态,更重要的是能够进一步推理,预测下一阶段或下一时刻可能发生的事情。
比如这段视频。初始状态下,道路右侧有一名行人站立,并面向道路方向。在后续帧中,该行人始终保持站立,没有向行车道移动,也没有转身。到最终状态,我们依然预测他不会发生变化,仍处于护栏外侧,没有进入行车道,全程保持静止。
因此,WITT模型不仅能提取当前事实,更重要的是能够预测一系列动作的发展趋势。这对自动驾驶非常重要,包括很多俗称“鬼探头”的场景,这种能力对提升安全性很有价值。
接下来是事实验证。正如刚才所说,我们会通过物理特征对大模型可能出现的幻觉和错误进行兜底。例如,大模型可能判断当前车辆处在隧道中,
但实际上车辆可能只是位于桥下。隧道和桥下在视频画面、视觉特征以及预测结果上可能非常相似,因此模型容易产生幻觉。但由于我们掌握了大量地图、GPS和路网信息,当大模型推理出这类错误结果时,我们可以很快进行纠正。所以,WITT集成了事实验证能力。
我认为这项能力非常重要。否则,大模型输出的结果可能存在错误或幻觉;如果这些数据最终进入训练模型,可能会让驾驶模型学到不准确的驾驶方式,甚至影响效果。
因此,事实验证非常关键。最后一项是事实编排。此前,我们已经发布了Genesis世界模型。刚才几位专家也提到,世界模型可以更多用于数据合成和数据生成,在仿真世界中生成大量长尾场景。
与此同时,我们把WITT与Genesis搭配起来使用。WITT并不是去生成合成数据,而是快速理解数据、定位数据。这也是行业解决长尾场景问题的两条重要路径。
对自动驾驶来说,最稀缺、最关键的数据往往就是长尾场景数据。行业普遍会通过上述两类方法解决这一问题。对文远知行而言,我们做了两个模型,而且这两个模型的性能和效果都比较好。WITT还有一项非常重要的能力,就是能够识别事实和场景,
并把经过验证的事实与整套Genesis体系编排在一起,最终形成数据闭环。这样,L2++车辆和L4车辆产生的数据都可以进入云端;在云端,我们通过WITT完成数据检索、理解和查找,再结合Genesis的数据生成能力。
最终,我们要解决的就是数据缺失、高质量数据缺失以及长尾数据缺失的问题。
这里也简单介绍一下文远知行。WeRide是一家全球化公司,目前已经在12个国家、40多个城市部署小巴、环卫车和Robotaxi等业务。因此,WeRide是在自动驾驶商业化运营过程中自然孵化出来的,真正服务于自动驾驶演进的过程。
这里有一段视频,大家可以看一下。Robotaxi正迈向大规模纯无人运营,智能辅助驾驶也正在走向千万级规模。AI需要学习的不再只是驾驶本身,而是如何从真实世界的规模化车队运营中持续学习。每一天、每1公里、每一次交互,都在创造海量经验。
随着物理AI迈向规模化,新的挑战也开始出现:机器幻觉增加,隐藏问题难以发现,人为噪声容易淹没关键信息。这些都在阻碍真正值得学习的经验形成。物理AI并不缺数据,缺的是可信、可学习的物理事实。AI需要更好的老师,也需要来自真实世界的可信物理事实。
WeRide WITT应运而生。这一物理AI认知基础大模型诞生于商业化服务和规模化运营之中。它不只是理解视频,更重要的是理解真实世界,并将真实世界转化为机器可信的物理事实。
一看即懂。WeRide WITT以物理事实为核心单元,将复合场景视频拆解为高置信、可校准的最小事件,再由多个事实组合生成高密度场景描述。在小于7B的模型规模下,它实现了自动驾驶垂类的高性能理解;相比主流通用多模态大模型,可节省98%的token成本,单块GPU每天可处理1万分钟车辆运行视频,一次请求可输出100多个动态标签。
疑问即得,自动理解并完成归因,预测真实事件。内置视频数据引擎能够通过关键词快速定位海量视频中的相关时间节点和目标场景。
在同样算力下,WITT每天最高可处理200倍的车辆运行视频数据。一验即知:它能够调用全局物理证据,基于review体系和六维评测进行交叉验证,确保事实一致性,建立机器可信的truth。事实理解正确率较行业通用模型提升3倍。
一筛即精。WITT可按学习价值进行智能分流,让每一条数据进入最合适的学习路径。真实世界创造事实,WeRide WITT让事实成为真知;源于真实世界,证于真实世界。一套物理AI底座,由两大商业体系共同验证。这就是文远知行物理AI的进化方式:每一个事实都至关重要,每1公里都推动进化。WeRide WITT,眼见为实,洞察真知。
这是我们整体能力的一个展示。我们也做了大量benchmark,并与开源视频数据集以及主流开源模型进行了对比。我们的模型规模并不大,大约为7B,但与200B甚至更大规模的模型相比,整体表现仍然不错。
从各项评分来看,我们处于较为领先的水平。这不仅体现在公开测试集上,也体现在我们内部对自身整体能力的评测中。大家可以看到,绿色框代表我们的整体能力,我们认为处于比较领先的位置。还有几个关键数字:首先是token成本,我们节省了98%;在同等算力下,效率提升了200倍。
因此,我们每天可以处理上万分钟视频,并对其进行理解。在公开测试集的7项理解任务上,与同等通用大模型相比,我们出现幻觉和错误的概率大约只有通用大模型的三分之一。
我认为,这正是自动驾驶所需要的能力。对于具身智能,以及当前非常热门的机器人行业,WITT同样可以应用到具身世界中。我们认为,它能够帮助具身智能企业更快落地,更快找到高质量数据。
最后,我们认为,每一个事实都至关重要,每1公里都推动进化。文远知行也希望与各位同仁一起推动整个行业发展。非常感谢主办方的邀请,也感谢政府以及上海方面的支持。谢谢大家,我的分享到此结束。
(注:本文根据现场速记整理,未经演讲嘉宾审阅)
以“高端、求实、重效”为特点的中国汽车论坛自2011年以来已成功举办了12届,并成为中国汽车领域的“达沃斯”论坛,备受业内外广泛关注。作为汽车行业顶级盛会,中国汽车论坛依托于汽车行业权威组织——中国汽车工业协会,将继续充分发挥桥梁和纽带作用,强力打造及时向行业输出新思想和智慧碰撞的高水平交流平台,继续助推我国汽车产业高质量发展,早日共圆汽车强国梦!
在7月23日上午举办的“【主题论坛八】筑牢基石,质领未来——协同推进新能源汽车产业高质量转型升级”上,安徽江淮汽车集团股份有限公司副总经理、首席质量官李卫华发表精彩演讲。
作为本次论坛代表社交媒体平台向行业做分享的唯一嘉宾,小红书商业交通出行行业平台专家负责人朱舜杰受邀出席7月22日下午举办的主题论坛,并发表题为《拥抱用户,建立长效经营阵地》的精彩演讲。
在7月22日下午举办的“【技术领袖峰会】第八届全球汽车技术发展领袖峰会”上,德赛西威高级总工程师彭学明发主题演讲讲。
在7月22日上午举办的“大会论坛”上,芯擎科技创始人兼首席执行官汪凯发表了“中国芯,走向端侧智能算力平台”主题演讲。
在7月22日下午举办的“【主题论坛二】中国标准·国际视野——汽车行业ESG评价体系的对标与融合”上,责扬天下(北京)管理顾问有限公司副总裁代奕波发表精彩演讲。
在7月22日下午举办的“【技术领袖峰会】第八届全球汽车技术发展领袖峰会”上,智驾新程(neueHCT)产品与市场总经理卢游发表精彩演讲。
在7月22日下午举办的“【技术领袖峰会】第八届全球汽车技术发展领袖峰会”上,芯擎科技副总裁兼产品规划部总经理蒋汉平发表精彩演讲。
在7月22日下午举办的“【主题论坛二】中国标准·国际视野——汽车行业ESG评价体系的对标与融合”上,通标标准技术服务有限公司管理与保证事业群可持续发展总经理李蕾发表精彩演讲。
在7月22日下午举办的“【主题论坛五】智驭未来·人才领航——中国汽车产业转型升级的人才战略新范式”上,中国人才研究会汽车人才专业委员会秘书长李喆乐发表精彩演讲。
微信公众号
总编微博