7月19日,生数科技联合创始人、首席执行官骆怡航在2026世界人工智能大会“启明创投·创业与投资论坛——从算力原点到应用落地的进化征程”上发表主旨演讲《通用世界模型:打通虚实边界,筑基物理智能》。
以下为部分发言实录,投资界(ID:pedaily2012)整理:
骆怡航:各位嘉宾、各位朋友,大家下午好!我是来自生数科技的骆怡航,非常荣幸作为启明创投被投企业之一参加本次论坛,生数科技是一家以视觉信息为核心,研发多模态生成和视觉模型的企业,这是我们第三次参加启明的论坛,2024年我们分享的是多模态视频生成模型,2025年视频模型在整个内容产业里取得了极大的技术突破和商业化落地的突破,到了2026年视频模型一样不断地发展,但其实它的边界和潜力我们认为还没有被完全释放,这就是我们今天分享的其中一个话题,以视频模型我们怎么样去思考更大的价值。
世界当前还没有达成完全收敛和共识的状态,还在不断做技术和产业的迭代。今天我主要以世界模型为主题,跟大家分享生数的理解和实践当中,世界模型从哪里来?未来三年到哪里去。
首先,对于人的智能来讲,我们除了人与人之间的语言交流,其实在我们的人脑里也会有一个指导我们行动决策的模型,比如说骑车、运动,除了视觉感知,我们人脑里也会做行动的预测和行动的执行。我们在人脑里也会有小规模的世界模型不停运转。对于人工智能时代,我们的目标是希望打造能够接近人类智能,甚至超过人类智能的完全智能模型,除了现在看到的语言模型取得了极大的深度推理,包括自主行动的能力,我们认为在人与世界交互的过程中也需要一个世界模型来推进整个人工智能整体发展。
为什么?首先人脑部分里除了语言处理部分,其余80%在处理视觉信息以及所有行动的规划和决策。其实这种智能就是对物理世界的感知和动作的决策,如果大模型只靠语言模型去理解世界,我们认为相当于只用了人脑极少量的大脑能力。所以我们认为未来三年到五年的发展一定是需要类似于语言模型当前级别的世界模型,这个世界模型也是一个大模型,是一个基座模型。
世界模型是什么?当前会有不同的解读和定义,在生数科技的眼里,我们认为世界模型对比语言模型,语言模型处理人与人、人与文字的信息,世界模型是处理人与世界的所有交互,它需要像人一样感知、思考、行动。早在2018年的ICML会议里面就对world model做了一个定义,其实它需要观察世界,同时也需要理解和思考世界,第三点更重要的是在物理世界里去行动于世界。所以感知+预测+行动的整个闭环,而且这个闭环是动态、持续、循环的闭环。
在我们人的行动里,大家可以想象和感知,我们不断感知行动的变化和环境状态的变化,不断去调节我们对于状态的感知和行动的决策,再作用于行动,这个循环往复的闭环我们认为是构建模型底层逻辑。世界模型不是什么?我们会认为交互的视频生成仅仅是在数字世界里做交互的视频,它不等于世界模型。同时,会有3D空间的重建包括4D的生成,我们认为不会完全等同于世界模型。
同时,以语言模型VR/AR为主的视觉行动和Action模型也不等于世界模型是因为我们认为这种底层逻辑它不具备一个完整的闭环,同时它也不具备类似于人脑思考世界交互的动态反馈循环,所以这种情况下我认为它比较难以实现LLM级别的智能能力,所以简单来讲我们总结世界模型需要感知、预测加行动的一个动态循环的闭环。直接来讲我们认为它类似于我们一边看、一边思考、一边行动,同时也在不断地去调整。
另外一个角度,有了世界模型底层逻辑,另外一个话题是世界模型是不是一个场景类的世界模型?比如说是具身在家庭场景的模型?或者工厂里的世界模型?我们认为可能都不足以去刻画或者推荐整个世界模型最大的潜力,其中一个关键词我们认为世界模型也需要像语言模型足够通用、足够泛化,为什么?
第一,这一代AI最本质的效果就是通用性和泛化性,其实背后的技术路径最本质就是因为它的Scaling Law,包括预训练数据的大规模化,包括架构能够支持预训练数据去消化,同时在效果上能产生极大的泛化性,通过不断的量化引起质变以及智能涌现,这是第一个路线我们认为世界模型可以做到足够的通用化。
其次,如果不够通用化,我们认为会有几个问题,当前路线看到了一些局限或者弊端。
(1)作为VLA模型是一种。
(2)视频生成本身在数字世界里模拟也是一样。
(3)行动领域会有行动模型做行动的驱动。
每个环节都可以处理一部分,但很难完成完整的模型。
第二,我觉得人与世界模型交互。
第三,在整个物理世界实现规模化和商业化的落地,要实现容易迁移、容易复制的能力,像语言模型一样,有了强大的语言模型,在各种场景里面去做Agent、做任务,都能很好地去完成。所以通过这几点我们认为,世界模型除了刚才我们讲的感知、预测、行动的闭环,同时一定要往更通用、更泛化的目标去做。
在这样的理解和认知思路的情况下,生数科技构建了整个通用世界模型的基座,这个基座就是我们认为的世界模型在生数公司去做最核心的战略目标。底座会构建通用世界模型的基础架构,这个架构会以丰富的视觉信息、听觉信息包括物理世界里的触觉、力学等所有信息为数据的部分,同时架构也需要创新。
在两个空间里一个是数字空间,就是我们现在已经可以去用到世界生成模型,它对物理世界进行了建模、抽象、理解之后在像素空间的解码和能力显现化的实现。另外它的解码空间是在具身物理操作上,它构成了世界行动模型,我们也可以简单把架构认为是一体两翼的统一架构。
第一,进一步在架构里,我们在去年12月份全球首次提出了具身智能MoT统一架构,这套架构把刚才提到的理解、感知、预测、行动做了统一的建模空间构建在一个模型里,它去实现整个理解预测行动的闭环。
第二,我们认为对于人学习世界交互,如果他能够理解到、学会了,首先还是能表达出来,所以我们用像素预测表征对世界的理解,这是第二点。
第三,用同一套基座模型做两个空间不同解码,它对整个世界理解是一套,统一去在不同空间里解码。
这三个核心要点是我们提出MoT具身智能架构最核心的理念。
有了算法、方向,我们对世界模型的适配创新之外,数据是作为整个模型很重要的一个维度。数据方向刚才提到了数据一定是在具身领域,在物理世界领域一定会有不同的架构在里面。我们提出了整个具身数据金字塔的结构,这套数据金字塔我们希望在整个世界模型的预训练、后训练里适配它的潜力突破通用化和泛化最核心的目标。
最底层大家可以看到其实是互联网视频数据,它会作为整个预训练的绝大部分核心数据去先验让模型理解整个世界模型规律,它里面记录了大量的信息,而且这些信息是时时刻刻每分每秒不停记录,充分发挥视频数据的价值。再往上需要六层,其中是两类,一类是具身本身无关的数据,包括仿真、第一人称视角数据。再往一层具身本体相关的数据,还有很多imperfect的数据,很多脏数据,包括失败的数据,包括很多长尾的数据,全部可以通过MoT的架构统一去消化这些数据,所以这一套MoT的架构包括我们设立整个数据体系、生数最早做视频模型积累的底层预训练数据和架构都会被这一套架构所吸收,我们既希望它可以有效破解整个物理世界数据的瓶颈,可以高效率消化每一层数据,同时希望同等数据量下可以快速地飞跃。
有了这样的算法架构和数据体系之后,我们在2026年4月份发布了Motubrain,整个基于通用世界模型架构和理念的具身大脑,这一套架构其实是在全球首次,就是同一个模型去驱动多个本体,完成多项任务,而且对于本体的适配我们在半天到一天的时间里,通过少量本体相关的数据做了微调和适配,使得几个本体完成多样的任务。同时它也具备了一脑多能完成很多原子任务的自动拆解和协作。同时可以做长程任务的规划和执行,除了理解的部分可以动态调整它的动作和执行,我们来看一个完整的视频。
[VCR播放]
骆怡航:它是通过Motubrain通用世界行动模型联合了本体合作伙伴一起在4月份做出来的效果,接下来在9月份我们也会发布新的模型版本。
进一步我们可以看到Motubrain模型,利用短架构和数据方面思考和实践,我们在整个具身领域的评测指标也是突飞猛进,包括在RoboTwin等指标里可以看到Motubrain指标快速提升。
同时,可以看到在数据泛化性上,同等数据量级模型的准确率以及在不同任务泛化性上,多任务里面的准确率可以看到绿色的线是Motubrain模型,相比以往VR/AR模型,包括没有利用视频数据作为预训练的模型产生了极大的提升。
为什么能够取得高斜率,加速去提升它潜在的通用能力?因为生数科技一方面在架构上,在2024年做了RDT的模型,它是VR/AR的模型,那时候取得了小场景可行的决策行动。同时2025年7月份Vidar模型是第一个用视频模型作为基座去做的一个具身模型,也产生了极大的提升。进一步我们在2025年12月份,Motus是我们开源统一架构的模型,这个架构模型相比Vidar模型又取得了快速的增长,今年4月份我们正式发布了Motubrain模型,一系列沿着这条路线,我们对于物理世界交互的模型进行了快速迭代,这是我们一方面看到在效果层面、落地层面的突破。
除此之外还有很重要的核心,因为在生成模型部分,我们的Vidu部分也对世界模型的能力提升产生了很大加持,这就是最开始我提到的,要理解、预测和行动一体化,理解和预测的能力是由人增加增强行动能力的。进一步我们可以看一下世界生成模型维度相关的迭代。它其实是在持续迭代对世界的理解和预测能力,它具备了很强的物理一致性,同时在内容创作领域中,包括音画同出、智能运镜、多样风格都能实现,我们一起看一下Vidu的演进过程。
骆怡航:这是世界生成模型Vidu的迭代进展。接下来Q4版本也会进一步增强模型能力。
同时视频模型进一步可以提升视频生成的速度,就是我们实时感知和交互,这是我们最近发布的Vidu S1的模型,我们看一下效果。
骆怡航:Vidu S1的版本,最终生数科技模型的理念和我们的目标是怎么样?三个方向:
第一,Vidu Q做了视频理解和预测的基座模型,我们会不断演进它在虚拟世界做内容生成的效果。
第二,Vidu S系列我们把虚拟和物理世界打通做实时交互。
第三,Motubrain纯物理世界做完全实时驱动模型。
整体这套架构就是生数科技通用世界模型的核心定位,我们希望结合数字和物理世界用同一套理解预测和行动的整个架构去实现整个人与世界更好交互。
最终的理念或者愿景我们认为是怎样呢?首先对于具身物理世界来说,我们认为未来所有的机器人,不同的本体就是物理世界的Agent,可以去像我们现在虚拟世界Agent一样实现自主规划和执行。要达到这样的目标,其实破局点就是模型,通用世界模型是我们认为最具有潜力的技术路径,同时数字和物理世界的Agent一定会是千差万别、多种多样化的,但是背后的智能我们认为它是通用的、泛化的、统一的,就像语言模型一样它使得模型和人、人和Agent一样实现了交流,同时视频生成实现了机器可以像人一样去创意和创作,进一步希望通过世界模型去驱动整个物理世界的Agent实现像人一样行动。生数科技为通用世界模型的理念和目标去努力,谢谢大家。
文章来源:投资界
原文地址:https://news.pedaily.cn/202607/566634.shtml





