旗下矩阵

  • 投资界
  • 天天IPO
  • 解码LP
  • 并购
  • 前哨
  • 投资界AI

港大教授获时间检验奖:他想让机器读懂物理世界

2026 年 7 月 SIGGRAPH 大会,香港大学 Taku Komura 团队 2016 年论文获时间检验奖,其研究推动具身智能发展,助力物理 AI 从工厂走向家庭。
·投资界综合

2026年7月,计算机图形学顶会SIGGRAPH在洛杉矶举行。大会公布了本年度时间检验奖(Test-of-Time Award),表彰发表至少十年、至今仍对业界产生持续影响的论文。今年,香港大学计算机科学系教授Taku Komura与团队成员在2016年发表的论文获此殊荣。

这项工作首次采用深度学习,让模型从大规模人类动作数据中自动学习人类运动的内在结构,并根据高层指令生成自然的人形角色动作。

彼时,AI的突破还主要集中在图像领域,这项工作已经系统地把表示学习用于复杂3D动作生成,让AI的学习对象从“看见”延伸到“行动”。十年后,该工作的意义已经超出角色动作生成本身:机器如何从人的运动与交互中学习,理解物理世界并在其中行动,正成为物理AI面对的核心问题。

二十年,让身体成为一种可计算的语言

围绕这个问题,Taku Komura已经研究了二十余年。他曾在爱丁堡大学任教多年,长期研究动作生成、物理模拟和交互技术。2020年,他加入香港大学,现任计算机科学系教授。他曾任SIGGRAPH Asia 2025大会主席,并被AI 2000评为该领域全球最 具影响力学者前15。

具体而言,他希望让机器从数据中学习人类运动的结构,并进一步理解动作如何随场景、物体和任务而变化。

2016年,Taku在SIGGRAPH发表这篇获奖论文《A Deep Learning Framework for Character Motion Synthesis and Editing》,将深度学习系统性地用于角色运动合成与编辑。研究团队利用卷积自编码器,从大规模动作捕捉数据中学习一个低维的运动空间,再将行走路径等高层控制条件映射到这个空间。模型由此可以生成和编辑动作,同时尽量保留人类运动的自然性。

这项工作的关键不在于逐帧记住训练动作,而在于学习可复用的运动表示。用今天更熟悉的说法,它学习的是一种Human Motion Prior:哪些姿态与时间变化通常属于自然的人体运动,以及怎样在满足目标约束时,仍留在这个运动空间内。该论文引用量至今仍持续增长,也成为后来数据驱动动作生成研究的一项基础工作。

此后,Taku与实验室成员继续把动作放入更复杂的场景。2019年的Neural State Machine让数字角色根据场景几何完成坐下、搬运、开门与避障;2020年的Local Motion Phases则处理多接触、快速切换和全身协调等问题。研究对象由孤立的人体动作,逐渐扩展到身体、物体和环境之间的关系。

2022年,他与团队提出的DeepPhase获得SIGGRAPH最 佳论文奖。这项技术通过周期性自编码器从未经人工整理的动作数据中学习多维相位空间,捕捉不同身体部位随时间变化的结构。它让系统在检索、对齐和合成复杂动作时,不再依赖人为定义的单一动作阶段;生成结果也不只在单帧姿态上“看起来像”,时间组织同样更加连贯。

from clipboard

围绕这条研究线形成的AI4Animation开源项目,已经获得GitHub 8000多个Star,是动作生成领域最 具影响力的开源项目之一。项目由团队成员持续维护,汇集了Taku团队长期以来在人形运动、四足运动和场景交互等方向的积累。

从工厂到客厅

具身智能的下一个突破口

从2016年发表论文,到十年后获得时间检验奖,Taku的研究主线可以概括为一套完整的人类交互先验模型:让模型先学会表示人类在真实世界的自然运动,再理解人与场景、物体和任务如何发生交互,进而把真实接触、受力与环境变化纳入其中。

这条研究路线对物理AI的意义,正在被机器人行业验证。真机遥操作数据采集成本高、场景窄且动作不自然,靠它撑起通用能力并不现实。机器要学会在真实世界里做事,更可行的来源是人类的日常操作。

但人的数据并非采集后就能用。要实现大规模采集,硬件必须足够便宜,而低成本传感器通常伴随较大噪声和信息缺失。团队多年积累的人类交互先验模型,正好补上这一环:它能够判断哪些姿态和时间变化属于自然人体运动,补齐残缺信号,再将结果约束在合理的人体运动范围内。

from clipboard

依托这套先验,团队目前利用消费级设备,例如一台iPhone手机,就能完成采集与重建,得到人手、物体和场景在同一世界坐标系下的3D结果。据团队测算,采集成本可降到传统方案的几十分之一,在第 一人称手部重建的公开评测上误差降低60%。

这套管线的价值首先体现在降低数据采集成本,更重要的是,它指向一个关键判断:具身智能的下一个突破口,很可能出现在消费级场景。

家庭整理、厨房操作、日常物品交互等真实生活场景蕴藏着巨大数据,边际成本极低,却因动作精细、接触关系复杂,长期缺乏可规模化的高质量数据来源。Taku团队的技术路线,让消费级设备拍摄的真实生活操作,转化并丰富物理上成立的训练数据。这意味着具身智能与世界模型未来的规模化落地,将从工厂产线走进千家万户的真实生活。

通往物理AI终局

采到数据只是第 一步。行为克隆能让机器模仿示范动作,但要在真实世界里行动,机器还必须知道一个动作会带来什么结果,以及结果背后的物理规律。Taku和团队正在推进的,就是一个用人类原生数据训练的多模态世界模型。

现有的具身数据范式大多围绕视觉和动作展开,包括第 一视角视频、UMI和机器人遥操数据。但视觉相近的动作,背后的接触过程和操作结果可能完全不同。只依赖视觉与轨迹,模型很难区分这些差异。

Taku团队正在推进的方向,是以人的原生操作数据为基础,补齐这些信号。团队将采集设备做成可穿戴的形式,第 一视角相机记录看到的画面,重建出的3D状态可以区分相机运动与真实环境变化,眼动记录人类视线的注意对象,肌电则记录发力与接触,补上人类动力学特征。采集时使用者只要照常完成日常操作,就能获得时序对齐的多种模态信息。

这也改变了世界模型要预测的目标,从下一帧像素,进一步深化到物理状态的变化,包括物体的3D状态、接触位置、受力大小。对机器人真正有用的判断是“这样推会不会倒”“这个力够不够拧开”,这些关键特征,构成机器眼中的世界状态,而不是一堆像素。

以人为中心的数据,并不是终点。人能示范的经验总有边界,机器人迟早要面对没有人做过的任务。Taku希望,机器人学习人类经验后,可以通过自主行动继续积累对世界的感知与行为经验,逐步具备自我探索和自主学习的能力。今天以人类为中心的这套范式,是在为那一步打基础。

物理AI面对的,是机器人如何适应未知环境,如何从有限交互中学习新技能。这些能力无法通过公开数据集或一次性实验获得,需要长期采集数据,在真机上反复测试,并根据真实任务持续调整。因此,这类研究也需要与产业界深入合作。

在爱丁堡大学任教多年后,Taku选择在中国香港继续自己的研究。他十分看重在中国推进这项工作的价值:相关领域学术活力强,产业落地场景多,为物理AI研究提供了丰富的实践条件。

接下来,Taku希望推进物理AI更根本的目标:让机器人形成对物理世界的内部表示,在真实交互中理解身体、动作与物理规律,并让这种行为智能可以迁移到不同的机器人、任务和环境中。多模态的人类原生操作数据,是他推进这一目标的重要入口。

时间从不为任何人停留,但时间会奖励那些真正理解它的人。

【本文经授权发布,不代表投资界立场。本平台仅提供信息存储服务。】
【免责声明】:本文不构成任何投资建议。市场有风险,投资需谨慎。
如有任何疑问,请联系(editor@zero2ipo.com.cn)投资界处理。