NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026
9409点击    2026-09-14 15:03

NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026


给生成模型引入仿真,补上难以获得的声音感知。


 机器人要进入真实世界,需要处理的信息远不止视觉。


倒水时,声音可以帮助判断杯子是不是快满了;物体发生碰撞时,不同材质会发出不同的声音;一个人在小房间和大房间里说话,空间回声也不一样。然而,这些人类习以为常的多模态感知,以及诸如切苹果、叠杯子这类极其复杂的双手灵巧操作,在机器人的训练阶段却面临着极其高昂的“数据采集壁垒”。


当机器人需要的数据很难直接采集,传统物理仿真又补不全这些信息时,还有没有别的办法?


在 ECCV 2026 主题为“Visual Perception and Reasoning in the Interactable World”的Workshop上,NVIDIA Research 科学家、UC Berkeley 研究者李柏依(Boyi Li)通过线上连线分享了她近期在这一方向上的两项工作。


她博士毕业于康奈尔大学,师从 Serge Belongie 与 Kilian Q. Weinberger,之后在 UC Berkeley 与 Jitendra Malik、Trevor Darrell 开展研究,目前研究重点包括具身智能中的高效多模态、泛化建模和交互智能系统。


面对这些难以直接采集的数据,她尝试了两条不同的路径:模拟器里没有的声音,可以“生成”出来;机器人身上昂贵的操作数据,也可以从人类视频里获得。


第一条路径是MultiGen。传统物理模拟器已经可以模拟相当逼真的倒水过程,却没有与画面同步的声音。李柏依团队利用现实世界中的视频和音频训练生成模型,再让它为仿真视频补上对应的声音。她将这个思路概括成一句话:“Don’t just simulate physics – generate perception” (不只模拟物理过程,还要生成感知)。


另一条路径是 DexImit。与其大量采集昂贵的双手机器人示范,团队尝试利用人类操作视频,恢复其中手与物体的交互,再将这些交互转化为机器人能够学习和执行的双手操作数据。


一个补上仿真世界里缺失的感知,一个把人类操作转化为机器人可以学习的示范。背后的思路是一致的:机器人训练需要的,不只是把物理世界模拟得更真实,还要把那些难以直接获得的感知和交互信息,变成机器人可以学习的数据。


以下是李柏依的演讲分享,AI科技评论根据其演讲内容进行了不改原意的编辑:


NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026

Efficient Multimodal Intelligence for Embodied Agents in Interactive Worlds(交互世界中的具身多模态智能)


01

机器人为什么需要“听见”世界?


我们一直在研究多模态系统。


现在的多模态已经不只是图像和语言,还包括 3D 几何、声音、嗅觉和触觉等信息。这些模态可以帮助模型进行泛化和推理,也可以用于机器人、医疗等真实场景。


今天我主要分享其中两个与机器人有关的工作。


先从声音开始。


我们先来看一个很有意思的任务。假设现在有一根水管正在往瓶子里倒水,你需要判断什么时候水会溢出来。如果没有声音,只看水管里的水流,其实很难判断瓶子里面发生了什么。


如果把声音加进来呢?


其实在日常生活中,我们一直在利用声音理解周围发生的事情。比如烤肉的时候,我们可以通过声音判断它的状态;玻璃碎了、门打开了、可乐被打开了、水烧开了,我们也可以通过声音知道发生了什么。


声音还能提供空间信息。在小房间、大房间,甚至更大的空间里说话,声音听起来都会不一样。它也可以帮助我们判断物体的材质和状态。比如洗碗的时候,不同材质的杯子、瓶子和盒子会发出不同的声音;有时候我们还会摇一摇薯片罐,通过声音判断里面是不是还有东西。


那机器人能不能也利用声音?


我们希望训练一个机器人策略,让它同时利用视觉、物理信息和声音,更准确地执行任务。要做到这一点,我们首先需要多模态数据。


但真实世界里的这类数据很难采集。


那 simulation 呢?现在的物理模拟器已经可以生成非常逼真的视觉效果。比如倒水,我们能够看到整个物理过程,看起来已经很真实了。


问题是,没有与画面对应的声音。


NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026


如果要训练同时利用视觉、物理信息和声音的机器人策略,我们就需要包含这些信息的多模态数据,而且不同模态之间还要彼此对应。现有的物理模拟器没办法提供这样的音频。


那这些声音从哪里来?


02

MultiGen:

不只模拟物理,还要“生成感知”


我们开始重新看已经拥有的数据。


现实世界里其实有大量同时包含视频和声音的数据,比如 YouTube 等来源的视频。我们把这些视频收集起来,作为 In-the-Wild Data


我们的目标是训练一个 Audio Generative Model:给模型一段视频,让它生成与视频内容对应、并且在时间上对齐的声音。我们选择 diffusion model 作为基础模型,在训练时输入视频,让模型学习生成对应的音频。


NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026


训练完成之后,我们发现这个模型对不同的视频内容有比较好的泛化能力。给它一段视频,它能够生成与画面对应的声音。


接下来,我们把物理模拟器生成的视频输入这个模型,让它生成对应的声音。这样,模拟器负责生成视觉信息和机器人的物理轨迹,生成模型负责补上音频,最后得到一套 Simulated Multimodal Dataset 


NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026


有了这些数据之后,我们就可以进一步训练同时利用视觉和声音的 Multimodal Robot Policy,再把它部署到真实环境中。


我们测试了不同的容器和液体。比如把液体倒进不规则的容器,机器人需要自己判断什么时候停止;换成可乐之后,声音和音高都发生了变化,但机器人仍然可以完成倒水任务。


我们还测试了环境变化。比如在倒水过程中把灯关掉,让视觉受到干扰,机器人仍然能够继续完成任务。我们也加入了背景噪声,在比较嘈杂的环境里,策略仍然能够识别倒水的声音。


为了进一步验证效果,我们比较了两种策略:一种只使用视觉,另一种同时使用视觉和声音。


先看不透明容器。因为无法直接看到容器内部的液体状态,只使用视觉时误差比较大;加入声音之后,误差明显下降。


我们也测试了透明容器。即使在这种情况下,视觉本身已经能够提供更多信息,加入声音之后,性能仍然有所提升。


NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026


我们还做了一个更直接的对比实验。两组实验保持完全相同的设置,一组机器人只使用视觉,另一组同时使用视觉和声音。倒水过程中,我们把灯关掉,等机器人判断应该停止之后,再把灯打开。


只使用视觉的时候,水已经溢出了杯子。


机器人在感知上其实非常脆弱。一旦视觉受到干扰,整个系统就很容易失效。在这种情况下,声音可以发挥很重要的作用,帮助系统变得更加鲁棒。


这也是我们最后想表达的:“Don’t just simulate physics – generate perception.”


不只模拟物理过程,还要生成感知。


NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026


03

DexImit:

机器人数据还能从哪里来?


刚才我们讲的是生成音频信号。


接下来,我们来看另一类与真实世界有关的交互信息:人和机器人怎样与真实世界中的物体发生交互。


这项工作的出发点很简单。我们关注 Bimanual Dexterous Manipulation,也就是双手灵巧操作。它对于通用机器人非常重要,很多真实世界任务都需要两只手和灵巧操作,比如抓取、倒水、使用工具,以及长时序操作。


NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026


但真实机器人上的双手灵巧操作数据,采集起来既昂贵,又耗费人力。


与此同时,人类操作视频几乎是无限的。它们可以来自日常演示,也可以来自视频生成模型,而且这些视频本身就包含了人类操作物体的知识。


那我们能不能直接从人类视频中生成机器人的灵巧操作数据?


这就是我们提出 DexImit 的出发点。它的全称是 Learning Bimanual Dexterous Manipulation from Monocular Human Videos。我们希望从人类视频出发,在仿真中生成模仿这些人类操作的机器人双手数据。


NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026


04

从一段人类视频,到真实机器人


具体怎么做?整个 pipeline 有四个阶段。


NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026


第一步是恢复人手和物体的运动。我们直接从一段单目人类视频开始,进行深度估计、手部姿态估计、3D 生成和物体的 6D pose estimation,最后把这些信息统一到 World Coordinate 中,得到手和物体随时间变化的 4D 交互轨迹。


NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026


但把轨迹恢复出来还不够。一段双手操作视频里,两只手可能同时在做不同的事情,一个长任务里也会连续出现多个动作。


所以第二步我们会把整个过程拆成不同的子任务,再安排两只手分别在什么时候执行什么动作。


NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026


接下来还有一个问题:人的手和机器人的手并不一样。


人的动作不能直接复制给机器人。我们需要根据前面恢复出来的交互,生成机器人真正能够执行的抓取姿态。这里我们会考虑 force closure 等物理约束,再通过 motion planning 生成平滑、无碰撞的机械臂轨迹,最终得到完整的仿真机器人示范。


NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026


得到这些数据之后,我们还会进行 Augmentation。比如改变物体的位置和尺度、相机视角以及 observation,让训练出来的策略能够更好地泛化到真实世界。


数据质量同样很重要。我们还会利用视觉语言模型理解原始的人类操作视频,再检查生成出来的数据是否与原始操作一致。


NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026


那这些生成出来的数据到底能不能用?


我们主要想回答几个问题:生成的数据本身是不是有效?和已有方法相比,能不能得到更好的双手灵巧操作数据?面对更复杂、更长的任务还能不能工作?最后,能不能实现 zero-shot real-world deployment?


我们测试了不同来源和不同难度的人类视频。可以看到,人工采集的数据质量更好;随着任务变得越来越复杂,生成数据的准确性和可用性也会下降。


NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026


我们还和已有方法进行了比较。对于真实世界里更加复杂的任务,比如制作饮料、烹饪、切苹果和叠杯子,仅仅把视频中的动作恢复出来是不够的。尤其是 long-horizon、fine-grained、contact-rich tasks,我们需要比较准确的 reconstruction,同时还要保证生成出来的动作交互在物理上是合理的。


比如切苹果,机器人不仅需要准确判断苹果的位置,还要控制切下去的力量,同时保证抓取足够稳定。


NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026


NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026


最后,我们进一步测试了 zero-shot real-world deployment。


为了让策略更好地泛化到真实环境,我们会对物体位置和尺度、相机视角以及 observation 做 augmentation。我们也做了 ablation study,分别改变其中一些设置。结果可以看到,完整方法的表现最好,这些 augmentation 对真实世界部署非常重要。


NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026


我们把 DexImit 生成的数据部署到了真实机器人上。


当然,DexImit 目前还有一些限制。


首先是柔性物体和关节物体。现在的 3D 生成阶段主要依赖 SAM 3D,它假设的是刚性物体几何,目前还不能很好地处理柔性物体或者带有关节结构的物体。未来可能需要更先进的 geometry reconstruction 或 generative modeling 来解决这个问题。


第二是移动操作。现在的方法主要面向桌面上的双手操作。如果机器人需要一边移动、一边操作物体,还需要进一步建模机器人本体的运动和环境动态。


第三是长视频。整个 pipeline 由多个模块连续执行,误差可能会随着时间不断累积。视频越长,这个问题越明显。有些情况下还是需要人工介入,比如调整基于 VLM 的子任务分解,或者修正重建过程中出现的问题。


最后是手内操作,比如在手里旋转一个橙子。这类任务中,手和物体之间会产生非常严重的遮挡,单目视频能够提供的信息有限,目前 DexImit 也没有专门针对这种情况设计机制。


NVIDIA 李柏依:机器人只会「看」还不够,它还得学会「听」| ECCV 2026


我们的代码已经开源,大家感兴趣的话也可以进一步尝试。


05

Q&A 现场问答


Q1(现场观众):有没有哪些特定的噪声或声音,会对机器人策略产生负面影响?或者有些声音对人类有用,但机器人却无法利用?


李柏依: 这是一个很好的问题,我们也一直在思考。比较有意思的是,我们在训练时其实没有做任何噪声增强(noise augmentation),但模型在有背景噪声的情况下依然比较鲁棒。我们猜测,可能是因为音频本身是一维信号,不同声音之间比较容易区分。比如模型训练过倒水的声音之后,即使环境中同时出现其他声音,也可以把不同的声音区分开。当然,这只是我们目前的推测。


Q2(现场观众):有没有一些任务,即使加入声音,对机器人也没有什么帮助?


李柏依: 这个我们还没有测试。但很容易想到声音在哪些任务里发挥作用。比如当视觉信息受到干扰的时候,声音就很重要。对于其他任务,比如拿起一个杯子或者拿起手机,声音可能就没有那么重要。通常我们并不需要依靠声音去抓取手机或者杯子。


文章来自于"AI科技评论",作者 "张岂萍"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI数据分析

【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。

项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file

本地安装:https://www.deepbi.com/

【开源免费airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。

项目地址:https://github.com/hitsz-ids/airda

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md