让机器人学会视频里的真实交互:大晓 HSImul3R 打通 Real-to-Sim-to-Real
创始人
2026-09-08 16:39:36
0

一段人坐上椅子的视频,对人类而言再普通不过。我们不仅能看见“人坐了下来”,还天然理解椅子承受人体重量,人与椅面形成接触并最终稳定,这些重力、接触与作用关系共同构成真实世界中的物理交互。但对今天的三维重建系统而言,“看见动作”与“重建真实交互”仍是两回事。一个视觉上准确坐在椅子上的人体,进入物理仿真后,椅子可能因结构缺失倒下,人体也可能与椅面严重穿模。视觉上成立,并不意味着物理交互上成立。

近日,大晓机器人联合南洋理工大学S-Lab、上海人工智能实验室发布全新人–场景交互重建研究HSImul3R,直指三维视觉长期存在的“感知—仿真鸿沟”,推动三维重建从“视觉正确”走向“物理可执行”。该成果已被全球计算机视觉顶级会议ECCV 2026 正式接收。不同于传统方法主要关注人和场景是否重建得像、是否对齐,HSImul3R将重力稳定性、真实接触与交互稳定性纳入核心评价标准。团队将其定义为首个面向非标定稀疏视角输入、实现稳定可仿真(Simulation-Ready)人–场景交互重建的框架,并进一步支持单目视频输入。与此同时,团队构建了面向人–场景交互的HSIBench,直接检验重建结果能否在物理仿真中稳定交互。HSImul3R在Easy、Medium、Hard三档任务中的交互稳定率分别达到53.68%、30.56%和13.92%,显著高于HSfM的10.52%、4.50%和2.66%,并将人–场景三维穿模率从69.51%降至22.90%。

为实现这一目标,HSImul3R提出物理闭环(Physics-in-the-Loop)双向优化框架,让物理仿真器从最终检验工具变成重建过程中的主动监督者。一方面,通过面向场景的强化学习(Scene-targeted Reinforcement Learning)优化人体运动,使其既物理可行,又能与当前场景稳定交互;另一方面,通过直接仿真奖励优化(Direct Simulation Reward Optimization,DSRO),利用交互后的仿真反馈反向优化三维场景。最终,团队将优化后的人体动作迁移至UnitreeG1 人形机器人,贯通日常图像/视频→ 三维人–场景交互重建→ 物理仿真优化 →人形机器人动作迁移→ 真实机器人执行的完整链路,让人类视频中的交互经验从视觉信息进一步转化为可仿真、可学习、可执行的机器人技能资产。

Paper:《HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human–Scene Interactions》

ArXiv: https://arxiv.org/abs/2603.15612

Project: https://yukangcao.github.io/HSImul3R/

GitHub: https://github.com/yukangcao/HSImul3R

从“视觉正确”到“物理成立”:重新定义三维重建

近几年,三维重建、人体运动估计与人–场景交互建模持续发展,机器从图像和视频中恢复三维世界、理解人类行为的能力不断提升。但传统方法大多仍以几何准确、姿态还原和视觉对齐为主要标准,回答的更多是“人和场景重建得像不像”。问题在于,机器人最终面对的是一个由重力、碰撞、摩擦与接触共同决定的物理世界。一个视觉上高度可信的场景,进入仿真器后可能立即失效:椅子可能因为结构缺失无法站稳,人体与物体也可能发生穿模,原本看似正确的交互因此无法真正成立。

HSImul3R概览图

HSImul3R因此将评价标准从“视觉正确”进一步推进到“物理成立”,把重力稳定性、真实接触和交互稳定性纳入重建过程。它不再只要求人和场景在画面中对齐,而是要求重建结果能够真正进入物理仿真,并保持原有的人–场景交互关系。更关键的是,HSImul3R并非先完成重建、再用仿真器验证,而是提出物理闭环(Physics-in-the-Loop)双向优化机制,让仿真反馈直接参与重建。正向过程优化人体,反向过程修正场景,物理仿真器由最终的“裁判”转变为整个重建过程中的主动监督者。

不只是动作可行,更要让交互真正成立

物理闭环的第一步,是让恢复出来的人体运动真正适应当前场景。传统动作跟踪与强化学习通常更关注人体自身是否稳定、动作是否接近原始轨迹,但即使人体动作在物理上成立,也可能已经偏离原有的人–物交互关系。例如,一段“坐在椅子上”的动作经过普通运动优化后,人体可能为了保持平衡而偏离椅子。人虽然没有摔倒,但“坐椅子”这一原本的交互已经消失。对于具身智能而言,只做到“动作可行”显然还不够。

去除面向场景的强化学习,仿真中出现非预期的物体位移,且难以稳定交互

为此,HSImul3R提出面向场景的强化学习(Scene-targeted Reinforcement Learning),在运动跟踪基础上进一步加入场景交互约束。系统通过人体关键接触点与物体表面的空间关系,使优化后的动作既忠实于原始观测,又能与当前场景保持正确、稳定的接触。也就是说,HSImul3R优化的不是一条抽象意义上“符合动力学”的人体轨迹,而是一段能够在特定场景中真正成立的物理交互。“坐下”意味着人必须真实坐到这把椅子上,而不是只在空间中复现一个相似动作。

用真实交互反过来优化三维世界

但仿真失败并不一定意味着“人动错了”,也可能是场景本身没有重建正确。尤其在人类遮挡严重、桌腿或椅腿等结构较细的场景中,图像生成三维模型(Image-to-3D)容易产生结构缺失或几何畸变,即使人体动作合理,也无法支撑真实交互。针对这一问题,HSImul3R在反向过程中提出直接仿真奖励优化(Direct Simulation Reward Optimization,DSRO),直接利用物理仿真的交互结果作为监督信号,反向优化三维物体生成模型。评价标准也由“物体自己能不能站稳”,进一步提升为“人与它交互之后还能不能稳定”。

图像到三维物体重建的定性对比

团队将仿真反馈划分为从“物体在重力下失稳”到“人与物体实现稳定交互”的四种状态。只有当物体自身稳定、交互后仍保持稳定,并且人与物体之间确实形成有效接触时,重建才被认为真正成立。因此,一把椅子即使单独放在地面上不会倒,如果人坐上去就倾覆,或者人与椅子最终完全分离,它仍然没有被真正“重建对”。HSImul3R由此把评价标准从“物体自身是否物理合理”推进到“物体在人–场景交互中是否物理合理”,让人类交互本身成为优化三维世界的重要监督信号。

HSIBench:不只看“像不像”,更要看“能不能交互”

为了验证这一新的评价体系,团队进一步构建了面向人–场景交互的HSIBench。数据集包含19个场景物体、超过50段人体动作序列和300个独立交互实例,由3名参与者完成,每个案例均从16个视角同步采集。与传统三维重建基准更多关注几何误差不同,HSIBench将人–场景交互稳定性(Stability-HSI)作为核心指标之一,不仅判断物体在重力下能否稳定,还要求整个交互进入仿真后保持稳定,并保留有意义的人–物接触。换句话说,三维重建不仅要通过“视觉和几何考试”,还要真正通过“物理实操”。

HSIBench示例及HSImul3R对应的仿真结果

实验结果显示,在Easy、Medium和Hard三档任务中,HSImul3R的人—场景交互稳定率分别达到53.68%、30.56%和13.92%,而HSfM分别为10.52%、4.50%和2.66%;人—场景三维穿模率也从HSfM的69.51%降至22.90%。这些结果意味着,当三维重建真正服务于具身智能时,“渲染得足够真实”已经不再是终点。重建出来的世界,还必须能够承受机器人真实的动作与交互。

从人类视频到真实机器人,让交互经验真正被“学会”

如果HSImul3R最终只停留在稳定的物理仿真,它仍然只是完成了从真实世界到仿真的迁移(Real-to-Sim)。这项工作的另一关键一步,是进一步将经过物理优化的人体动作迁移到真实人形机器人上,实现从仿真到真实世界(Sim-to-Real)。团队首先将优化后的人体运动重定向至UnitreeG1,再以这些动作作为先验,在仿真环境中训练全身控制策略,最终直接部署到真实G1上,使机器人能够在现实环境中复现相应的人—场景交互。

部署于UnitreeG1 人形机器人上的仿真到真实(Sim-to-Real)结果

至此,一段人类视频中的行为完成了完整转换:从图像或视频中恢复三维人—场景关系,通过物理仿真修正那些“视觉上合理、物理上无法成立”的部分,再将人体动作转化为机器人能够学习的动作先验,最终由真实机器人重新执行。这也打开了一条更具想象力的路径。互联网中已经存在规模巨大的人类行为视频,如果其中的人–场景交互能够被持续重建、物理验证并迁移到不同机器人本体,这些视频就不再只是供机器“观看”的视觉数据,而可能成为机器人学习真实物理技能的重要来源。

当然,这条路线仍处于早期阶段,复杂交互、多物体场景和动态环境依然存在大量挑战。但HSImul3R已经给出一个重要方向:机器人从人类视频中学习的,不应只是“人看起来怎么动”,更应该是这个动作为什么能够在真实物理世界中成立。从视觉重建到可仿真重建,从人体动作到人—场景交互,再从真实世界到仿真、最终回到真实机器人,HSImul3R正在推动人类视频从视觉信息进一步转化为可仿真、可学习、可执行的机器人技能资产。

关于大晓机器人(ACE ROBOTICS)——让机器人拥有聪明的“大脑”和有趣的“灵魂”

大晓机器人(ACEROBOTICS)是加速具身智能智慧跃迁的机器人公司,由商汤科技联合创始人、执行董事王晓刚出任董事长,世界级AI科学家陶大程院士担任首席科学家,公司汇聚全球稀缺的青年AI科学家及来自产业界的卓越专家,共同深耕具身智能领域,旨在通过突破性技术创新,对具身智能场景的深刻洞察,推动机器人自主理解和探索物理世界,加速具身智能的商业化场景落地。

大晓机器人首创ACE研发范式,构建“环境式数据采集—开悟世界模型3.0—泛化具身模组”的全链路技术体系。大晓机器人以全时空多视角环境采集为引擎,国内首个开源且已实现商业应用的“开悟”世界模型3.0(Kairos3.0)和具身基模型为技术基座,解决具身智能行业目前面临的数据荒、常识差、泛化难、通用性不足等核心挑战。大晓机器人同步重磅推出“具身超级大脑模组A1”,加速具身智能在安防、巡检、服务等多元场景的规模化、商业化落地。

大晓机器人不仅是技术的开拓者,更是生态的共建者。大晓机器人通过与顶尖的芯片厂商、硬件厂商、云服务商及垂直场景伙伴的战略合作,共同打通“模型—硬件—场景”的产业闭环,提供标准化与定制化结合的解决方案,共同成为具身智能领域极具潜力的中国创新力量。

相关内容

“世界小米之乡”进入丰收季...
中新网赤峰9月8日电 题:“世界小米之乡”进入丰收季:百万亩谷子开...
2026-09-08 17:21:32
银华心怡灵活配置混合过去一...
近日,银华心怡灵活配置混合型证券投资基金2026年中期报告显示,报...
2026-09-08 17:21:09
闽山消防地上消火栓获消防认...
近日,应急管理部消防产品信息查询系统显示,福建闽山消防有限公司旗下...
2026-09-08 17:20:53
微信视频号相关功能已全部恢...
  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力...
2026-09-08 17:20:42
受贿1.48亿余元,山西省...
9月8日,河南省信阳市中级人民法院一审公开宣判山西省委原副书记、省...
2026-09-08 17:20:32
智飞生物:司美格鲁肽注射液...
转自:证券时报人民财讯9月8日电,智飞生物(300122)9月8日...
2026-09-08 17:20:21
闽山消防地上消火栓获消防认...
近日,应急管理部消防产品信息查询系统显示,福建闽山消防有限公司旗下...
2026-09-08 17:20:11
投资者提问:你好,截止8月...
投资者提问:你好,截止8月底股东户数多少董秘回答(三全食品SZ00...
2026-09-08 17:20:00
恒指摩利八甲牛F,恒指摩利...
【摩根士丹利亚洲产品:四只恒生指数牛熊证触发强制赎回】Morgan...
2026-09-08 17:19:49

热门资讯

“世界小米之乡”进入丰收季:百... 中新网赤峰9月8日电 题:“世界小米之乡”进入丰收季:百万亩谷子开镰收割作者 奥蓝 端木金秋时节,在...
银华心怡灵活配置混合过去一年盈... 近日,银华心怡灵活配置混合型证券投资基金2026年中期报告显示,报告期末基金份额持有人户数合计为20...
闽山消防地上消火栓获消防认证有... 近日,应急管理部消防产品信息查询系统显示,福建闽山消防有限公司旗下的地上消火栓产品已顺利通过合规认证...
微信视频号相关功能已全部恢复   炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会! (来源:界面新闻)@...
受贿1.48亿余元,山西省原省... 9月8日,河南省信阳市中级人民法院一审公开宣判山西省委原副书记、省政府原省长金湘军受贿一案,对被告人...
智飞生物:司美格鲁肽注射液申请... 转自:证券时报人民财讯9月8日电,智飞生物(300122)9月8日公告,近日,公司控股子公司重庆宸安...
闽山消防地上消火栓获消防认证有... 近日,应急管理部消防产品信息查询系统显示,福建闽山消防有限公司旗下一款地上消火栓产品已顺利通过相关合...
投资者提问:你好,截止8月底股... 投资者提问:你好,截止8月底股东户数多少董秘回答(三全食品SZ002216):您好,请将您个人的身份...
恒指摩利八甲牛F,恒指摩利八乙... 【摩根士丹利亚洲产品:四只恒生指数牛熊证触发强制赎回】Morgan Stanley Asia Pro...
兴业控股(00132)附属与广... 兴业控股(00132)发布公告,于2026年9月8日,公司附属公司绿金租赁与承租人(广东荣天环保发展...