【环球网科技报道 记者 李文瑶】9月8日消息,大晓机器人联合南洋理工大学S-Lab、上海人工智能实验室近日发布面向非标定稀疏视角输入、实现稳定可仿真的人-场景交互重建框架HSImul3R,相关成果已被计算机视觉顶会ECCV 2026正式接收。该框架直指三维重建长期存在的“感知-仿真鸿沟”,让机器人不仅“看见”人类动作,更能理解动作背后的物理交互逻辑。

传统三维重建主要追求几何精度和视觉对齐,但重建结果进入物理仿真后往往出现结构失稳、穿模等问题,难以支撑真实交互。HSImul3R提出物理闭环双向优化机制,将重力稳定性、接触与交互稳定性纳入重建标准,让仿真反馈从最终检验变为主动监督。一方面通过面向场景的强化学习优化人体运动,使其在特定场景中物理可行且保持有效交互;另一方面利用直接仿真奖励优化反向修正三维场景,将人-场景三维穿模率从69.51%降至22.90%。
团队同步构建了评测基准HSIBench,涵盖19个场景物体、超50段动作序列。在Easy、Medium、Hard三档任务中,HSImul3R的交互稳定率分别达53.68%、30.56%和13.92%,显著高于对比方法的10.52%、4.50%和2.66%。
进一步地,团队将优化后的人体动作迁移至Unitree G1人形机器人,完成从日常视频到三维交互重建、物理仿真优化、再到真实机器人执行的完整闭环。这意味着互联网海量人类行为视频有望成为机器人学习物理技能的可复用资产,为具身智能的数据来源和技能习得开辟新路径。目前项目论文、代码及演示已公开上线。