智能体世界仿真与建图

AWSM

读作 “awesome”

把真实空间,变成虚实融合智能体可以使用的世界。

Phygital = physical(物理)+ digital(数字),即虚实融合。

发布于

一个场景可以看起来合理,却在空间上是错的。

Agentic 重建由大模型检查观测、调用建模工具,并迭代构建和验证可编辑场景。挑战不只是生成一个令人信服的房间,还在于保留尺度、形状与空间关系,让结果在渲染之外仍然有用。AWSM 研究如何用几何证据约束这一过程,让输出成为下游智能体更忠实的空间参照。

我们对 NVIDIA Isaac Sim 中的 World Lobby 仿真场景,沿四条完整工程路径进行重建:从纯 RGB 建模,逐步加入估计位姿、深度与真实相机位姿。每条路径交付的是冻结的 Blender 场景,而不只是点云或新视角渲染器。实验关注的不是谁生成了最漂亮的单帧,而是几何证据究竟带来了什么、没有解决什么,以及哪些误差会穿过对象化建模继续存在。

0.376 → 0.072 m双向表面误差相对降低约 81% · M1 → M4
16.44% → 7.60%模型深度绝对相对误差(AbsRel)· 180 个评估视角相对降低约 54% · M1 → M4

单场景 M1 → M4 诊断性对比:M1 使用真值辅助的 Sim(3) 配准,M4 使用真值相机位姿。相对降幅比较的是完整管线,而非 IMU 的独立贡献。

从看起来合理的重建,到可以使用的空间参照

负责重建的智能体可以搭建一个看似合理的房间,却重建错转角、距离或通道。对具身智能体而言,这些不只是视觉缺陷,还会改变目标的位置与身体可以通过的路线。几何锚定,是在信息可用时以位姿、深度与米制证据约束建模过程,而非仅依赖视觉合理性。关键问题是:这些约束如何在观测转化为可编辑对象的过程中得到保留?

前台任务让这种联系变得具体:在重建地图中标记目标、设定路线,再由机器人控制器执行。本文用“场景表示”指可编辑的对象与几何,用“地图”描述它在导航中的作用,用“仿真资产”描述它与仿真器的集成。AWSM 中的“世界”指这种可复用的空间环境,而非学习得到的动力学预测模型。连接导航、记忆、交互与仿真的持久空间基础是长期目标;当前实验和 demo 分别研究其几何基础,并展示一种下游用途。

本文贡献

  1. 对几何锚定的 agentic 重建开展四路线研究:固定场景、同一组 180 帧 RGB 输入、建模目标与可编辑输出格式,比较具有不同几何证据的完整管线。
  2. 将轨迹误差、原生深度、最终场景深度、表面几何和渲染外观分开评测,并提供冻结 Blend/GLB 资产、可复现评测子集、公开哈希与交互式对照。
  3. 通过基于地图的多机器人仿真示例,将重建场景连接到目标标记、预设路线和控制器执行;它展示下游用途,而非不同重建路线之间的受控导航对比。

几何锚定:真实尺度是必要约束,但不是全部答案

纯单目投影几何存在全局尺度歧义;学习型米制深度提供有用先验,却不是对每个真实尺寸的独立测量。标定 RGB-D、已知基线或长度,以及视觉惯性估计,都可以提供米制约束。IMU 融合能在运动激励充分、初始化、偏置估计、时间同步与标定可靠时恢复米制运动;IMU 不是直接测距传感器,“带 IMU”不等于“尺度一定准确”。

尺度、局部形状、相机位姿和可通行连通性需要分别检查。弯曲转角被简化成直角,不能只靠缩放修复。位姿条件可以改善深度重建,但 DA3 消融和本文 M2/M3 的结果都不支持“所有深度指标必然同步改善”;下文四条路线是完整系统比较,而非只切换 IMU 的单变量实验。

VINS-Mono · DA3 位姿条件消融

一个 agentic 工作流,四条重建路线

负责重建的智能体遵循共同的“观察—构建—验证”循环:检查可用证据,编写 Blender Python 构建对象,渲染检查视图,并在冻结评测前迭代修改。这里的 agentic 指这种工具驱动的建模过程;下游机器人控制器承担另一种角色。

四条路径使用相同的 180 张 RGB 身份和相同的 Astra–Blender 建模目标。M1 检验没有米制测量时视觉先验能走多远;M2 加入 RGB-only ViPE 位姿与 pose-conditioned DA3 深度;M3 使用 ORB-SLAM3 单目惯性位姿与同类 DA3 观测;M4 提供 GT 相机位姿,用于诊断剩余建模误差,但建模时不读取 GT 网格或 GT 深度。

Table 1.

Agentic 重建闭环

01 · 观察检查全部 180 张 RGB;在允许的方法中读取位姿条件下的 DA3 几何。
02 · 建模编写 Blender Python,将房间拆解为命名对象、材质、相机与碰撞代理。
03 · 验证在固定修订相机上比较成对 RGB 与 optical-Z 渲染,并在固定版本预算内修改。
04 · 冻结在作者看到任何 GT 评分前,导出 Blend/GLB、manifest、语义 ID 与哈希。
05 · 评测在同一冻结协议下分别测量位姿、原生深度、模型深度、表面距离与外观。

所有场景冻结后才引入真值。M2/M3 只使用一次全局 SE(3) 配准,尺度固定为 1;不进行 mesh ICP 或逐视角拟合。M1 没有原生米制轨迹,其模型空间指标使用由 5 个手工相机关联得到、冻结不变的 GT-assisted Sim(3),因此只能解释形状与显示误差,不能视为米制恢复。

比排行榜更重要的三个发现

FINDING 01

1. 更好的位姿不会机械地带来更好的原生深度

M3 的轨迹优于 M2:ATE 从 0.167 m 降至 0.121 m,旋转误差从 0.31° 降至 0.19°;但 M3 的原生 DA3 AbsRel 反而略差(20.38% 对 19.06%)。经过建模后,排序再次反转:M3 的模型深度 AbsRel 为 8.37%,优于 M2 的 9.29%。上游指标与最终场景忠实度相关,却不能彼此替代。

Table 2.
Trajectory, native depth, and model depth
Figure 1. 上游轨迹与原生深度的排序,并不会一一映射为冻结场景的深度排序。

FINDING 02

2. 几何证据把“合理布局”约束成更忠实的空间

在声明配准且不使用 mesh ICP 的条件下,双向表面误差从纯 RGB 诊断基线的 0.376 m,依次降至 ViPE 的 0.118 m、ORB-SLAM3 的 0.082 m 与 GT 位姿的 0.072 m。M4 在本案例中拥有最强几何,而 M3 依靠估计轨迹已经缩小了大部分差距。

Table 3.

FINDING 03

3. 定性比较

不只看汇总指标,也检查重建场景

在共享相机中将每个重建与 GT 对照:先从 M1 观察语义上合理的房间如何偏离米制布局;再比较 M2/M3,寻找几何改善但 RGB 相似度未同步提升的区域;最后检查 M4,把相机位姿不再是瓶颈后仍然存在的建模与材质误差分离出来。

M1 to M4 and input GT across five fixed views
Figure 2. M1–M4 与输入 GT 在五个固定视角下的并排比较。

旋转、缩放,检查冻结场景

M4GT

滚动到此处加载三维对比。

Figure 3. 所选冻结模型与 GT 共用同一相机和完整 viewport;网页运行时隐藏顶棚与四周墙体,以相同剖视方式检查,源模型文件保持不变。
Selected frozen model rendering

M1 / 视角 0

Input GT RGB

INPUT / GT RGB

Figure 4. 同一所选视角下的冻结模型渲染与输入 GT RGB。

网页只在运行时隐藏顶棚与四周墙体,以便剖视检查;运行时配准与显示选择不会修改可下载的冻结 GLB 或 Blend 文件。

几何锚定改变了什么,又没有解决什么

建模像一种结构化、同时有损的正则化

在共享的 180 视角协议下,M2–M4 的最终场景深度都显著接近 GT:相较原生 DA3,AbsRel 约下降 51–60%。一种可能解释是,对象级聚合抑制了局部不一致预测;但这仍是假说,而非受控因果结论。同一种抽象也可能删除真实表面与细节。

测量约束生成,却不会自动解决外观

几何最强的路径并未统治 PSNR 或 SSIM。位姿消除了一类不确定性,外观仍受材质估计、照明、物体细节与渲染器差异支配。只评 RGB 会漏掉空间进步,只评几何也会漏掉感知失败。

100 视角检查衡量一致性,而不是未见视角泛化

Table 7 使用一组固定随机种子的 100 个相机,它们从固定 5 帧之外的 175 张建模帧中抽取。这些视角相对固定检查是额外视角,但其 RGB 在建模阶段可见。在该集合上,M4 的深度 AbsRel 最低(7.47%),M3 的 RMSE 最低(1.090 m)。

Model-depth error at five fixed evaluation views
Figure 5. 固定 5 视角检查中的模型深度误差;青绿色表示缺失或无效预测。
Table 6.
Table 7.

走出仿真大厅:手机采集空间中还剩下什么?

Office Café 不是 World Lobby 基准的第二次运行,也不构成同协议的定量验证。它是一个真实采集的外部案例,用于展示对象化场景、求解后的原视频相机轨迹、视频—模型对照与物理回放如何组合成一个可检查的空间产物。作者观察到的一类失败是:真实的弯曲转角被简化成方正结构。它提醒我们区分局部形状与全局尺度——尺度正确并不能自动修复形状错误;这里将其作为定性观察,而非另一组定量结果。

打开原始交互网页

交互模型: 来自已发布模型渲染视频的本地预览。
交互模型

来自已发布模型渲染视频的本地预览。

摇晃实验: 来自已发布较强摇晃回放的本地预览。
摇晃实验

来自已发布较强摇晃回放的本地预览。

链接通过 lang=en 请求英文,实际语言与可用性由外站控制。这里展示的是本地内容预览,并非外站页面截图。若嵌入不可用,可使用全屏外链,或查看下方本地模型与视频。

原有模型输入为视频与估计深度;拖动旋转、右键平移、滚轮缩放。
旧模型输入仅为视频;该旧版布局未按 ViPE 扫描重新标定。

两个模型默认采用俯视剖切视图,仅在显示时裁去上部遮挡,以展示室内布局;点击“剖切视图”可切换完整模型,“重置视角”可恢复总览。原始坐标、材质和模型文件保持不变。联动旋转用于观察布局,不代表几何配准。

输入视频原始手机拍摄视频。
程序化模型沿原视频相机轨迹渲染的模型。
点云沿相同轨迹渲染的扫描点云。
00:00 / 01:10

同步播放 · 70.1 秒 · 30 fps

较强地震效果场景中的物体均可交互,柜门可以打开;此段展示较强摇晃下的物理响应。

一张重建地图,一个目标,一次具身执行。

这个 demo 在 NVIDIA Isaac Sim 中将重建连接到下游使用:在导航地图中标出前台,设定路线,再让无人机、人形、四足和轮式机器人执行任务。同一个空间参照连接目标、路径约束与运动控制:从可以查看的重建场景,走向可以用于行动的地图。

任务意图:让机器人前往前台,并在那里排成一列。
  1. 01任务指令
  2. 02地图上定位前台
  3. 03设定导航路线
  4. 04控制器执行
基于重建地图的仿真导航 · 预设路线 · 仿真器位姿反馈。作者确认,本演示已完成人工审阅。
标出前台与航点的四机器人路线设计图;静态设计,非执行轨迹
导航地图。 在重建场景中标出前台与规划路线。这是静态设计图,而非实跑轨迹;点击查看原尺寸地图。
演示条件与范围

上方指令说明任务意图,不代表本次演示实现了语言到计划的自动解析。路线人工设定,并同时参考 M4 重建地图和原始几何筛选;这不是只依赖重建图的规划 benchmark。

成片为 156 秒、1× 原速:场景(0–6秒)、重建(6–12秒)、路线设计(12–18秒)、导航(18–156秒)。导航来自新运行 20260930-214924,略去开头等待的 12.32 秒,后续终点保持过程不在本剪辑中。地图是静态路线设计图,不是实测执行轨迹。

本 demo 不评测在线视觉定位、学习型指令理解、记忆检索或真实机器人迁移。这些是独立能力,不改变本演示所表达的“利用重建地图执行导航任务”。

人工展示审阅与下方保留的历史自动检查属于不同验证层次,不改变其原始判定。

历史自动检查记录 ↗

边界本身也是结果的一部分

  • 一个合成场景、每条路径一次工程运行,不能建立一般优越性或统计显著性。
  • 四条路径是完整系统,而非严格的单变量消融;M2 与 M3 的差异不能只归因于 IMU。
  • M4 使用 GT 相机位姿,是诊断路线,不是可部署基线,也不是理论上界。
  • M1 模型空间指标依赖 GT-assisted Sim(3),不能与原生米制恢复混为一谈。
  • 100 视角外观与深度集合包含建模 RGB 输入,不是 held-out novel-view benchmark。
  • 外观指标混合了几何、材质、照明与渲染误差;M4 revision 4 尚未完成完整独立视觉复审。
  • 前台 demo 展示基于地图的仿真执行,不是 M1–M4 的受控导航对比。路线预先设定,定位使用仿真器位姿;具体范围见演示条件。
  • 多模态空间记忆、长期地图维护与策略 sim-to-real 差距的降低是研究目标,不是这段四机器人视频已量化的结果。本页也没有 Office Café 拐角的同视角 GT 定量测量。
  • 历史下游文档对同一 M4 Blend 哈希使用了不同的深度前端描述。本页冻结表格与资产保持不变;将旧任务收益归因于 DA3 之前,需要核对上游方法命名,详见来源说明。

所有表格都由冻结资产生成;公开 manifest 提供模型哈希、配准、固定视角与固定随机评测索引。

版本与资产来源说明 ↗

引用本文

如果本研究的受控实验、冻结资产或评测协议对你的工作有帮助,请引用下面的交互式研究文章。

@misc{awsm_2026,
  title        = {{AWSM}: Agentic World Simulation and Mapping},
  author       = {{Phygital AI}},
  year         = {2026},
  howpublished = {Interactive research article},
  url          = {https://phygital-ai.github.io/agentic-world-simulation-and-mapping/},
  note         = {Reconstruction benchmarks, editable scene assets, and map-based embodied demonstration}
}
下载 BibTeX 引用

参考文献

  1. AHa-3D: Agentic Tool Use for Real2Sim with GPT-6 Astra.
  2. ViPE: Video Pose Engine for camera motion and near-metric geometry.
  3. Campos et al. ORB-SLAM3: An Accurate Open-Source Library for Visual, Visual–Inertial, and Multimap SLAM. IEEE Transactions on Robotics, 2021.
  4. Depth Anything 3: Recovering the Visual Space from Any Views.
  5. Wang et al. Image Quality Assessment: From Error Visibility to Structural Similarity. IEEE Transactions on Image Processing, 2004.
  6. Zhang et al. The Unreasonable Effectiveness of Deep Features as a Perceptual Metric. CVPR, 2018.
  7. Blender Foundation. Blender: Free and Open Source 3D Creation Suite.
  8. Qin et al. VINS-Mono: A Robust and Versatile Monocular Visual-Inertial State Estimator. TRO, 2018.
  9. Keetha et al. MapAnything: Universal Feed-Forward Metric 3D Reconstruction. 2025.
  10. Zhou et al. Memory Over Maps: 3D Object Localization Without Reconstruction. 2026.
  11. Yang et al. 3D-Mem: 3D Scene Memory for Embodied Exploration and Reasoning. 2024.
  12. Khanna et al. GOAT-Bench: A Benchmark for Multi-Modal Lifelong Navigation. CVPR, 2024.
  13. ConceptGraphs: Open-Vocabulary 3D Scene Graphs for Perception and Planning. ICRA, 2024.
  14. Clio: Real-time Task-Driven Open-Set 3D Scene Graphs. RA-L, 2024.