详细介绍
产品定位
LingBot-Map 是蚂蚁集团灵波(Robbyant)团队开源的流式三维重建基础模型,相关论文 Geometric Context Transformer for Streaming 3D Reconstruction 被 ECCV 2026 接收为 Oral。它面向视频或图像序列的实时场景重建,以基础模型形态提供可商用、易部署的三维感知能力,帮助研究者和开发者快速构建地图、位姿与深度相关应用。
核心功能
工具支持输入图片文件夹或视频文件,直接输出带逐点置信度的点云、相机位姿与深度图。它采用前馈式推理,无需迭代式离线优化,可从连续画面中重建场景;同时提供自动去天空、关键帧间隔与窗口模式处理超长序列,并给出 long、平衡、stage1 三个权重版本,方便按精度与效率取舍。
技术特点
LingBot-Map 基于 Geometric Context Transformer(GCT)架构,借助分页 KV cache 注意力,在 518×378 分辨率下可对超过 10000 帧的序列做到约 20 FPS 实时处理。通过锚点上下文、位姿参考窗口与轨迹记忆抑制漂移,它提升了长序列稳定性;还可选 FlashInfer 加速、CPU 卸载降低显存。模型权重在 HuggingFace 与 ModelScope 免费下载,GitHub 星标约 1.7 万,Apache 2.0 协议可商用,社区已有 Apple Silicon Mac 桌面查看器、Pinokio 一键启动器、RTX 4060 8GB 适配等衍生项目。
适用场景
LingBot-Map 可用于测绘、自动驾驶、机器人、数字孪生、三维内容创作等方向。它适合需要从视频或图像序列快速获得点云、相机位姿和深度信息的任务,也适合在长序列、实时性和显存受限条件下进行三维重建实验与产品原型开发。









