COMPUTER VISION
Video-driven 2D Digital Twin
从室内视频生成具有真实尺度的平面图,围绕门体几何、尺度锚定与多视角 BEV 融合开展工作。
- 我的角色
- 代码仓库协调 · Door Detection 与 Multi-view Fusion 贡献者
- 当前状态
- 开发中
- 时间
- 2026
从画面走向可用的空间表示
室内视频呈现的是摄像机视角,而平面图需要统一的俯视表示和有意义的尺度。团队通过模块化管线连接这两种表示:从背景提取、语义分割、单视角 Bird’s-eye View 转换,到多视角融合、门体与尺度推理,最终生成可用于后续运动映射的真实尺度平面图。
让门体检测服务于几何重建
我负责 door-detection 模块,并参与候选 mask 处理、门体下端点估计与尺度锚定。有用的输出不只是“这里有一扇门”:下游重建需要具有几何意义的点,以及建立尺度的参照。这也要求我将检测结果与后续模块所需的坐标和表示方式连接起来。
我的技术贡献:让视觉检测结果能够被下游几何推理真正使用。
把不同视角放到同一张图上
我也参与了单视角 BEV 对齐与多视角融合。已记录的融合模块结合多策略配准、双向闭环检查、稳健的 pose-graph 推理,以及带不确定性输出的像素和 footprint 共识。图像合并不能默认不同视角天然一致,而需要通过这些步骤检验它们能否支持同一个空间解释。
把模块贡献接入团队系统
除了具体模块,我还搭建并管理共享 GitHub 仓库,协调贡献结构与模块接口。项目在 2026 年 8 月记录中仍处于开发阶段。我的职责有清晰边界:仓库协调、门体几何,以及融合部分的贡献;更完整的系统由团队共同构建。
NEXT / LET’S TALK
从这个项目,聊到下一个想法。
想了解技术细节、讨论研究问题,或交流合作机会?欢迎给我发邮件。