Mapeo semántico de vocabulario abierto mediante 3D Gaussian Splatting
DOI:
https://doi.org/10.17979/ja-cea.2026.47.13803Palabras clave:
Robots móviles, Percepción y sensado, Construcción de mapas, Robótica inteligente, Aprendizaje automáticoResumen
Los mapas semánticos de vocabulario abierto son clave para la autonomía de los robots móviles en entornos complejos no estructurados. Comparados con las técnicas tradicionales, los mapas semánticos de vocabulario abierto representan una mejora, ya que no están limitados por un conjunto predefinido de categorías de objetos. Para su construcción, las representaciones geométricas basadas en 3D Gaussian Splatting con descriptores semánticos de bajo nivel han ganado popularidad. Sin embargo, la operativa robótica exige etiquetas de alto nivel, como descripciones textuales y categorías. En este trabajo presentamos una evolución de OpenSplat3D que integra Modelos de Visión-Lenguaje a Gran Escala (LVLMs) para la descripción y categorización de instancias de objetos, cuya coherencia es validada en el espacio latente de Modelos de Visión-Lenguaje (VLMs). Adicionalmente, optimizamos la reconstrucción geométrica mediante una inicialización densa y el uso de una función de pérdida basada en la profundidad. Ambas propuestas se validan empleando los conjuntos de datos Replica y ScanNet, obteniendo mapas precisos enriquecidos semánticamente.
Referencias
Ambrosio-Cestero, G., Matez, J., Ruiz-Sarmiento, J., Gonzalez-Jimenez, J., 2024. Container based architecture for mobile robotics. En: Actas de las XLV Jornadas de Automática.
Dai, A., Chang, A. X., Savva, M., Halber, M., Funkhouser, T., Nießner, M., 2017. ScanNet: Richly-annotated 3d reconstructions of indoor scenes. En: Proc. CVPR, pp. 5828–5839.
Kerbl, B., Kopanas, G., Leimkühler, T., Drettakis, G., 2023. 3D Gaussian Splatting for real-time radiance field rendering. ACM Trans. Graph. 42 (4), 1–14.
Kirillov, A., Mintun, E., Ravi, N., Mao, H., Rolland, C., Gustafson, L., et al., 2023. Segment anything. arXiv preprint arXiv:2304.02643.
Li, H., Wu, Y., Meng, J., Gao, Q., Zhang, Z., Wang, R., Zhang, J., 2025. InstanceGaussian: Appearance-semantic joint gaussian representation for 3d instance-level perception. En: Proc. CVPR.
Matez-Bandera, J.-L., Ojeda, P., Monroy, J., Gonzalez-Jimenez, J., Ruiz-Sarmiento, J.-R., 2024. Voxeland: Probabilistic instance-aware semantic mapping with evidence-based uncertainty quantification. arXiv preprint arXiv:2411.08727.
Piekenbrinck, J., Schmidt, C., Hermans, A., Vaskevicius, N., Linder, T., Leibe, B., 2025. OpenSplat3D: Open-Vocabulary 3D Instance Segmentation using Gaussian Splatting. En: Proc. CVPR, pp. 5246–5255.
Radford, A., Kim, J. W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., et al., 2021. Learning transferable visual models from natural language supervision. En: Proc. ICML. PMLR, pp. 8748–8763.
Ravi, N., Gabeur, V., Hu, Y.-T., Hu, R., Ryali, C., Ma, T., et al., 2024. SAM 2: Segment anything in images and videos. arXiv preprint arXiv:2408.00714.
Rubio, F., Valero, F., Llopis-Albert, C., 2019. A review of mobile robots: Concepts, methods, theoretical framework, and applications. Int. J. Adv. Robot. Syst. 16 (2), 1–22.
Ruiz-Sarmiento, J.-R., Galindo, C., Gonzalez-Jimenez, J., 2017. Building multiversal semantic maps for mobile robot operation. Knowl. Based Syst. 119, 257–272. DOI: https://doi.org/10.1016/j.knosys.2016.12.016
Straub, J., Whelan, T., Ma, L., Chen, Y., Wijmans, E., Green, S., et al., 2019. The Replica dataset: A digital replica of indoor spaces. arXiv preprint arXiv:1906.05797.
Takmaz, A., Fedele, E., Sumner, R. W., Pollefeys, M., Tombari, F., Engelmann, F., 2023. OpenMask3D: Open-Vocabulary 3D Instance Segmentation. En: Proc. NeurIPS.
Wu, Y., Meng, J., Li, H., Wu, C., Shi, Y., Cheng, X., et al., 2024. OpenGaussian: Towards point-level 3d gaussian-based open vocabulary understanding. En: Proc. NeurIPS, pp. 19114–19138.
Xu, X., Xiong, T., Ding, Z., Tu, Z., 2023. MasQCLIP for open-vocabulary universal image segmentation. En: Proc. ICCV, pp. 887–898.
Zhu, R., Yu, M., Xu, L., Jiang, L., Li, Y., Zhang, T., et al., 2025. ObjectGS: Object-aware scene reconstruction and scene understanding via gaussian splatting. En: Proc. ICCV.
Descargas
Publicado
Número
Sección
Licencia
Derechos de autor 2026 J. Serrano-Mesa, J. Moncada-Ramirez, P. Ojeda, G. Ambrosio-Cestero, J.R. Ruiz-Sarmiento, J. Gonzalez-Jimenez

Esta obra está bajo una licencia internacional Creative Commons Atribución-NoComercial-CompartirIgual 4.0.