Atención multimodal y seguimiento robusto del interlocutor en HRI natural

Autores/as

DOI:

https://doi.org/10.17979/ja-cea.2026.47.13811

Palabras clave:

Robótica inteligente, Interacción multimodal, Percepción y sensado, Robótica móvil, Interacción humano-vehículo

Resumen

Este artículo presenta una arquitectura multimodal diseñada para mejorar la naturalidad en la Interacción Humano-Robot. Para superar las ambigüedades espaciales, se integra una matriz de micrófonos que estima la dirección de llegada del sonido de forma omnidireccional. Esto permite al robot orientarse de forma natural mediante la coordinación de su cabeza y su base móvil. Además, se propone un método de reconocimiento visual eficiente que desplaza el peso computacional del análisis facial continuo hacia un seguimiento de cuerpo completo. Este enfoque utiliza una caché de identidades que logra mantener la identidad del interlocutor ante oclusiones temporales o giros del rostro. El sistema se completa con un agente conversacional gestionado por Grandes Modelos de Lenguaje y un módulo de expresividad que sincroniza la boca con el habla y adapta la expresión facial al contexto del diálogo. La arquitectura ha sido validada con éxito en un robot social del grupo de investigación MAPIR-UMA.

Referencias

Alansari, M., Alnuaimi, K., Ganapathi, I., Alansari, S., Javed, S., Shoufan, A., Zweiri, Y., Werghi, N., 2025. Efficientfacev2s: A lightweight model and a benchmarking approach for drone-captured face recognition. Expert Systems with Applications 273, 126786. DOI: https://doi.org/10.1016/j.eswa.2025.126786

Cañete, A., Quemada-Torres, E., Ruiz-Sarmiento, J.-R., Moreno, F. Á., Gonzalez-Jimenez, J., 2024. Sistema multimodal para la orientación de robots móviles hacia su interlocutor. Jornadas de Automática 45. DOI: https://doi.org/10.17979/ja-cea.2024.45.10939

Desai, D., Mehendale, N., 2022. A review on sound source localization systems. Archives of Computational Methods in Engineering 29, 4631–4642. DOI: https://doi.org/10.1007/s11831-022-09747-2

Ge, Z., Liu, S., Wang, F., Li, Z., Sun, J., 2021. Yolox: Exceeding yolo series in 2021. arXiv preprint arXiv:2107.08430. DOI: https://doi.org/10.48550/arXiv.2107.08430

Khalifa, A., Abdelrahman, A. A., Strazdas, D., Hintz, J., Hempel, T., Al-Hamadi, A., 2022. Face recognition and tracking framework for human-robot interaction. Applied Sciences 12 (11), 5568. DOI: https://doi.org/10.3390/app12115568

Khan, S. S., Sengupta, D., Ghosh, A., Chaudhuri, A., 2024. Mtcnn++: A cnn-based face detection algorithm inspired by mtcnn. The Visual Computer 40, 899–917. DOI: https://doi.org/10.1007/s00371-023-02822-0

Kumar, A., Kaur, A., Kumar, M., 2019. Face detection techniques: a review. Artificial Intelligence Review 52 (2), 927–948. DOI: https://doi.org/10.1007/s10462-018-9650-2

Matheus, K., Ramnauth, R., Scassellati, B., Salomons, N., 2025. Long-term interactions with social robots: Trends, insights, and recommendations. J. Hum.-Robot Interact. 14 (3). DOI: https://doi.org/10.1145/3729539

Picovoice, 2026. Porcupine: On-device wake word detection powered by deep learning. https://github.com/Picovoice/porcupine, repositorio de GitHub. Accedido el 21 de abril de 2026.

Quemada-Torres, E., Jun. 2025. Sistema multimodal de interacción humano robot basado en técnicas de ia. Trabajo fin de grado, Universidad de Málaga. URL: https://hdl.handle.net/10630/40843

Scripka, D., 2026. openwakeword: An open-source audio wake word detection framework. https://github.com/dscripka/openWakeWord, repositorio de GitHub. Accedido el 21 de abril de 2026.

Wang, Y.-Q., 2014. An Analysis of the Viola-Jones Face Detection Algorithm. Image Processing On Line 4, 128–148. DOI: https://doi.org/10.5201/ipol.2014.104

Zangemeister, W. H., Stark, L., 1982. Gaze latency: Variable interactions of head and eye latency. Experimental Neurology 75 (2), 389–406. DOI: https://doi.org/10.1016/0014-4886(82)90169-8

Zhang, K., Zhang, Z., Li, Z., Qiao, Y., 2016. Joint face detection and alignment using multitask cascaded convolutional networks. IEEE Signal Processing Letters 23 (10), 1499–1503. DOI: https://doi.org/10.1109/LSP.2016.2603342

Zhang, Y., Sun, P., et al., 2022. Bytetrack: Multi-object tracking by associating every detection box. In: Proceedings of the European Conference on Computer Vision (ECCV). Springer, pp. 1–21. DOI: https://doi.org/10.1007/978-3-031-20047-2_1

Descargas

Publicado

01-09-2026

Número

Sección

Robótica