Ir al contenido principal

OGA

Traducción automática de lenguaje de signos mediante landmarks 3D y arquitecturas híbridas. Caso de uso médico.

18 de junio de 2025

La accesibilidad comunicativa sigue siendo una deuda pendiente en múltiples sectores, particularmente en aquellos donde la interacción precisa es crítica.

El lenguaje de signos, si bien ampliamente utilizado por la comunidad de personas con dificultades auditivas, continúa siendo una barrera en sistemas tradicionales que no están preparados para procesarlo de forma automatizada.

Este proyecto parte de la necesidad de traducir el lenguaje de signos a texto legible, sin intervención humana, con el objetivo de habilitar aplicaciones que puedan integrarse en entornos digitales con capacidad de interpretación semántica.

En particular, se abordó el reto de reconocer palabras aisladas del lenguaje de signos, relacionadas con terminología médica, utilizando recursos computacionales limitados y datos estructurados extraídos de vídeo.

Enfoque tecnológico: del gesto al texto en tiempo real

El reto principal fue diseñar y desarrollar un sistema que fuera preciso, eficiente y capaz de operar en tiempo real sin depender de una infraestructura visual pesada.

Desde el principio, optamos por una estrategia basada en datos estructurados- en lugar de alimentar al modelo con imágenes o vídeo, trabajamos directamente con los landmarks tridimensionales generados mediante MediaPipe, una representación que codifica la posición de manos, cuerpo y rostro en cada frame de forma abstracta, robusta y computacionalmente ligera.

Este enfoque nos permitió prescindir de factores irrelevantes como la iluminación, el fondo o la calidad de la cámara, centrándonos únicamente en la dinámica gestual.

A partir de estos datos, se diseñó un pipeline de preprocesado con alineación temporal, cálculo de velocidad y aceleración, y normalización espacial por referencia corporal. Las secuencias se homogeneizaron mediante padding dinámico durante la fase de entrenamiento, dado que los gestos tienen longitudes variables.

Evaluación de arquitecturas y elección del modelo final

En cuanto a las arquitecturas evaluadas, comenzamos con modelos LSTM —tanto unidireccionales como bidireccionales— por su reconocida capacidad para manejar datos secuenciales. Sin embargo, los resultados fueron inestables en gestos lentos o poco marcados. También se exploraron modelos densos aplicados sobre vectores promediados, pero su rendimiento era limitado al carecer de sensibilidad temporal.

Fue entonces cuando nos decidimos por una arquitectura híbrida CNN-Transformer, que combinaba lo mejor de ambos mundos: aprendizaje local y global.

Por un lado, incorporamos bloques de convolución 1D causales con núcleos dilatados, que nos permitieron captar la evolución cinemática de los gestos en ventanas temporales amplias. Estos bloques se reforzaron con mecanismos Efficient Channel Attention (ECA), para ajustar automáticamente la relevancia de cada canal del input —por ejemplo, ciertas articulaciones— en función del gesto observado. Por otro lado, añadimos bloques Transformer autocontenidos con atención multi-cabeza, para modelar relaciones de largo alcance entre frames, permitiendo que cada instante atendiese a cualquier otro dentro de la secuencia, independientemente de su distancia temporal.

Equipo

El equipo de desarrollo estuvo compuesto por dos científicos de datos, con una base que combina la formación en Matemáticas y experiencia previa en modelado secuencial y optimización, junto con una formación en Análisis Económico y un máster en Big Data Analytics. Su experiencia abarca la inteligencia artificial aplicada en entornos reales, la analítica avanzada y el diseño de sistemas eficientes.

Implementación técnica y entrenamiento

Todo el sistema fue implementado en Python, utilizando TensorFlow 2.x y un diseño modular que facilita la reutilización del backbone del modelo en otros contextos. El entrenamiento se realizó en GPU local, usando un generador de datos propio capaz de leer directamente los .npy de MediaPipe sin necesidad de cargar el dataset completo en memoria.

Para mejorar la capacidad de generalización desde las primeras épocas, se aplicó transfer learning a partir de pesos preentrenados en tareas de reconocimiento de signos en ASL. También incorporamos técnicas como early stopping, validación cruzada y un sistema de versionado automático de métricas y checkpoints.

Uno de los aprendizajes clave fue la necesidad de introducir un umbral de activación temporal para confirmar cada palabra reconocida, evitando confusiones en la transición entre gestos encadenados. Esto fue determinante para avanzar hacia un sistema de traducción continua en el flujo de vídeo.

Impacto

La solución desarrollada representa un salto cualitativo en accesibilidad comunicativa, con aplicación directa en entornos médicos, atención al cliente, administración pública y otros sectores sensibles a la inclusión.

Las pruebas realizadas alcanzaron una precisión superior al 90% en los datos de entrenamiento de la clasificación de gestos individuales del caso de uso médico, y una precisión del 87% en los datos de validación, por lo que consideramos que la precisión del modelo es robusta. Esta elevada fiabilidad reduce de forma significativa la necesidad de repeticiones por parte del usuario, evitando errores de interpretación y eliminando la intervención humana. En entornos donde la precisión es crítica —como hospitales, consultas médicas o estaciones de emergencia—, esta capacidad mejora la fluidez y la confianza en la comunicación entre pacientes y profesionales de la salud.

Gracias a su arquitectura optimizada y al uso eficiente de datos estructurados (landmarks), el sistema es capaz de operar en tiempo real, capturando e interpretando gestos de manera continua a medida que ocurren. Un umbral de activación inteligente evita solapamientos entre signos consecutivos, reduciendo ambigüedades y mejorando la comprensión de frases completas. Esto permite su uso en escenarios conversacionales dinámicos, como la atención al cliente o la interacción en puntos de información.

Finalmente, el potencial uso de esta solución, puede extenderse a asistentes digitales, interfaces conversacionales o plataformas educativas en múltiples sectores, donde la comunicación inclusiva es un imperativo tecnológico y ético.

 

#PassionForData

Autoría
José María Baca Daza OGA
José María Baca Daza
Data Scientist en 

Graduado en Análisis Económico por la Universidad Pablo de Olavide y Máster en Big Data Analytics por la Universidad Carlos III de Madrid, con experiencia como analista en proyectos de datos, visualización y automatización en entornos académicos y tecnológicos.

Me gustan los videojuegos, los juegos de mesa, ir al gimnasio, cocinar sin prisas y perder el tiempo en internet de formas muy productivas.