Un modelo híbrido de aprendizaje profundo alcanzó 93 % de precisión al reconocer peleas en videos del Hockey Fight Dataset. La propuesta combina una red convolucional, atención espacial y una red LSTM para analizar zonas de cada imagen y el movimiento entre fotogramas. Sus autores apuntan a un uso casi en tiempo real.
La arquitectura usa una red convolucional distribuida en el tiempo. Entre sus capas, un módulo de atención espacial resalta las áreas que el modelo considera importantes para distinguir rasgos de una escena.
Después, una red LSTM analiza cómo se relacionan los fotogramas a lo largo del video para captar patrones de movimiento ligados a conductas violentas. En la prueba, el modelo superó a varias líneas de base y mantuvo una carga de cómputo que los autores describen como ligera.
✅ El resultado sugiere que combinar el análisis de imágenes y movimiento puede mejorar el reconocimiento de violencia en video. El límite es que el trabajo solo informa pruebas en el Hockey Fight Dataset; falta comprobar si el rendimiento se mantiene en otros conjuntos de videos.



