Grabar una reunión es fácil. Entenderla, no. Cualquiera que haya intentado recuperar un acuerdo concreto de una grabación de dos horas sabe que el audio, tal cual, es un archivo muerto: hay que escucharlo entero para encontrar treinta segundos. Y si en la sala hablan seis personas a la vez, si alguien tose, si un camión pasa por la calle, la cosa empeora.

De ahí nace WARD, Workflow Aplicado al Reconocimiento y Diagnóstico de audio—, el proyecto de I+D que INNOVASUR desarrolla desde febrero de 2025 y cuya primera fase se cierra este mes. Su punto de partida es un producto propio: una plataforma que graba, sella y custodia evidencias sonoras con tecnología blockchain, pensada para que una grabación tenga validez como prueba. Esa plataforma guardaba el audio con todas las garantías, pero no sabía nada de lo que había dentro. WARD es el paso siguiente: convertir el sonido en información que se pueda leer, buscar y medir.

Cuatro preguntas sobre un mismo sonido

El sistema responde a cuatro cosas a la vez, y esa simultaneidad es justamente lo difícil.

Quién habla. Antes de transcribir nada hay que separar las voces. El sistema detecta los tramos con voz, extrae una huella acústica de cada hablante y los agrupa, sin que haya que decirle de antemano cuántas personas hay en la sala. Es una diferencia práctica importante: muchas soluciones comerciales se rinden a partir de cuatro interlocutores.

Qué dice. Cada fragmento, ya atribuido a una voz, pasa por un modelo de transcripción adaptado al español y puesto en producción sobre infraestructura de inferencia industrial. El resultado no es un bloque de texto: es una conversación ordenada, con su hora de inicio, su hora de fin y su hablante.

Cómo lo dice. Sobre esa misma voz, el sistema estima el estado emocional a partir de la prosodia —el tono, la intensidad, las pausas— y del contenido. Clasifica siete emociones y está ya integrado en el servicio.

Qué suena alrededor. En paralelo, un detector de eventos acústicos identifica lo que ocurre fuera de la conversación: veintiuna clases de sonidos urbanos que pueden solaparse entre sí, porque en la realidad una sirena y un claxon no esperan su turno. En la evaluación interna, el modelo alcanza un mAP de 84,0 con un recall del 93,8 %.

Que funcione donde hace falta, no solo en el laboratorio

El reto que convierte a WARD en un proyecto de investigación y no en una integración de herramientas es el entorno: hacerlo en tiempo real y en equipos de pocas prestaciones. Un modelo que necesita una tarjeta gráfica de centro de datos no sirve para una cámara en una calle ni para un equipo embarcado.

Por eso una parte del trabajo de esta primera fase ha ido a la infraestructura. El equipo ha desarrollado un componente propio que adapta la señal de audio al formato que los modelos de visión esperan, y eso ha permitido ejecutar la detección de eventos sobre dispositivos empotrados de bajo consumo. Es un resultado poco vistoso y muy decisivo: es la diferencia entre una demostración y un producto.

Lo que deja la primera fase

Al cerrar 2025, WARD tiene los modelos elegidos tras probarlos, no por catálogo; la transcripción y la separación de voces funcionando de forma desacoplada, lo que permite medir y mejorar cada pieza por separado; el reconocimiento de emociones integrado; y la detección de eventos acústicos llevada a dispositivos reales. En 2026 el proyecto aborda la optimización de los modelos, las interfaces de visualización y el piloto en entorno real.

En el desarrollo participa el grupo CASIP de la Universidad de Granada, que aporta su experiencia en modelos de emociones y en la caracterización de eventos sonoros en espacios cerrados.

Duración 02/2025 – 02/2027
Presupuesto aprobado 737.364,12 €
Ayuda CDTI 278.354,96 €

Desarrollar una plataforma integral de análisis de audio en tiempo real para entornos con varias voces y ruido. El sistema separa e identifica a los hablantes, transcribe cada intervención, estima el estado emocional a partir de la voz y detecta los eventos acústicos del entorno, todo ello optimizado para ejecutarse sobre equipos de bajas prestaciones.

Financiación

El proyecto WARD, Workflow Aplicado al Reconocimiento y Diagnóstico de audio, cuenta con el apoyo del Centro para el Desarrollo Tecnológico y la Innovación (CDTI, E.P.E.), entidad dependiente del Ministerio de Ciencia, Innovación y Universidades, a través de un Proyecto de Investigación y Desarrollo, expediente IDI-20250424.

 

 “El proyecto “WARD: Workflow Aplicado al Reconocimiento y Diagnóstico de audio” con número de expediente IDI-20250424 ha sido cofinanciado por el Centro para el Desarrollo Tecnológico Industrial (CDTI) dentro de la modalidad de proyectos de I+D individuales (2025-2027)”.

Suscríbete a nuestra newsletter

No te pierdas las últimas novedades y noticias de INNOVASUR.

Resumen de privacidad

Esta web utiliza cookies para que podamos ofrecerte la mejor experiencia de usuario posible. La información de las cookies se almacena en tu navegador y realiza funciones tales como reconocerte cuando vuelves a nuestra web o ayudar a nuestro equipo a comprender qué secciones de la web encuentras más interesantes y útiles.