Documentos de traballo · fala, saúde e IA fiableVigo, 2026

Investigador · enxeñeiro de ML_

O que revela a voz, e como facer segura a IA que escoita

José Manuel Ramírez Sánchez1

1Grupo de Tecnoloxías Multimedia (GTM), Centro de Investigación atlanTTic, Universidade de Vigo

0000-0003-4700-6592 josemspeechtech

Lámina I. O autor, tramado Atkinson de 1 bit.

Resumo

Son investigador en tecnoloxías da fala e da linguaxe, rematando o meu doutoramento na Universidade de Vigo, e enxeñeiro que leva os modelos a produción. Constrúo modelos que len a saúde na voz: COVID persistente, doenzas respiratorias, malestar emocional e risco de suicidio. Na industria, entreguei o clasificador de voz da plataforma de cribado de COPERIA en Bahía Software, e agora asesoro a Balidea en sistemas de IA axéntica para o Servizo Galego de Saúde (SERGAS). Agora céntrome en que a IA xerativa que fala con persoas vulnerables estea aliñada, sexa robusta e difícil de empregar indebidamente.

Palabras clave — biomarcadores de voz; aprendizaxe multimodal; representacións autosupervisadas da fala; seguridade da IA; aliñamento; salvagardas para IA xerativa; IA para a saúde mental.

§1 Liñas de investigación

Táboa 1. Liñas de traballo, as modalidades implicadas e os artigos de cada unha.
LiñaModalidadeRefs.
A voz como sinal clínico [1][4][6]
IA para a saúde mental e salvagardas conversacionais [2][3][5]
Recoñecemento de voz robusto e busca na fala [9][10][11][12][13][14]
Tecnoloxía lingüística para linguas con poucos recursos [7][8]
Aliñamento e salvagardas para IA xerativa (actual) —

§2 Artigos destacados

  1. [1]

    Un paseo curto fai máis fiable o cribado por voz: as tuses e vogais gravadas despois do exercicio revelan as secuelas post-COVID mellor ca as gravadas en repouso.

    Vera-López Á. et al. · Frontiers in Medicine · 2026

    Cita completa

    Vera-López Á., Tilves-Santiago D., Ramírez-Sánchez J.M., Docío-Fernández L., García-Mateo C., Bustillo-Casado M., García-Caballero A.A. Improving respiratory disease detection through SSL-enhanced acoustic analysis and exercise-rest measurements. Frontiers in Medicine, 2026.

  2. [3]

    Un axente conversacional deseñado para detectar factores de risco de suicidio durante unha conversa en directo e responder de forma segura cando os atopa.

    Ramírez Sánchez J.M. et al. · IWSDS · 2025

    Conference Link
    Cita completa

    Ramírez Sánchez J.M., Manso Vázquez M., García-Mateo C., Docío-Fernández L., Fernández-Iglesias M.J., Gómez-Gómez B., Pinal B., Brañas A., García-Caballero A. Design of a conversational agent to support people on suicide risk. IWSDS 2025 (International Workshop on Spoken Dialogue Systems Technology), 2025.

  3. [6]

    O primeiro estudo que comproba se as gravacións de voz abondan para distinguir pacientes con COVID persistente de persoas sas. As tuses despois do esforzo funcionaron mellor.

    Ramírez Sánchez J.M. et al. · JMIR Preprints · 2023

    Preprint Ler resumo (EN) DOI
    Cita completa

    Ramírez Sánchez J.M., Docío-Fernández L., García Mateo C., Bustillo-Casado M., García-Caballero A.A. Identifying patients with Long COVID: study of the effectiveness of voice signal analysis and machine learning. JMIR Preprints, 2023.

  4. [13]

    MFCC ou PLP? En silencio apenas importa; con ruído, os MFCC manteñen mellor o recoñecemento de voz, mentres que os PLP decodifican máis rápido. O meu primeiro artigo.

    Ramírez Sánchez J.M. et al. · Revista Ingeniería Electrónica · 2019

    Cita completa

    Ramírez Sánchez J.M., Montalvo Bereau A.R., Calvo de Lara J.R. Evaluación de Rasgos Acústicos para el Reconocimiento Automático del Habla en Escenarios Ruidosos usando Kaldi. Revista Ingeniería Electrónica, Automática y Comunicaciones (RIELAC) 40(3), 2019.

Todos os artigos (14) →

§3 Titoriais

MFCC and PLP from scratch: how machines first learned to listen

Constrúe paso a paso en NumPy os dous trazos clásicos da fala, segue un fotograma de voz real a través de ambos pipelines e observa que lles fai o ruído. O front end que usaba todo recoñecedor antes do deep learning, e o tema do meu primeiro artigo.

NumPySciPylibrosaWhisper

Fine-tuning Whisper with Optuna, cross-validation and MLflow

Un ciclo completo e reproducible de fine-tuning de Whisper sobre voz real, con validación cruzada agrupada, pruning con Optuna, runs aniñados en MLflow e un test bloqueado, que remata nunha decisión explícita fronte a un baseline zero-shot.

WhisperTransformersOptunaMLflowLibriSpeech

§4 Escritos