Documentos de trabajo · habla, salud e IA fiableVigo, 2026

Investigador · ingeniero de ML_

Lo que revela la voz, y cómo hacer segura la IA que escucha

José Manuel Ramírez Sánchez1

1Grupo de Tecnologías Multimedia (GTM), Centro de Investigación atlanTTic, Universidade de Vigo

0000-0003-4700-6592 josemspeechtech

Lámina I. El autor, tramado Atkinson de 1 bit.

Resumen

Soy investigador en tecnologías del habla y del lenguaje, terminando mi doctorado en la Universidade de Vigo, e ingeniero que lleva los modelos a producción. Construyo modelos que leen la salud en la voz: COVID persistente, enfermedades respiratorias, malestar emocional y riesgo suicida. En la industria, entregué el clasificador de voz de la plataforma de cribado de COPERIA en Bahía Software, y ahora asesoro a Balidea en sistemas de IA agéntica para el Servicio Gallego de Salud (SERGAS). Ahora me centro en que la IA generativa que habla con personas vulnerables esté alineada, sea robusta y difícil de usar indebidamente.

Palabras clave — biomarcadores de voz; aprendizaje multimodal; representaciones autosupervisadas del habla; seguridad de la IA; alineamiento; salvaguardas para IA generativa; IA para la salud mental.

§1 Líneas de investigación

Tabla 1. Líneas de trabajo, las modalidades implicadas y los artículos de cada una.
LíneaModalidadRefs.
La voz como señal clínica [1][4][6]
IA para la salud mental y salvaguardas conversacionales [2][3][5]
Reconocimiento de voz robusto y búsqueda en habla [9][10][11][12][13][14]
Tecnología lingüística para lenguas con pocos recursos [7][8]
Alineamiento y salvaguardas para IA generativa (actual) —

§2 Artículos destacados

  1. [1]

    Un paseo corto hace más fiable el cribado por voz: las toses y vocales grabadas tras el ejercicio revelan las secuelas post-COVID mejor que las grabadas en reposo.

    Vera-López Á. et al. · Frontiers in Medicine · 2026

    Cita completa

    Vera-López Á., Tilves-Santiago D., Ramírez-Sánchez J.M., Docío-Fernández L., García-Mateo C., Bustillo-Casado M., García-Caballero A.A. Improving respiratory disease detection through SSL-enhanced acoustic analysis and exercise-rest measurements. Frontiers in Medicine, 2026.

  2. [3]

    Un agente conversacional diseñado para detectar factores de riesgo suicida durante una conversación en directo y responder de forma segura cuando los encuentra.

    Ramírez Sánchez J.M. et al. · IWSDS · 2025

    Conference Link
    Cita completa

    Ramírez Sánchez J.M., Manso Vázquez M., García-Mateo C., Docío-Fernández L., Fernández-Iglesias M.J., Gómez-Gómez B., Pinal B., Brañas A., García-Caballero A. Design of a conversational agent to support people on suicide risk. IWSDS 2025 (International Workshop on Spoken Dialogue Systems Technology), 2025.

  3. [6]

    El primer estudio que comprueba si las grabaciones de voz bastan para distinguir a pacientes con COVID persistente de personas sanas. Las toses tras el esfuerzo funcionaron mejor.

    Ramírez Sánchez J.M. et al. · JMIR Preprints · 2023

    Cita completa

    Ramírez Sánchez J.M., Docío-Fernández L., García Mateo C., Bustillo-Casado M., García-Caballero A.A. Identifying patients with Long COVID: study of the effectiveness of voice signal analysis and machine learning. JMIR Preprints, 2023.

  4. [13]

    ¿MFCC o PLP? En silencio apenas importa; con ruido, los MFCC mantienen mejor el reconocimiento de voz, mientras que los PLP decodifican más rápido. Mi primer artículo.

    Ramírez Sánchez J.M. et al. · Revista Ingeniería Electrónica · 2019

    Cita completa

    Ramírez Sánchez J.M., Montalvo Bereau A.R., Calvo de Lara J.R. Evaluación de Rasgos Acústicos para el Reconocimiento Automático del Habla en Escenarios Ruidosos usando Kaldi. Revista Ingeniería Electrónica, Automática y Comunicaciones (RIELAC) 40(3), 2019.

Todos los artículos (14) →

§3 Tutoriales

MFCC and PLP from scratch: how machines first learned to listen

Construye paso a paso en NumPy los dos rasgos clásicos del habla, sigue un fotograma de voz real a través de ambos pipelines y observa qué les hace el ruido. El front end que usaba todo reconocedor antes del deep learning, y el tema de mi primer artículo.

NumPySciPylibrosaWhisper

Fine-tuning Whisper with Optuna, cross-validation and MLflow

Un ciclo completo y reproducible de fine-tuning de Whisper sobre voz real, con validación cruzada agrupada, pruning con Optuna, runs anidados en MLflow y un test bloqueado, que termina en una decisión explícita frente a un baseline zero-shot.

WhisperTransformersOptunaMLflowLibriSpeech

§4 Escritos

How LLM guards decide: a tour inside four safety models

Dónde vive la política, qué capas la leen, qué hace el router y por qué el último bloque puede darle la vuelta a un veredicto: un recorrido por las tripas de cuatro guards de LLM, medido sobre los pesos que ejecutan.