Documentos de trabajo · habla, salud e IA fiableVigo, 2026
Tutoriales
Notebooks ejecutables sobre aprendizaje automático con audio. Todos funcionan en la CPU de un portátil con datos sintéticos y están pensados para reutilizarse en proyectos reales.
Construye paso a paso en NumPy los dos rasgos clásicos del habla, sigue un fotograma de voz real a través de ambos pipelines y observa qué les hace el ruido. El front end que usaba todo reconocedor antes del deep learning, y el tema de mi primer artículo.
Un ciclo completo y reproducible de fine-tuning de Whisper sobre voz real, con validación cruzada agrupada, pruning con Optuna, runs anidados en MLflow y un test bloqueado, que termina en una decisión explícita frente a un baseline zero-shot.
Congela Whisper, inyecta adaptadores LoRA en los puntos adecuados y entrena menos del 2% de los parámetros, ya sea para un clasificador de extremo a extremo o para obtener embeddings que alimenten tu propio clasificador.
Abre un guard de seguridad en la CPU de un portátil: lee su veredicto como probabilidad, mira cómo se forma la decisión capa a capa y comprueba por qué un guard de contenido dañino deja pasar la inyección escondida en documentos.