Documentos de trabajo · habla, salud e IA fiableVigo, 2026

Escritos

Ensayos y análisis sobre voz, salud y seguridad de la IA generativa. Cada uno enlaza al tutorial o a los artículos en los que se basa.

Inside four LLM guards: what the weights say about safeguards for agentic systems

Audité capa a capa cuatro candidatos a salvaguarda para un asistente agéntico. Todos deciden en un solo token y tarde en la red, y los dos guards especializados no ven la inyección escondida en documentos. Un generalista pequeño la detecta casi toda si escribe su justificación antes del veredicto.

AI safetyLLM safeguardsPrompt injectionInterpretabilityAgentic AI

How LLM guards decide: a tour inside four safety models

Dónde vive la política, qué capas la leen, qué hace el router y por qué el último bloque puede darle la vuelta a un veredicto: un recorrido por las tripas de cuatro guards de LLM, medido sobre los pesos que ejecutan.

AI safetyLLM safeguardsInterpretabilityTransformersMixture of experts