Documentos de traballo · fala, saúde e IA fiableVigo, 2026

Escritos

Ensaios e análises sobre voz, saúde e seguridade da IA xerativa. Cada un enlaza co titorial ou aos artigos nos que se basea.

Inside four LLM guards: what the weights say about safeguards for agentic systems

Auditei capa a capa catro candidatos a salvagarda para un asistente axéntico. Todos deciden nun só token e tarde na rede, e os dous guards especializados non ven a inxección agochada en documentos. Un xeneralista pequeno detéctaa case toda se escribe a súa xustificación antes do veredicto.

AI safetyLLM safeguardsPrompt injectionInterpretabilityAgentic AI

How LLM guards decide: a tour inside four safety models

Onde vive a política, que capas a len, que fai o router e por que o último bloque pode darlle a volta a un veredicto: un percorrido polas entrañas de catro guards de LLM, medido sobre os pesos que executan.

AI safetyLLM safeguardsInterpretabilityTransformersMixture of experts