Inside four LLM guards: what the weights say about safeguards for agentic systems
Audité capa a capa cuatro candidatos a salvaguarda para un asistente agéntico. Todos deciden en un solo token y tarde en la red, y los dos guards especializados no ven la inyección escondida en documentos. Un generalista pequeño la detecta casi toda si escribe su justificación antes del veredicto.
AI safetyLLM safeguardsPrompt injectionInterpretabilityAgentic AI