Inside four LLM guards: what the weights say about safeguards for agentic systems
Auditei capa a capa catro candidatos a salvagarda para un asistente axéntico. Todos deciden nun só token e tarde na rede, e os dous guards especializados non ven a inxección agochada en documentos. Un xeneralista pequeno detéctaa case toda se escribe a súa xustificación antes do veredicto.
AI safetyLLM safeguardsPrompt injectionInterpretabilityAgentic AI