1. Define el límite de confianza
Trata como no confiable todo texto escrito por usuarios o recuperado desde webs, correos, documentos, RAG, APIs y herramientas. Los datos externos no deben poder reemplazar las instrucciones privilegiadas.
2. Compara contenido visible y original
Busca texto invisible, controles bidireccionales, comentarios HTML, estilos ocultos y bloques codificados. Lo que una persona no ve todavía puede entrar en el contexto del modelo.
3. Retira secretos y datos personales
Antes de enviar un prompt, elimina credenciales, tokens, RUT, correos, teléfonos y datos de pago que no sean estrictamente necesarios. Si un secreto real ya se expuso, hay que rotarlo.
4. Reduce herramientas y destinos
Permite solo las herramientas, parámetros y destinos necesarios. Pagos, borrado, publicaciones, correos y cambios de permisos requieren confirmación humana inmediata.
5. Interpreta el resultado con cautela
Un detector determinista reconoce patrones conocidos, pero no puede garantizar que un texto sea seguro. La inyección nueva, semántica, visual o profundamente ofuscada puede evadir reglas.
Preguntas frecuentes
H/M Blindspot · hogarmas.net
¿Un resultado sin alertas significa que el prompt es seguro?
No. Solo significa que ninguna regla configurada coincidió. No es una certificación de seguridad.
¿El texto se envía al servidor o a otro modelo?
No. Prompt Firewall analiza el texto en el navegador y los informes omiten tanto el original como la copia redactada.
¿La copia redactada elimina la inyección?
No. Sustituye secretos, datos personales y controles invisibles seleccionados, pero las instrucciones pueden seguir presentes.
