1. Reduce el catálogo a la tarea
Expón únicamente las herramientas necesarias para el encargo actual. Cada lector de archivos, escritor externo, navegador, ejecutor de código o función de pagos amplía el radio de impacto aunque nunca se invoque.
2. Trata las anotaciones como pistas
readOnlyHint, destructiveHint, idempotentHint y openWorldHint ayudan a revisar, pero provienen del servidor. Si faltan, aplica valores conservadores; si contradicen el nombre, la descripción o el esquema, exige una revisión más estricta.
3. Busca autoridad combinada
Una herramienta que lee datos privados y otra que publica fuera del sistema forman una ruta de exfiltración aunque cada una parezca razonable por separado. Código más red abierta, credenciales más mensajería y privilegios más egress requieren aislamiento.
4. Confirma justo antes de la consecuencia
Borrado, pagos, publicación, correo, cambios de identidad y permisos deben pedir aprobación humana con parámetros y destino visibles. La confirmación debe vivir fuera del razonamiento del modelo.
5. Impón límites verificables
Restringe raíces de archivos, comandos, dominios, audiencias de token, tiempo de vida y cuotas en la capa de autorización y ejecución. Conserva un paquete de revisión sin incluir el catálogo original ni secretos.
Preguntas frecuentes
H/M Blindspot · hogarmas.net
¿Un informe sin alertas demuestra que el agente es seguro?
No. El análisis estático no prueba la implementación, autorización, aislamiento ni conducta en tiempo de ejecución.
¿Se sube el catálogo o se ejecuta alguna herramienta?
No. Agent Scope analiza el JSON dentro del navegador y no abre destinos, llama modelos ni ejecuta herramientas.
¿Las anotaciones MCP aplican permisos?
No. Son metadatos para revisión. Los permisos reales deben imponerse mediante autorización, sandbox, controles de red y confirmación externa.
