1. 明确信任边界
用户编写以及从网页、邮件、文档、RAG、API 和工具获得的文字都应视为不可信数据。外部数据不能替换高权限指令。
2. 对比渲染内容与原文
检查不可见文字、双向控制符、HTML 注释、隐藏样式和编码片段。人看不到的内容仍可能进入模型上下文。
3. 移除密钥与个人信息
发送提示词前,删除并非绝对必要的凭据、令牌、身份号码、邮箱、电话和支付数据。已经暴露的真实密钥必须轮换。
4. 限制工具和目标地址
只允许任务必需的工具、参数和目标。付款、删除、发布、邮件和权限变更必须立即由人确认。
5. 保守解读结果
确定性检测器只能识别已知模式,不能保证文字安全。新的、语义型、视觉型或深度混淆的注入可能绕过规则。
常见问题
H/M Blindspot · hogarmas.net
没有警告就代表提示词安全吗?
不代表。它只说明没有命中已配置规则,不是安全认证。
文字会发送给服务器或另一个模型吗?
不会。Prompt Firewall 在浏览器中分析,报告不包含原文或脱敏副本。
脱敏副本会消除提示词注入吗?
不会。它替换选定的密钥、个人信息和隐藏控制符,但语义指令仍可能存在。
