1. 为每项任务缩小工具目录
只暴露当前任务必需的工具。文件读取、外部写入、浏览器、代码执行和支付功能,即使从未调用,也会扩大潜在影响范围。
2. 把工具注解当作不可信提示
readOnlyHint、destructiveHint、idempotentHint 和 openWorldHint 有助于审查,但它们由服务器提供。缺失时采用保守默认值;与名称、描述或结构冲突时提高审查等级。
3. 检查组合权限
读取私密数据的工具与对外发布工具组合后,会形成数据外泄路径。代码执行加开放网络、凭据加消息发送、权限变更加外部出口,都需要隔离。
4. 在产生后果之前确认
删除、付款、发布、发送消息、身份和权限变更,必须展示参数与目标并由人类即时批准。确认机制应位于模型推理之外。
5. 执行可验证的硬边界
在授权与执行层限制文件根目录、命令、域名、令牌受众、有效期和配额。保留不包含原始目录和密钥的审查包。
常见问题
H/M Blindspot · hogarmas.net
没有警告是否证明智能体安全?
不能。静态分析无法证明实现行为、授权、隔离或运行时表现。
工具目录会被上传或执行吗?
不会。Agent Scope 只在浏览器中分析 JSON,不打开目标、不调用模型,也不执行工具。
MCP 注解会强制执行权限吗?
不会。它们只是审查元数据。真实权限需要授权、沙箱、网络控制和外部确认机制。
