行动计划

把指南转化为安全试用流程

在使用真实数据前,请先用合成示例完成这些步骤。勾选状态只保留在当前标签页。

0%0/3 已完成
  1. 打开工具
  2. 打开工具
  3. 打开工具

此清单不创建账户、不向服务器发送数据,并会在刷新页面后清除。

01

把指令与数据设计为独立通道

RAG 文档、工单或用户文本即使看起来像指令,也应先视为数据。随机明确的分隔符标记数据块,治理规则禁止执行其中命令、泄露秘密或在不明确时继续。

分隔符不是防火墙。工具白名单、窄参数模式、只读默认、输出限制和高影响操作前的人工审批必须共同工作。

  • 不要把不可信内容合并进系统指令。
  • 对白名单工具与参数进行限制。
  • 使用合成数据和回滚方案测试。
02

把输出绑定到机器可校验契约

仅要求 JSON 无法控制字段、类型或额外说明。封闭对象 Schema 明确必填字段、类型与附加属性策略;应先解析,再按 Schema 校验,并向用户解释错误。

Schema 不能替代金额、日期、枚举、关系和权限等业务规则;通过 Schema 的结果仍需评估实际影响。

03

让红队用例带版本和证据

检查应涵盖数据泄露、越权、虚假确定性、异常输入、撤销、日志最小化和绕过审批。记录预期行为、实际观察、模型/提示版本、日期与评审者。

一次通过并不等于保障。版本变化后应重复正常、边界、滥用和回归用例,发布决定由授权人员作出。

应用核验

把指南转化为可重复的检查流程

请使用这套包含 3 个工具的检查计划来落实《用提示边界、结构化输出和红队测试构建可靠 AI 流程》。目标:将提示分隔符、JSON Schema 输出与人工审批红队检查结合的深入指南。 请先用安全示例代替真实数据,并记录每一步的预期结果与验收决定。

01

提示词边界与分隔符生成器

准备
提示词边界与分隔符生成器的输入应为节、键和值结构有效的 INI / properties 文本。本次处理目标是:用明确的数据边界分隔不可信内容与指令。处理敏感真实数据前,请先用合成示例确认格式。
执行
运行设备端处理。提示词边界与分隔符生成器为实现“用明确的数据边界分隔不可信内容与指令”采用以下可解释方法:解析采用确定性规则,并保留字段与类型边界。
验收检查
验收检查:接受提示词边界与分隔符生成器的结果前,请完成将字段名、值类型、转义以及空值或 null 与源数据逐项比较;核验证据应与“用明确的数据边界分隔不可信内容与指令”这一目标一致。提示词边界与分隔符生成器的使用边界:规则检查不能证明真实模型行为;请使用代表性案例复测。
预期输出
提示词边界与分隔符生成器完成后会提供解析后的结构、字段指标和明确的语法问题,并围绕“用明确的数据边界分隔不可信内容与指令”组织结果。. 用明确的数据边界分隔不可信内容与指令。
02

结构化输出模式生成器

准备
结构化输出模式生成器的输入应为工具要求的 URL、HTTP 标头、cURL 命令、API 定义或 Web 配置。本次处理目标是:根据字段定义生成 JSON Schema 和模型输出约定。处理敏感真实数据前,请先用合成示例确认格式。
执行
运行设备端处理。结构化输出模式生成器为实现“根据字段定义生成 JSON Schema 和模型输出约定”采用以下可解释方法:输入在不发起网络请求的情况下解析,并分别显示组成部分和高风险假设。
验收检查
验收检查:接受结构化输出模式生成器的结果前,请完成在获授权的测试环境中,与现行标准和真实服务器行为进行比较;核验证据应与“根据字段定义生成 JSON Schema 和模型输出约定”这一目标一致。结构化输出模式生成器的使用边界:规则检查不能证明真实模型行为;请使用代表性案例复测。
预期输出
结构化输出模式生成器完成后会提供规范化的 Web 配置、组件清单和可执行的复核提示,并围绕“根据字段定义生成 JSON Schema 和模型输出约定”组织结果。. 根据字段定义生成 JSON Schema 和模型输出约定。
03

AI 红队检查清单生成器

准备
AI 红队检查清单生成器的输入应为明确说明目标、受众、上下文、约束和预期输出格式的指令。本次处理目标是:为 AI 使用场景创建基于风险且可追踪的测试清单。处理敏感真实数据前,请先用合成示例确认格式。
执行
运行设备端处理。AI 红队检查清单生成器为实现“为 AI 使用场景创建基于风险且可追踪的测试清单”采用以下可解释方法:基于规则的检查会拆分指令组成部分,不调用远程模型。
验收检查
验收检查:接受AI 红队检查清单生成器的结果前,请完成在模型上用正常、缺少上下文、冲突、敏感数据和提示词注入案例测试;核验证据应与“为 AI 使用场景创建基于风险且可追踪的测试清单”这一目标一致。AI 红队检查清单生成器的使用边界:工具不调用远程模型,也不生成或验证模型输出。
预期输出
AI 红队检查清单生成器完成后会提供可编辑的提示词草稿、覆盖指标和明确的改进项,并围绕“为 AI 使用场景创建基于风险且可追踪的测试清单”组织结果。. 为 AI 使用场景创建基于风险且可追踪的测试清单。
何时应停止?

提示词边界与分隔符生成器适用以下边界:提示词边界与分隔符生成器的使用边界:规则检查不能证明真实模型行为;请使用代表性案例复测。 如果未满足该条件,请勿把输出传递到工作流的下一步。

检查记录

落实《用提示边界、结构化输出和红队测试构建可靠 AI 流程》时,请记录工具名称、所选设置、浏览器版本,以及“使用提示词边界与分隔符生成器完成:用明确的数据边界分隔不可信内容与指令”的接受或拒绝理由,而不是敏感内容。这样既能重复检查,也不会复制真实数据。