使用 Processor 设置 Guardrail
正在加载内容……
主题公园 Agent 已经能够使用 Tool、保留上下文并规划真实的游园行程。当它开始面向真实用户时,安全就成为实际问题。用户不一定总按预期行动,有些人甚至会主动尝试操纵或越狱 Agent。
本课将使用两个 Processor 添加输入阶段的 Guardrail:PromptInjectionDetector 会在消息到达模型之前拦截 prompt injection、越狱和覆盖系统指令的尝试;ModerationProcessor 会在输入阶段检查传入消息中的仇恨和骚扰内容。
这两个 Processor 都只在输入阶段工作,并在调用 LLM 之前运行。你也可以将自定义 Processor 加入同一条 pipeline。当消息在输入阶段被阻止时,LLM 不会被调用,该请求的任何内容也不会写入 Memory。
“由于请求无法通过输入 Processor,模型根本不会被带离任务。”
— Guil Hernandez
代码:
相关 Mastra 文档:
交流提问:
关注 Mastra: