Processor によるガードレール
コンテンツを読み込んでいます…
テーマパーク Agent は Tool を使い、コンテキストを保持し、実際のパークで過ごす一日を計画できます。このような Agent を実際のユーザーに提供すると、安全性が現実的な課題になります。ユーザーが常に想定どおりに行動するとは限らず、Agent の操作や脱獄を積極的に試みる人もいます。
このレッスンでは、2 つの Processor を使って入力段階のガードレールを追加します。PromptInjectionDetector は、モデルがメッセージを受け取る前にプロンプトインジェクション、脱獄の試行、システム指示の上書きの試行を遮断します。ModerationProcessor は、入力段階で受信メッセージにヘイトやハラスメントが含まれていないかを検査します。
どちらの Processor も入力段階でのみ動作し、LLM が呼び出される前に実行されます。独自の Processor を追加した場合も同じパイプラインに組み込まれます。メッセージが入力段階でブロックされると LLM は呼び出されず、そのリクエストの内容は Memory に一切書き込まれません。
「リクエストは入力 Processor を通過しないため、モデルが本来のタスクから逸れることはありません。」
— Guil Hernandez
コード:
関連する Mastra ドキュメント:
質問する:
Mastra をフォロー: