L'Agent de parc à thème peut utiliser des Tools, conserver du contexte et planifier une véritable journée au parc. Dès qu'un tel système est exposé à de vrais utilisateurs, la sécurité devient une préoccupation concrète. Les utilisateurs ne se comportent pas toujours comme prévu, et certains tenteront activement de manipuler l'Agent ou de contourner ses protections.
Dans cette leçon, vous ajouterez des Guardrails au stade des entrées à l'aide de deux Processors : PromptInjectionDetector, qui intercepte les injections de prompt, les tentatives de jailbreak et les tentatives de remplacement des instructions système avant que le modèle ne voie le message, et ModerationProcessor, qui filtre les messages entrants à la recherche de haine et de harcèlement.
Les deux Processors opèrent exclusivement au stade des entrées et s'exécutent avant l'appel au LLM. Vous pouvez ajouter votre propre Processor dans ce même pipeline. Lorsqu'un message est bloqué à l'entrée, le LLM n'est jamais appelé et aucun élément de cette requête n'est écrit en mémoire.
"Le modèle ne dévie jamais de sa tâche, car la requête ne franchit pas le Processor d'entrée."
— Guil Hernandez
Code :
Documentation Mastra pertinente :
Poser des questions :
Suivre Mastra :