Patterns d'architecture agentique
Comprendre chaque pattern en le voyant fonctionner : une petite scène animée montre qui parle à qui, qui décide du chemin, ce qui circule et ce que cela coûte. Puis la fiche dit le problème résolu, quand l'utiliser, quand l'éviter, et ce qu'en disent ceux qui l'ont mis en production.
Briques de base
Les composants de tous les autres patterns : un appel de modèle enrichi, des outils bien conçus, des sorties structurées.
- A1 · LLM augmenté — Un seul appel de modèle, enrichi de documents, d’outils et de mémoire.
- A2 · Outils et interface agent-machine (ACI) — Le modèle reçoit des fonctions qu’il demande d’appeler ; la qualité de cette interface compte autant que l’architecture.
- A3 · Sortie structurée — Le modèle répond dans un schéma que le code peut vérifier et exploiter sans ambiguïté.
Workflows
Le code décide du chemin, les LLM exécutent des étapes. La forme la plus répandue en production.
- B1 · Chaîne séquentielle — La tâche est découpée en étapes fixes ; chaque appel traite la sortie du précédent.
- B2 · Routage — Un classifieur range chaque demande dans une catégorie et l’envoie au traitement spécialisé.
- B3 · Parallélisation — Des sous-tâches indépendantes s’exécutent en même temps, puis une étape agrège leurs résultats.
- B4 · Échantillonnage et vote — On génère plusieurs réponses à la même question, puis on retient celle qui l’emporte au vote.
- B5 · Générateur-évaluateur — Un modèle produit, un autre évalue selon des critères explicites, et la boucle recommence jusqu’à acceptation.
- B6 · Graphe d’états sur mesure — Le flux est déclaré comme un graphe de nœuds, de conditions et de cycles, dont certains nœuds sont du code et d’autres des LLM.
Agent unique
Un modèle décide lui-même de ses étapes et de ses outils, dans une boucle.
- C1 · Boucle agentique (ReAct) — Le modèle alterne raisonnement, appel d’outil et observation jusqu’à une condition d’arrêt.
- C2 · Planifier puis exécuter — Un planificateur écrit tout le plan, des exécutants le déroulent, un solveur rédige la réponse.
- C3 · Réflexion — L’agent critique sa propre sortie, ou tire une leçon d’un échec, puis réessaie.
- C4 · Agent qui agit en code — Au lieu d’appels d’outils en JSON, l’agent écrit un programme qui compose lui-même les outils.
- C5 · Recherche arborescente — On explore plusieurs branches de raisonnement ou d’action, on les évalue, et l’on revient en arrière si besoin.
- C6 · Recherche agentique — L’agent décide lui-même quoi chercher, lit, juge la pertinence et relance, au lieu de recevoir des passages préparés d’avance.
Contexte et mémoire
Ce que le modèle voit à chaque étape : compaction, notes, mémoire, skills, isolation.
- D1 · Compaction — Quand le contexte approche sa limite, on le résume et l’on repart d’une fenêtre neuve.
- D2 · Notes structurées et plan récité — L’agent écrit ses notes et son plan dans des fichiers hors du contexte, et les relit pour garder le cap.
- D3 · Mémoire long terme — L’agent conserve des faits, des expériences et des savoir-faire d’une session à l’autre.
- D4 · Skills (divulgation progressive) — Des dossiers d’instructions dont seuls le nom et la description sont chargés au départ ; le reste vient à la demande.
- D5 · Sous-agent d’isolation de contexte — Une exploration est confiée à un sous-agent au contexte vierge, qui ne renvoie qu’un résumé condensé.
- D6 · Harnais longue durée — Un agent prépare l’environnement, puis un autre avance une fonctionnalité à la fois sur plusieurs sessions.
Multi-agent
Plusieurs agents se coordonnent. Puissant sur les tâches qui se découpent, coûteux partout ailleurs.
- E1 · Orchestrateur et sous-agents — Un agent central découpe la tâche, la confie à des sous-agents spécialisés, souvent en parallèle, puis synthétise.
- E2 · Orchestrateur à registre de tâches (Magentic) — L’orchestrateur tient un registre des tâches et de l’avancement, repère les blocages et replanifie.
- E3 · Hiérarchie — Des orchestrateurs imbriqués : un superviseur de superviseurs, avec une décomposition récursive.
- E4 · Passage de relais — Un seul agent est actif à la fois ; il transfère entièrement la main à un agent mieux placé, qui devient l’interlocuteur.
- E5 · Conversation de groupe et débat — Plusieurs agents partagent un fil, proposent, critiquent et convergent sous la houlette d’un animateur.
- E6 · Mixture-of-agents (en couches) — Des couches de modèles proposent des réponses ; chaque couche lit la précédente, puis un agrégateur synthétise.
- E7 · Essaim et réseau de pairs — Tous les agents peuvent parler à tous ; sans coordinateur central, le chemin émerge.
- E8 · Équipe d’agents sur file de tâches — Un coordinateur lance des agents persistants qui piochent dans une file de tâches partagée.
- E9 · Bus de messages — Les agents publient des événements et s’abonnent à des sujets via un routeur ; le flux émerge des événements.
- E10 · État partagé (tableau noir) — Des agents autonomes lisent et écrivent dans un stockage commun, sans coordinateur.
- E11 · Agents distribués (A2A) — Des agents exécutés comme services indépendants, parfois chez des éditeurs différents, qui se découvrent et se parlent par un protocole.
Supervision et exploitation
La place de l'humain, les garde-fous, le choix du modèle et l'exécution en arrière-plan.
- F1 · Humain dans la boucle — Des points de contrôle où un humain approuve, corrige ou reprend la main.
- F2 · Garde-fous en couches — Une défense en profondeur : plusieurs contrôles superposés, à l’entrée, aux outils et à la sortie.
- F3 · Cascade et routage de modèles — Chaque requête va au modèle le moins cher capable de la traiter, et monte d’un cran si la confiance est insuffisante.
- F4 · Agent ambiant — Un agent qui écoute un flux d’événements, travaille en arrière-plan et ne sollicite l’humain qu’au besoin.
Sécurité par conception
Des architectures qui restent sûres même si le modèle se laisse manipuler par une injection de prompt.
- G1 · Sélecteur d’actions — Le modèle choisit une action dans une liste fermée ; aucun résultat d’outil ne lui revient.
- G2 · Plan figé avant contact — Le plan d’actions est arrêté avant toute lecture de données non fiables, puis exécuté tel quel.
- G3 · Map-reduce isolé — Chaque donnée non fiable est traitée par une instance isolée dont la sortie est contrainte, puis les résultats sont agrégés.
- G4 · Double LLM (et CaMeL) — Un LLM privilégié détient les outils sans jamais voir le contenu non fiable ; un LLM en quarantaine le lit, sans outils.
- G5 · Minimisation du contexte — Une fois l’action choisie, on retire du contexte ce qui n’est plus nécessaire, demande initiale comprise.
- G6 · Règle de deux — Ne jamais réunir, en autonomie, les trois propriétés qui rendent une injection de prompt dangereuse.