Présentation des agents

Publié le 25 février 2025

Les développeurs Web créent et optimisent des sites Web pour des audiences humaines et non humaines, y compris les robots d'exploration et autres bots. Les agents IA sont les derniers utilisateurs Web à bénéficier de votre optimisation.

À la base, un agent est un système qui reçoit une entrée, l'interprète, puis planifie et exécute des actions au nom de l'utilisateur (qu'il s'agisse d'un humain ou d'un autre agent). Un agent comporte plusieurs composants, qui peuvent inclure des modèles, des API ou d'autres outils.

Plusieurs caractéristiques définissent les agents. Dans un contexte de développement Web, vous devez tenir compte des points suivants :

  • Autonome : les agents peuvent fonctionner sans intervention humaine directe.
  • Interactif : les agents peuvent converser avec d'autres agents et des humains.
  • Réactif : un agent perçoit son environnement et répond aux changements.
  • Proactif : les agents peuvent prendre des initiatives pour atteindre des objectifs spécifiques.

Par exemple, Example Bookshop est une librairie en ligne. Un utilisateur peut obtenir des recommandations pour un nouveau livre, en fonction des livres qu'il aime et d'autres centres d'intérêt, en interagissant avec un grand modèle de langage (LLM). Un agent peut rediriger l'utilisateur vers la page du livre recommandé et lancer le processus de paiement. Si le livre est en rupture de stock, l'agent peut rediriger l'utilisateur vers un autre libraire en ligne pour qu'il puisse acheter le livre recommandé.

Les agents étant des utilisateurs relativement nouveaux sur le Web, vous avez le temps d'adopter les bonnes pratiques. Toutefois, de nombreuses bonnes pratiques pour aider les agents aident en fait tous les utilisateurs, en particulier pour créer un site Web accessible.

Dans ce document, nous expliquons comment les agents fonctionnent en tant qu'utilisateurs Web et pourquoi vous devriez envisager de créer votre site Web en pensant aux agents.

Fonctionnement des agents en tant qu'utilisateurs

La plupart des discussions sur l'IA et les sites Web portent sur les robots d'exploration utilisés pour extraire des données d'entraînement pour les LLM. Les données extraites pour l'entraînement sont souvent conservées dans des ensembles de données ouverts tels que Common Crawl, ce qui permet d'éviter que les sites ne soient submergés par les robots d'exploration. Toutefois, l'entraînement n'est qu'une des raisons pour lesquelles vous rencontrerez des systèmes d'IA.

Les systèmes d'IA peuvent cibler des pages spécifiques à extraire, en fonction de la demande d'un utilisateur spécifique (qu'il s'agisse d'un humain ou d'un agent). Par exemple, un utilisateur peut fournir des sources à NotebookLM et le système extrait le contenu pour mieux l'aider dans les tâches associées, telles que la synthèse ou l'agrégation de données.

Les agents suivent des schémas similaires et explorent les pages au nom de l'utilisateur pour répondre à sa demande, mais le flux peut être moins linéaire.

Les agents sont utilisés depuis longtemps pour les tâches d'automatisation et la collecte d'informations. Ils peuvent désormais cliquer sur des liens et des boutons, remplir des champs et faire défiler des pages, en effectuant des workflows au nom des utilisateurs. Il peut s'agir de petites tâches, comme remplir des formulaires de contact, ou de tâches plus complexes, comme réserver des vols pour votre famille.

Comprendre le consentement est la compétence la plus importante pour ces nouveaux types d'agents, car ils agissent comme des compagnons pour les humains. Les agents doivent demander une confirmation à des moments critiques, comme une étape d'achat ou l'envoi d'un formulaire contenant des informations sensibles.

Les agents comme compagnons

Les agents peuvent être des compagnons, voire des substituts pour les utilisateurs humains, en les aidant à effectuer des tâches complexes sur votre site Web ou votre application Web. De manière générale, le processus d'un agent est toujours le même :

  1. Recevoir la requête.
  2. Traiter et planifier la manière de répondre à la requête.
  3. Exécuter le plan.
  4. Enregistrer les leçons apprises dans la mémoire.

Les agents sont plus adaptés aux tâches d'assistance sur plusieurs origines. Dans le cas d'un achat de livres, l'agent peut effectuer une tâche sur votre origine, tout en naviguant sur d'autres origines similaires. Plus votre site est adapté à l'exécution de la tâche par un agent, plus il est probable que l'agent l'effectue avec votre origine.

En tant que développeur Web, vous devez prendre en charge et créer des outils pour aider les humains et les agents à effectuer efficacement des tâches critiques. Mais les outils ne sont qu'un élément de l'infrastructure des agents.

Infrastructure des agents

Les humains coopèrent avec les agents. Chaque élément envoie et renvoie des informations au modèle.
Un humain travaille avec un agent, qui contient un modèle, des règles, une mémoire et des outils.

Un agent est une unité contenue avec plusieurs éléments connectés :

  • Modèle : les grands modèles de langage (LLM) sont à la base d'un agent IA. Ils fournissent un raisonnement, une base de connaissances et la capacité de traiter et de générer du langage.
  • Règles : diverses contraintes, y compris une personnalité, des instructions et des objectifs, aident l’agent à effectuer des tâches de manière cohérente.
  • Mémoire : la mémoire à court terme et la mémoire à long terme aident un agent à gérer le contexte, à gagner en efficacité et, de manière générale, à mieux fonctionner pour l'utilisateur.
  • Outils : un agent peut utiliser de nombreux outils différents, y compris des API, des fonctions, des bases de données et même d'autres agents. Par exemple, WebMCP (en essai Origin Trial) est une proposition visant à prendre en charge les interactions structurées sur votre site Web.

Lorsque les agents traitent les sites Web comme des sources de données ou interagissent directement avec les pages, ils peuvent le faire visuellement ou sémantiquement :

  • Interaction visuelle : l'agent prend un instantané de la page Web rendue. Il utilise un modèle de vision pour lire le contenu et identifier les éléments interactifs.
  • Interaction sémantique : l'agent analyse le DOM et lit directement le texte. Cela est particulièrement courant pour les agents qui effectuent des tâches automatisées.

Pour les interactions visuelles et sémantiques, les agents bénéficient de sites bien conçus, intuitifs et dotés d'une hiérarchie de contenu claire.

Les agents nécessitent un accès aux données

Une façon de définir les agents est de les mettre en relation avec les données. Le propriétaire de l'agent et des données est-il le même ou différent ? Ce choix détermine les couches d'authentification nécessaires et la difficulté d'effectuer la tâche.

Agent zéro-party

Un agent zéro-party est un agent basé sur un navigateur qui agit dans un contexte local, en utilisant des données locales. Comme les navigateurs stockent des préférences utilisateur personnalisées qui peuvent être considérées comme des informations permettant d'identifier personnellement l'utilisateur (PII), un agent zéro-party peut empêcher les opérations qui partagent ces données avec d'autres parties.

Agent propriétaire

Un agent propriétaire est un outil et des informations appartenant à la même partie. Les développeurs peuvent donc posséder et prendre en charge des outils, gérer l'accès aux informations et à la configuration.

Supposons que vous soyez un utilisateur qui prévoit des vacances à Toronto et que vous souhaitiez créer une liste de lieux à visiter. Un agent fourni par Google Maps peut prendre un ensemble de critères et de données pour générer une liste de points d'intérêt en votre nom, en marquant chaque élément sur la carte. Il peut s'agir d'un agent propriétaire, car l'agent est fourni par Google, qui possède également les données cartographiques et toutes les autres préférences personnelles stockées par un utilisateur connecté.

Agent tiers

Un agent tiers est créé par un développeur ou une organisation externe, et propose des fonctions et des données provenant de services externes. Par exemple, vous pouvez souhaiter qu'un fournisseur de calendrier tiers prenne en charge une fonctionnalité basée sur des événements sur votre site Web. Vous pouvez proposer des outils à ces agents, tels que WebMCP, ou intégrer les agents à vos workflows (à condition qu'ils réussissent votre examen de confidentialité).

Un agent tiers pourrait effectuer la même tâche de cartographie, lorsqu'il est créé en tant qu'extension.

Les développeurs peuvent créer un agent qui s'appuie sur des sources spécifiques pour créer des listes, par exemple en capturant les meilleurs restaurants des journaux locaux. Cet agent aurait besoin d'un accès en lecture aux sites des journaux locaux, ainsi qu'un accès en lecture et en écriture à un outil de création de listes, qu'il s'agisse de Google Maps ou d'un autre service. Cela nécessite plusieurs niveaux de consentement et d'autorisations, ainsi que des outils spécifiques pour interagir avec les sites (tels qu'un outil Playwright).

Il est probable que votre site Web ou votre application Web soit un fournisseur d'informations tiers pour un agent. Dans ce cas, vous pouvez proposer une structure d'autorisations qui permet aux agents et aux humains d'effectuer des tâches avec vous.

Points à retenir

Maintenant que vous comprenez comment fonctionnent les agents, vous pouvez décider comment votre site Web peut les prendre en charge au mieux.

  • Découvrez WebMCP et inscrivez-vous à la version d'évaluation d'origine.
  • Découvrez comment créer un site Web accessible.
  • Suivez le cours Apprendre l'IA pour comprendre comment ajouter des systèmes d'IA peuvent être ajoutés à vos sites.

Nous continuerons de mettre à jour cette série avec des bonnes pratiques concrètes pour prendre en charge les interactions de votre site Web et de votre application Web avec les agents.