Fecha de publicación: 25 de febrero de 2025
Los desarrolladores web han creado y optimizado sitios web para públicos humanos y no humanos, incluidos rastreadores y otros bots. Los agentes de IA son los usuarios web más recientes que se benefician de tu optimización.
En esencia, un agente es un sistema que recibe entradas, las interpreta y, luego, planifica y ejecuta acciones en nombre del usuario (ya sea una persona o otro agente). Un agente tiene varios componentes, que pueden incluir modelos, APIs o cualquier otra herramienta.
Hay varias características que definen a los agentes. En un contexto de desarrollo web, debes tener en cuenta lo siguiente:
- Autónomo: Los agentes pueden operar sin intervención humana directa.
- Interactivo: Los agentes pueden conversar con otros agentes y personas.
- Reactivo: Un agente percibe su entorno y responde a los cambios.
- Proactivo: Los agentes pueden tomar la iniciativa para cumplir objetivos específicos.
Por ejemplo, Example Bookshop es una librería en línea. Un usuario puede obtener recomendaciones para un libro nuevo, según los libros que le gustan y otros intereses, interactuando con un modelo de lenguaje grande (LLM). Un agente puede llevar al usuario a la página del libro recomendado y comenzar el proceso de confirmación de la compra. Si el libro no está en stock, el agente puede llevar al usuario a comprar esa recomendación en otra librería en línea.
Como los agentes son usuarios bastante nuevos en la Web, tienes tiempo antes de que debas adoptar las prácticas recomendadas. Sin embargo, muchas de las prácticas recomendadas para ayudar a los agentes en realidad ayudan a todos los usuarios, en particular, a crear un sitio web accesible.
En este documento, revisamos cómo operan los agentes como usuarios web y por qué deberías considerar crear tu sitio web teniendo en cuenta a los agentes.
Cómo operan los agentes como usuarios
Gran parte del debate en torno a la IA y los sitios web se centró en los rastreadores que se usan para extraer datos de entrenamiento para los LLM. Los datos extraídos para el entrenamiento suelen conservarse en conjuntos de datos abiertos, como Common Crawl, lo que ayuda a evitar que los sitios se vean abrumados por los rastreadores. Sin embargo, el entrenamiento es solo una de las razones por las que encontrarás sistemas de IA.
Los sistemas de IA pueden segmentar páginas específicas para extraer datos, según la solicitud de un usuario específico (ya sea una persona o un agente). Por ejemplo, un usuario puede proporcionar fuentes a NotebookLM y el sistema extrae el contenido para ayudar mejor al usuario con tareas relacionadas, como el resumen o la agregación de datos.
Los agentes siguen patrones similares y rastrean páginas en nombre del usuario para responder a su solicitud, pero el flujo puede ser menos lineal.
Si bien los agentes se han usado durante mucho tiempo para tareas de automatización y recopilación de información, ahora pueden hacer clic en vínculos y botones, completar campos y desplazarse por las páginas, y completar flujos de trabajo en nombre de los usuarios. Pueden ser tareas pequeñas, como completar formularios de contacto, o tareas más complejas, como reservar vuelos para tu familia.
Comprender el consentimiento es la habilidad más importante para estos nuevos tipos de agentes, ya que actúan como compañeros de los humanos. Los agentes deben solicitar confirmación en puntos críticos, como un paso de compra o el envío de un formulario con información sensible.
Agentes como compañeros
Los agentes pueden ser compañeros o incluso sustitutos de los usuarios humanos, y ayudan a completar tareas complejas en tu sitio web o aplicación web. En general, el proceso de un agente siempre es el mismo:
- Recibe la consulta.
- Procesa y planifica cómo abordar la consulta.
- Ejecuta el plan.
- Guarda las lecciones aprendidas en la memoria.
Los agentes son más adecuados para admitir tareas en varios orígenes. En el caso de la compra de libros, el agente puede completar una tarea en tu origen y, al mismo tiempo, navegar por otros orígenes similares. Cuanto mejor sea tu sitio para admitir que un agente complete la tarea, más probable será que el agente la complete con tu origen.
Tu trabajo como desarrollador web es admitir y crear herramientas para ayudar a las personas y a los agentes a completar tareas críticas de manera eficiente. Sin embargo, las herramientas son solo una parte de la infraestructura de agentes.
Infraestructura de agentes
Un agente es una unidad contenida con varias piezas conectadas:
- Modelo: Los modelos de lenguaje grandes (LLM) son la base de un agente de IA. Proporcionan razonamiento, una base de conocimiento y la capacidad de procesar y generar lenguaje.
- Reglas: Varias restricciones, incluidas una personalidad, instrucciones y objetivos, ayudan al agente a realizar tareas de manera coherente.
- Memoria: La memoria a corto plazo y la memoria a largo plazo ayudan a un agente a administrar el contexto, obtener eficiencia y, en general, tener un mejor rendimiento para el usuario.
- Herramientas: Hay muchas herramientas diferentes que un agente puede usar, incluidas APIs, funciones, bases de datos e incluso otros agentes. Por ejemplo, WebMCP (en prueba de origen) es una propuesta para admitir interacciones estructuradas en tu sitio web.
Cuando los agentes tratan los sitios web como fuentes de datos o interactúan directamente con las páginas, pueden hacerlo de forma visual o semántica:
- Interacción visual: El agente toma una instantánea de la página web renderizada. Usa un modelo de visión para leer el contenido y, luego, identificar elementos interactivos.
- Interacción semántica: El agente analiza el DOM y lee el texto directamente. Esto es particularmente común para los agentes que realizan tareas automatizadas.
Tanto para las interacciones visuales como semánticas, los agentes se benefician de los sitios que están bien diseñados, son intuitivos para navegar y tienen una jerarquía de contenido clara.
Los agentes requieren acceso a los datos
Una forma de definir a los agentes es por su relación con los datos. ¿El propietario del agente y los datos es el mismo o diferente? Esta elección determina qué capas de autenticación son necesarias y qué tan difícil es completar la tarea.
Agente de datos de terceros
Un agente de datos de terceros es un agente basado en el navegador que actúa en un contexto local y usa datos locales. Como los navegadores almacenan preferencias de usuario personalizadas que podrían considerarse información de identificación personal (PII), un agente de datos de terceros puede evitar operaciones que compartan estos datos con otras partes.
Agente de datos de origen
Un agente de datos de origen es cuando la herramienta y la información son propiedad de la misma parte, por lo que los desarrolladores pueden poseer y admitir herramientas, administrar el acceso a la información y la configuración.
Por ejemplo, supongamos que eres un usuario que planea unas vacaciones en Toronto y quieres crear una lista de lugares para visitar. Un agente proporcionado por Google Maps podría tomar un conjunto de criterios y datos para generar una lista de lugares de interés en tu nombre, y marcar cada elemento en el mapa. Esto podría considerarse un agente de datos de origen, ya que el agente es proporcionado por Google, que también posee los datos del mapa y cualquier otra preferencia personal almacenada por un usuario que accedió a su cuenta.
Agente externo
Un agente externo es creado por un desarrollador o una organización externos, y ofrece funciones y datos de servicios externos. Por ejemplo, es posible que quieras que un proveedor de calendario externo admita una función basada en eventos en tu sitio web. Puedes ofrecer herramientas a estos agentes, como WebMCP, o integrar los agentes en tus flujos de trabajo (siempre que pasen tu revisión de privacidad).
Un agente externo podría completar la misma tarea de asignación, cuando se compila como una extensión.
Los desarrolladores podrían crear un agente que dependa de fuentes específicas para crear listas, como capturar los mejores restaurantes de los periódicos locales. Este agente necesitaría acceso de lectura a los sitios de periódicos locales, además de acceso de lectura y escritura en una herramienta de creación de listas, ya sea Google Maps o un servicio alternativo. Esto requiere varias capas de consentimiento y permisos, así como herramientas específicas para interactuar con los sitios (como una herramienta de Playwright).
Es probable que tu sitio web o aplicación web sea un proveedor de información externo para un agente. En este caso, es posible que quieras ofrecer una estructura de permisos que permita que los agentes y las personas completen tareas contigo.
Conclusiones
Ahora que comprendes cómo funcionan los agentes, puedes decidir cómo tu sitio web puede admitirlos mejor.
- Lee sobre WebMCP y regístrate en la prueba de origen.
- Obtén información para crear un sitio web accesible.
- Realiza el curso de Learn AI para comprender cómo se pueden agregar sistemas de IA a tus sitios.
Seguiremos actualizando esta serie con prácticas recomendadas prácticas para admitir las interacciones de tu sitio web y aplicación web con agentes.