エージェントの概要

公開日: 2025 年 2 月 25 日

ウェブ デベロッパーは、クローラやその他の bot など、人間と人間以外のオーディエンス向けにウェブサイトを構築し、最適化してきました。AI エージェントは、最適化の恩恵を受ける最新のウェブユーザーです。

エージェントは、入力を受け取って解釈し、ユーザー(人間または別のエージェント)に代わってアクションを計画して実行するシステムです。 エージェントには複数のコンポーネントがあり、モデル、API、その他のツールを 含めることができます。

エージェントを定義する特性はいくつかあります。 ウェブ開発のコンテキストでは、次の点を考慮する必要があります。

  • 自律的: エージェントは人間の直接的な介入なしに動作できます。
  • インタラクティブ: エージェントは他のエージェントや人間と会話できます。
  • 反応型: エージェントは環境を認識し、変化に対応します。
  • プロアクティブ: エージェントは特定の目標を達成するために主導的に行動できます。

たとえば、Example Bookshop はオンライン書店です。ユーザーは、大規模言語モデル(LLM)とやり取りすることで、好きな書籍やその他の興味に基づいて新しい書籍のおすすめ情報を収集できます。エージェントは、おすすめの書籍のページにユーザーを誘導し、購入手続きを開始できます。書籍が在庫切れの場合、エージェントはユーザーを別のオンライン書店に誘導して、おすすめの書籍を購入できるようにします。

エージェントはウェブ上の比較的新しいユーザーであるため、ベスト プラクティスを採用するまでにはしばらく時間がかかります。ただし、エージェントを支援するためのベスト プラクティスの多くは、すべてのユーザー、特にアクセシビリティの高いウェブサイトの構築に役立ちます。

このドキュメントでは、エージェントがウェブユーザーとしてどのように動作するか、エージェントを念頭に置いてウェブサイトを構築することを検討すべき理由について説明します。

エージェントがユーザーとして動作する方法

AI とウェブサイトに関する議論の多くは、LLM のトレーニング データのスクレイピングに使用されるクローラに関するものでした。トレーニング用のスクレイピングされたデータは、多くの場合、 Common Crawlなどのオープン データセットに保存されます。これにより、 サイトがクローラによって過負荷になるのを防ぐことができます。ただし、トレーニングは AI システムに遭遇する理由の 1 つにすぎません。

AI システムは、特定のユーザー(人間またはエージェント)のリクエストに基づいて、スクレイピングする特定のページをターゲットにできます。たとえば、ユーザーがソース を NotebookLM に提供すると、システムはコンテンツ をスクレイピングして、要約やデータ 集計などの関連タスクでユーザーをサポートします。

エージェントは同様のパターンに従い、ユーザーに代わってページをクロールしてユーザーのリクエストに応答しますが、フローは直線的ではない可能性があります。

エージェントは、自動化タスクや情報収集に長年使用されてきましたが、リンクやボタンのクリック、フィールドへの入力、ページでのスクロールなど、ユーザーに代わってワークフローを完了できるようになりました。問い合わせフォームへの入力などの簡単なタスクから、家族のフライトの予約などの複雑なタスクまで、さまざまなタスクに対応できます。

同意を理解することは、人間をサポートする新しいタイプのエージェントにとって最も重要なスキルです。エージェントは、購入ステップや機密情報を含むフォームの送信など、重要なポイントで確認を求める必要があります。

エージェントをコンパニオンとして使用する

エージェントは、ウェブサイトやウェブ アプリケーションでの複雑なタスクの完了を支援する、人間のユーザーのコンパニオンや代理人として機能します。大まかに言うと、エージェントのプロセスは常に同じです。

  1. クエリを受け取ります。
  2. クエリに対処する方法を処理して計画します。
  3. 計画を実行します。
  4. 学習した内容をメモリに保存します。

エージェントは、複数の オリジンにまたがるタスクをサポートするのに最適です。書籍の購入の場合、エージェントはオリジンでタスクを完了しながら、他の同様のオリジンをナビゲートすることがあります。エージェントがタスクを完了するのをサポートするサイトの品質が高いほど、エージェントがオリジンでタスクを完了する可能性が高くなります。

ウェブ デベロッパーの仕事は、人間とエージェントが重要なタスクを効率的に完了できるように、ツールをサポートして構築することです。ただし、ツールはエージェント インフラストラクチャの一部にすぎません。

エージェント インフラストラクチャ

人間がエージェントと協力する。各ピースはモデルに情報を送信して返します。
人間は、モデル、ルール、メモリ、ツールを含むエージェントと連携します。

エージェントは、複数の接続されたピースを持つコンテナ化されたユニットです。

  • モデル: 大規模言語モデル(LLM)は、AI エージェントの基盤です。 推論、知識ベース、言語の処理と生成の機能を提供します。
  • ルール: ペルソナ、指示、目標などのさまざまな制約により、 エージェントはタスクを一貫して実行できます。
  • メモリ: 短期メモリと長期メモリにより、エージェントは コンテキストを管理し、効率を高め、ユーザーのパフォーマンスを向上させることができます。
  • ツール: エージェントが使用できるツールは、API、 関数、データベース、他のエージェントなど、多岐にわたります。たとえば、 WebMCP(オリジン トライアル)は、 ウェブサイトでの構造化されたインタラクションをサポートするための提案です。

エージェントがウェブサイトをデータソースとして扱う場合や、ページと直接やり取りする場合は、視覚的またはセマンティックに行うことができます。

  • 視覚的なインタラクション: エージェントはレンダリングされたウェブページのスナップショットを取得します。 ビジョンモデルを使用してコンテンツを読み取り、インタラクティブな要素を識別します。
  • セマンティックなインタラクション: エージェントは DOM を分析し、テキストを直接読み取ります。 これは、自動化タスクを実行するエージェントで特に一般的です。

視覚的インタラクションとセマンティックなインタラクションの両方で、エージェントは、適切に設計され、直感的に操作でき、コンテンツの階層が明確なサイトを利用できます。

エージェントはデータへのアクセスを必要とする

エージェントを定義する方法の一つは、データとの関係です。エージェントとデータの所有者は同じですか、それとも異なりますか?この選択により、必要な認証レイヤとタスクの完了の難易度が決まります。

ゼロパーティ エージェント

ゼロパーティ エージェントは、ローカル データを使用してローカル コンテキストで動作するブラウザベースのエージェントです。 ブラウザには、個人情報(PII)と見なされる可能性のあるカスタム ユーザー設定が保存されるため、ゼロパーティ エージェントは、このデータを他のパーティと共有するオペレーションを防ぐことができます。

ファーストパーティ エージェント

ファーストパーティ エージェントは、ツールと情報が同じパーティによって所有されているため、デベロッパーはツールを所有してサポートし、情報と構成へのアクセスを管理できます。

たとえば、トロントへの旅行を計画しているユーザーが、訪問する場所のリストを作成したいとします。Google マップが提供するエージェントは、一連の条件とデータを受け取り、ユーザーに代わって観光スポットのリストを生成し、地図上の各項目をマークします。このエージェントは、地図データやログイン ユーザーが保存したその他の個人設定を所有する Google によって提供されるため、ファーストパーティ エージェントと見なされます。

サードパーティ エージェント

サードパーティ エージェントは、外部のデベロッパーまたは組織によって作成され、外部サービスの機能とデータを提供します。 たとえば、サードパーティのカレンダー プロバイダに、ウェブサイトのイベントベースの機能をサポートしてもらいたい場合があります。 WebMCP などのツールをこれらのエージェントに提供したり、エージェントをワークフローに統合したりできます(プライバシー審査に合格している場合)。

サードパーティ エージェントは、拡張機能として構築された場合、同じマッピング タスクを完了できます。

デベロッパーは、特定のソースに依存してリストを作成するエージェントを構築できます。たとえば、地元の新聞から最高のレストランをキャプチャするなどです。このエージェントは、Google マップまたは代替サービスであるリスト作成ツールに対する読み取り / 書き込みアクセス権に加えて、地元の新聞サイトへの読み取りアクセス権が必要です。 これには、複数の同意と権限のレイヤと、サイトとやり取りするための特定の ツール( Playwright ツールなど)が必要です。

ウェブサイトまたはウェブ アプリケーションがエージェントのサードパーティ情報プロバイダである可能性があります。この場合、エージェントと人間がタスクを完了できるようにする権限構造を提供することをおすすめします。

要点

エージェントの仕組みを理解したら、ウェブサイトでエージェントを最大限にサポートする方法を決定できます。

  • WebMCP について確認し、 オリジン トライアルに登録します。
  • アクセシビリティの高いウェブサイトを構築する方法を学びます。
  • Learn AI コースを受講して、AI システムをサイトに 追加する方法を理解します。

今後も、エージェントとのウェブサイトとウェブ アプリケーションのインタラクションをサポートするための実践的なベスト プラクティスをこのシリーズで更新していきます。