第II部 · 大規模モデルの時代
AIエージェント:チャットボットから自律的な行為者へ
6.1モデルからエージェントへ
これは、コパイロット(あなたが作業している間そばで支援する存在)からデジタル従業員(タスクを丸ごと任せられる存在)への移行である。この転換はあまりに中心的な出来事だったため、2025年から2026年の時期は広く「エージェントの年」と呼ばれた。
6.2エージェントの構造
具体的には、この手順は2段階で進む。事前の段階では、文書を断片(chunks、チャンク)に分割し、それぞれを埋め込み(embedding、第2章)、すなわち意味を捉えた数値のベクトルに変換して、ベクトルデータベースに格納する。質問を受けた段階では、質問もベクトルに変換し、意味が最も近い断片を取り出して(セマンティック検索)、プロンプトに追加する。利点は3つある。最新かつ専門的な回答(モデルが一度も見たことのない非公開データに基づく回答)が得られること、ハルシネーションが減ること、そして出典を示せるため検証が可能になることである。今日では、企業向けアプリケーションにおける最重要の構成要素となっている。
古典的なRAGは一度検索して、それから回答する。エージェント型RAG(agentic RAG)はさらに一歩進み、検索そのものをエージェントに任せる。エージェントは検索が必要かどうかを判断し、クエリを言い換え、複数の情報源やツールに問い合わせ、見つけた内容の質を評価し、不十分であればやり直し、そのうえで統合する。単純なRAGが反射だとすれば、エージェント型RAGは小さな調査である。コストとレイテンシが増える代わりに、複数の段階を要する複雑な質問にも対応できる。これは、「答えるモデル」と「行動するエージェント」の境界が薄れていく経路のひとつである。
6.3Model Context Protocol(MCP)とツールの利用
6.4エージェントフレームワーク
このカテゴリでは、対照的な性格を持つ2つのプロジェクトが抜きん出ている。爆発的に広まった先駆者である OpenClaw と、安全性により配慮した Hermes Agent である。どちらも十分に重要かつ代表的なので、それぞれ事例研究として取り上げる(6.8節と6.9節)。両者はともに、エージェントの民主化(ソブリン性、ローカルなデータ。第9章)と、高度に自律的なエージェントに固有のリスク(第20章)の双方を体現している。
6.5コンピュータ操作エージェント(computer-use)とウェブブラウジング
6.6マルチエージェントシステム
協調して働く「AIの企業体」というこのイメージは、決して些細なものではない。これはまさに、最も踏み込んだ未来予測シナリオが描くビジョンであり、そこではひとつのモデルの数千ものコピーが超人的なペースで協働する。この点は、アライメントと制御の問題の核心にあるため、第24章であらためて取り上げる。
6.7バイブコーディング:自然言語でプログラミングする
6.8事例研究:OpenClaw
6.9事例研究:Hermes Agent
要点(第6章)
- エージェントは答えるのではなく、行動する。目標を託されると、「考える、行動する、観察する」というループによって自律的にそれを達成する。これはコパイロットからデジタル従業員への移行である。
- エージェントは、頭脳(LLM)に4つの能力、すなわち知覚、記憶、ツール、計画を組み合わせたものである。
- MCP(2024年末にAnthropicが発表し、業界に採用され、2025年末からはLinux Foundation傘下の財団に委ねられているオープンな標準規格)は「AIのUSB-C」であり、どんなAIでもどんなツールにでも接続する。
- フレームワーク(LangChain/LangGraph、CrewAI、AutoGen)とノーコードツール(n8n、Make、Zapier)が、エージェントの構築を容易にする。
- コンピュータ操作エージェント(computer-use)は人間と同じようにコンピュータを使う。強力だが、信頼性とセキュリティ(プロンプトインジェクション、そして2026年以降は封じ込めからの脱出。第24章)のリスクを伴う。
- マルチエージェントシステムは複数のエージェントを協働させるもので、未来予測シナリオが描く「AIの企業体」を先取りしている(第24章)。
- セルフホスト型パーソナルエージェント(OpenClaw、Hermes Agent)の波により、モデルに依存せず永続的な記憶を持つアシスタントを自分のマシン上で動かし、行動させられるようになった。高い自律性とソブリン性が得られる一方、新たな攻撃対象領域も生まれる(第20章)。
- バイブコーディング(ソフトウェアを自然言語で記述し、AIに書かせること)は、ソフトウェア制作を民主化し、専門家の作業を加速するが、理解の不十分なコード、セキュリティ上の脆弱性(第20章)、そして基礎を忘れてしまうリスクにさらす。
ここまでで「何を」と「どのように」をひととおり見てきた。第7章では「誰が」の地図を描く。米国、中国、欧州の研究機関、クローズドモデルとオープンモデルの対立、そしてこの革命を形づくる人々の顔ぶれである。