第I部 · 基礎:LLM以前のAIを理解する

Transformer革命:「アテンションこそすべて」

第3章読了目安 13分更新:2026年9月

3.1逐次型アーキテクチャの壁

この壁を越えるには、2つの離れ業を同時にこなせるアーキテクチャが必要だった。系列全体を一度に処理すること(速度のため)、そして、どれほど離れていても任意の単語を任意の単語に直接結びつけること(何も忘れないため)である。アテンション機構がもたらすのは、まさにこれである。

3.2アテンションの直観

別のたとえを挙げよう。会議の場で、ある発言を理解するために、それまでに各参加者が述べたことを関連性に応じて自動的に重みづけしている自分を想像してほしい。アテンションとは、この重みづけの仕組みを大規模に適用し、しかも自動的に学習させたものである。

図3.1. アテンション機構のイメージ。「それ」という語を解釈するために、モデルは「動物」に高い重みを、「道」に低い重みを与える。これらの重みは人間が書き込んだものではなく、何十億もの文から学習されたものである。

3.3Transformerアーキテクチャ(2017年)

押さえておきたい要素が2つある。

  • マルチヘッドアテンション(multi-head attention)。Transformerは重みづけの仕組みを1つだけ使うのではなく、複数を並列に走らせる。いわば文に向けられた何通りもの異なる「視線」である。あるヘッドは文法(主語と動詞の一致)を追い、別のヘッドは意味を、また別のヘッドは指示関係(「それ」は「動物」を指す)を追う。これらの視線を組み合わせることで、モデルは非常に豊かな関係を捉える。
  • 位置エンコーディング(positional encoding)。アテンションはそのままでは語順が見えない。アテンションにとっては、「犬が人を噛む」と「人が犬を噛む」は同じものになってしまう。そこで、各単語の表現に文中での位置の情報を注入し、語順が保たれるようにする。
図3.2. Transformerをごく単純化した図。1つのブロックは、マルチヘッドアテンション層と計算層を組み合わせたものであり、このブロックを数十、場合によっては数百も積み重ねる。モデルの力を生み出すのは、この積み重ねの深さと規模である。

3.4スケーリング則(scaling laws)

研究者のRichard Suttonは、この哲学的な教訓を「苦い教訓」(bitter lesson)という名でまとめた。長期的には、増え続ける計算能力を活用する汎用的な手法が、専門家が苦労して手作業で組み上げた巧妙な手法に必ず勝つ、というものである。人間の創意にとっては歯がゆいが、驚くほど有効である。

3.5事前学習、ファインチューニング、RLHF

図3.3. アシスタントを作り上げるパイプライン。2022年末にGPT-3をChatGPTへと変えたのは、本質的にこの工程である。
  1. 事前学習(pre-training)。入手可能なテキスト(ウェブページ、書籍、コード、記事)のうち途方もなく大きな部分をモデルに取り込ませる。モデルはただ続きを予測しようとするだけで、文法、事実、推論、文体を学ぶ。これが最も費用のかかる段階であり、何千ものプロセッサで数週間の計算を行い、数千万ドルから数億ドルを要する。
  2. 教師ありファインチューニング(supervised fine-tuning、SFT)。インストラクションチューニングとも呼ばれる。「ユーザーの質問、アシスタントの理想的な回答」という形式の例を何千件もモデルに見せる。こうしてモデルは、アシスタントとして振る舞うことを学ぶ。答えること、指示に従うこと、適切な語調をとることである。
  3. RLHF(Reinforcement Learning from Human Feedback、人間のフィードバックによる強化学習)。人間がモデルの複数の回答を比較し、どれが好ましいかを示す。「報酬モデル」と呼ばれる第2のモデルがこの選好を学習し、次にそれを用いて、より良いと判断される回答、すなわちより役に立ち、より誠実で、より有害性の低い回答を生成するよう主モデルを学習させる。アシスタントを感じのよい、比較的安全なものにするのがこの段階である。

要点(第3章)

  • Transformer(2017年、論文「Attention Is All You Need」)は、逐次的な読み取りをアテンション機構に置き換えた。アテンションはすべての単語を互いに直接結びつけ、GPU上で並列化できる。
  • アテンションは、単語ごとに、ほかのどの単語がどの程度重要かを学習する。マルチヘッドアテンションはこの「視線」を複数にし、位置エンコーディングは語順を保つ。
  • テキスト生成では、デコーダのみの系統(GPTファミリー)が主流となった。
  • スケーリング則は、性能が規模、データ、計算量とともに予測可能な形で伸びることを示しており、資源の競争はここから生じた。ただし、その収穫は頭打ちになる可能性がある。
  • アシスタントは3段階で作られる。事前学習、教師ありファインチューニング、そしてRLHFである。この最後の段階は、アライメント問題の揺りかごでもある。

次章では、この新時代の主役である大規模言語モデルそのものの内部を、大きく開いて見ていく。