第II部 · 大規模モデルの時代
大規模言語モデル(LLM)
4.1LLMとは、結局のところ何なのか
印象的な言い方をすれば、こうなる。LLMとは、どんな人間が千回生まれ変わっても読み切れない量のテキストを読んだうえで、言語の規則性の、そして言語を通じて世界の規則性の膨大な部分を、自らのパラメータの中に圧縮した関数である。
4.2トークン(tokens):AIの「通貨」
なぜこれが決定的に重要なのか。きわめて具体的な理由が二つある。
- コンテキストウィンドウ(context window)とは、モデルが同時に「頭に入れておける」トークンの最大数である。その大きさはモデルによって大きく異なる。2026年時点では、多くが128,000から256,000トークン(分厚い本1冊分に相当)の範囲にあり、フロンティアモデルの多くはいまや100万トークン、あるいはそれ以上に達している。ウィンドウを超えると、モデルには会話や文書の冒頭がもう「見えなく」なる。実際には、非常に長いコンテキストを活用する能力は、この上限よりずっと手前で低下することが多い。
- 価格はトークン単位で数えられる。アプリケーション・プログラミング・インターフェース(API)経由でモデルを利用する場合、消費した100万トークンあたりで課金される。入力(モデルに送るもの)と出力(モデルが生成するもの)の両方が対象である。チップメーカーのNVIDIAは、トークンを「AIの言語であり通貨である」とまで表現している。トークンあたりのコストの最適化は、産業上の重大な課題となった(第8章および第9章)。
4.3学習の全体像
4.4創発的な能力とハルシネーション
しかし、これらのモデルには悪名高い欠陥がある。ハルシネーションである。モデルは、真実を語るときとまったく同じ落ち着き払った調子で、誤った情報を断言する。でっち上げの引用、存在しない法的典拠、誤った事実などである。その原因は構造的なものだ。LLMはもっともらしい文章を生み出すよう最適化されているのであって、真実の文章を生み出すよう最適化されているのではない。その成り立ちからして、「わからない」という内的な概念を持っていない。知識の欠落に直面すると、ありそうな答えに最もよく似たもので埋めてしまうのである。
その帰結は深刻なものになりうる(医療上の誤り、法廷で引用された架空の判例)。いくつかの対策が存在し、進歩を続けている。
- 検索拡張生成(RAG、第2章参照):その場で検索して取得した信頼できる文書をモデルに与え、それに依拠させる。
- ツールの利用:計算は電卓に、最近の事実は検索エンジンに任せる(第6章)。
- 検証可能な出典の提示と、学習の継続的な改善。
- 明示的なリーズニング(次節)。一部の誤りを減らす。
4.5リーズニング:思考の連鎖と「thinking」モデル
そこで各研究所は、リーズニングモデル(または「thinking」モデル)を学習させた。答えを出す前に長い内的な思考を生成し、回答時により多くの計算を費やすモデルである(これを test-time compute、すなわち推論時の計算と呼ぶ)。即座に答えを返すのではなく、モデルは「じっくり考える時間を取り」、さまざまな道筋を探り、自らを修正する。
この変化は、性能のフロンティアを動かした。事前学習を大きくすることだけでなく、モデルにより長く考えさせることによっても性能が伸びるようになったのである。この世代の最初のモデルは、OpenAIの o1、続いて o3 の系列(2024年末および2025年)と、オープンモデルの DeepSeek-R1(2025年初め)であった。後者は、きわめて低いコストで優れたリーズニング水準に達し、強い印象を残した。2026年には、主要なファミリー(Claude、Gemini、GPT、Grok)のすべてがリーズニングモードを提供している。
4.6モデルを評価する:ベンチマーク
2026年9月末の現状。 最先端の座は激しく争われており、順位はほぼ毎月入れ替わる。以下はある一時点のスナップショットである。米国勢では、Anthropicの Claude ファミリー、OpenAIの GPT 系列(2026年9月に GPT-6 世代へ移行した)、Google DeepMindの Gemini 3、SpaceXAI(旧xAI、SpaceXの子会社、第7章)の Grok が接戦を繰り広げている。中国勢では、DeepSeek や Qwen(Alibaba)のように、多くがオープンウェイトで非常に低コストのモデルが、フロンティアに近い水準に達している。欧州勢では、フランスの Mistral が主権(ソブリン)の旗印を掲げている。ここで取り上げるランキングの最終集計時点である2026年半ばには、いくつかの明確な傾向が浮かび上がっていた。人間の選好にもとづくアリーナでは、Claudeの各モデルが1年の大半にわたって上位を占めていた。コード(SWE-bench)では、Claude、Grok、GPTが首位を争っていた。Gemini は複数のリーズニング系の試験とマルチモーダルで際立っていた。そしてオープンウェイトモデルは、すでに数分の一の価格でほぼ同等の品質を提供しており、この分野の経済全体を揺さぶっている。
2026年の大きな教訓は、第7章で改めて取り上げるが、一文に集約できる。絶対的な意味での「最良のモデル」はもはや存在せず、あるのはタスクごとの最良のモデルである。最も先進的な組織は「ルーティング」(routing)を実践している。リクエストごとに、品質、速度、コストの面で最も適したモデルに処理を任せるのである。そして、あらゆるランキングは、ある瞬間にだけ有効な一枚の写真として読まなければならない。
要点(第4章)
- LLMとは、次のトークンを予測するよう大規模に学習させたTransformerである。この目標から、会話、翻訳、コード、リーズニングが立ち現れる。
- モデルはトークン(単語の断片)を単位として処理を行う。これがコンテキストウィンドウと価格(100万トークンあたりで課金)を決める。
- 学習(一度きりの巨額の投資)は、推論(リクエストのたびに繰り返し発生するコスト)と区別される。蒸留によって、軽量で安価な版が作られる。
- 原材料である質の高い人間のテキストは、2026年から2032年頃に枯渇する可能性がある(「データの壁」)。そのため、ライセンス、マルチモーダル、合成データが活用される。
- ハルシネーションは構造的なものである(モデルが目指すのは真実ではなく、もっともらしさである)。RAG、ツールの利用、リーズニングによって軽減できるが、完全になくすことはできない。
- リーズニングモデルは、回答時により長く「考える」ことで、性能のフロンティアを推論時の計算へと移した。
- ベンチマークは進歩を測るが、飽和、汚染、グッドハート効果という弱点を抱えている。2026年の時点で、フロンティアは米国、中国、欧州のプレイヤーの間で争われており、唯一の勝者はいない。
これで、「どう動くのか」の全体像がつかめた。第II部では、さらに視野を広げていく。テキストを超えた世界モデルとマルチモーダル(第5章)、続いてエージェントによる行動への移行(第6章)を見たうえで、プレイヤーの見取り図を描く(第7章)。