第VI部 · 存亡に関わる課題

AIのアライメントと安全性

第24章読了目安 30分更新:2026年9月

24.1アライメント問題

したがって防御は多層的に構想されている。モデルのレベルでは、危険な能力の評価、閾値と強化されたガードレール、学習によって身につけさせた拒否(24.4節)。そして何より、エコシステムのレベルでは、DNA合成業者によるスクリーニング(注文に応じて遺伝子配列を製造する事業者が、依頼内容を精査し、顧客の身元を確認する)があり、これはAIに依存しない関門である。最後に、このデュアルユースという同じ論理は、生物学だけにとどまらない。CBRN(化学、生物、放射性物質、核)の脅威という言い方がなされる。化学は、知識の壁が下がるという同じ懸念を共有している。放射性物質と核は、情報よりもむしろ物質へのアクセスによって、より強く封じられたままである。いずれにせよ、本講座はリスクとそのガバナンスの話にとどめ、意図的に実行可能な情報には踏み込まない。

24.2非常に高い能力をもつAIがなぜ危険になりうるのか

24.3シナリオ AI 2027

図24.1. 自己改善のループ。シナリオ AI 2027 の(そして「知能爆発」への懸念の)核心にあるのは、AIそのものを進歩させることのできるAIが、ループ状の加速を引き起こし、数十年分の進歩を数か月に圧縮しかねないという考えである。

このシナリオには、緊迫した地政学的競争(モデルの重みの窃取、「軍拡競争」の論理)、「データセンターの中の天才たちの国」というイメージ、そして何より、きわめて高度なAIがミスアライメントの状態にあることが明らかになり、設計者たちを犠牲にして自分自身の目的を追求するという転換点が描かれている。

24.4AIを安全にするための取り組み

これに加えて、制度のレベルでは、フロンティアモデルの評価を担うAI安全性研究所(アメリカ、イギリス)が設けられている(第25章)。

複数の研究所が、こうした閾値を安全性レベルという形で定式化している。最もよく知られているのは、生物学的封じ込めレベルに着想を得たAnthropicのASL(AI Safety Levels)という尺度である。危険な能力の各段階に、より厳格な措置(配備の制限、情報セキュリティの強化、拒否の厳格化)が対応しており、閾値を超えた場合には、保護策が追いつかないかぎり提供を停止することがありうる。OpenAI(Preparedness Framework)とGoogle DeepMind(Frontier Safety Framework)も同等の枠組みをもっており、安全性に関する公的研究所(イギリス、アメリカ)が配備前に独立した評価を行っている。限界は現実のものであり、認識もされている。評価が無害性を証明することは決してなく(モデルが能力を隠すこともありうる。先に見た sandbagging である)、テストは進歩の速さについていくのに苦労している。したがって、危険の証拠がないことは、危険がないことの証拠ではない。

24.5大論争:慎重論対加速論

この対立は、2022年から2023年以降、はっきり識別できる運動の形をとるようになった。戯画化することなく記述しておく必要がある。慎重論の側では、いくつかの取り組みが強い印象を残した。2023年3月には、Future of Life Instituteが主導し、3万人を超える人々(先駆者であるヨシュア・ベンジオやスチュアート・ラッセルのほか、イーロン・マスクやスティーブ・ウォズニアックも含む)が署名した公開書簡「Pause Giant AI Experiments」が、当時のモデルより強力なモデルの学習について6か月のモラトリアムを求めた。2023年5月には、Center for AI Safetyによる一文だけの声明が、AIに関連する絶滅のリスクを、パンデミックや核戦争と並ぶ世界的な優先課題に位置づけた。2025年10月には、同じFuture of Life Instituteによる新たな取り組みである「超知能に関する声明」が、さらに踏み込んだ。一文で、もはや一時停止ではなく、二つの条件、すなわち安全性と制御についての幅広い科学的合意と、一般市民の強い支持が揃わないかぎり、超知能の開発を禁止することを求めたのである。注目すべきことに、この声明は非常に幅広く政治的にも雑多な連合(ベンジオやヒントンのような先駆者のほか、芸術家、宗教指導者、あらゆる立場の著名人)を結集させ、急速で規制のない開発を支持するアメリカ人はわずか5%にすぎないという世論調査に依拠していた。この陣営の極には、全面的な停止を唱える人々がおり、反対派からは「doomers」とあだ名されている。その旗手がエリーザー・ユドコウスキー(第7章)であり、雄弁な題名をもつ2025年の著書 If Anyone Builds It, Everyone Dies は、フロンティアAIの開発を止めるべきだという確信を要約している。小規模な活動家の運動であるPauseAIも、その一時停止を公に求めている。

対岸では、2022年にBeff Jezos(Guillaume Verdon、第7章)という人物を中心に生まれた効果的加速主義(e/acc)が、速度を美徳に祭り上げている。AIにブレーキをかけることこそが真の危険であり、市場と競争が規制に優先すべきだというのである。その名称は、効果的利他主義(英語で effective altruism、略してEA)への意図的な当てこすりである。こちらはテクノロジー業界に深く浸透している慈善思想の潮流であり、逆に、AIの安全性研究に資金と人材を供給することに大きく貢献してきた。この語彙の中で、「decel」(decelerationist の略)という言葉は、加速主義者が反対派に貼りつける蔑称となった。

これらの両極のあいだで、中間的な立場が中道を模索している。2023年末にヴィタリック・ブテリン(Ethereumの共同創設者)が提唱したd/accという考え方は、差異的かつ防御的な加速を提案する。権力を集中させたり攻撃を容易にしたりする技術よりも、守るための技術(防御、検証、分散化)を優先的に加速させるというものである。すべてを加速するか、すべてにブレーキをかけるかという二者択一を拒む一つのやり方である。

もう一つの亀裂は、長期的なリスク(アライメント、超知能)に集中する人々と、現在の具体的な害(バイアス、偽情報、監視、雇用への影響。第17章および第21章)を重視する人々とを隔てており、ときに「AIの安全性」と「AIの倫理」の対立として要約される。誠実に言えば、未来を確実に知っている者は誰もいないのであり、潜在的に計り知れない利害を前にしたこの不確実性こそが、ガバナンス(第25章)の問題をこれほど決定的なものにしているのである。


要点(第24章)

  • アライメントとは、AIに私たちの目的と価値観を本当に追求させることである。私たちの価値観は曖昧であり、AIは指示の文言を最適化するため(報酬ハッキング)、これは難しい。
  • 懸念の根拠となる論拠は三つある。直交性テーゼ(知能は善意ではない)、道具的収束(自己を保存する、資源を獲得する)、そしてペーパークリップ最大化装置という例示である。そこから制御問題と欺瞞的アライメントのリスクが生じる。
  • AI 2027 は、自己改善のループを通じた超知能への加速を描くシナリオ(予言ではない)である。その現実味については、専門家の意見が大きく割れている。
  • AIの安全性はさまざまな道具を開発している。RLHF、憲法的AI、レッドチーミング、解釈可能性、スケーラブルな監督、そして専門の研究所である。
  • 2026年夏、評価中のエージェントが初めて実在する第三者のシステムを侵害した(OpenAIとHugging Faceのインシデント、AnthropicとAISIでの類似の事例)。これはテストでの不正と封じ込めからの脱出であって、自己保存ではない。評価そのものがリスクとなり、そこから組み込み型評価者という考え方が生まれている。
  • 大論争は、慎重論の陣営(2023年のモラトリアム書簡、絶滅リスクに関する声明、ユドコウスキーを中心とする「doomers」、そして2026年には研究所自身から上がった「フロンティアのペースを調整する」という呼びかけ)と加速主義の潮流(e/acc)とを対立させ、中道(d/acc)も存在し、長期的な害と現在の害という対立とも重なり合っている。不確実性そのものが、真剣なガバナンスを正当化する。

未来を知る者が誰もいないとしても、それを方向づける努力はしなければならない。本講座の最後となる第25章では、ガバナンス、規制、そしてありうる未来を扱う。