基礎知識・しくみ

アライメント

読み
あらいめんと
英語・正式名称
Alignment

アライメントは、AIの目標や振る舞いを人間の意図や価値観に沿わせるための研究・技術のことです。AIの安全性の中心的なテーマです。

アライメントとは?

アライメント(Alignment:整列・調整)とは、AIの目標や振る舞いを、人間の意図や価値観に沿わせるための研究・技術のことです。「賢いAIを作る」ことと「人間のためになるAIを作る」ことは別の問題であり、後者を担うのがアライメントです。AIが強力になるほど重要性が増す、AI安全性の中心テーマです。

なぜ必要?

AIは指示を文字どおりに最適化しすぎて、意図しない行動を取ることがあります。有名な思考実験に「ペーパークリップの生産を最大化せよと命じられたAIが、あらゆる資源をクリップ製造につぎ込んでしまう」という話があります。極端な例ですが、「目標の与え方を間違えると、賢さがそのまま害になる」という本質を突いています。

身近なレベルでも、危険な質問に答えない、差別的な表現をしない、間違いを認める、といったチャットAIの振る舞いは、アライメント技術の成果です。

どうやって実現している?

  • RLHF:人間が回答の良し悪しを評価し、その評価をもとにモデルを調整する
  • 原則やルールを先に定め、モデル自身に守らせる方式(憲法AIなど)
  • レッドチーム:専門家がわざと攻撃的な使い方を試して弱点を探し、公開前に改善する

AIを使う側にも関係ある?

あります。AIが答えを拒否したり、回答に注意書きを添えたりするのはアライメントの表れで、故障ではありません。また、AIが賢くなるほど「人間の意図に沿っているか」の重要性は増していきます。AGIの議論とセットで語られることが多いのはそのためです。Anthropic(Claudeの開発元)のようにアライメント研究を看板に掲げる企業があること、各国でAIの安全性に関するルール作りが進んでいることも、この言葉を軸に見ると理解しやすくなります。

「AIアラインメント」という表記で登場することもあります。AIの能力開発と安全性研究のバランスは、AI業界の路線対立を読み解く重要な軸になっています。

関連する用語

出典・確認情報

内容確認日 2026年7月17日

AI用語集に戻る

サイト内検索