「なぜ急にAIが賢くなったの?」
「GPTやLLMとは、どうつながっている?」
文章を1語ずつ読むAIから、文全体を一気に見比べるAIへ。
Transformerとは、文中の単語同士の関係を一度に見比べて意味をつかむ仕組みです。いま、多くの生成AIがこの仕組みを土台にしています。「順番に読む」から「一気に見比べる」への転換が、今のAIブームの引き金になりました。
この記事は、時間の流れに沿って進みます。まず1語ずつ読む旧来のやり方の限界を見て、2017年の転換点をたどり、中核のAttentionが何を見ているのかを図でつかみます。読み終えるころ、あなたはGPTやLLMとのつながりまで一望できます。生成AIパスポートの技術分野に、そのまま効きます。
1. 一語ずつ読む時代が抱えていた限界

Transformerの前は、RNNのように、文章を先頭から順番に1単語ずつ処理する仕組みが主流でした。あなたが本を読むのと同じで、前の単語を読み終えてから次へ進みます。素直な発想ですが、ここに2つの弱点がありました。
1つは速度です。順番に読む以上、前の処理が終わるまで次に進めません。文が長いほど待ち時間が積み重なり、大量の文章を学ばせるのに膨大な時間がかかりました。もう1つは遠くの関係の取りこぼしです。文の始めに出た単語と終わりの単語が関係していても、順番に読むうちに前半の記憶が薄れ、離れた単語同士の結びつきをつかみにくかったのです。
2. 2017年、「Attention Is All You Need」が変えたこと

転機は2017年です。Googleの研究チームが発表した論文「Attention Is All You Need」で、Transformerが提案されました。タイトルが示すとおり、この仕組みの核はAttention(後述)で、順番に読む処理を思い切って手放した点が新しさでした。
順番待ちをやめると、何が起きるか。あなたが目にする変化は、文中の単語をまとめて同時に見比べられるようになることです。これが並列処理です。前の単語の処理を待たずに済むので、大量のテキストを一気に学ばせられるようになりました。旧来と何が入れ替わったのかを、表で並べます。
| 観点 | 旧来(順次処理) | Transformer |
|---|---|---|
| 読む順序 | 先頭から1単語ずつ | 文全体をまとめて見比べる |
| 処理の仕方 | 順番待ちが発生 | 並列で同時に処理 |
| 遠い単語の関係 | 薄れやすい | 直接結んで捉える |
| 大規模学習 | 時間がかさむ | 現実的な時間で回せる |
3. Attentionは、文中の何を見ているのか
Transformerの心臓がAttentionです。難しく聞こえますが、やっていることは1つ。「いま見ている単語にとって、文中のどの単語が重要か」を点数付けする——これだけです。
たとえば「彼は犬を見て、それを可愛がった」という文。あなたは「それ」が「犬」を指すと自然に読み取れるはずです。Attentionも同じことを点数でやります。「それ」という単語から見て、文中のどの単語が関係深いかを採点し、「犬」に高い点(強い反応)を付ける。この反応の強さを、太い矢印として描いたのが次の図です。
そしてTransformerの強みは、この点数付けを全単語ペアぶん、まとめて同時に計算するところにあります。順番待ちがないので、長い文でも離れた単語の結びつきを一気にとらえられる。前のH2で見た並列処理の恩恵が、この関係の読み取りにそのまま効いています。仕組みをもう一段深掘りしたいなら、Attentionとは で単独に整理できます。
4. GPTのTはTransformer — 生成AIの共通土台

ここまで来ると、あなたにも聞き覚えのある名前とつながります。GPTの「T」は、Transformerの「T」です。GPTはGenerative Pre-trained Transformer(生成的・事前学習済み・Transformer)の略で、Transformerを土台に、大量のテキストで事前学習を重ねた言語モデルにあたります。
そしてLLM(大規模言語モデル)の多くが、内部構造としてTransformerを採用しています。対話AIから業務向けの文章生成まで、幅広いLLMが同じ土台の上に立っている、という関係です。1つの仕組みが、これだけ多くのモデルの共通の下地になっているのは珍しいことです。
5. 言葉を超えて広がるTransformer

Transformerの物語は、文章の中だけにとどまりませんでした。「関係の強い相手を点数付けして一気に見比べる」という発想は、言葉に限らず使えます。そのため近年は、画像・音声・動画といった、文章とは別の種類のデータにも同じ考え方が広がっています。
画像なら小さな区画同士の関係を、音声なら時間ごとの音の断片同士の関係を、Attentionで見比べる。入力の種類が変わっても、中心の発想は共通です。ChatGPTのような対話AI、画像生成AI、音声認識AIまで、生成AIの主役級プロダクトの多くが、この1つの仕組みを土台に持っています。2017年の論文から始まった流れが、いま生成AI全体を下から支えているわけです。
次のステップ
あなたが次に読むなら、Transformerを土台に使うモデルの代表として LLMとは へ、あるいは中核の仕組みをもう一段深く見る Attentionとは へ進むのが自然な順序です。土台の全体像は 基盤モデルとは で俯瞰できます。
試験全体でどこがどう問われるかを掴みたいなら、生成AIパスポートの試験範囲と勉強法ガイド で優先順位を立てるのが着実です。学んだ流れを得点に変えるなら、生成AIパスポート LLM・基盤技術の問題集 で、Transformer周辺の設問にあたって定着させるとよいです。