LLMの仕組み
「なぜ AI はもっともらしい文章を作れるのか」の謎を解く
ChatGPT や Claude に質問すると、まるで知識豊富な専門家が答えてくれているかのような文章が返ってきます。「なぜそんなことができるのか」と不思議に思ったことはありませんか?
その仕組みを理解すると、AI をもっと上手に使えるようになります。特に「なぜ AI は嘘をつくのか」という疑問が解けると、AI との付き合い方が大きく変わります。
LLM とは
LLM(Large Language Model / 大規模言語モデル)は、インターネット上の膨大なテキストデータで学習した、文章生成のための AI モデルです。
「Large(大規模)」というのは、学習に使ったデータ量とモデルの規模(パラメータ数)の両方が「桁違いに大きい」ことを意味します。GPT-4 や Claude は、Webページ・書籍・論文・コードなど、数兆語規模のテキストで学習しています。
LLM の仕組み: 「次の単語を予測する」だけ
LLM の本質は、驚くほどシンプルです。
LLM がやっていることは「次に来る単語(トークン)を確率的に予測する」だけです。
例えば「今日の天気は」という文章があると、LLM は「次に来る言葉として可能性が高いのは何か」を膨大な学習データを基に計算します。
「今日の天気は」→ 次の候補:
「晴れ」 確率: 35%
「雨」 確率: 20%
「曇り」 確率: 18%
「どうですか」確率: 15%
その他 確率: 12%
この「次を予測する」作業をどんどん繰り返すことで、長い文章が生成されます。
人間は文章を「考えて」書きますが、LLM は「統計的に次に来そうな言葉」を選び続けているのです。
なぜ知識があるように見えるのか
学習に使われた膨大なテキストの中には、医学・法律・歴史・科学・プログラミングなど、あらゆる分野の情報が含まれています。LLM はその情報の「パターン」を学習しています。
「〇〇とは」という問いに対して、学習データの中にあった「〇〇についての説明」のパターンを使って回答を生成します。だから「知識があるように見える」のです。
ただし、LLM は情報を「検索してきている」わけではありません。学習時に吸収したパターンから生成しているため、情報の「鮮度」「正確性」の保証がありません。
ハルシネーションとは
ハルシネーション(hallucination / 幻覚)とは、LLM が事実と異なる情報を、自信を持って正しいかのように生成する現象です。
なぜハルシネーションが起きるか
「次に来る確率の高い言葉を選ぶ」という仕組みから、ハルシネーションは必然的に生まれます。
「〇〇教授が 2020 年に発表した論文によると」という文脈では、LLM はそれっぽい論文タイトルと内容を「生成」します。しかし実際にはその論文が存在しないことがあります。LLM は「正確な情報を引用する」のではなく「それっぽい文章を作る」のが仕事だからです。
ハルシネーションの具体例
例 1: 存在しない論文や URL を引用する 「AI に関する学術論文を 3 本教えて」と聞くと、もっともらしいタイトルと著者名が返ってきますが、実在しない論文が混ざっていることがあります。
例 2: 古い情報を最新として答える LLM の学習データには「カットオフ日」があります。それ以降の情報は持っていないため、「最新の状況は?」と聞いても古い情報が返ることがあります。
例 3: 計算を間違える 「3,847 × 2,163 を計算してください」のような複雑な計算は苦手で、もっともらしい数字を「生成」してしまうことがあります。正確な計算が必要な場合はコード実行ツールを使いましょう。
ハルシネーションへの対処法
| 場面 | 対処法 |
|---|---|
| 数値・統計の確認 | 一次ソース(公式サイト・論文・統計)で必ず確認 |
| 論文・書籍の引用 | タイトルと著者名を検索して実在を確認 |
| 法令・規制の確認 | 弁護士等の専門家または公的機関の公式文書で確認 |
| 計算 | 「Python コードで計算して」と依頼してコード実行で検証 |
| 不明な場合 | 「わからない場合は「わからない」と答えてください」とプロンプトに明示 |
コンテキストウィンドウ——「一度に覚えられる量」
LLM が一度の会話で処理できるテキスト量の上限をコンテキストウィンドウと呼びます。
人間の「短期記憶」のようなものです。今読んでいるページは覚えていますが、1 年前に読んだ本の内容はすぐには思い出せません。LLM も、コンテキストウィンドウの範囲内にある情報しか参照できません。
主要モデルの比較
| モデル | コンテキスト窓 | 日本語換算 |
|---|---|---|
| GPT-4o | 128K トークン | 約 6〜7 万文字 |
| Claude 3.7 Sonnet | 200K トークン | 約 10〜12 万文字 |
| Gemini 1.5 Pro | 1M トークン | 約 50 万文字以上 |
長い会話での注意点
会話が長くなると、最初の方に言っていた内容が「参照できなくなる」ことがあります。これは LLM が「忘れた」のではなく、コンテキストウィンドウの容量の関係で参照できなくなっているからです。
対処法: 長い会話では、重要な前提条件を適宜まとめて改めて伝え直すと、精度が維持されます。
具体的なイメージ: LLM は「超高性能な予測変換」
スマートフォンで文字を打つとき、次に来る言葉の候補が表示される「予測変換」機能を使ったことがあると思います。
LLM は、それの桁違いに高性能な版です。予測変換が「自分がよく使う言葉パターン」から学習しているのに対し、LLM は「人類が書いたテキスト全体のパターン」から学習しています。
スマートフォンの予測変換が「もっともらしい次の言葉」を提案するように、LLM も「この文脈でもっともらしい次のトークン」を次々と生成します。その積み重ねが、智者が答えたかのような文章になるのです。
そして予測変換が「意味を理解して」ではなく「よく出てくるパターン」で提案するように、LLM も「理解して」いるわけではなく、「統計的に妥当なパターン」を出力しています。これがハルシネーションの根本原因です。
よくある誤解
「LLM は検索エンジンのように、最新情報をリアルタイムで調べている」と思われがちだが、実際は違う
基本的な LLM は学習データに基づいた生成のみ行います(リアルタイム検索は別機能として追加されたもの)。「最新情報を教えて」と聞いたときに正確な答えが返っても、それは学習データに含まれていた情報であり、今この瞬間に調べた情報ではありません。
「LLM が自信を持って答えているなら正しい」と思われがちだが、実際は違う
LLM は確率的に「もっともらしい文章」を生成するため、自信のある口調で誤情報を述べることがあります。回答のトーン(自信度)と内容の正確性は無関係です。
「ハルシネーションは古い AI の問題で、最新モデルは解決済み」と思われがちだが、実際は違う
最新モデルではハルシネーションの頻度は大幅に下がっていますが、なくなったわけではありません。「次のトークンを予測する」という仕組みである限り、ハルシネーションを完全になくすことは難しいと考えられています。
まとめ
- LLM とは膨大なテキストデータで学習し、「次に来るトークンを予測する」モデル
- 「理解して」回答するのではなく、「統計的にもっともらしい文章」を生成している
- ハルシネーション(誤情報を自信満々に出力)は LLM の構造上避けられない——重要情報は必ず一次ソースで検証する
- コンテキストウィンドウは「一度に処理できるテキスト量の上限」で、超えると以前の情報が参照できなくなる
確認問題
Q: LLM がハルシネーション(存在しない論文を引用するなど)を起こす主な理由はどれですか?
A. インターネットの接続が不安定で、正しい情報にアクセスできないから
B. 「次に来る確率の高いトークンを予測する」という仕組み上、正確さより「もっともらしさ」が優先されるから
C. 学習データが少なすぎるから
D. 日本語の処理が苦手なため、翻訳エラーが起きるから
→ 正解: B(LLM は「次のトークンの確率を計算する」という仕組みで動いており、「正確な情報を返す」ようには設計されていません。統計的にそれっぽい文章が生成されますが、内容の正確性は保証されません)
全 12 レッスンを、登録なしで無料で読めます。