RAGの仕組みを完全解説!AI時代に欠かせない検索拡張生成をプロが解説
概要
RAGはAIモデル自体を賢く作り直すのではなく、質問に応じて社内資料などの関連情報を検索し、それを踏まえて回答させる仕組みである。AIエージェント構築や社内AI導入で拡張性の差を生む重要技術として、初心者向けに図解しながら解説している。
主なポイント
- AIには「知識のカットオフ」「社内・組織の内部情報を知らない」「知らないことを自信満々に答えるハルシネーション」という3つの限界がある
- RAG(Retrieval-Augmented Generation)は「質問受信→関連資料の検索→資料を添えたプロンプト生成→AIが回答」という4段階で動作する
- 検索には文字列一致の「キーワード検索」と意味の近さで探す「セマンティック検索」があり、型番など完全一致が重要な場合はキーワード検索が有利
- 文章は埋め込みモデル(エンベディング)により数百〜数千次元の数値列(ベクトル)に変換され、意味が近い文章ほど座標(距離)が近くなる
- 資料はそのままベクトル化せず「チャンク」という単位に分割し、各チャンクを「元の文章+ベクトル+メタデータ」の3点セットでデータベースに保存する
- AIが最終的に読むのは元の文章であり、ベクトルはあくまで類似度判定(検索)のためだけに使われる
- 検索結果を関連度順に並び替える「リランク」を組み込むと検索精度をさらに高められる
- RAGはモデル自体を再学習させる「ファインチューニング」とは異なり、モデルは変えずに検索の仕組みを外付けする手法である
- RAGを使っても誤りはゼロにはならず、違う資料を選んでしまう・資料を読み違えるといった限界がある
- ChatGPTのエージェンティックサーチやWeb検索機能はRAGとは別の仕組み(都度コマンドを実行して調べる方式)であり、RAGは事前にベクトルデータベースを構築しておく必要がある