OllamaでつくるRAG、社内ナレッジ検索の手順
社内ナレッジ検索RAGとは、社内文書をAIに検索させてから答えさせる仕組みです。Ollama(オラマ)という無料ツールを使えば、データを外に出さず自分のPC内だけで作れます。
この記事は、こんな方に向けて書きました。「社内の規程やマニュアルが多すぎて、探すだけで時間が消える」。そう感じている中小企業の経営者や担当者の方です。しかも「ChatGPTに社内文書を貼るのは不安」という方にも合います。
私は毎日AIを実務で使い倒していますが、触れば触るほど思います。難しそうに見えるだけで、やってみると拍子抜けするほど簡単です。今回は、その代表例を手順つきでお話しします。
RAGって名前からして難しそう…。うちにはエンジニアもいないんですけど。
ええ質問やね。仕組みは「AIに辞書を引かせてから答えさせる」だけやから、思てるより全然カンタンやで。
OllamaでRAGを作ると何が変わる?

結論から言うと、探す時間が減り、機密情報を外に出す心配もなくなります。AIの料金も、使えば使うほど増える従量課金から解放されます。
RAG(検索拡張生成)の流れは、たった3段階です。
- 質問に関係する部分を、社内文書から検索する
- その部分を質問と一緒にAIへ渡す
- AIが、渡された内容を根拠に答える
通常のAIは、あなたの会社の昨日の議事録を知りません。だから、もっともらしい嘘をつくことがあります。RAGなら資料を読みながら答えるので、この問題を大きく減らせます。TDCソフトウェアエンジニアリングのコラム(2026年)も、ローカルLLMとRAGの組み合わせを「機密データを外部へ送信せずに社内専用AIを構築できる方法」として紹介しています。
私の考えを言います。RAGの価値は「便利な検索」ではありません。「あの件、誰が知ってる?」と人に聞いて回る時間をなくすことです。詳しい人の時間を、本当にその人らしい仕事に戻せます。これが、面倒な作業を任せて好きと得意に集中する第一歩だと思っています。
Ollamaで社内ナレッジ検索を作る手順は?

手順は大きく4ステップです。公開されている技術記事の構成を参考にまとめます。
ステップ1:Ollamaを入れて、モデルを2つ取得する
Ollamaの公式サイトから、Windows・Mac・Linux用のインストーラを入れます。次に、ターミナルで次の2行を実行します。
ollama pull gemma3:4b
ollama pull nomic-embed-text1つ目は回答を書くAI、2つ目は文章を数値に変える「埋め込みモデル」です。NTTデータ系の技術ブログ(Zenn、LangChain v1対応の記事)も、この組み合わせをメモリ8GB以上のWindows11ノートPCで動かしています。役割が違う2つのモデルが必要、と覚えてください。
ステップ2:文書を読み込んで分割し、保存する
Python 3.10以降で、仮想環境を作ってライブラリを入れます。
pip install langchain-community chromadb pypdfChromaDBは、ローカルファイルとして動くベクトルデータベースです。外部サーバーは要りません。PDFやWord、Excelを読み込み、小さな塊(チャンク)に分けて保存します。保存するのは、この塊と数値の組です。
ステップ3:質問と検索、回答をつなぐ
質問を数値に変え、近い塊を数件取り出します。それをAIに渡し、「この資料の範囲だけで答えて」と指示します。この一言が大事です。資料にないことは「わかりません」と言わせれば、嘘を防げます。
ステップ4:まずは10〜20ファイルで試す
最初から全社の文書を入れてはいけません。就業規則や経費精算ルールなど、よく聞かれる資料だけで十分です。
コードを書くのはやっぱりハードル高いです…。他に方法はないんですか?
あるで。<a href="https://anythingllm.com" target="_blank" rel="noopener noreferrer nofollow">AnythingLLM</a>みたいなアプリなら、画面で文書を放り込んでOllamaにつなぐだけやで。
機器の目安も押さえましょう。ある技術記事では、Ollamaの公式ガイドとして、7Bクラスのモデルで約8GB、13Bクラスで約16GBのメモリが目安と紹介されています。GPUがなくてもCPUで動くため、試すだけなら今あるPCで十分です。費用面の詳しい話は、過去記事のブログ一覧にある「ローカルLLM導入、費用とPCスペックの目安」もあわせてご覧ください。
精度が出ないときはどう直す?

答えがズレたら、まず文書の分け方(チャンクサイズ)を疑ってください。リナックスマスター.JPの解説でも、回答精度が低いときの最初の改善ポイントはchunk_sizeとchunk_overlapの調整とされています。
調整の考え方は次の表のとおりです。
症状 | 試すこと |
|---|---|
答えが断片的 | チャンクを大きくする |
関係ない内容が混ざる | チャンクを小さくする |
文の途中で切れて意味が通らない | オーバーラップを増やす |
古い規程を答える | 文書を差し替えて再インデックス |
日本語のPDFでは、表や段組みの読み取りで崩れることもあります。そんなときは、元の文書をテキストやWordに整えるだけで、見違えることがあります。
もう一つ、回答の末尾に「どの文書の何ページか」を出させましょう。根拠が見えると、社員が安心して使えます。
私自身、AIにブログ記事の下書きや調べものを任せていますが、最初の指示を少し直すだけで出力が一変します。RAGも同じで、一発で完璧を狙わず、触りながら育てるのがコツです。
結局、どのモデルを選べば日本語でも安心ですか?
最初は軽いモデルで十分や。足りんかったら、OpenAIが公開したgpt-oss:20bみたいな大きめに替えたらええ。モデルはコマンド1行で入れ替えられるのが強みやね。
なお、Ollama自体の安全設定は別の問題です。社内に置くなら、過去記事「Ollamaの安全性は?社内導入の落とし穴と安全設定3ステップ」で触れた設定も確認してください。
まとめ:探す時間を、あなたの得意に回そう
OllamaでのRAG構築は、モデル2つの取得、文書の分割と保存、検索と回答の接続、という流れです。特別な設備は要りません。まず10ファイルで試し、ズレたらチャンクを直す。それだけで、社内の「探す時間」は確実に減ります。
効率化は目的ではありません。探し物や問い合わせ対応から解放された先に、あなたの本当の価値があります。あなたが一番ワクワクする仕事は何でしょうか。自分の得意なことは何だろう、と少し考えてみてください。AIに雑務を引き受けてもらい、その時間でお客様と向き合う。私はそんな社会を一緒につくりたいのです。
最初の一歩は小さくて大丈夫です。今日、Ollamaを入れてみてください。「なんだ、こんなに簡単だったのか」と、きっと思います。
社内ナレッジ検索の構築を自社で進めたい方は、つむぎや株式会社にご相談ください。社員の皆さんが自分で使いこなせるようになる研修もご用意しています。