AI を載せる前に、載せるに値する情報を作る。前章までで部品は揃った ── 土台・門番・文書・コード・メール・会議・Web・API と、道具は立った。だが、その上を流れる情報そのものは、まだ散らばっている。共有フォルダの底に沈んだファイル、紙とスキャン PDF、そして最も重いもの ── 誰かの頭の中にしかない属人知。ここではその三つを、書かれた・構造化された状態へ移す。
整備こそ本体、AI は最後の一手
順序を間違えてはいけない。RAG も、自前の AI も、整った情報の上にしか立たない。散らばった・書かれていない情報に、いくら賢いモデルを載せても、出てくるものも整わない(garbage in, garbage out)。
だから本章は、AI の前に置く。やることは三つ ── 紙を読む(OCR)、散らばりを揃える(分類・構造化)、頭の中を書き出す(属人知の成文化)。
そして、この整備には、二つの性質がある。
- 人にしかできない判断だ。何を残し、何を捨て、どう構造化するか ── これは業務を知る人間の判断で、AI に丸投げできない(1-04)。AI は下書きを助けるが、決めるのは人だ。
- no-regret 投資だ。情報を構造化すれば、AI を一切載せなくても回収できる。属人化が解け、引き継ぎが楽になり、業務が健全になる。AI は、その上に最後に載る一手にすぎない。
賢いモデルより、整った情報のほうが効く。整備こそ本体。AI は、最後の一手だ。
紙は OCR でテキストにする
最初の関門は、これまで機械が読めなかった情報だ。紙、スキャン、画像 PDF、手書き。
- 定型・活字なら、Tesseract などの OSS OCR でテキスト化できる。Tesseract も
ocrmypdfも Debian 13 の apt にある。 - レイアウトが複雑な帳票・図表混じりは、オープンウェイトのビジョンモデル (2-16 で立てるローカル AI)に読ませ、Markdown に起こす。
# 例: スキャン PDF をテキスト層つきに(OSS OCR)
ocrmypdf --language jpn input.pdf output.pdf # 検索可能な PDF + テキスト
出力は、文字(AsciiDoc か Markdown)とプレーンテキストに寄せる。専用フォーマットに閉じ込めない ── 後で誰でも・どの AI でも読めるようにするためだ(2-07 の原則)。
散らばりは、分類と構造化で揃える
次に、散らばったファイルを揃える。
- 置き場を一つに ── 2-07 で決めた、Forgejo のリポジトリに集める。届いたファイルはファイルのまま。
- メタデータを付ける ── 種類・部門・日付・版を、フォルダとファイル名で持つ。
- 構造を Markdown で ── 見出し・箇条書き・表で、機械にも人にも読める形に整える。 AI に下書きさせ、人が直す。
ここで AI は強力な助手になる。「この 200 ファイルを種類ごとに分類し、要約を付けて」── 分類も要約も、ローカルのモデル(2-16)で回せる。だが、*分類の軸を決めるのは人*だ。業務にとって何が「同じ種類」かは、業務を知る者にしか分からない。
頭の中は、聞いて書き出す
最も重く、最も価値があるのが、書かれていない知だ。長年の担当者の頭の中にある、仕様の曖昧な部分、例外処理、なぜそうなっているかの理由。これが消えると、システムは「動くが、誰も分からない」状態になる(3-05 の人的依存)。
やり方は、2-12 で基幹ロジックに使ったのと同じだ ── 現場にヒアリングし、AI に下書きさせ、現場が確認する。
- 担当者に聞く・録る → AI が文字起こしと構造化の下書き
- 下書きを担当者が読み、誤りを直す(ここが検証 ── 人にしかできない)
- 確定したものを、Markdown で文書置き場に置く
属人知が書かれた瞬間、それは引き継げる資産になる。AI を載せるかどうかと無関係に、ここで会社は強くなる。
整った情報の上に、AI を載せる
整った情報が揃って、はじめて次章だ。書かれた・構造化された文書を、2-03 の pgvector に埋め込み、RAG に載せる(2-16)。
整備を飛ばして RAG を組むと、出典は曖昧で、答えは当てにならない。整備を済ませてあれば、自社の実データに基づいて、出典つきで答える AI が、素直に立つ。
RAG の質は、モデルの賢さではなく、載せた情報の整い方で決まる。
確かめ方
この章は、次の五つができていれば済みだ。
- 紙の帳票が、検索できるテキストになっている(PDF を開いて語を検索すると当たる)
- 図表混じりの帳票が、Markdown として読める形に起きている
- 文書置き場が一つになり、種類・部門・日付・版が、フォルダとファイル名で分かる
- 担当者一人しか知らなかった手順が Markdown になり、本人が読んで直した版が置き場にある
- 置き場の文書が、専用フォーマットではなく Markdown とプレーンテキストで開ける
人が持つ物
人が渡す値
- 分類の軸 ── 業務にとって何を「同じ種類」とするか
- 何を残し、何を捨てるかの判断
- メタデータの項目(種類・部門・日付・版)と、その付け方
- OCR にかける言語(
--languageに渡す値) - ヒアリングする担当者と、録音してよいかの許可
- 文書置き場の場所
AI が「やる前に言う」操作
- 紙やスキャンの原本を、消す・動かす
- 置き場のファイルを、一括で改名する・移動する
- ヒアリングの録音を、外のサービスへ送る
- 担当者の確認が済んでいない下書きを、確定版として置き場に入れる
確かめた版と日付
- Tesseract 5.5、
ocrmypdf16.7(Debian 13 のパッケージ)、オープンウェイトのビジョンモデル(2-16 の AI のサーバー)、pgvector(2-03) - 手順を書いたのは 2026-07-16、見直したのは 2026-10-06
- 版が上がっていたら、AI に公式の手順を確かめさせてから進める
まとめ
AI の前に、情報を整える。
- OCR ── 紙・スキャンを、Tesseract やビジョンモデルで Markdown に
- 分類・構造化 ── 置き場を一つに、メタデータと Markdown で揃える(軸は人が決める)
- 属人知の成文化 ── ヒアリング → AI 下書き → 現場が確認(2-12 と同じ)
- AI は最後の一手 ── 整えた情報を pgvector に載せ、RAG は次章で(2-16)
整備は、AI を載せなくても回収できる ── 属人化が解け、引き継ぎが楽になる。整備こそ本体で、賢いモデルより、整った情報が効く。
次章では、この整えた情報の上に、自前の AI を据える。