AIの精度はどう検証するか|評価データの作り方

AIの精度はどう検証するか|評価データの作り方の図解。精度は「出力単位」と「誤りの種類」を決めて初めて測れる値になる/帳票単位で数える/1つでもミスがあれば不正解。実務感覚に近い/項目単位で数える/各項目で正誤を判定。数字は高く出る/文字単位で数える/かなり高く出る。業務判断には使えない/気づける誤り ── 許容しやすい/未抽出(空欄で返す)/表記ゆれ/人が埋める・正規化 AI活用方法

「精度は何%出ますか」という質問に、そのまま数字で答えられる開発会社は信用しないでください。精度は業務の出力単位と誤りの種類を決めて初めて測れる値です。この記事では、不動産・建設の実務で使える評価セットの作り方を工程順に説明します。

そもそもAIの精度検証とは何をすることですか?

AIの精度検証とは、業務で扱う出力単位ごとに人が正解データを用意し、誤りを種類別に分類したうえで、項目ごとの許容範囲と照らして合否を判定する作業です。

「精度90%」という表現が発注側と開発側でずれるのは、何を1件と数えるかが共有されていないからです。同じシステムでも数え方でこう変わります。

数え方 何を1件とするか 見え方
帳票単位 賃貸借契約書1通に転記ミスが1つでもあれば不正解 数字は低く出る。実務感覚に近い
項目単位 賃料、共益費、敷金…の各項目で正誤を判定 数字は高く出る
文字単位 OCRの1文字ごとに判定 かなり高く出る。業務判断には使えない

契約書1通に20項目あり、そのうち1項目を間違えた場合、項目単位なら95%ですが、帳票単位では0%です。この契約書はそのまま使えないので、実務的に正しいのは帳票単位の見方です。

最初の打ち合わせで決めるべきことは3つです。

  1. 1件の定義:帳票単位か、項目単位か。両方測るなら両方を報告書に載せる
  2. 誰が正解を決めるか:現場担当者か、管理者か、複数人の合議か
  3. 合否ライン:どの項目が、どの状態なら「業務に載せてよい」のか

この3つを決めずに検証に入ると、「体感では使えない」「数字上は出ている」という主観の応酬になります。

評価データはどう作りますか?

実データからサンプルを抜き、現場担当者が正解を付ける、という順で作ります。開発側が作った疑似データで評価してはいけません。

工程1:サンプルの抜き方を設計する

件数を先に決めないでください。先に決めるのは内訳です。転記・抽出系の業務なら、最低限このばらつきを反映させます。

  • 入力元の種類:レインズの出力、仲介会社ごとのマイソク、FAXで届いた手書き、PDF、写真で撮った紙
  • 物件種別:居住用と事業用、区分と一棟、土地と建物
  • 取引形態:売買と賃貸、専任と一般、代理と媒介
  • 時期:直近だけでなく、書式が変わる前の古い書類も含める
  • 担当者の癖:備考欄の書き方は人によって大きく違う

そのうえで、意図的に「崩れた例」を混ぜます。ここを外すと本番で必ず数字が落ちます。

  • 項目が空欄のまま届いた資料
  • 手書きで追記・二重線で訂正された箇所
  • 斜めにスキャンされた、影が入った、印影が数字に重なった画像
  • 同じ意味の別表記(「1丁目2番地3」「1-2-3」「一丁目二番地三」)
  • 例外的な条件(定期借家、サブリース、区分所有の共用部負担など)

きれいなデータだけを集めた評価セットは、開発側にとって都合がよいだけの資料になります。

工程2:判定ルールを先に文書化する

正解を付ける前に、「何を正解とみなすか」を紙に落とします。ここを飛ばすと、評価の途中で判定が揺れて数字が意味を失います。実際によく揉めるのは次のような点です。

  • 物件名の表記ゆれ(「○○マンション」「○○マンション 301号室」)は正解とするか
  • 面積は登記面積と現況(壁芯・内法)のどちらを採るか
  • 賃料に消費税を含めるか、税抜で取るか
  • 全角半角、カンマの有無、円マークの有無は誤りとするか
  • 記載が無い項目は「空欄」が正解か、「該当なし」が正解か

表記ゆれのように後処理の正規化で吸収できるものは、評価の対象から外すか、別カテゴリとして集計します。これらを誤りに混ぜると、本当に危険な誤りが数字の中に埋もれます。

工程3:現場担当者に正解を付けてもらう

正解付けは、実際にその業務を毎日やっている人が行います。管理職や開発側が付けた正解は、現場の運用ルールとずれることが多いためです。

進め方の推奨は次の通りです。

  1. 同じサンプルに2名が独立して正解を付ける
  2. 2名の答えが割れた箇所だけを抜き出す
  3. 割れた箇所を関係者で議論し、判定ルールに追記する
  4. ルールを更新したうえで正解を確定する

2名の判断が割れた項目は、AIにとっても難しい項目です。この工程で洗い出された論点は、そのまま仕様の検討課題になります。逆にここで人間同士が一致しない項目は、AIに一致を求めても意味がありません。

工程4:一部を開発側に渡さない

評価セットのうち一定割合は、開発側に見せずに発注者側で保持してください。開発側は渡されたデータに合わせて調整を重ねるため、渡した分だけでは実力が測れなくなります。伏せておいた分で最後に測る、という段取りにします。

誤りは全部同じ扱いでいいですか?

いいえ。誤りは人が気づけるかで扱いを分けます。これが精度設計の中心です。

誤りの種類 何が起きるか 人が気づけるか 扱い
未抽出(空欄で返す) 項目が埋まらない 気づける 許容しやすい。人が埋める
誤抽出(もっともらしい誤った値) 誤った数字が入ったまま流れる 気づきにくい 最も危険。原則ゼロを目指す
表記ゆれ 意味は合っているが書式が違う 気づける 正規化で後処理
桁・単位違い 賃料10万円が100万円、㎡と坪の取り違え 額次第で気づく 致命的。範囲チェックで機械的に検出
別項目への混入 共益費の額が賃料欄に入る 気づきにくい 危険。相互の整合チェックを入れる

空欄が返ってくるほうが、間違った値が入っているよりはるかに安全です。「わからないときは空欄で返す」という挙動を仕様として明記してください。埋まっている率(網羅率)と、埋まっているものが合っている率(正確率)は別々に測り、後者を優先します。

この設計を実装に落とすと、AIに確信度を一緒に出させ、閾値を下回ったものは自動で人のチェック列に回すという形になります。全件を人が見るのではなく、危険なものだけを人に回す。これが現場で回る形です。

許容誤差は項目ごとにどう決めますか?

業務影響の大きさで決めます。全項目に同じ基準を当てると、重要項目が緩すぎるか、些末な項目に過剰なコストがかかるかのどちらかになります。

不動産の転記業務であれば、次のような整理になります。

項目 誤ったときの影響 基準 運用でのカバー
賃料・共益費・敷金・礼金 契約金額の誤り、再締結 誤抽出は不可。不確実なら空欄 全件を人が目視。金額の範囲チェック
所在地・地番・面積 法定書面の誤記 誤抽出は不可 登記情報・原本と突合
契約期間・更新条件 更新漏れ、明渡し時期の齟齬 誤抽出は不可 日付の妥当性を機械チェック
物件名・部屋番号 取り違え 誤抽出は不可。表記ゆれは許容 正規化ルールで吸収
設備・特約の自由記述 追記で回復可能 見逃しを許容 担当者が原本を見て補う

建設業でも考え方は同じです。工事写真の分類(国土交通省「デジタル写真管理情報基準」令和5年3月では、写真区分→工種→種別→細別の階層で管理します)を自動付与する場合、写真区分の誤りは電子納品の受理に影響しますが、細別の抜けは提出前の確認で補える、といった具合に階層ごとに扱いを変えます。なお基準への適合可否の最終判断は発注者・監督員が行うため、AIの出力は提出前チェックの補助という位置づけになります。

「AIが8割やって、残り2割を人が拾う」という表現は避けてください。どの2割かを人が特定できなければ、結局全件を見ることになります。決めるべきは割合ではなく、人が見る対象を機械的に選べる条件です。

運用開始後も精度は測り続ける必要がありますか?

必要です。検証時の数字は、その時点のデータに対する値でしかありません。

精度が落ちる典型的なきっかけは次の通りです。

  • 仲介会社がマイソクの書式を変えた
  • レインズや社内基幹システムの出力項目が改定された
  • これまで扱っていなかった物件種別・契約形態を扱い始めた
  • 利用しているAIモデルが提供元側で更新された
  • 入力を担当する人が変わり、備考欄の書き方が変わった

そのため、測定を運用に埋め込みます。推奨する組み込み方は3つです。

  1. 修正ログを残す:人が画面上で値を直したら、直す前と直した後を記録する。修正率がそのまま実運用の誤り率になります。専用の検証作業を追加せずに数字が取れるのが利点です
  2. 月次でサンプリング再評価する:修正ログは「人が気づいた誤り」しか捉えられません。気づかれずに流れた誤りを拾うため、月に一度、少数を抜き取って原本と突合します
  3. 変更をトリガーに再評価する:書式変更やモデル更新の連絡を受けたら、保管してある評価セットで測り直す。そのために評価セットは捨てずに保管します

エクサテックが株式会社イーリアルティ様に構築した転記エージェントでは、契約の前段階から何度も現場に足を運び、困りごとを理解するところから着手しました。評価データを作る工程も同じで、現場の操作を見ないと「何を正解とするか」の設計ができません。

AIの精度検証でできないことは何ですか?

明示しておきます。

  • 100%は保証できません。 現状の生成AI・OCRは確率的に出力するため、同じ入力でも結果が揺れることがあります。したがって「人の確認をゼロにする」設計は、法定書面や契約金額を扱う業務では推奨できません
  • 評価セットに無いパターンの精度は測れません。 測定値はサンプルの範囲内の話です。「未知の書式が来たときどうなるか」は測定ではなく、空欄で返す・エラーで止まるという設計で守ります
  • 低頻度の誤りは少数サンプルでは検出できません。 数百件に1件しか起きない誤りは、数十件の評価では現れません。そのため運用中の修正ログが必要になります
  • 自由文の出力は数値で評価しにくいです。 物件紹介文の生成や問い合わせ返信の下書きのように、正解が一意に決まらない出力は、正誤ではなく「そのまま送れるか/要修正か/使えないか」の3段階を人が判定する形にします。人による判定である以上、判定者間のばらつきも織り込む必要があります
  • 精度が良くても業務に載るとは限りません。 既存の入力画面と行き来が発生する、確認のクリック数が増えるといった理由で使われなくなる例があります。精度の検証と、業務フローに載るかの検証は別々に行ってください
  • 法的責任はAIに移せません。 重要事項説明書には宅地建物取引士の記名が必要と宅地建物取引業法第35条に定められており(2022年5月18日の改正で押印は不要となり記名のみ)、内容の責任は有資格者にあります。AIは下書きの位置づけを崩さない設計にしてください。個別案件は専門家にご確認ください

関連する実装・運用の手順

AIの検証を進める際は、精度の評価、変更時の回帰テスト、現場での受入テストを分けて設計します。次の関連記事で各工程を確認できます。

まとめ

  • 精度は「1件の定義」を決めて初めて測れます。帳票単位と項目単位では数字が大きく変わるため、契約前に定義を共有してください
  • 評価データは実データから作り、崩れた例外を意図的に含めます。正解は現場担当者2名が独立して付け、割れた箇所を議論して判定ルールに落とします
  • 誤りは「未抽出」と「誤抽出」を分けて扱います。もっともらしい誤った値を返す誤抽出が最も危険で、わからないときは空欄で返す仕様を明記します
  • 許容誤差は項目ごとに変えます。金額・所在地・契約期間は誤抽出ゼロ、自由記述は見逃し許容、という設計が現実的です
  • 運用開始後は人の修正ログを誤り率として蓄積し、月次のサンプリングと書式変更時の再評価を組み込みます

ご相談について

エクサテックは、不動産・建設の現場に入り、評価データの設計から実装・運用までを同じチームで担当しています。「精度が業務で使えるレベルか判断できない」「見積もりに書かれた精度の数字をどう読めばいいかわからない」といった段階のご相談も承っています。お手元の帳票や入力画面を見ながら、まず何を測るべきかを一緒に整理するところから始められます。

エクサテックへのご相談

どの業務から自動化すべきか、一緒に整理します

不動産・建設の現場に入り込み、仕組み設計からWebアプリ構築まで一気通貫で支援しています。1業務に絞った小さな範囲からの着手も可能です。「何から手をつけるべきか分からない」段階でのご相談で構いません。

無料で相談する 事業内容・開発事例を見る

AI活用方法
不動産業界・建設業界のAIメディア
タイトルとURLをコピーしました