46. AIの判断基準を公開資料から作る【実装編】— 実測値を機械検査に落とし、自分の資産を測り返す
公開資料の実測値を集めて、AIの判断基準を機械検査13項目と読解判定18項目に落とした。機械で測れるもの(文字数・フォント・出所の有無)とAIが読解すべきもの(示唆・トレードオフ)を分けた設計が核だ。一番効いたのは「資料の型を最初に判定して、以降の基準の当て方を切り替える」こと。結論がタイトルに入る型と、サブタイトルに入る型で、適用する判定ルールを分ける。型を間違えると全部狂う。完成後に自分の資産を測り直したら、痛い指摘が返ってきた。最小フォントが基準の8ptを下回っていた。機械判定には5週間気づかなかった。さらに月次レポートは機械判定で13項目すべてPASSだったのに、AIが「読み手に何もさせられない資料ですね」と言い返した。
ここが本音だ。事実の並べだけで、読み手が「で、何をするの」と困る状態。自分で基準を作ったのに、実装段階では見えない。これはスキル開発あるあるで、「要件通りに作った→実務で使われない」という落差の正体。システム部門が机上で完璧に設計しても、現場に乗せたら別の形が要る。完璧な基準は理屈であって、現実ではない。自社のAI導入も同じ構図に陥りやすい。対処は「完璧を目指さない」こと。最初は人間が見張りながら、毎日の「足りないこと指摘」をスキル改善に落とす。
著者のアプローチが示唆的だ。改善したら検出率が落ちた。なぜか。示唆化するほど、語彙リストから外れるようになったからだ。良い例で通ることを確認せず、悪い例だけで調整していた。これは開発あるあるで、バグを追い詰めて防ぎ過ぎると、成果物の成長を阻む。修正は語彙リストに「提言」カテゴリを足して、既存資産で誤検知が増えていないことを確認した。自分の資産で試して改善する習慣が、結局は一番堅牢なスキルを作る。
※ 上記は配信元記事をもとにAIの鬼編集部が要約・再構成したものです。正確な内容は出典元をご確認ください。
このニュースの全文は、配信元でお読みいただけます。 Zenn AIで元記事を読む →


