
AI精度の評価設計:正答率だけで判断しない
法律業務のAI評価では、名前や金額の誤りと表現の好みを同じ重さにできません。作業目的に応じた正解資料、重大度、見逃し率、人による確認時間を用い、導入可否を判断する方法を提案します。
評価する作業を限定する
記録から日付を抜き出す、証拠名を一覧化する、要約を作るなど、評価対象を一つの作業として定義します。複雑な起案全体を一つの点数にすると原因が分かりません。入力条件、期待する出力、採用してよい範囲を先に決めます。正解資料は担当者が原文と照合し、曖昧な項目は無理に一つの答えへ固定せず、許容範囲や保留条件を明示します。
誤りの重大度を分ける
人名、金額、期限の根拠、否定の取り違えなど、判断へ大きく影響する項目は別集計にします。全体の正答率が高くても、重要項目を一件誤れば用途によっては不適合です。資料にない内容を足した誤りと、必要な内容を落とした誤りも分けます。表現の読みやすさ、出典の探しやすさ、未確認を適切に残したかは別の観点として評価します。
実務で起きる難しさを含める
きれいな短文だけでなく、画像PDF、表、訂正版、矛盾する資料、関連事件を含む架空セットを用意します。実事件の資料を使う場合は利用条件と情報管理を確認します。入力資料を学習したような定型問題だけに偏らないよう、未使用の検証用セットも残します。成功例だけを選ぶのではなく、失敗した例も保存して改善後の再試験に使います。
人の作業を含む効果を見る
生成時間が短くても修正と確認に長時間かかるなら、全体の効率は上がりません。準備、生成、レビュー、修正、承認までの時間と重大な見落としを測ります。導入前の人手作業にも同じ条件を当て、比較の前提をそろえます。少数の試験で得た数値を全業務へ一般化せず、評価した件数と資料の種類、未検証の範囲を報告します。
TreeeSと本記事の位置付け
当事者用操作マニュアルVer.2.0(2026年8月31日発行、暫定版)の本文61頁はフォーム選択から入力、確認、提出完了の流れを、134–139頁は記録の一覧と個別確認を説明しています。資料確認日は2026年10月10日です。本記事のAI運用はAILEX編集部による所内準備の提案であり、裁判所の公式なAI利用手順やAILEXの機能保証ではありません。本番の対象手続と操作は最新の公式案内で確認し、製品の機能・契約条件は導入時に個別に確かめてください。
実務チェック
- 作業と合格条件を先に定義する
- 重大な誤りを別集計する
- 難しい資料と未使用セットを含める
- 確認時間を含めて比較する
出典・参照資料
資料に記載された計画・制度と、本記事の実務提案は区別してお読みください。
- 裁判所TreeeS自己研修サイト:ヘルプ掲載の当事者用操作マニュアルVer.2.0(暫定版・2026年8月31日)、本文61頁・134–139頁(提出と記録確認の背景) ↗
- AILEX:TreeeSの公開情報と対応方針(製品の個別機能は別途確認) ↗
あわせて読む
AIの根拠のない生成を減らす:出典確認と保留を組み込む
AIが存在しない判例や記録の内容を自然な文章で述べる可能性を前提に、出典へ戻る工程を設計します。生成を禁止するだけでなく、確認できない情報を採用しない具体的な運用を紹介します。
記事を読む AI活用・AILEXAI利用コストの管理:生成回数と確認工数を合わせて見る
AIの利用料だけを比較すると、入力準備や修正の負担を見落とします。記録整理や起案補助を対象に、処理量、再生成、人の確認時間を把握し、費用と品質の両方を管理する方法を説明します。
記事を読む AI活用・AILEXAI導入の小規模試行:対象業務と成功条件を決めて始める
いきなり全案件へAIを使うと、何が改善し何が危険か評価しづらくなります。架空資料での検証から限定した業務へ進み、確認体制と停止条件を含む試行計画を作る方法を提案します。
記事を読む