結果より先に、
採点表を
固定する。

Cowork・Make・n8nへ同じ問い合わせ100件を渡す。入力、出力schema、合格条件を先に公開し、都合のよい測り方へ後から変えない。

PUBLIC PROTOCOL / V1

問い合わせ分類・要約

automation-note.inquiry-routing.v1

INPUT
100
合成問い合わせ
CATEGORY
95%
最低正解率
REVIEW FLAG
95%
最低正解率
INPUT SHA-2562b2908a44018058a04044cff018577051185deeb59bfc0a4eeec2c748dcf7856GROUND TRUTH SHA-256ed6a7f3525174301e6689dc23d5083953aeccd7c2599f677f6c5acd4b58af196正解値は非公開。commitmentのみ公開。
STATUS LEDGER

空欄も、
結果の一部。

実測ファイルとvalidatorが揃うまで「測定済み」へ変えない。現在の公開結果数は0。

PRODUCT / COWORK

Cowork

未測定 / result: null

PRODUCT / MAKE

Make

未測定 / result: null

PRODUCT / N8N

n8n

未測定 / result: null

SCORING PIPELINE

4段階で、
同じ条件を守る。

自動判定できる項目と、人が読む項目を混ぜない。要約品質は文字数だけで合格扱いしない。

  1. 01 / FIX INPUT

    100件の入力を固定

    個人情報・勤務先・顧客データを含まない合成データ。正解ラベルは公開入力に含めない。

  2. 02 / FIX OUTPUT

    4項目へ揃える

    case_id、category、summary、needs_review。欠落、重複ID、型違反を失敗にする。

  3. 03 / SCORE

    2指標を自動採点

    カテゴリ正解率と要確認フラグ正解率。両方95%以上で自動判定PASS。

  4. 04 / REVIEW

    要約は人が読む

    非空・180文字以下は機械検査。正確さ、抜け、誤解の余地は手動評価として分離。

DOWNLOAD EVIDENCE

追試できる形で、
公開する。

manifestのSHA-256で契約・入力・状態の組み合わせを固定。公開物とリポジトリの差異は本番ゲートで停止する。

この時点で言えないこと

次は各製品を同じ入力で実行し、成功率、作業時間、費用、必要権限、失敗時の復旧を同じ台帳へ追加する。

3製品の役割境界を見る / 5問で比較の入口を絞る