Skip to main content
    Meta-Evaluation Engine

    メタ評価エンジンMeta-Evaluation Engine

    「評価を、評価する」——eval000 は評価プロセスそのものを数学的に再設計します。
    外生の原理 N × Evaluation Rubric × SEGT 収束で、Noise 0 · Bias 0 · Error 0 を実現します。
    "Evaluating evaluation itself" — eval000 mathematically redesigns the evaluation process.
    External Principle N × Evaluation Rubric × SEGT convergence achieves Noise 0 · Bias 0 · Error 0.

    特願 2026-096693IOTEIR 2026 国際学会発表Banach 固定点定理

    The Problem

    評価の「現実」——ノイズ・バイアス・誤差・知識情報の限界という構造的問題The Reality of Evaluation — Noise, Bias, Error & Knowledge Limits

    コンテスト審査・人事評価・調達判断——評価はあらゆる意思決定の核心にあります。しかし現状の評価プロセスには、審査員を増やしても・ルーブリックを精緻化しても・生成AIに採点させても解決できない、構造的な問題が4つ存在します。Contest judging, HR evaluation, procurement — evaluation lies at the heart of every decision. Yet current evaluation processes have four structural problems that cannot be solved by adding evaluators, refining rubrics, or delegating to generative AI.

    🎲 ノイズ(Noise)
    気分・時刻・審査順番による無意識のスコア変動。同じ書類でも状況次第で結果が変わる。
    Kahneman(2021):同一評価者でも午前・午後で平均 19% 変動
    🧲 バイアス(Bias)
    専門分野・経験・固定観念による系統的な歪み。審査員の背景によって有利・不利が生まれる。
    権威収束:合議で上位者の評価に同調する情報的影響
    📐 誤差(Error)Error
    評価者間の採点尺度のズレ。「3点」の意味が審査員によって異なり、集計が意味を失う。Misalignment in evaluators' scoring scales. "3 points" means different things to different evaluators, making aggregation meaningless.
    生成 AI でも最大 12点差——AI にもバイアスとノイズが内在するEven generative AI produces up to 12-point gaps — AI inherits bias and noise
    💡 知識・情報の限界Knowledge & Information Limits
    ノイズ・バイアス・誤差とは独立した第4の問題。審査員がそもそも評価に必要な知識・情報を十分に持てないという構造的限界。人間の認知的限界と情報の爆発的増加により、専門外の技術・市場を適切に評価することは本質的に困難です。A fourth problem independent of noise, bias, and error. The structural limit that evaluators simply cannot possess sufficient knowledge and information to evaluate properly. Human cognitive limits combined with the explosion of information make it inherently difficult to evaluate unfamiliar technologies or markets.
    例:専門外の技術・市場を評価する際の判断根拠の欠如
    → AI ペルソナ審査員が専門知識を補完することで構造的に解決
    E.g., Lack of informed basis when evaluating unfamiliar technology or markets
    → AI persona evaluators structurally compensate for this knowledge gap
    従来アプローチがすべて失敗する理由
    審査員を増やす——多数決は情報的影響(権威収束)を増幅するだけ
    ルーブリックを精緻化する——「外生の原理 N」なしには収束しない
    生成 AI に採点させる——モデル自体にバイアスとノイズが内在する
    投票・多数決で決めるVoting / majority rule——集計は問題を隠蔽するだけで解決しない — aggregation conceals the problem rather than solving it
    CONCLUSION
    生成 AI は「評価を便利にした」が、「評価を正確にした」わけではありません。Generative AI made evaluation convenient — it did not make evaluation accurate.
    ノイズ・バイアス・誤差・知識情報の限界という 4 つの構造的問題はどんな評価にも内在します。
    だからこそ外生の原理 N が規定する Evaluation Criterion に基づく反復再構成で
    Evaluation Standard v* を生成する eval000 が必要です。
    All four structural problems — noise, bias, error, and knowledge limits — are inherent in any evaluation.
    That is precisely why eval000 is needed: to generate Evaluation Standard v* through
    iterative reconstruction governed by External Principle N's Evaluation Criterion.

    Historical Evolution

    評価方法の変遷と eval000 が実現する次のステージHistorical Evolution of Evaluation & What eval000 Achieves Next

    審査の方法論はこの数十年で段階的に進化してきましたが、いずれも「バラつきそのもの」を除去するには至りませんでした。

    目利き審査員の時代
    単一基準
    × 審査員
    単一評価基準 × 審査員数
    総合評価
    専門家チーム体制の時代
    ルーブリック
    × 審査員
    複数基準合計
    × 審査員数
    総合評価
    バラつき軽減を試行錯誤した時代
    重み付き基準
    × 審査員
    重み付き複数基準
    → 合計 × 審査員数
    総合評価
    現在
    生成 AI による
    評価の自動化
    生成 AI 評価
    総合評価
    ※ モデルごとに結果が異なる
    eval000 が実現する次のステージ
    外生の原理 N
    × Evaluation Rubric
    × SEGT 収束
    外生の原理 N
    ↓ 規定
    Evaluation Rubric
    ↓ 反復再構成
    Evaluation Standard v*
    = 再現可能な Evaluation Measure
    特願 2026-096693

    Evaluation Hierarchy

    5 段階評価階層——eval000 の概念体系5-Level Evaluation Hierarchy — eval000 Conceptual Framework

    eval000 は 5 つの要素が上位から下位へと規定し合う階層構造を持ちます。N が最上位に位置し、全ての評価プロセスを体系の外部から拘束します。

    eval000 の 5 段階評価階層NExternal Principle N外生の原理 N審査の目的・意図を体系の外部から与える上位原理。N が全ての評価プロセスを拘束する。LAYER 0規定するECEvaluation Criterion評価基準「何を良い評価とするか」を定める固定的・外生的な基準。N から実装される。LAYER 1実装するREvaluation Rubric評価ルーブリック評価基準を採点に落とし込む評価項目・配点・判定基準。運用上変更可能。LAYER 2反復再構成(SEGT 収束)v*Evaluation Standard標準評価 v*SEGT 収束によって生成される Evaluation Standard。N に拘束された固定点。LAYER 3適用するEMEvaluation Measure評価尺度(ものさし)v* を再利用可能な評価尺度として適用。同一 N・R での評価を再現可能にする。LAYER 4
    N — 外生の原理(最上位)
    「審査目的・事業評価の方向性」など、評価を行う理由・意図そのものを体系の外部から定義します。N を変えれば v* が変わる——N 設計がメタ評価の質を決定します。
    R — Evaluation Rubric
    N を受けて「どの軸で・どの配点で・どの基準で」採点するかを定義します。BGルーブリック(バランス型)とAGルーブリック(革新重視型)で v* が変わることを体験セミナーで実証しました。
    EM — Evaluation Measure
    生成された v* を「再現可能なものさし」として継続利用します。同一の評価者集団・同一の N・R であれば、常に同じ v* が再現される——これが Evaluation Measure の本質的価値です(異なる評価者集団間の収束性は別途実証研究を進めています)。

    Core Algorithm

    SEGT 収束——数学的証明に基づく標準評価生成SEGT Convergence — Mathematically Proven Standard Evaluation Generation

    eval000 の核心は「収束」にあります。この理論的枠組みを標準評価生成理論(SEGT:Standard Evaluation Generation Theory)と呼びます。Banach の固定点定理が数学的に保証する通り、縮小写像を反復することで評価は必ず唯一の固定点 v* に収束します。

    CORE FORMULA
    v* = FN(v*, R)
    v*:Evaluation Standard(標準評価・固定点)
    FN:N によって規定された評価再構成関数(縮小写像)
    R:Evaluation Rubric(評価ルーブリック)

    N が F を規定し、R が採点基準を与える。F を反復適用することで評価は必ず v* という唯一の固定点に収束する——これが Banach の固定点定理の保証です。
    📐 Banach 固定点定理との対応
    完備距離空間上の縮小写像は、反復適用により必ず唯一の固定点に収束する——Banach(1922)。

    eval000 では評価空間を完備距離空間として定義し、評価再構成関数 FN が縮小写像の条件を満たすよう N と R を設計します。同一の評価者集団による入力に同一の写像を反復適用する場合、v* への収束が数学的に保証されます(異なる評価者集団への拡張は本定理の適用範囲外です)。
    🔬 Gödel の不完全性定理との接続
    Gödel(1931)の不完全性定理は「形式的体系は自己の無矛盾性を内部では証明できない」ことを示します。

    これは評価にも直接適用されます——「良い評価とは何か」を評価体系の内部から定義することには本質的な限界があります。eval000 が「外生の原理 N」を体系の外部から供給する根拠はここにあります。N は Gödel 的な意味での外部原理として機能します。

    SEGT 収束の 4 ステップ

    1
    外生の原理 N の設定
    審査の目的・方向性・評価方針を体系の外部から与える。N の品質が v* の品質を決定する最重要ステップ。評価者とは独立した存在として、N は Human In The Loop の Lv4 で人間が定義・確認する。
    2
    Evaluation Rubric の設計と AI ペルソナ評価
    N を受けて Evaluation Rubric(評価軸・配点・判定基準)を専用設計。複数の AI ペルソナ審査員が独立した視点で同一の Rubric に従い採点を実施。この段階でペルソナ間のスコアにバラつきが生じる。
    体験セミナーデモ実値:BGルーブリック×3ペルソナ
    プランA:実務派 68.2 / 革新派 89.0 / バランス派 84.0(差 20.8点)
    プランB:実務派 73.0 / 革新派 84.0 / バランス派 84.0(差 11.0点)
    3
    反復再構成(Iterative Reconstruction)→ 収束
    N によって規定された評価再構成関数 FN をペルソナの採点に反復適用。Banach の縮小写像定理により、評価は必ず唯一の固定点 v* に収束する。この過程でノイズ・バイアス・誤差が数学的に除去される。
    体験セミナーデモ実値(SEGT 収束後)
    プランA v* = 80.3点 ≈ プランB v* = 80.1点
    → 差 0.2点(両プランが外生の原理 N に対してほぼ等しい)
    4
    Evaluation Measure としての活用
    生成された v* を Evaluation Measure(再現可能なものさし)として継続利用。同一の評価者集団・同一の N・R であれば、常に同じ v* が再現される。これにより審査の公正性・再現性・説明責任が同時に達成される。

    Live Demo Results

    体験セミナーデモ実値——バラつきと SEGT 収束Live Demo Results — Variance & SEGT Convergence

    2026 年 8 月 5 日の体験セミナーで実施したライブデモの実値です。同一の外生の原理 N・Evaluation Rubric(BG 型)のもとで、3 つの AI ペルソナ審査員が採点すると最大 20.8点のバラつきが生じ、SEGT 収束で v* に収束することを実証しました。

    Step 1:ルーブリックが変わると v* が変わる

    同一プラン・同一ペルソナ・同一 N のもとで Evaluation Rubric のみを変えた結果。「物差し」の設計が評価の方向性を決定することを示します。

    AG ルーブリック(実証度重視)vs BG ルーブリック(バランス型)の v* 比較
    同一ペルソナ3名・同一外生の原理N / 軸構成のみ変更
    AG ルーブリック(実証度 30% 重視)
    プランA
    70.6
    プランB
    77.9
    差 7.3点 → プランBが優位
    BG ルーブリック(バリューイノベーション 30% 重視)
    プランA
    80.3
    プランB
    80.1
    差 0.2点 → ほぼ同等
    INSIGHT
    同じプランを同じ N で評価しても、Evaluation Rubric(物差し)が変わればv*が変わります。AGルーブリックでは差7.3点だったものが、BGルーブリックでは差0.2点に。これはルーブリック設計がいかに重要かを示す実証です。

    Step 2 → Step 3:ペルソナ間バラつき → SEGT 収束

    BG ルーブリック・同一 N のもとで 3 ペルソナが採点すると最大 20.8点のバラつきが生じます。SEGT 収束でこのバラつきを除去し Evaluation Standard v* を生成します。

    3 ペルソナのスコアバラつき vs SEGT 収束後 v*(BGルーブリック・実値)
    外生の原理 N・Evaluation Rubric 固定 / ペルソナ3名の採点結果と v* の比較
    実務派(大手コンサル出身・数値重視)
    革新派(新興スタートアップ投資家・新規性重視)
    バランス派(経営学者・総合判断重視)
    v*(SEGT 収束後・Evaluation Standard)
    プランA(某ビジネスプラン)— バラつき:20.8点
    実務派
    68.2
    革新派
    89.0
    バランス派
    84.0
    v*(収束後)
    80.3
    = Evaluation Standard
    プランB(EcoBottle)— バラつき:11.0点
    実務派
    73.0
    革新派
    84.0
    バランス派
    84.0
    v*(収束後)
    80.1
    = Evaluation Standard
    ※ 上記は 2026 年 8 月 5 日体験セミナーのライブデモ実値です。プランA v* = 80.3点 / プランB v* = 80.1点(差 0.2点)。 単純加重平均との差が小さいケースもありますが、v* の価値は「数値の差」ではなく「再現可能性」にあります——同一の評価者集団・同一の N・R であれば、常に同じ v* が得られます。
    EVALUATION MEASURE としての本質
    v* と単純平均が近似値になることがあります。しかし v* の本質的価値は「再現可能な Evaluation Measure(ものさし)として機能する」点です。生成AIが直接採点する場合、モデルやプロンプトが変われば結果が変わります。eval000 の v* は、同一の評価者集団・同一の N・R であれば常に同じ固定点に収束することが数学的に保証されています。

    Human In The Loop

    HITL 自動化レベル(Lv 0〜4)HITL Automation Levels (Lv 0–4)

    eval000 は SAE J3016(自動運転レベル)の考え方を評価プロセスに適用します。AI が決めるのではなく、人間が「目的(N)」を定義し、結果を最終確認する——これが eval000 の HITL 設計の本質です。

    レベル名称評価の実態責任主体
    Lv 0人間のみ審査員全員が手作業で採点。基準のブレは個人の経験に依存。「目利き」の質で結果が変わる。常に人間
    Lv 1AI アシストAI が類似事例・参考情報を提示。採点・判断は人間が行う。AI は補助ツール。常に人間
    Lv 2AI 主導AI が採点を実施。人間は結果を確認・修正する役割に変わる。大部分の採点を AI が担う。常に人間
    Lv 3⚠ 査読 AI特定条件下で AI が独立採点。人間の監視なしで動作する場合がある。バイアス・ノイズが無対策で蓄積するリスク。eval000 が解決すべき問題の所在。不明確
    Lv 4✓ eval000 推奨外生の原理 N を定義し評価結果を最終確認する審査責任者(人間)が存在。 AI ペルソナ審査員が SEGT 収束で v* を生成し、人間が N の方向性と v* の妥当性を確認する。評価の実施は AI、目的の定義と最終責任は人間。人間
    eval000 が Lv 4 を推奨する理由: AI が自律的に評価する Lv 3 では、AI 自身のバイアス・ノイズが無対策で評価に入り込みます。Lv 4 では人間が外生の原理 N を定義・確認する責任を持ちながら、採点の実施は SEGT 収束エンジンが担います。「AI が決める」のではなく「人間が目的を定義し AI が標準化する」というアーキテクチャが eval000 の本質です。

    Evidence & Credentials

    学術的・特許的根拠Academic & Patent Foundation

    eval000 のメタ評価技術は、数学的理論・国際学会発表・特許出願という 3 層の根拠を持ちます。

    FOUNDATION 01
    Banach の固定点定理
    完備距離空間上の縮小写像は唯一の固定点に収束する(Banach, 1922)。SEGT 収束の数学的保証の根拠。同一の評価者集団による入力に同一の写像を反復適用する場合、v* への収束が保証される(異なる評価者集団への拡張は適用範囲外)。
    FOUNDATION 02
    Gödel の不完全性定理
    形式的体系は自己の無矛盾性を内部では証明できない(Gödel, 1931)。「良い評価とは何か」を評価体系の内部から定義することの根本的限界——外生の原理 N が体系の外部から供給される根拠。
    FOUNDATION 03
    IOTEIR 2026 国際学会発表
    "From Evaluation to Standard Generation: A Generative AI-Based Model for Reproducible Educational Assessment"
    里吉 竜一(東京福祉大学)
    Bridgewater State University, MA, USA / 2026.7.28〜29
    FOUNDATION 04
    特願 2026-096693
    生成 AI による評価再構成に基づく標準評価算出方法。特許権者:里吉 竜一氏。出願中。SEGT 収束計算という固有の技術手法を保護。類似特許は現時点で未確認。
    FOUNDATION 05
    Kahneman「Noise」(2021)
    ノイズ:同一評価者でも午前・午後で評価が平均 19% 変動することを実証。「ノイズはバイアスと同等以上に評価を歪める」——Daniel Kahneman、Olivier Sibony、Cass R. Sunstein。eval000 の課題設定の根拠。
    FOUNDATION 06
    PoC 実証データ(2025〜)
    当チームの PoC 実施により、同一書類を複数の生成 AI モデル(ChatGPT・Gemini・Claude 等)で評価すると最大 12点差が発生することを確認。生成 AI 単純適用では評価の標準化が不可能であることの根拠。

    eval000 のメタ評価技術を、体験してみませんか?Ready to experience eval000 meta-evaluation technology?

    体験セミナーでは実際に SEGT 収束をライブデモでご確認いただけます。
    コンテスト審査・人事評価・比較評価など、あなたの分野での適用をご相談ください。
    Our hands-on seminar lets you witness SEGT convergence live.
    Discuss applications in contest judging, HR evaluation, procurement, and more.

    特許出願中 特願 2026-096693 / IOTEIR 2026 国際学会発表 / Banach 固定点定理に基づく数学的証明