標準評価生成理論(SEGT)は、単純な平均とどう違うのか。バナッハの不動点定理による数学的な保証と、外生の評価基準Rに基づいて生成される評価値Nという設計思想を、SEGT研究シリーズ第1回として解説します。理論と実装検証を往復しながら精緻化していく研究開発の過程を、平均値との対比からご紹介します。
なぜSEGTは「平均」ではないのか
標準評価生成理論(SEGT)が目指す、理論と実装検証の往復による精緻化
eval000.aiが取り組む標準評価生成理論(SEGT:Standard Evaluation Generation Theory)は、完成した理論を一方的に発表するものではありません。数学的な検討と実装上の検証を繰り返しながら、少しずつ精緻化していく研究開発のプロセスそのものです。このシリーズでは、その過程を3回にわたってご紹介します。第1回は、「SEGTはなぜ単純な平均と違うのか」という、最も基本的な問いから始めます。
同じ入力なら、平均もSEGTも同じ結果になる
まず正直にお伝えしておきたいことがあります。同一の評価者、同一の評価対象、同一の評価入力という条件であれば、単純な平均値も、SEGTが生成する標準評価V*も、結果として同じ値になります。つまり「再現可能である」という性質だけを根拠に、SEGTと平均を区別することはできません。差別化の本質は、別のところにあります。
SEGTを支える数学的な保証
SEGTでは、外生の評価基準R(ルーブリック)を固定し、Rに基づいて生成される評価値N(詳しくは第3回で解説します)を用いて評価を更新していく作用素Φが一定の性質(縮小写像)を満たすとき、バナッハの不動点定理という数学の定理によって、標準評価V*は一意に定まり、同じ入力条件のもとでは常に同じ結果へ収束することが保証されます。
V* = (M + αN) / (1 + α) // 収束する固定点
ここでNは、外生の評価基準R(ルーブリック)に基づいて生成される評価値です。N自体が規範なのではなく、Rから導かれた具体的な評価値である点が重要です。
バナッハの不動点定理が保証しているのは、「同一の写像・同一条件のもとで反復を行えば、一意の固定点に収束する」という性質です。この定理そのものは、評価者集団が変わった場合にどうなるかまでは保証していません。この論点は、シリーズ第2回で詳しく取り上げます。
平均との本質的な違いは「外生基準に基づく生成評価値N」
平均は、入力された評価値をそのまま集約するだけの操作です。評価者全体に共通する偏りがあれば、その偏りはそのまま結果に残ります。一方、SEGTは、評価者集団から得られる現象的な評価M(本人評価を除く他者評価の平均など)に加えて、それとは別系統で、外生の評価基準R(ルーブリック)に基づいて生成される評価値Nを導入し、この二つを作用素Φによって統合することで標準評価V*を生成します。
平均とSEGTの違いを一言でまとめるなら、「入力をただ集約するか」「外部の基準と整合させながら統合するか」という一点にあります。
SEGTの本質は、「数学的にV*へ収束する」という性質そのものではありません。評価者集団に依存して変動する平均的な評価Mを、外生の評価基準Rに基づく生成評価値Nを取り込みながら再構成し、より安定的で再現可能な標準評価へ組み直すこと──ここに、固定点V*を算出する本質的な意味があります。
3つの層に分けて理解する
SEGTの価値を正確に伝えるには、次の3層を区別して説明することが有効です。
「同じ条件なら同じ答えになる」という一意性の保証は、SEGTの土台です。しかし実際の評価現場では、評価者集団そのものが変わる場面が想定されます。その場合に何が保証され、何がまだ研究課題として残るのか──第2回で、この論点を正面から取り上げます。
標準評価はどこまで再現可能か
