「評価する人」の実力を評価する

10.09.26 17:41:44 - 投稿者: mo4ma

SEGT審査システムに、評価入力者(審査員)自身の「評価能力」を数値化する追加機能案を解説。評価者集団の平均との整合性(客観レベル)とSEGT標準評価v*との整合性(絶対性レベル)を、具体的な計算例とともに紹介します。

R&DCase Study2026年8月
評価者を評価する、新しいレイヤー

「評価する人」の実力を、
標準評価から逆算する。

SEGT審査システムに、評価入力者(審査員)自身の「評価能力」を数値化する追加機能案をご紹介します。評価者集団の平均との整合性(客観レベル)と、SEGT標準評価v*との整合性(絶対性レベル)という二層構造で、評価する側の特性を可視化する試みです。

01 — 背景

評価される側だけでなく、評価する側も測る

現行のSEGT一括審査システムの画面案では、作品ごとにAI①〜③の評価入力点・平均点・SEGT標準評価(v*)を同一画面で比較できる構成になっています。今回検討している追加機能案は、この構成を一段発展させ、評価対象そのものの標準評価を生成するだけでなく、「評価を入力した側」の評価能力も測定できるようにするものです。

算出方法は、里吉竜一「『自己評価能力測定システム』について―実践的活用方法の解説として―」で示された考え方を参照しています。同論文では、主観(自己評価)と客観(他者評価)の差異を絶対値で求め、その差異を標準偏差によって標準化することで、評価能力を数値化する手法が示されています。SEGTでは、この「評価値どうしの差異を標準偏差によって尺度化する」という基本発想を、評価入力者(審査員)の能力測定に応用します。

02 — 二層構造

客観レベルと絶対性レベル——比較対象を2つに分ける

ただし、SEGTにおける比較対象は単一ではなく、「平均点」と「標準評価点(v*)」の二つに分けます。評価入力者の評価能力を、評価者集団との整合性(客観レベル)と、SEGTが生成した標準評価との整合性(絶対性レベル)という、性質の異なる2つの軸で測定します。

LEVEL 01 — 客観レベル
評価者集団との整合性
各評価入力者の評価点と、同一評価対象に対する評価者集団の平均点との差異を測定。他の評価入力者の集合的な評価と、どの程度整合しているかを示します。
LEVEL 02 — 絶対性レベル
SEGT標準評価との整合性
各評価入力者の評価点と、SEGTによって生成された標準評価点(v*)との差異を測定。「生成された標準」にどの程度近い評価を行っているかを示します。

平均点とSEGT標準評価点を区別するSEGTの二層構造を、そのまま評価入力者の能力分析にも拡張する位置づけです。「集団に対してどれだけ一致しているか」と「標準に対してどれだけ一致しているか」を、分離して測定できる点が特徴です。

DIFFERENCE FORMULAS
d_O = | x_i − x̄ |   /   d_A = | x_i − v* |

x_iは評価入力者iの入力点、x̄は当該評価対象に対する評価入力点の平均点、v*はSEGTの反復更新・収束によって得られた標準評価点です。差異が小さいほど、それぞれの整合性が高いと解釈します。

03 — 得点化の仕組み

差異を、標準偏差で偏差値型の得点へ変換する

差異値dの分布について、平均値と標準偏差σを用い、差異の大きさを偏差値型の尺度に変換します。「ずれ」が小さいほど能力が高いという関係に合わせ、差異尺度を反転させて能力得点として扱います。客観レベルと絶対性レベルの双方を、同一尺度(0〜100点目安)で表示する設計です。

STANDARDIZATION
score = 50 − ((d − d̄) / σ) × 10
実装上の留意点

標準偏差σを『どの差異値の集合から算出するか』は、明示的に固定する必要があります。同一審査タスク内の全作品×全評価入力者の差異値を母集団とするか、評価項目ごとに算出するか、一定件数以上の過去データを含めるかを仕様として定義し、比較可能性と再現性のため、母集団定義を処理ごとに変動させないことが重要です。

04 — 具体例

3名の審査員で見る、評価能力得点の算出例

仕様案に示された想定データ(実務派・革新派・バランス派の3ペルソナ、平均点90.0、SEGT標準評価v*=89.8)をもとに、上記の計算式を実際に適用してみます。※本稿の数値はあくまで算出方法を示すための試算例であり、実運用時は母集団の設計次第で値が変動します。

審査員評価入力点平均点標準評価v*客観レベル絶対性レベル
実務派8990.089.842.948.4
革新派9190.089.842.938.6
バランス派9090.089.864.163.0

バランス派は入力点が平均点・標準評価点のいずれにも最も近く、客観レベル・絶対性レベルの両方で最高得点になっています。実務派と革新派は平均点からの差の絶対値(|89-90|=1.0、|91-90|=1.0)が等しいため、客観レベルは同点です。一方、絶対性レベルでは、標準評価v*(89.8)からより離れている革新派(差1.2)の方が、実務派(差0.8)より低い得点になっています。

興味深いのは、実務派と革新派が『集団の平均からの距離』では同点でありながら、『SEGT標準評価からの距離』では明確に差がつく点です。これは、平均点だけを見ていては区別できない評価者間の違いを、標準評価v*という別の基準軸が浮かび上がらせていることを示しています。客観レベルと絶対性レベルを分けて測定する意義が、この例からも見て取れます。
05 — この機能が拓くもの

「評価対象を測るシステム」から「評価者を測るシステム」へ

この追加機能により、SEGTは「評価対象の標準評価を生成するシステム」にとどまらず、標準評価を基準として「評価入力者の評価特性・評価能力を測定するシステム」にも発展します。「集団に対してどれだけ一致しているか」と「標準に対してどれだけ一致しているか」を区別して出力できる点が重要です。

実装依頼事項(要点)

  • 二層算出:客観レベル(評価入力点-平均点の絶対差)と絶対性レベル(評価入力点-標準評価v*の絶対差)を、それぞれ算出すること
  • 得点化:差異値・標準偏差・偏差値化の考え方を参照して得点化すること
  • 母集団の固定:標準偏差の算出対象となる母集団を仕様として固定し、同一条件で再計算可能な設計にすること
  • 表示:作品詳細画面または評価者分析画面に、評価入力点・平均点・標準評価v*・客観レベル・絶対性レベルを一覧表示すること
  • 将来拡張:評価項目別得点と総合評価能力得点の双方を出力できる構造にすること

次回は、より多くの評価入力者・評価項目を含む拡張データでの検証や、評価項目別の客観レベル・絶対性レベルを可視化するグラフ設計について、検討を進める予定です。

Learn More

SEGTの理論的枠組みについて、詳しくはこちら

標準評価生成理論(SEGT)の全体構造・数学的根拠は、metaE-Engineページでご紹介しています。

metaE-Engineを見る →
里
Ryuichi Satoyoshi
SEGT 理論・設計
標準評価生成理論(SEGT:Standard Evaluation Generation Theory)の考案者・特許権者。本稿は、SEGT審査システムへの追加機能案として検討中の内容を、研究ノートの形でご紹介するものです。

mo4ma