mo4maによるブログ

MR中途採用一次選考におけるSEGT実証

評価者が変われば、標準評価は変わってよいのか。医薬品企業のMR中途採用一次選考を題材に、外生原理から生成したNorm Nと、即戦力重視・将来性重視という異なる評価者ペルソナ構成を組み合わせ、SEGTが標準評価V*をどう導き出すかを検証。Norm Nと評価者平均の乖離が意味するものも考察するPoCの記録です。

SEGTのN生成理論と、これからの5段階

EGTのN生成理論と、これからの5段階に及ぶR&Dロードマップをご紹介します。外生原理→評価基準R→生成評価値Nという設計と、評価者集団Mとの合流によって標準評価V*が生成される仕組み、そして集団を超えた標準評価V†という将来像まで、研究シリーズ最終回として解説します。

標準評価はどこまで再現可能か

標準評価はどこまで再現可能か。「同一写像下での収束」と「異なる評価者集団間の再現性」は別の問題です。SEGT研究シリーズ第2回では、この理論的な区別と、再現性を測るEvaluation Measure/Stabilization Ratioという新指標、今後の検証計画をご紹介します。

なぜSEGTは「平均」ではないのか

標準評価生成理論(SEGT)は、単純な平均とどう違うのか。バナッハの不動点定理による数学的な保証と、外生の評価基準Rに基づいて生成される評価値Nという設計思想を、SEGT研究シリーズ第1回として解説します。理論と実装検証を往復しながら精緻化していく研究開発の過程を、平均値との対比からご紹介します。

【実証レポート】

DeepSeekとClaudeに同一ルーブリック(AG/BG)で2件のビジネスプランを評価させると、AGスコアで最大1.60点差が発生しました。「将来計画を評価するか/現在の実績を評価するか」というAIの評価思想の差が、同一ルーブリックを使っても結果を変えてしまうことを実証しました。

日英カタログPDFダウンロード

eval000のサービス概要をまとめた日英2言語のカタログPDFを公開しました。メタ評価の考え方からSEGT実証データ、料金・導入プロセスまで11ページに凝縮。社内共有や比較検討にご活用いただけます。

グローバル審査設計の3要素

国内のビジネスコンテストに構造的に不足する「グローバルで勝てるか」を判断する審査視点を、海外VC型・現地事業家型・グローバルCTO型という3つのSEGTペルソナで補う設計を、ロードマップとしてご紹介します。

SEGT標準評価の事例

同じ審査員・同じ基準でも生成AIの評価は最大20.8点ブレる——8月5日の体験セミナー・ライブデモの実データをもとに、SEGT収束計算がそのブレを単一の標準評価V*にまとめた実例を解説します。

SEGTへのステップ

「審査は属人的になりがち」「審査員が変われば評価が変わる」——多くの主催者が感じる6つの構造的な難しさを整理し、SEGTがそれぞれにどう対応しようとしているのかを段階的にご紹介します。

8/10  Web Site Renewal

eval000.aiのTOP・メタ評価エンジン・Solutions等5ページを更新。外生の原理N〜Evaluation Measureまでの5階層をSEGTという名のもとに整理し、実証データや料金体系もあわせて掲載しました。