標準評価はどこまで再現可能か。「同一写像下での収束」と「異なる評価者集団間の再現性」は別の問題です。SEGT研究シリーズ第2回では、この理論的な区別と、再現性を測るEvaluation Measure/Stabilization Ratioという新指標、今後の検証計画をご紹介します。
標準評価生成理論(SEGT)は、単純な平均とどう違うのか。バナッハの不動点定理による数学的な保証と、外生の評価基準Rに基づいて生成される評価値Nという設計思想を、SEGT研究シリーズ第1回として解説します。理論と実装検証を往復しながら精緻化していく研究開発の過程を、平均値との対比からご紹介します。
DeepSeekとClaudeに同一ルーブリック(AG/BG)で2件のビジネスプランを評価させると、AGスコアで最大1.60点差が発生しました。「将来計画を評価するか/現在の実績を評価するか」というAIの評価思想の差が、同一ルーブリックを使っても結果を変えてしまうことを実証しました。
eval000のサービス概要をまとめた日英2言語のカタログPDFを公開しました。メタ評価の考え方からSEGT実証データ、料金・導入プロセスまで11ページに凝縮。社内共有や比較検討にご活用いただけます。
国内のビジネスコンテストに構造的に不足する「グローバルで勝てるか」を判断する審査視点を、海外VC型・現地事業家型・グローバルCTO型という3つのSEGTペルソナで補う設計を、ロードマップとしてご紹介します。
同じ審査員・同じ基準でも生成AIの評価は最大20.8点ブレる——8月5日の体験セミナー・ライブデモの実データをもとに、SEGT収束計算がそのブレを単一の標準評価V*にまとめた実例を解説します。
「審査は属人的になりがち」「審査員が変われば評価が変わる」——多くの主催者が感じる6つの構造的な難しさを整理し、SEGTがそれぞれにどう対応しようとしているのかを段階的にご紹介します。
eval000.aiのTOP・メタ評価エンジン・Solutions等5ページを更新。外生の原理N〜Evaluation Measureまでの5階層をSEGTという名のもとに整理し、実証データや料金体系もあわせて掲載しました。
(2)
(14)
(3)