articleとして分類されたブログ

【実証レポート】

DeepSeekとClaudeに同一ルーブリック(AG/BG)で2件のビジネスプランを評価させると、AGスコアで最大1.60点差が発生しました。「将来計画を評価するか/現在の実績を評価するか」というAIの評価思想の差が、同一ルーブリックを使っても結果を変えてしまうことを実証しました。

グローバル審査設計の3要素

国内のビジネスコンテストに構造的に不足する「グローバルで勝てるか」を判断する審査視点を、海外VC型・現地事業家型・グローバルCTO型という3つのSEGTペルソナで補う設計を、ロードマップとしてご紹介します。

SEGT標準評価の事例

同じ審査員・同じ基準でも生成AIの評価は最大20.8点ブレる——8月5日の体験セミナー・ライブデモの実データをもとに、SEGT収束計算がそのブレを単一の標準評価V*にまとめた実例を解説します。

SEGTへのステップ

「審査は属人的になりがち」「審査員が変われば評価が変わる」——多くの主催者が感じる6つの構造的な難しさを整理し、SEGTがそれぞれにどう対応しようとしているのかを段階的にご紹介します。

査読AIとeval000にみるHITLの本当の意味

生成AIによる評価・査読の自動化はどこまで進んだのか。自動運転のレベル分類を借りて、論文査読AIとeval000のメタ評価技術がそれぞれどの段階に立っているのかを、責任の所在という観点から整理します。

スタートアップの可能性を、ノイズなく見極める!

スタートアップ支援機関・VC・アクセラレーター等を対象に、eval000のPoC実施計画をまとめた汎用提案書を公開。機関類型別の課題と2つの最適構成を提示します。

行政の評価業務を、数学的に再設計する!

補助金審査・政策評価・大学評価など公的機関の評価業務を対象に、eval000のPoC実施計画をまとめた汎用提案書を公開。共通課題の整理から本格展開へのロードマップまでを提示します。

BtoB情報検索サービスへ、評価のパラダイムシフトを。

イプロスやG2など国内外のBtoB情報検索サービスが抱える掲載審査の属人化という課題に、メタ評価エンジンで挑む新ソリューションを発表。12社の適合度分析と汎用提案書もあわせて公開しました。

AIで人事評価することに、なぜ納得感が生まれないのか

生成AI人事評価の導入が急速に進む一方、「評価への納得感」は上がらない——その原因はAIの使い方ではなく設計の構造にあります。eval000が捉える4つの構造的問題を解説します。

「スポンジ人間」化を超えて

AIとともに判断するはずの人間が、判断能力を失い責任だけを引き受ける「スポンジ人間」と化すリスクとは。慶應義塾大学・山本龍彦教授の問いかけと国内外の最新研究から、あるべき姿を考察します。