DeepSeekとClaudeに同一ルーブリック(AG/BG)で2件のビジネスプランを評価させると、AGスコアで最大1.60点差が発生しました。「将来計画を評価するか/現在の実績を評価するか」というAIの評価思想の差が、同一ルーブリックを使っても結果を変えてしまうことを実証しました。
eval000のサービス概要をまとめた日英2言語のカタログPDFを公開しました。メタ評価の考え方からSEGT実証データ、料金・導入プロセスまで11ページに凝縮。社内共有や比較検討にご活用いただけます。
国内のビジネスコンテストに構造的に不足する「グローバルで勝てるか」を判断する審査視点を、海外VC型・現地事業家型・グローバルCTO型という3つのSEGTペルソナで補う設計を、ロードマップとしてご紹介します。
同じ審査員・同じ基準でも生成AIの評価は最大20.8点ブレる——8月5日の体験セミナー・ライブデモの実データをもとに、SEGT収束計算がそのブレを単一の標準評価V*にまとめた実例を解説します。
「審査は属人的になりがち」「審査員が変われば評価が変わる」——多くの主催者が感じる6つの構造的な難しさを整理し、SEGTがそれぞれにどう対応しようとしているのかを段階的にご紹介します。
eval000.aiのTOP・メタ評価エンジン・Solutions等5ページを更新。外生の原理N〜Evaluation Measureまでの5階層をSEGTという名のもとに整理し、実証データや料金体系もあわせて掲載しました。
AI評価のノイズ・バイアス・誤差を数学的に除去する仕組みを、8月5日開催の無料オンラインセミナーでライブデモ体験。IOTEIR 2026国際学会発表と連動した、国内初公開の解説セミナーです。
eval000メタ評価エンジンの核心技術を、より速く・シンプルに届ける新サービス「eval000 Essential」を7月7日に提供開始。評価アウトソーシングサービスとして、より利用しやすい形でご案内します。
生成AIによる評価・査読の自動化はどこまで進んだのか。自動運転のレベル分類を借りて、論文査読AIとeval000のメタ評価技術がそれぞれどの段階に立っているのかを、責任の所在という観点から整理します。
スタートアップ支援機関・VC・アクセラレーター等を対象に、eval000のPoC実施計画をまとめた汎用提案書を公開。機関類型別の課題と2つの最適構成を提示します。
(2)
(10)
(3)