<?xml version="1.0" encoding="UTF-8" ?><!-- generator=Zoho Sites --><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><atom:link href="https://www.eval000.ai/blogs/tag/case-study/feed" rel="self" type="application/rss+xml"/><title>eval000 - Blog #Case study</title><description>eval000 - Blog #Case study</description><link>https://www.eval000.ai/blogs/tag/case-study</link><lastBuildDate>Thu, 01 Oct 2026 22:12:21 -0700</lastBuildDate><generator>http://zoho.com/sites/</generator><item><title><![CDATA[MR中途採用一次選考におけるSEGT実証]]></title><link>https://www.eval000.ai/blogs/post/MR</link><description><![CDATA[<img align="left" hspace="5" src="https://www.eval000.ai/sam4blog/blog_thumbnail_segt_mr_hiring.png"/>評価者が変われば、標準評価は変わってよいのか。医薬品企業のMR中途採用一次選考を題材に、外生原理から生成したNorm Nと、即戦力重視・将来性重視という異なる評価者ペルソナ構成を組み合わせ、SEGTが標準評価V*をどう導き出すかを検証。Norm Nと評価者平均の乖離が意味するものも考察するPoCの記 ]]></description><content:encoded><![CDATA[<div class="zpcontent-container blogpost-container "><div data-element-id="elm_kxTbAQIPRRe4aRTEBV205w" data-element-type="section" class="zpsection "><style type="text/css"></style><div class="zpcontainer-fluid zpcontainer"><div data-element-id="elm_Zuko-qVERymu8l2IbUiRSQ" data-element-type="row" class="zprow zprow-container zpalign-items- zpjustify-content- " data-equal-column=""><style type="text/css"></style><div data-element-id="elm_JbQAVruOTFqUbyPhpPuCLw" data-element-type="column" class="zpelem-col zpcol-12 zpcol-md-12 zpcol-sm-12 zpalign-self- "><style type="text/css"></style><div data-element-id="elm_di1gH_b6xjiUA2T6y-FIyw" data-element-type="text" class="zpelement zpelem-text "><style></style><div class="zptext zptext-align-left zptext-align-mobile-left zptext-align-tablet-left " data-editor="true"><p><span><span><span><span></span></span></span></span></p><div><div><span>評価者が変われば、標準評価は変わってよいのか。医薬品企業のMR中途採用一次選考を題材に、外生原理から生成したNorm Nと、即戦力重視・将来性重視という異なる評価者ペルソナ構成を組み合わせ、SEGTが標準評価V*をどう導き出すかを検証。Norm Nと評価者平均の乖離が意味するものも考察するPoCの記録です。</span></div></div><p></p></div>
</div><div data-element-id="elm_SZ06KsPqCBoUSJ1hasCMIQ" data-element-type="codeSnippet" class="zpelement zpelem-codesnippet "><div class="zpsnippet-container"><style> .e0-blog-wrap{max-width:820px;margin:0 auto;padding:56px 24px 96px;background:#ffffff;color:#1a1a1a;font-family:"Noto Sans JP","Noto Sans",sans-serif;line-height:1.9;} .e0-blog-wrap *{box-sizing:border-box;} .e0-blog-lang-toggle{display:flex;justify-content:flex-end;gap:8px;margin-bottom:28px;} .e0-blog-lang-btn{font-family:"DM Mono",monospace;font-size:12px;letter-spacing:.04em;padding:6px 14px;border:1px solid #00489d;background:#ffffff;color:#00489d;border-radius:999px;cursor:pointer;transition:background .15s ease,color .15s ease;} .e0-blog-lang-btn.e0-active{background:#00489d;color:#ffffff;} .e0-blog-eyebrow{font-family:"DM Mono",monospace;font-size:12px;letter-spacing:.08em;color:#00489d;text-transform:uppercase;margin-bottom:10px;} .e0-blog-title{font-family:"Noto Serif JP",serif;font-size:clamp(24px,4vw,34px);line-height:1.5;color:#0d1b33;margin:0 0 28px;} .e0-blog-lede{font-size:16px;color:#333333;border-left:3px solid #00489d;padding:2px 0 2px 16px;margin-bottom:36px;} .e0-blog-disclaimer{font-size:13px;color:#6b6b6b;background:#f4f7fb;border:1px solid #dbe4f0;border-radius:8px;padding:12px 16px;margin-bottom:40px;} .e0-blog-h2{font-family:"Noto Serif JP",serif;font-size:20px;color:#00489d;margin:44px 0 16px;padding-bottom:8px;border-bottom:2px solid #00489d;} .e0-blog-h3{font-family:"Noto Sans JP",sans-serif;font-weight:700;font-size:15px;color:#0d1b33;margin:24px 0 10px;} .e0-blog-p{font-size:15.5px;color:#222222;margin:0 0 16px;} .e0-blog-quote{font-size:14.5px;color:#333333;background:#f4f7fb;border-left:3px solid #00489d;padding:14px 18px;margin:16px 0 24px;border-radius:0 6px 6px 0;} .e0-blog-formula{font-family:"DM Mono",monospace;font-size:13.5px;color:#0d1b33;background:#f4f7fb;border:1px dashed #00489d;border-radius:8px;padding:16px 18px;margin:16px 0 24px;white-space:pre-wrap;line-height:1.8;} .e0-blog-table-wrap{overflow-x:auto;margin:16px 0 28px;} table.e0-blog-table{width:100%;border-collapse:collapse;font-size:13.5px;min-width:480px;} table.e0-blog-table th{background:#00489d;color:#ffffff;font-weight:700;text-align:left;padding:9px 12px;} table.e0-blog-table td{padding:9px 12px;border-bottom:1px solid #e2e8f2;} table.e0-blog-table tr:nth-child(even) td{background:#f7f9fc;} table.e0-blog-table td.e0-num{font-family:"DM Mono",monospace;text-align:right;} .e0-blog-list{margin:0 0 20px;padding-left:22px;} .e0-blog-list li{font-size:15px;color:#222222;margin-bottom:8px;} .e0-blog-callout{background:#0d1b33;color:#f4f7fb;border-radius:10px;padding:20px 22px;margin:28px 0;font-size:14.5px;} .e0-blog-callout strong{color:#7fb3ff;} .e0-blog-footer-note{font-family:"DM Mono",monospace;font-size:11.5px;color:#8a8a8a;margin-top:56px;padding-top:20px;border-top:1px solid #e2e8f2;} [data-e0-lang]{display:none;} [data-e0-lang].e0-lang-visible{display:block;} </style><div class="e0-blog-wrap" id="e0BlogRoot"><div class="e0-blog-lang-toggle"><button type="button" class="e0-blog-lang-btn" data-e0-set-lang="ja">日本語</button><button type="button" class="e0-blog-lang-btn" data-e0-set-lang="en">EN</button></div>
<!-- ================= JAPANESE================= --><div data-e0-lang="ja"><div class="e0-blog-eyebrow">Case Study / PoC</div>
<h1 class="e0-blog-title">標準評価は「誰が審査するか」で変わるべきか<br>——MR中途採用一次選考におけるSEGT実証</h1><p class="e0-blog-lede">評価者が変われば、標準評価はどう変わるのか。医薬品企業のMR中途採用の一次書類選考を題材に、eval000のSEGT（Standard Evaluation Generation Theory）で検証しました。</p><div class="e0-blog-disclaimer">※本稿で扱う応募者データはすべて架空のサンプルです。実在の選考事例ではなく、概念実証（PoC）の記録として公開しています。</div>
<p class="e0-blog-p">採用選考の一次書類審査は、多くの場合「複数の評価者が採点し、平均する」という方法で標準化されています。しかし、評価者が変われば重視する観点も変わります。即戦力を求める採用マネージャーと、将来性を見る育成担当者とでは、同じ応募書類でも評価が変わって当然です。</p><p class="e0-blog-p">この「評価者による違い」を、単なるブレとして平均化してしまってよいのでしょうか。それとも、会社が求める基準と評価者の視点の違いを、両方とも活かした形で評価を導き出すべきなのでしょうか。今回、SEGTを用いてこの問いを検証しました。</p><h2 class="e0-blog-h2">① 外生原理からNorm Nを生成する——「原理→ルーブリックR→生成評価値N」という設計</h2><p class="e0-blog-p">SEGTの理論構造を正確に述べると、採用方針の文章そのものが「Norm N」なのではありません。理論上、この関係は次の4段階として整理されます。</p><div class="e0-blog-formula">外生原理 → R（評価基準・ルーブリック）→ N（外生基準に基づく生成評価値） 評価者集団 → M (M, N) → Φ → V*</div>
<p class="e0-blog-p">「即戦力となるMR職を採用する」といった採用方針そのもの（外生原理）は、まずルーブリックR（評価軸とアンカー基準）へと翻訳されます。Norm Nは、この外生原理そのものではなく、<strong>外生原理をルーブリックRに照らして導出された、生成評価値</strong>という位置づけです。</p><p class="e0-blog-p">今回のMR中途採用では、次のような採用方針（外生原理）を設定しました。</p><div class="e0-blog-quote">自社発売体制移行期において即戦力となるMR職を採用する。医療機関との信頼構築力とコンプライアンス意識を、実績の大小以上に重視する。学歴・年齢・前職社名ブランドは評価の対象としない。</div>
<p class="e0-blog-p">この外生原理を5軸のルーブリックRへ落とし込んだ上で、各軸のNorm N（生成評価値）を導出する際、重要な設計判断がありました。「軸ごとの重み（配点比率）」と「軸ごとの絶対的な到達目標（0〜100点の水準）」を、明確に分けて定義することです。</p><div class="e0-blog-table-wrap"><table class="e0-blog-table"><tr><th>評価軸</th><th>配点（軸間の重み）</th><th>Norm N（生成評価値）</th></tr><tr><td>専門性・疾患知識</td><td class="e0-num">20%</td><td class="e0-num">70点</td></tr><tr><td>渉外・関係構築力</td><td class="e0-num">25%</td><td class="e0-num">85点</td></tr><tr><td>コンプライアンス意識</td><td class="e0-num">25%</td><td class="e0-num">85点</td></tr><tr><td>成果創出力</td><td class="e0-num">15%</td><td class="e0-num">65点</td></tr><tr><td>組織適応・自律性</td><td class="e0-num">15%</td><td class="e0-num">70点</td></tr></table></div>
<p class="e0-blog-p">「重視する軸ほど配点が高い」だけでなく、「重視する軸ほど、ルーブリックRから生成される評価値そのものも高くなる」という二重の反映です。この生成評価値Nは合否を分ける足切り線ではなく、SEGTのV*（収束後スコア）がNと評価者集団Mのスコアを連続的にすり合わせて算出するための基準点です。</p><h2 class="e0-blog-h2">② ルーブリック定義——評価者が共通言語で採点できるように</h2><p class="e0-blog-p">Norm Nを生成する土台となるルーブリックRそのものが曖昧では、評価者ごとに解釈がバラバラになってしまいます。5段階のアンカー基準を作成し、各軸で「どのような記述があれば何点相当か」を具体化しました。例えば「渉外・関係構築力」は次の通りです。</p><ul class="e0-blog-list"><li><strong>5（卓越）</strong>：KOLとの継続的信頼関係構築の具体エピソードと成果が明確</li><li><strong>4（優良）</strong>：医療機関担当者との関係構築実績が具体的に記述されている</li><li><strong>3（標準）</strong>：関係構築への言及はあるが成果や継続性が不明確</li><li><strong>2（要改善）</strong>：対人折衝経験はあるが医療機関特有の文脈がない</li><li><strong>1（不足）</strong>：渉外・関係構築の記述がほぼない</li></ul><h2 class="e0-blog-h2">③ 審査員構成（評価者集団M）——4つのペルソナから2つのパネルを編成する</h2><p class="e0-blog-p">SEGTのもう一つの構成要素が、評価者集団Mです。評価者を「複数の視点を持つペルソナ」として設計できます。今回は次の4ペルソナを定義しました。</p><div class="e0-blog-table-wrap"><table class="e0-blog-table"><tr><th>ペルソナ</th><th>重視する視点</th></tr><tr><td>採用マネージャー型</td><td>KPI・即戦力</td></tr><tr><td>コンプライアンス責任者型</td><td>規制遵守</td></tr><tr><td>現場MRリーダー型</td><td>渉外・KOL対応の実務適性</td></tr><tr><td>育成観点型</td><td>伸びしろ・学習意欲</td></tr></table></div>
<p class="e0-blog-p">この4名を、目的の異なる2つの3名パネル（M）に再編成しました。コンプライアンス責任者型と現場MRリーダー型はMR職の核となる評価軸のため両パネルに共通させ、採用マネージャー型と育成観点型だけを入れ替えています。</p><p class="e0-blog-p"><strong>組1｜即戦力重視パネル（M₁）</strong>：採用マネージャー型＋コンプライアンス責任者型＋現場MRリーダー型<br><strong>組2｜将来性重視パネル（M₂）</strong>：コンプライアンス責任者型＋現場MRリーダー型＋育成観点型</p><p class="e0-blog-p">ここまでで、外生原理から生成したNorm N（①）と、評価者集団M（③）が揃いました。SEGTはこの(M, N)を収束アルゴリズムΦに入力し、標準評価値V*を算出します。Nは共通のまま、Mだけを2通りに変えることで、V*がどう変化するかを次に検証します。</p><h2 class="e0-blog-h2">④ 即戦力重視vs将来性重視で異なる標準評価結果</h2><p class="e0-blog-p">MR未経験（他業界の法人営業出身）で、独学によるコンプライアンス理解と学習意欲を強みとする架空の応募者データを、M₁・M₂それぞれのパネルで評価しました。</p><div class="e0-blog-table-wrap"><table class="e0-blog-table"><tr><th>評価軸</th><th>組1 v*（M₁：即戦力）</th><th>組2 v*（M₂：将来性）</th><th>Norm N</th></tr><tr><td>専門性・疾患知識</td><td class="e0-num">59.17</td><td class="e0-num">62.73</td><td class="e0-num">70.00</td></tr><tr><td>渉外・関係構築力</td><td class="e0-num">73.43</td><td class="e0-num">77.66</td><td class="e0-num">85.00</td></tr><tr><td>コンプライアンス意識</td><td class="e0-num">79.88</td><td class="e0-num">83.12</td><td class="e0-num">85.00</td></tr><tr><td>成果創出力</td><td class="e0-num">38.32</td><td class="e0-num">46.64</td><td class="e0-num">65.00</td></tr><tr><td>組織適応・自律性</td><td class="e0-num">61.56</td><td class="e0-num">65.66</td><td class="e0-num">70.00</td></tr><tr><td><strong>総合スコア</strong></td><td class="e0-num"><strong>62.5</strong></td><td class="e0-num"><strong>67.2</strong></td><td class="e0-num">—</td></tr></table></div>
<p class="e0-blog-p">Nは同一のまま、Mだけを変えたにもかかわらず、総合スコアが62.5点から67.2点へと変化しました。特に成果創出力は実務経験に乏しいという実態を反映してNorm N（65点）を大きく下回っていますが、育成観点型を含むM₂ではその不足がやや緩和されています。</p><p class="e0-blog-p">興味深いのは、変化が成果創出力だけに留まらず、5軸すべてでM₂の方が一様に高くなっている点です。「Mを構成する1名の視点が変わると、狙った軸だけでなく評価全体が方向性を持ってシフトする」という挙動は、複数評価者による標準評価の設計において重要な示唆です。</p><div class="e0-blog-callout"><strong>Norm NとEval avgの乖離が意味するもの</strong><br> 成果創出力では、評価者集団Mの採点平均（Eval avg）がわずか10点前後だったのに対し、外生原理から生成されたNorm Nは65点でした。V*（38.32）はどちらか一方に寄らず、両者から距離を保った中間的な値に収束しています。これは算出の不具合ではなく、「外生原理が求める水準と、Mが見た応募者の実態との間に、埋めがたいギャップが存在する」という事実そのものを、V*が定量的に可視化していると解釈できます。 </div>
<h2 class="e0-blog-h2">まとめと今後の展開</h2><ul class="e0-blog-list"><li>外生原理をルーブリックRに翻訳し、そこから生成評価値Nを導出するという三段階の設計にすることで、採用方針をより精緻に評価へ反映できる</li><li>評価者集団Mの構成を変えることで、同じNorm Nに対する標準評価値V*が変化し、その変化は特定軸だけでなく全体的な傾向としても現れうる</li><li>Norm NとEval avgの乖離幅そのものが、応募者の強み・弱みを定量的に語る指標として機能する</li></ul><p class="e0-blog-p">今後は、特定軸が著しく水準に届かない場合に総合評価によらず選考の再検討を促す仕組みや、より多様な評価者集団Mでのロバスト性検証など、実運用に向けた設計を継続して検討していきます。</p><div class="e0-blog-footer-note">eval000 — Meta-Evaluation Engine based on SEGT（特願2026-096693）</div>
</div><!-- ================= ENGLISH================= --><div data-e0-lang="en"><div class="e0-blog-eyebrow">Case Study / PoC</div>
<h1 class="e0-blog-title">Should Standard Evaluation Change Depending on Who Judges?<br>SEGT Applied to First-Round MR Hiring Screening</h1><p class="e0-blog-lede">If the panel of evaluators changes, how should the standard evaluation change with it? We tested this question using eval000's SEGT (Standard Evaluation Generation Theory) on a first-round document screening scenario for mid-career Medical Representative (MR) hiring at a pharmaceutical company.</p><div class="e0-blog-disclaimer">All applicant data in this article is fictional. This is a proof-of-concept (PoC) record, not an account of an actual hiring decision.</div>
<p class="e0-blog-p">First-round document screening is usually standardized by having multiple evaluators score independently and averaging the results. But different evaluators naturally weigh different things: a hiring manager looking for immediate impact and a development-minded manager looking for potential will read the same résumé differently.</p><p class="e0-blog-p">Should that variation simply be averaged away as noise? Or should the evaluation draw on both the company's standard and the genuine differences between evaluator perspectives? We used SEGT to explore this question directly.</p><h2 class="e0-blog-h2">① Generating Norm N from the External Principle: "Principle → Rubric R → Generated Value N"</h2><p class="e0-blog-p">Stated precisely, the hiring policy text itself is not "Norm N." Theoretically, the relationship breaks down into four stages:</p><div class="e0-blog-formula">External Principle → R (evaluation criteria / rubric) → N (generated evaluation value based on the external standard) Evaluator population → M (M, N) → Φ → V*</div>
<p class="e0-blog-p">A hiring policy such as "hire an MR who can perform immediately" (the external principle) is first translated into rubric R — the evaluation axes and anchor criteria. Norm N is not the principle itself, but rather <strong>the generated value derived by reading the external principle through rubric R.</strong></p><p class="e0-blog-p">For this case, we set the following hiring policy (external principle).</p><div class="e0-blog-quote">Hire an MR who can perform immediately during the transition to an in-house sales structure. Prioritize trust-building with medical institutions and compliance awareness above raw performance numbers. Do not evaluate based on academic background, age, or previous employer brand.</div>
<p class="e0-blog-p">Translating this principle into a 5-axis rubric R, and then deriving each axis's Norm N, required one key design decision: explicitly separating the <strong>weight</strong> of each axis (how much it contributes to the total, summing to 100%) from the <strong>target level</strong> (an absolute 0–100 anchor value).</p><div class="e0-blog-table-wrap"><table class="e0-blog-table"><tr><th>Evaluation Axis</th><th>Weight</th><th>Norm N (generated value)</th></tr><tr><td>Expertise / Disease Knowledge</td><td class="e0-num">20%</td><td class="e0-num">70</td></tr><tr><td>Relationship Building</td><td class="e0-num">25%</td><td class="e0-num">85</td></tr><tr><td>Compliance Awareness</td><td class="e0-num">25%</td><td class="e0-num">85</td></tr><tr><td>Track Record / Results</td><td class="e0-num">15%</td><td class="e0-num">65</td></tr><tr><td>Organizational Adaptability</td><td class="e0-num">15%</td><td class="e0-num">70</td></tr></table></div>
<p class="e0-blog-p">Axes the company prioritizes get both a higher weight and a higher value generated from rubric R — a double emphasis. This generated value N is not a pass/fail cutoff; it is the anchor that SEGT's V* (post-convergence score) continuously reconciles against the evaluator population M's actual scores.</p><h2 class="e0-blog-h2">② Rubric Design: A Shared Language for Evaluators</h2><p class="e0-blog-p">If rubric R — the foundation from which Norm N is generated — is itself vague, evaluators will interpret each axis differently. We built a 5-level anchor rubric so each axis had a concrete definition of what a given score should look like. For "Relationship Building":</p><ul class="e0-blog-list"><li><strong>5 (Excellent)</strong>: Clear, specific episodes and outcomes of sustained trust-building with KOLs</li><li><strong>4 (Good)</strong>: Concrete track record of relationship-building with medical institution staff</li><li><strong>3 (Standard)</strong>: Relationship-building is mentioned but outcomes or continuity are unclear</li><li><strong>2 (Needs Improvement)</strong>: Has interpersonal experience but lacks healthcare-specific context</li><li><strong>1 (Insufficient)</strong>: Almost no mention of relationship-building</li></ul><h2 class="e0-blog-h2">③ Evaluator Panel Design (Population M): Two Panels from Four Personas</h2><p class="e0-blog-p">The other component of SEGT is the evaluator population, M. Evaluators can be designed as personas with distinct perspectives. We defined four:</p><div class="e0-blog-table-wrap"><table class="e0-blog-table"><tr><th>Persona</th><th>Priority</th></tr><tr><td>Hiring Manager type</td><td>KPIs / immediate impact</td></tr><tr><td>Compliance Officer type</td><td>Regulatory adherence</td></tr><tr><td>Field MR Leader type</td><td>Practical fit for KOL engagement</td></tr><tr><td>Talent Development type</td><td>Growth potential / learning drive</td></tr></table></div>
<p class="e0-blog-p">These four were recombined into two 3-person panels (M). The Compliance Officer and Field MR Leader personas — core to the MR role — appear in both panels; only the Hiring Manager and Talent Development personas are swapped.</p><p class="e0-blog-p"><strong>Panel 1 | Immediate-Impact Panel (M₁)</strong>: Hiring Manager + Compliance Officer + Field MR Leader<br><strong>Panel 2 | Future-Potential Panel (M₂)</strong>: Compliance Officer + Field MR Leader + Talent Development</p><p class="e0-blog-p">At this point we have both Norm N, generated from the external principle (①), and the evaluator population M (③). SEGT feeds this pair (M, N) into a convergence algorithm Φ to compute the standard evaluation value V*. Holding N fixed and varying only M lets us examine how V* shifts.</p><h2 class="e0-blog-h2">④ Different Standard Evaluations for Immediate-Impact vs. Future-Potential Panels</h2><p class="e0-blog-p">We evaluated a fictional applicant — no direct MR experience (corporate sales in another industry), with self-taught compliance knowledge and strong learning motivation as their key strength — under both panels M₁ and M₂.</p><div class="e0-blog-table-wrap"><table class="e0-blog-table"><tr><th>Axis</th><th>Panel 1 v* (M₁: Immediate)</th><th>Panel 2 v* (M₂: Future)</th><th>Norm N</th></tr><tr><td>Expertise / Disease Knowledge</td><td class="e0-num">59.17</td><td class="e0-num">62.73</td><td class="e0-num">70.00</td></tr><tr><td>Relationship Building</td><td class="e0-num">73.43</td><td class="e0-num">77.66</td><td class="e0-num">85.00</td></tr><tr><td>Compliance Awareness</td><td class="e0-num">79.88</td><td class="e0-num">83.12</td><td class="e0-num">85.00</td></tr><tr><td>Track Record / Results</td><td class="e0-num">38.32</td><td class="e0-num">46.64</td><td class="e0-num">65.00</td></tr><tr><td>Organizational Adaptability</td><td class="e0-num">61.56</td><td class="e0-num">65.66</td><td class="e0-num">70.00</td></tr><tr><td><strong>Overall Score</strong></td><td class="e0-num"><strong>62.5</strong></td><td class="e0-num"><strong>67.2</strong></td><td class="e0-num">—</td></tr></table></div>
<p class="e0-blog-p">With N held constant and only M changed, the overall score shifted from 62.5 to 67.2. Track Record / Results falls well short of its Norm N (65) under both panels, reflecting the applicant's limited hands-on experience — but the shortfall is somewhat softened under M₂, which includes the Talent Development persona.</p><p class="e0-blog-p">Notably, the shift wasn't confined to Track Record — all five axes scored uniformly higher under M₂. This suggests that swapping a single evaluator's perspective within M can shift the evaluation's overall tenor, not just the axis it was intended to affect — an important consideration when designing multi-evaluator standard evaluation systems.</p><div class="e0-blog-callout"><strong>What the Gap Between Norm N and Eval avg Reveals</strong><br> For Track Record / Results, the evaluator population M's raw average (Eval avg) was only around 10, against a Norm N of 65 generated from the external principle. Rather than settling near either value, V* (38.32) converged to a point clearly distant from both. This isn't a computational glitch — it's V* quantitatively surfacing a genuine, hard-to-close gap between what the external principle requires and what M observed in the applicant's actual profile. </div>
<h2 class="e0-blog-h2">Conclusion and Next Steps</h2><ul class="e0-blog-list"><li>Translating the external principle into rubric R, then deriving the generated value N from it, allows a hiring policy to be reflected in evaluation with much greater precision</li><li>Changing the composition of evaluator population M shifts the standard evaluation value V* for the same Norm N, and that shift can appear as a broad tendency rather than being confined to a single axis</li><li>The gap between Norm N and Eval avg itself functions as a quantitative signal of an applicant's strengths and weaknesses</li></ul><p class="e0-blog-p">Next steps include designing mechanisms that flag candidates for reconsideration when a specific axis falls far short of target regardless of overall score, and testing robustness across a wider range of evaluator population M configurations.</p><div class="e0-blog-footer-note">eval000 — Meta-Evaluation Engine based on SEGT (Japan Patent Application 2026-096693)</div>
</div></div><script>
(function(){
  var root = document.getElementById('e0BlogRoot');
  if(!root) return;
  var KEY = 'e0-lang';
  function apply(lang){
    var blocks = root.querySelectorAll('[data-e0-lang]');
    for(var i=0;i<blocks.length;i++){
      blocks[i].classList.toggle('e0-lang-visible', blocks[i].getAttribute('data-e0-lang') === lang);
    }
    var btns = root.querySelectorAll('[data-e0-set-lang]');
    for(var j=0;j<btns.length;j++){
      btns[j].classList.toggle('e0-active', btns[j].getAttribute('data-e0-set-lang') === lang);
    }
    try{ localStorage.setItem(KEY, lang); }catch(e){}
  }
  var btns = root.querySelectorAll('[data-e0-set-lang]');
  for(var k=0;k<btns.length;k++){
    btns[k].addEventListener('click', function(){ apply(this.getAttribute('data-e0-set-lang')); });
  }
  var saved = 'ja';
  try{ saved = localStorage.getItem(KEY) || 'ja'; }catch(e){}
  apply(saved);
})();
</script></div>
</div></div></div></div></div></div> ]]></content:encoded><pubDate>Tue, 25 Aug 2026 11:39:47 +0900</pubDate></item><item><title><![CDATA[【実証レポート】]]></title><link>https://www.eval000.ai/blogs/post/testreport2608</link><description><![CDATA[<img align="left" hspace="5" src="https://www.eval000.ai/sam4blog/eval000_blog_casestudy_thumb.png"/>DeepSeekとClaudeに同一ルーブリック（AG/BG）で2件のビジネスプランを評価させると、AGスコアで最大1.60点差が発生しました。「将来計画を評価するか／現在の実績を評価するか」というAIの評価思想の差が、同一ルーブリックを使っても結果を変えてしまうことを実証しました。 ]]></description><content:encoded><![CDATA[<div class="zpcontent-container blogpost-container "><div data-element-id="elm_kxTbAQIPRRe4aRTEBV205w" data-element-type="section" class="zpsection "><style type="text/css"></style><div class="zpcontainer-fluid zpcontainer"><div data-element-id="elm_Zuko-qVERymu8l2IbUiRSQ" data-element-type="row" class="zprow zprow-container zpalign-items- zpjustify-content- " data-equal-column=""><style type="text/css"></style><div data-element-id="elm_JbQAVruOTFqUbyPhpPuCLw" data-element-type="column" class="zpelem-col zpcol-12 zpcol-md-12 zpcol-sm-12 zpalign-self- "><style type="text/css"></style><div data-element-id="elm_di1gH_b6xjiUA2T6y-FIyw" data-element-type="text" class="zpelement zpelem-text "><style></style><div class="zptext zptext-align-left zptext-align-mobile-left zptext-align-tablet-left " data-editor="true"><p><span><span>DeepSeekとClaudeに同一ルーブリック（AG/BG）で2件のビジネスプランを評価させると、AGスコアで最大1.60点差が発生しました。「将来計画を評価するか／現在の実績を評価するか」というAIの評価思想の差が、同一ルーブリックを使っても結果を変えてしまうことを実証しました。</span></span></p></div>
</div><div data-element-id="elm_Hd22eLo02u7PC_Q7c2uy3w" data-element-type="codeSnippet" class="zpelement zpelem-codesnippet "><div class="zpsnippet-container"><!-- eval000 Case Study ブログ v3 — Zoho Sites CodeSnippet --><link href="https://fonts.googleapis.com/css2?family=Noto+Sans+JP:wght@300;400;500;700&family=Noto+Serif+JP:wght@600;700&family=DM+Mono:wght@400;500&display=swap" rel="stylesheet"><style> /* ─── Tokens ─────────────────────────────────── */ :root{ --navy:#06102a; --navy2:#0d1f4a; --blue:#2a5cff; --blue2:#5b82ff; --blue3:#93afff; --blue-dim:rgba(42,92,255,.10); --royal:#00489d; --gold:#c8933a; --gold-d:#fdf3e0; --grn:#166534; --grn-d:#f0fdf4; --grn2:#22c55e; --red:#dc2626; --red-d:#fef2f2; --pur:#6040b8; --pur-d:#f0edf8; --ink:#111827; --ink2:#374151; --ink3:#6b7280; --rule:#e5e7eb; --bg-soft:#f8f9fc; --serif:'Noto Serif JP',serif; --sans:'Noto Sans JP',sans-serif; --mono:'DM Mono',monospace; --r:6px; --rl:12px; } /* ─── Root wrapper ────────────────────────────── */ .cs{font-family:var(--sans);color:var(--ink);background:#fff; line-height:1.8;-webkit-font-smoothing:antialiased;} .cs *{box-sizing:border-box;} .cs a{color:var(--blue);text-decoration:none;} .cs a:hover{text-decoration:underline;} /* ─── Scroll progress ─────────────────────────── */ .cs-prog{position:fixed;top:0;left:0;right:0;height:3px; background:linear-gradient(90deg,var(--blue),var(--blue2)); transform-origin:left;transform:scaleX(0);z-index:9999; transition:transform .1s linear;} /* ─── Hero ────────────────────────────────────── */ .cs-hero{background:linear-gradient(135deg,#06102a 0%,#0d2268 55%,#00489d 100%); padding:48px 24px 40px;text-align:center;} .cs-cat{display:inline-block;font-family:var(--mono);font-size:10.5px; letter-spacing:.18em;color:#90c8ff;background:rgba(255,255,255,.10); border:1px solid rgba(255,255,255,.25);border-radius:20px; padding:4px 14px;margin-bottom:18px;} .cs-title{font-family:var(--serif);font-size:clamp(20px,3.2vw,30px);font-weight:700; color:#fff;line-height:1.45;max-width:900px;margin:0 auto 16px;} .cs-title .hi{color:#7ec8ff;} .cs-meta{font-size:12.5px;color:rgba(192,218,255,.80); display:flex;align-items:center;justify-content:center;gap:14px;flex-wrap:wrap;} .cs-meta-sep{color:rgba(255,255,255,.25);} .cs-tags{display:flex;gap:8px;flex-wrap:wrap;justify-content:center;margin-top:14px;} .cs-htag{font-family:var(--mono);font-size:10px;letter-spacing:.06em;padding:3px 10px; border-radius:20px;background:rgba(255,255,255,.12);color:rgba(255,255,255,.80); border:1px solid rgba(255,255,255,.22);} /* ─── Key insight strip ───────────────────────── */ .cs-ki{background:var(--navy);border-bottom:3px solid var(--blue);padding:14px 20px;} .cs-ki-in{max-width:960px;margin:0 auto;display:flex;align-items:center;gap:12px;flex-wrap:wrap;} .cs-ki-label{font-family:var(--mono);font-size:9px;letter-spacing:.18em; color:var(--blue3);font-weight:600;white-space:nowrap;flex-shrink:0;} .cs-ki-text{font-size:13px;color:#c8d8ff;line-height:1.6;} .cs-ki-text strong{color:#fff;} /* ─── Breadcrumb ──────────────────────────────── */ .cs-bc{font-size:12px;color:var(--ink3);padding:12px 20px;max-width:960px;margin:0 auto; display:flex;align-items:center;gap:6px;flex-wrap:wrap;} .cs-bc a{color:var(--ink3);} .cs-bc a:hover{color:var(--blue);} .cs-bc-sep{color:var(--rule);} /* ─── Single column body ──────────────────────── */ .cs-body{max-width:960px;margin:0 auto;padding:0 20px 80px;} /* ─── TOC (inline) ────────────────────────────── */ .cs-toc-box{background:var(--bg-soft);border:1px solid var(--rule); border-radius:var(--rl);padding:18px 20px;margin:28px 0;} .cs-toc-title{font-family:var(--mono);font-size:9.5px;letter-spacing:.16em; color:var(--ink3);margin-bottom:12px;font-weight:600;} .cs-toc-list{list-style:none;padding:0;column-count:2;column-gap:20px;} @media(max-width:540px){.cs-toc-list{column-count:1;}} .cs-toc-list li{margin-bottom:7px;break-inside:avoid;} .cs-toc-list li a{font-size:12.5px;color:var(--ink2);display:block;line-height:1.5;} .cs-toc-list li a:hover{color:var(--blue);} .cs-toc-list .sub{padding-left:12px;font-size:11.5px;color:var(--ink3);} /* ─── Typography ──────────────────────────────── */ .cs-body h2{font-family:var(--serif);font-size:clamp(17px,2.4vw,22px); font-weight:700;color:var(--navy);margin:44px 0 14px; padding-bottom:10px;border-bottom:2px solid var(--rule);line-height:1.4;} .cs-body h2:first-of-type{margin-top:0;} .cs-body h3{font-size:16px;font-weight:700;color:var(--navy); margin:28px 0 10px;line-height:1.5;} .cs-body p{font-size:15px;line-height:1.9;color:var(--ink2);margin-bottom:16px;} .cs-body p:last-child{margin-bottom:0;} .cs-body strong{color:var(--ink);font-weight:700;} .cs-body ul,.cs-body ol{padding-left:20px;margin-bottom:16px;} .cs-body li{font-size:14.5px;line-height:1.85;color:var(--ink2);margin-bottom:5px;} /* ─── Lead ────────────────────────────────────── */ .cs-lead{font-size:15.5px;line-height:2.0;color:var(--ink); border-left:3px solid var(--blue);padding:14px 18px; background:var(--blue-dim);border-radius:0 var(--r) var(--r) 0;margin:28px 0;} /* ─── Callout ─────────────────────────────────── */ .cs-cb{border-radius:var(--rl);padding:14px 18px;margin:18px 0;} .cs-cb-lbl{font-family:var(--mono);font-size:9.5px;letter-spacing:.16em;font-weight:600;margin-bottom:7px;} .cs-cb-body{font-size:13px;line-height:1.85;} .cs-cb.note{background:var(--blue-dim);border:1px solid rgba(42,92,255,.20);} .cs-cb.note .cs-cb-lbl{color:var(--blue);} .cs-cb.note .cs-cb-body{color:var(--ink2);} .cs-cb.warn{background:var(--gold-d);border:1px solid rgba(200,147,58,.30);} .cs-cb.warn .cs-cb-lbl{color:var(--gold);} .cs-cb.warn .cs-cb-body{color:#78350f;} .cs-cb.key{background:var(--navy);border:1px solid rgba(255,255,255,.10);} .cs-cb.key .cs-cb-lbl{color:var(--blue3);} .cs-cb.key .cs-cb-body{color:#c8d8ff;} .cs-cb.key strong{color:#fff;} .cs-cb.good{background:var(--grn-d);border:1px solid rgba(22,101,52,.20);} .cs-cb.good .cs-cb-lbl{color:var(--grn);} .cs-cb.good .cs-cb-body{color:var(--grn);} .cs-cb.crit{background:#fff0f0;border:1.5px solid rgba(220,38,38,.25);border-left:3px solid var(--red);} .cs-cb.crit .cs-cb-lbl{color:var(--red);} .cs-cb.crit .cs-cb-body{color:#7f1d1d;} .cs-cb.insight{background:#e8f0fb;border:1px solid rgba(42,92,255,.20);} .cs-cb.insight .cs-cb-lbl{color:var(--royal);} .cs-cb.insight .cs-cb-body{color:var(--ink2);} /* ─── Section divider ─────────────────────────── */ .cs-div{display:flex;align-items:center;gap:10px;margin:36px 0 26px;} .cs-div-line{flex:1;border-top:1px solid var(--rule);} .cs-div-num{font-family:var(--mono);font-size:9.5px;letter-spacing:.16em; color:var(--ink3);background:var(--bg-soft);padding:3px 10px;border-radius:20px;} /* ─── Rubric table ────────────────────────────── */ .cs-tbl-wrap{overflow-x:auto;margin:16px 0;} .cs-tbl{width:100%;border-collapse:collapse;font-size:13px;min-width:500px;} .cs-tbl thead th{background:var(--navy);color:#fff;padding:9px 12px; text-align:left;font-weight:600;white-space:nowrap;} .cs-tbl thead th.c{text-align:center;width:54px;} .cs-tbl tbody td{padding:9px 12px;border-bottom:1px solid var(--rule); color:var(--ink2);vertical-align:middle;line-height:1.6;} .cs-tbl .sv{font-family:var(--mono);font-weight:700;text-align:center;font-size:15px;} .cs-tbl .sv.hi{color:var(--blue);} .cs-tbl .sv.md{color:var(--gold);} .cs-tbl .sv.lo{color:var(--red);} .cs-tbl .sv.top{color:var(--grn2);} .cs-tbl .sv.d1{color:var(--red);} .cs-tbl .sv.d2{color:var(--red);font-size:17px;} .cs-tbl .sv.d3{color:var(--red);font-size:19px;font-weight:900;} .cs-tbl .sv.zero{color:var(--ink3);} .cs-tbl .total-row td{background:var(--navy);color:#fff;font-weight:700; border-top:2px solid rgba(255,255,255,.15);} .cs-tbl .total-row .sv{color:#7ec8ff;font-size:16px;} /* コメント行 — 背景色で視覚分離、全幅1セル */ .cs-tbl .cmt-row td{background:#f6f8fc;border-bottom:2px solid var(--rule);padding:0;} .cs-cmt{padding:10px 12px 13px;font-size:12.5px;color:var(--ink2);line-height:1.75;} .cs-cmt strong{font-weight:700;} .cs-cmt .ds{color:var(--pur);} .cs-cmt .cl{color:var(--royal);} /* ─── Spotlight cards ─────────────────────────── */ .cs-spot-grid{display:grid;grid-template-columns:1fr 1fr;gap:14px;margin:18px 0;} @media(max-width:480px){.cs-spot-grid{grid-template-columns:1fr;}} .cs-spot{border:1px solid var(--rule);border-radius:var(--rl); padding:16px;text-align:center;background:#fff; box-shadow:0 2px 8px rgba(0,0,0,.05);} .cs-spot-lbl{font-family:var(--mono);font-size:9.5px;letter-spacing:.13em; color:var(--ink3);margin-bottom:10px;font-weight:500;} .cs-spot-scores{display:flex;gap:8px;justify-content:center;flex-wrap:wrap;margin-bottom:8px;} .cs-sc{font-family:var(--mono);font-size:22px;font-weight:700; padding:5px 11px;border-radius:7px;line-height:1.15;} .cs-sc.ds{background:var(--pur-d);color:var(--pur);} .cs-sc.cl{background:rgba(0,72,157,.08);color:var(--royal);} .cs-sc-lbl{font-size:10px;font-weight:400;display:block;margin-top:3px;} .cs-diff{display:inline-block;font-family:var(--mono);font-size:12px; font-weight:700;padding:3px 11px;border-radius:20px;margin-top:6px;} .cs-diff.lg{background:var(--red-d);color:var(--red);} .cs-spot-note{font-size:11.5px;color:var(--ink3);margin-top:8px;line-height:1.55;text-align:left;} /* ─── AI compare cards ────────────────────────── */ .cs-ai-grid{display:grid;grid-template-columns:1fr 1fr;gap:14px;margin:18px 0;} @media(max-width:480px){.cs-ai-grid{grid-template-columns:1fr;}} .cs-ai{border-radius:var(--rl);padding:16px;} .cs-ai.ds{background:var(--pur-d);border:1px solid rgba(96,64,184,.20);border-top:3px solid var(--pur);} .cs-ai.cl{background:rgba(0,72,157,.06);border:1px solid rgba(0,72,157,.20);border-top:3px solid var(--royal);} .cs-ai-name{font-family:var(--mono);font-size:10px;letter-spacing:.12em;font-weight:600;margin-bottom:7px;} .cs-ai.ds .cs-ai-name{color:var(--pur);} .cs-ai.cl .cs-ai-name{color:var(--royal);} .cs-ai-type{font-size:13px;font-weight:700;color:var(--navy);margin-bottom:8px;} .cs-ai-list{list-style:none;padding:0;display:flex;flex-direction:column;gap:5px;} .cs-ai-list li{font-size:12px;color:var(--ink2);display:flex;gap:6px;align-items:flex-start;line-height:1.6;} .cs-ai-list li::before{content:'›';font-weight:700;flex-shrink:0;font-size:13px;margin-top:-1px;} .cs-ai.ds .cs-ai-list li::before{color:var(--pur);} .cs-ai.cl .cs-ai-list li::before{color:var(--royal);} /* ─── Compare table ───────────────────────────── */ .cs-ctbl-wrap{overflow-x:auto;margin:18px 0;} .cs-ctbl{width:100%;border-collapse:collapse;font-size:13px;min-width:420px;} .cs-ctbl th{background:var(--bg-soft);color:var(--ink2);padding:8px 12px; font-weight:700;border-bottom:2px solid var(--rule);text-align:left;} .cs-ctbl th.c{text-align:center;} .cs-ctbl td{padding:9px 12px;border-bottom:1px solid var(--rule);color:var(--ink2);} .cs-ctbl tr:nth-child(even) td{background:var(--bg-soft);} .cs-ctbl td.c{text-align:center;} .cs-ctbl .rh{font-weight:700;color:var(--navy);} /* ─── Bar chart ───────────────────────────────── */ .cs-bar-wrap{margin:18px 0;} .cs-bar-legend{display:flex;gap:14px;flex-wrap:wrap;margin-bottom:12px;} .cs-bar-leg{display:flex;align-items:center;gap:5px;font-size:11px;color:var(--ink3);} .cs-bar-leg-dot{width:11px;height:11px;border-radius:3px;flex-shrink:0;} .cs-bar-sec{font-size:12px;font-weight:700;color:var(--ink2); margin:14px 0 8px;padding-top:12px;border-top:1px solid var(--rule);} .cs-bar-sec:first-of-type{border-top:none;margin-top:0;} .cs-bar-row{display:flex;align-items:center;gap:8px;margin-bottom:7px;} .cs-bar-name{width:90px;font-size:11px;color:var(--ink2);text-align:right;flex-shrink:0;line-height:1.3;} .cs-bar-track{flex:1;background:#e5e7eb;border-radius:3px;height:24px;overflow:hidden;} .cs-bar-fill{height:100%;border-radius:3px;display:flex;align-items:center;padding:0 8px;} .cs-bar-val{font-family:var(--mono);font-size:11px;font-weight:700;color:#fff;} .cs-bar-after{font-size:11px;color:var(--grn);font-weight:700;white-space:nowrap;} /* ─── SEGT result ─────────────────────────────── */ .cs-segt{background:var(--navy);border-radius:var(--rl);padding:22px 20px;margin:22px 0;text-align:center;} .cs-segt-lbl{font-family:var(--mono);font-size:9.5px;letter-spacing:.18em; color:var(--blue3);margin-bottom:14px;font-weight:500;} .cs-segt-scores{display:flex;gap:10px;justify-content:center;flex-wrap:wrap;margin-bottom:10px;} .cs-segt-score{background:rgba(255,255,255,.10);border:1px solid rgba(255,255,255,.18); border-radius:var(--rl);padding:12px 16px;text-align:center;} .cs-segt-num{font-family:var(--mono);font-size:clamp(26px,4vw,38px);font-weight:700;color:#7ec8ff;line-height:1;} .cs-segt-plan{font-size:10.5px;color:rgba(255,255,255,.55);margin-top:4px;} .cs-segt-eq{font-size:20px;color:rgba(255,255,255,.30);display:flex;align-items:center;} .cs-segt-badge{display:inline-block;font-family:var(--mono);font-size:12px;font-weight:700; padding:4px 14px;border-radius:20px;background:rgba(34,197,94,.15);color:#4ade80; border:1px solid rgba(34,197,94,.30);} .cs-segt-desc{font-size:12.5px;color:rgba(192,218,255,.80);line-height:1.8;margin-top:12px;} /* ─── Tags / author / footer ──────────────────── */ .cs-tag-row{display:flex;gap:7px;flex-wrap:wrap;margin:16px 0;} .cs-tag{font-family:var(--mono);font-size:10.5px;padding:3px 11px; border-radius:20px;background:var(--bg-soft);border:1px solid var(--rule);color:var(--ink3);} .cs-tag.b{background:var(--blue-dim);border-color:rgba(42,92,255,.25);color:var(--blue);} .cs-author{display:flex;align-items:center;gap:12px;border:1px solid var(--rule); border-radius:var(--rl);padding:14px 16px;margin:32px 0;} .cs-author-av{width:40px;height:40px;border-radius:50%;flex-shrink:0; background:linear-gradient(135deg,#00489d,#1a6fd4); display:flex;align-items:center;justify-content:center; font-family:var(--mono);font-size:13px;font-weight:700;color:#fff;} .cs-author-name{font-size:13px;font-weight:700;color:var(--navy);margin-bottom:2px;} .cs-author-role{font-size:11.5px;color:var(--ink3);} .cs-footer{border-top:1px solid var(--rule);padding-top:22px;margin-top:32px;} .cs-footer-desc{font-size:13px;color:var(--ink2);margin-bottom:12px;line-height:1.8;} .cs-footer-links{display:flex;gap:10px;flex-wrap:wrap;} .cs-flink{display:inline-flex;align-items:center;gap:5px;font-size:13px;font-weight:600; padding:9px 16px;border-radius:var(--r);text-decoration:none;transition:opacity .15s;} .cs-flink:hover{opacity:.85;text-decoration:none;} .cs-flink.p{background:var(--navy);color:#fff;} .cs-flink.s{background:var(--bg-soft);border:1px solid var(--rule);color:var(--ink2);} </style><div class="cs"><div class="cs-prog" id="cs-prog"></div>
<!-- ── HERO ──────────────────────────────────────── --><div class="cs-hero"><div class="cs-cat">Case Study ／ 実証レポート</div>
<h1 class="cs-title">【実証レポート】<span class="hi">AI評価モデルが異なると</span>、<br>なぜ同じプランの評点が最大1.45点変わるのか</h1><div class="cs-meta"><span>2026年8月5日</span><span class="cs-meta-sep">|</span><span>eval000 事務局</span><span class="cs-meta-sep">|</span><span>読了目安 約8分</span></div>
<div class="cs-tags"><span class="cs-htag">生成AI評価バイアス</span><span class="cs-htag">ルーブリックAG/BG</span><span class="cs-htag">SEGT収束</span><span class="cs-htag">DeepSeek vs Claude</span><span class="cs-htag">ビジネスプラン評価</span></div>
</div><!-- ── KEY FINDING ────────────────────────────────── --><div class="cs-ki"><div class="cs-ki-in"><div class="cs-ki-label">KEY FINDING</div>
<div class="cs-ki-text">同一プラン・同一ルーブリックで DeepSeek と Claude に採点させると<strong> AGスコアで最大 1.60点差</strong>（DeepSeek 5.00 vs Claude 3.40）が発生。同じ「ものさし」を使っても AI によってスコアが大きく変わる——これが eval000 が解決すべき問題の核心です。</div>
</div></div><!-- ── BREADCRUMB ──────────────────────────────────── --><div class="cs-bc"><a href="https://www.eval000.ai/">Home</a><span class="cs-bc-sep">/</span><a href="https://www.eval000.ai/blogs">ブログ</a><span class="cs-bc-sep">/</span><span>Case Study</span></div>
<!-- ── BODY ───────────────────────────────────────── --><div class="cs-body"><!-- TOC（インライン） --><div class="cs-toc-box"><div class="cs-toc-title">目次</div>
<ul class="cs-toc-list"><li><a href="#cs-bg">実施背景</a></li><li><a href="#cs-method">評価方法</a></li><li><a href="#cs-eco">EcoBottle Campus の評価</a></li><li><a class="sub" href="#cs-eco-ag">└ AGルーブリック比較</a></li><li><a class="sub" href="#cs-eco-bg">└ BGルーブリック比較</a></li><li><a href="#cs-yat">越中八尾の評価</a></li><li><a class="sub" href="#cs-yat-ag">└ AGルーブリック比較</a></li><li><a class="sub" href="#cs-yat-bg">└ BGルーブリック比較</a></li><li><a href="#cs-cmp">AIスコア総括</a></li><li><a href="#cs-thought">AI評価思想の比較</a></li><li><a href="#cs-segt">SEGT収束の実証</a></li><li><a href="#cs-conc">結論</a></li></ul></div>
<p class="cs-lead">生成AIに同一のビジネスプランを評価させても、使うAIモデルが違えばスコアが大きく変わる——これは直感的には分かっていても、実際のデータとして示されることは少なかった。本レポートでは eval000 の体験セミナー（2026年8月5日）で実施したライブデモの実証データとして、DeepSeekとClaudeに全く同一のルーブリックで2件のビジネスプランを評価させた結果を公開します。</p><!-- SEC 01 背景 --><div class="cs-div"><div class="cs-div-line"></div><div class="cs-div-num">SECTION 01</div><div class="cs-div-line"></div></div>
<h2 id="cs-bg">実施背景——「AI評価の標準化」という問題</h2><p>ビジネスコンテスト・採用選考・補助金審査の現場では、審査工数の削減を目的として生成AIの活用が急速に広まっています。しかし多くの場面で「AIに採点させる」という実装が行われており、そこには構造的な問題があります。</p><div class="cs-cb warn"><div class="cs-cb-lbl">PROBLEM</div>
<div class="cs-cb-body"><strong>ChatGPT・Gemini・Claude・DeepSeek——同じプロンプトを送っても、各AIモデルは異なる採点結果を返します。</strong>モデルごとに学習データ・RLHF設計・評価思想が異なるためです。「AIを使った客観的評価」という前提が、使うAIの選択によって評点が変わるという矛盾を内包しています。</div>
</div><p>eval000が2025年に実施した予備検証では、同一のビジネスプランをChatGPT・Gemini・Claude等の複数モデルで評価させると<strong>最大12点差</strong>が生じることを確認しています。本レポートはその構造的問題を、AG・BGという2種類のルーブリックを用いたより精密な実証として示します。</p><!-- SEC 02 評価方法 --><div class="cs-div"><div class="cs-div-line"></div><div class="cs-div-num">SECTION 02</div><div class="cs-div-line"></div></div>
<h2 id="cs-method">評価方法</h2><h3>評価対象プラン</h3><ul><li><strong>プランA：EcoBottle Campus</strong>——大学生向け水筒シェアリングサービス</li><li><strong>プランB：越中八尾ウェルネス・スマートビレッジ創生事業</strong>——令和8年度富山市PoC申請</li></ul><h3>使用ルーブリック</h3><div class="cs-cb note"><div class="cs-cb-lbl">評価軸の設計</div>
<div class="cs-cb-body"><strong>AGルーブリック（5項目・加重スコア）</strong><br> ① 根拠と検証（30%）② 発展可能性（25%）③ 人間ならではの価値（20%）④ 実行リスク（15%）⑤ 社会的変革の度合い（10%）<br><br><strong>BGルーブリック（4項目・加重スコア）</strong><br> ① 価値の革新性（30%）② 市場の潜在性（20%）③ 商業的実現可能性（25%）④ 技術的実現可能性（25%） </div>
</div><h3>評価者</h3><p><strong>DeepSeek</strong>（ポテンシャル評価型）と<strong>Claude</strong>（エビデンス評価型）に、全く同一のルーブリック・評価基準・ビジネスプラン文書を提供し、独立採点を実施しました。</p><!-- SEC 03 EcoBottle --><div class="cs-div"><div class="cs-div-line"></div><div class="cs-div-num">SECTION 03</div><div class="cs-div-line"></div></div>
<h2 id="cs-eco">EcoBottle Campus の評価結果</h2><h3 id="cs-eco-ag">AGルーブリック比較</h3><div class="cs-tbl-wrap"><table class="cs-tbl"><thead><tr><th>評価基準</th><th class="c">配点</th><th class="c">DeepSeek</th><th class="c">Claude</th><th class="c">差</th></tr></thead><tbody><tr><td><strong>① 根拠と検証</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">30%</td><td class="sv hi">4</td><td class="sv md">3</td><td class="sv d1">+1</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt"><span class="ds">DeepSeek：</span>環境省データ・実証実験に裏付けられ、ABC大学の検証が「100人以上」とみなせると判断。<br><span class="cl">Claude：</span>実参加ユーザー数が不明瞭、廃棄コスト算出根拠の記載なしを厳密に評価。</div></td></tr><tr><td><strong>② 発展可能性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">25%</td><td class="sv md">3</td><td class="sv lo">2</td><td class="sv d1">+1</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt"><span class="ds">DeepSeek：</span>3ヵ年計画・全国100大学・アジア展開という将来構想を「発展性」として評価。<br><span class="cl">Claude：</span>AI洗浄システムの改善履歴・実績の開示がなく、実証された発展の軌跡が乏しいと判断。</div></td></tr><tr><td><strong>③ 人間ならではの価値</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">20%</td><td class="sv hi">4</td><td class="sv lo">2</td><td class="sv d2">+2</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt"><span class="ds">DeepSeek：</span>「所有から共有へ」という価値観転換を学生の視点で描写——共感を得やすいと高評価。<br><span class="cl">Claude：</span>市場分析・数値データ中心の構成で、創業者の個人的な動機・感情的訴求がほぼ見当たらないと判断。</div></td></tr><tr><td><strong>④ 実行リスク</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">15%</td><td class="sv hi">4</td><td class="sv md">3</td><td class="sv d1">+1</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt"><span class="ds">DeepSeek：</span>3リスクに個別対応策があり事業全体として実現可能と評価。<br><span class="cl">Claude：</span>個人情報保護・損害賠償責任等の法的観点への言及が薄いと判断。</div></td></tr><tr><td><strong>⑤ 社会的変革の度合い</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">10%</td><td class="sv hi">4</td><td class="sv hi">4</td><td class="sv zero">0</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt">両AI共通：CO2・廃棄物削減を定量化し、長期ビジョン（ASEAN展開）まで提示している点を評価。唯一一致した評価軸。</div></td></tr><tr class="total-row"><td><strong>AGスコア（加重平均）</strong></td><td></td><td class="sv">3.75</td><td class="sv">2.55</td><td class="sv" style="color:rgb(248, 113, 113);font-size:16px;">1.20</td></tr></tbody></table></div>
<div class="cs-cb insight"><div class="cs-cb-lbl">INSIGHT — 「人間ならではの価値」で最大差（+2点）</div>
<div class="cs-cb-body">DeepSeekは「将来の価値観転換」という構想を評価したのに対し、Claudeは「資料に確認できる創業者の物語性」の有無を評価しました。同じルーブリック項目の解釈が、AIの「評価思想」によって根本から異なることを示しています。</div>
</div><h3 id="cs-eco-bg">BGルーブリック比較</h3><div class="cs-tbl-wrap"><table class="cs-tbl"><thead><tr><th>評価基準</th><th class="c">配点</th><th class="c">DeepSeek</th><th class="c">Claude</th><th class="c">差</th></tr></thead><tbody><tr><td><strong>① 価値の革新性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">30%</td><td class="sv hi">4</td><td class="sv md">3</td><td class="sv d1">+1</td></tr><tr><td><strong>② 市場の潜在性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">20%</td><td class="sv top">5</td><td class="sv hi">4</td><td class="sv d1">+1</td></tr><tr><td><strong>③ 商業的実現可能性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">25%</td><td class="sv hi">4</td><td class="sv md">3</td><td class="sv d1">+1</td></tr><tr><td><strong>④ 技術的実現可能性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">25%</td><td class="sv top">5</td><td class="sv md">3</td><td class="sv d2">+2</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt"><span class="ds">DeepSeek：</span>IoT・UV殺菌・アプリ連携は既存技術の組み合わせで実用化ハードルは低いと満点評価。<br><span class="cl">Claude：</span>「特許出願中」の自動洗浄システムは未確定要素でコスト面の裏付けも薄いと判断。</div></td></tr><tr class="total-row"><td><strong>BGスコア（加重平均）</strong></td><td></td><td class="sv">4.45</td><td class="sv">3.20</td><td class="sv" style="color:rgb(248, 113, 113);font-size:16px;">1.25</td></tr></tbody></table></div>
<!-- SEC 04 越中八尾 --><div class="cs-div"><div class="cs-div-line"></div><div class="cs-div-num">SECTION 04</div><div class="cs-div-line"></div></div>
<h2 id="cs-yat">越中八尾ウェルネス・スマートビレッジ創生事業の評価結果</h2><h3 id="cs-yat-ag">AGルーブリック比較</h3><div class="cs-tbl-wrap"><table class="cs-tbl"><thead><tr><th>評価基準</th><th class="c">配点</th><th class="c">DeepSeek</th><th class="c">Claude</th><th class="c">差</th></tr></thead><tbody><tr><td><strong>① 根拠と検証</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">30%</td><td class="sv top">5</td><td class="sv md">3</td><td class="sv d2">+2</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt"><span class="ds">DeepSeek：</span>高齢化率・人口減少率・富山大医学部の倫理審査取得済みという根拠の豊富さを満点評価。<br><span class="cl">Claude：</span>PoC自体がこれから実施する提案段階であり、実地検証データが存在しないことを重視。</div></td></tr><tr><td><strong>② 発展可能性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">25%</td><td class="sv top">5</td><td class="sv lo">2</td><td class="sv d3">+3</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt"><span class="ds">DeepSeek：</span>PoC→野外能楽堂→フルビレッジ整備という二段階ロードマップ全体を「発展性」として満点評価。<br><span class="cl">Claude：</span>ロードマップは将来計画であり、過去の改善履歴・AI活用実績の開示という観点では情報が少ないと判断。</div></td></tr><tr><td><strong>③ 人間ならではの価値</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">20%</td><td class="sv top">5</td><td class="sv top">5</td><td class="sv zero">0</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt">両AI共通で満点：4市民（文化継承者・高齢住民・都市生活者・能楽愛好者）の困りごとから出発する構成。300年の伝統・担い手不足・認知症リスクという感情に訴える描写の深さを両AIが高く評価。</div></td></tr><tr><td><strong>④ 実行リスク</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">15%</td><td class="sv top">5</td><td class="sv hi">4</td><td class="sv d1">+1</td></tr><tr><td><strong>⑤ 社会的変革の度合い</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">10%</td><td class="sv top">5</td><td class="sv top">5</td><td class="sv zero">0</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt">両AI共通で満点：KGIとして「来訪者50%増」「移住100名」を明示。ユネスコ無形文化遺産という長期的・文化的インパクトの経路の明確さを評価。</div></td></tr><tr class="total-row"><td><strong>AGスコア（加重平均）</strong></td><td></td><td class="sv">5.00</td><td class="sv">3.40</td><td class="sv" style="color:rgb(248, 113, 113);font-size:18px;">1.60</td></tr></tbody></table></div>
<div class="cs-cb crit"><div class="cs-cb-lbl">CRITICAL FINDING — 最大差は「発展可能性」の +3点</div>
<div class="cs-cb-body">DeepSeek 5 vs Claude 2 という本レポート最大の開き。DeepSeekは「将来ロードマップ」を発展性の証拠と評価し、Claudeは「現在確認できる実績の有無」を基準にしました。<strong>「将来計画を評価するか／現在の実績を評価するか」——これがAI評価思想の根本的な分岐点です。</strong></div>
</div><h3 id="cs-yat-bg">BGルーブリック比較</h3><div class="cs-tbl-wrap"><table class="cs-tbl"><thead><tr><th>評価基準</th><th class="c">配点</th><th class="c">DeepSeek</th><th class="c">Claude</th><th class="c">差</th></tr></thead><tbody><tr><td><strong>① 価値の革新性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">30%</td><td class="sv top">5</td><td class="sv hi">4</td><td class="sv d1">+1</td></tr><tr><td><strong>② 市場の潜在性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">20%</td><td class="sv top">5</td><td class="sv hi">4</td><td class="sv d1">+1</td></tr><tr><td><strong>③ 商業的実現可能性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">25%</td><td class="sv hi">4</td><td class="sv md">3</td><td class="sv d1">+1</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt"><span class="ds">DeepSeek：</span>補助金450万円・PoC収益による収支均衡計画を「実現可能」と判断。<br><span class="cl">Claude：</span>本格展開（2〜10億円規模）の財源確保が「今後の申請頼み」であることを重視。</div></td></tr><tr><td><strong>④ 技術的実現可能性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">25%</td><td class="sv top">5</td><td class="sv top">5</td><td class="sv zero">0</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt">両AI共通で満点：ウェアラブル・IoTカメラ・SCRUM-T連携は全て既存技術の活用。富山市の既存インフラ（LPWA・SCRUM-T）を活用する設計で実現可能性が非常に高いと両AI一致。</div></td></tr><tr class="total-row"><td><strong>BGスコア（加重平均）</strong></td><td></td><td class="sv">4.75</td><td class="sv">3.90</td><td class="sv" style="color:rgb(248, 113, 113);font-size:16px;">0.85</td></tr></tbody></table></div>
<!-- SEC 05 総括 --><div class="cs-div"><div class="cs-div-line"></div><div class="cs-div-num">SECTION 05</div><div class="cs-div-line"></div></div>
<h2 id="cs-cmp">全スコアの総括</h2><div class="cs-spot-grid"><div class="cs-spot"><div class="cs-spot-lbl">EcoBottle Campus — AGスコア</div>
<div class="cs-spot-scores"><div class="cs-sc ds">3.75<span class="cs-sc-lbl">DeepSeek</span></div>
<div class="cs-sc cl">2.55<span class="cs-sc-lbl">Claude</span></div></div><div class="cs-diff lg">差 1.20点</div>
<div class="cs-spot-note">「人間ならではの価値」で+2点差。将来の共感性 vs 現在の物語性。</div></div><div class="cs-spot"><div class="cs-spot-lbl">EcoBottle Campus — BGスコア</div>
<div class="cs-spot-scores"><div class="cs-sc ds">4.45<span class="cs-sc-lbl">DeepSeek</span></div>
<div class="cs-sc cl">3.20<span class="cs-sc-lbl">Claude</span></div></div><div class="cs-diff lg">差 1.25点</div>
<div class="cs-spot-note">「技術的実現可能性」で+2点差。実用化ハードルの解釈が大きく異なる。</div></div><div class="cs-spot"><div class="cs-spot-lbl">越中八尾 — AGスコア（最大差）</div>
<div class="cs-spot-scores"><div class="cs-sc ds">5.00<span class="cs-sc-lbl">DeepSeek</span></div>
<div class="cs-sc cl">3.40<span class="cs-sc-lbl">Claude</span></div></div><div class="cs-diff lg">差 1.60点</div>
<div class="cs-spot-note">「発展可能性」で+3点差。本レポート最大の開き。</div></div><div class="cs-spot"><div class="cs-spot-lbl">越中八尾 — BGスコア</div>
<div class="cs-spot-scores"><div class="cs-sc ds">4.75<span class="cs-sc-lbl">DeepSeek</span></div>
<div class="cs-sc cl">3.90<span class="cs-sc-lbl">Claude</span></div></div><div class="cs-diff lg">差 0.85点</div>
<div class="cs-spot-note">BGは差が比較的小さい。技術的実現可能性では両AI一致（5点）。</div></div></div><!-- SEC 06 AI評価思想 --><div class="cs-div"><div class="cs-div-line"></div><div class="cs-div-num">SECTION 06</div><div class="cs-div-line"></div></div>
<h2 id="cs-thought">AI評価思想の比較分析</h2><p>スコアの差はAIの「能力差」ではなく<strong>「評価思想の差」</strong>です。DeepSeekとClaudeは高性能なLLMですが、事業計画の「何を」評価するかという判断が根本的に異なります。</p><div class="cs-ai-grid"><div class="cs-ai ds"><div class="cs-ai-name">DEEPSEEK</div>
<div class="cs-ai-type">ポテンシャル評価型</div><ul class="cs-ai-list"><li>将来の発展可能性・社会的ビジョンを積極評価</li><li>計画全体の構成・方向性の妥当性を重視</li><li>加点型——強みに注目して評価する傾向</li><li>ロードマップ・将来構想も「発展性の証拠」として評価</li></ul></div>
<div class="cs-ai cl"><div class="cs-ai-name">CLAUDE</div><div class="cs-ai-type">エビデンス評価型</div>
<ul class="cs-ai-list"><li>提出資料で客観的に確認できる実績・証拠を重視</li><li>実証されるまでは評価を保留する姿勢</li><li>減点型——不足点を指摘して評価する傾向</li><li>「将来計画」は実績として扱わない</li></ul></div>
</div><div class="cs-ctbl-wrap"><table class="cs-ctbl"><thead><tr><th>比較軸</th><th class="c">DeepSeek</th><th class="c">Claude</th></tr></thead><tbody><tr><td class="rh">評価姿勢</td><td class="c">将来性・ポテンシャルを重視</td><td class="c">現時点の証拠・実績を重視</td></tr><tr><td class="rh">採点方法</td><td class="c">加点型</td><td class="c">減点型</td></tr><tr><td class="rh">将来構想の扱い</td><td class="c">積極的に評価</td><td class="c">実証されるまで保留</td></tr><tr><td class="rh">適した用途</td><td class="c">事業の魅力・可能性の把握</td><td class="c">審査員視点の客観的評価</td></tr></tbody></table></div>
<div class="cs-cb warn"><div class="cs-cb-lbl">IMPLICATION</div><div class="cs-cb-body">どちらのAIが「正しい」かという問題ではありません。<strong>同一のルーブリックを使っても、AIモデルによってルーブリック項目の解釈が大きく異なる</strong>ことが問題です。「AIを使った客観的評価」を実現するためには、AIに採点させるだけでは不十分で、そのAIの評価思想そのものをコントロールする仕組みが必要です。</div>
</div><!-- SEC 07 SEGT --><div class="cs-div"><div class="cs-div-line"></div><div class="cs-div-num">SECTION 07</div><div class="cs-div-line"></div></div>
<h2 id="cs-segt">SEGT収束——バラつきを除去した評価標準 v* の生成</h2><p>本体験セミナーでは上記の実証に続き、eval000のSEGT収束計算を適用するライブデモを実施しました。3つのAIペルソナ審査員（実務派・革新派・バランス派）がBGルーブリックで採点した後、SEGT収束で Evaluation Standard v* を生成しました。</p><h3>BGルーブリック × 3ペルソナ → SEGT収束の実値</h3><div class="cs-bar-wrap"><div class="cs-bar-legend"><div class="cs-bar-leg"><div class="cs-bar-leg-dot" style="background:rgb(37, 99, 235);"></div>実務派（数値重視）</div>
<div class="cs-bar-leg"><div class="cs-bar-leg-dot" style="background:rgb(124, 58, 237);"></div>革新派（新規性重視）</div>
<div class="cs-bar-leg"><div class="cs-bar-leg-dot" style="background:rgb(8, 145, 178);"></div>バランス派（総合判断）</div>
<div class="cs-bar-leg"><div class="cs-bar-leg-dot" style="background:rgb(22, 101, 52);border-radius:50%;"></div>v*（SEGT収束後）</div>
</div><div class="cs-bar-sec">プランA（EcoBottle Campus）— バラつき：<span style="color:var(--red);font-weight:700;">11.0点</span></div>
<div class="cs-bar-row"><div class="cs-bar-name">実務派</div><div class="cs-bar-track"><div class="cs-bar-fill" style="width:73%;background:linear-gradient(90deg, rgb(37, 99, 235), rgb(59, 130, 246));"><span class="cs-bar-val">73.0</span></div></div></div>
<div class="cs-bar-row"><div class="cs-bar-name">革新派</div><div class="cs-bar-track"><div class="cs-bar-fill" style="width:84%;background:linear-gradient(90deg, rgb(124, 58, 237), rgb(139, 92, 246));"><span class="cs-bar-val">84.0</span></div></div></div>
<div class="cs-bar-row"><div class="cs-bar-name">バランス派</div><div class="cs-bar-track"><div class="cs-bar-fill" style="width:84%;background:linear-gradient(90deg, rgb(8, 145, 178), rgb(6, 182, 212));"><span class="cs-bar-val">84.0</span></div></div></div>
<div class="cs-bar-row"><div class="cs-bar-name" style="color:var(--royal);font-weight:700;">v*（収束後）</div><div class="cs-bar-track"><div class="cs-bar-fill" style="width:80.1%;background:linear-gradient(90deg, rgb(22, 101, 52), rgb(34, 197, 94));"><span class="cs-bar-val">80.1</span></div></div><div class="cs-bar-after">= Evaluation Standard</div></div>
<div class="cs-bar-sec">プランB（越中八尾ウェルネス・スマートビレッジ）— バラつき：<span style="color:var(--red);font-weight:700;">20.8点</span></div>
<div class="cs-bar-row"><div class="cs-bar-name">実務派</div><div class="cs-bar-track"><div class="cs-bar-fill" style="width:68.2%;background:linear-gradient(90deg, rgb(37, 99, 235), rgb(59, 130, 246));"><span class="cs-bar-val">68.2</span></div></div></div>
<div class="cs-bar-row"><div class="cs-bar-name">革新派</div><div class="cs-bar-track"><div class="cs-bar-fill" style="width:89%;background:linear-gradient(90deg, rgb(124, 58, 237), rgb(139, 92, 246));"><span class="cs-bar-val">89.0</span></div></div></div>
<div class="cs-bar-row"><div class="cs-bar-name">バランス派</div><div class="cs-bar-track"><div class="cs-bar-fill" style="width:84%;background:linear-gradient(90deg, rgb(8, 145, 178), rgb(6, 182, 212));"><span class="cs-bar-val">84.0</span></div></div></div>
<div class="cs-bar-row"><div class="cs-bar-name" style="color:var(--royal);font-weight:700;">v*（収束後）</div><div class="cs-bar-track"><div class="cs-bar-fill" style="width:80.3%;background:linear-gradient(90deg, rgb(22, 101, 52), rgb(34, 197, 94));"><span class="cs-bar-val">80.3</span></div></div><div class="cs-bar-after">= Evaluation Standard</div></div>
</div><div class="cs-segt"><div class="cs-segt-lbl">SEGT 収束の結果 — BGルーブリック × 3ペルソナ</div>
<div class="cs-segt-scores"><div class="cs-segt-score"><div class="cs-segt-num">80.1</div><div class="cs-segt-plan">v*（プランA / EcoBottle）</div></div>
<div class="cs-segt-eq">≈</div><div class="cs-segt-score"><div class="cs-segt-num">80.3</div><div class="cs-segt-plan">v*（プランB / 越中八尾）</div></div>
</div><div class="cs-segt-badge">v* の差：わずか 0.2点</div><div class="cs-segt-desc">バラつき最大20.8点 → SEGT収束後の差0.2点。外生の原理 N に対して、両プランがほぼ等しい評価標準値に収束しました。</div>
</div><div class="cs-cb good"><div class="cs-cb-lbl">WHAT v* MEANS</div><div class="cs-cb-body">v* の本質的価値は「数値の大小」ではなく<strong>「再現可能性」</strong>です。同じ外生の原理 N と Evaluation Rubric があれば、いつ・誰が評価しても同じ v* が生成されることが Banach の固定点定理により数学的に保証されています。DeepSeek が評価しても Claude が評価しても——N と R が同じであれば v* は常に同じ固定点に収束します。</div>
</div><!-- SEC 08 結論 --><div class="cs-div"><div class="cs-div-line"></div><div class="cs-div-num">CONCLUSION</div><div class="cs-div-line"></div></div>
<h2 id="cs-conc">結論</h2><h3>1. 同一ルーブリックでも AI によってスコアが最大 1.60点変わる</h3><p>越中八尾プランのAGスコアにおいて DeepSeek 5.00 vs Claude 3.40 という1.60点差が発生。これはAIの能力差ではなく、「将来計画を評価するか／現在の実績を評価するか」という<strong>評価思想の構造的な差</strong>に起因しています。</p><h3>2. 共通点は「事業の本質」への評価に現れる</h3><p>両AI一致または差が小さかった項目（「社会的変革の度合い」「人間ならではの価値」「技術的実現可能性」）はプランの本質的な価値に関わる軸です。AIが「正しく評価できる領域」は存在しますが、それは評価の一部にすぎません。</p><h3>3. eval000 SEGT収束は AI の評価思想の差を数学的に除去する</h3><p>複数のAIペルソナ審査員のスコアを SEGT 収束計算にかけることで、各AIが持つ固有の評価思想のバラつきを外生の原理 N のもとで除去し、再現可能な Evaluation Standard v* を生成します。</p><div class="cs-cb key"><div class="cs-cb-lbl">TAKEAWAY</div>
<div class="cs-cb-body">生成 AI は「評価を便利にした」が、「評価を正確にした」わけではありません。<strong>AI が持つ評価思想そのものをコントロールする仕組み——それが外生の原理 N × SEGT 収束によるメタ評価です。</strong></div>
</div><!-- Tags --><div class="cs-tag-row"><span class="cs-tag b">#評価バイアス</span><span class="cs-tag b">#生成AI評価</span><span class="cs-tag b">#SEGT収束</span><span class="cs-tag">#ビジネスコンテスト</span><span class="cs-tag">#DeepSeek</span><span class="cs-tag">#Claude</span><span class="cs-tag">#メタ評価</span><span class="cs-tag">#ルーブリック</span></div>
<!-- Author --><div class="cs-author"><div class="cs-author-av">e0</div><div><div class="cs-author-name">eval000 事務局（株式会社テンプロクシー）</div>
<div class="cs-author-role">特願 2026-096693 ／ Award Force 日本正規パートナー</div></div></div>
<!-- Footer --><div class="cs-footer"><p class="cs-footer-desc">本レポートで紹介した実証データは 2026 年 8 月 5 日の体験セミナーで取得した実値です。eval000 のメタ評価技術に関するご相談・デモのお申し込みはこちらから。</p><div class="cs-footer-links"><a href="https://www.eval000.ai/contact" class="cs-flink p">デモ・相談を申し込む →</a><a href="https://www.eval000.ai/metae-engine" class="cs-flink s">メタ評価エンジンの仕組みを見る →</a><a href="https://www.eval000.ai/service" class="cs-flink s">eval000 Essential →</a><a href="https://www.eval000.ai/blogs" class="cs-flink s">← ブログ一覧</a></div>
</div></div><!-- /cs-body --></div><!-- /cs --><script>
(function(){
  var bar = document.getElementById('cs-prog');
  if(!bar) return;
  window.addEventListener('scroll', function(){
    var h = document.documentElement;
    var pct = h.scrollTop / (h.scrollHeight - h.clientHeight);
    bar.style.transform = 'scaleX(' + Math.min(pct,1) + ')';
  }, {passive:true});
})();
</script></div>
</div></div></div></div></div></div> ]]></content:encoded><pubDate>Tue, 18 Aug 2026 06:45:06 +0900</pubDate></item><item><title><![CDATA[SEGT標準評価の事例]]></title><link>https://www.eval000.ai/blogs/post/casestudy</link><description><![CDATA[<img align="left" hspace="5" src="https://www.eval000.ai/sam4blog/casestudy.png"/>同じ審査員・同じ基準でも生成AIの評価は最大20.8点ブレる——8月5日の体験セミナー・ライブデモの実データをもとに、SEGT収束計算がそのブレを単一の標準評価V*にまとめた実例を解説します。 ]]></description><content:encoded><![CDATA[<div class="zpcontent-container blogpost-container "><div data-element-id="elm_kxTbAQIPRRe4aRTEBV205w" data-element-type="section" class="zpsection "><style type="text/css"></style><div class="zpcontainer-fluid zpcontainer"><div data-element-id="elm_Zuko-qVERymu8l2IbUiRSQ" data-element-type="row" class="zprow zprow-container zpalign-items- zpjustify-content- " data-equal-column=""><style type="text/css"></style><div data-element-id="elm_JbQAVruOTFqUbyPhpPuCLw" data-element-type="column" class="zpelem-col zpcol-12 zpcol-md-12 zpcol-sm-12 zpalign-self- "><style type="text/css"></style><div data-element-id="elm_DLbovp84W8jX-RiVY2ZdeA" data-element-type="text" class="zpelement zpelem-text "><style></style><div class="zptext zptext-align-left zptext-align-mobile-left zptext-align-tablet-left " data-editor="true"><p><span>同じ審査員・同じ基準でも生成AIの評価は最大20.8点ブレる——8月5日の体験セミナー・ライブデモの実データをもとに、SEGT収束計算がそのブレを単一の標準評価V*にまとめた実例を解説します。</span></p></div>
</div><div data-element-id="elm_e9RDLlISQ9s1-ihFEKmiYA" data-element-type="codeSnippet" class="zpelement zpelem-codesnippet "><div class="zpsnippet-container"><!DOCTYPE html><html lang="ja"><meta charset="UTF-8"><meta name="viewport" content="width=device-width, initial-scale=1.0"><title>同じ審査員・同じ基準でも評価は20.8点ブレる ── eval000ライブデモが見せた「SEGT収束」 | eval000.ai Blog</title><meta name="description" content="2026年8月5日のeval000体験セミナー・ライブデモの実データをもとに、生成AIの評価がなぜバラつくのか、そのバラつきをSEGT収束計算がどのように単一の標準評価V*へ収束させるのかを解説します。"><link href="https://fonts.googleapis.com/css2?family=Shippori+Mincho+B1:wght@400;600;700;800&family=Zen+Kaku+Gothic+New:wght@300;400;500;700&family=DM+Mono:wght@300;400;500&display=swap" rel="stylesheet"><style> :root { --primary:#0070c9;--primary-lt:#3a9fe8;--primary-pale:#a8d4f5; --primary-dim:rgba(0,112,201,.16);--primary-bg:rgba(0,112,201,.06);--primary-bd:rgba(0,112,201,.25); --teal:#00a898;--teal-lt:#00d4c2;--teal-bg:rgba(0,168,152,.08);--teal-bd:rgba(0,168,152,.3); --void:#050e1a;--ink:#0f1c2e;--coal:#1a2d42;--paper:#ffffff;--bg:#f5f9fd; --muted:#5a7080;--faint:#a0bdd0;--border:#d8e8f4;--border2:#c2d8ec; --amber:#b06800;--am-bg:rgba(176,104,0,.08);--am-bd:rgba(176,104,0,.28); } *,*::before,*::after{box-sizing:border-box;margin:0;padding:0;} html{scroll-behavior:smooth;} body{background:var(--bg);color:var(--ink);font-family:'Zen Kaku Gothic New',sans-serif;font-size:16px;line-height:1.85;overflow-x:hidden;} [data-i18n]{transition:opacity .25s ease;} body.lang-switching [data-i18n]{opacity:0;} .lang-toggle{display:flex;align-items:center;border:1px solid var(--border2);overflow:hidden;flex-shrink:0;} .lang-btn{padding:.3rem .7rem;font-family:'DM Mono',monospace;font-size:.58rem;font-weight:500;letter-spacing:.12em;border:none;background:transparent;color:var(--faint);cursor:pointer;line-height:1;} .lang-btn.active{background:var(--primary);color:#fff;} .lang-divider{width:1px;height:20px;background:var(--border2);flex-shrink:0;} .rv{opacity:0;transform:translateY(16px);transition:opacity .6s ease,transform .6s ease;} .rv.in{opacity:1;transform:translateY(0);} .con{max-width:1200px;margin:0 auto;padding:0 3rem;} /* HEADER */ .news-header{background:linear-gradient(135deg,#3a9fe8 0%,#00d4c2 100%);position:relative;overflow:hidden;padding:4.4rem 0 3.6rem;} .news-grid{position:absolute;inset:0;background-image:linear-gradient(rgba(255,255,255,.08) 1px,transparent 1px),linear-gradient(90deg,rgba(255,255,255,.08) 1px,transparent 1px);background-size:60px 60px;} .news-glow{position:absolute;inset:0;background:radial-gradient(ellipse 55% 50% at 50% 40%,rgba(255,255,255,.3) 0%,transparent 65%);} .news-inner{position:relative;z-index:2;} .news-tags{display:flex;gap:.6rem;flex-wrap:wrap;align-items:center;margin-bottom:1.5rem;font-family:'DM Mono',monospace;font-size:.62rem;letter-spacing:.05em;} .news-tags .pill{background:rgba(255,255,255,.55);color:var(--coal);border:1px solid rgba(255,255,255,.75);padding:.22rem .75rem;} .news-tags .pill.b{background:rgba(255,255,255,.92);color:var(--coal);border-color:rgba(255,255,255,.95);} .news-tags .date{color:rgba(255,255,255,.78);} .date-chip{display:inline-flex;align-items:center;gap:.7rem;padding:.5rem 1.1rem;border:1px solid rgba(255,255,255,.55);background:rgba(255,255,255,.18);margin-bottom:1.8rem;} .date-chip .dot{width:6px;height:6px;border-radius:50%;background:#ffffff;animation:blink 2.2s ease-in-out infinite;} .date-chip span{font-family:'DM Mono',monospace;font-size:.62rem;letter-spacing:.18em;text-transform:uppercase;color:#ffffff;} @keyframes blink{0%,100%{opacity:1;}50%{opacity:.15;}} .news-title{font-family:'Shippori Mincho B1',serif;font-size:clamp(1.5rem,3vw,2.15rem);font-weight:800;color:#fff;line-height:1.55;margin-bottom:1.3rem;} .news-title .accent{color:var(--coal);} .news-lead{font-size:.95rem;color:rgba(255,255,255,.88);line-height:2;max-width:600px;} /* metric strip (replaces countdown strip) */ .metric-strip{margin-top:2.2rem;display:flex;background:rgba(255,255,255,.24);border:1px solid rgba(255,255,255,.45);} .metric-item{flex:1;padding:1rem 1rem;text-align:center;} .metric-item+.metric-item{border-left:1px solid rgba(255,255,255,.45);} .metric-num{font-family:'Shippori Mincho B1',serif;font-size:1.3rem;font-weight:800;color:var(--coal);white-space:nowrap;} .metric-num .arrow{color:rgba(255,255,255,.35);font-weight:400;margin:0 .15rem;} .metric-lbl{font-family:'DM Mono',monospace;font-size:.54rem;letter-spacing:.04em;color:rgba(10,30,50,.75);margin-top:.5rem;line-height:1.6;} /* SECTION */ .post-sec{padding:3rem 0;border-bottom:1px solid var(--border);background:var(--paper);} .post-sec:last-of-type{border-bottom:none;} .post-sec.alt{background:var(--bg);} .sec-eyebrow{font-family:'DM Mono',monospace;font-size:.6rem;letter-spacing:.25em;text-transform:uppercase;color:var(--primary);margin-bottom:.7rem;display:flex;align-items:center;gap:.6rem;} .sec-eyebrow::before{content:'';width:20px;height:1px;background:var(--primary);opacity:.5;} .post-sec h2{font-family:'Shippori Mincho B1',serif;font-size:clamp(1.25rem,2.1vw,1.6rem);font-weight:700;line-height:1.5;margin-bottom:1.1rem;color:var(--coal);} .post-sec p{font-size:.9rem;color:var(--muted);line-height:2;margin-bottom:1.1rem;} .post-sec p:last-child{margin-bottom:0;} .post-sec h4{font-size:.82rem;font-weight:700;color:var(--coal);margin:1.4rem 0 .6rem;} /* inline links to source plans / rubric */ .post-sec a{color:var(--primary);text-decoration:underline;text-decoration-color:var(--primary-bd);text-decoration-thickness:1px;text-underline-offset:2px;} .post-sec a:hover{color:var(--primary-lt);} .converge-after a{color:#fff;text-decoration-color:rgba(255,255,255,.5);} .converge-after a:hover{color:var(--teal-lt);} .compare-box .cx-name a{color:var(--coal);text-decoration-color:var(--border2);} .compare-box .cx-name a:hover{color:var(--primary);} /* persona intro cards */ .persona-grid{display:grid;grid-template-columns:1fr 1fr 1fr;gap:.8rem;margin:1.3rem 0;} .persona-card{background:var(--bg);border:1px solid var(--border);padding:.9rem .9rem;} .persona-card .pc-role{font-family:'DM Mono',monospace;font-size:.54rem;letter-spacing:.08em;color:var(--primary);text-transform:uppercase;margin-bottom:.35rem;} .persona-card .pc-name{font-size:.82rem;font-weight:700;color:var(--coal);margin-bottom:.4rem;} .persona-card .pc-d{font-size:.72rem;color:var(--muted);line-height:1.7;} /* score table */ .score-table{width:100%;border-collapse:collapse;margin:1.2rem 0;font-size:.76rem;} .score-table caption{text-align:left;font-family:'DM Mono',monospace;font-size:.58rem;letter-spacing:.06em;color:var(--muted);text-transform:uppercase;margin-bottom:.5rem;caption-side:top;} .score-table th,.score-table td{border:1px solid var(--border);padding:.5rem .55rem;text-align:center;} .score-table thead th{background:var(--coal);color:#fff;font-weight:700;font-size:.68rem;} .score-table td.axis{text-align:left;color:var(--muted);} .score-table tbody tr:nth-child(even){background:var(--bg);} .score-table tr.total td{font-weight:700;color:var(--coal);background:var(--primary-bg) !important;} .score-table td.num{font-family:'DM Mono',monospace;} /* convergence visual */ .converge-wrap{display:grid;grid-template-columns:1fr auto 1fr;gap:1rem;align-items:center;margin:1.6rem 0;} .converge-before{background:var(--bg);border:1px solid var(--border);padding:1.1rem 1.2rem;} .converge-before .cb-title{font-family:'DM Mono',monospace;font-size:.56rem;letter-spacing:.08em;color:var(--muted);margin-bottom:.7rem;text-transform:uppercase;} .converge-before .cb-row{display:flex;justify-content:space-between;align-items:baseline;font-size:.8rem;padding:.32rem 0;border-bottom:1px dashed var(--border2);color:var(--coal);} .converge-before .cb-row:last-child{border-bottom:none;} .converge-before .cb-row .cb-num{font-family:'DM Mono',monospace;font-weight:700;} .converge-before .cb-gap{margin-top:.6rem;font-family:'DM Mono',monospace;font-size:.62rem;color:var(--amber);text-align:right;} .converge-arrow{font-size:1.5rem;color:var(--primary);text-align:center;line-height:1;} .converge-after{background:linear-gradient(135deg,var(--primary),var(--coal));padding:1.3rem 1.1rem;text-align:center;color:#fff;} .converge-after .ca-lbl{font-family:'DM Mono',monospace;font-size:.54rem;letter-spacing:.1em;color:var(--teal-lt);text-transform:uppercase;margin-bottom:.55rem;} .converge-after .ca-num{font-family:'Shippori Mincho B1',serif;font-size:1.85rem;font-weight:800;} .converge-after .ca-sub{font-size:.62rem;color:rgba(255,255,255,.55);margin-top:.4rem;} @media(max-width:640px){ .converge-wrap{grid-template-columns:1fr;} .converge-arrow{transform:rotate(90deg);padding:.2rem 0;} } /* two-plan compare */ .compare-grid{display:grid;grid-template-columns:1fr auto 1fr;gap:.9rem;align-items:center;margin:1.3rem 0;} .compare-box{background:var(--paper);border:1px solid var(--border);border-top:3px solid var(--primary);padding:1rem 1rem;text-align:center;} .compare-box.tl{border-top-color:var(--teal);} .compare-box .cx-name{font-size:.76rem;color:var(--muted);margin-bottom:.45rem;} .compare-box .cx-num{font-family:'Shippori Mincho B1',serif;font-size:1.55rem;font-weight:800;color:var(--coal);} .compare-box .cx-sub{font-family:'DM Mono',monospace;font-size:.56rem;color:var(--muted);margin-top:.35rem;} .compare-vs{font-family:'DM Mono',monospace;font-size:.68rem;color:var(--faint);} .diff-note{text-align:center;font-family:'DM Mono',monospace;font-size:.68rem;color:var(--teal);letter-spacing:.03em;margin-top:-.2rem;} @media(max-width:640px){ .compare-grid{grid-template-columns:1fr;} .compare-vs{display:none;} } /* callout box for the scope correction */ .note-box{margin:1.4rem 0;padding:1.1rem 1.2rem;background:var(--am-bg);border:1px solid var(--am-bd);border-left:3px solid var(--amber);} .note-box .nb-lbl{font-family:'DM Mono',monospace;font-size:.56rem;letter-spacing:.1em;color:var(--amber);text-transform:uppercase;margin-bottom:.5rem;} .note-box p{font-size:.82rem;color:var(--coal);line-height:1.9;margin-bottom:0;} /* mini value cards */ .mini-grid{display:grid;grid-template-columns:1fr 1fr 1fr;gap:1rem;margin:1.4rem 0;} .mini-card{background:var(--bg);border:1px solid var(--border);border-top:3px solid var(--primary);padding:1.2rem 1.1rem;} .mini-card.tl{border-top-color:var(--teal);} .mini-card .mc-lbl{font-family:'DM Mono',monospace;font-size:.5rem;letter-spacing:.12em;text-transform:uppercase;color:var(--primary);margin-bottom:.4rem;} .mini-card.tl .mc-lbl{color:var(--teal);} .mini-card .mc-t{font-size:.82rem;font-weight:700;color:var(--coal);margin-bottom:.4rem;line-height:1.5;} .mini-card .mc-d{font-size:.75rem;color:var(--muted);line-height:1.7;} /* roadmap list */ .road-list{margin:1.2rem 0;} .road-item{display:flex;gap:.9rem;padding:.85rem 0;border-bottom:1px solid var(--border);} .road-item:last-child{border-bottom:none;} .road-num{font-family:'DM Mono',monospace;font-size:.72rem;font-weight:700;color:var(--primary);flex-shrink:0;width:1.4rem;} .road-t{font-size:.84rem;font-weight:700;color:var(--coal);margin-bottom:.25rem;} .road-d{font-size:.78rem;color:var(--muted);line-height:1.8;} /* CTA */ .cta-box{margin-top:1.6rem;background:linear-gradient(135deg,var(--primary),var(--coal));padding:2.2rem 2rem;text-align:center;} .cta-box .ct-tag{font-family:'DM Mono',monospace;font-size:.6rem;letter-spacing:.18em;text-transform:uppercase;color:var(--teal-lt);margin-bottom:.6rem;} .cta-box h3{font-family:'Shippori Mincho B1',serif;font-size:1.05rem;font-weight:700;color:#fff;margin-bottom:.5rem;} .cta-box p{font-size:.82rem;color:rgba(255,255,255,.6);margin-bottom:1.2rem;} .cta-box a.btn{display:inline-block;padding:.75rem 1.6rem;background:#fff;color:var(--primary);font-weight:700;font-size:.84rem;text-decoration:none;} .author-box{margin-top:2.2rem;padding-top:1.8rem;border-top:1px solid var(--border);display:flex;gap:1.1rem;align-items:flex-start;} .author-avatar{width:40px;height:40px;border-radius:50%;background:var(--primary);color:#fff;display:flex;align-items:center;justify-content:center;font-family:'Shippori Mincho B1',serif;font-weight:700;flex-shrink:0;font-size:.85rem;} .author-name{font-size:.82rem;font-weight:700;color:var(--coal);margin-bottom:.2rem;} .author-role{font-family:'DM Mono',monospace;font-size:.6rem;color:var(--primary);margin-bottom:.5rem;} .author-bio{font-size:.76rem;color:var(--muted);line-height:1.8;} footer{background:var(--ink);padding:2rem 3rem;display:flex;align-items:center;justify-content:space-between;} .footer-l{font-family:'DM Mono',monospace;font-size:.65rem;color:rgba(255,255,255,.28);display:flex;align-items:center;gap:.6rem;} .footer-brand{color:var(--primary-lt);opacity:.8;letter-spacing:.08em;} .footer-r{font-family:'DM Mono',monospace;font-size:.52rem;color:rgba(255,255,255,.2);text-align:right;line-height:1.9;} @media(max-width:760px){ .con{padding:0 1.5rem;} .mini-grid{grid-template-columns:1fr;} .persona-grid{grid-template-columns:1fr;} .metric-strip{flex-direction:column;} .metric-item+.metric-item{border-left:none;border-top:1px solid rgba(255,255,255,.45);} footer{flex-direction:column;gap:.8rem;text-align:center;} .footer-r{text-align:center;} .score-table{font-size:.66rem;} .score-table th,.score-table td{padding:.35rem .3rem;} } </style><div id="e0langbar" style="background:rgba(255, 255, 255, 0.97);border-bottom:1px solid var(--border);padding:0.55rem 3rem;display:flex;justify-content:flex-end;align-items:center;"><div class="lang-toggle"><button class="lang-btn active" id="btn-ja" data-lang="ja">JPN</button><div class="lang-divider"></div>
<button class="lang-btn" id="btn-en" data-lang="en">EN</button></div></div><header class="news-header"><div class="news-grid"></div><div class="news-glow"></div>
<div class="con news-inner"><div class="news-tags"><span class="pill b" data-i18n data-ja="ケーススタディ" data-en="Case Study">ケーススタディ</span><span class="pill" data-i18n data-ja="SEGT収束" data-en="SEGT Convergence">SEGT収束</span><span class="date">2026年8月8日</span></div>
<div class="date-chip rv"><div class="dot"></div><span data-i18n data-ja="2026年8月5日 体験セミナー・ライブデモより" data-en="From the live demo at the Aug 5, 2026 seminar">2026年8月5日 体験セミナー・ライブデモより</span></div>
<h1 class="news-title"><span data-i18n data-ja="同じ審査員・同じ基準で採点しても、生成AIの評価は20.8点ブレる。" data-en="Same judges, same criteria — yet generative-AI scores can drift by 20.8 points.">同じ審査員・同じ基準で採点しても、生成AIの評価は20.8点ブレる。</span><br><span class="accent" data-i18n data-ja="eval000のSEGT収束計算が、そのブレを1つの標準評価にまとめた実例。" data-en="Here's a real example of eval000's SEGT convergence turning that drift into a single standard evaluation.">eval000のSEGT収束計算が、そのブレを1つの標準評価にまとめた実例。</span></h1><p class="news-lead" data-i18n data-ja="2026年8月5日開催のeval000体験セミナー・ライブデモでは、同じ事業計画・同じ評価ルーブリック・同じ外生の原理Nのもとで、3種類のAIペルソナ審査員に採点してもらいました。結果は最大20.8点のブレ。ここにSEGT（標準評価生成理論）の収束計算を適用したところ、ブレは単一の標準評価値 V* に収束しました。本記事ではこのライブデモの実データをもとに、生成AIの評価がなぜバラつくのか、SEGTがそのブレをどう解消するのかを解説します。" data-en="At the eval000 hands-on seminar held on August 5, 2026, three different AI persona judges scored the same business plan under the same evaluation rubric and the same External Principle N. The result: a gap of up to 20.8 points between judges. Applying eval000's SEGT (Standard Evaluation Generation Theory) convergence calculation collapsed that gap into a single standard evaluation value, V*. Using the real data from this live demo, this post explains why generative-AI evaluation varies so much — and how SEGT resolves that variance.">2026年8月5日開催のeval000体験セミナー・ライブデモでは、同じ事業計画・同じ評価ルーブリック・同じ外生の原理Nのもとで、3種類のAIペルソナ審査員に採点してもらいました。結果は最大20.8点のブレ。ここにSEGT（標準評価生成理論）の収束計算を適用したところ、ブレは単一の標準評価値 V* に収束しました。本記事ではこのライブデモの実データをもとに、生成AIの評価がなぜバラつくのか、SEGTがそのブレをどう解消するのかを解説します。</p><div class="metric-strip rv"><div class="metric-item"><div class="metric-num">20.8<span style="font-size:0.8rem;">点</span></div>
<div class="metric-lbl" data-i18n data-ja="3ペルソナ間の評価差<br>（越中八尾プラン）" data-en="Gap between 3 AI judges<br>(Ecchu-Yao plan)">3ペルソナ間の評価差<br>（越中八尾プラン）</div>
</div><div class="metric-item"><div class="metric-num">80.3<span style="font-size:0.8rem;">点</span></div>
<div class="metric-lbl" data-i18n data-ja="SEGT収束後の<br>標準評価 V*" data-en="Standard evaluation V*<br>after SEGT convergence">SEGT収束後の<br>標準評価 V*</div>
</div><div class="metric-item"><div class="metric-num">0.2<span style="font-size:0.8rem;">点</span></div>
<div class="metric-lbl" data-i18n data-ja="2つの事業計画の<br>V*同士の差" data-en="Gap between the two<br>plans' V* values">2つの事業計画の<br>V*同士の差</div>
</div></div></div></header><!-- 01 ライブデモの実データ --><section class="post-sec alt"><div class="con"><div class="sec-eyebrow">01 &mdash; <span data-i18n data-ja="ライブデモの実データ" data-en="Live Demo Data">ライブデモの実データ</span></div>
<h2 data-i18n data-ja="同じ審査員・同じ基準で採点しても、スコアは大きくバラつく" data-en="Same judges, same criteria — yet the scores vary widely">同じ審査員・同じ基準で採点しても、スコアは大きくバラつく</h2><p data-i18n data-ja="今回のデモでは、地域活性化に関する2つの事業計画（「<a href='https://www.award-of.net/Yatsuo_2026PoC_v4_1.html' target='_blank' rel='noopener'>越中八尾</a>」「<a href='https://ecobottle-campus--xp34hiw.gamma.site/' target='_blank' rel='noopener'>EcoBottle</a>」）を対象に、外生の原理N（審査の目的）と<a href='https://www.award-of.net/files/rubric4bizBG.html' target='_blank' rel='noopener'>Evaluation Rubric（BGルーブリック・4軸）</a>を固定したまま、3種類のAIペルソナ審査員に評価してもらいました。" data-en="The demo evaluated two regional-revitalization business plans (&quot;<a href='https://www.award-of.net/Yatsuo_2026PoC_v4_1.html' target='_blank' rel='noopener'>Ecchu-Yao</a>&quot; and &quot;<a href='https://ecobottle-campus--xp34hiw.gamma.site/' target='_blank' rel='noopener'>EcoBottle</a>&quot;). External Principle N (the review's purpose) and the <a href='https://www.award-of.net/files/rubric4bizBG.html' target='_blank' rel='noopener'>Evaluation Rubric (the 4-axis &quot;BG&quot; rubric)</a> were held fixed, while three different AI persona judges scored each plan.">今回のデモでは、地域活性化に関する2つの事業計画（「<a href="https://www.award-of.net/Yatsuo_2026PoC_v4_1.html" target="_blank" rel="noopener">越中八尾</a>」「<a href="https://ecobottle-campus--xp34hiw.gamma.site/" target="_blank" rel="noopener">EcoBottle</a>」）を対象に、外生の原理N（審査の目的）と<a href="https://www.award-of.net/files/rubric4bizBG.html" target="_blank" rel="noopener">Evaluation Rubric（BGルーブリック・4軸）</a>を固定したまま、3種類のAIペルソナ審査員に評価してもらいました。</p><div class="persona-grid rv"><div class="persona-card"><div class="pc-role" data-i18n data-ja="ペルソナ 1" data-en="PERSONA 1">ペルソナ 1</div>
<div class="pc-name" data-i18n data-ja="革新派（新興スタートアップ投資家）" data-en="The Innovator (early-stage VC)">革新派（新興スタートアップ投資家）</div>
<div class="pc-d" data-i18n data-ja="新規性・独創性・先駆性を最重視。「これは世界初か？」が口癖。" data-en="Prioritizes novelty and originality above all. Signature question: &quot;Is this a world first?&quot;">新規性・独創性・先駆性を最重視。「これは世界初か？」が口癖。</div>
</div><div class="persona-card"><div class="pc-role" data-i18n data-ja="ペルソナ 2" data-en="PERSONA 2">ペルソナ 2</div>
<div class="pc-name" data-i18n data-ja="実務派（大手メーカー事業開発部長）" data-en="The Pragmatist (corporate biz-dev lead)">実務派（大手メーカー事業開発部長）</div>
<div class="pc-d" data-i18n data-ja="実績・数値根拠・実行可能性を最重視。「根拠データはあるか？」が口癖。" data-en="Prioritizes track record and hard numbers. Signature question: &quot;Where's the supporting data?&quot;">実績・数値根拠・実行可能性を最重視。「根拠データはあるか？」が口癖。</div>
</div><div class="persona-card"><div class="pc-role" data-i18n data-ja="ペルソナ 3" data-en="PERSONA 3">ペルソナ 3</div>
<div class="pc-name" data-i18n data-ja="バランス派（行政系支援機関の審査委員）" data-en="The Balancer (public-sector reviewer)">バランス派（行政系支援機関の審査委員）</div>
<div class="pc-d" data-i18n data-ja="全評価軸を均等に重視。偏りを嫌い公正さを優先。「総合的に見ると」が口癖。" data-en="Weighs every axis equally, favoring fairness over emphasis. Signature phrase: &quot;Looking at this holistically...&quot;">全評価軸を均等に重視。偏りを嫌い公正さを優先。「総合的に見ると」が口癖。</div>
</div></div><table class="score-table rv"><caption data-i18n data-ja="プランA「<a href='https://www.award-of.net/Yatsuo_2026PoC_v4_1.html' target='_blank' rel='noopener'>越中八尾</a>」／<a href='https://www.award-of.net/files/rubric4bizBG.html' target='_blank' rel='noopener'>BGルーブリック</a>・実値" data-en="Plan A &quot;<a href='https://www.award-of.net/Yatsuo_2026PoC_v4_1.html' target='_blank' rel='noopener'>Ecchu-Yao</a>&quot; / <a href='https://www.award-of.net/files/rubric4bizBG.html' target='_blank' rel='noopener'>BG Rubric</a>, actual scores">プランA「<a href="https://www.award-of.net/Yatsuo_2026PoC_v4_1.html" target="_blank" rel="noopener">越中八尾</a>」／<a href="https://www.award-of.net/files/rubric4bizBG.html" target="_blank" rel="noopener">BGルーブリック</a>・実値</caption><thead><tr><th data-i18n data-ja="評価軸" data-en="Axis">評価軸</th><th data-i18n data-ja="実務派" data-en="Pragmatist">実務派</th><th data-i18n data-ja="革新派" data-en="Innovator">革新派</th><th data-i18n data-ja="バランス派" data-en="Balancer">バランス派</th><th data-i18n data-ja="平均" data-en="Average">平均</th></tr></thead><tbody><tr><td class="axis" data-i18n data-ja="バリューイノベーション (30%)" data-en="Value Innovation (30%)">バリューイノベーション (30%)</td><td class="num">60.0</td><td class="num">90.0</td><td class="num">83.3</td><td class="num">77.8</td></tr><tr><td class="axis" data-i18n data-ja="市場の可能性 (20%)" data-en="Market Potential (20%)">市場の可能性 (20%)</td><td class="num">70.0</td><td class="num">85.0</td><td class="num">80.0</td><td class="num">78.3</td></tr><tr><td class="axis" data-i18n data-ja="商業的実行可能性 (25%)" data-en="Commercial Feasibility (25%)">商業的実行可能性 (25%)</td><td class="num">65.0</td><td class="num">88.0</td><td class="num">84.0</td><td class="num">79.0</td></tr><tr><td class="axis" data-i18n data-ja="技術的実現可能性 (25%)" data-en="Technical Feasibility (25%)">技術的実現可能性 (25%)</td><td class="num">80.0</td><td class="num">92.0</td><td class="num">88.0</td><td class="num">86.7</td></tr><tr class="total"><td class="axis" data-i18n data-ja="加重合計" data-en="Weighted Total">加重合計</td><td class="num">68.2</td><td class="num">89.0</td><td class="num">84.0</td><td class="num">80.4</td></tr></tbody></table><p data-i18n data-ja="加重合計は実務派68.2点、バランス派84.0点、革新派89.0点。同じ計画・同じ基準にもかかわらず、審査員の視点によって20.8点もの差が生まれました。3者を単純に平均すると80.4点になりますが、これは「多数決」であり「標準化」ではありません。" data-en="The weighted totals were 68.2 (Pragmatist), 84.0 (Balancer), and 89.0 (Innovator) — a 20.8-point gap for the same plan under the same criteria, driven purely by each judge's perspective. A simple average of the three comes to 80.4, but that's a majority vote, not a standard.">加重合計は実務派68.2点、バランス派84.0点、革新派89.0点。同じ計画・同じ基準にもかかわらず、審査員の視点によって20.8点もの差が生まれました。3者を単純に平均すると80.4点になりますが、これは「多数決」であり「標準化」ではありません。</p><div class="converge-wrap rv"><div class="converge-before"><div class="cb-title" data-i18n data-ja="収束前（<a href='https://www.award-of.net/Yatsuo_2026PoC_v4_1.html' target='_blank' rel='noopener'>越中八尾</a>／3ペルソナの加重合計）" data-en="Before convergence (<a href='https://www.award-of.net/Yatsuo_2026PoC_v4_1.html' target='_blank' rel='noopener'>Ecchu-Yao</a> / weighted totals)">収束前（<a href="https://www.award-of.net/Yatsuo_2026PoC_v4_1.html" target="_blank" rel="noopener">越中八尾</a>／3ペルソナの加重合計）</div>
<div class="cb-row"><span data-i18n data-ja="実務派" data-en="Pragmatist">実務派</span><span class="cb-num">68.2</span></div>
<div class="cb-row"><span data-i18n data-ja="バランス派" data-en="Balancer">バランス派</span><span class="cb-num">84.0</span></div>
<div class="cb-row"><span data-i18n data-ja="革新派" data-en="Innovator">革新派</span><span class="cb-num">89.0</span></div>
<div class="cb-gap" data-i18n data-ja="差 20.8点" data-en="Gap: 20.8 pts">差 20.8点</div>
</div><div class="converge-arrow">→</div><div class="converge-after"><div class="ca-lbl" data-i18n data-ja="SEGT収束後" data-en="After SEGT convergence">SEGT収束後</div>
<div class="ca-num">80.3<span style="font-size:1rem;">点</span></div><div class="ca-sub" data-i18n data-ja="標準評価 V*（<a href='https://www.award-of.net/Yatsuo_2026PoC_v4_1.html' target='_blank' rel='noopener'>越中八尾</a>）" data-en="Standard evaluation V* (<a href='https://www.award-of.net/Yatsuo_2026PoC_v4_1.html' target='_blank' rel='noopener'>Ecchu-Yao</a>)">標準評価 V*（<a href="https://www.award-of.net/Yatsuo_2026PoC_v4_1.html" target="_blank" rel="noopener">越中八尾</a>）</div>
</div></div><table class="score-table rv"><caption data-i18n data-ja="プランB「<a href='https://ecobottle-campus--xp34hiw.gamma.site/' target='_blank' rel='noopener'>EcoBottle</a>」／<a href='https://www.award-of.net/files/rubric4bizBG.html' target='_blank' rel='noopener'>BGルーブリック</a>・実値" data-en="Plan B &quot;<a href='https://ecobottle-campus--xp34hiw.gamma.site/' target='_blank' rel='noopener'>EcoBottle</a>&quot; / <a href='https://www.award-of.net/files/rubric4bizBG.html' target='_blank' rel='noopener'>BG Rubric</a>, actual scores">プランB「<a href="https://ecobottle-campus--xp34hiw.gamma.site/" target="_blank" rel="noopener">EcoBottle</a>」／<a href="https://www.award-of.net/files/rubric4bizBG.html" target="_blank" rel="noopener">BGルーブリック</a>・実値</caption><thead><tr><th data-i18n data-ja="評価軸" data-en="Axis">評価軸</th><th data-i18n data-ja="実務派" data-en="Pragmatist">実務派</th><th data-i18n data-ja="革新派" data-en="Innovator">革新派</th><th data-i18n data-ja="バランス派" data-en="Balancer">バランス派</th><th data-i18n data-ja="平均" data-en="Average">平均</th></tr></thead><tbody><tr><td class="axis" data-i18n data-ja="バリューイノベーション (30%)" data-en="Value Innovation (30%)">バリューイノベーション (30%)</td><td class="num">70.0</td><td class="num">83.3</td><td class="num">83.3</td><td class="num">78.9</td></tr><tr><td class="axis" data-i18n data-ja="市場の可能性 (20%)" data-en="Market Potential (20%)">市場の可能性 (20%)</td><td class="num">75.0</td><td class="num">80.0</td><td class="num">80.0</td><td class="num">78.3</td></tr><tr><td class="axis" data-i18n data-ja="商業的実行可能性 (25%)" data-en="Commercial Feasibility (25%)">商業的実行可能性 (25%)</td><td class="num">68.0</td><td class="num">84.0</td><td class="num">88.0</td><td class="num">80.0</td></tr><tr><td class="axis" data-i18n data-ja="技術的実現可能性 (25%)" data-en="Technical Feasibility (25%)">技術的実現可能性 (25%)</td><td class="num">80.0</td><td class="num">88.0</td><td class="num">84.0</td><td class="num">84.0</td></tr><tr class="total"><td class="axis" data-i18n data-ja="加重合計" data-en="Weighted Total">加重合計</td><td class="num">73.0</td><td class="num">84.0</td><td class="num">84.0</td><td class="num">80.3</td></tr></tbody></table><p data-i18n data-ja="EcoBottleでも同様に3ペルソナの評価がバラつきました。加重合計は実務派73.0点、バランス派・革新派がともに84.0点で、差は11.0点。越中八尾よりは小さいものの、単純平均（80.3点）はやはり「多数決」にすぎません。" data-en="EcoBottle showed the same pattern. The weighted totals were 73.0 (Pragmatist) and 84.0 for both the Balancer and the Innovator — an 11.0-point gap. Smaller than Ecchu-Yao's, but the simple average (80.3) is still just a majority vote.">EcoBottleでも同様に3ペルソナの評価がバラつきました。加重合計は実務派73.0点、バランス派・革新派がともに84.0点で、差は11.0点。越中八尾よりは小さいものの、単純平均（80.3点）はやはり「多数決」にすぎません。</p><div class="converge-wrap rv"><div class="converge-before"><div class="cb-title" data-i18n data-ja="収束前（<a href='https://ecobottle-campus--xp34hiw.gamma.site/' target='_blank' rel='noopener'>EcoBottle</a>／3ペルソナの加重合計）" data-en="Before convergence (<a href='https://ecobottle-campus--xp34hiw.gamma.site/' target='_blank' rel='noopener'>EcoBottle</a> / weighted totals)">収束前（<a href="https://ecobottle-campus--xp34hiw.gamma.site/" target="_blank" rel="noopener">EcoBottle</a>／3ペルソナの加重合計）</div>
<div class="cb-row"><span data-i18n data-ja="実務派" data-en="Pragmatist">実務派</span><span class="cb-num">73.0</span></div>
<div class="cb-row"><span data-i18n data-ja="バランス派" data-en="Balancer">バランス派</span><span class="cb-num">84.0</span></div>
<div class="cb-row"><span data-i18n data-ja="革新派" data-en="Innovator">革新派</span><span class="cb-num">84.0</span></div>
<div class="cb-gap" data-i18n data-ja="差 11.0点" data-en="Gap: 11.0 pts">差 11.0点</div>
</div><div class="converge-arrow">→</div><div class="converge-after"><div class="ca-lbl" data-i18n data-ja="SEGT収束後" data-en="After SEGT convergence">SEGT収束後</div>
<div class="ca-num">80.1<span style="font-size:1rem;">点</span></div><div class="ca-sub" data-i18n data-ja="標準評価 V*（<a href='https://ecobottle-campus--xp34hiw.gamma.site/' target='_blank' rel='noopener'>EcoBottle</a>）" data-en="Standard evaluation V* (<a href='https://ecobottle-campus--xp34hiw.gamma.site/' target='_blank' rel='noopener'>EcoBottle</a>)">標準評価 V*（<a href="https://ecobottle-campus--xp34hiw.gamma.site/" target="_blank" rel="noopener">EcoBottle</a>）</div>
</div></div><p data-i18n data-ja="興味深いのは、越中八尾（審査員間のバラつき20.8点）とEcoBottle（バラつき11.0点）という、意見の割れ方が異なる2つの計画を比べたときの結果です。" data-en="What's striking is how this plays out across the two plans, which had very different degrees of judge disagreement — 20.8 points for Ecchu-Yao versus 11.0 points for EcoBottle.">興味深いのは、越中八尾（審査員間のバラつき20.8点）とEcoBottle（バラつき11.0点）という、意見の割れ方が異なる2つの計画を比べたときの結果です。</p><div class="compare-grid rv"><div class="compare-box"><div class="cx-name"><a href="https://www.award-of.net/Yatsuo_2026PoC_v4_1.html" target="_blank" rel="noopener" data-i18n data-ja="越中八尾" data-en="Ecchu-Yao">越中八尾</a></div>
<div class="cx-num">V* = 80.3</div><div class="cx-sub" data-i18n data-ja="収束前のバラつき 20.8点" data-en="Pre-convergence gap: 20.8 pts">収束前のバラつき 20.8点</div>
</div><div class="compare-vs">vs</div><div class="compare-box tl"><div class="cx-name"><a href="https://ecobottle-campus--xp34hiw.gamma.site/" target="_blank" rel="noopener">EcoBottle</a></div>
<div class="cx-num">V* = 80.1</div><div class="cx-sub" data-i18n data-ja="収束前のバラつき 11.0点" data-en="Pre-convergence gap: 11.0 pts">収束前のバラつき 11.0点</div>
</div></div><div class="diff-note" data-i18n data-ja="収束後のV*の差はわずか0.2点" data-en="After convergence, the two V* values differ by only 0.2 points">収束後のV*の差はわずか0.2点</div>
<p style="margin-top:1.3rem;" data-i18n data-ja="審査員間のブレの大きさは計画ごとに違っても、外生の原理Nに拘束された収束計算をかけると、どちらも同水準の標準評価に落ち着きました。個々の審査員のブレの大きさに依存せず、安定した基準点を導けることがうかがえます。" data-en="Even though the size of the pre-convergence disagreement differed between the two plans, running the convergence calculation bound to External Principle N settled both plans onto a comparable standard-evaluation level — suggesting the process can reach a stable benchmark regardless of how scattered the individual judges were.">審査員間のブレの大きさは計画ごとに違っても、外生の原理Nに拘束された収束計算をかけると、どちらも同水準の標準評価に落ち着きました。個々の審査員のブレの大きさに依存せず、安定した基準点を導けることがうかがえます。</p></div>
</section><!-- 02 なぜ収束するのか --><section class="post-sec"><div class="con"><div class="sec-eyebrow">02 &mdash; <span data-i18n data-ja="なぜ収束するのか" data-en="Why It Converges">なぜ収束するのか</span></div>
<h2 data-i18n data-ja="SEGTが解消するのは「多数決」ではなく「基準のブレ」" data-en="SEGT resolves a drifting standard — not a majority vote">SEGTが解消するのは「多数決」ではなく「基準のブレ」</h2><p data-i18n data-ja="eval000は、外生の原理N（何のために評価するか）を先に定義し、その原理に拘束された写像 v(t+1) = F_N(v(t), R) を反復計算することで、単一の固定点 v* に収束させます。この収束プロセスは、バナッハの不動点定理という数学的な定理によって裏付けられています。" data-en="eval000 first defines External Principle N &mdash; the purpose of the review &mdash; and then repeatedly applies a mapping bound to that principle, v(t+1) = F_N(v(t), R), until it converges to a single fixed point, v*. This convergence process is grounded in a mathematical result known as the Banach fixed-point theorem.">eval000は、外生の原理N（何のために評価するか）を先に定義し、その原理に拘束された写像 v(t+1) = F_N(v(t), R) を反復計算することで、単一の固定点 v* に収束させます。この収束プロセスは、バナッハの不動点定理という数学的な定理によって裏付けられています。</p><p data-i18n data-ja="ポイントは、平均点と異なる数値を作ることが目的ではないということです。変動する個々の評価の背後にある標準評価（Evaluation Standard）を構成し、再現可能な「ものさし」（Evaluation Measure）として使えるようにすることに価値があります。" data-en="The point isn't to produce a number that differs from the average. The value lies in constructing the Evaluation Standard that sits behind the fluctuating individual scores, so it can be used as a reproducible &quot;ruler&quot; &mdash; an Evaluation Measure.">ポイントは、平均点と異なる数値を作ることが目的ではないということです。変動する個々の評価の背後にある標準評価（Evaluation Standard）を構成し、再現可能な「ものさし」（Evaluation Measure）として使えるようにすることに価値があります。</p><div class="note-box rv"><div class="nb-lbl" data-i18n data-ja="正確に言うと" data-en="To be precise">正確に言うと</div>
<p data-i18n data-ja="バナッハの不動点定理が保証するのは、同一の評価チーム（今回のデモでは3ペルソナ固定）・同一の入力・同一のN・同一のルーブリックのもとでは、計算のたびに同じv*が得られるということです。評価するチーム自体が変わった場合（別のペルソナ構成や、人間の審査員チームなど）に同じ標準評価へ到達できるかどうかは、この定理が直接保証する範囲の外にあります。eval000ではこの区別を明確にしたうえで、異なる評価者集団間の収束性についてもPoCで検証を重ねています。" data-en="What the Banach fixed-point theorem actually guarantees is that, given the same evaluator group (here, the same three personas), the same input, the same N, and the same rubric, the calculation reaches the same v* every time. Whether a different evaluator group &mdash; a different set of personas, or a panel of human judges &mdash; would converge on the same standard evaluation is a separate question, outside what this theorem alone guarantees. eval000 keeps this distinction explicit, and is validating convergence across different evaluator groups as part of its ongoing PoC work.">バナッハの不動点定理が保証するのは、同一の評価チーム（今回のデモでは3ペルソナ固定）・同一の入力・同一のN・同一のルーブリックのもとでは、計算のたびに同じv*が得られるということです。評価するチーム自体が変わった場合（別のペルソナ構成や、人間の審査員チームなど）に同じ標準評価へ到達できるかどうかは、この定理が直接保証する範囲の外にあります。eval000ではこの区別を明確にしたうえで、異なる評価者集団間の収束性についてもPoCで検証を重ねています。</p></div>
<div class="mini-grid rv"><div class="mini-card"><div class="mc-lbl">POINT 01</div>
<div class="mc-t" data-i18n data-ja="審査員構成に左右されないブレない評価" data-en="An evaluation that doesn't depend on panel composition">審査員構成に左右<br>されないブレない評価</div>
<div class="mc-d" data-i18n data-ja="複数のAIペルソナ審査員の評価傾向を、外生の原理Nに拘束された固定点（標準評価）へ収束させます。" data-en="Multiple AI persona judges' tendencies converge to a single fixed point bound to External Principle N — the standard evaluation.">複数のAIペルソナ審査員の評価傾向を、外生の原理Nに拘束された固定点（標準評価）へ収束させます。</div>
</div><div class="mini-card tl"><div class="mc-lbl">POINT 02</div><div class="mc-t" data-i18n data-ja="「収束の強さ」を数値で測る取り組み" data-en="Measuring &quot;how strong the convergence is&quot;">「収束の強さ」を<br>数値で測る取り組み</div>
<div class="mc-d" data-i18n data-ja="収束後のブレの小ささを示す指標（Evaluation Measure・Stabilization Ratio）の定義を進めています。今回のような収束幅を定量的に示すのが次のステップです。" data-en="We're defining metrics &mdash; an Evaluation Measure and a Stabilization Ratio &mdash; that quantify how tight the post-convergence result is. Putting a number on convergence gaps like the ones shown here is the next step.">収束後のブレの小ささを示す指標（Evaluation Measure・Stabilization Ratio）の定義を進めています。今回のような収束幅を定量的に示すのが次のステップです。</div>
</div><div class="mini-card"><div class="mc-lbl">POINT 03</div><div class="mc-t" data-i18n data-ja="評価の「方針」を最初に明文化する" data-en="The evaluation &quot;policy&quot; is written down first">評価の「方針」を<br>最初に明文化する</div>
<div class="mc-d" data-i18n data-ja="「外生的な原理」として評価方針（N）を定義し、審査の前提を明確にしたうえで収束計算にかけます。" data-en="The review policy is defined up front as an &quot;exogenous principle&quot; (N), making the premise of the review explicit before convergence runs.">「外生的な原理」として評価方針（N）を定義し、審査の前提を明確にしたうえで収束計算にかけます。</div>
</div></div></div></section><!-- 03 今後の検証 --><section class="post-sec alt"><div class="con"><div class="sec-eyebrow">03 &mdash; <span data-i18n data-ja="今後の検証" data-en="What We're Validating Next">今後の検証</span></div>
<h2 data-i18n data-ja="このデモは「第一歩」。次はPoCで実証を重ねます" data-en="This demo is a first step — next, we validate through a PoC">このデモは「第一歩」。次はPoCで実証を重ねます</h2><p data-i18n data-ja="今回のライブデモは、固定した3ペルソナ審査員チームによる1回の収束計算の実例です。この実例を土台に、eval000では3ヶ月のPoCプログラムの中で次の3点を検証しています。" data-en="This live demo shows a single convergence run by one fixed three-persona panel. Building on that, eval000 is validating the following three points over a 3-month PoC program.">今回のライブデモは、固定した3ペルソナ審査員チームによる1回の収束計算の実例です。この実例を土台に、eval000では3ヶ月のPoCプログラムの中で次の3点を検証しています。</p><div class="road-list rv"><div class="road-item"><div class="road-num">01</div>
<div><div class="road-t" data-i18n data-ja="同一条件での再現性の定量評価" data-en="Quantifying reproducibility under identical conditions">同一条件での再現性の定量評価</div>
<div class="road-d" data-i18n data-ja="同一チーム・同一条件で複数回再実施し、V*の変動幅をEvaluation Measure・Stabilization Ratioとして数値化します。" data-en="Rerunning the same team under the same conditions multiple times, and expressing how much V* varies as an Evaluation Measure and Stabilization Ratio.">同一チーム・同一条件で複数回再実施し、V*の変動幅をEvaluation Measure・Stabilization Ratioとして数値化します。</div>
</div></div><div class="road-item"><div class="road-num">02</div><div><div class="road-t" data-i18n data-ja="通常のLLM単体評価とのばらつき比較" data-en="Comparing variance against a single LLM evaluator">通常のLLM単体評価とのばらつき比較</div>
<div class="road-d" data-i18n data-ja="収束計算を通さない通常のLLM評価と比べて、SEGTがどの程度ばらつきを抑えられるかを比較します。" data-en="Comparing how much SEGT reduces variance relative to a plain LLM evaluation that skips the convergence step.">収束計算を通さない通常のLLM評価と比べて、SEGTがどの程度ばらつきを抑えられるかを比較します。</div>
</div></div><div class="road-item"><div class="road-num">03</div><div><div class="road-t" data-i18n data-ja="異なる評価者集団間の収束性の検証" data-en="Validating convergence across different evaluator groups">異なる評価者集団間の収束性の検証</div>
<div class="road-d" data-i18n data-ja="AIペルソナと人間審査員など、異なる評価者集団のあいだでどこまで標準評価が近づくのかを検証します。" data-en="Examining how closely standard evaluations align across different evaluator groups, such as AI personas versus human judges.">AIペルソナと人間審査員など、異なる評価者集団のあいだでどこまで標準評価が近づくのかを検証します。</div>
</div></div></div><div class="cta-box rv"><div class="ct-tag" data-i18n data-ja="PoC ご相談受付中" data-en="PoC Consultations Open">PoC ご相談受付中</div>
<h3 data-i18n data-ja="この収束計算を、貴社の審査プロセスで確かめてみませんか" data-en="See this convergence at work in your own review process">この収束計算を、貴社の審査プロセスで確かめてみませんか</h3><p data-i18n data-ja="3ヶ月のPoCで、Go/No-Go判定まで一気通貫で確認できます。お気軽にご相談ください。" data-en="Our 3-month PoC takes you all the way to a Go/No-Go decision. Feel free to reach out.">3ヶ月のPoCで、Go/No-Go判定まで一気通貫で確認できます。お気軽にご相談ください。</p><a class="btn" href="https://www.eval000.ai/contact" data-i18n data-ja="お問い合わせ" data-en="Contact Us">お問い合わせ</a></div>
<div class="author-box"><div class="author-avatar">乙</div><div><div class="author-name">株式会社テンプロクシー（award-of）編集部</div>
<div class="author-role">eval000.ai / award-of.net</div><div class="author-bio" data-i18n data-ja="eval000は、特許権者・里吉 竜一氏と株式会社テンプロクシーの共同事業運営契約に基づき運営されるメタ評価AIプラットフォームです。Award Force（オーストラリア・50カ国以上）の日本正規パートナーとして、コンテスト・審査・表彰のDXを推進しています。" data-en="eval000 is a meta-evaluation AI platform operated under a joint operation agreement between patent holder Ryuichi Satoyoshi and TEN PROXY Co., Ltd. As the Japan official partner of Award Force (Australia, 50+ countries), we drive DX for contests, reviews, and awards.">eval000は、特許権者・里吉 竜一氏と株式会社テンプロクシーの共同事業運営契約に基づき運営されるメタ評価AIプラットフォームです。Award Force（オーストラリア・50カ国以上）の日本正規パートナーとして、コンテスト・審査・表彰のDXを推進しています。</div>
</div></div></div></section><footer><div class="footer-l"><span class="footer-brand">eval000.ai</span><span>Case Study / award-of × 株式会社テンプロクシー</span></div>
<div class="footer-r">特許出願中（里吉 竜一氏） / &copy; 2026 TEN PROXY Co., Ltd. / award-of. All rights reserved.</div>
</footer><script>
(function(){
  if (!window.IntersectionObserver) {
    document.querySelectorAll('.rv').forEach(function(el){ el.classList.add('in'); });
  } else {
    var obs = new IntersectionObserver(function(entries){
      entries.forEach(function(e){ if (e.isIntersecting) e.target.classList.add('in'); });
    }, { threshold: 0.07 });
    document.querySelectorAll('.rv').forEach(function(el){ obs.observe(el); });
  }

  var currentLang = 'ja';
  function e0SetLang(lang) {
    if (lang === currentLang) return;
    currentLang = lang;
    var btnJa = document.getElementById('btn-ja');
    var btnEn = document.getElementById('btn-en');
    if (btnJa) btnJa.classList.toggle('active', lang === 'ja');
    if (btnEn) btnEn.classList.toggle('active', lang === 'en');
    document.documentElement.lang = lang === 'ja' ? 'ja' : 'en';
    document.body.classList.add('lang-switching');
    setTimeout(function(){
      document.querySelectorAll('[data-i18n]').forEach(function(el){
        var text = el.getAttribute('data-' + lang);
        if (text === null) return;
        if (el.children.length === 0) { el.textContent = text; }
        else { el.innerHTML = text; }
      });
      document.body.classList.remove('lang-switching');
    }, 200);
  }

  var btnJa = document.getElementById('btn-ja');
  var btnEn = document.getElementById('btn-en');
  if (btnJa) btnJa.addEventListener('click', function(){ e0SetLang('ja'); });
  if (btnEn) btnEn.addEventListener('click', function(){ e0SetLang('en'); });
})();
</script></div>
</div></div></div></div></div></div> ]]></content:encoded><pubDate>Mon, 10 Aug 2026 17:40:00 +0900</pubDate></item></channel></rss>