<?xml version="1.0" encoding="UTF-8" ?><!-- generator=Zoho Sites --><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><atom:link href="https://www.eval000.ai/blogs/tag/case-study/feed" rel="self" type="application/rss+xml"/><title>eval000 - Blog #Case study</title><description>eval000 - Blog #Case study</description><link>https://www.eval000.ai/blogs/tag/case-study</link><lastBuildDate>Thu, 20 Aug 2026 21:37:17 -0700</lastBuildDate><generator>http://zoho.com/sites/</generator><item><title><![CDATA[【実証レポート】]]></title><link>https://www.eval000.ai/blogs/post/testreport2608</link><description><![CDATA[<img align="left" hspace="5" src="https://www.eval000.ai/sam4blog/eval000_blog_casestudy_thumb.png"/>DeepSeekとClaudeに同一ルーブリック（AG/BG）で2件のビジネスプランを評価させると、AGスコアで最大1.60点差が発生しました。「将来計画を評価するか／現在の実績を評価するか」というAIの評価思想の差が、同一ルーブリックを使っても結果を変えてしまうことを実証しました。 ]]></description><content:encoded><![CDATA[<div class="zpcontent-container blogpost-container "><div data-element-id="elm_kxTbAQIPRRe4aRTEBV205w" data-element-type="section" class="zpsection "><style type="text/css"></style><div class="zpcontainer-fluid zpcontainer"><div data-element-id="elm_Zuko-qVERymu8l2IbUiRSQ" data-element-type="row" class="zprow zprow-container zpalign-items- zpjustify-content- " data-equal-column=""><style type="text/css"></style><div data-element-id="elm_JbQAVruOTFqUbyPhpPuCLw" data-element-type="column" class="zpelem-col zpcol-12 zpcol-md-12 zpcol-sm-12 zpalign-self- "><style type="text/css"></style><div data-element-id="elm_di1gH_b6xjiUA2T6y-FIyw" data-element-type="text" class="zpelement zpelem-text "><style></style><div class="zptext zptext-align-left zptext-align-mobile-left zptext-align-tablet-left " data-editor="true"><p><span><span>DeepSeekとClaudeに同一ルーブリック（AG/BG）で2件のビジネスプランを評価させると、AGスコアで最大1.60点差が発生しました。「将来計画を評価するか／現在の実績を評価するか」というAIの評価思想の差が、同一ルーブリックを使っても結果を変えてしまうことを実証しました。</span></span></p></div>
</div><div data-element-id="elm_Hd22eLo02u7PC_Q7c2uy3w" data-element-type="codeSnippet" class="zpelement zpelem-codesnippet "><div class="zpsnippet-container"><!-- eval000 Case Study ブログ v3 — Zoho Sites CodeSnippet --><link href="https://fonts.googleapis.com/css2?family=Noto+Sans+JP:wght@300;400;500;700&family=Noto+Serif+JP:wght@600;700&family=DM+Mono:wght@400;500&display=swap" rel="stylesheet"><style> /* ─── Tokens ─────────────────────────────────── */ :root{ --navy:#06102a; --navy2:#0d1f4a; --blue:#2a5cff; --blue2:#5b82ff; --blue3:#93afff; --blue-dim:rgba(42,92,255,.10); --royal:#00489d; --gold:#c8933a; --gold-d:#fdf3e0; --grn:#166534; --grn-d:#f0fdf4; --grn2:#22c55e; --red:#dc2626; --red-d:#fef2f2; --pur:#6040b8; --pur-d:#f0edf8; --ink:#111827; --ink2:#374151; --ink3:#6b7280; --rule:#e5e7eb; --bg-soft:#f8f9fc; --serif:'Noto Serif JP',serif; --sans:'Noto Sans JP',sans-serif; --mono:'DM Mono',monospace; --r:6px; --rl:12px; } /* ─── Root wrapper ────────────────────────────── */ .cs{font-family:var(--sans);color:var(--ink);background:#fff; line-height:1.8;-webkit-font-smoothing:antialiased;} .cs *{box-sizing:border-box;} .cs a{color:var(--blue);text-decoration:none;} .cs a:hover{text-decoration:underline;} /* ─── Scroll progress ─────────────────────────── */ .cs-prog{position:fixed;top:0;left:0;right:0;height:3px; background:linear-gradient(90deg,var(--blue),var(--blue2)); transform-origin:left;transform:scaleX(0);z-index:9999; transition:transform .1s linear;} /* ─── Hero ────────────────────────────────────── */ .cs-hero{background:linear-gradient(135deg,#06102a 0%,#0d2268 55%,#00489d 100%); padding:48px 24px 40px;text-align:center;} .cs-cat{display:inline-block;font-family:var(--mono);font-size:10.5px; letter-spacing:.18em;color:#90c8ff;background:rgba(255,255,255,.10); border:1px solid rgba(255,255,255,.25);border-radius:20px; padding:4px 14px;margin-bottom:18px;} .cs-title{font-family:var(--serif);font-size:clamp(20px,3.2vw,30px);font-weight:700; color:#fff;line-height:1.45;max-width:900px;margin:0 auto 16px;} .cs-title .hi{color:#7ec8ff;} .cs-meta{font-size:12.5px;color:rgba(192,218,255,.80); display:flex;align-items:center;justify-content:center;gap:14px;flex-wrap:wrap;} .cs-meta-sep{color:rgba(255,255,255,.25);} .cs-tags{display:flex;gap:8px;flex-wrap:wrap;justify-content:center;margin-top:14px;} .cs-htag{font-family:var(--mono);font-size:10px;letter-spacing:.06em;padding:3px 10px; border-radius:20px;background:rgba(255,255,255,.12);color:rgba(255,255,255,.80); border:1px solid rgba(255,255,255,.22);} /* ─── Key insight strip ───────────────────────── */ .cs-ki{background:var(--navy);border-bottom:3px solid var(--blue);padding:14px 20px;} .cs-ki-in{max-width:960px;margin:0 auto;display:flex;align-items:center;gap:12px;flex-wrap:wrap;} .cs-ki-label{font-family:var(--mono);font-size:9px;letter-spacing:.18em; color:var(--blue3);font-weight:600;white-space:nowrap;flex-shrink:0;} .cs-ki-text{font-size:13px;color:#c8d8ff;line-height:1.6;} .cs-ki-text strong{color:#fff;} /* ─── Breadcrumb ──────────────────────────────── */ .cs-bc{font-size:12px;color:var(--ink3);padding:12px 20px;max-width:960px;margin:0 auto; display:flex;align-items:center;gap:6px;flex-wrap:wrap;} .cs-bc a{color:var(--ink3);} .cs-bc a:hover{color:var(--blue);} .cs-bc-sep{color:var(--rule);} /* ─── Single column body ──────────────────────── */ .cs-body{max-width:960px;margin:0 auto;padding:0 20px 80px;} /* ─── TOC (inline) ────────────────────────────── */ .cs-toc-box{background:var(--bg-soft);border:1px solid var(--rule); border-radius:var(--rl);padding:18px 20px;margin:28px 0;} .cs-toc-title{font-family:var(--mono);font-size:9.5px;letter-spacing:.16em; color:var(--ink3);margin-bottom:12px;font-weight:600;} .cs-toc-list{list-style:none;padding:0;column-count:2;column-gap:20px;} @media(max-width:540px){.cs-toc-list{column-count:1;}} .cs-toc-list li{margin-bottom:7px;break-inside:avoid;} .cs-toc-list li a{font-size:12.5px;color:var(--ink2);display:block;line-height:1.5;} .cs-toc-list li a:hover{color:var(--blue);} .cs-toc-list .sub{padding-left:12px;font-size:11.5px;color:var(--ink3);} /* ─── Typography ──────────────────────────────── */ .cs-body h2{font-family:var(--serif);font-size:clamp(17px,2.4vw,22px); font-weight:700;color:var(--navy);margin:44px 0 14px; padding-bottom:10px;border-bottom:2px solid var(--rule);line-height:1.4;} .cs-body h2:first-of-type{margin-top:0;} .cs-body h3{font-size:16px;font-weight:700;color:var(--navy); margin:28px 0 10px;line-height:1.5;} .cs-body p{font-size:15px;line-height:1.9;color:var(--ink2);margin-bottom:16px;} .cs-body p:last-child{margin-bottom:0;} .cs-body strong{color:var(--ink);font-weight:700;} .cs-body ul,.cs-body ol{padding-left:20px;margin-bottom:16px;} .cs-body li{font-size:14.5px;line-height:1.85;color:var(--ink2);margin-bottom:5px;} /* ─── Lead ────────────────────────────────────── */ .cs-lead{font-size:15.5px;line-height:2.0;color:var(--ink); border-left:3px solid var(--blue);padding:14px 18px; background:var(--blue-dim);border-radius:0 var(--r) var(--r) 0;margin:28px 0;} /* ─── Callout ─────────────────────────────────── */ .cs-cb{border-radius:var(--rl);padding:14px 18px;margin:18px 0;} .cs-cb-lbl{font-family:var(--mono);font-size:9.5px;letter-spacing:.16em;font-weight:600;margin-bottom:7px;} .cs-cb-body{font-size:13px;line-height:1.85;} .cs-cb.note{background:var(--blue-dim);border:1px solid rgba(42,92,255,.20);} .cs-cb.note .cs-cb-lbl{color:var(--blue);} .cs-cb.note .cs-cb-body{color:var(--ink2);} .cs-cb.warn{background:var(--gold-d);border:1px solid rgba(200,147,58,.30);} .cs-cb.warn .cs-cb-lbl{color:var(--gold);} .cs-cb.warn .cs-cb-body{color:#78350f;} .cs-cb.key{background:var(--navy);border:1px solid rgba(255,255,255,.10);} .cs-cb.key .cs-cb-lbl{color:var(--blue3);} .cs-cb.key .cs-cb-body{color:#c8d8ff;} .cs-cb.key strong{color:#fff;} .cs-cb.good{background:var(--grn-d);border:1px solid rgba(22,101,52,.20);} .cs-cb.good .cs-cb-lbl{color:var(--grn);} .cs-cb.good .cs-cb-body{color:var(--grn);} .cs-cb.crit{background:#fff0f0;border:1.5px solid rgba(220,38,38,.25);border-left:3px solid var(--red);} .cs-cb.crit .cs-cb-lbl{color:var(--red);} .cs-cb.crit .cs-cb-body{color:#7f1d1d;} .cs-cb.insight{background:#e8f0fb;border:1px solid rgba(42,92,255,.20);} .cs-cb.insight .cs-cb-lbl{color:var(--royal);} .cs-cb.insight .cs-cb-body{color:var(--ink2);} /* ─── Section divider ─────────────────────────── */ .cs-div{display:flex;align-items:center;gap:10px;margin:36px 0 26px;} .cs-div-line{flex:1;border-top:1px solid var(--rule);} .cs-div-num{font-family:var(--mono);font-size:9.5px;letter-spacing:.16em; color:var(--ink3);background:var(--bg-soft);padding:3px 10px;border-radius:20px;} /* ─── Rubric table ────────────────────────────── */ .cs-tbl-wrap{overflow-x:auto;margin:16px 0;} .cs-tbl{width:100%;border-collapse:collapse;font-size:13px;min-width:500px;} .cs-tbl thead th{background:var(--navy);color:#fff;padding:9px 12px; text-align:left;font-weight:600;white-space:nowrap;} .cs-tbl thead th.c{text-align:center;width:54px;} .cs-tbl tbody td{padding:9px 12px;border-bottom:1px solid var(--rule); color:var(--ink2);vertical-align:middle;line-height:1.6;} .cs-tbl .sv{font-family:var(--mono);font-weight:700;text-align:center;font-size:15px;} .cs-tbl .sv.hi{color:var(--blue);} .cs-tbl .sv.md{color:var(--gold);} .cs-tbl .sv.lo{color:var(--red);} .cs-tbl .sv.top{color:var(--grn2);} .cs-tbl .sv.d1{color:var(--red);} .cs-tbl .sv.d2{color:var(--red);font-size:17px;} .cs-tbl .sv.d3{color:var(--red);font-size:19px;font-weight:900;} .cs-tbl .sv.zero{color:var(--ink3);} .cs-tbl .total-row td{background:var(--navy);color:#fff;font-weight:700; border-top:2px solid rgba(255,255,255,.15);} .cs-tbl .total-row .sv{color:#7ec8ff;font-size:16px;} /* コメント行 — 背景色で視覚分離、全幅1セル */ .cs-tbl .cmt-row td{background:#f6f8fc;border-bottom:2px solid var(--rule);padding:0;} .cs-cmt{padding:10px 12px 13px;font-size:12.5px;color:var(--ink2);line-height:1.75;} .cs-cmt strong{font-weight:700;} .cs-cmt .ds{color:var(--pur);} .cs-cmt .cl{color:var(--royal);} /* ─── Spotlight cards ─────────────────────────── */ .cs-spot-grid{display:grid;grid-template-columns:1fr 1fr;gap:14px;margin:18px 0;} @media(max-width:480px){.cs-spot-grid{grid-template-columns:1fr;}} .cs-spot{border:1px solid var(--rule);border-radius:var(--rl); padding:16px;text-align:center;background:#fff; box-shadow:0 2px 8px rgba(0,0,0,.05);} .cs-spot-lbl{font-family:var(--mono);font-size:9.5px;letter-spacing:.13em; color:var(--ink3);margin-bottom:10px;font-weight:500;} .cs-spot-scores{display:flex;gap:8px;justify-content:center;flex-wrap:wrap;margin-bottom:8px;} .cs-sc{font-family:var(--mono);font-size:22px;font-weight:700; padding:5px 11px;border-radius:7px;line-height:1.15;} .cs-sc.ds{background:var(--pur-d);color:var(--pur);} .cs-sc.cl{background:rgba(0,72,157,.08);color:var(--royal);} .cs-sc-lbl{font-size:10px;font-weight:400;display:block;margin-top:3px;} .cs-diff{display:inline-block;font-family:var(--mono);font-size:12px; font-weight:700;padding:3px 11px;border-radius:20px;margin-top:6px;} .cs-diff.lg{background:var(--red-d);color:var(--red);} .cs-spot-note{font-size:11.5px;color:var(--ink3);margin-top:8px;line-height:1.55;text-align:left;} /* ─── AI compare cards ────────────────────────── */ .cs-ai-grid{display:grid;grid-template-columns:1fr 1fr;gap:14px;margin:18px 0;} @media(max-width:480px){.cs-ai-grid{grid-template-columns:1fr;}} .cs-ai{border-radius:var(--rl);padding:16px;} .cs-ai.ds{background:var(--pur-d);border:1px solid rgba(96,64,184,.20);border-top:3px solid var(--pur);} .cs-ai.cl{background:rgba(0,72,157,.06);border:1px solid rgba(0,72,157,.20);border-top:3px solid var(--royal);} .cs-ai-name{font-family:var(--mono);font-size:10px;letter-spacing:.12em;font-weight:600;margin-bottom:7px;} .cs-ai.ds .cs-ai-name{color:var(--pur);} .cs-ai.cl .cs-ai-name{color:var(--royal);} .cs-ai-type{font-size:13px;font-weight:700;color:var(--navy);margin-bottom:8px;} .cs-ai-list{list-style:none;padding:0;display:flex;flex-direction:column;gap:5px;} .cs-ai-list li{font-size:12px;color:var(--ink2);display:flex;gap:6px;align-items:flex-start;line-height:1.6;} .cs-ai-list li::before{content:'›';font-weight:700;flex-shrink:0;font-size:13px;margin-top:-1px;} .cs-ai.ds .cs-ai-list li::before{color:var(--pur);} .cs-ai.cl .cs-ai-list li::before{color:var(--royal);} /* ─── Compare table ───────────────────────────── */ .cs-ctbl-wrap{overflow-x:auto;margin:18px 0;} .cs-ctbl{width:100%;border-collapse:collapse;font-size:13px;min-width:420px;} .cs-ctbl th{background:var(--bg-soft);color:var(--ink2);padding:8px 12px; font-weight:700;border-bottom:2px solid var(--rule);text-align:left;} .cs-ctbl th.c{text-align:center;} .cs-ctbl td{padding:9px 12px;border-bottom:1px solid var(--rule);color:var(--ink2);} .cs-ctbl tr:nth-child(even) td{background:var(--bg-soft);} .cs-ctbl td.c{text-align:center;} .cs-ctbl .rh{font-weight:700;color:var(--navy);} /* ─── Bar chart ───────────────────────────────── */ .cs-bar-wrap{margin:18px 0;} .cs-bar-legend{display:flex;gap:14px;flex-wrap:wrap;margin-bottom:12px;} .cs-bar-leg{display:flex;align-items:center;gap:5px;font-size:11px;color:var(--ink3);} .cs-bar-leg-dot{width:11px;height:11px;border-radius:3px;flex-shrink:0;} .cs-bar-sec{font-size:12px;font-weight:700;color:var(--ink2); margin:14px 0 8px;padding-top:12px;border-top:1px solid var(--rule);} .cs-bar-sec:first-of-type{border-top:none;margin-top:0;} .cs-bar-row{display:flex;align-items:center;gap:8px;margin-bottom:7px;} .cs-bar-name{width:90px;font-size:11px;color:var(--ink2);text-align:right;flex-shrink:0;line-height:1.3;} .cs-bar-track{flex:1;background:#e5e7eb;border-radius:3px;height:24px;overflow:hidden;} .cs-bar-fill{height:100%;border-radius:3px;display:flex;align-items:center;padding:0 8px;} .cs-bar-val{font-family:var(--mono);font-size:11px;font-weight:700;color:#fff;} .cs-bar-after{font-size:11px;color:var(--grn);font-weight:700;white-space:nowrap;} /* ─── SEGT result ─────────────────────────────── */ .cs-segt{background:var(--navy);border-radius:var(--rl);padding:22px 20px;margin:22px 0;text-align:center;} .cs-segt-lbl{font-family:var(--mono);font-size:9.5px;letter-spacing:.18em; color:var(--blue3);margin-bottom:14px;font-weight:500;} .cs-segt-scores{display:flex;gap:10px;justify-content:center;flex-wrap:wrap;margin-bottom:10px;} .cs-segt-score{background:rgba(255,255,255,.10);border:1px solid rgba(255,255,255,.18); border-radius:var(--rl);padding:12px 16px;text-align:center;} .cs-segt-num{font-family:var(--mono);font-size:clamp(26px,4vw,38px);font-weight:700;color:#7ec8ff;line-height:1;} .cs-segt-plan{font-size:10.5px;color:rgba(255,255,255,.55);margin-top:4px;} .cs-segt-eq{font-size:20px;color:rgba(255,255,255,.30);display:flex;align-items:center;} .cs-segt-badge{display:inline-block;font-family:var(--mono);font-size:12px;font-weight:700; padding:4px 14px;border-radius:20px;background:rgba(34,197,94,.15);color:#4ade80; border:1px solid rgba(34,197,94,.30);} .cs-segt-desc{font-size:12.5px;color:rgba(192,218,255,.80);line-height:1.8;margin-top:12px;} /* ─── Tags / author / footer ──────────────────── */ .cs-tag-row{display:flex;gap:7px;flex-wrap:wrap;margin:16px 0;} .cs-tag{font-family:var(--mono);font-size:10.5px;padding:3px 11px; border-radius:20px;background:var(--bg-soft);border:1px solid var(--rule);color:var(--ink3);} .cs-tag.b{background:var(--blue-dim);border-color:rgba(42,92,255,.25);color:var(--blue);} .cs-author{display:flex;align-items:center;gap:12px;border:1px solid var(--rule); border-radius:var(--rl);padding:14px 16px;margin:32px 0;} .cs-author-av{width:40px;height:40px;border-radius:50%;flex-shrink:0; background:linear-gradient(135deg,#00489d,#1a6fd4); display:flex;align-items:center;justify-content:center; font-family:var(--mono);font-size:13px;font-weight:700;color:#fff;} .cs-author-name{font-size:13px;font-weight:700;color:var(--navy);margin-bottom:2px;} .cs-author-role{font-size:11.5px;color:var(--ink3);} .cs-footer{border-top:1px solid var(--rule);padding-top:22px;margin-top:32px;} .cs-footer-desc{font-size:13px;color:var(--ink2);margin-bottom:12px;line-height:1.8;} .cs-footer-links{display:flex;gap:10px;flex-wrap:wrap;} .cs-flink{display:inline-flex;align-items:center;gap:5px;font-size:13px;font-weight:600; padding:9px 16px;border-radius:var(--r);text-decoration:none;transition:opacity .15s;} .cs-flink:hover{opacity:.85;text-decoration:none;} .cs-flink.p{background:var(--navy);color:#fff;} .cs-flink.s{background:var(--bg-soft);border:1px solid var(--rule);color:var(--ink2);} </style><div class="cs"><div class="cs-prog" id="cs-prog"></div>
<!-- ── HERO ──────────────────────────────────────── --><div class="cs-hero"><div class="cs-cat">Case Study ／ 実証レポート</div>
<h1 class="cs-title">【実証レポート】<span class="hi">AI評価モデルが異なると</span>、<br>なぜ同じプランの評点が最大1.45点変わるのか</h1><div class="cs-meta"><span>2026年8月5日</span><span class="cs-meta-sep">|</span><span>eval000 事務局</span><span class="cs-meta-sep">|</span><span>読了目安 約8分</span></div>
<div class="cs-tags"><span class="cs-htag">生成AI評価バイアス</span><span class="cs-htag">ルーブリックAG/BG</span><span class="cs-htag">SEGT収束</span><span class="cs-htag">DeepSeek vs Claude</span><span class="cs-htag">ビジネスプラン評価</span></div>
</div><!-- ── KEY FINDING ────────────────────────────────── --><div class="cs-ki"><div class="cs-ki-in"><div class="cs-ki-label">KEY FINDING</div>
<div class="cs-ki-text">同一プラン・同一ルーブリックで DeepSeek と Claude に採点させると<strong> AGスコアで最大 1.60点差</strong>（DeepSeek 5.00 vs Claude 3.40）が発生。同じ「ものさし」を使っても AI によってスコアが大きく変わる——これが eval000 が解決すべき問題の核心です。</div>
</div></div><!-- ── BREADCRUMB ──────────────────────────────────── --><div class="cs-bc"><a href="https://www.eval000.ai/">Home</a><span class="cs-bc-sep">/</span><a href="https://www.eval000.ai/blogs">ブログ</a><span class="cs-bc-sep">/</span><span>Case Study</span></div>
<!-- ── BODY ───────────────────────────────────────── --><div class="cs-body"><!-- TOC（インライン） --><div class="cs-toc-box"><div class="cs-toc-title">目次</div>
<ul class="cs-toc-list"><li><a href="#cs-bg">実施背景</a></li><li><a href="#cs-method">評価方法</a></li><li><a href="#cs-eco">EcoBottle Campus の評価</a></li><li><a class="sub" href="#cs-eco-ag">└ AGルーブリック比較</a></li><li><a class="sub" href="#cs-eco-bg">└ BGルーブリック比較</a></li><li><a href="#cs-yat">越中八尾の評価</a></li><li><a class="sub" href="#cs-yat-ag">└ AGルーブリック比較</a></li><li><a class="sub" href="#cs-yat-bg">└ BGルーブリック比較</a></li><li><a href="#cs-cmp">AIスコア総括</a></li><li><a href="#cs-thought">AI評価思想の比較</a></li><li><a href="#cs-segt">SEGT収束の実証</a></li><li><a href="#cs-conc">結論</a></li></ul></div>
<p class="cs-lead">生成AIに同一のビジネスプランを評価させても、使うAIモデルが違えばスコアが大きく変わる——これは直感的には分かっていても、実際のデータとして示されることは少なかった。本レポートでは eval000 の体験セミナー（2026年8月5日）で実施したライブデモの実証データとして、DeepSeekとClaudeに全く同一のルーブリックで2件のビジネスプランを評価させた結果を公開します。</p><!-- SEC 01 背景 --><div class="cs-div"><div class="cs-div-line"></div><div class="cs-div-num">SECTION 01</div><div class="cs-div-line"></div></div>
<h2 id="cs-bg">実施背景——「AI評価の標準化」という問題</h2><p>ビジネスコンテスト・採用選考・補助金審査の現場では、審査工数の削減を目的として生成AIの活用が急速に広まっています。しかし多くの場面で「AIに採点させる」という実装が行われており、そこには構造的な問題があります。</p><div class="cs-cb warn"><div class="cs-cb-lbl">PROBLEM</div>
<div class="cs-cb-body"><strong>ChatGPT・Gemini・Claude・DeepSeek——同じプロンプトを送っても、各AIモデルは異なる採点結果を返します。</strong>モデルごとに学習データ・RLHF設計・評価思想が異なるためです。「AIを使った客観的評価」という前提が、使うAIの選択によって評点が変わるという矛盾を内包しています。</div>
</div><p>eval000が2025年に実施した予備検証では、同一のビジネスプランをChatGPT・Gemini・Claude等の複数モデルで評価させると<strong>最大12点差</strong>が生じることを確認しています。本レポートはその構造的問題を、AG・BGという2種類のルーブリックを用いたより精密な実証として示します。</p><!-- SEC 02 評価方法 --><div class="cs-div"><div class="cs-div-line"></div><div class="cs-div-num">SECTION 02</div><div class="cs-div-line"></div></div>
<h2 id="cs-method">評価方法</h2><h3>評価対象プラン</h3><ul><li><strong>プランA：EcoBottle Campus</strong>——大学生向け水筒シェアリングサービス</li><li><strong>プランB：越中八尾ウェルネス・スマートビレッジ創生事業</strong>——令和8年度富山市PoC申請</li></ul><h3>使用ルーブリック</h3><div class="cs-cb note"><div class="cs-cb-lbl">評価軸の設計</div>
<div class="cs-cb-body"><strong>AGルーブリック（5項目・加重スコア）</strong><br> ① 根拠と検証（30%）② 発展可能性（25%）③ 人間ならではの価値（20%）④ 実行リスク（15%）⑤ 社会的変革の度合い（10%）<br><br><strong>BGルーブリック（4項目・加重スコア）</strong><br> ① 価値の革新性（30%）② 市場の潜在性（20%）③ 商業的実現可能性（25%）④ 技術的実現可能性（25%） </div>
</div><h3>評価者</h3><p><strong>DeepSeek</strong>（ポテンシャル評価型）と<strong>Claude</strong>（エビデンス評価型）に、全く同一のルーブリック・評価基準・ビジネスプラン文書を提供し、独立採点を実施しました。</p><!-- SEC 03 EcoBottle --><div class="cs-div"><div class="cs-div-line"></div><div class="cs-div-num">SECTION 03</div><div class="cs-div-line"></div></div>
<h2 id="cs-eco">EcoBottle Campus の評価結果</h2><h3 id="cs-eco-ag">AGルーブリック比較</h3><div class="cs-tbl-wrap"><table class="cs-tbl"><thead><tr><th>評価基準</th><th class="c">配点</th><th class="c">DeepSeek</th><th class="c">Claude</th><th class="c">差</th></tr></thead><tbody><tr><td><strong>① 根拠と検証</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">30%</td><td class="sv hi">4</td><td class="sv md">3</td><td class="sv d1">+1</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt"><span class="ds">DeepSeek：</span>環境省データ・実証実験に裏付けられ、ABC大学の検証が「100人以上」とみなせると判断。<br><span class="cl">Claude：</span>実参加ユーザー数が不明瞭、廃棄コスト算出根拠の記載なしを厳密に評価。</div></td></tr><tr><td><strong>② 発展可能性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">25%</td><td class="sv md">3</td><td class="sv lo">2</td><td class="sv d1">+1</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt"><span class="ds">DeepSeek：</span>3ヵ年計画・全国100大学・アジア展開という将来構想を「発展性」として評価。<br><span class="cl">Claude：</span>AI洗浄システムの改善履歴・実績の開示がなく、実証された発展の軌跡が乏しいと判断。</div></td></tr><tr><td><strong>③ 人間ならではの価値</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">20%</td><td class="sv hi">4</td><td class="sv lo">2</td><td class="sv d2">+2</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt"><span class="ds">DeepSeek：</span>「所有から共有へ」という価値観転換を学生の視点で描写——共感を得やすいと高評価。<br><span class="cl">Claude：</span>市場分析・数値データ中心の構成で、創業者の個人的な動機・感情的訴求がほぼ見当たらないと判断。</div></td></tr><tr><td><strong>④ 実行リスク</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">15%</td><td class="sv hi">4</td><td class="sv md">3</td><td class="sv d1">+1</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt"><span class="ds">DeepSeek：</span>3リスクに個別対応策があり事業全体として実現可能と評価。<br><span class="cl">Claude：</span>個人情報保護・損害賠償責任等の法的観点への言及が薄いと判断。</div></td></tr><tr><td><strong>⑤ 社会的変革の度合い</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">10%</td><td class="sv hi">4</td><td class="sv hi">4</td><td class="sv zero">0</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt">両AI共通：CO2・廃棄物削減を定量化し、長期ビジョン（ASEAN展開）まで提示している点を評価。唯一一致した評価軸。</div></td></tr><tr class="total-row"><td><strong>AGスコア（加重平均）</strong></td><td></td><td class="sv">3.75</td><td class="sv">2.55</td><td class="sv" style="color:rgb(248, 113, 113);font-size:16px;">1.20</td></tr></tbody></table></div>
<div class="cs-cb insight"><div class="cs-cb-lbl">INSIGHT — 「人間ならではの価値」で最大差（+2点）</div>
<div class="cs-cb-body">DeepSeekは「将来の価値観転換」という構想を評価したのに対し、Claudeは「資料に確認できる創業者の物語性」の有無を評価しました。同じルーブリック項目の解釈が、AIの「評価思想」によって根本から異なることを示しています。</div>
</div><h3 id="cs-eco-bg">BGルーブリック比較</h3><div class="cs-tbl-wrap"><table class="cs-tbl"><thead><tr><th>評価基準</th><th class="c">配点</th><th class="c">DeepSeek</th><th class="c">Claude</th><th class="c">差</th></tr></thead><tbody><tr><td><strong>① 価値の革新性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">30%</td><td class="sv hi">4</td><td class="sv md">3</td><td class="sv d1">+1</td></tr><tr><td><strong>② 市場の潜在性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">20%</td><td class="sv top">5</td><td class="sv hi">4</td><td class="sv d1">+1</td></tr><tr><td><strong>③ 商業的実現可能性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">25%</td><td class="sv hi">4</td><td class="sv md">3</td><td class="sv d1">+1</td></tr><tr><td><strong>④ 技術的実現可能性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">25%</td><td class="sv top">5</td><td class="sv md">3</td><td class="sv d2">+2</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt"><span class="ds">DeepSeek：</span>IoT・UV殺菌・アプリ連携は既存技術の組み合わせで実用化ハードルは低いと満点評価。<br><span class="cl">Claude：</span>「特許出願中」の自動洗浄システムは未確定要素でコスト面の裏付けも薄いと判断。</div></td></tr><tr class="total-row"><td><strong>BGスコア（加重平均）</strong></td><td></td><td class="sv">4.45</td><td class="sv">3.20</td><td class="sv" style="color:rgb(248, 113, 113);font-size:16px;">1.25</td></tr></tbody></table></div>
<!-- SEC 04 越中八尾 --><div class="cs-div"><div class="cs-div-line"></div><div class="cs-div-num">SECTION 04</div><div class="cs-div-line"></div></div>
<h2 id="cs-yat">越中八尾ウェルネス・スマートビレッジ創生事業の評価結果</h2><h3 id="cs-yat-ag">AGルーブリック比較</h3><div class="cs-tbl-wrap"><table class="cs-tbl"><thead><tr><th>評価基準</th><th class="c">配点</th><th class="c">DeepSeek</th><th class="c">Claude</th><th class="c">差</th></tr></thead><tbody><tr><td><strong>① 根拠と検証</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">30%</td><td class="sv top">5</td><td class="sv md">3</td><td class="sv d2">+2</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt"><span class="ds">DeepSeek：</span>高齢化率・人口減少率・富山大医学部の倫理審査取得済みという根拠の豊富さを満点評価。<br><span class="cl">Claude：</span>PoC自体がこれから実施する提案段階であり、実地検証データが存在しないことを重視。</div></td></tr><tr><td><strong>② 発展可能性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">25%</td><td class="sv top">5</td><td class="sv lo">2</td><td class="sv d3">+3</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt"><span class="ds">DeepSeek：</span>PoC→野外能楽堂→フルビレッジ整備という二段階ロードマップ全体を「発展性」として満点評価。<br><span class="cl">Claude：</span>ロードマップは将来計画であり、過去の改善履歴・AI活用実績の開示という観点では情報が少ないと判断。</div></td></tr><tr><td><strong>③ 人間ならではの価値</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">20%</td><td class="sv top">5</td><td class="sv top">5</td><td class="sv zero">0</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt">両AI共通で満点：4市民（文化継承者・高齢住民・都市生活者・能楽愛好者）の困りごとから出発する構成。300年の伝統・担い手不足・認知症リスクという感情に訴える描写の深さを両AIが高く評価。</div></td></tr><tr><td><strong>④ 実行リスク</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">15%</td><td class="sv top">5</td><td class="sv hi">4</td><td class="sv d1">+1</td></tr><tr><td><strong>⑤ 社会的変革の度合い</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">10%</td><td class="sv top">5</td><td class="sv top">5</td><td class="sv zero">0</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt">両AI共通で満点：KGIとして「来訪者50%増」「移住100名」を明示。ユネスコ無形文化遺産という長期的・文化的インパクトの経路の明確さを評価。</div></td></tr><tr class="total-row"><td><strong>AGスコア（加重平均）</strong></td><td></td><td class="sv">5.00</td><td class="sv">3.40</td><td class="sv" style="color:rgb(248, 113, 113);font-size:18px;">1.60</td></tr></tbody></table></div>
<div class="cs-cb crit"><div class="cs-cb-lbl">CRITICAL FINDING — 最大差は「発展可能性」の +3点</div>
<div class="cs-cb-body">DeepSeek 5 vs Claude 2 という本レポート最大の開き。DeepSeekは「将来ロードマップ」を発展性の証拠と評価し、Claudeは「現在確認できる実績の有無」を基準にしました。<strong>「将来計画を評価するか／現在の実績を評価するか」——これがAI評価思想の根本的な分岐点です。</strong></div>
</div><h3 id="cs-yat-bg">BGルーブリック比較</h3><div class="cs-tbl-wrap"><table class="cs-tbl"><thead><tr><th>評価基準</th><th class="c">配点</th><th class="c">DeepSeek</th><th class="c">Claude</th><th class="c">差</th></tr></thead><tbody><tr><td><strong>① 価値の革新性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">30%</td><td class="sv top">5</td><td class="sv hi">4</td><td class="sv d1">+1</td></tr><tr><td><strong>② 市場の潜在性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">20%</td><td class="sv top">5</td><td class="sv hi">4</td><td class="sv d1">+1</td></tr><tr><td><strong>③ 商業的実現可能性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">25%</td><td class="sv hi">4</td><td class="sv md">3</td><td class="sv d1">+1</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt"><span class="ds">DeepSeek：</span>補助金450万円・PoC収益による収支均衡計画を「実現可能」と判断。<br><span class="cl">Claude：</span>本格展開（2〜10億円規模）の財源確保が「今後の申請頼み」であることを重視。</div></td></tr><tr><td><strong>④ 技術的実現可能性</strong></td><td class="sv" style="font-size:12px;color:var(--ink3);">25%</td><td class="sv top">5</td><td class="sv top">5</td><td class="sv zero">0</td></tr><tr class="cmt-row"><td colspan="5"><div class="cs-cmt">両AI共通で満点：ウェアラブル・IoTカメラ・SCRUM-T連携は全て既存技術の活用。富山市の既存インフラ（LPWA・SCRUM-T）を活用する設計で実現可能性が非常に高いと両AI一致。</div></td></tr><tr class="total-row"><td><strong>BGスコア（加重平均）</strong></td><td></td><td class="sv">4.75</td><td class="sv">3.90</td><td class="sv" style="color:rgb(248, 113, 113);font-size:16px;">0.85</td></tr></tbody></table></div>
<!-- SEC 05 総括 --><div class="cs-div"><div class="cs-div-line"></div><div class="cs-div-num">SECTION 05</div><div class="cs-div-line"></div></div>
<h2 id="cs-cmp">全スコアの総括</h2><div class="cs-spot-grid"><div class="cs-spot"><div class="cs-spot-lbl">EcoBottle Campus — AGスコア</div>
<div class="cs-spot-scores"><div class="cs-sc ds">3.75<span class="cs-sc-lbl">DeepSeek</span></div>
<div class="cs-sc cl">2.55<span class="cs-sc-lbl">Claude</span></div></div><div class="cs-diff lg">差 1.20点</div>
<div class="cs-spot-note">「人間ならではの価値」で+2点差。将来の共感性 vs 現在の物語性。</div></div><div class="cs-spot"><div class="cs-spot-lbl">EcoBottle Campus — BGスコア</div>
<div class="cs-spot-scores"><div class="cs-sc ds">4.45<span class="cs-sc-lbl">DeepSeek</span></div>
<div class="cs-sc cl">3.20<span class="cs-sc-lbl">Claude</span></div></div><div class="cs-diff lg">差 1.25点</div>
<div class="cs-spot-note">「技術的実現可能性」で+2点差。実用化ハードルの解釈が大きく異なる。</div></div><div class="cs-spot"><div class="cs-spot-lbl">越中八尾 — AGスコア（最大差）</div>
<div class="cs-spot-scores"><div class="cs-sc ds">5.00<span class="cs-sc-lbl">DeepSeek</span></div>
<div class="cs-sc cl">3.40<span class="cs-sc-lbl">Claude</span></div></div><div class="cs-diff lg">差 1.60点</div>
<div class="cs-spot-note">「発展可能性」で+3点差。本レポート最大の開き。</div></div><div class="cs-spot"><div class="cs-spot-lbl">越中八尾 — BGスコア</div>
<div class="cs-spot-scores"><div class="cs-sc ds">4.75<span class="cs-sc-lbl">DeepSeek</span></div>
<div class="cs-sc cl">3.90<span class="cs-sc-lbl">Claude</span></div></div><div class="cs-diff lg">差 0.85点</div>
<div class="cs-spot-note">BGは差が比較的小さい。技術的実現可能性では両AI一致（5点）。</div></div></div><!-- SEC 06 AI評価思想 --><div class="cs-div"><div class="cs-div-line"></div><div class="cs-div-num">SECTION 06</div><div class="cs-div-line"></div></div>
<h2 id="cs-thought">AI評価思想の比較分析</h2><p>スコアの差はAIの「能力差」ではなく<strong>「評価思想の差」</strong>です。DeepSeekとClaudeは高性能なLLMですが、事業計画の「何を」評価するかという判断が根本的に異なります。</p><div class="cs-ai-grid"><div class="cs-ai ds"><div class="cs-ai-name">DEEPSEEK</div>
<div class="cs-ai-type">ポテンシャル評価型</div><ul class="cs-ai-list"><li>将来の発展可能性・社会的ビジョンを積極評価</li><li>計画全体の構成・方向性の妥当性を重視</li><li>加点型——強みに注目して評価する傾向</li><li>ロードマップ・将来構想も「発展性の証拠」として評価</li></ul></div>
<div class="cs-ai cl"><div class="cs-ai-name">CLAUDE</div><div class="cs-ai-type">エビデンス評価型</div>
<ul class="cs-ai-list"><li>提出資料で客観的に確認できる実績・証拠を重視</li><li>実証されるまでは評価を保留する姿勢</li><li>減点型——不足点を指摘して評価する傾向</li><li>「将来計画」は実績として扱わない</li></ul></div>
</div><div class="cs-ctbl-wrap"><table class="cs-ctbl"><thead><tr><th>比較軸</th><th class="c">DeepSeek</th><th class="c">Claude</th></tr></thead><tbody><tr><td class="rh">評価姿勢</td><td class="c">将来性・ポテンシャルを重視</td><td class="c">現時点の証拠・実績を重視</td></tr><tr><td class="rh">採点方法</td><td class="c">加点型</td><td class="c">減点型</td></tr><tr><td class="rh">将来構想の扱い</td><td class="c">積極的に評価</td><td class="c">実証されるまで保留</td></tr><tr><td class="rh">適した用途</td><td class="c">事業の魅力・可能性の把握</td><td class="c">審査員視点の客観的評価</td></tr></tbody></table></div>
<div class="cs-cb warn"><div class="cs-cb-lbl">IMPLICATION</div><div class="cs-cb-body">どちらのAIが「正しい」かという問題ではありません。<strong>同一のルーブリックを使っても、AIモデルによってルーブリック項目の解釈が大きく異なる</strong>ことが問題です。「AIを使った客観的評価」を実現するためには、AIに採点させるだけでは不十分で、そのAIの評価思想そのものをコントロールする仕組みが必要です。</div>
</div><!-- SEC 07 SEGT --><div class="cs-div"><div class="cs-div-line"></div><div class="cs-div-num">SECTION 07</div><div class="cs-div-line"></div></div>
<h2 id="cs-segt">SEGT収束——バラつきを除去した評価標準 v* の生成</h2><p>本体験セミナーでは上記の実証に続き、eval000のSEGT収束計算を適用するライブデモを実施しました。3つのAIペルソナ審査員（実務派・革新派・バランス派）がBGルーブリックで採点した後、SEGT収束で Evaluation Standard v* を生成しました。</p><h3>BGルーブリック × 3ペルソナ → SEGT収束の実値</h3><div class="cs-bar-wrap"><div class="cs-bar-legend"><div class="cs-bar-leg"><div class="cs-bar-leg-dot" style="background:rgb(37, 99, 235);"></div>実務派（数値重視）</div>
<div class="cs-bar-leg"><div class="cs-bar-leg-dot" style="background:rgb(124, 58, 237);"></div>革新派（新規性重視）</div>
<div class="cs-bar-leg"><div class="cs-bar-leg-dot" style="background:rgb(8, 145, 178);"></div>バランス派（総合判断）</div>
<div class="cs-bar-leg"><div class="cs-bar-leg-dot" style="background:rgb(22, 101, 52);border-radius:50%;"></div>v*（SEGT収束後）</div>
</div><div class="cs-bar-sec">プランA（EcoBottle Campus）— バラつき：<span style="color:var(--red);font-weight:700;">11.0点</span></div>
<div class="cs-bar-row"><div class="cs-bar-name">実務派</div><div class="cs-bar-track"><div class="cs-bar-fill" style="width:73%;background:linear-gradient(90deg, rgb(37, 99, 235), rgb(59, 130, 246));"><span class="cs-bar-val">73.0</span></div></div></div>
<div class="cs-bar-row"><div class="cs-bar-name">革新派</div><div class="cs-bar-track"><div class="cs-bar-fill" style="width:84%;background:linear-gradient(90deg, rgb(124, 58, 237), rgb(139, 92, 246));"><span class="cs-bar-val">84.0</span></div></div></div>
<div class="cs-bar-row"><div class="cs-bar-name">バランス派</div><div class="cs-bar-track"><div class="cs-bar-fill" style="width:84%;background:linear-gradient(90deg, rgb(8, 145, 178), rgb(6, 182, 212));"><span class="cs-bar-val">84.0</span></div></div></div>
<div class="cs-bar-row"><div class="cs-bar-name" style="color:var(--royal);font-weight:700;">v*（収束後）</div><div class="cs-bar-track"><div class="cs-bar-fill" style="width:80.1%;background:linear-gradient(90deg, rgb(22, 101, 52), rgb(34, 197, 94));"><span class="cs-bar-val">80.1</span></div></div><div class="cs-bar-after">= Evaluation Standard</div></div>
<div class="cs-bar-sec">プランB（越中八尾ウェルネス・スマートビレッジ）— バラつき：<span style="color:var(--red);font-weight:700;">20.8点</span></div>
<div class="cs-bar-row"><div class="cs-bar-name">実務派</div><div class="cs-bar-track"><div class="cs-bar-fill" style="width:68.2%;background:linear-gradient(90deg, rgb(37, 99, 235), rgb(59, 130, 246));"><span class="cs-bar-val">68.2</span></div></div></div>
<div class="cs-bar-row"><div class="cs-bar-name">革新派</div><div class="cs-bar-track"><div class="cs-bar-fill" style="width:89%;background:linear-gradient(90deg, rgb(124, 58, 237), rgb(139, 92, 246));"><span class="cs-bar-val">89.0</span></div></div></div>
<div class="cs-bar-row"><div class="cs-bar-name">バランス派</div><div class="cs-bar-track"><div class="cs-bar-fill" style="width:84%;background:linear-gradient(90deg, rgb(8, 145, 178), rgb(6, 182, 212));"><span class="cs-bar-val">84.0</span></div></div></div>
<div class="cs-bar-row"><div class="cs-bar-name" style="color:var(--royal);font-weight:700;">v*（収束後）</div><div class="cs-bar-track"><div class="cs-bar-fill" style="width:80.3%;background:linear-gradient(90deg, rgb(22, 101, 52), rgb(34, 197, 94));"><span class="cs-bar-val">80.3</span></div></div><div class="cs-bar-after">= Evaluation Standard</div></div>
</div><div class="cs-segt"><div class="cs-segt-lbl">SEGT 収束の結果 — BGルーブリック × 3ペルソナ</div>
<div class="cs-segt-scores"><div class="cs-segt-score"><div class="cs-segt-num">80.1</div><div class="cs-segt-plan">v*（プランA / EcoBottle）</div></div>
<div class="cs-segt-eq">≈</div><div class="cs-segt-score"><div class="cs-segt-num">80.3</div><div class="cs-segt-plan">v*（プランB / 越中八尾）</div></div>
</div><div class="cs-segt-badge">v* の差：わずか 0.2点</div><div class="cs-segt-desc">バラつき最大20.8点 → SEGT収束後の差0.2点。外生の原理 N に対して、両プランがほぼ等しい評価標準値に収束しました。</div>
</div><div class="cs-cb good"><div class="cs-cb-lbl">WHAT v* MEANS</div><div class="cs-cb-body">v* の本質的価値は「数値の大小」ではなく<strong>「再現可能性」</strong>です。同じ外生の原理 N と Evaluation Rubric があれば、いつ・誰が評価しても同じ v* が生成されることが Banach の固定点定理により数学的に保証されています。DeepSeek が評価しても Claude が評価しても——N と R が同じであれば v* は常に同じ固定点に収束します。</div>
</div><!-- SEC 08 結論 --><div class="cs-div"><div class="cs-div-line"></div><div class="cs-div-num">CONCLUSION</div><div class="cs-div-line"></div></div>
<h2 id="cs-conc">結論</h2><h3>1. 同一ルーブリックでも AI によってスコアが最大 1.60点変わる</h3><p>越中八尾プランのAGスコアにおいて DeepSeek 5.00 vs Claude 3.40 という1.60点差が発生。これはAIの能力差ではなく、「将来計画を評価するか／現在の実績を評価するか」という<strong>評価思想の構造的な差</strong>に起因しています。</p><h3>2. 共通点は「事業の本質」への評価に現れる</h3><p>両AI一致または差が小さかった項目（「社会的変革の度合い」「人間ならではの価値」「技術的実現可能性」）はプランの本質的な価値に関わる軸です。AIが「正しく評価できる領域」は存在しますが、それは評価の一部にすぎません。</p><h3>3. eval000 SEGT収束は AI の評価思想の差を数学的に除去する</h3><p>複数のAIペルソナ審査員のスコアを SEGT 収束計算にかけることで、各AIが持つ固有の評価思想のバラつきを外生の原理 N のもとで除去し、再現可能な Evaluation Standard v* を生成します。</p><div class="cs-cb key"><div class="cs-cb-lbl">TAKEAWAY</div>
<div class="cs-cb-body">生成 AI は「評価を便利にした」が、「評価を正確にした」わけではありません。<strong>AI が持つ評価思想そのものをコントロールする仕組み——それが外生の原理 N × SEGT 収束によるメタ評価です。</strong></div>
</div><!-- Tags --><div class="cs-tag-row"><span class="cs-tag b">#評価バイアス</span><span class="cs-tag b">#生成AI評価</span><span class="cs-tag b">#SEGT収束</span><span class="cs-tag">#ビジネスコンテスト</span><span class="cs-tag">#DeepSeek</span><span class="cs-tag">#Claude</span><span class="cs-tag">#メタ評価</span><span class="cs-tag">#ルーブリック</span></div>
<!-- Author --><div class="cs-author"><div class="cs-author-av">e0</div><div><div class="cs-author-name">eval000 事務局（株式会社テンプロクシー）</div>
<div class="cs-author-role">特願 2026-096693 ／ Award Force 日本正規パートナー</div></div></div>
<!-- Footer --><div class="cs-footer"><p class="cs-footer-desc">本レポートで紹介した実証データは 2026 年 8 月 5 日の体験セミナーで取得した実値です。eval000 のメタ評価技術に関するご相談・デモのお申し込みはこちらから。</p><div class="cs-footer-links"><a href="https://www.eval000.ai/contact" class="cs-flink p">デモ・相談を申し込む →</a><a href="https://www.eval000.ai/metae-engine" class="cs-flink s">メタ評価エンジンの仕組みを見る →</a><a href="https://www.eval000.ai/service" class="cs-flink s">eval000 Essential →</a><a href="https://www.eval000.ai/blogs" class="cs-flink s">← ブログ一覧</a></div>
</div></div><!-- /cs-body --></div><!-- /cs --><script>
(function(){
  var bar = document.getElementById('cs-prog');
  if(!bar) return;
  window.addEventListener('scroll', function(){
    var h = document.documentElement;
    var pct = h.scrollTop / (h.scrollHeight - h.clientHeight);
    bar.style.transform = 'scaleX(' + Math.min(pct,1) + ')';
  }, {passive:true});
})();
</script></div>
</div></div></div></div></div></div> ]]></content:encoded><pubDate>Tue, 18 Aug 2026 06:45:06 +0900</pubDate></item><item><title><![CDATA[SEGT標準評価の事例]]></title><link>https://www.eval000.ai/blogs/post/casestudy</link><description><![CDATA[<img align="left" hspace="5" src="https://www.eval000.ai/sam4blog/casestudy.png"/>同じ審査員・同じ基準でも生成AIの評価は最大20.8点ブレる——8月5日の体験セミナー・ライブデモの実データをもとに、SEGT収束計算がそのブレを単一の標準評価V*にまとめた実例を解説します。 ]]></description><content:encoded><![CDATA[<div class="zpcontent-container blogpost-container "><div data-element-id="elm_kxTbAQIPRRe4aRTEBV205w" data-element-type="section" class="zpsection "><style type="text/css"></style><div class="zpcontainer-fluid zpcontainer"><div data-element-id="elm_Zuko-qVERymu8l2IbUiRSQ" data-element-type="row" class="zprow zprow-container zpalign-items- zpjustify-content- " data-equal-column=""><style type="text/css"></style><div data-element-id="elm_JbQAVruOTFqUbyPhpPuCLw" data-element-type="column" class="zpelem-col zpcol-12 zpcol-md-12 zpcol-sm-12 zpalign-self- "><style type="text/css"></style><div data-element-id="elm_DLbovp84W8jX-RiVY2ZdeA" data-element-type="text" class="zpelement zpelem-text "><style></style><div class="zptext zptext-align-left zptext-align-mobile-left zptext-align-tablet-left " data-editor="true"><p><span>同じ審査員・同じ基準でも生成AIの評価は最大20.8点ブレる——8月5日の体験セミナー・ライブデモの実データをもとに、SEGT収束計算がそのブレを単一の標準評価V*にまとめた実例を解説します。</span></p></div>
</div><div data-element-id="elm_e9RDLlISQ9s1-ihFEKmiYA" data-element-type="codeSnippet" class="zpelement zpelem-codesnippet "><div class="zpsnippet-container"><!DOCTYPE html><html lang="ja"><meta charset="UTF-8"><meta name="viewport" content="width=device-width, initial-scale=1.0"><title>同じ審査員・同じ基準でも評価は20.8点ブレる ── eval000ライブデモが見せた「SEGT収束」 | eval000.ai Blog</title><meta name="description" content="2026年8月5日のeval000体験セミナー・ライブデモの実データをもとに、生成AIの評価がなぜバラつくのか、そのバラつきをSEGT収束計算がどのように単一の標準評価V*へ収束させるのかを解説します。"><link href="https://fonts.googleapis.com/css2?family=Shippori+Mincho+B1:wght@400;600;700;800&family=Zen+Kaku+Gothic+New:wght@300;400;500;700&family=DM+Mono:wght@300;400;500&display=swap" rel="stylesheet"><style> :root { --primary:#0070c9;--primary-lt:#3a9fe8;--primary-pale:#a8d4f5; --primary-dim:rgba(0,112,201,.16);--primary-bg:rgba(0,112,201,.06);--primary-bd:rgba(0,112,201,.25); --teal:#00a898;--teal-lt:#00d4c2;--teal-bg:rgba(0,168,152,.08);--teal-bd:rgba(0,168,152,.3); --void:#050e1a;--ink:#0f1c2e;--coal:#1a2d42;--paper:#ffffff;--bg:#f5f9fd; --muted:#5a7080;--faint:#a0bdd0;--border:#d8e8f4;--border2:#c2d8ec; --amber:#b06800;--am-bg:rgba(176,104,0,.08);--am-bd:rgba(176,104,0,.28); } *,*::before,*::after{box-sizing:border-box;margin:0;padding:0;} html{scroll-behavior:smooth;} body{background:var(--bg);color:var(--ink);font-family:'Zen Kaku Gothic New',sans-serif;font-size:16px;line-height:1.85;overflow-x:hidden;} [data-i18n]{transition:opacity .25s ease;} body.lang-switching [data-i18n]{opacity:0;} .lang-toggle{display:flex;align-items:center;border:1px solid var(--border2);overflow:hidden;flex-shrink:0;} .lang-btn{padding:.3rem .7rem;font-family:'DM Mono',monospace;font-size:.58rem;font-weight:500;letter-spacing:.12em;border:none;background:transparent;color:var(--faint);cursor:pointer;line-height:1;} .lang-btn.active{background:var(--primary);color:#fff;} .lang-divider{width:1px;height:20px;background:var(--border2);flex-shrink:0;} .rv{opacity:0;transform:translateY(16px);transition:opacity .6s ease,transform .6s ease;} .rv.in{opacity:1;transform:translateY(0);} .con{max-width:1200px;margin:0 auto;padding:0 3rem;} /* HEADER */ .news-header{background:linear-gradient(135deg,#3a9fe8 0%,#00d4c2 100%);position:relative;overflow:hidden;padding:4.4rem 0 3.6rem;} .news-grid{position:absolute;inset:0;background-image:linear-gradient(rgba(255,255,255,.08) 1px,transparent 1px),linear-gradient(90deg,rgba(255,255,255,.08) 1px,transparent 1px);background-size:60px 60px;} .news-glow{position:absolute;inset:0;background:radial-gradient(ellipse 55% 50% at 50% 40%,rgba(255,255,255,.3) 0%,transparent 65%);} .news-inner{position:relative;z-index:2;} .news-tags{display:flex;gap:.6rem;flex-wrap:wrap;align-items:center;margin-bottom:1.5rem;font-family:'DM Mono',monospace;font-size:.62rem;letter-spacing:.05em;} .news-tags .pill{background:rgba(255,255,255,.55);color:var(--coal);border:1px solid rgba(255,255,255,.75);padding:.22rem .75rem;} .news-tags .pill.b{background:rgba(255,255,255,.92);color:var(--coal);border-color:rgba(255,255,255,.95);} .news-tags .date{color:rgba(255,255,255,.78);} .date-chip{display:inline-flex;align-items:center;gap:.7rem;padding:.5rem 1.1rem;border:1px solid rgba(255,255,255,.55);background:rgba(255,255,255,.18);margin-bottom:1.8rem;} .date-chip .dot{width:6px;height:6px;border-radius:50%;background:#ffffff;animation:blink 2.2s ease-in-out infinite;} .date-chip span{font-family:'DM Mono',monospace;font-size:.62rem;letter-spacing:.18em;text-transform:uppercase;color:#ffffff;} @keyframes blink{0%,100%{opacity:1;}50%{opacity:.15;}} .news-title{font-family:'Shippori Mincho B1',serif;font-size:clamp(1.5rem,3vw,2.15rem);font-weight:800;color:#fff;line-height:1.55;margin-bottom:1.3rem;} .news-title .accent{color:var(--coal);} .news-lead{font-size:.95rem;color:rgba(255,255,255,.88);line-height:2;max-width:600px;} /* metric strip (replaces countdown strip) */ .metric-strip{margin-top:2.2rem;display:flex;background:rgba(255,255,255,.24);border:1px solid rgba(255,255,255,.45);} .metric-item{flex:1;padding:1rem 1rem;text-align:center;} .metric-item+.metric-item{border-left:1px solid rgba(255,255,255,.45);} .metric-num{font-family:'Shippori Mincho B1',serif;font-size:1.3rem;font-weight:800;color:var(--coal);white-space:nowrap;} .metric-num .arrow{color:rgba(255,255,255,.35);font-weight:400;margin:0 .15rem;} .metric-lbl{font-family:'DM Mono',monospace;font-size:.54rem;letter-spacing:.04em;color:rgba(10,30,50,.75);margin-top:.5rem;line-height:1.6;} /* SECTION */ .post-sec{padding:3rem 0;border-bottom:1px solid var(--border);background:var(--paper);} .post-sec:last-of-type{border-bottom:none;} .post-sec.alt{background:var(--bg);} .sec-eyebrow{font-family:'DM Mono',monospace;font-size:.6rem;letter-spacing:.25em;text-transform:uppercase;color:var(--primary);margin-bottom:.7rem;display:flex;align-items:center;gap:.6rem;} .sec-eyebrow::before{content:'';width:20px;height:1px;background:var(--primary);opacity:.5;} .post-sec h2{font-family:'Shippori Mincho B1',serif;font-size:clamp(1.25rem,2.1vw,1.6rem);font-weight:700;line-height:1.5;margin-bottom:1.1rem;color:var(--coal);} .post-sec p{font-size:.9rem;color:var(--muted);line-height:2;margin-bottom:1.1rem;} .post-sec p:last-child{margin-bottom:0;} .post-sec h4{font-size:.82rem;font-weight:700;color:var(--coal);margin:1.4rem 0 .6rem;} /* inline links to source plans / rubric */ .post-sec a{color:var(--primary);text-decoration:underline;text-decoration-color:var(--primary-bd);text-decoration-thickness:1px;text-underline-offset:2px;} .post-sec a:hover{color:var(--primary-lt);} .converge-after a{color:#fff;text-decoration-color:rgba(255,255,255,.5);} .converge-after a:hover{color:var(--teal-lt);} .compare-box .cx-name a{color:var(--coal);text-decoration-color:var(--border2);} .compare-box .cx-name a:hover{color:var(--primary);} /* persona intro cards */ .persona-grid{display:grid;grid-template-columns:1fr 1fr 1fr;gap:.8rem;margin:1.3rem 0;} .persona-card{background:var(--bg);border:1px solid var(--border);padding:.9rem .9rem;} .persona-card .pc-role{font-family:'DM Mono',monospace;font-size:.54rem;letter-spacing:.08em;color:var(--primary);text-transform:uppercase;margin-bottom:.35rem;} .persona-card .pc-name{font-size:.82rem;font-weight:700;color:var(--coal);margin-bottom:.4rem;} .persona-card .pc-d{font-size:.72rem;color:var(--muted);line-height:1.7;} /* score table */ .score-table{width:100%;border-collapse:collapse;margin:1.2rem 0;font-size:.76rem;} .score-table caption{text-align:left;font-family:'DM Mono',monospace;font-size:.58rem;letter-spacing:.06em;color:var(--muted);text-transform:uppercase;margin-bottom:.5rem;caption-side:top;} .score-table th,.score-table td{border:1px solid var(--border);padding:.5rem .55rem;text-align:center;} .score-table thead th{background:var(--coal);color:#fff;font-weight:700;font-size:.68rem;} .score-table td.axis{text-align:left;color:var(--muted);} .score-table tbody tr:nth-child(even){background:var(--bg);} .score-table tr.total td{font-weight:700;color:var(--coal);background:var(--primary-bg) !important;} .score-table td.num{font-family:'DM Mono',monospace;} /* convergence visual */ .converge-wrap{display:grid;grid-template-columns:1fr auto 1fr;gap:1rem;align-items:center;margin:1.6rem 0;} .converge-before{background:var(--bg);border:1px solid var(--border);padding:1.1rem 1.2rem;} .converge-before .cb-title{font-family:'DM Mono',monospace;font-size:.56rem;letter-spacing:.08em;color:var(--muted);margin-bottom:.7rem;text-transform:uppercase;} .converge-before .cb-row{display:flex;justify-content:space-between;align-items:baseline;font-size:.8rem;padding:.32rem 0;border-bottom:1px dashed var(--border2);color:var(--coal);} .converge-before .cb-row:last-child{border-bottom:none;} .converge-before .cb-row .cb-num{font-family:'DM Mono',monospace;font-weight:700;} .converge-before .cb-gap{margin-top:.6rem;font-family:'DM Mono',monospace;font-size:.62rem;color:var(--amber);text-align:right;} .converge-arrow{font-size:1.5rem;color:var(--primary);text-align:center;line-height:1;} .converge-after{background:linear-gradient(135deg,var(--primary),var(--coal));padding:1.3rem 1.1rem;text-align:center;color:#fff;} .converge-after .ca-lbl{font-family:'DM Mono',monospace;font-size:.54rem;letter-spacing:.1em;color:var(--teal-lt);text-transform:uppercase;margin-bottom:.55rem;} .converge-after .ca-num{font-family:'Shippori Mincho B1',serif;font-size:1.85rem;font-weight:800;} .converge-after .ca-sub{font-size:.62rem;color:rgba(255,255,255,.55);margin-top:.4rem;} @media(max-width:640px){ .converge-wrap{grid-template-columns:1fr;} .converge-arrow{transform:rotate(90deg);padding:.2rem 0;} } /* two-plan compare */ .compare-grid{display:grid;grid-template-columns:1fr auto 1fr;gap:.9rem;align-items:center;margin:1.3rem 0;} .compare-box{background:var(--paper);border:1px solid var(--border);border-top:3px solid var(--primary);padding:1rem 1rem;text-align:center;} .compare-box.tl{border-top-color:var(--teal);} .compare-box .cx-name{font-size:.76rem;color:var(--muted);margin-bottom:.45rem;} .compare-box .cx-num{font-family:'Shippori Mincho B1',serif;font-size:1.55rem;font-weight:800;color:var(--coal);} .compare-box .cx-sub{font-family:'DM Mono',monospace;font-size:.56rem;color:var(--muted);margin-top:.35rem;} .compare-vs{font-family:'DM Mono',monospace;font-size:.68rem;color:var(--faint);} .diff-note{text-align:center;font-family:'DM Mono',monospace;font-size:.68rem;color:var(--teal);letter-spacing:.03em;margin-top:-.2rem;} @media(max-width:640px){ .compare-grid{grid-template-columns:1fr;} .compare-vs{display:none;} } /* callout box for the scope correction */ .note-box{margin:1.4rem 0;padding:1.1rem 1.2rem;background:var(--am-bg);border:1px solid var(--am-bd);border-left:3px solid var(--amber);} .note-box .nb-lbl{font-family:'DM Mono',monospace;font-size:.56rem;letter-spacing:.1em;color:var(--amber);text-transform:uppercase;margin-bottom:.5rem;} .note-box p{font-size:.82rem;color:var(--coal);line-height:1.9;margin-bottom:0;} /* mini value cards */ .mini-grid{display:grid;grid-template-columns:1fr 1fr 1fr;gap:1rem;margin:1.4rem 0;} .mini-card{background:var(--bg);border:1px solid var(--border);border-top:3px solid var(--primary);padding:1.2rem 1.1rem;} .mini-card.tl{border-top-color:var(--teal);} .mini-card .mc-lbl{font-family:'DM Mono',monospace;font-size:.5rem;letter-spacing:.12em;text-transform:uppercase;color:var(--primary);margin-bottom:.4rem;} .mini-card.tl .mc-lbl{color:var(--teal);} .mini-card .mc-t{font-size:.82rem;font-weight:700;color:var(--coal);margin-bottom:.4rem;line-height:1.5;} .mini-card .mc-d{font-size:.75rem;color:var(--muted);line-height:1.7;} /* roadmap list */ .road-list{margin:1.2rem 0;} .road-item{display:flex;gap:.9rem;padding:.85rem 0;border-bottom:1px solid var(--border);} .road-item:last-child{border-bottom:none;} .road-num{font-family:'DM Mono',monospace;font-size:.72rem;font-weight:700;color:var(--primary);flex-shrink:0;width:1.4rem;} .road-t{font-size:.84rem;font-weight:700;color:var(--coal);margin-bottom:.25rem;} .road-d{font-size:.78rem;color:var(--muted);line-height:1.8;} /* CTA */ .cta-box{margin-top:1.6rem;background:linear-gradient(135deg,var(--primary),var(--coal));padding:2.2rem 2rem;text-align:center;} .cta-box .ct-tag{font-family:'DM Mono',monospace;font-size:.6rem;letter-spacing:.18em;text-transform:uppercase;color:var(--teal-lt);margin-bottom:.6rem;} .cta-box h3{font-family:'Shippori Mincho B1',serif;font-size:1.05rem;font-weight:700;color:#fff;margin-bottom:.5rem;} .cta-box p{font-size:.82rem;color:rgba(255,255,255,.6);margin-bottom:1.2rem;} .cta-box a.btn{display:inline-block;padding:.75rem 1.6rem;background:#fff;color:var(--primary);font-weight:700;font-size:.84rem;text-decoration:none;} .author-box{margin-top:2.2rem;padding-top:1.8rem;border-top:1px solid var(--border);display:flex;gap:1.1rem;align-items:flex-start;} .author-avatar{width:40px;height:40px;border-radius:50%;background:var(--primary);color:#fff;display:flex;align-items:center;justify-content:center;font-family:'Shippori Mincho B1',serif;font-weight:700;flex-shrink:0;font-size:.85rem;} .author-name{font-size:.82rem;font-weight:700;color:var(--coal);margin-bottom:.2rem;} .author-role{font-family:'DM Mono',monospace;font-size:.6rem;color:var(--primary);margin-bottom:.5rem;} .author-bio{font-size:.76rem;color:var(--muted);line-height:1.8;} footer{background:var(--ink);padding:2rem 3rem;display:flex;align-items:center;justify-content:space-between;} .footer-l{font-family:'DM Mono',monospace;font-size:.65rem;color:rgba(255,255,255,.28);display:flex;align-items:center;gap:.6rem;} .footer-brand{color:var(--primary-lt);opacity:.8;letter-spacing:.08em;} .footer-r{font-family:'DM Mono',monospace;font-size:.52rem;color:rgba(255,255,255,.2);text-align:right;line-height:1.9;} @media(max-width:760px){ .con{padding:0 1.5rem;} .mini-grid{grid-template-columns:1fr;} .persona-grid{grid-template-columns:1fr;} .metric-strip{flex-direction:column;} .metric-item+.metric-item{border-left:none;border-top:1px solid rgba(255,255,255,.45);} footer{flex-direction:column;gap:.8rem;text-align:center;} .footer-r{text-align:center;} .score-table{font-size:.66rem;} .score-table th,.score-table td{padding:.35rem .3rem;} } </style><div id="e0langbar" style="background:rgba(255, 255, 255, 0.97);border-bottom:1px solid var(--border);padding:0.55rem 3rem;display:flex;justify-content:flex-end;align-items:center;"><div class="lang-toggle"><button class="lang-btn active" id="btn-ja" data-lang="ja">JPN</button><div class="lang-divider"></div>
<button class="lang-btn" id="btn-en" data-lang="en">EN</button></div></div><header class="news-header"><div class="news-grid"></div><div class="news-glow"></div>
<div class="con news-inner"><div class="news-tags"><span class="pill b" data-i18n data-ja="ケーススタディ" data-en="Case Study">ケーススタディ</span><span class="pill" data-i18n data-ja="SEGT収束" data-en="SEGT Convergence">SEGT収束</span><span class="date">2026年8月8日</span></div>
<div class="date-chip rv"><div class="dot"></div><span data-i18n data-ja="2026年8月5日 体験セミナー・ライブデモより" data-en="From the live demo at the Aug 5, 2026 seminar">2026年8月5日 体験セミナー・ライブデモより</span></div>
<h1 class="news-title"><span data-i18n data-ja="同じ審査員・同じ基準で採点しても、生成AIの評価は20.8点ブレる。" data-en="Same judges, same criteria — yet generative-AI scores can drift by 20.8 points.">同じ審査員・同じ基準で採点しても、生成AIの評価は20.8点ブレる。</span><br><span class="accent" data-i18n data-ja="eval000のSEGT収束計算が、そのブレを1つの標準評価にまとめた実例。" data-en="Here's a real example of eval000's SEGT convergence turning that drift into a single standard evaluation.">eval000のSEGT収束計算が、そのブレを1つの標準評価にまとめた実例。</span></h1><p class="news-lead" data-i18n data-ja="2026年8月5日開催のeval000体験セミナー・ライブデモでは、同じ事業計画・同じ評価ルーブリック・同じ外生の原理Nのもとで、3種類のAIペルソナ審査員に採点してもらいました。結果は最大20.8点のブレ。ここにSEGT（標準評価生成理論）の収束計算を適用したところ、ブレは単一の標準評価値 V* に収束しました。本記事ではこのライブデモの実データをもとに、生成AIの評価がなぜバラつくのか、SEGTがそのブレをどう解消するのかを解説します。" data-en="At the eval000 hands-on seminar held on August 5, 2026, three different AI persona judges scored the same business plan under the same evaluation rubric and the same External Principle N. The result: a gap of up to 20.8 points between judges. Applying eval000's SEGT (Standard Evaluation Generation Theory) convergence calculation collapsed that gap into a single standard evaluation value, V*. Using the real data from this live demo, this post explains why generative-AI evaluation varies so much — and how SEGT resolves that variance.">2026年8月5日開催のeval000体験セミナー・ライブデモでは、同じ事業計画・同じ評価ルーブリック・同じ外生の原理Nのもとで、3種類のAIペルソナ審査員に採点してもらいました。結果は最大20.8点のブレ。ここにSEGT（標準評価生成理論）の収束計算を適用したところ、ブレは単一の標準評価値 V* に収束しました。本記事ではこのライブデモの実データをもとに、生成AIの評価がなぜバラつくのか、SEGTがそのブレをどう解消するのかを解説します。</p><div class="metric-strip rv"><div class="metric-item"><div class="metric-num">20.8<span style="font-size:0.8rem;">点</span></div>
<div class="metric-lbl" data-i18n data-ja="3ペルソナ間の評価差<br>（越中八尾プラン）" data-en="Gap between 3 AI judges<br>(Ecchu-Yao plan)">3ペルソナ間の評価差<br>（越中八尾プラン）</div>
</div><div class="metric-item"><div class="metric-num">80.3<span style="font-size:0.8rem;">点</span></div>
<div class="metric-lbl" data-i18n data-ja="SEGT収束後の<br>標準評価 V*" data-en="Standard evaluation V*<br>after SEGT convergence">SEGT収束後の<br>標準評価 V*</div>
</div><div class="metric-item"><div class="metric-num">0.2<span style="font-size:0.8rem;">点</span></div>
<div class="metric-lbl" data-i18n data-ja="2つの事業計画の<br>V*同士の差" data-en="Gap between the two<br>plans' V* values">2つの事業計画の<br>V*同士の差</div>
</div></div></div></header><!-- 01 ライブデモの実データ --><section class="post-sec alt"><div class="con"><div class="sec-eyebrow">01 &mdash; <span data-i18n data-ja="ライブデモの実データ" data-en="Live Demo Data">ライブデモの実データ</span></div>
<h2 data-i18n data-ja="同じ審査員・同じ基準で採点しても、スコアは大きくバラつく" data-en="Same judges, same criteria — yet the scores vary widely">同じ審査員・同じ基準で採点しても、スコアは大きくバラつく</h2><p data-i18n data-ja="今回のデモでは、地域活性化に関する2つの事業計画（「<a href='https://www.award-of.net/Yatsuo_2026PoC_v4_1.html' target='_blank' rel='noopener'>越中八尾</a>」「<a href='https://ecobottle-campus--xp34hiw.gamma.site/' target='_blank' rel='noopener'>EcoBottle</a>」）を対象に、外生の原理N（審査の目的）と<a href='https://www.award-of.net/files/rubric4bizBG.html' target='_blank' rel='noopener'>Evaluation Rubric（BGルーブリック・4軸）</a>を固定したまま、3種類のAIペルソナ審査員に評価してもらいました。" data-en="The demo evaluated two regional-revitalization business plans (&quot;<a href='https://www.award-of.net/Yatsuo_2026PoC_v4_1.html' target='_blank' rel='noopener'>Ecchu-Yao</a>&quot; and &quot;<a href='https://ecobottle-campus--xp34hiw.gamma.site/' target='_blank' rel='noopener'>EcoBottle</a>&quot;). External Principle N (the review's purpose) and the <a href='https://www.award-of.net/files/rubric4bizBG.html' target='_blank' rel='noopener'>Evaluation Rubric (the 4-axis &quot;BG&quot; rubric)</a> were held fixed, while three different AI persona judges scored each plan.">今回のデモでは、地域活性化に関する2つの事業計画（「<a href="https://www.award-of.net/Yatsuo_2026PoC_v4_1.html" target="_blank" rel="noopener">越中八尾</a>」「<a href="https://ecobottle-campus--xp34hiw.gamma.site/" target="_blank" rel="noopener">EcoBottle</a>」）を対象に、外生の原理N（審査の目的）と<a href="https://www.award-of.net/files/rubric4bizBG.html" target="_blank" rel="noopener">Evaluation Rubric（BGルーブリック・4軸）</a>を固定したまま、3種類のAIペルソナ審査員に評価してもらいました。</p><div class="persona-grid rv"><div class="persona-card"><div class="pc-role" data-i18n data-ja="ペルソナ 1" data-en="PERSONA 1">ペルソナ 1</div>
<div class="pc-name" data-i18n data-ja="革新派（新興スタートアップ投資家）" data-en="The Innovator (early-stage VC)">革新派（新興スタートアップ投資家）</div>
<div class="pc-d" data-i18n data-ja="新規性・独創性・先駆性を最重視。「これは世界初か？」が口癖。" data-en="Prioritizes novelty and originality above all. Signature question: &quot;Is this a world first?&quot;">新規性・独創性・先駆性を最重視。「これは世界初か？」が口癖。</div>
</div><div class="persona-card"><div class="pc-role" data-i18n data-ja="ペルソナ 2" data-en="PERSONA 2">ペルソナ 2</div>
<div class="pc-name" data-i18n data-ja="実務派（大手メーカー事業開発部長）" data-en="The Pragmatist (corporate biz-dev lead)">実務派（大手メーカー事業開発部長）</div>
<div class="pc-d" data-i18n data-ja="実績・数値根拠・実行可能性を最重視。「根拠データはあるか？」が口癖。" data-en="Prioritizes track record and hard numbers. Signature question: &quot;Where's the supporting data?&quot;">実績・数値根拠・実行可能性を最重視。「根拠データはあるか？」が口癖。</div>
</div><div class="persona-card"><div class="pc-role" data-i18n data-ja="ペルソナ 3" data-en="PERSONA 3">ペルソナ 3</div>
<div class="pc-name" data-i18n data-ja="バランス派（行政系支援機関の審査委員）" data-en="The Balancer (public-sector reviewer)">バランス派（行政系支援機関の審査委員）</div>
<div class="pc-d" data-i18n data-ja="全評価軸を均等に重視。偏りを嫌い公正さを優先。「総合的に見ると」が口癖。" data-en="Weighs every axis equally, favoring fairness over emphasis. Signature phrase: &quot;Looking at this holistically...&quot;">全評価軸を均等に重視。偏りを嫌い公正さを優先。「総合的に見ると」が口癖。</div>
</div></div><table class="score-table rv"><caption data-i18n data-ja="プランA「<a href='https://www.award-of.net/Yatsuo_2026PoC_v4_1.html' target='_blank' rel='noopener'>越中八尾</a>」／<a href='https://www.award-of.net/files/rubric4bizBG.html' target='_blank' rel='noopener'>BGルーブリック</a>・実値" data-en="Plan A &quot;<a href='https://www.award-of.net/Yatsuo_2026PoC_v4_1.html' target='_blank' rel='noopener'>Ecchu-Yao</a>&quot; / <a href='https://www.award-of.net/files/rubric4bizBG.html' target='_blank' rel='noopener'>BG Rubric</a>, actual scores">プランA「<a href="https://www.award-of.net/Yatsuo_2026PoC_v4_1.html" target="_blank" rel="noopener">越中八尾</a>」／<a href="https://www.award-of.net/files/rubric4bizBG.html" target="_blank" rel="noopener">BGルーブリック</a>・実値</caption><thead><tr><th data-i18n data-ja="評価軸" data-en="Axis">評価軸</th><th data-i18n data-ja="実務派" data-en="Pragmatist">実務派</th><th data-i18n data-ja="革新派" data-en="Innovator">革新派</th><th data-i18n data-ja="バランス派" data-en="Balancer">バランス派</th><th data-i18n data-ja="平均" data-en="Average">平均</th></tr></thead><tbody><tr><td class="axis" data-i18n data-ja="バリューイノベーション (30%)" data-en="Value Innovation (30%)">バリューイノベーション (30%)</td><td class="num">60.0</td><td class="num">90.0</td><td class="num">83.3</td><td class="num">77.8</td></tr><tr><td class="axis" data-i18n data-ja="市場の可能性 (20%)" data-en="Market Potential (20%)">市場の可能性 (20%)</td><td class="num">70.0</td><td class="num">85.0</td><td class="num">80.0</td><td class="num">78.3</td></tr><tr><td class="axis" data-i18n data-ja="商業的実行可能性 (25%)" data-en="Commercial Feasibility (25%)">商業的実行可能性 (25%)</td><td class="num">65.0</td><td class="num">88.0</td><td class="num">84.0</td><td class="num">79.0</td></tr><tr><td class="axis" data-i18n data-ja="技術的実現可能性 (25%)" data-en="Technical Feasibility (25%)">技術的実現可能性 (25%)</td><td class="num">80.0</td><td class="num">92.0</td><td class="num">88.0</td><td class="num">86.7</td></tr><tr class="total"><td class="axis" data-i18n data-ja="加重合計" data-en="Weighted Total">加重合計</td><td class="num">68.2</td><td class="num">89.0</td><td class="num">84.0</td><td class="num">80.4</td></tr></tbody></table><p data-i18n data-ja="加重合計は実務派68.2点、バランス派84.0点、革新派89.0点。同じ計画・同じ基準にもかかわらず、審査員の視点によって20.8点もの差が生まれました。3者を単純に平均すると80.4点になりますが、これは「多数決」であり「標準化」ではありません。" data-en="The weighted totals were 68.2 (Pragmatist), 84.0 (Balancer), and 89.0 (Innovator) — a 20.8-point gap for the same plan under the same criteria, driven purely by each judge's perspective. A simple average of the three comes to 80.4, but that's a majority vote, not a standard.">加重合計は実務派68.2点、バランス派84.0点、革新派89.0点。同じ計画・同じ基準にもかかわらず、審査員の視点によって20.8点もの差が生まれました。3者を単純に平均すると80.4点になりますが、これは「多数決」であり「標準化」ではありません。</p><div class="converge-wrap rv"><div class="converge-before"><div class="cb-title" data-i18n data-ja="収束前（<a href='https://www.award-of.net/Yatsuo_2026PoC_v4_1.html' target='_blank' rel='noopener'>越中八尾</a>／3ペルソナの加重合計）" data-en="Before convergence (<a href='https://www.award-of.net/Yatsuo_2026PoC_v4_1.html' target='_blank' rel='noopener'>Ecchu-Yao</a> / weighted totals)">収束前（<a href="https://www.award-of.net/Yatsuo_2026PoC_v4_1.html" target="_blank" rel="noopener">越中八尾</a>／3ペルソナの加重合計）</div>
<div class="cb-row"><span data-i18n data-ja="実務派" data-en="Pragmatist">実務派</span><span class="cb-num">68.2</span></div>
<div class="cb-row"><span data-i18n data-ja="バランス派" data-en="Balancer">バランス派</span><span class="cb-num">84.0</span></div>
<div class="cb-row"><span data-i18n data-ja="革新派" data-en="Innovator">革新派</span><span class="cb-num">89.0</span></div>
<div class="cb-gap" data-i18n data-ja="差 20.8点" data-en="Gap: 20.8 pts">差 20.8点</div>
</div><div class="converge-arrow">→</div><div class="converge-after"><div class="ca-lbl" data-i18n data-ja="SEGT収束後" data-en="After SEGT convergence">SEGT収束後</div>
<div class="ca-num">80.3<span style="font-size:1rem;">点</span></div><div class="ca-sub" data-i18n data-ja="標準評価 V*（<a href='https://www.award-of.net/Yatsuo_2026PoC_v4_1.html' target='_blank' rel='noopener'>越中八尾</a>）" data-en="Standard evaluation V* (<a href='https://www.award-of.net/Yatsuo_2026PoC_v4_1.html' target='_blank' rel='noopener'>Ecchu-Yao</a>)">標準評価 V*（<a href="https://www.award-of.net/Yatsuo_2026PoC_v4_1.html" target="_blank" rel="noopener">越中八尾</a>）</div>
</div></div><table class="score-table rv"><caption data-i18n data-ja="プランB「<a href='https://ecobottle-campus--xp34hiw.gamma.site/' target='_blank' rel='noopener'>EcoBottle</a>」／<a href='https://www.award-of.net/files/rubric4bizBG.html' target='_blank' rel='noopener'>BGルーブリック</a>・実値" data-en="Plan B &quot;<a href='https://ecobottle-campus--xp34hiw.gamma.site/' target='_blank' rel='noopener'>EcoBottle</a>&quot; / <a href='https://www.award-of.net/files/rubric4bizBG.html' target='_blank' rel='noopener'>BG Rubric</a>, actual scores">プランB「<a href="https://ecobottle-campus--xp34hiw.gamma.site/" target="_blank" rel="noopener">EcoBottle</a>」／<a href="https://www.award-of.net/files/rubric4bizBG.html" target="_blank" rel="noopener">BGルーブリック</a>・実値</caption><thead><tr><th data-i18n data-ja="評価軸" data-en="Axis">評価軸</th><th data-i18n data-ja="実務派" data-en="Pragmatist">実務派</th><th data-i18n data-ja="革新派" data-en="Innovator">革新派</th><th data-i18n data-ja="バランス派" data-en="Balancer">バランス派</th><th data-i18n data-ja="平均" data-en="Average">平均</th></tr></thead><tbody><tr><td class="axis" data-i18n data-ja="バリューイノベーション (30%)" data-en="Value Innovation (30%)">バリューイノベーション (30%)</td><td class="num">70.0</td><td class="num">83.3</td><td class="num">83.3</td><td class="num">78.9</td></tr><tr><td class="axis" data-i18n data-ja="市場の可能性 (20%)" data-en="Market Potential (20%)">市場の可能性 (20%)</td><td class="num">75.0</td><td class="num">80.0</td><td class="num">80.0</td><td class="num">78.3</td></tr><tr><td class="axis" data-i18n data-ja="商業的実行可能性 (25%)" data-en="Commercial Feasibility (25%)">商業的実行可能性 (25%)</td><td class="num">68.0</td><td class="num">84.0</td><td class="num">88.0</td><td class="num">80.0</td></tr><tr><td class="axis" data-i18n data-ja="技術的実現可能性 (25%)" data-en="Technical Feasibility (25%)">技術的実現可能性 (25%)</td><td class="num">80.0</td><td class="num">88.0</td><td class="num">84.0</td><td class="num">84.0</td></tr><tr class="total"><td class="axis" data-i18n data-ja="加重合計" data-en="Weighted Total">加重合計</td><td class="num">73.0</td><td class="num">84.0</td><td class="num">84.0</td><td class="num">80.3</td></tr></tbody></table><p data-i18n data-ja="EcoBottleでも同様に3ペルソナの評価がバラつきました。加重合計は実務派73.0点、バランス派・革新派がともに84.0点で、差は11.0点。越中八尾よりは小さいものの、単純平均（80.3点）はやはり「多数決」にすぎません。" data-en="EcoBottle showed the same pattern. The weighted totals were 73.0 (Pragmatist) and 84.0 for both the Balancer and the Innovator — an 11.0-point gap. Smaller than Ecchu-Yao's, but the simple average (80.3) is still just a majority vote.">EcoBottleでも同様に3ペルソナの評価がバラつきました。加重合計は実務派73.0点、バランス派・革新派がともに84.0点で、差は11.0点。越中八尾よりは小さいものの、単純平均（80.3点）はやはり「多数決」にすぎません。</p><div class="converge-wrap rv"><div class="converge-before"><div class="cb-title" data-i18n data-ja="収束前（<a href='https://ecobottle-campus--xp34hiw.gamma.site/' target='_blank' rel='noopener'>EcoBottle</a>／3ペルソナの加重合計）" data-en="Before convergence (<a href='https://ecobottle-campus--xp34hiw.gamma.site/' target='_blank' rel='noopener'>EcoBottle</a> / weighted totals)">収束前（<a href="https://ecobottle-campus--xp34hiw.gamma.site/" target="_blank" rel="noopener">EcoBottle</a>／3ペルソナの加重合計）</div>
<div class="cb-row"><span data-i18n data-ja="実務派" data-en="Pragmatist">実務派</span><span class="cb-num">73.0</span></div>
<div class="cb-row"><span data-i18n data-ja="バランス派" data-en="Balancer">バランス派</span><span class="cb-num">84.0</span></div>
<div class="cb-row"><span data-i18n data-ja="革新派" data-en="Innovator">革新派</span><span class="cb-num">84.0</span></div>
<div class="cb-gap" data-i18n data-ja="差 11.0点" data-en="Gap: 11.0 pts">差 11.0点</div>
</div><div class="converge-arrow">→</div><div class="converge-after"><div class="ca-lbl" data-i18n data-ja="SEGT収束後" data-en="After SEGT convergence">SEGT収束後</div>
<div class="ca-num">80.1<span style="font-size:1rem;">点</span></div><div class="ca-sub" data-i18n data-ja="標準評価 V*（<a href='https://ecobottle-campus--xp34hiw.gamma.site/' target='_blank' rel='noopener'>EcoBottle</a>）" data-en="Standard evaluation V* (<a href='https://ecobottle-campus--xp34hiw.gamma.site/' target='_blank' rel='noopener'>EcoBottle</a>)">標準評価 V*（<a href="https://ecobottle-campus--xp34hiw.gamma.site/" target="_blank" rel="noopener">EcoBottle</a>）</div>
</div></div><p data-i18n data-ja="興味深いのは、越中八尾（審査員間のバラつき20.8点）とEcoBottle（バラつき11.0点）という、意見の割れ方が異なる2つの計画を比べたときの結果です。" data-en="What's striking is how this plays out across the two plans, which had very different degrees of judge disagreement — 20.8 points for Ecchu-Yao versus 11.0 points for EcoBottle.">興味深いのは、越中八尾（審査員間のバラつき20.8点）とEcoBottle（バラつき11.0点）という、意見の割れ方が異なる2つの計画を比べたときの結果です。</p><div class="compare-grid rv"><div class="compare-box"><div class="cx-name"><a href="https://www.award-of.net/Yatsuo_2026PoC_v4_1.html" target="_blank" rel="noopener" data-i18n data-ja="越中八尾" data-en="Ecchu-Yao">越中八尾</a></div>
<div class="cx-num">V* = 80.3</div><div class="cx-sub" data-i18n data-ja="収束前のバラつき 20.8点" data-en="Pre-convergence gap: 20.8 pts">収束前のバラつき 20.8点</div>
</div><div class="compare-vs">vs</div><div class="compare-box tl"><div class="cx-name"><a href="https://ecobottle-campus--xp34hiw.gamma.site/" target="_blank" rel="noopener">EcoBottle</a></div>
<div class="cx-num">V* = 80.1</div><div class="cx-sub" data-i18n data-ja="収束前のバラつき 11.0点" data-en="Pre-convergence gap: 11.0 pts">収束前のバラつき 11.0点</div>
</div></div><div class="diff-note" data-i18n data-ja="収束後のV*の差はわずか0.2点" data-en="After convergence, the two V* values differ by only 0.2 points">収束後のV*の差はわずか0.2点</div>
<p style="margin-top:1.3rem;" data-i18n data-ja="審査員間のブレの大きさは計画ごとに違っても、外生の原理Nに拘束された収束計算をかけると、どちらも同水準の標準評価に落ち着きました。個々の審査員のブレの大きさに依存せず、安定した基準点を導けることがうかがえます。" data-en="Even though the size of the pre-convergence disagreement differed between the two plans, running the convergence calculation bound to External Principle N settled both plans onto a comparable standard-evaluation level — suggesting the process can reach a stable benchmark regardless of how scattered the individual judges were.">審査員間のブレの大きさは計画ごとに違っても、外生の原理Nに拘束された収束計算をかけると、どちらも同水準の標準評価に落ち着きました。個々の審査員のブレの大きさに依存せず、安定した基準点を導けることがうかがえます。</p></div>
</section><!-- 02 なぜ収束するのか --><section class="post-sec"><div class="con"><div class="sec-eyebrow">02 &mdash; <span data-i18n data-ja="なぜ収束するのか" data-en="Why It Converges">なぜ収束するのか</span></div>
<h2 data-i18n data-ja="SEGTが解消するのは「多数決」ではなく「基準のブレ」" data-en="SEGT resolves a drifting standard — not a majority vote">SEGTが解消するのは「多数決」ではなく「基準のブレ」</h2><p data-i18n data-ja="eval000は、外生の原理N（何のために評価するか）を先に定義し、その原理に拘束された写像 v(t+1) = F_N(v(t), R) を反復計算することで、単一の固定点 v* に収束させます。この収束プロセスは、バナッハの不動点定理という数学的な定理によって裏付けられています。" data-en="eval000 first defines External Principle N &mdash; the purpose of the review &mdash; and then repeatedly applies a mapping bound to that principle, v(t+1) = F_N(v(t), R), until it converges to a single fixed point, v*. This convergence process is grounded in a mathematical result known as the Banach fixed-point theorem.">eval000は、外生の原理N（何のために評価するか）を先に定義し、その原理に拘束された写像 v(t+1) = F_N(v(t), R) を反復計算することで、単一の固定点 v* に収束させます。この収束プロセスは、バナッハの不動点定理という数学的な定理によって裏付けられています。</p><p data-i18n data-ja="ポイントは、平均点と異なる数値を作ることが目的ではないということです。変動する個々の評価の背後にある標準評価（Evaluation Standard）を構成し、再現可能な「ものさし」（Evaluation Measure）として使えるようにすることに価値があります。" data-en="The point isn't to produce a number that differs from the average. The value lies in constructing the Evaluation Standard that sits behind the fluctuating individual scores, so it can be used as a reproducible &quot;ruler&quot; &mdash; an Evaluation Measure.">ポイントは、平均点と異なる数値を作ることが目的ではないということです。変動する個々の評価の背後にある標準評価（Evaluation Standard）を構成し、再現可能な「ものさし」（Evaluation Measure）として使えるようにすることに価値があります。</p><div class="note-box rv"><div class="nb-lbl" data-i18n data-ja="正確に言うと" data-en="To be precise">正確に言うと</div>
<p data-i18n data-ja="バナッハの不動点定理が保証するのは、同一の評価チーム（今回のデモでは3ペルソナ固定）・同一の入力・同一のN・同一のルーブリックのもとでは、計算のたびに同じv*が得られるということです。評価するチーム自体が変わった場合（別のペルソナ構成や、人間の審査員チームなど）に同じ標準評価へ到達できるかどうかは、この定理が直接保証する範囲の外にあります。eval000ではこの区別を明確にしたうえで、異なる評価者集団間の収束性についてもPoCで検証を重ねています。" data-en="What the Banach fixed-point theorem actually guarantees is that, given the same evaluator group (here, the same three personas), the same input, the same N, and the same rubric, the calculation reaches the same v* every time. Whether a different evaluator group &mdash; a different set of personas, or a panel of human judges &mdash; would converge on the same standard evaluation is a separate question, outside what this theorem alone guarantees. eval000 keeps this distinction explicit, and is validating convergence across different evaluator groups as part of its ongoing PoC work.">バナッハの不動点定理が保証するのは、同一の評価チーム（今回のデモでは3ペルソナ固定）・同一の入力・同一のN・同一のルーブリックのもとでは、計算のたびに同じv*が得られるということです。評価するチーム自体が変わった場合（別のペルソナ構成や、人間の審査員チームなど）に同じ標準評価へ到達できるかどうかは、この定理が直接保証する範囲の外にあります。eval000ではこの区別を明確にしたうえで、異なる評価者集団間の収束性についてもPoCで検証を重ねています。</p></div>
<div class="mini-grid rv"><div class="mini-card"><div class="mc-lbl">POINT 01</div>
<div class="mc-t" data-i18n data-ja="審査員構成に左右されないブレない評価" data-en="An evaluation that doesn't depend on panel composition">審査員構成に左右<br>されないブレない評価</div>
<div class="mc-d" data-i18n data-ja="複数のAIペルソナ審査員の評価傾向を、外生の原理Nに拘束された固定点（標準評価）へ収束させます。" data-en="Multiple AI persona judges' tendencies converge to a single fixed point bound to External Principle N — the standard evaluation.">複数のAIペルソナ審査員の評価傾向を、外生の原理Nに拘束された固定点（標準評価）へ収束させます。</div>
</div><div class="mini-card tl"><div class="mc-lbl">POINT 02</div><div class="mc-t" data-i18n data-ja="「収束の強さ」を数値で測る取り組み" data-en="Measuring &quot;how strong the convergence is&quot;">「収束の強さ」を<br>数値で測る取り組み</div>
<div class="mc-d" data-i18n data-ja="収束後のブレの小ささを示す指標（Evaluation Measure・Stabilization Ratio）の定義を進めています。今回のような収束幅を定量的に示すのが次のステップです。" data-en="We're defining metrics &mdash; an Evaluation Measure and a Stabilization Ratio &mdash; that quantify how tight the post-convergence result is. Putting a number on convergence gaps like the ones shown here is the next step.">収束後のブレの小ささを示す指標（Evaluation Measure・Stabilization Ratio）の定義を進めています。今回のような収束幅を定量的に示すのが次のステップです。</div>
</div><div class="mini-card"><div class="mc-lbl">POINT 03</div><div class="mc-t" data-i18n data-ja="評価の「方針」を最初に明文化する" data-en="The evaluation &quot;policy&quot; is written down first">評価の「方針」を<br>最初に明文化する</div>
<div class="mc-d" data-i18n data-ja="「外生的な原理」として評価方針（N）を定義し、審査の前提を明確にしたうえで収束計算にかけます。" data-en="The review policy is defined up front as an &quot;exogenous principle&quot; (N), making the premise of the review explicit before convergence runs.">「外生的な原理」として評価方針（N）を定義し、審査の前提を明確にしたうえで収束計算にかけます。</div>
</div></div></div></section><!-- 03 今後の検証 --><section class="post-sec alt"><div class="con"><div class="sec-eyebrow">03 &mdash; <span data-i18n data-ja="今後の検証" data-en="What We're Validating Next">今後の検証</span></div>
<h2 data-i18n data-ja="このデモは「第一歩」。次はPoCで実証を重ねます" data-en="This demo is a first step — next, we validate through a PoC">このデモは「第一歩」。次はPoCで実証を重ねます</h2><p data-i18n data-ja="今回のライブデモは、固定した3ペルソナ審査員チームによる1回の収束計算の実例です。この実例を土台に、eval000では3ヶ月のPoCプログラムの中で次の3点を検証しています。" data-en="This live demo shows a single convergence run by one fixed three-persona panel. Building on that, eval000 is validating the following three points over a 3-month PoC program.">今回のライブデモは、固定した3ペルソナ審査員チームによる1回の収束計算の実例です。この実例を土台に、eval000では3ヶ月のPoCプログラムの中で次の3点を検証しています。</p><div class="road-list rv"><div class="road-item"><div class="road-num">01</div>
<div><div class="road-t" data-i18n data-ja="同一条件での再現性の定量評価" data-en="Quantifying reproducibility under identical conditions">同一条件での再現性の定量評価</div>
<div class="road-d" data-i18n data-ja="同一チーム・同一条件で複数回再実施し、V*の変動幅をEvaluation Measure・Stabilization Ratioとして数値化します。" data-en="Rerunning the same team under the same conditions multiple times, and expressing how much V* varies as an Evaluation Measure and Stabilization Ratio.">同一チーム・同一条件で複数回再実施し、V*の変動幅をEvaluation Measure・Stabilization Ratioとして数値化します。</div>
</div></div><div class="road-item"><div class="road-num">02</div><div><div class="road-t" data-i18n data-ja="通常のLLM単体評価とのばらつき比較" data-en="Comparing variance against a single LLM evaluator">通常のLLM単体評価とのばらつき比較</div>
<div class="road-d" data-i18n data-ja="収束計算を通さない通常のLLM評価と比べて、SEGTがどの程度ばらつきを抑えられるかを比較します。" data-en="Comparing how much SEGT reduces variance relative to a plain LLM evaluation that skips the convergence step.">収束計算を通さない通常のLLM評価と比べて、SEGTがどの程度ばらつきを抑えられるかを比較します。</div>
</div></div><div class="road-item"><div class="road-num">03</div><div><div class="road-t" data-i18n data-ja="異なる評価者集団間の収束性の検証" data-en="Validating convergence across different evaluator groups">異なる評価者集団間の収束性の検証</div>
<div class="road-d" data-i18n data-ja="AIペルソナと人間審査員など、異なる評価者集団のあいだでどこまで標準評価が近づくのかを検証します。" data-en="Examining how closely standard evaluations align across different evaluator groups, such as AI personas versus human judges.">AIペルソナと人間審査員など、異なる評価者集団のあいだでどこまで標準評価が近づくのかを検証します。</div>
</div></div></div><div class="cta-box rv"><div class="ct-tag" data-i18n data-ja="PoC ご相談受付中" data-en="PoC Consultations Open">PoC ご相談受付中</div>
<h3 data-i18n data-ja="この収束計算を、貴社の審査プロセスで確かめてみませんか" data-en="See this convergence at work in your own review process">この収束計算を、貴社の審査プロセスで確かめてみませんか</h3><p data-i18n data-ja="3ヶ月のPoCで、Go/No-Go判定まで一気通貫で確認できます。お気軽にご相談ください。" data-en="Our 3-month PoC takes you all the way to a Go/No-Go decision. Feel free to reach out.">3ヶ月のPoCで、Go/No-Go判定まで一気通貫で確認できます。お気軽にご相談ください。</p><a class="btn" href="https://www.eval000.ai/contact" data-i18n data-ja="お問い合わせ" data-en="Contact Us">お問い合わせ</a></div>
<div class="author-box"><div class="author-avatar">乙</div><div><div class="author-name">株式会社テンプロクシー（award-of）編集部</div>
<div class="author-role">eval000.ai / award-of.net</div><div class="author-bio" data-i18n data-ja="eval000は、特許権者・里吉 竜一氏と株式会社テンプロクシーの共同事業運営契約に基づき運営されるメタ評価AIプラットフォームです。Award Force（オーストラリア・50カ国以上）の日本正規パートナーとして、コンテスト・審査・表彰のDXを推進しています。" data-en="eval000 is a meta-evaluation AI platform operated under a joint operation agreement between patent holder Ryuichi Satoyoshi and TEN PROXY Co., Ltd. As the Japan official partner of Award Force (Australia, 50+ countries), we drive DX for contests, reviews, and awards.">eval000は、特許権者・里吉 竜一氏と株式会社テンプロクシーの共同事業運営契約に基づき運営されるメタ評価AIプラットフォームです。Award Force（オーストラリア・50カ国以上）の日本正規パートナーとして、コンテスト・審査・表彰のDXを推進しています。</div>
</div></div></div></section><footer><div class="footer-l"><span class="footer-brand">eval000.ai</span><span>Case Study / award-of × 株式会社テンプロクシー</span></div>
<div class="footer-r">特許出願中（里吉 竜一氏） / &copy; 2026 TEN PROXY Co., Ltd. / award-of. All rights reserved.</div>
</footer><script>
(function(){
  if (!window.IntersectionObserver) {
    document.querySelectorAll('.rv').forEach(function(el){ el.classList.add('in'); });
  } else {
    var obs = new IntersectionObserver(function(entries){
      entries.forEach(function(e){ if (e.isIntersecting) e.target.classList.add('in'); });
    }, { threshold: 0.07 });
    document.querySelectorAll('.rv').forEach(function(el){ obs.observe(el); });
  }

  var currentLang = 'ja';
  function e0SetLang(lang) {
    if (lang === currentLang) return;
    currentLang = lang;
    var btnJa = document.getElementById('btn-ja');
    var btnEn = document.getElementById('btn-en');
    if (btnJa) btnJa.classList.toggle('active', lang === 'ja');
    if (btnEn) btnEn.classList.toggle('active', lang === 'en');
    document.documentElement.lang = lang === 'ja' ? 'ja' : 'en';
    document.body.classList.add('lang-switching');
    setTimeout(function(){
      document.querySelectorAll('[data-i18n]').forEach(function(el){
        var text = el.getAttribute('data-' + lang);
        if (text === null) return;
        if (el.children.length === 0) { el.textContent = text; }
        else { el.innerHTML = text; }
      });
      document.body.classList.remove('lang-switching');
    }, 200);
  }

  var btnJa = document.getElementById('btn-ja');
  var btnEn = document.getElementById('btn-en');
  if (btnJa) btnJa.addEventListener('click', function(){ e0SetLang('ja'); });
  if (btnEn) btnEn.addEventListener('click', function(){ e0SetLang('en'); });
})();
</script></div>
</div></div></div></div></div></div> ]]></content:encoded><pubDate>Mon, 10 Aug 2026 17:40:00 +0900</pubDate></item></channel></rss>