issueでタグ付けされたブログ

Report :「第5回:開示・権利設計と、評価データガバナンス」

評価者への開示と、世間一般への公開はまったく別の問題です。著作権は具体的な表現しか守らずアイデア自体は守らないこと、特許・営業秘密との使い分け、AI検知ツールの構造的な限界を整理したうえで、評価プロセスを構造化し較正(キャリブレーション)し続けるという、評価データガバナンスの最後のピースを提示します。

Report :「第4回:メタ評価という答え ─ eval000の設計思想」

評価プロセスの目的を、良い提案を選ぶことから、AIでは出せない価値の可視化へと再定義します。情報の非対称性と実世界での検証実績という2つの軸、その間をつなぐ疑似検証段階を提示したうえで、拡張可能な監督問題に対する答えとして、eval000が採用するHITL段階的自律性という設計思想を解説します。

Report :「第3回:評価プロセスの先行事例:分野横断の比較」

文学賞に見る6つのAI利用規定パターン、学術出版の3類型と国際団体の4原則、なろう・RWAの定義モデル、グッドデザイン賞の評価哲学。分野ごとに個別発展してきたAI時代の評価ルールを横断的に比較し、その背後にある共通の設計原則と、プロセス評価という発想が抱える構造的な限界を浮き彫りにします。

Report :「第2回:評価者自身が摩耗するとき」

評価する側の能力もまた、AIへの日常的な依存によって静かに摩耗しつつあります。人間がAIの前で自らの判断基準を保てなくなる双方向の不整合、組織研究が指摘する分散的脱スキル化というリスクを整理し、なぜこの問題がeval000のメタ評価という設計思想に直結するのかを、認知科学の知見から論じます。

Report :AI時代の評価プロセスとメタ評価という解「第1回:知の重荷と、AI時代の評価危機」

査読、助成金審査、採用選考、投資のスクリーニング。分野が違っても、評価プロセスは生成AIによる同じ構造の危機に直面しています。応募・提出コストの低下と知の重荷という長期トレンドがぶつかる逆説、そして評価者の目利きが理論的に頼れない理由を、最新の研究データとともに解き明かすシリーズの第一章です。

「評価する人」の実力を評価する

SEGT審査システムに、評価入力者(審査員)自身の「評価能力」を数値化する追加機能案を解説。評価者集団の平均との整合性(客観レベル)とSEGT標準評価v*との整合性(絶対性レベル)を、具体的な計算例とともに紹介します。

SEGTへのステップ

「審査は属人的になりがち」「審査員が変われば評価が変わる」——多くの主催者が感じる6つの構造的な難しさを整理し、SEGTがそれぞれにどう対応しようとしているのかを段階的にご紹介します。

査読AIとeval000にみるHITLの本当の意味

生成AIによる評価・査読の自動化はどこまで進んだのか。自動運転のレベル分類を借りて、論文査読AIとeval000のメタ評価技術がそれぞれどの段階に立っているのかを、責任の所在という観点から整理します。

AIで人事評価することに、なぜ納得感が生まれないのか

生成AI人事評価の導入が急速に進む一方、「評価への納得感」は上がらない——その原因はAIの使い方ではなく設計の構造にあります。eval000が捉える4つの構造的問題を解説します。

「スポンジ人間」化を超えて

AIとともに判断するはずの人間が、判断能力を失い責任だけを引き受ける「スポンジ人間」と化すリスクとは。慶應義塾大学・山本龍彦教授の問いかけと国内外の最新研究から、あるべき姿を考察します。