2026年9月 | AIスコアの評価精度を改善し、評価できなかった項目を「未評価」として表示するようにしました

リリースノート

AI協働形式のレポートで表示するAIスコアの評価方式を改善しました。

候補者本人の発言と操作を根拠に評価し、評価できる場面がなかった項目は点数を付けずに「未評価」として表示します。評価の対象となる項目と、各項目の段階的な評価基準は変わりません。

改善の背景

AIと協働しながら課題に取り組むと、ログには候補者のプロンプトだけでなく、AIの応答や操作、課題文、対話型の問題ではペルソナの回答も含まれます。

従来の評価では、AIやペルソナが示した判断を候補者本人の行動として扱ってしまうことや、評価できる場面がなかった項目にも点数を付けてしまうことがありました。その結果、候補者が実際には行っていない行動でスコアが上がったり、判断材料がないことが能力不足として低いスコアになったりする場合がありました。

主な変更点

本人の発言と操作を根拠に評価します

評価の根拠にするのは、候補者本人が書いたプロンプトや発言と、エディタ上での候補者自身の操作です。AIの応答や操作、課題文、ペルソナの回答は、候補者が何に対してどう行動したかを理解するための文脈として参照し、評価の根拠にはしません。

候補者がAIの出力や課題文をプロンプトに貼り付けた部分も、本人の発言としては扱いません。

評価詳細では、根拠となった候補者の発言や操作をそのまま引用して表示します。

評価できる場面があった項目だけを評価します

評価項目ごとに、まず評価できる場面があったかを判断します。場面があった項目だけを、段階的な評価基準のどこまで満たしたかで評価します。

評価できる場面がなかった項目は、点数を付けずに「未評価」とし、その理由を表示します。未評価の項目はスコアの計算から除きます。

0点と未評価は意味が異なります。

表示 意味
0点 評価できる場面はあったが、最も低い段階の基準にも届かなかった
未評価(-) 評価できる場面がなかった、または根拠を確認できなかった

評価範囲を表示します

AIスコアの下に「評価範囲」を表示します。評価項目のうち、いくつの項目に基づいてスコアを算出したかを示します。

評価範囲が広いほど、多くの項目に基づいたスコアです。課題の内容や候補者の進め方によっては、評価できない項目もあります。

評価バージョンを表示します

レポートに、評価に使った方式のバージョンを「評価バージョン」として表示します。今回の方式で評価したレポートは v0.2.0、これまでの方式で評価したレポートは v0.1.0 と表示されます。

対話型の問題では、課題解決能力とコミュニケーション能力も同じ方式で評価します

ペルソナと対話しながら進める対話型の問題では、AI協働力に加えて、課題解決能力とコミュニケーション能力も同じ方式で評価します。

社内検証の結果

過去の受検データを使い、従来の方式と今回の方式でそれぞれ評価した結果を、別のAIモデルで監査しました。

比較指標 従来の評価と比べた変化
妥当と判断された評価の割合 約3倍に増加
本人以外の行動を根拠にした評価の割合 約3分の1に減少

評価方式は今後も改善を続けます。

※ 過去の受検データ30件を、評価に使ったモデルとは別のAIモデルで監査した結果です。方式どうしを比べるための指標であり、評価の絶対的な精度を示すものではありません。

ご利用中のレポートへの影響

  • 本改善は、リリース後に評価される提出から適用されます。すでに作成されたレポートは再評価しません。
  • 新しい方式では、評価できる場面がなかった項目がスコアの計算から除かれるため、従来の方式で評価したレポートとはスコアの傾向が異なる場合があります。評価バージョンが異なるレポートどうしを比べる際はご注意ください。
  • 成果物への評価やテストのトータルスコアの計算方法に変更はありません。

評価項目の一覧と考え方は、AIスコアについてをご覧ください。