適性検査は何を測れないのか:提供元が書いている「確率のツール」という限界
この記事の内容は 2026-09-07 時点のものです。
適性検査で落ちると、自分の何かを見抜かれて否定された気分になります。何を見られたのかも分からないまま、結果だけが返ってくるからです。
この記事では、SPIの提供元が公開している番外編の解説を読みます。テストの品質をどう担保しているかと、どこまでしか分からないと考えているかが書かれている珍しいページです。以下は2026年9月7日時点の記載です。
目次
- そもそも測っているものに実体がない
- 品質を判断する3つの言葉
- 問題は1問ずつ落とされている
- 数千から1万名規模の追跡
- 偏差値の土台は年間約215万人
- 「確率のツール」という限界
- 落ちたときの受け取り方
- よくある質問
そもそも測っているものに実体がない
リクルートマネジメントソリューションズが学生向けに公開している【番外編】適性検査の品質と効能・限界については、こう書き出しています。
適性検査の測定対象となる一般知的能力や性格などの人の特性は、重さや長さのように物理的な実体があるわけではなく、概念的なものです。そのためか、それを測る適性検査の「品質」の良し悪しについて語られることは多くありませんが、心理統計の分野では長年1つの研究対象となっており、考え方や指標が整理されています。
体重計のように、正しい値が別に存在してそれと比べられるものではない、という前提から始まっています。だから作り手の側で品質を組み立てる必要がある、という話につながります。
品質を判断する3つの言葉
ページには、良いテストの条件が3つ挙げられています。
良いテストは「測ろうとする人の特徴を誤差なく正確に表せる」「実施目的に沿った適切な情報が得られる」「結果を基準とする集団の水準と比較できる」といった条件を満たしている必要があり、これらの概念を「信頼性」「妥当性」「標準性」と呼んでいます。
| 言葉 | 何を担保するか |
|---|---|
| 信頼性 | 測ろうとする特徴を誤差なく正確に表せるか |
| 妥当性 | 実施目的に沿った適切な情報が得られるか |
| 標準性 | 結果を基準とする集団の水準と比較できるか |
信頼性については具体的な目安まで公開されています。
テストの信頼性については、その程度を表す「信頼性係数」と呼ばれる指標があり、これが0.8程度以上であることが1つの目安になっています。
問題は1問ずつ落とされている
問題の作り方も書かれています。
SPIについては、例えば言語能力を測る基礎能力検査では、1問1問について下表のようなトライアルデータ分析を行い、識別力や難易度が確認された問題だけを使用する、といった運用をルール化しています。
手順は、トライアルの対象とする問題を集めて数百名以上の被検者に回答してもらい、テスト全体の得点で被検者を上位群・中位群・下位群に区分して、それぞれの選択状況を確認する、というものです。判定の基準はこうです。
上位群ほど正答の選択率が高く、中位群・下位群になるほど誤答を多く選んでいると、測ろうとする能力の高低を識別できているということになり、良い問題と判断されます。
逆に「上位群が正答を選べない、どの群にも回答の選択状況に違いがないなどの場合は、識別力のない問題ということになり」不採用になります。ページには、悪い問題の例として「言葉の辞書上の意味と一般的な語感のズレ」が原因のものが挙げられています。
受検者を分けられない問題は使わない、という設計です。 出題される問題が、解ける人と解けない人に分かれるように選ばれている以上、手応えが悪いこと自体は珍しくありません。ボーダーの話はWEBテストのボーダーは何割か:公開されているのかを確かめたにまとめました。
数千から1万名規模の追跡
妥当性の検証についてはこう書かれています。
多くの企業と協力して数千から1万名規模のデータを収集し、入社後の行動や評価とSPIの結果に一定の関係性があることを確認する妥当性の検証作業も定期的に実施しています。
「一定の関係性がある」という言い方に留めているのが重要な点です。 入社後の評価を当てる、とは書かれていません。
偏差値の土台は年間約215万人
標準性については、比較の土台になるデータの規模が書かれています。
SPIについては、偏差値と同様の「標準得点」で結果を報告していますが、1年間に約215万人が受検しており(2021年実績)、母集団を代表する豊富な基準集団のデータを持っています。
同じ提供元の【番外編】SPIの開発背景と理念には、受検者の回答状況に応じて出題が変わる適応型テストの説明もあり、問題の選ばれ方そのものが受検者ごとに違うことが書かれています。
標準性の段落には、限られた大学で集めたデータでは比較の対象にできないこと、集団の傾向が変わるため継続的な確認が必要なことも書かれています。自分の点数は、その年に受けた人たちの中での位置として返っている、という理解になります。
「確率のツール」という限界
ここが一番はっきり書かれている箇所です。
一方で、適性テストには「(品質は高くても)確率のツールである」という限界があり、企業の人材採用の成功確率を高めることはできても100%当たるものではなく、応募者のすべてが分かるわけでもありません。基本的には、あくまで意思決定の補完ツールとして利用されるべきものであると考えています。
作り手自身が「補完ツール」と書いています。 別の提供元も同じ趣旨のことを書いていて、内田クレペリン検査の日本・精神技術研究所は「たまたま、内田クレペリン検査でスポットライトを当てた(ごく限られた部分の)あなたの特徴が、たまたま、あなたの希望した会社や組織が求めていた特徴とズレていただけです」と受検者向けページに書いています。詳しくは内田クレペリン検査に「対策」はあるのかを読んでください。
落ちたときの受け取り方
公開情報から言える範囲で整理します。
- 測っているのは概念であって、実体のある値ではない。 完璧な測定は最初から想定されていません
- 問題は「差がつくこと」を条件に選ばれている。 手応えの悪さは設計の一部です
- 結果はその年の受検者の中での位置。 絶対的な優劣ではありません
- 企業は補完ツールとして使うことになっている。 検査だけで決まる設計ではないと作り手は書いています
とはいえ、落ちた原因を切り分けておくのは次に効きます。原因の候補はWEBテストに落ちる原因、他に3つに、対策の順番はWEBテストで落ちる時期を、先に抜けるにまとめました。形式ごとの科目と解き方は普通の就活記録 WEBテスト解答集(1,480円・税込・買い切り)に主要17形式ぶんを収録しています。
よくある質問
Q. 信頼性係数0.8というのは、SPIの数値ですか?
いいえ。ページに書かれているのは「これが0.8程度以上であることが1つの目安になっています」という一般的な目安の説明で、SPIの実測値としての記載はありませんでした。
Q. 年間約215万人というのは今の数字ですか?
ページには「(2021年実績)」と明記されています。それ以降の数字は、このページからは確認できませんでした。
Q. 適性検査だけで落とされることはないのですか?
そうとは書かれていません。書かれているのは「あくまで意思決定の補完ツールとして利用されるべきものであると考えています」という提供元の考え方です。実際の使い方は企業ごとに異なります。
Q. 品質の高い検査と低い検査を見分けられますか?
受検する側が見分ける方法は、このページには書かれていません。信頼性・妥当性・標準性という3つの観点が公開されていること自体は、判断材料の一つになります。