アンケート調査結果の統計解析:代表的な8つの事例を解説
今回は、アンケート調査の結果を統計解析したい人のために、代表的な8つ事例について解説していきます。データの種類と解析する目的から、「こういう場合はこういう解析」というパターンが分かるように書いてみました。すべてのデータタイプや解析方法を紹介することはできませんが、多くの場合はいずれかのケースに当てはまると思います。
名義尺度
独立した2つのデータ群
100人の男女(男性50・女性50)にある質問をして、「はい」と答えた人数、「いいえ」と答えた人数を調べたところ、次のようなクロス集計表が得られたとします。男性と女性の回答傾向に違いがあると言えるでしょうか?
| 性別 | はい | いいえ |
|---|---|---|
| 男性 | 29 | 21 |
| 女性 | 22 | 28 |
ここでは「男性」として回答した人と「女性」として回答した人は異なり、「男性」と「女性」は独立したグループと考えられます。
このようなデータの統計解析では、カイ二乗検定またはフィッシャー(Fisher)の正確確率検定(直接法、直接確率検定)を行います。
対応のある2つのデータ群
100人の学生を対象にして、ある考え方について講義の前後に質問しました。その考え方について「同意できる」と答えた人数、「同意できない」と答えた人数を調べたところ、次のようなクロス集計表が得られたとします。例えば、講義前は「同意できる」と回答し、講義後も「同意できる」と回答した学生が20人、講義前は「同意できる」と回答したけど、講義後は「同意できない」と回答した学生が28人ということです。講義は学生の考え方に影響を与えたと言えるでしょうか?
| 講義後:同意できる | 講義後:同意できない | |
|---|---|---|
| 講義前:同意できる | 20 | 28 |
| 講義前:同意できない | 15 | 37 |
このような調査では、同じ人が二度回答しているので、独立した二つのグループではなく、一つのグループの変化を調べることになります。講義の前後(二度の調査)に同じ人が回答する(対応する)ので、「対応のある2つのデータ群」となります。
このようなデータの統計解析では、マクネマー(McNemar)検定を行います。
順序尺度
順序データは等間隔性が保証されないため、平均値や標準偏差を計算することは理論的にはあまり意味がありません。例えば、満足度に関する5件法のアンケート調査で、「5. 非常に満足」と「4. 満足」の差は「1ポイント」で、「2. 不満」と「1. 非常に不満」の差「1ポイント」と同じですが、両者の感情の差が同じとは限らないということです。
したがって、多くの場合、順序データではデータの正規性という概念もないため、ノンパラメトリックな解析が行われます。(ただし、順序データの背後に連続的な変化を仮定してパラメトリックな解析をすることはあります。詳しくはこちらの記事をご覧ください。)
独立した2つのデータ群
順序尺度の例として、ある会社でAサービスとBサービスの顧客満足度を、
- 非常に満足
- 満足
- 普通
- 不満
- 非常に不満
の5件法でアンケート調査したとします。Aサービスを利用したのは100人、Bサービスを利用したのも100人ですが、AサービスとBサービスを利用した人たちは同じではありません。アンケートの結果、次の表のような人数分布が得られたとします。AサービスとBサービスは、顧客満足度が異なると言えるでしょうか?
| 満足度 | Aサービス | Bサービス |
|---|---|---|
| 5. 非常に満足 | 15 | 10 |
| 4. 満足 | 48 | 52 |
| 3. 普通 | 21 | 23 |
| 2. 不満 | 13 | 10 |
| 1. 非常に不満 | 3 | 5 |
ここではAサービスに回答した人とBサービスに回答した人は異なるため、独立した2つのグループの比較となります。集計表のもとになっているデータは、次のような形式です。
| 回答者 | サービス名 | 満足度 |
|---|---|---|
| 回答者1 | Aサービス | 5. 非常に満足 |
| 回答者2 | Aサービス | 4. 満足 |
| 回答者3 | Aサービス | 2. 不満 |
| 回答者4 | Bサービス | 4. 満足 |
| 回答者5 | Bサービス | 3. 普通 |
| (続く) |
このようなデータの統計解析では、マン-ホイットニー(Mann-Whitney)のU検定またはウィルコクソン(Wilcoxon)の順位和検定を行います。名前は違いますが、両者の検定結果は同じになります。
対応のある2つのデータ群
先ほどと同じように、ある会社でAサービスとBサービスの顧客満足度を、
- 非常に満足
- 満足
- 普通
- 不満
- 非常に不満
の5件法でアンケート調査しました。今回はAサービスとBサービスを両方とも利用している100人を対象にして調査を行い、その結果、次のような人数分布が得られたとします。AサービスとBサービスは、顧客満足度が異なると言えるでしょうか?
| 満足度 | Aサービス | Bサービス |
|---|---|---|
| 5. 非常に満足 | 15 | 10 |
| 4. 満足 | 48 | 52 |
| 3. 普通 | 21 | 23 |
| 2. 不満 | 13 | 10 |
| 1. 非常に不満 | 3 | 5 |
ここではAサービスに回答した人とBサービスに回答した人は同じため、対応する2つのグループの比較となります。集計表のもとになっているデータは、次のような形式です。
| 回答者 | Aサービス | Bサービス |
|---|---|---|
| 回答者1 | 5. 非常に満足 | 4. 満足 |
| 回答者2 | 4. 満足 | 4. 満足 |
| 回答者3 | 5. 非常に満足 | 3. 普通 |
| 回答者4 | 3. 普通 | 2. 不満 |
| 回答者5 | 4. 満足 | 3. 普通 |
| (続く) |
このようなデータの統計解析では、ウィルコクソン(Wilcoxon)の符号付順位和検定を行います。各回答者について、AサービスとBサービスの差に注目する解析手法です。
量的データ:正規性が仮定できる場合
数量データの解析方法は、データの正規性が仮定できるかどうかによって大きく変わってきます。データの正規性について知りたい方は、こちらの記事をご覧ください。
データの正規性が仮定できる場合、「独立した試料」か「対応のある試料」かによって解析方法が異なります。
独立した2つのデータ群
ある地域において、20代の男性100人と、40代の男性100人をランダムに選び、身長のデータを比較したいとします。この場合の結果は、次のように平均値と標準偏差でまとめることができます(架空のデータです)。20代と40代では、身長に有意な差があると言えるでしょうか?
| 年代 | 身長の平均値 (cm) | 標準偏差 (cm) |
|---|---|---|
| 20代 | 167.8 | 3.8 |
| 40代 | 168.5 | 2.5 |
ここでは20代の人と40代の人は異なるため、独立した2つのグループの比較となります。
このようなデータの統計解析は、スチューデントのt検定またはウェルチのt検定を行います。スチューデントのt検定は2群の分散が等しいと仮定した検定、ウェルチのt検定は2群の等分散を仮定しなくてもよい検定です。
対応のある2つのデータ群
30代の男性100人を対象として、2024年1月と2024年6月に体重を測定し、この間の体重変化を調べたいとします。この場合の結果は、「独立した2つのデータ群」の例と同じように平均値と標準偏差でまとめることができます。1月から6月にかけて、体重に有意な変化があったと言えるでしょうか?
| 時期 | 体重の平均値 (kg) | 標準偏差 (kg) |
|---|---|---|
| 2024年1月 | 65.6 | 5.3 |
| 2024年6月 | 63.4 | 4.8 |
ここでは同じ人に注目して異なる時期のデータを比較するため、対応のある2つのデータ群(2つの時期)の比較となります。
このようなデータの統計解析は、対応のあるt検定を行います。
独立した3つ以上のデータ群
ある地域において、20代、30代、40代、50代の人を100人ずつランダムに選び、年代間で睡眠時間を比較したいとします。先ほどの例と同じように、この場合の結果も平均値と標準偏差でまとめることができます。年代によって、睡眠時間に有意な差があると言えるでしょうか?
| 年代 | 睡眠時間の平均値 (時間) | 標準偏差(時間) |
|---|---|---|
| 20代 | 6.2 | 0.7 |
| 30代 | 6.5 | 0.5 |
| 40代 | 7.2 | 0.6 |
| 50代 | 7.5 | 0.5 |
ここでは20代、30代、40代、50代の人は異なるため、独立した4つのグループ(調査対象者)の比較となります。
このようなデータの統計解析では、一元配置の分散分析や、テューキー検定・ダネット検定などの多重比較検定を行います。
量的データ:正規性が仮定できない場合
数量データでも正規性が仮定できない場合は、ノンパラメトリックな解析を行うことになるので、上述した順序尺度の解析と同じ方法を用います。
まとめ
以上、アンケート調査結果の基本的な統計解析についてまとめました。冒頭にも書きましたが、今回取り上げたのはあくまで代表的なケースだけなので、データによっては対応できないこともあります。そういう特殊なケースについても、今後徐々に記事を書いていきたいと思います。
<参考文献>
田久浩志『統計解析なんかこわくない−データ整理から学会発表まで』、医学書院、2019年
内田治『アンケート調査の計画と解析』、日科技連出版、2022年

この記事を書いた人
田中泰章
Yasuaki Tanaka
プロフィール
自然の仕組みや環境問題、社会・教育制度などについて広い視点から考える自然科学者。2008年に東京大学大学院で博士号(環境学)を取得した後、東京大学、琉球大学、米国オハイオ州立大学、ブルネイ大学など、国内外の大学で研究と教育に約15年間携わってきました。これまでに40本以上の論文を出版し、国際的な科学雑誌の査読者として多数の論文審査も行っています。大学教員としては、これまでに40名以上の学生(学部・修士・博士を含む)を研究指導し、若手研究者を育成してきました。専門は「人間と自然とのかかわり」で、人間活動が自然界に与える影響を生物学・化学・社会学などの複合的な視点から研究しています。
アカデミックラウンジ
サービス案内

