分散の求め方を徹底解説!公式と標準偏差の違いからエクセル計算まで網羅

目次
分散の求め方を徹底解説!公式と標準偏差の違いからエクセル計算まで網羅
分散の求め方を徹底解説!公式と標準偏差の違いからエクセル計算まで網羅
@ creator • Click to Play Video Inline
🎵 分散の求め方を徹底解説!公式と標準偏差の違いからエクセル計算まで網羅

テストの点数や売上データを見るとき、多くの人はまず「平均値」を確認します。しかし、平均値が同じ「60点」のグループであっても、全員が55点から65点前後に集まっているクラスと、0点から100点まで極端に分かれているクラスでは、現場の状況は全く異なります。このデータの散らばり度合いを客観的に捉えるために欠かせない指標が「分散」です。

データサイエンス教育の必修化やビジネスでのDX推進が進む昨今、分散の理解は高校数学の授業にとどまらず、マーケティング施策の検証や品質管理の実務、統計検定の対策においても必須の知識となりました。本稿では、数学に苦手意識がある方でも確実にマスターできるよう、直感的な具体例から計算手順、標準偏差との違い、そしてエクセルでの実践的な関数処理までを体系的に整理してお伝えします。

📌 【この記事の重要ポイントまとめ】
  • 要点1:分散は「各データの平均値からのズレ(偏差)を2乗し、その平均をとった数値」であり、散らばりの大きさをダイレクトに表す。
  • 要点2:2乗により単位が変わってしまう分散の平方根をとったものが「標準偏差」であり、元データと同じ尺度で直感的に把握できる。
  • 要点3:データ全体を対象にするなら「n」で割る母分散(VAR.P)、一部の標本から全体を推計するなら「n-1」で割る不偏分散(VAR.S)を用いる。

【直感で理解する】分散とは何か?平均値の罠を暴く具体例

統計学を学び始めた人が最初につまずくのが、「なぜ平均値だけでは不十分で、わざわざ分散を求めなければならないのか」という疑問です。この疑問を解消するために、ある小テスト(満点10点)を受けたAグループとBグループ、各5人の成績を見比べてみます。

Aグループの得点: 5点、6点、6点、6点、7点(合計30点 / 平均6.0点)
Bグループの得点: 1点、3点、6点、10点、10点(合計30点 / 平均6.0点)

両グループとも平均値はまったく同じ「6.0点」です。しかし、実態は大きく乖離しています。Aグループは全員が平均点付近に密集しており実力が安定しているのに対し、Bグループは低得点者と満点者に極端に二極化しています。平均値という単一の数値だけを信じると、こうした背後にある本質的な違いを見落としてしまいます。

そこで考案されたのが「データが平均値からどれくらい離れて散らばっているか」を数値化する分散です。分散の値が0に近ければ「平均値の周辺にデータが密集している(散らばりが小さい)」ことを意味し、数値が大きくなるほど「データが広範囲に散らばっている」ことを客観的に証明できます。

【4ステップで即マスター】分散の公式と偏差平方和の計算手順

分散の計算は、一見すると難解なシグマ($\sum$)記号が登場するため身構えてしまいがちですが、処理している中身は極めてシンプルな算数です。以下の4つのステップを踏むだけで、誰でも確実に算出できます。

ステップ1:平均値と偏差の求め方

まず全データの平均値を求めます。続いて、個々のデータから平均値を引き算します。この引き算の結果を「偏差」と呼びます。例えば先ほどのAグループ(平均6.0点)の最初のデータ「5点」の偏差は「5 - 6 = -1」となります。

ステップ2:偏差を2乗する(マイナスを消去する工夫)

各データの偏差をそのまま合計すると、必ず「プラスとマイナスが相殺されてゼロ」になってしまいます。散らばりの大きさを測りたいのに、合計がゼロになってしまっては計算が進みません。そこで、マイナスを強制的にプラスに変えるために「すべての偏差を2乗」します。先ほどの「-1」なら「$(-1)^2 = 1$」と変換します。

ステップ3:偏差平方和の計算

2乗した偏差をすべて足し合わせます。この合計値を専門用語で「偏差平方和(Sum of Squared Errors)」と呼びます。散らばりの絶対量を表す重要な数値です。

ステップ4:データの個数で割る(分散の算出)

偏差平方和をデータの個数(n)で割ることで、「2乗したズレの平均値」が導き出されます。これが分散です。

高校数学の「数学I・データの分析」で学ぶ分散の公式は、記号で書くと以下の通りになります。

$$s^2 = \frac{1}{n}\sum_{i=1}^{n} (x_i - \bar{x})^2$$

また、計算の手間を劇的に減らすテクニックとして「分散 = 2乗の平均値 -(平均値)の2乗」という展開公式も頻出します。手計算が必要な統計検定や試験対策では、こちらの公式を用いた方が計算スピードが圧倒的に上がります。

分散と標準偏差の求め方|なぜ平方根をとる必要があるのか?

分散を計算できた後に立ちはだかる次の壁が、「標準偏差」との違いです。結論から言うと、標準偏差は「分散の正の平方根(ルートをとったもの)」です。

なぜわざわざルートを被せる必要があるのでしょうか。理由は「単位の一致」にあります。分散の計算過程では偏差を2乗したため、単位も2乗されてしまっています。テストの点数であれば「点$^2$」、身長のデータであれば「cm$^2$」、年収であれば「円$^2$」という、現実には存在しない架空の単位に膨れ上がっている状態です。

先ほどのAグループの分散は「0.4」ですが、元データの単位である「点」に戻すために平方根をとると、$\sqrt{0.4} \approx 0.63$ 点となります。こうすることで、「データはおおむね平均値から約0.6点前後の範囲に散らばっている」と、直感的に解釈できるようになります。実務のレポートや学術論文で分散そのものよりも標準偏差が多用されるのは、元のデータと単位が揃っており、誰もが直感的に理解しやすいからです。

【現場検証】母分散と標本分散・不偏分散の違い|なぜ「n-1」で割るのか?

実務のデータ分析者や統計検定の受験生が最も激しく混乱するのが、「データを割る分母が『n』なのか『n-1』なのか」という問題です。大手知恵袋やエンジニアコミュニティでも、この計算に関する質問が毎月のように投稿されています。

この混乱を解く鍵は、「手元にあるデータがすべてなのか、それとも一部の抜き出しなのか」という視点にあります。

全数データなら「母分散(nで割る)」

学校のクラス全員の試験結果や、自社社員全員の健康診断結果など、調査対象の全体(母集団)そのものを測定している場合は、単純にデータの個数「n」で割ります。これが母分散です。

サンプリング調査なら「不偏分散(n-1で割る)」

全国の有権者から抽出した1,000人の世論調査や、工場で日々生産される数万個の部品から抜き取った100個のサンプルなど、標本(サンプル)から母集団全体の分散を推測したい場合は「n-1」で割らなければなりません。これを「不偏分散」と呼びます。

標本データから計算した平均値(標本平均)は、母集団の真の平均値(母平均)よりも標本自身のデータに自然と近づいてしまいます。その結果、標本データを使ってそのまま「n」で分散を計算すると、母集団の本当の散らばりよりも平均して小さめに過小評価されてしまうという数学的な歪み(バイアス)が生じるのです。この過小評価を相殺するために、分母を「n」より少し小さい「n-1」にして、数値を少し大きく補正します。

項目詳細・数値データ一般的な基準・相場編集部の見解・評価
母分散($\sigma^2$)全数調査(母集団全体)を対象に「n」で除算。例:自社全社員300名の勤怠データ。全データが手元に揃っていることが必須条件。社内分析など全数把握が容易なシーンに限定して適用するのが確実。
標本分散($s^2$)サンプルデータのみの散らばりを「n」で除算。手元のサンプルの現状記述に限定。高校数学の教科書(数学I)で扱われる基本定義。標本そのものの形状を見るのには使えるが、母集団の推測には不適。
不偏分散($u^2$)サンプルから母集団の散らばりを推定するため「n-1(自由度)」で除算。統計検定2級以上、学術論文、実務データ分析の標準仕様。現代のビジネス分析や機械学習の前処理では実質的なデファクトスタンダード。
共分散($s_{xy}$)2つの変数の相関性を確認するため、Xの偏差とYの偏差の積を平均化。相関係数を導き出すための土台となる中間指標。単一データの散らばりを超えて「2つの事象の連動性」を追う必須ステップ。

エクセルでの分散計算|VAR.PとVAR.Sの使い分けと共分散の計算手順

日常の実務現場において、分散を手計算することはほとんどありません。大半は表計算ソフトのExcelやプログラミング言語(Python、R)を用いて処理します。しかし、ここで関数を誤って選択すると、全く異なる分析結果を報告してしまうリスクがあります。

VAR.PとVAR.Sの決定的な違い

Excelには分散を求める関数が主に2種類用意されています。

  • =VAR.P(範囲):「Population(母集団)」のP。データを「n」で割り、母分散を求めます。全数調査のデータに使用します。
  • =VAR.S(範囲):「Sample(標本)」のS。データを「n-1」で割り、不偏分散を求めます。サンプリング調査のデータに使用します。

※なお、古いExcelに存在した「VAR」関数は現在の「VAR.S」と同等ですが、数式の意図を明確にするためにも最新の表記を使うのが鉄則です。

2変数の関係を解き明かす「共分散」の計算手順

単一のデータの散らばりだけでなく、「広告費と売上」「気温とアイスの販売数」のように、2つの変数がどのように連動して散らばっているかを見る指標が「共分散」です。

共分散の求め方は、Xの偏差とYの偏差を掛け合わせ、その合計をデータの個数で割ります。Excelでは以下の関数を使用します。

  • =COVARIANCE.P(配列1, 配列2):母集団全体の共分散
  • =COVARIANCE.S(配列1, 配列2):標本から母共分散を推測する不偏共分散

共分散が正の大きな値をとれば「Xが増えればYも増える関係」、負の大きな値をとれば「Xが増えればYが減る関係」があることを特定できます。

一般に知られていない盲点とネットの誤解|外れ値に弱い分散の限界

分散は散らばりを表す指標として万能視されがちですが、実務上、極めて致命的な弱点を抱えています。それが「外れ値(極端な異常値)に著しく引っ張られる」という性質です。

分散の計算では、偏差を「2乗」します。これが原因となり、例えば平均から「2」離れているデータのペナルティは「4」ですが、異常値によって「20」離れているデータが1つでも紛れ込むと、その影響度は一気に「400」へと跳ね上がります。つまり、たった1つの入力ミスや極端な富裕層のデータが混ざるだけで、全体の分散が異常に巨大化し、データの大半の実態を表さなくなってしまうのです。

【プロの結論】分散・標準偏差を使うべき人・別の指標を選ぶべき人の条件

分散・標準偏差を積極的に採用すべき条件:

  • データが左右対称の釣鐘型(正規分布)に近い形状をしている場合
  • 工場の製品規格やテストの点数など、データのばらつきが一定の範囲に収まることが期待される場合
  • 高度な統計モデリングや仮説検定の前提条件として活用する場合

分散の使用を見送り、四分位範囲(IQR)などへ切り替えるべき条件:

  • Webサイトの滞在時間や個人の金融資産残高など、ロングテールで極端な外れ値が存在するデータ
  • データ件数が数十件未満と極端に少なく、1つの異常値が全体を歪めてしまう危険がある場合

【分散の求め方】に関するよくある質問(FAQ)

Q1:分散の計算結果がマイナス(負の数)になることはありますか?
A1:絶対にありません。分散は「偏差を2乗した値の平均」です。実数を2乗すると必ず0以上の正の数になるため、計算結果がマイナスになった場合は途中の引き算や符号の処理で計算ミスが発生しています。

Q2:高校数学の「分散」と統計検定の「分散」で答えが異なるのはなぜですか?
A2:分母の割り方が異なるためです。高校の「数学I」では基本的に手元のデータをすべてとする標本分散(nで割る)を教えます。一方、大学以降の統計学や統計検定2級以上では、母集団を推測する不偏分散(n-1で割る)が標準となるため、問題の指示や文脈を正確に読み分ける必要があります。

Q3:手計算を素早く終わらせる裏ワザはありますか?
A3:「2乗の平均 - 平均の2乗」の公式を使うのが最も効果的です。各データを2乗した値の合計から「2乗の平均」を出し、そこから最初に計算した平均値を2乗して引くだけで、個々の偏差を1つずつ引き算する手間を大幅に削減できます。

まとめ:今後の動向と失敗しないための判断基準

データの散らばり度合いを把握する「分散」は、平均値というフィルターに隠された実態を白日の下に晒すための必須ツールです。「平均を出す → 偏差を出す → 2乗する → 合計して割る」という基本の4ステップさえ身体に染み込ませてしまえば、決して難しい計算ではありません。

実務においては、分析の目的に応じて「母集団全体なのか(VAR.P)」「標本からの推計なのか(VAR.S)」を正しく切り分け、外れ値の影響を考慮しながら標準偏差とセットで運用することが、数字に騙されない意思決定への最短ルートとなります。まずは身近なExcelシートに数値を入力し、実際に関数を動かしてみることから始めてみてください。 (出典: 分散 求め 方(Yahoo!ニュース))

分散 求め 方
分散 求め 方
分散 求め 方