時間に合わせて読む
目次この記事でわかること13項目+
点線の用語を長押しすると、短い解説が開きます。タップ・クリックでも確認できます。
読む前に押さえたいこと
平均値や標準偏差を計算できても、「その数値が何を表し、何を表さないのか」が曖昧だと、看護研究や院内データの解釈は不安定になります。数式は暗記項目ではなく、データをどの方向から見ているかを示す設計図です。この記事では、量的データを中心、ばらつき、分布、推定の不確かさ、2つの量の関係という順に整理します。平均と中央値、SDとSE、95%信頼区間、p値、相関の違いを、架空の学習例と図のイメージで理解し、臨床データを読むときの確認点までつなげます。
統計量は「中心・ばらつき・分布・推定・関係」への別々の答え
この章の要点最初に押さえる結論は、1つの統計量ですべては分からないということです。平均は中心、標準偏差は個々の値のばらつき、信頼区間は推定の不確かさ、相関係数は2つの量の直線的な関係を見ています。
数式をカメラのレンズにたとえると、同じデータでもレンズを替えるたびに見える特徴が変わります。ただし、この比喩には限界があります。統計量は写真のようにデータ全体を保存するのではなく、多くの情報を1つか少数の数値へ圧縮します。したがって、統計量だけでなく、元データの分布を示す図、標本数、単位、測定条件を一緒に確認します。
どの辺りが中心か
- 主な統計量・図
- 平均、中央値
- 数式から浮かべるイメージ
- 全員へ均等に配り直す/順に並べた中央
- 単独では分からないこと
- ばらつき、分布の形
どれくらい散らばるか
- 主な統計量・図
- 範囲、IQR、分散、SD
- 数式から浮かべるイメージ
- 中心からの距離
- 単独では分からないこと
- 時間的な変化、原因
どんな形に分布するか
- 主な統計量・図
- ヒストグラム、箱ひげ図
- 数式から浮かべるイメージ
- 値がどこに何個あるか
- 単独では分からないこと
- 因果関係
ある値は相対的にどこか
- 主な統計量・図
- z得点
- 数式から浮かべるイメージ
- 平均からSD何個分か
- 単独では分からないこと
- 臨床的な異常かどうか
推定はどれくらい不確かか
- 主な統計量・図
- SE、95%信頼区間
- 数式から浮かべるイメージ
- 標本を取り直したときの揺れ
- 単独では分からないこと
- 偏りや測定誤差の解消
2つの量は一緒に動くか
- 主な統計量・図
- 散布図、相関係数
- 数式から浮かべるイメージ
- 対になった点の並び
- 単独では分からないこと
- どちらが原因か
| 知りたいこと | 主な統計量・図 | 数式から浮かべるイメージ | 単独では分からないこと |
|---|---|---|---|
| どの辺りが中心か | 平均、中央値 | 全員へ均等に配り直す/順に並べた中央 | ばらつき、分布の形 |
| どれくらい散らばるか | 範囲、IQR、分散、SD | 中心からの距離 | 時間的な変化、原因 |
| どんな形に分布するか | ヒストグラム、箱ひげ図 | 値がどこに何個あるか | 因果関係 |
| ある値は相対的にどこか | z得点 | 平均からSD何個分か | 臨床的な異常かどうか |
| 推定はどれくらい不確かか | SE、95%信頼区間 | 標本を取り直したときの揺れ | 偏りや測定誤差の解消 |
| 2つの量は一緒に動くか | 散布図、相関係数 | 対になった点の並び | どちらが原因か |
「数字で記録した」だけでは量的データとは限らない
この章の要点量的データは、値の大小や差に数量としての意味があるデータです。連続データは体温や時間のように理論上さらに細かく測れ、離散データは転倒件数や訪室回数のように数えて得ます。
一方、「病棟A=1、病棟B=2」と番号を振っても、2が1の2倍という意味にはなりません。これは分類を数字で表した質的データです。疼痛の0~10評価や段階評価も数字ですが、隣り合う差が常に同じ意味を持つか、対象者間で同じ尺度として比較できるかを検討する必要があります。数値が入力されているという理由だけで平均を出さないことが出発点です。
また、解析単位を明確にします。「測定9回」と「患者9人」は同じn=9でも意味が違います。同じ患者を9回測った値は互いに関連しやすく、9人の独立した患者と同じ方法では扱えません。単位、測定時点、対象、欠測、重複を先に確認してから式へ進みます。
処置準備時間(分)
- 種類
- 連続量として扱うことが多い
- 最初に確認すること
- 開始・終了の定義、測定精度、同一条件か
1勤務のナースコール回数
- 種類
- 離散
- 最初に確認すること
- 観察時間、病床数、重複計数の有無
病棟番号1・2・3
- 種類
- 質的データのコード
- 最初に確認すること
- 数字の大小を計算に使わない
同一患者の朝・夕の測定値
- 種類
- 反復測定
- 最初に確認すること
- 患者内の対応、時刻、介入や状態変化
| データ例 | 種類 | 最初に確認すること |
|---|---|---|
| 処置準備時間(分) | 連続量として扱うことが多い | 開始・終了の定義、測定精度、同一条件か |
| 1勤務のナースコール回数 | 離散 | 観察時間、病床数、重複計数の有無 |
| 病棟番号1・2・3 | 質的データのコード | 数字の大小を計算に使わない |
| 同一患者の朝・夕の測定値 | 反復測定 | 患者内の対応、時刻、介入や状態変化 |
平均は「均等配分」、中央値は「順番の中央」を表す
この章の要点平均と中央値はどちらも中心を表しますが、答えている問いが違います。平均は全データを合計して同じ量ずつ配り直した値、中央値は小さい順に並べたとき中央に来る値です。
値を x₁, x₂, …, xₙ とすると、標本平均は x̄=Σxᵢ÷n です。Σは「全部足す」、nはデータ数を意味します。平均はすべての値を使うため、後の比較や推定に利用しやすい一方、極端な値にも引っ張られます。
架空の学習例として、9回の処置準備時間が2、3、3、4、4、5、5、6、22分だったとします。平均は54÷9=6分ですが、中央値は4分です。22分という1回の長い値が平均を引き上げています。このデータを「通常6分程度」とだけ表すと、多くの回が2~6分だったことを見失います。
中央値は極端な値の影響を受けにくいため、右側に長い裾をもつ所要時間などで中心を表しやすくなります。ただし、外れた値を無視してよいという意味ではありません。22分が入力誤りか、物品不足、緊急対応、患者状態への配慮などの実際の出来事かを確認することが、看護の改善につながります。最頻値は最も多く現れる値ですが、存在しない場合や複数ある場合もあります。
平均 x̄
- 式・決め方
- Σxᵢ÷n
- 向く状況
- おおむね対称で、全データを反映した中心を見たい
- 注意点
- 極端な値に影響される
中央値
- 式・決め方
- 並べた中央。偶数個なら中央2値の平均
- 向く状況
- 歪みや外れ値がある分布
- 注意点
- 数値間の距離の情報を十分には使わない
最頻値
- 式・決め方
- 最も頻度が高い値
- 向く状況
- 最も多い値や区分を知りたい
- 注意点
- 中心とは限らず、複数・なしの場合がある
| 代表値 | 式・決め方 | 向く状況 | 注意点 |
|---|---|---|---|
| 平均 x̄ | Σxᵢ÷n | おおむね対称で、全データを反映した中心を見たい | 極端な値に影響される |
| 中央値 | 並べた中央。偶数個なら中央2値の平均 | 歪みや外れ値がある分布 | 数値間の距離の情報を十分には使わない |
| 最頻値 | 最も頻度が高い値 | 最も多い値や区分を知りたい | 中心とは限らず、複数・なしの場合がある |
標準偏差は「平均からの距離」を元の単位へ戻したもの
この章の要点中心が同じでも、値がそろっている集団と広く散らばる集団は異なります。その違いを表すのがばらつきです。平均だけを示さず、分布に合うばらつきの指標を組み合わせます。
範囲は最大値-最小値です。計算は簡単ですが、両端の2値だけで決まります。四分位範囲(IQR)は Q₃-Q₁ で、小さい順に並べた中央50%の幅を表します。外れた値の影響を受けにくく、中央値と組み合わせて「中央値(Q₁~Q₃)」のように示します。
分散は、各値と平均との差を二乗し、その合計を平均したものです。母集団全体を記述する分散は σ²=Σ(xᵢ-μ)²÷N、標本から母分散を推定する標本分散は s²=Σ(xᵢ-x̄)²÷(n-1) と表します。差をそのまま足すと正負が打ち消し合うため、二乗します。遠い値ほど大きく効くことも式から分かります。
標準偏差は s=√s² です。分散では単位も二乗されますが、平方根を取ると元の単位へ戻ります。たとえば時間ならSDも「分」で読めます。架空の例で、4、5、6分と1、5、9分はどちらも平均5分ですが、標本SDは前者1分、後者4分です。後者の方が、準備時間が一定しないと分かります。
母集団のNで割る式と、標本のn-1で割る式は目的が違います。収集した対象だけを全体として記述するのか、より大きな母集団へ一般化するのかを先に決めます。ソフトの関数名だけで選ばないことが重要です。
範囲
- 数式
- 最大値-最小値
- イメージ
- 両端の幅
- 主な組み合わせ
- 最小値・最大値を併記
IQR
- 数式
- Q₃-Q₁
- イメージ
- 真ん中50%の箱の幅
- 主な組み合わせ
- 中央値と組み合わせる
分散
- 数式
- 距離の二乗の平均
- イメージ
- 遠い値を強く反映
- 主な組み合わせ
- 計算過程で使うことが多い
SD
- 数式
- √分散
- イメージ
- 平均からの距離の物差し
- 主な組み合わせ
- 平均と組み合わせる
| ばらつきの指標 | 数式 | イメージ | 主な組み合わせ |
|---|---|---|---|
| 範囲 | 最大値-最小値 | 両端の幅 | 最小値・最大値を併記 |
| IQR | Q₃-Q₁ | 真ん中50%の箱の幅 | 中央値と組み合わせる |
| 分散 | 距離の二乗の平均 | 遠い値を強く反映 | 計算過程で使うことが多い |
| SD | √分散 | 平均からの距離の物差し | 平均と組み合わせる |
代表値を計算する前に、ヒストグラムと箱ひげ図で分布を見る
この章の要点平均とSDを出す前に、分布の形を図で確認します。数値だけでは、左右の歪み、山が複数あること、外れた値、床効果・天井効果を見落とすからです。
ヒストグラムは、量的データを区間に分け、各区間の度数を面積で表します。全体の形を見るのに適しています。ただし、区間幅の選び方で見え方が変わります。幅が異なる区間では棒の高さではなく面積が度数に対応するため、単純な棒グラフとして読まないようにします。
箱ひげ図は、中央値、Q₁、Q₃と「ひげ」で分布を圧縮して示し、複数群を比べるのに向きます。ただし、ひげが最小値・最大値を示す形式も、一定の百分位点や別の規則を示す形式もあります。凡例を確認しないと外れ値の意味を誤ります。箱ひげ図で外れた点も、臨床的異常や入力誤りと決まったわけではありません。
看護データでは、外れた値を機械的に削除せず、元記録、単位、測定機器、測定時刻、患者の状態、実施手順を確認します。誤記なら訂正過程を残し、実測値ならその値が生じた状況を検討します。研究・質改善では除外規則と欠測処理を記録し、都合のよい結果になるよう後から変えません。
「平均±2SDに約95%」は正規分布に限った見方
この章の要点平均を中心とする左右対称のベル型である正規分布では、平均μと標準偏差σで形を表せます。理論上、μ±1σに約68.27%、μ±2σに約95.45%、μ±3σに約99.73%が入ります。
z得点は z=(x-μ)÷σ で、ある値が平均から標準偏差何個分離れているかを表します。z=2なら平均より2SD高いという意味です。異なる単位の値を相対的位置として考える助けになります。
しかし、これは分布が正規分布に近いことを前提としたイメージです。時間、回数、在院日数などは片側に長い裾を持つことがあり、平均±2SDを機械的に「正常範囲」にしてはいけません。臨床検査の基準範囲、診断基準、治療目標、施設の報告基準は、それぞれ目的と作成方法が異なります。統計上まれな値であることだけでは、疾患、緊急性、対応方法は決まりません。
SDは個々の値のばらつき、SEは標本平均の揺れを表す
この章の要点標準偏差(SD)と標準誤差(SE)は名前が似ていますが、対象が違います。SDは今回集めた個々の値がどれくらい散らばるか、SEは同じ母集団から標本を何度も取り直したと仮定したとき、標本平均がどれくらい揺れるかを表します。
平均の標準誤差は SE=s÷√n です。標本数nが大きいほどSEは小さくなります。ここで小さくなるのは平均推定の不確かさであり、患者間の個人差そのものではありません。人数を増やしても、個々の測定値のSDが自動的に小さくなるわけではありません。
個々の患者データのばらつきを示したいのに平均±SEを使うと、分布が実際より狭く見えます。生物医学研究の統計報告ガイドラインであるSAMPLは、おおむね正規分布するデータを平均(SD)で、非正規データを中央値と百分位範囲などで示し、データのばらつきにSEを使わないよう求めています。
95%信頼区間は「推定手順の精度」を幅で示す
この章の要点95%信頼区間は、標本から母集団の値を推定するときの不確かさの幅です。母平均について、母標準偏差が未知でt分布を使う基本形は、x̄±t₀.₉₇₅,ₙ₋₁×s÷√n です。
式を見ると、SDが大きければ区間は広がり、nが増えれば√nを通じて狭くなります。点推定である平均に、推定精度を示す「ひげ」を付けた図をイメージすると理解しやすくなります。
頻度論の厳密な意味では、同じ方法で標本抽出と区間計算を何度も繰り返すと、作られた区間の約95%が真の母数を含む、という性質です。計算済みの1区間について「真の値が95%の確率でこの中にある」とは言いません。実務では、その研究データと方法の下で母数として整合的な値の範囲、かつ推定精度の目安として読みます。
区間が狭くても、選択バイアス、測定誤差、交絡、欠測、誤ったモデルは解消されません。同じ患者からの反復測定を独立とみなした場合など、前提が崩れると単純な式のSEや信頼区間は過度に狭くなることがあります。
p値より先に、差の大きさと信頼区間を読む
この章の要点群を比べるときは、まず平均差 Δ=x̄A-x̄B などの効果の大きさと、その信頼区間を確認します。p値だけでは、差が臨床的に重要か、推定が精密かは分かりません。
p値は、帰無仮説と統計モデルの前提が成り立つとしたとき、観察された検定統計量と同じかそれ以上に極端な結果が得られる確率です。概念的には p=P(観察値以上に極端なT|帰無仮説とモデル)と表せます。条件の縦線「|」の右側に帰無仮説が置かれている点が重要です。
したがって、p値は「帰無仮説が正しい確率」でも「結果が偶然だけで生じた確率」でもありません。p<0.05なら重要、p≥0.05なら差がない、と二分するのも不十分です。標本数が大きければ小さな差でもp値は小さくなり得て、標本数が少なければ重要な差でも不確かさが大きくなります。研究目的、事前に定めた臨床的に意味のある差、研究デザイン、効果量、信頼区間、有害事象などを合わせて判断します。
相関係数は「一緒に動く方向と強さ」であり、原因の証明ではない
この章の要点2つの量の関係は、相関係数の前に散布図で確認します。各対象を(x, y)の1点として置くと、直線的か、曲線的か、外れた点があるか、群が混在しているかが見えます。
Pearsonの相関係数は、r=Σ(xᵢ-x̄)(yᵢ-ȳ)÷√{Σ(xᵢ-x̄)²Σ(yᵢ-ȳ)²} で表され、-1から1の間を取ります。同じ方向へ動く偏差の積は正、反対方向へ動く積は負になるため、点が右上がりなら正、右下がりなら負に近づきます。0に近いことは直線的な関係が弱いことを示しますが、曲線的な関係がないとは限りません。
相関は因果を示しません。たとえば勤務負担とエラー件数に相関があっても、患者重症度、人員配置、経験年数、記録方法など別の要因が両方へ影響している可能性があります。どちらが先か、介入で変わるか、交絡をどう扱ったかを別に検討します。相関の「弱い・中等度・強い」という区切りも領域共通ではないため、r、標本数、信頼区間、散布図、臨床的背景を示します。
同じ患者の前後差は、先に「対応」を保って計算する
この章の要点同一患者の介入前後や複数時点の測定は、互いに対応しています。前後の平均を別々に眺めるだけでなく、各患者の変化量 dᵢ=介入後ᵢ-介入前ᵢ を作り、その患者内変化を要約するのが基本の考え方です。
たとえば全体の平均が変わらなくても、改善した患者と悪化した患者が同数なら相殺されます。個々の軌跡や変化量の分布を見ると、平均だけでは隠れた異質性が分かります。逆に、全測定回を独立した患者数としてnへ入れると、情報量を過大評価し、SEや信頼区間を小さく見積もるおそれがあります。
観察時刻、食事・活動・投薬との時間関係、測定機器、体位、担当者などが違えば、変化は介入効果だけでは説明できません。時系列では折れ線で経過を見せ、欠測や中断も明示します。必要な解析は2時点か多時点か、対象数、分布、研究目的で変わるため、検定名を式だけで一律に決めません。
看護で統計値を読むときは「数値・分布・文脈」を同時に確認する
この章の要点看護研究や質改善で統計値を読むときは、計算結果からすぐ結論へ飛ばず、測定の文脈へ戻ります。平均の変化が患者全体の改善なのか、一部の極端な値なのか、対象構成の変化なのかで意味が変わるからです。
まず、対象と分母を確認します。何人・何回のデータか、除外や欠測はどれだけか、同じ患者の反復測定を含むかを見ます。割合なら分子と分母、率なら観察期間と単位を確認します。次に、単位、測定方法、測定時点、機器、条件がそろっているかを見ます。その後に、中心とばらつき、ヒストグラムや箱ひげ図、個別の経時変化を組み合わせます。
普段と違う値が出たら、入力・単位・患者取り違え・測定条件・機器の状態を再確認します。同時に、値が実測なら患者の症状、意識、呼吸・循環など関連所見、直前の処置や薬剤、基礎疾患、過去の推移と合わせます。統計的に外れているかどうかより、患者安全上の変化かどうかを優先します。
研究・質改善データの問題は、責任者や研究支援・統計担当へ、対象、測定時点、単位、元データ、欠測、外れ値への対応、解析目的を具体的に共有します。患者の急変が疑われる場合は、統計処理を待たず、施設の急変対応・報告体制に従って観察所見と経時変化を医師や担当チームへ伝えます。本稿から共通の報告閾値を新たに作ることはできません。
n、分子・分母、欠測
- なぜ見るか
- 見かけの割合や精度が変わる
- 変化が示し得ること
- 対象構成の変化、記録漏れ
- 次の連携
- 元データと集計条件を再確認
平均と中央値
- なぜ見るか
- 歪みや外れ値の影響を知る
- 変化が示し得ること
- 一部の極端値、集団の混在
- 次の連携
- 分布図と該当記録を確認
SD・IQR
- なぜ見るか
- 平均が同じでも安定性が違う
- 変化が示し得ること
- ケア過程の不均一、個人差
- 次の連携
- 層別・経時データを検討
SE・95%信頼区間
- なぜ見るか
- 推定精度を知る
- 変化が示し得ること
- 標本数不足、大きなばらつき
- 次の連携
- 研究設計と解析前提を確認
外れた実測値
- なぜ見るか
- 誤記と重要な臨床変化を区別する
- 変化が示し得ること
- 測定エラー、状態変化、特殊事情
- 次の連携
- 再測定・関連所見・施設手順に沿う報告
相関・p値
- なぜ見るか
- 因果や重要性の早合点を防ぐ
- 変化が示し得ること
- 交絡、標本数の影響
- 次の連携
- 効果量、信頼区間、背景を共有
| 確認すること | なぜ見るか | 変化が示し得ること | 次の連携 |
|---|---|---|---|
| n、分子・分母、欠測 | 見かけの割合や精度が変わる | 対象構成の変化、記録漏れ | 元データと集計条件を再確認 |
| 平均と中央値 | 歪みや外れ値の影響を知る | 一部の極端値、集団の混在 | 分布図と該当記録を確認 |
| SD・IQR | 平均が同じでも安定性が違う | ケア過程の不均一、個人差 | 層別・経時データを検討 |
| SE・95%信頼区間 | 推定精度を知る | 標本数不足、大きなばらつき | 研究設計と解析前提を確認 |
| 外れた実測値 | 誤記と重要な臨床変化を区別する | 測定エラー、状態変化、特殊事情 | 再測定・関連所見・施設手順に沿う報告 |
| 相関・p値 | 因果や重要性の早合点を防ぐ | 交絡、標本数の影響 | 効果量、信頼区間、背景を共有 |
数式を「何を数え、何で割り、何と比べるか」に戻す
この章の要点量的データの統計量は、式を丸暗記するより、答えたい問いへ戻すと整理できます。平均は均等配分、中央値は順位の中央、SDは個々の値の散らばり、SEは標本平均の揺れ、信頼区間は推定の不確かさ、相関係数は2つの量の直線的な同時変化です。
読む順番は、①量的データか、②対象・単位・時点は何か、③分布はどんな形か、④中心とばらつきは何か、⑤標本から一般化しているか、⑥差の大きさと信頼区間はどうか、⑦臨床的文脈と合うか、です。数式は判断を支える道具ですが、測定の質、患者の経過、研究デザインを置き換えるものではありません。
学習メモ・復習の予定気づきを自分の言葉で残す+
わかったこと、まだ曖昧なこと、次に調べたいことを残せます。
学びを、もう一度
復習日になると、ホームと復習リストで確認できます。
次に見返す日を決める
この記事の編集方針
主要な定義・数値・推奨は、公開時点で確認できるガイドライン、公的資料、学会資料、査読論文を優先して確認しています。未確認の編集メモは公開せず、根拠の範囲や限界を区別して、読者が原資料を確認できるよう参考資料を掲載します。
詳しい編集方針を見る →参考にした資料
- データ・データセットの種類総務省統計局量的データ、連続データ、離散データ、質的データの定義を確認。見出し2。原資料を開く
- ビジネスパーソン向け統計データ利活用セミナー 講義資料総務省統計局・202629~40頁で平均・中央値・最頻値、分散、標準偏差、正規分布の基礎を確認。見出し3・4・6。原資料を開く
- ヒストグラム総務省統計局量的データの分布、階級幅と面積の注意点を確認。見出し5。原資料を開く
残り8件の参考資料を見る原資料・発行元・発行年を確認できます+
- 箱ひげ図総務省統計局四分位数、中央値、箱ひげ図の用途、ひげの定義が形式により異なる点を確認。見出し5。原資料を開く
- 1.3.5.6. Measures of ScaleNational Institute of Standards and Technology標本分散・標本標準偏差、範囲、IQRの式と外れ値への感度を確認。見出し4。原資料を開く
- Lesson 2: Summarizing DataCenters for Disease Control and Prevention・2012Section 6・7・8で代表値、ばらつき、SDとSE、信頼区間、分布に応じた選択を確認。見出し3・4・7・8。原資料を開く
- 1.3.5.2. Confidence Limits for the MeanNational Institute of Standards and Technology母平均のt信頼区間の式、標本数・標準偏差と区間幅の関係を確認。見出し8。原資料を開く