時間に合わせて読む
目次この記事でわかること13項目+
点線の用語を長押しすると、短い解説が開きます。タップ・クリックでも確認できます。
読む前に押さえたいこと
「対象者は何人集めればよいのか」「P<0.05なら結果を信じてよいのか」「項目を何度も検定したら補正が必要なのか」は、看護研究でつまずきやすい疑問です。必要人数は一律ではなく、何をどの精度で推定・検定したいかによって変わります。また、同じデータから多くの「当たり」を探すと、偶然の有意差が増えるため、研究目的に応じた多重性への対応が欠かせません。この記事では、α、検出力、効果量、信頼区間を順に理解し、計画時に必要な情報を整理できるようにします。さらに、Bonferroni法、Holm法、FDRの使い分けと、論文で確認すべき人数・P値の読み方を、架空の看護研究例で解説します。
サンプルサイズとP値の補正は「解析後」ではなく計画時に決める
この章の要点結論からいえば、サンプルサイズもP値の補正も、結果が出てから都合よく選ぶものではありません。研究計画の段階で、何を主要な問いとするか、どの程度の誤りを許容するかを決めます。
サンプルサイズが小さすぎると、重要な差があっても検出できず、信頼区間も広くなります。一方、大きければ自動的に良い研究になるわけではありません。ごく小さな差でもP値が小さくなり得るうえ、選択バイアス、測定誤差、欠測などは人数を増やすだけでは解消しません。
また、同じ研究で多数の項目、時点、群、サブグループを検定すると、偶然P<0.05になる機会が増えます。したがって、主要評価項目・必要人数・多重性への対応を一体として設計することが重要です。
最初に「誰の、何を、いつ、どの単位で比べるか」を固定する
この章の要点必要人数を求める前に、研究の問いを具体化します。「退院支援の効果を調べる」だけでは計算できません。少なくとも次を決めます。
- 対象集団:どの病棟、疾患、年齢、重症度の患者か
- 比較:通常ケアと新しい支援、介入前後、曝露群と非曝露群など
- 主要評価項目:疼痛得点、再入院、セルフケア得点など
- 評価時点:退院時、退院30日後など
- 解析単位:患者、看護師、病棟、施設、観察機会など
- 研究目的:値を精度よく推定するのか、群間差を検定するのか
- 成功条件:どの仮説が成立すれば研究目的を達成したと判断するか
1人の患者から複数時点のデータを得ても、独立した複数人になったわけではありません。同じ病棟の患者や看護師も互いに似る可能性があります。人数と独立した情報量は同じとは限らないため、反復測定やクラスター構造を計算と解析に反映させます。
必要人数を左右する8つの要素
この章の要点仮説検定を目的とする一般的な研究では、有意水準、検出力、検出したい差、データのばらつきが必要人数の中心になります。これに研究デザイン、割付比、脱落、多重性などを加えます。
主要評価項目
- 意味と注意点
- 通常は主要な問いを基準に計算する。測定尺度と評価時点も固定する
検出したい差
- 意味と注意点
- 臨床・看護実践上、見逃したくない最小限の差。単に先行研究の平均差を転記しない
分散・発生率
- 意味と注意点
- 連続値なら標準偏差、二値なら発生率など。先行研究や予備データから根拠を示す
有意水準α
- 意味と注意点
- 差がないのに差があると判断する第Ⅰ種過誤の許容水準。0.05は慣例であり絶対規則ではない
検出力1−β
- 意味と注意点
- 想定した差があるときに検出できる確率。80%または90%がよく使われるが、目的に応じて決める
研究デザイン
- 意味と注意点
- 対応の有無、反復測定、クラスター、非劣性、イベント発生までの時間などで方法が変わる
割付・脱落
- 意味と注意点
- 群の人数が不均衡になると総数が増えることがある。脱落・欠測を見込んで募集人数を増やす
多重性
- 意味と注意点
- 複数の検証的仮説を判定する場合、補正後のαを症例数計算にも反映する
| 要素 | 意味と注意点 |
|---|---|
| 主要評価項目 | 通常は主要な問いを基準に計算する。測定尺度と評価時点も固定する |
| 検出したい差 | 臨床・看護実践上、見逃したくない最小限の差。単に先行研究の平均差を転記しない |
| 分散・発生率 | 連続値なら標準偏差、二値なら発生率など。先行研究や予備データから根拠を示す |
| 有意水準α | 差がないのに差があると判断する第Ⅰ種過誤の許容水準。0.05は慣例であり絶対規則ではない |
| 検出力1−β | 想定した差があるときに検出できる確率。80%または90%がよく使われるが、目的に応じて決める |
| 研究デザイン | 対応の有無、反復測定、クラスター、非劣性、イベント発生までの時間などで方法が変わる |
| 割付・脱落 | 群の人数が不均衡になると総数が増えることがある。脱落・欠測を見込んで募集人数を増やす |
| 多重性 | 複数の検証的仮説を判定する場合、補正後のαを症例数計算にも反映する |
研究目的によってサンプルサイズの決め方は変わる
この章の要点「何人必要か」に唯一の答えはありません。推定したいのか、差を検出したいのかによって基準が変わります。
平均値・割合の推定
- 主な基準
- 信頼区間をどの幅に収めたいか
- 特に必要な情報
- 標準偏差、想定割合、許容誤差、信頼水準
2群以上の比較
- 主な基準
- 検出したい差に対する検出力
- 特に必要な情報
- 差、分散・発生率、α、検出力、割付比、検定法
生存時間・再発までの時間
- 主な基準
- 必要なイベント数
- 特に必要な情報
- 発生率、登録期間、追跡期間、打ち切り
クラスター研究
- 主な基準
- 施設・病棟間の相関を含む情報量
- 特に必要な情報
- クラスター数、各人数、クラスター内相関
既存データの解析
- 主な基準
- 利用可能人数を明示し、精度を評価
- 特に必要な情報
- 信頼区間、検出可能な差、データ欠損
パイロット研究
- 主な基準
- 実施可能性の推定精度
- 特に必要な情報
- 参加率、脱落率、測定完遂率など
多変量・予測モデル
- 主な基準
- 過学習を避けるための情報量
- 特に必要な情報
- イベント数、候補変数、検証方法、モデルの複雑さ
| 研究目的 | 主な基準 | 特に必要な情報 |
|---|---|---|
| 平均値・割合の推定 | 信頼区間をどの幅に収めたいか | 標準偏差、想定割合、許容誤差、信頼水準 |
| 2群以上の比較 | 検出したい差に対する検出力 | 差、分散・発生率、α、検出力、割付比、検定法 |
| 生存時間・再発までの時間 | 必要なイベント数 | 発生率、登録期間、追跡期間、打ち切り |
| クラスター研究 | 施設・病棟間の相関を含む情報量 | クラスター数、各人数、クラスター内相関 |
| 既存データの解析 | 利用可能人数を明示し、精度を評価 | 信頼区間、検出可能な差、データ欠損 |
| パイロット研究 | 実施可能性の推定精度 | 参加率、脱落率、測定完遂率など |
| 多変量・予測モデル | 過学習を避けるための情報量 | イベント数、候補変数、検証方法、モデルの複雑さ |
募集人数、解析人数、実際の情報量を区別する
この章の要点症例数設計で求めた人数は、多くの場合、主要解析で必要な人数です。募集時には脱落や欠測を見込みますが、人数を上乗せすれば欠測バイアスも消えるわけではありません。
確認すべき点は次のとおりです。
- 同意取得前の辞退と、登録後の脱落を分ける
- 群別・時点別・評価項目別に、データが得られた人数を示す
- 欠測理由と、群による偏りがないかを確認する
- 除外基準と解析対象集団を事前に決める
- 欠測データの処理方法と感度分析を計画する
- 病棟・施設単位で割り付ける場合は、患者数だけでなくクラスター数を確保する
- 反復測定では、測定回数を独立した人数として数えない
- まれな転帰では、総人数だけでなく実際のイベント数を確認する
[NIHの研究方法資料](https://researchmethodsresources.nih.gov/methods/additional)は、脱落や多重比較をサンプルサイズに反映し、再現できる程度に前提を示すことを勧めています。[CONSORT 2025](https://jamanetwork.com/journals/jama/fullarticle/2832868)も、無作為化比較試験では割り付け人数、解析人数、データが得られた人数、脱落理由を明示するよう求めています。
P値は「仮説が正しい確率」ではない
この章の要点P値は、設定した統計モデルと「差がない」などの帰無仮説を前提にしたとき、観察結果以上に極端なデータが得られる程度を示します。P=0.03は、帰無仮説が正しい確率が3%という意味ではありません。
また、P値だけから次のことは判断できません。
- 効果が大きいか、小さいか
- 臨床的・看護実践上重要か
- 研究結果が再現する確率
- 結果が偶然だけで生じた確率
- 個々の患者に介入すべきか
- バイアスや交絡がないか
大規模研究では、ごく小さな差でもP値が小さくなり得ます。小規模研究では、実務上重要な差があってもP値が大きくなることがあります。P≧0.05は「差がないと証明された」という意味ではなく、同等性・非劣性を示すには専用の研究デザインと解析が必要です。
したがって、効果量と95%信頼区間をP値と一緒に読むことが基本です。信頼区間が、臨床的に意味のある利益・無効・害のどこまで含むかを確認します。[ASAの声明](https://www.amstat.org/asa/files/pdfs/p-valuestatement.pdf)も、科学的判断をP値の閾値だけに基づけず、推定値や信頼区間を含めて透明に報告するよう求めています。
複数の検定を繰り返すと偶然の有意差が増える
この章の要点すべての帰無仮説が正しく、互いに独立した検定を有意水準5%で10回行うと、少なくとも1回P<0.05になる確率は、
1−0.95¹⁰=0.401
で、約40%になります。これが統計的多重性の基本的な問題です。検定が相関している場合、正確な確率は変わりますが、判定機会を増やせば誤った肯定的結論が増え得るという問題は残ります。
多重性は次の場面で生じます。
- 複数の主要評価項目
- 3群以上の群間比較
- 複数の評価時点
- 多数のサブグループ
- 複数用量・複数介入群
- 中間解析の繰り返し
- 多数のモデルや変数から有意なものだけを選ぶ解析
- 結果を見て評価項目や解析法を変更する行為
補正対象となる「仮説のファミリー」とは、同じ結論を支える判定機会のまとまりです。論文内のすべてのP値を機械的に一括補正するのでも、同じ結論に使う検定を恣意的に小分けするのでもなく、研究目的に基づいて事前に定義します。
この考え方と10検定の計算例は、[緒方による多重性の解説](https://www.jstage.jst.go.jp/article/kenkokyoiku/31/3/31_310311/_pdf/-char/ja)で確認できます。
補正が必要かは「どの結論を保証したいか」で決める
この章の要点補正の有無は検定数だけでは決まりません。検証的な主張と探索的な観察を分けることが先です。
事前に定めた主要仮説が1つ
- 基本的な対応
- その1回の検定については、通常、多重性補正は不要
複数の仮説のうち1つでも有意なら研究成功
- 基本的な対応
- FWERを制御する補正などが必要
複数の共同主要評価項目がすべて成立して初めて成功
- 基本的な対応
- 必ずしもαの分割を要しない場合がある。ただし、同時に成立させる検出力と必要人数を検討する
仮説に明確な優先順位がある
- 基本的な対応
- 固定順序法などを事前規定し、上位が不成立なら下位を検証的に主張しない
多数の探索的評価項目
- 基本的な対応
- 探索的であると明示し、全結果を透明に報告する。目的に応じてFDRなどを検討
安全性シグナルの探索
- 基本的な対応
- 厳しい補正だけでシグナルを切り捨てず、件数、発生率、重症度、時間関係を含めて評価
結果を見た後に追加した解析
- 基本的な対応
- 事後解析と明記し、新たな仮説生成として扱う
| 状況 | 基本的な対応 |
|---|---|
| 事前に定めた主要仮説が1つ | その1回の検定については、通常、多重性補正は不要 |
| 複数の仮説のうち1つでも有意なら研究成功 | FWERを制御する補正などが必要 |
| 複数の共同主要評価項目がすべて成立して初めて成功 | 必ずしもαの分割を要しない場合がある。ただし、同時に成立させる検出力と必要人数を検討する |
| 仮説に明確な優先順位がある | 固定順序法などを事前規定し、上位が不成立なら下位を検証的に主張しない |
| 多数の探索的評価項目 | 探索的であると明示し、全結果を透明に報告する。目的に応じてFDRなどを検討 |
| 安全性シグナルの探索 | 厳しい補正だけでシグナルを切り捨てず、件数、発生率、重症度、時間関係を含めて評価 |
| 結果を見た後に追加した解析 | 事後解析と明記し、新たな仮説生成として扱う |
Bonferroni法、Holm法、FDRは守る誤りが異なる
この章の要点補正法は「どれが最も厳しいか」だけでなく、何の誤りを制御するかで選びます。
Bonferroni法
- 主に制御するもの
- FWER
- 特徴
- αを検定数で割る、またはP値を検定数倍する。簡単で広く適用できる
- 主な注意点
- 検定数が多いと保守的になり、検出力が下がりやすい
Holm法
- 主に制御するもの
- FWER
- 特徴
- 小さいP値から順に判定する段階的方法
- 主な注意点
- Bonferroni法より有利なことが多く、原則として単純Bonferroni法を優越する
固定順序法
- 主に制御するもの
- FWER
- 特徴
- 優先順位に従って順に検定する
- 主な注意点
- 順序の事前規定が必要。途中で不成立なら、その後は検証的主張ができない
Tukey法
- 主に制御するもの
- 全群間の対比較
- 特徴
- 各群どうしを網羅的に比べる場合に用いる
- 主な注意点
- 正規性、分散、比較目的などの条件確認が必要
Dunnett法
- 主に制御するもの
- 対照群との複数比較
- 特徴
- 各介入群を共通の対照群と比べる
- 主な注意点
- 全群間比較を目的とする方法ではない
Games–Howell法など
- 主に制御するもの
- 分散が等しくない群間比較
- 特徴
- 不等分散を考慮した対比較
- 主な注意点
- データ構造と解析条件に合う方法を選ぶ
BH法
- 主に制御するもの
- FDR
- 特徴
- 棄却した仮説に含まれる誤発見の割合を平均的に抑える
- 主な注意点
- 「少なくとも1件誤る確率」を制御する方法ではない。依存構造にも注意する
BY法
- 主に制御するもの
- FDR
- 特徴
- より一般的な依存を想定できる
- 主な注意点
- BH法より保守的になりやすい
| 方法 | 主に制御するもの | 特徴 | 主な注意点 |
|---|---|---|---|
| Bonferroni法 | FWER | αを検定数で割る、またはP値を検定数倍する。簡単で広く適用できる | 検定数が多いと保守的になり、検出力が下がりやすい |
| Holm法 | FWER | 小さいP値から順に判定する段階的方法 | Bonferroni法より有利なことが多く、原則として単純Bonferroni法を優越する |
| 固定順序法 | FWER | 優先順位に従って順に検定する | 順序の事前規定が必要。途中で不成立なら、その後は検証的主張ができない |
| Tukey法 | 全群間の対比較 | 各群どうしを網羅的に比べる場合に用いる | 正規性、分散、比較目的などの条件確認が必要 |
| Dunnett法 | 対照群との複数比較 | 各介入群を共通の対照群と比べる | 全群間比較を目的とする方法ではない |
| Games–Howell法など | 分散が等しくない群間比較 | 不等分散を考慮した対比較 | データ構造と解析条件に合う方法を選ぶ |
| BH法 | FDR | 棄却した仮説に含まれる誤発見の割合を平均的に抑える | 「少なくとも1件誤る確率」を制御する方法ではない。依存構造にも注意する |
| BY法 | FDR | より一般的な依存を想定できる | BH法より保守的になりやすい |
同じP値でも補正法によって結論が変わる
この章の要点架空の退院支援研究で、疼痛、睡眠、不安、セルフケアの4項目を「どれか1項目でも有意なら介入効果あり」と判定するとします。得られた未補正P値を、3つの方法で調整した例です。
疼痛
- 未補正P値
- 0.003
- Bonferroni調整
- 0.012
- Holm調整
- 0.012
- BH調整
- 0.012
睡眠
- 未補正P値
- 0.012
- Bonferroni調整
- 0.048
- Holm調整
- 0.036
- BH調整
- 0.024
不安
- 未補正P値
- 0.020
- Bonferroni調整
- 0.080
- Holm調整
- 0.040
- BH調整
- 0.027
セルフケア
- 未補正P値
- 0.180
- Bonferroni調整
- 0.720
- Holm調整
- 0.180
- BH調整
- 0.180
| 項目 | 未補正P値 | Bonferroni調整 | Holm調整 | BH調整 |
|---|---|---|---|---|
| 疼痛 | 0.003 | 0.012 | 0.012 | 0.012 |
| 睡眠 | 0.012 | 0.048 | 0.036 | 0.024 |
| 不安 | 0.020 | 0.080 | 0.040 | 0.027 |
| セルフケア | 0.180 | 0.720 | 0.180 | 0.180 |
P値を補正するなら症例数計算にも反映する
この章の要点4つの検証的仮説に単純Bonferroni法を使う場合、全体のαを0.05とすれば、各検定の基準は0.05÷4=0.0125です。α=0.05のまま計算した人数では、補正後の基準に対する検出力が不足する可能性があります。
したがって、症例数計算では次の順序が重要です。
- 主要仮説と仮説のファミリーを決める
- FWER、FDRなど、守る誤りを決める
- 補正法・検定順序を決める
- 補正後の有意水準を使って必要人数を計算する
- 脱落・欠測・クラスター構造などを反映する
- 前提値を変えた感度分析を行う
優先順位が明確なら固定順序法によって検出力の低下を抑えられる場合があります。ただし、順序を結果に合わせて変更することはできません。[Lakensのサンプルサイズ論文](https://online.ucpress.edu/collabra/article/8/1/33267/120491/Sample-Size-Justification)も、複数検定で補正したαを使うなら、そのαを検出力分析へ反映する必要があると説明しています。
解析後に得られた効果量を使う「事後検出力」で人数不足を正当化することは推奨されません。解析後は、効果推定値と信頼区間がどの程度の精度を持つかを示すほうが有用です。[STROBEの解説](https://pmc.ncbi.nlm.nih.gov/articles/PMC2020496/)も、観察研究では実際に利用できた人数と推定精度を示し、事後検出力による説明を避けるよう述べています。
研究実施中と論文読解で確認するポイント
この章の要点研究実施中は、P値を途中で確認して対象者を増減するのではなく、登録状況とデータ品質を監視することが大切です。中間解析を行う場合は、時期、判定基準、αの調整、終了条件を事前に規定します。
実施中に確認する事項:
- 登録人数が予定どおりか
- 不参加・脱落理由に偏りがないか
- 主要評価項目の欠測率が群によって異ならないか
- 病棟・施設ごとの登録人数が極端に偏っていないか
- 測定時点や測定方法が統一されているか
- 事前に定めていない除外や解析変更が生じていないか
登録遅延、想定を超える欠測、施設間の偏り、解析計画の変更が必要になった場合は、結果を伏せた状態で研究責任者・統計担当者へ共有します。必要に応じて倫理審査や研究計画書の変更手続きを行い、変更理由と時期を記録します。
論文を読む際は、次を確認します。
- 主要評価項目と評価時点が明確か
- 症例数計算の前提と根拠が記載されているか
- 予定人数、登録人数、解析人数が区別されているか
- 欠測・脱落とその理由が示されているか
- クラスターや反復測定を解析で考慮しているか
- 多重性の対象と補正法が事前規定されているか
- 未補正P値と調整P値が区別されているか
- 効果量と95%信頼区間が示されているか
- 主要解析、追加解析、事後解析が区別されているか
- 統計学的有意差と臨床的・実務的意義を混同していないか
個々の患者への看護判断をP値だけで変更してはいけません。効果の大きさ、信頼区間、有害事象、患者への適用可能性、本人の価値観を合わせて検討します。
まとめ
この章の要点量的研究のサンプルサイズに万能の人数はありません。主要評価項目、検出したい差、分散・発生率、α、検出力、研究デザイン、脱落、多重性を基に決めます。
P値は効果の大きさや仮説が正しい確率を示すものではありません。効果量と信頼区間を併記し、臨床的意義と統計学的有意差を分けて読みます。
複数の検証的仮説から肯定的な結論を選ぶ場合は、多重性への対応が必要です。Bonferroni法やHolm法は主にFWER、BH法などはFDRを制御します。仮説、補正法、必要人数を事前に整合させることが、信頼できる看護研究への出発点です。
学習メモ・復習の予定気づきを自分の言葉で残す+
わかったこと、まだ曖昧なこと、次に調べたいことを残せます。
学びを、もう一度
復習日になると、ホームと復習リストで確認できます。
次に見返す日を決める
この記事の編集方針
主要な定義・数値・推奨は、公開時点で確認できるガイドライン、公的資料、学会資料、査読論文を優先して確認しています。未確認の編集メモは公開せず、根拠の範囲や限界を区別して、読者が原資料を確認できるよう参考資料を掲載します。
詳しい編集方針を見る →参考にした資料
この記事は一般的な情報整理を目的としています。出典は編集確認後に追加します。
実践時は最新情報と所属施設の手順をご確認ください。