治療家が学術論文を読む場面で、もっとも頻繁に目にする記号は「p<0.05」という五文字ではないでしょうか。この数字が載っていれば「有効と示された治療」、載っていなければ「効果が確認されなかった治療」という二値的な読み方は、臨床現場で広く定着しています。しかし2016年以降、統計学の国際的な権威機関がこの慣習に正面から疑義を呈し、治療研究の読み方を根本から見直すよう求めています。p値は研究の1側面に過ぎず、「治療の大きさ」と「患者にとっての意味」は別の指標で読む必要があります。本稿では、p値と効果量という2つの統計指標の意味と限界を、実在の研究論文に基づいて詳しく解説し、数字を臨床判断に翻訳するための具体的な視点を提供します。
p値とは何か——そして何でないか
p値(p-value)とは、統計的仮説検定において「帰無仮説が真であると仮定したとき、観測されたデータと同程度かそれ以上に極端なデータが偶然に得られる確率」を指します。帰無仮説とは通常「治療効果はゼロである」という前提のことです。つまりp値は、もし本当に治療効果がなかったとしたら、今回観測されたような(あるいはそれ以上に大きな)差が偶然生じる確率を表しています。
p<0.05という慣習的な閾値は、「この結果が帰無仮説のもとで偶然生じる確率が5%未満」を意味します。しかし、この数字が伝えることと伝えないことの境界線を理解しないままでは、論文の結論を誤読するリスクが常に潜んでいます。
p値が教えてくれないことは、以下の4点に集約されます。
まず、「治療効果が存在する確率」ではありません。p値は「帰無仮説が真であるときにこのデータが得られる確率」であり、「帰無仮説そのものが正しい確率」でも「対立仮説(治療有効)が正しい確率」でもありません。これは論理の方向が逆転しているように見えますが、統計的仮説検定の根本的な枠組みがそうなっています。
次に、「効果の大きさ」を伝えません。サンプルサイズが十分に大きければ、臨床的にほぼ無意味な微小な差でもp<0.05になります。たとえば、1,000人を対象とした慢性腰痛の介入研究で、治療群のVASスコア(0〜10点)が平均0.3点改善したとしましょう。このとき差は統計的に有意になり得ますが、0.3点という差が患者の日常生活に意味をもたらすかどうかは、p値からは一切わかりません。
3つ目に、「臨床的な意味」を保証しません。統計的有意性はサンプルサイズと効果の大きさとノイズの関数であり、患者が体感する変化や治療家が目標とする機能回復とは直接対応しません。
4つ目に、「研究の再現可能性」を示しません。あるp<0.05の結果が別の研究室・別の患者集団で再現される確率は、p値から計算できません。
この問題は研究者の間でも長年議論されてきましたが、2016年にアメリカ統計学会(ASA)がp値の正しい使用法に関する正式な声明を発表したことで、国際的な議論が一気に加速しました。WassersteinとLazarがThe American Statistician誌に発表した同声明(2016年)は、p値を意思決定の唯一の基準として使用すること、あるいはp<0.05という二値的な判断に依拠することへの強い警告を含んでいます。声明では「p値は、データとある特定の統計モデル(帰無仮説)との不一致の程度を測る指標に過ぎない」と明記され、それ以上でも以下でもないことが強調されています。
さらに2019年、Amrheinら(Nature誌)は800名以上の科学者との連名で「統計的有意性(statistical significance)という概念そのものを廃止すべきだ」と主張しました。同論文はp値の二値的使用が科学的コミュニケーションを歪め、過剰な確信を生む源泉だと論じ、代わりに効果量と信頼区間を用いた連続的な解釈を推奨しました。医学・心理学・生物学にまたがるこの大規模な提言は、学術誌の査読方針や研究報告のガイドラインにも波及しつつあります。
図1: p値の概念——帰無仮説の分布の中で観測された統計量がどこに位置するかを示す模式図。金色の面積が「p値」にあたる
p値の概念的な限界を押さえたうえで、では治療の「大きさ」を適切に表す指標として何を使うべきかという問いに向かうとき、統計学者コーエンが体系化した「効果量(effect size)」の概念が、臨床判断においてp値の最も重要な補完指標となります。
効果量——治療の「大きさ」を単位なしで比較する
効果量(effect size)とは、統計的検定の結果(有意か否か)とは独立に、観察された差や関連の「規模(magnitude)」を直接表す指標の総称です。効果量の最大の利点は、測定単位に依存しない点にあります。VASのポイントも、ROMの角度も、筋力値も、それぞれの標準偏差で割って標準化することで、異なる研究間で効果の大きさを直接比較できるようになります。
治療研究で最もよく使われる効果量指標は、コーエンのd(Cohen's d)です。その計算式は次のとおりです。
d =(治療群の平均 − 対照群の平均)÷ 両群のプールされた標準偏差
Cohenは1992年にPsychological Bulletin誌に発表した論文「A power primer」の中で、効果量の解釈の目安として広く参照される経験則を提示しました。この論文はそれ以降、行動科学・医学・リハビリテーション研究にわたって何十万回も引用される基盤的な文献となっています。
経験則の内容は以下のとおりです。
- d=0.2(小効果):治療群と対照群の分布の重なりが92%程度。日常的な観察では知覚しにくい微小な差。
- d=0.5(中効果):分布の重なりが79%程度。治療群の69%が対照群の平均を上回る。
- d=0.8(大効果):分布の重なりが69%程度。治療群の79%が対照群の平均を上回る。
分布の「重なり」という表現は直感的に重要です。たとえばd=0.5のとき、治療群と対照群の分布の中心は0.5標準偏差分離れていますが、それでも両群の分布の79%は重なっています。つまり、治療を受けていない患者の3人に2人は、治療を受けた患者の平均よりも良い値を示す可能性があることを意味します。これは「効果あり」という単純な二値判断がいかに情報を損失しているかを示しています。
ただしCohen自身は同論文のなかで、この目安はあくまで分野横断的な「大まかな参照点」であり、文脈に依存して解釈すべきだと注意しています。たとえば、副作用のない簡便な介入であればd=0.2でも臨床的価値があり得ますし、侵襲的な治療では大きな効果量でなければ正当化されません。
効果量の解釈において、点推定値(dの値そのもの)だけに注目するのは不十分です。**95%信頼区間(CI)**と合わせて読むことが必須です。信頼区間は「仮に同じ方法で無限回研究を繰り返したとき、95%の場合に真の値を含む区間」と慣習的に説明されます。信頼区間が広いほど推定の不確実性が大きく、それはほぼ例外なくサンプルサイズが不十分であることを意味します。
コーエンのd以外の効果量指標として、2値アウトカム(回復した/しなかった)ではオッズ比(OR)や絶対リスク減少(ARR)、相関研究ではPearsonのrや**η²(イータ二乗)**などが用いられます。臨床研究でとくに重要なのはARRです。相対リスク減少(RRR)が50%という表現は非常に印象的に聞こえますが、もとのリスクが2%であれば絶対的な差は1%(NNT=100)に過ぎません。ARRとNNT(治療必要数)を確認する習慣が、治療の「実際の大きさ」を理解するうえで欠かせません。
図2: コーエンのd——小(0.2)・中(0.5)・大(0.8)の効果量で2群の分布がどのように重なるかを示す。dが大きいほど2群の差は明確になるが、中程度(0.5)でもなお79%が重なっていることに注目
検出力とサンプルサイズ——小標本研究が引き起こす「勝者の呪い」
統計的検出力(statistical power)とは、「真の治療効果が存在するとき、それを統計的に検出できる確率」を指します。計算上、検出力は「1 − β」で表され、ここでβは第2種の誤り(偽陰性)の確率です。慣例的に検出力80%が研究デザインの目安とされますが、これは「10回中2回は真の効果を見逃す」という水準であり、決して高いとは言えません。
2013年、Buttonら(Nature Reviews Neuroscience誌)は神経科学分野の730本の研究を系統的に分析し、衝撃的な結果を報告しました。同レビューが推定した研究の中央値検出力はわずか21%であり、特定のサブフィールドでは8%に満たないものもありました。検出力21%とは、真の効果があっても5回に4回はそれを検出できないことを意味します。
Buttonらが指摘したのは、低検出力の問題が単純に「見逃しが多い」という以上の深刻な帰結をもたらすことでした。これを「勝者の呪い(winner's curse)」と呼びます。
勝者の呪いのメカニズムを理解するために、次のシナリオを考えてみましょう。真の効果量がd=0.4であり、各研究のサンプルサイズは20名(各群10名)だとします。このとき、偶然にp<0.05を達成して「発見」として公表される研究は、実際の効果量d=0.4よりもはるかに大きな効果量(たとえばd=0.9〜1.2)を報告する傾向があります。なぜなら、小標本の研究では「たまたま効果量が大きく見えた回」だけが統計的有意になるからです。
つまり、出版された小標本研究のポジティブな結果は、真の効果量を系統的に過大推定しています。これが「勝者の呪い」の実態です。その結果、後続の大規模研究や再現研究が行われるたびに効果量が縮小する「シュリンケージ(shrinkage)」現象が起こり、「最初の報告はいつも大きすぎる」という学術的パターンが定常化します。
Buttonらはさらに、低検出力研究の集積によって引き起こされる問題として「偽発見率(false discovery rate)の上昇」を挙げています。検出力が低い研究が出版バイアスによってフィルタリングされると、発表された「有意な結果」の中に偽陽性が占める割合が急増します。同論文の試算では、検出力20%・α=0.05・事前確率50%の研究環境では、公表されたポジティブ結果のうち偽陽性率が36%に達することが示されています。
この問題は神経科学に限りません。筋骨格系疾患の理学療法研究やカイロプラクティック介入の文献でも、サンプルサイズが20〜50名程度の研究が大多数を占め、同様の検出力問題が存在することが指摘されています。
図3: サンプルサイズと効果量推定の不確実性——真の効果量d=0.5を想定したとき、n=20では95%信頼区間がほぼ0をまたぐほど広く、治療効果があるかどうかさえ定かでない。n=400になって初めて実用的な精度が得られる
臨床研究の実践において事前検出力計算(a priori power analysis)を行わずに研究を開始することは、「十分な被験者数を集めれば有意になる」という逆方向の思考につながります。Buttonらはこの問題に対し、研究を公表する前に事前登録(pre-registration)を行い、計画した検出力と実際のサンプルサイズを明示することを推奨しています。
なぜ研究知見の多くは再現されないのか——Ioannidisのモデルで考える
検出力やp値の問題が積み重なると、科学的知見全体の信頼性にどのような影響を与えるのでしょうか。この問いに正面から向き合ったのが、Ioannidis(2005年)がPLOS Medicine誌に発表した論文「Why most published research findings are false」です。この論文は発表から20年近く経った現在でも、医学研究における最も広く引用されるメソドロジカル論文の一つです。
Ioannidisの分析の核心は、**陽性的中率(positive predictive value:PPV)**という概念にあります。PPVとは「統計的に有意な結果が得られたとき、それが真の効果を反映している確率」のことです。この確率は直感的に高いと思われがちですが、実際は想像以上に低くなり得ます。
PPVは以下の変数によって決まります。
- R:研究される関係が「真に存在する」確率(事前確率比)
- 1−β:検出力(真の効果を検出できる確率)
- α:第1種の誤り率(慣例的に0.05)
Ioannidisの公式をざっくり言えば、PPV = R×(1−β) / (R×(1−β) + α) で近似されます。
探索的な研究(多くの仮説を無差別に検証する状況)では、R(事前確率比)は非常に低くなります。たとえばR=1:10(10件に1件が真の効果)、検出力50%、α=0.05とすると、PPVは約50%に過ぎません。つまり、「有意な結果」が出ても、それが真である確率は半分程度しかありません。
さらにIoannidisは、現実の研究環境では「バイアス(u)」の影響も加わると指摘します。複数の結果変数から都合の良いものを選ぶ「アウトカム切り替え」、集めながら繰り返し検定する「逐次検定」、モデルを変えながら探索する「p-hacking」などが横行するほど、PPVはさらに低下します。
また、出版バイアスの問題も見過ごせません。陽性結果(有意な結果)は陰性結果の3〜5倍の確率で論文として出版されるという推定があります。このフィルタリングにより、「出版された文献」の中での偽陽性率は「実施された全研究」の中での偽陽性率よりも大幅に高くなります。医学分野のメタアナリシスでファネルプロット(funnel plot)が非対称を示すことが多いのは、この出版バイアスの証拠として解釈されています。
Ioannidisモデルが治療家に伝える最も実践的なメッセージは次の3点です。
第1に、単一の研究結果には大きなノイズが含まれるということです。特に被験者数が少なく、探索的な性格を持つ研究の陽性結果は、その半数近くが偶然の産物である可能性を否定できません。
第2に、独立した複数の研究で一貫性が確認されてはじめて、知見の信頼性が上がるという点です。特に、プレ登録された試験(registered trials)が同じ方向を向いているかどうかを確認することが重要です。
第3に、事前確率(R)が低い研究ほど懐疑的に読む必要があるということです。理論的根拠が乏しい、あるいは「プロット仮説」的な研究(例:特定の周波数で免疫が活性化するという仮説を初めて検証する研究)では、有意なp値が出ても信頼性は非常に低くなります。
図4: Ioannidisモデル——事前確率10%・検出力80%・α=0.05の条件下では、公表された「有意な結果」のうち36%が偽陽性である。事前確率がさらに低い探索的研究ではPPVはさらに下がる
最小臨床的重要差(MCID)——「患者が感じる変化」の閾値
p値と効果量の問題を踏まえると、治療研究を臨床判断に翻訳する際には第3の軸が必要になります。それが「最小臨床的重要差(minimal clinically important difference:MCID)」という概念です。
MCIDとは「患者が『変化した』と感じる最小の差」のことです。より正確には、「患者が有益または有害と感じる、評価されたドメインにおけるスコアの最小の差」と定義されます。この概念を体系化した先駆的な研究がJaeschkeら(1989年、Controlled Clinical Trials誌)です。同研究は入院患者の慢性的な健康状態を測定する文脈で、「どの程度の変化があれば患者は改善を実感するか」を経験的に調査し、7段階リッカートスケールで「わずかに良くなった」と回答した患者群が示したスコア変化量を基準として、MCIDの操作的定義を初めて提示しました。
MCIDが臨床的に重要な理由は、統計的有意性との乖離にあります。次の例を考えてみましょう。
慢性頸部痛の患者500名を対象としたRCT(無作為化比較試験)で、特定の徒手療法が対照群と比較してVAS(0〜100mm)を平均4mm改善し、p<0.001という統計的に非常に有意な結果が出たとします。ところが、慢性頸部痛のVAS-MCIDは一般的に研究によって異なりますが、15〜20mm程度とする報告が多く、4mmの差は統計的には確認されても患者の体感には届かない可能性があります。逆に、サンプルサイズ30名のパイロット試験でVASが18mm改善したが、p=0.12(有意でない)という結果が出た場合、MCIDを超える変化が観察されていながら検出力不足で「効果なし」に分類されるという矛盾が生じます。
この2つの「矛盾」を整理すると、治療研究の結果は**統計的有意性(p値)×臨床的意味(MCID超過)**の2軸で4象限に分けて考えることが有用です。
第1象限(統計的有意+臨床的意味あり):最も理想的な結果。大きな治療効果が信頼性高く確認されています。
第2象限(統計的有意+臨床的意味なし):「大標本の罠」。サンプルが大きすぎて、患者にとって無意味な微小な差が有意に見えます。この結果を「有効」と解釈するのは誤りです。
第3象限(統計的非有意+臨床的意味あり):「小標本の罠」。臨床的に意義のある効果があるにもかかわらず、検出力不足で見逃された可能性があります。「効果なし」ではなく「結論未確定」と解釈すべきです。
第4象限(統計的非有意+臨床的意味なし):効果がなく、それが適切に確認された結果。この場合にのみ「治療効果がなかった」と言えます。
MCIDの具体的な数値は、測定尺度・患者集団・疾患の種類によって大きく異なります。研究を読む際には、その研究で使用された測定ツールのMCIDが研究者によって参照されているかを確認することが、臨床的解釈の精度を高める第一歩となります。MCIDは「変化の量」のみを捉えるため、治療の副作用・コスト・患者の好みなどと合わせて総合的に判断することが重要です。
図5: 統計的有意性×臨床的意味(MCID超過)の4象限——「有意=効果あり」と単純に解釈できるのは第1象限のみ。第2象限(大標本の罠)は統計的に有意でも臨床的には無意味な可能性があり、第3象限(小標本の罠)は有意でないが臨床的に重要な変化が起きている場合を示す
臨床への示唆——明日の診療から変えられること
ここまで概観してきたp値の限界、効果量の概念、検出力とサンプルサイズの問題、そして再現性危機とMCIDの視点を、臨床家の日常的な論文読解にどう活かすかを整理します。
論文を読む際の優先順位を変える
p値を確認することは必要ですが、それを「有効か無効か」の最終判断材料にしないことが出発点です。p値を確認したあとに続けるべきは以下の手順です。
第1ステップ:効果量と信頼区間を確認する。 多くの論文はp値と並んで平均差や標準化効果量を報告していますが、見落とされがちです。信頼区間の幅が広い(たとえば95%CI:-0.1〜1.2)場合、点推定値(平均差0.5など)は精度が低く、臨床的な解釈はそれを前提に慎重にすべきです。
第2ステップ:MCIDと比較する。 研究で使用された測定ツールのMCIDが文中に言及されているか確認します。言及がない場合でも、同様の患者集団・測定ツールを用いた先行研究からMCIDを調べ、報告された平均差がそれを上回るかどうかを確認します。
第3ステップ:サンプルサイズと研究デザインを評価する。 被験者数20〜30名の単一施設RCTは「概念実証(proof of concept)」として読むのが適切です。事前登録されているか、検出力計算が報告されているかも確認します。プレ登録されている試験(clinicaltrials.govなどで確認できる)は、事後的なアウトカム変更の可能性が低く、信頼性が高い傾向があります。
第4ステップ:独立した複数の研究で一貫しているかを確認する。 1本の論文で方針を変えることには慎重であるべきです。コクランレビューなどの系統的レビュー・メタアナリシスは、個別研究のノイズを平滑化し、より信頼性の高い効果量推定を提供します。ただしメタアナリシスも出版バイアスや研究の異質性の影響を受けるため、含まれる研究の質とファネルプロットの対称性を確認することが重要です。
相対リスク減少と絶対リスク減少の違いを意識する
治療の「効果」を伝える際の数字のなかで、もっとも誤解を招きやすいのが相対リスク減少(relative risk reduction:RRR)と絶対リスク減少(absolute risk reduction:ARR)の違いです。「治療によって再発リスクが50%減少した」というRRRは印象的ですが、元の再発率が4%であれば、治療後のリスクは2%となり、ARRは2ポイントです。このとき、NNT(number needed to treat:治療必要数)は1÷0.02=50となり、50人の患者に治療を行ってはじめて1人の再発を防げるという意味になります。ARRとNNTは治療の価値をより現実的に伝える指標であり、学術誌の採用頻度も増えてきています。
単一研究に過剰反応しない
「先週の学会で発表された新しい研究でXは効果がないと示された」という情報に対して、臨床家が翌週から治療方針を変える必要は通常ありません。単一の研究結果はノイズを含んでおり、既存の知見の文脈の中で解釈されるべきです。一方で、複数の大規模プレ登録試験が一貫して効果を否定しているにもかかわらず特定の治療法を継続することも、エビデンスに基づく態度とは言えません。「証拠の重み(weight of evidence)」を継続的に更新していく姿勢が、長期的に患者に最善の治療を届けることにつながります。
図6: 論文の数字を臨床判断に翻訳するための5ステップフロー——p値の確認は起点に過ぎず、効果量・MCID・研究の質・証拠の総体の4つの層を順に確認することで、数字を臨床文脈に翻訳できる
まとめ
p値はあくまで「帰無仮説のもとでこのデータが偶然に出る確率」であり、「治療効果がある確率」でも「結果が再現される確率」でもありません。2016年のASA声明(Wasserstein & Lazar)と2019年のAmrheinらの提言は、p値の二値的使用を科学コミュニティ全体に再考させる転換点となりました。
効果量(Cohen's d、OR、ARRなど)は、サンプルサイズに依存せず治療の「大きさ」を直接表す指標です。Cohenが1992年に示した目安(小:0.2、中:0.5、大:0.8)は参照点として有用ですが、治療の文脈・副作用リスク・患者価値観と合わせて解釈することが求められます。
Buttonら(2013年)が明らかにしたとおり、多くの研究は統計的検出力が不十分であり、有意になった小標本研究は真の効果量を過大推定する「勝者の呪い」の影響を受けています。Ioannidis(2005年)のモデルは、事前確率・検出力・有意水準・出版バイアスが組み合わさると、公表されたポジティブな結果のかなりの割合が偽陽性になり得ることを数理的に示しています。
Jaeschkeら(1989年)が提唱したMCIDの概念は、「患者が感じる最小の変化量」という臨床的閾値を提供し、統計的有意性と臨床的意味の乖離を可視化します。4象限モデルで整理すると、「有意かつMCID超過」の第1象限だけが臨床実装を積極的に検討できる状態であることがわかります。
治療研究の数字は、p値を起点にしながらも、効果量・信頼区間・MCID・研究の質・証拠の総体という複数の軸で読み解いてはじめて、臨床判断に翻訳できる情報になります。この多層的な読解習慣は、日常の論文抄読会を患者ケアに直結した実践的な対話の場に変えていく力を持っています。
参考文献
- Wasserstein RL, Lazar NA. (2016). The ASA's statement on p-values: context, process, and purpose. The American Statistician, 70(2), 129–133.
- Amrhein V, Greenland S, McShane B. (2019). Scientists rise up against statistical significance. Nature, 567, 305–307.
- Cohen J. (1992). A power primer. Psychological Bulletin, 112(1), 155–159.
- Button KS, Ioannidis JPA, Mokrysz C, et al. (2013). Power failure: why small sample size undermines the reliability of neuroscience. Nature Reviews Neuroscience, 14, 365–376.
- Ioannidis JPA. (2005). Why most published research findings are false. PLOS Medicine, 2(8), e124.
- Jaeschke R, Singer J, Guyatt GH. (1989). Measurement of health status: ascertaining the minimal clinically important difference. Controlled Clinical Trials, 10(4), 407–415.