「このコクランレビューによれば、○○療法は有効とされています」——患者さんや同僚からそのような話を聞かされるたびに、あなたはその根拠をどこまで自分で確認できているでしょうか。コクランレビューには単に「有効か無効か」を示す結論行があるだけでなく、その裏にエビデンスの確実性を多角的に評価した精緻な表が存在します。その表を読み解くための共通言語が「GRADEアプローチ」です。現在、世界保健機関(WHO)から各国の臨床ガイドライン委員会まで100以上の組織がGRADEを採用しており、エビデンスに基づく臨床判断の共通インフラとなっています。本稿では、GRADEの仕組みを段階的に解説しながら、コクランレビューを手に取った際に「何をどの順序で確認すればよいか」を、治療家の実際の臨床疑問に即して説明します。

コクランレビューとは——系統的レビューの「金本位制」

コクランレビューの思想的な出発点は、英国の医師アーチー・コクランが1972年に著した『Effectiveness and Efficiency(有効性と効率)』にさかのぼります。コクランはこの著作の中で、「医療における治療の有効性を判断するためには、ランダム化比較試験(RCT)を系統的に統合しなければならない」と主張し、当時の医学界に大きな衝撃を与えました。彼のビジョンを受け継ぐ形で、1993年に英国オックスフォードに「コクランコラボレーション」が設立されました。現在は130か国以上の研究者・臨床家・患者代表が参加し、6,000本を超えるシステマティックレビューをオンラインで公開しています(Higgins et al., 2019)。

コクランレビューが通常の解説論文やナラティブレビューと根本的に異なるのは、次の5点です。

① 研究開始前のプロトコル公開登録: レビューを始める前に、研究疑問・選択基準・検索戦略・アウトカムの優先順位といった計画をPROSPERO(国際的な系統的レビュー登録データベース)に登録し、公開します。これにより、「結果を見てから都合のよい仮説に合わせる」HARKing(Hypothesizing After Results are Known)を防ぎます。プロトコルの変更は発生しうるものですが、その場合も変更内容と理由を明示することが求められます。

② PICOによる厳格な研究疑問の定義: 「どんな患者に(P:Population)、どんな介入を行い(I:Intervention)、何と比較して(C:Comparison)、どんな結果を見るか(O:Outcome)」を明示します。このPICO形式があいまいなレビューは、後述するGRADE評価での「非直接性(Indirectness)」の減点対象となります。治療家がレビューを読む際に、まず「このレビューのPICOは自分の患者と一致しているか」を確認することが、批判的読解の第一歩です。

③ 包括的な文献検索: MEDLINE(PubMed)・EMBASE・コクラン登録試験データベース(CENTRAL)に加え、グレー文献(未出版論文・学会抄録・政府報告書)や引用文献の手作業追跡まで行い、「有意差のある研究だけが出版される」出版バイアスを最小化しようとします。この網羅的な検索こそが、単純なPubMed検索に基づく個人レビューとの本質的な差です。

④ 2名の研究者による独立した評価: スクリーニング(タイトル・抄録の選別)から全文評価・データ抽出・バイアスリスク評価まで、2名の研究者が独立して行い、不一致はコンセンサス会議または第三者の仲裁で解決します。この手続きが個人的な先入観によるバイアスを低減する最も重要な仕組みです。

⑤ 透明なバイアスリスク評価: Cochrane Risk of Bias Tool 2(RoB 2)などの構造化ツールを用いて各研究のバイアスリスクを系統的に評価し、その結果を表形式で全て報告します。「Low risk(低リスク)」「Some concerns(一部懸念)」「High risk(高リスク)」という三段階で評価され、その集計がGRADE評価の「バイアスリスク」ドメインに直接反映されます。

システマティックレビューとメタアナリシスの違い

「システマティックレビュー」と「メタアナリシス」はしばしば混同されます。システマティックレビュー(系統的レビュー)は、上記のような厳格な手順で複数の研究を統合・評価する方法論的枠組みです。一方、メタアナリシスは複数の研究から得た数値を統計的に統合して一つの効果推定値を算出する統計手法です。コクランレビューはシステマティックレビューですが、含まれる研究が十分に同質であればメタアナリシスを実施し、研究間の異質性が高い場合は定性的統合(narrative synthesis)にとどまることもあります。

報告の透明性という観点では、Page et al.(2021年、BMJ)が発表したPRISMA 2020声明が国際的な報告ガイドラインの標準となっており、コクランレビューもこの基準に準拠しています。PRISMA 2020は、文献検索から最終選定までの流れを示すフローダイアグラムの作成を含む27項目のチェックリストを設けており、読者がレビューの透明性を評価する際の指針となります。

Summary of Findings(SoF)テーブル

コクランレビューを開いたとき、多くの臨床家が最初に向かうべきは「Summary of Findings(SoF)テーブル」です。SoFテーブルはレビューの核心的な発見を凝縮した一覧表であり、①対象とするアウトカム(通常は重要度順に最大7つ)、②含まれた研究数と参加者の合計、③比較群と介入群のリスク(または効果の差)、④相対効果の推定値と95%信頼区間、⑤GRADEによるエビデンスの確実性、⑥コメント——という構造で整理されています。後半のセクションでSoFテーブルの各列を詳しく読み解きますが、まずは「確実性」の列がGRADE評価の結果であることを押さえておいてください。

コクランレビュー作成プロセス ① 研究疑問の設定(PICOフレームワーク) P:対象 I:介入 C:比較対照 O:アウトカム ② プロトコル事前登録(PROSPERO等) 選択基準・検索戦略を公開登録してバイアスを防ぐ ③ 包括的な文献検索 DB・グレー文献・引用文献追跡・手作業検索 ④ 2名独立スクリーニング → 全文評価 不一致はコンセンサス会議・第三者仲裁で解決 ⑤ データ抽出・バイアスリスク評価 Cochrane RoB Tool 2 / ROBINS-I を使用 ⑥ 統合・分析(メタアナリシス等) フォレストプロット・異質性検定(I²)・感度分析 ⑦ GRADEによるエビデンス確実性評価 → SoFテーブル作成・診療ガイドラインへの反映

図1: コクランレビュー作成プロセスのフロー図

GRADEとは——エビデンスの確実性を4段階で評価する国際標準

GRADE(Grading of Recommendations Assessment, Development and Evaluation)は、2000年代初頭にGordon Guyattらが主導して開発したエビデンス評価システムです。Guyattら(GRADE Working Group)は2008年にBMJに掲載した論文「GRADE: an emerging consensus on rating quality of evidence and strength of recommendations(エビデンスの質と推奨の強さの評価に関する新たなコンセンサス)」において、それまで乱立していた各学会・各ガイドラインのエビデンスグレード分類を統一する必要性を論じました(Guyatt et al., 2008年、BMJ)。

GRADEが誕生するまで、医療ガイドラインにはA/B/C/DやLevel I〜IVなどさまざまな格付けシステムが乱立しており、次の3つの根本的な問題がありました。第一に、「RCTは自動的に最高ランク」とする設計のため、RCTの質のばらつき(例:サンプルサイズが極端に小さいRCT)が無視されていました。第二に、「エビデンスの質(確実性)」と「推奨の強さ」が混同され、質が高い研究でも副作用リスクや費用便益によって弱い推奨になりうるという論理構造が見えにくくなっていました。第三に、異なるガイドライン間で同一の研究が異なるランクに位置づけられ、臨床家にとっての混乱の元となっていました。GRADEはこれら三つの欠陥を解決するために設計されており、現在はWHO、国際骨粗鬆症財団(IOF)、日本を含む各国の診療ガイドライン委員会など、100を超える組織で標準採用されています。

4段階の確実性レベル

GRADEでは、ある介入が特定のアウトカムに与える「真の効果」についての確信の程度を、次の4段階で表現します。

高(High): 真の効果が効果推定値に非常に近いという確信がある。今後の研究が効果推定値を大幅に変える可能性はほとんどない。臨床判断として「この推定値に基づいて動いてよい」という水準です。

中(Moderate): 真の効果が効果推定値に近いという相当の確信はあるが、今後の研究が効果推定値を変える可能性があり、推定値が変わることもありうる。「おおよそ信頼できるが留保が必要」な水準です。

低(Low): 真の効果についての確信は限定的であり、今後の研究が効果推定値を大幅に変える可能性が高い。「現時点の推定値には相当の不確かさがある」水準です。

非常に低(Very Low): 真の効果についての確信はほとんどない。効果推定値は非常に不確かであり、実際の効果はゼロ、あるいは逆方向である可能性さえ排除できない。

この4段階を表す際、コクランレビューや多くのガイドラインでは「⊕⊕⊕⊕(高)」「⊕⊕⊕⊝(中)」「⊕⊕⊝⊝(低)」「⊕⊝⊝⊝(非常に低)」という記号表記か、「HIGH / MODERATE / LOW / VERY LOW」という英語表記が使われます。SoFテーブルの確実性の列を見たとき、この記号がどのレベルを指すかをすぐに読み取れるようにしておくことが重要です。

出発点:RCTはHighから、観察研究はLowから

GRADEの評価は、研究デザインによって「出発点」が決まります。ランダム化比較試験(RCT)または複数のRCTのメタアナリシスは**「高(High)」から出発します。一方、観察研究(コホート研究・症例対照研究・横断研究など)は「低(Low)」**から出発します。

重要なのは、これが「RCTは常により良い研究」という意味ではないという点です。RCTが「高」から出発するのは、ランダム化によって選択バイアスが制御され、介入群と対照群の比較可能性が担保されるという設計上の強みがあるためです。しかし後述の5つの要因によって、RCTであっても確実性は「中」「低」「非常に低」へと格下げされます。逆に観察研究であっても、特定の条件(後述する3つの格上げ要因)を満たせば「中」や「高」に格上げされることがあります。

また、GRADEが評価するのは「研究の質そのもの」ではなく「私たちが効果推定値を信頼できる程度(確実性)」であるという点も、臨床判断への活用において重要な概念的区別です。質が高い研究でも、その研究集合体全体を見たときに結果の確実性が低いことはあり得ます——例えば、方法論的に完璧なRCTが10本あっても、そのすべてが異なる集団・異なるアウトカム指標を使っていれば、私たちが知りたい状況への「確実性」は低くなります。

GRADEエビデンス確実性の4段階 高(High) 真の効果への確信が非常に高い 今後の研究で推定値が大幅変化する可能性はほとんどない 主にRCT(格下げなし) 中(Moderate) 相当の確信はある 今後の研究で推定値が変わる可能性がある RCT格下げ1段階 / 観察研究格上げ 低(Low) 確信は限定的 今後の研究で推定値が大幅に変わる可能性が高い 観察研究(格下げなし)/ RCT格下げ2段階 非常に低(Very Low) 確信はほとんどない 効果推定値は非常に不確か。逆方向の可能性も排除できない 観察研究の格下げ / 複数の深刻な問題

図2: GRADEエビデンス確実性の4段階と出発点

エビデンスを「格下げ」する5つの要因

GRADEではRCTを「高(High)」から出発させますが、5つのドメインのうち一つでも深刻な問題があれば1段階、非常に深刻な問題があれば2段階の格下げが行われます(Balshem et al., 2011年、Journal of Clinical Epidemiology)。これらの要因を理解することは、コクランレビューが「なぜその確実性評価に至ったか」を追跡するうえで欠かせません。

① バイアスリスク(Risk of Bias)

バイアスリスクとは、研究デザインや実施上の問題によって、真の効果が過大または過小に見積もられる可能性です。Cochrane RoB Tool 2(RoB 2)では次の5つのドメインを評価します。

  • ランダム化プロセスに由来するバイアス: ランダム化の手順(乱数表・コンピュータ生成等)が適切か、割り付け隠蔽(allocation concealment)が実施されているかを評価します。割り付け隠蔽が不十分だと、担当者が介入群・対照群への割り当てを予測してより予後良好な患者を介入群に誘導できてしまいます。
  • 意図された介入からの逸脱に由来するバイアス: 参加者や担当者が割り付けを知ることで生じるバイアス(遂行バイアス)と、プロトコルに定めた介入以外の差が生じることによるバイアスです。理学療法・マニュアルセラピー・鍼灸などの徒手的介入では、参加者・術者ともに二重盲検化が技術的に不可能なため、この評価で「一部懸念(Some concerns)」以上となる研究が非常に多くなります。
  • 欠測アウトカムデータに由来するバイアス: 脱落や追跡不能が生じた場合、その理由が介入・アウトカムと関連していれば結果を歪めます。この問題を統計的に補う手法として多重代入法(multiple imputation)が用いられますが、完全に解決できるわけではありません。
  • アウトカム測定に由来するバイアス: アウトカム評価者が盲検化されているか、使用した測定ツールが適切かを評価します。患者報告型アウトカム(PRO)では参加者の期待が測定値を歪める可能性があり、評価者盲検化RCT(単盲検)でも検出バイアスのリスクが残ります。
  • 選択的報告に由来するバイアス: 事前登録されたプロトコルと実際の報告を比較し、有意差のなかったアウトカムが隠されていないかを評価します。

治療家が臨床で参照する研究の多くは徒手的介入や運動療法を扱っており、盲検化の困難さから「バイアスリスク」での格下げが生じやすい領域です。このことを知っておくだけで、「確実性:中」という評価の背景にある具体的な問題を推測できるようになります。

② 非一致性(Inconsistency)

非一致性とは、複数の研究の結果が互いに矛盾・乖離している状態です。例えば、ある介入の効果について、Aという研究では大きな有益効果が示され、Bでは効果なし、Cでは有害方向の傾向が出ている場合、これらを単純に統合することは困難であり、効果推定値の信頼性が低下します。

統計的な異質性の指標として最も多く使われるのがI²(アイ二乗)統計量です。I²は「観察された変動のうち、偶然(標本誤差)ではなく研究間の真の差異(異質性)によって説明される割合」を表し、0〜100%で表現されます。コクランハンドブック(Higgins et al., 2019)では、目安として0〜40%を「低い異質性」、30〜60%を「中程度」、50〜90%を「実質的」、75〜100%を「相当な異質性」と示していますが、これらはあくまで参考値であり、信頼区間の広さや試験数も考慮して判断する必要があります。

非一致性が深刻と判断された場合、GRADE評価では1段階の格下げが行われます。ただし、非一致性の「説明可能な原因」(例:対象集団の重症度の違い、介入の用量・期間の違い)が特定され、サブグループ解析で一貫した結果が示されれば、格下げを保留することもあります。

③ 非直接性(Indirectness)

非直接性とは、レビューが取り扱っている研究(PICO)と、臨床家が実際に疑問を抱いている状況(臨床PICO)との間にギャップがある状態です。非直接性には次の4種類があります。

  • 集団(P)の非直接性: 研究対象が若年健常者のみで、実際の高齢患者への適用を想定したものではない。
  • 介入(I)の非直接性: 研究で使った施術プロトコルが現場で実施しているものと異なる(強度・頻度・時間等)。
  • 比較(C)の非直接性: 研究の比較対照が「無治療」であり、実際の臨床で想定している「通常ケア」と異なる。
  • アウトカム(O)の非直接性: 研究が測定したのは「炎症マーカーの値」(代理アウトカム)であり、患者が重視する「日常生活機能の改善」(最終アウトカム)ではない。

特にアウトカムの非直接性(代理アウトカム問題)は治療家が見落としやすい点です。「血中CRPが有意に低下した」という研究が「その治療で痛みが軽減する」ことの直接証拠にはならず、GRADE評価ではこのギャップが格下げ要因となります。

④ 不精確さ(Imprecision)

不精確さとは、効果推定値の95%信頼区間(CI)が広すぎて、臨床的に重要な判断を下すには不十分な状態です。例えば、相対リスク(RR)の点推定値が0.80(介入で20%のリスク低減)であっても、95%CIが0.45〜1.42であれば、真の効果はRR=0.45(大きな有益効果)からRR=1.42(有害)まで幅広く存在しうることになります。この場合、信頼区間がRR=1(効果なし)を跨いでいるだけでなく、MCIDと呼ばれる「臨床的に重要な最小差(Minimally Clinical Important Difference)」の両側をまたぐ可能性があり、格下げが生じます。

GRADEでは「最適情報量(Optimal Information Size:OIS)」という概念も使われます。OISとは、特定の効果量と統計的検出力を仮定したときに必要なサンプルサイズの合計であり、含まれる研究の総参加者数がOIS未満の場合、不精確さによる格下げが検討されます。

⑤ 出版バイアス(Publication Bias)

出版バイアスとは、統計的に有意な(ポジティブな)結果を持つ研究が、そうでない研究よりも出版されやすい傾向を指します。これにより、文献データベースで検索可能な研究は「介入が有効」に偏り、系統的レビューの効果推定値が実際より過大評価される可能性があります。

出版バイアスの統計的検出法として最もよく使われるのがファンネルプロットです。縦軸に研究の精度(標準誤差の逆数など)、横軸に効果推定値を取った散布図で、出版バイアスがない場合は左右対称の逆三角形(漏斗形)になるとされます。非対称性を統計的に検定するEgger検定やBegg検定も使われますが、これらは研究数が10本以上なければ統計的検出力が低く、解釈に注意が必要です。

また、試験登録データベース(ClinicalTrials.gov等)と実際の出版物を照合することで、「登録はされたが出版されていない試験」の存在を把握する手法も推奨されています(Higgins et al., 2019)。

格下げ5要因:エビデンス確実性を下げる問題 出発点(RCT:高) 観察研究:低 ① バイアスリスク ランダム化・盲検化・脱落の問題 ② 非一致性 研究間で結果が矛盾・I²が高い ③ 非直接性 PICOが臨床状況とズレている ④ 不精確さ CIが広い・サンプルサイズ不足 ⑤ 出版バイアス ポジティブ結果の選択的出版 確実性の格下げ(−1 または −2) 深刻な問題 → −1 非常に深刻 → −2 ※各要因を独立して評価し、合計で格下げ幅を決定

図3: エビデンスを格下げする5つの要因と格下げの論理

エビデンスを「格上げ」する3つの要因

観察研究は「低(Low)」から出発しますが、3つの要因によって格上げされる可能性があります(Guyatt et al., 2011年、Journal of Clinical Epidemiology)。ただし、これらの格上げ要因はほぼ観察研究に限定的に適用されるものであり、RCTで格上げが行われることは稀です。

① 大きな効果量(Large Effect Size)

観察研究において、測定されたアウトカムの効果が非常に大きい場合(例:相対リスク RR > 2、または RR < 0.5)、少なくとも1段階の格上げが検討されます。効果がさらに大きい場合(RR > 5 または RR < 0.2)は2段階の格上げも考慮されます。

この考え方の根拠は次のとおりです。残存する交絡因子がいくら強くても、観察された効果が非常に大きければ、交絡だけで効果全体を説明することは難しくなります。例えば、「喫煙と肺がんの関連(RR ≒ 15〜20)」のような圧倒的な効果量の場合、観察研究であっても「高」水準の確実性が認められることがあります。

ただし、この格上げはあくまで観察研究で深刻なバイアスや非直接性がない場合に限られます。バイアスが高い研究で大きな効果が出ていても、その効果がバイアスによるものである可能性が否定できないため、格上げは行われません。

② 用量反応関係(Dose-Response Gradient)

介入量が多いほど効果も大きくなる(または少ないほど小さくなる)という明確な用量反応関係が示されている場合、1段階の格上げが検討されます。用量反応関係は因果関係の古典的なヒル基準の一つでもあり、単純な相関以上の説得力を持ちます。

例えば、「1日の歩数が増えるほど心血管疾患リスクが段階的に低下する」という観察研究の結果は、介入の効果を支持する強い間接証拠となります。臨床の場で言えば、「施術頻度が多いグループほど機能改善スコアが高い」という系統的な傾向が複数の研究で確認されれば、用量反応の格上げが議論されます。

③ 対抗する交絡(Plausible Opposing Confounding)

観察研究において、残存しうる交絡因子が「観察された効果を小さく見せる方向」に作用すると考えられる場合に、1段階の格上げが検討されます。この要因は直感的にわかりにくいため、具体例で考えます。

例えば、「健康意識の高い人ほど〇〇療法を受ける傾向がある」という選択バイアスが存在する場合、観察研究で測定された効果には「もともと健康な人が介入を受けている」という交絡が混入しています。もしこの交絡因子が「効果を過大評価させる方向」に働いているなら問題ですが、もし逆に「より病状が重い人が〇〇療法を受ける」という選択パターン(重症者優先)であれば、交絡が効果を過小評価させていることになります。その場合、実際の効果は観察された推定値よりも大きい可能性があり、格上げの根拠となります。

格上げ3要因:観察研究の確実性を引き上げる条件 出発点(観察研究:低) ※格上げはほぼ観察研究にのみ適用 ① 大きな効果量 RR>2 → +1 RR>5 → +2 ② 用量反応関係 量が増えるほど 効果が増す傾向 → +1 ③ 対抗する交絡 交絡が効果を 過小評価させる → +1 確実性の格上げ(+1 または +2) 格上げ後も「バイアスリスク」等の格下げと相殺 ※格上げ後の最終確実性は「高」を超えることはない

図4: エビデンスを格上げする3つの要因(主に観察研究に適用)

SoFテーブルを実際に読む——7つの列の意味と解釈

ここまでGRADEの理論的な枠組みを解説しましたが、最終的にコクランレビューで目にするのは「Summary of Findings(SoF)テーブル」です。このテーブルの各列を順に追うことで、「研究が何を言っているか」と「その言説をどこまで信頼してよいか」の両方が一目で把握できます。

列①:アウトカムと重要度

SoFテーブルの第1列には、レビューが扱うアウトカムが重要度順(Critical → Important → Less important)に列挙されています。コクランハンドブック(Higgins et al., 2019)では、アウトカムを最大7つに絞ることを推奨しており、患者の視点から「最も重要」と判断されるもの(Critical outcomes)が上位に来ます。例えば慢性腰痛の介入研究なら、「痛みの強度(VAS/NRS)」「機能障害(ODI等)」「QOL(SF-36等)」が上位に並び、「筋力や可動域」は相対的に重要度が低く扱われることが多いです。

この順序は、後述するGRADE評価が「Critical outcomes での確実性」に基づいて推奨の強さが決まるという観点からも重要です。Less importantなアウトカムだけで確実性が高くても、Criticalなアウトカムで確実性が低ければ、全体の推奨は弱くなります。

列②:研究数と参加者数

第2列は含まれた研究の数(例:15 RCTs)と総参加者数(例:1,240 participants)を示します。この数字は不精確さの評価と密接に関連しています。参加者数が少ない(例:合計100名未満)場合、効果推定値の信頼区間は広くなりがちで、不精確さによる格下げの候補となります。逆に参加者数が多くても、対象集団が特定の属性に偏っていれば非直接性の問題が生じます。

列③・④:リスクと効果の推定値

二項アウトカム(発生あり/なし)の場合、第3列に「比較群(対照群)の想定リスク」(例:1,000人中100人に事象が発生)、第4列に「介入群の対応リスク」(例:1,000人中80人)が示されます。連続アウトカム(痛みスコアなど)の場合は平均差(MD)または標準化平均差(SMD)が使われます。

MD(平均差:Mean Difference) は同一の測定スケールで結果を報告した複数研究を統合する際に用いられます。例えば「VAS痛みスコアが平均1.5点低下(0〜10点スケール)」のように解釈します。一方、SMD(標準化平均差:Standardised Mean Difference) は異なるスケールを使った複数研究を統合する際に用いられ、単位は「標準偏差(SD)」です。SMD=0.5は「介入群と対照群の差が0.5SD分」という意味です。SMDの解釈の目安としてCohenの基準(0.2:小、0.5:中、0.8:大)がよく使われますが、臨床的意義の判断には疾患・アウトカムに特有のMCIDとの比較が必要です。

列⑤:相対効果と95%信頼区間

二項アウトカムでは**相対リスク(RR)またはオッズ比(OR)**が示されます。RR=0.80(95%CI 0.65〜0.98)という値は、「介入群では対照群に比べて事象リスクが20%低い(95%の確率で実際のリスク低減は2%〜35%の範囲にある)」と読みます。信頼区間がRR=1.0(効果なし)を含む場合(例:0.75〜1.20)、統計的有意差はなく、格下げ(不精確さ)の候補となります。

注意点として、ORはRRより効果を大きく見せる傾向があり、特に基礎リスクが高い(例えば50%超)状況ではRRとORの乖離が大きくなります。コクランレビューのSoFテーブルでORが使われている場合は、基礎リスクを確認してRRへの変換を検討することが望ましいです。

列⑥:確実性(Certainty)

GRADE評価の結果が⊕⊕⊕⊕〜⊕⊝⊝⊝のいずれかで示され、その下に「(HIGH)」「(MODERATE)」「(LOW)」「(VERY LOW)」という文字表記が添えられます。多くのレビューでは、確実性が格下げされた理由を脚注(footnote)にアルファベットやアイコンで付記しています。例えば「a: due to risk of bias」「b: due to imprecision」のような脚注を確認することで、「なぜこの確実性になったか」の具体的な理由が分かります。この脚注まで読む習慣が、批判的読解の核心です。

SoFテーブルの構造と各列の役割 アウトカム 研究数/人数 対照群リスク 介入群リスク/差 相対効果(95%CI) 確実性 痛みの強度 (VAS 0-100) 12 RCTs n=1,240 54.2点 (中程度の痛み) MD −12.3点 (−18.5 〜 −6.1) — (連続値のため) ⊕⊕⊝⊝ LOW a,b 機能障害 (ODI 0-100) 8 RCTs n=820 38.6点 MD −8.1点 (−14.2 〜 −2.0) — ⊕⊕⊕⊝ MODERATE a 脚注の例 — a: バイアスリスク(盲検化困難のため) b: 不精確さ(95%CIが広い) MDのCIがMCIDをまたぐ場合 → 「臨床的に有意差なし」の可能性も検討 ※数値は架空の例示。実在データではありません。 <脚注まで読んで「なぜその確実性か」を確認することが批判的読解の核心>

図5: SoFテーブルの構造と各列の読み方(架空データによる例示)

異質性(I²)とコクランレビューの限界

異質性の視覚的確認:フォレストプロット

SoFテーブルの背後には「フォレストプロット(Forest plot)」があります。フォレストプロットは各研究の効果推定値と信頼区間を横棒で示し、統合推定値をダイヤモンドで示した図です。各棒がどれだけ広がっているか(個別研究のCIの幅)、各棒の中心点がどの方向に向いているか(効果の方向)を見ることで、研究間の異質性が直観的に把握できます。棒の中心点が左右にバラバラに散らばっていれば異質性が高く、密集していれば一致性が高いと判断されます。

I²統計量はこの視覚的印象を数値化したものですが、数値だけに頼るのは危険です。例えばI²=50%でも、試験数が2本しかない場合は統計的な意味が乏しく、逆にI²=35%でも個別研究が全て同じ方向を向いており信頼区間が重なっていれば、臨床的な一致性は高いと判断されることがあります。Cochrane Handbook(Higgins et al., 2019)も「I²は研究間の差異の程度ではなく、その不確かさを定量化するものに過ぎない」と注意を促しています。

I²(異質性)の目安と臨床的解釈 I²の範囲 異質性の程度 GRADE格下げの目安 0 〜 40% 低い異質性 通常格下げなし 30 〜 60% 中程度の異質性 要検討(原因を探る) 50 〜 90% 実質的な異質性 −1格下げ検討 75 〜 100% 相当な異質性 −1〜−2格下げ ※I²の閾値はコクランハンドブック(Higgins et al., 2019)の目安。数値単独ではなく 信頼区間の重なり・研究方向の一致・点推定値の位置も総合して判断する

図6: I²統計量による異質性の目安とGRADE格下げの考え方

コクランレビューの限界

コクランレビューは系統的レビューの最高水準ですが、固有の限界も存在します。第一に更新の遅れです。医療エビデンスは蓄積し続けており、数年前に公開されたレビューがすでに新しい大規模RCTによって書き換えられている場合があります。レビューの公開日と最終検索日を確認し、主要なデータベースで「その後の大規模RCT」が出ていないかを簡易チェックする習慣が重要です。

第二に言語バイアスの問題があります。包括的な検索を行っても、英語以外の言語で書かれた研究の取り込み率は低くなりがちです。これは英語圏以外の臨床実践文脈で行われた研究(例:東洋医学や日本・中国発の介入研究)が過小評価される一因となります。

第三にPICOの制約です。コクランレビューのPICOが自分の臨床状況と合致していない場合、そのレビューが「有効」と結論づけていても、それが自分の患者に当てはまる根拠にはなりません。「コクランが有効と言っている」という引用は、PICOの確認なしには不完全な推論です。

臨床への示唆——GRADEを知ることで変わる患者との会話

GRADEとコクランレビューの読み方を学ぶことは、単に「論文を読む技術」を高めるだけでなく、患者との会話の質を根本的に変えます。

これまでの会話が「コクランレビューによれば〇〇は有効です」というシンプルな断言だったとすれば、GRADEを知った後の会話はこうなります。「この介入については、12本のRCTを統合した系統的レビューがあります。ただし、術者の盲検化が難しいため確実性は『低(Low)』評価です。効果の方向は一致していて、痛みは平均で12点(0〜100スケール)改善するとされていますが、この値の信頼区間は6〜18点と幅があり、患者さんにとって意味のある改善かどうかは個人差があります。」

このような会話は、患者の自律的な意思決定を支援する「Informed Consent(インフォームドコンセント)」の精神にも合致します。「論文がある」という情報だけでなく、「その論文の確実性がどの程度か」まで共有することで、治療家と患者の関係はより誠実なパートナーシップへと深まります。

また、GRADEの枠組みは自己研鑽にも有効です。「確実性:低」のエビデンスしかない介入を日常的に使っている場合、それは必ずしも「効果がない」ことを意味しません。まだ十分に研究されていないだけかもしれませんし、観察研究が蓄積されている途中かもしれません。確実性のレベルを知ることで、「現在の自分の実践における不確かさの程度」を正確に認識できるようになり、アップデートすべき研究領域を自覚的に絞り込めます。

さらに、ガイドラインや施設のプロトコルを読む際にも、GRADE評価がベースにあるかどうかを確認する習慣が生まれます。推奨の強さ(Strong / Conditional)とエビデンスの確実性(High / Moderate / Low / Very Low)が明示されているガイドラインは、透明性が高く批判的に評価しやすいです。これらが示されていない場合は、その推奨がどの程度の根拠に基づいているかについて、より慎重な姿勢が求められます。

まとめ

コクランレビューは、医療分野で利用可能な最も信頼性の高い二次文献の一つです。しかし「コクランに載っている」というだけでは、エビデンスの確実性について何も語っていません。GRADEアプローチは、系統的レビューの結果を「高・中・低・非常に低」という4段階の確実性として表現することで、臨床家が効果推定値をどこまで信頼してよいかを判断するための枠組みを提供しています。

格下げの5要因(バイアスリスク・非一致性・非直接性・不精確さ・出版バイアス)は、コクランレビューのSoFテーブルの確実性評価の背景を理解するための鍵です。格上げの3要因(大きな効果量・用量反応関係・対抗する交絡)は、観察研究から得られた知見を過小評価しないための補正メカニズムです。

実際の臨床では、「確実性:高(High)」のエビデンスが常に存在するわけではなく、「確実性:低(Low)」の状況で意思決定を迫られる場面の方がずっと多いです。そのような状況でこそ、GRADEの枠組みは「何がわかっていて、何がわかっていないか」を明示することで、誠実な臨床判断と患者説明を支えます。コクランレビューのSoFテーブルを開き、確実性の列とその脚注を確認する——その一歩が、エビデンスに基づく臨床判断への確かな入口となります。

参考文献

  1. Guyatt GH, Oxman AD, Vist GE, Kunz R, Falck-Ytter Y, Alonso-Coello P, Schünemann HJ; GRADE Working Group. (2008). GRADE: an emerging consensus on rating quality of evidence and strength of recommendations. BMJ, 336(7650), 924–926.
  2. Balshem H, Helfand M, Schünemann HJ, Oxman AD, Kunz R, Brozek J, Vist GE, Falck-Ytter Y, Meerpohl J, Norris S, Guyatt GH. (2011). GRADE guidelines: 3. Rating the quality of evidence. Journal of Clinical Epidemiology, 64(4), 401–406.
  3. Higgins JPT, Thomas J, Chandler J, Cumpston M, Li T, Page MJ, Welch VA (editors). (2019). Cochrane Handbook for Systematic Reviews of Interventions. Version 6.0. Cochrane.
  4. Page MJ, McKenzie JE, Bossuyt PM, et al. (2021). The PRISMA 2020 statement: an updated guideline for reporting systematic reviews. BMJ, 372, n71.
  5. Guyatt GH, Oxman AD, Sultan S, Glasziou P, Akl EA, Alonso-Coello P, et al.; GRADE Working Group. (2011). GRADE guidelines: 9. Rating up the quality of evidence. Journal of Clinical Epidemiology, 64(12), 1311–1316.