疫学・統計・研究の読み方の基盤
本文の目次
- 誰について何を知りたいか
- 数値の意味と比較条件
- 繰り返しのばらつきと一定方向のずれ
- 分布を形として見る
- 平均・中央値・最頻値
- 中心だけでは広がりが分からない
- 標準偏差は平均からの散らばり
- その時点の状態と期間内の新発生
- 累積罹患割合の対象と期間
- 人ごとの観察時間を足す
- 状態の出入りと未確認の転帰
- 差と比は基準をそろえて読む
- リスクとオッズの分母
- 症例対照で選んだ人数の意味
- 条件を割り付ける研究と、観察する研究
- 比較の起点と、記録の時間順序
- 調べる人を選ぶ操作と、群を決める操作
- 群の背景差と、評価に入る期待
- 誰の記録が残るか、どう測るか
- 共通原因と、途中をつなぐ過程
- 散布図と、線形の相関
- 関連から、別の説明を確かめる
- 個々の値と、取り直した標本の平均
- 標準偏差と標準誤差
- 一つの推定値と、推定の幅
- 信頼水準は、区間を作る方法の性質
- 帰無仮説の下で、どれくらい極端か
- 真の状態を分けて、誤りと検出力を考える
- 差の大きさと、統計的な判断
- 結果を、調べた条件へ戻して説明する
1. 誰について何を知りたいか
調査で傾向を知りたい対象全体を母集団、そこから選んで実際に調べる一部を標本といいます。ある学校の全学生の通学時間を知りたいなら、全学生が母集団で、調べた学生が標本です。一人ずつについて測る通学時間が変数で、学生一人が観測の単位になります。同じ学生を一週間に5回測れば、測定値は5個でも学生は一人です。何人についての情報かと、何回の測定かを分けると、調べた情報をどの集団へ説明できるかを考えやすくなります。
母集団、標本、一人と測定回数
2. 数値の意味と比較条件
変数には、交通手段の種類のようなカテゴリ、軽い・中程度・重いのような順序、時間や人数のような数量があります。順序があるだけでは、隣り合う段階の差が等しいとは限りません。順序を1、2、3と符号化しても、経験の強さが同じ間隔で増えたと決まるわけではありません。数量も、測定の定義、単位、時点をそろえて比べます。「通学時間」を片道と往復で記録した値や、分と時間の値をそのまま混ぜると、同じ変数を比べたつもりでも意味が変わります。
3. 繰り返しのばらつきと一定方向のずれ
同じ対象を同じ方法で繰り返し測っても、値が多少変わることがあります。偶然の測定変動は、繰り返した値のばらつきとして現れます。一方、時刻を記録する際、時計の表示が基準より常に3分進むような一定方向のずれは、系統誤差です。同条件で独立な偶然変動を含む測定を増やせば平均の変動を小さくできる場合がありますが、時計のずれ自体は測定回数を増やしても直りません。記録が多いこと、同じ値を安定して出すこと、基準となる値に近いことは、それぞれ別に確かめます。
4. 分布を形として見る
値がどのあたりに多く、どの範囲へ広がるかを表すのが分布です。個々の値を点で並べると、かたまり、左右の偏り、離れた値が見えます。ヒストグラムは数量を区間に分け、その区間に入る個数である度数を長方形で表します。階級はその区間、階級幅は区間の長さです。幅がそろっていれば高さで度数を比べられます。幅が違う図で度数を面積に対応させるなら、高さは度数÷階級幅です。同じ度数10でも幅1と幅2では高さ10と5となり、面積はどちらも10です。横軸の区間と縦軸が何を表すかを一緒に読みます。
階級幅と高さから、度数を読む
5. 平均・中央値・最頻値
算術平均は値の合計を個数で割った値です。中央値は小さい順に並べた中央の値で、個数が偶数なら中央の二つの値の平均を使います。最頻値は最も多く現れる値で、一つに決まらない場合もあります。2、3、5、7、9の平均は5.2、中央値は5です。9だけを99へ変えると合計が増え、平均は23.2になりますが、中央の順位の5は変わりません。中心を一つの値で示す方法によって、端の大きい値から受ける影響が違います。
6. 中心だけでは広がりが分からない
0、5、10と4、5、6は平均がどちらも5ですが、値の広がりは違います。範囲は最大値から最小値を引いた値で、前者は10、後者は2です。四分位数は小さい順のデータをおよそ四等分する位置の値で、第1四分位数から第3四分位数までの幅が四分位範囲です。中央付近の半分の広がりを見るため、範囲のように両端だけで決まりません。有限個の値で四分位数を求める手順には違いがあるため、値を計算するときは使う手順もそろえます。同じ平均から、同じ散らばりや分布の形まで決めることはできません。
7. 標準偏差は平均からの散らばり
各値から平均を引いた差は、正と負が打ち消し合います。そこで差を二乗して大きさを集計するのが分散です。対象となる全データの分散を記述する場合は、その二乗の合計を個数で割ります。分散の平方根が標準偏差で、元の値と同じ単位になります。例えば平均が5の0、5、10は、平均との差の二乗が25、0、25です。4、5、6では1、0、1なので、同じ平均でも前者の標準偏差が大きくなります。母集団の分散を標本から推定するときには、二乗の合計を個数より1少ない数で割る方法も使います。記述か推定かを区別し、同じ計算条件で比較します。
同じ平均でも、散らばりは違う
8. その時点の状態と期間内の新発生
ある時点で対象集団のうちその状態にある人の割合を有病割合といいます。100人を同じ日に確認し、現在その状態の人が12人なら12/100です。以前その状態でも、現在終わっている人は現在の分子には入れません。一方、期間中に初めてその状態になった人の割合は、新発生のリスクを表します。初回発生を追う場合は、開始時までその状態の発生がなく、発生可能な人が分母で、その人たちの期間内の初回発生が分子です。どの状態を、どの人について、いつ又はどの期間で数えたかを一緒に示します。
9. 累積罹患割合の対象と期間
開始時に発生可能な集団を一定期間追跡し、新しく発生した人の割合を求めるのが累積罹患割合です。その期間の発生リスクとして読めます。初回発生を調べる閉鎖集団では、開始前に既に発生した人を、現在の状態が終わっていても初回発生の分母へ足しません。発生の有無などの結果を転帰といいます。全員の期間末までの転帰が分かる条件なら、開始時に発生可能な60人のうち6人に発生した6か月リスクは6/60=10%です。1か月と1年のリスクは観察期間が違います。後の記録や発生の規則がないまま、1か月の割合を12倍して1年のリスクへ置き換えることはできません。
時点の状態と、期間の初回発生
10. 人ごとの観察時間を足す
追跡できる長さが人によって違うときは、人ごとの発生可能な観察時間を足した人時間を使えます。初回発生を調べる模型なら、発生、観察終了又は予定した期間末までの時間を数えます。三人がそれぞれ2、4、6か月観察されれば、合計は12人月です。この間の新発生が2件なら、罹患率は2/12件/人月です。人時間当たりの発生の速さを表す率と、人について一定期間に発生する確率を表すリスクは、分母も単位も違います。率を期間と掛けた値が、どんな条件でもその期間の発生確率になるわけではありません。
11. 状態の出入りと未確認の転帰
現在その状態にある人数は、新しい発生で増え、状態の終了で減ります。出入りのない集団でも、期間中に発生した人数と期間末に残っている人数は同じとは限りません。また、追跡が途中で終わった人は、その時まで発生なしでも、その後の転帰は未確認です。開始60人中、10人の発生と30人の期間末までの発生なしが分かり、20人のその後が不明なら、確認された発生10人だけで全60人の期間リスクが一つに決まるわけではありません。未確認者全員に後の発生がない場合とある場合を、模型の条件に合わせて分けます。
一人ずつの観察時間を、分母へ足す
12. 差と比は基準をそろえて読む
対象の定義と観察期間をそろえた二群のリスクは、差と比で比較できます。Aが20%、基準のBが10%なら、リスク差は10百分率ポイント、リスク比は20/10=2です。差は絶対的な増減、比は基準群に対して何倍かを表します。Aが2%、Bが1%でも比は2ですが、差は1百分率ポイントです。同じ比でも基準リスクによって絶対差が変わります。基準群のリスクが0なら、その値で割る通常のリスク比は定まりません。比較した結果だけでは、群を分けた条件が差の原因と確認できたことにはなりません。
13. リスクとオッズの分母
リスクpに対して、オッズはp/(1-p)、つまり発生した側と発生しなかった側の比です。100人中20人に発生ならリスクは20/100=0.2、オッズは20/80=0.25です。別の群で100人中10人ならオッズは10/90です。二群のオッズ比は、一群のオッズを基準群のオッズで割ります。この例では(20/80)/(10/90)=2.25で、リスク比の2とは異なります。発生がまれな条件で近い値になる場合はあっても、二つをいつも同じ指標として扱いません。全員に発生したp=1では、発生なしが0なので、通常の有限のオッズは求められません。オッズ比も、基準のオッズが0なら、その値で割る通常の式では定まりません。
14. 症例対照で選んだ人数の意味
曝露とは、調べる要因にさらされることや、その条件を持つことです。症例対照研究は、調べる転帰があった人を症例、なかった人を対照として選び、以前の曝露を比較する方法です。症例と対照を何人ずつ集めるかは研究で決められるため、その選んだ人たちの症例の割合を母集団の発生リスクへ置き換えません。症例で曝露あり20人・なし10人、対照であり20人・なし40人なら、曝露のオッズはそれぞれ20/10と20/40で、オッズ比は4です。症例側と対照側の曝露の比を比較した値であり、選んだ症例数から母集団の新発生リスクを直接計算した値ではありません。
15. 条件を割り付ける研究と、観察する研究
観察研究は、研究者が調べる条件を割り付けず、既にある曝露や転帰を観察する研究です。介入研究では、研究者が比較する条件を参加者へ割り付けます。たとえば、既に使っている学習方法と成績を記録することと、二つの学習方法を研究者が参加者へ割り付けて比べることでは、条件を作る操作が異なります。介入研究の中でも、偶然の仕組みで群を決める場合と、別の規則で決める場合があります。介入したことと、無作為に割り付けたことは、別に確かめます。
16. 比較の起点と、記録の時間順序
横断研究では、ある時点の曝露と転帰などを同じ時点の状態として記録します。どちらが先に生じたかは、その記録だけでは分からない場合があります。コホート研究では、曝露のある側とない側など、曝露の状態を起点として転帰を追います。これから追跡する場合も、過去の記録で曝露時点からその後の転帰をたどる場合も、この比較の向きは同じです。症例対照研究は、転帰があった人となかった人を選び、それ以前の曝露を比較します。今からデータを集めるか、過去の記録を使うかだけでなく、何を起点に人を選び、どの時点の何を比べるかを読みます。
研究の起点と、時間の対応
17. 調べる人を選ぶ操作と、群を決める操作
無作為抽出は、母集団から誰を標本として調べるかを、偶然の仕組みで選ぶことです。無作為割付けは、研究へ参加した人がどの比較群へ入るかを、偶然の仕組みで決めることです。学校の名簿から学生を無作為に選ぶ段階と、参加した学生を二つの学習方法へ無作為に分ける段階は異なります。参加希望者だけを集めた後に無作為割付けをしても、最初の募集が学校全体からの無作為抽出へ変わるわけではありません。母集団への説明には、抽出の対象、参加しなかった人、記録が得られた人も関わります。
18. 群の背景差と、評価に入る期待
無作為割付けでは、背景因子と群の割付けを結び付けない仕組みによって、背景差を偶然によるものにします。多くの割付けを繰り返して考えると背景因子を釣り合わせる働きがありますが、一回の有限人数の研究で年齢などが完全に一致するとは限りません。盲検化は、参加者や評価者などに割付けの情報を伏せ、知っている条件や期待が行動・測定・評価へ入る偏りを減らす方法です。誰にどの情報を伏せたかを確かめます。無作為割付けと盲検化は働く過程が異なり、どちらを使っても測定のずれや追跡できなかった人の問題が全て解消するわけではありません。
抽出と割付けは、別の操作
19. 誰の記録が残るか、どう測るか
選択バイアスは、研究へ選ばれることや記録が残ることが、調べたい曝露と転帰の関係に影響して、対象集団の関係から比較が偏ることです。たとえば、曝露や転帰に関わる条件で参加や追跡の継続が変わると、記録が得られた人だけの比較が集団の比較と異なる場合があります。情報バイアスは、曝露や転帰などの測定・記録の仕方により比較が偏ることです。一方の群だけ詳しく転帰を探したり、群により過去の曝露の思い出し方が異なったりすると、同じ定義で測った比較ではなくなります。その偏りが差を大きくするか小さくするかは、何がどのように記録されたかによります。
20. 共通原因と、途中をつなぐ過程
交絡は、曝露と転帰に共通する原因などが比較へ混ざり、曝露と転帰の関係を別の経路でも説明できることです。たとえば、曝露より前の条件Zが、曝露にも後の転帰にも影響するという因果関係を考えるなら、Zから二方向へ分かれる経路があります。一方、媒介は、曝露の影響を途中で受け、その後の転帰へつなぐ過程です。曝露→M→転帰という関係では、Mは途中をつなぐ変数になります。曝露の全体の影響を調べたいとき、途中のMをそろえる調整は、その経路を取り除くことがあります。共通原因への調整と媒介への調整を同じ操作として扱わず、時点と矢印を確かめます。これらの矢印は考える因果関係を表し、描いたこと自体が実際の因果を確認した証拠にはなりません。
21. 散布図と、線形の相関
散布図は、同じ対象について測った二つの変数を、横軸と縦軸の位置で一つの点として示す図です。一方が大きいほど他方も大きい傾向は正の相関、他方が小さい傾向は負の相関です。ここで扱う相関係数はピアソンの相関係数で、値が−1から1の間にあり、直線的な関係の方向と強さを表します。両変数にばらつきがある条件で、点が右上がりの一直線上なら1、右下がりなら−1です。傾きは横軸が一単位増えたときの縦軸の変化です。YがXの2倍となる直線と10倍となる直線は、どちらも相関係数1でも傾きが異なります。縦軸の単位を正の倍率で変えると傾きは変わりますが、相関係数は変わりません。曲線に沿う関係は、直線的な相関が小さくても規則的なことがあります。離れた点が係数へ影響するため、数値だけでなく点の形も読みます。
22. 関連から、別の説明を確かめる
観察された関連を因果として考えるときは、原因と考える条件が転帰より先にあったかを確かめます。共通原因、対象の選び方、測定の違いで関連が説明できないかも検討します。たとえば、関連があっても、転帰が先に生じてその後の曝露を変えた可能性があるなら、曝露が転帰を生じさせたという説明とは向きが異なります。研究で行った比較と時間情報を合わせると、どの説明を調べ、どの点がまだ分からないかを整理できます。相関係数の大きさだけから、一人の原因や、条件を変えたときの効果を確定することはできません。
共通原因と、途中の媒介を分ける
23. 個々の値と、取り直した標本の平均
母数は、知りたい母集団の平均や割合などを表す値です。同じ母集団と条件を考える間、その未知の値は固定して考えます。統計量は標本から計算する平均や割合などで、母数を推定するために使う統計量を推定量といいます。同じ母集団から同じ人数の標本を取り直すと、選ばれた人や測定値が変わり、各標本の平均も変わります。一つの標本で個々の値を並べた分布と、たくさんの標本から一つずつ計算した平均を並べた分布は、一つの点が表す対象が異なります。前者の一つの値は一人の観測値、後者の一つの値は一つの標本の平均です。
24. 標準偏差と標準誤差
標準偏差は、個々の観測値が平均からどれくらい散らばるかを表します。標準誤差は、同じ条件で標本を取り直したときに推定量がどれくらい変わるかを表す標準偏差です。独立で同じ母集団から抽出した値の平均について、母集団の標準偏差が分かっていれば、平均の標準誤差は「母集団の標準偏差÷√標本数」です。√標本数は、二乗すると標本数になる正の数です。母集団の標準偏差が未知なら、標本から推定した標準偏差を使って標準誤差を推定できます。同じ抽出条件と母集団の散らばりなら、標本数を増やすと平均の標準誤差は小さくなります。個々の値の散らばりが同じ割合で小さくなるという意味ではありません。測定値に一定のずれがあったり、特定の人だけが選ばれたりする問題も、標本数を増やすだけでは解消しません。
個々の値と、標本平均の分布
25. 一つの推定値と、推定の幅
点推定は、未知の母数を一つの値で推定することです。区間推定は、方法の前提に基づき、標本の変動を反映する区間で推定することです。信頼区間は、そのような区間を作る方法の一つです。標本平均の分布を、左右対称の釣り鐘型をした正規分布で近似できる条件では、標本平均の両側に標準誤差へ係数を掛けた幅を置く方法があります。係数は、信頼水準という方法の包含率の水準などに関わります。同じ係数を使う比較なら、標準誤差が小さければ幅は狭くなります。その比較では方法・信頼水準などの係数に関わる条件をそろえます。同じ作り方で標準誤差や他の係数の条件をそろえ、より高い信頼水準を求めるなら幅は広くなります。幅には標本数、観測値の変動、信頼水準が関わるので、中心の推定値だけで確かさまで同じとは決まりません。
26. 信頼水準は、区間を作る方法の性質
頻度論の信頼区間では、未知の母数を固定し、標本を取り直すごとに区間が変わると考えます。信頼水準95%の方法は、その前提が成り立つとき、同じ手順で反復して作る区間が長期的に約95%の割合で母数を含むように作られます。どの一つの区間が母数を含むかは未知です。得られた一回の区間に、固定した母数が95%の確率で入るという意味ではありません。また、個々の人の測定値の95%がその区間へ入るという意味でもありません。方法による標本変動の評価と、「誤差は必ずこの幅以内」という絶対上限の保証は別です。抽出や測定の前提が外れた偏りも、信頼水準の数字だけで解消することはできません。
母数は一定、区間は取り直す
27. 帰無仮説の下で、どれくらい極端か
帰無仮説は、例えば二群の母平均の差が0であるというように、検定で基準として置く仮説です。対立仮説は、それと比べる別の条件で、二群に差があるなどと表します。検定統計量は、標本から計算して比較に使う値です。P値は、帰無仮説と検定で用いる確率の仕組みが成り立つとき、観察した統計量と同じかそれ以上に極端な統計量が得られる確率です。どちらの向きの差を極端とするかも検定で決めます。有意水準は、帰無仮説を棄却する基準として事前に決める水準です。選んだ検定でP値がその水準以下なら棄却すると決める方法があります。棄却は、帰無仮説に合わないとして判断することで、P値は帰無仮説が真である確率や、観察した差が重要である確率を表す値ではありません。
28. 真の状態を分けて、誤りと検出力を考える
帰無仮説が真なのに棄却する誤りを第一種過誤といいます。有意水準は、前提が成り立つ下で、この誤りを起こす確率を管理するために使います。指定した対立仮説の条件が真なのに帰無仮説を棄却しない誤りが第二種過誤です。その対立条件の下で棄却する確率が検出力で、第二種過誤の確率を1から引いた値です。検出力は、どの大きさの差を考えるか、観測の変動、標本数、有意水準などに関わります。同じ方法と条件なら、標本数を増やすことなどで検出力が高くなる場合があります。棄却しなかったという結果には、差がない場合だけでなく、ある差を検出できなかった場合も含まれます。
29. 差の大きさと、統計的な判断
統計的有意とは、事前に決めた有意水準の基準を満たし、帰無仮説を棄却する判断に関わります。効果の推定値は、二群の差や比など、比較する関係の大きさを表す推定値です。統計的有意性と、その差が目的に対してどれほど重要かは別に考えます。実務的重要性には、同じ単位の差の大きさと、その差が及ぼす影響や負担、研究の目的が関わります。標本数が多く標準誤差が小さいと、小さな差も有意になり得ます。一方、有意でない結果でも、区間が広ければ、0だけでなく重要と考える差も区間に含まれることがあります。推定値、区間、P値を合わせて読み、有意という言葉だけを大きな差へ、非有意という言葉だけを効果0の証明へ置き換えません。
効果の大きさと、幅と有意性
30. 結果を、調べた条件へ戻して説明する
研究結果を説明するときは、どの集団で、どの転帰を、どの期間に、どの定義や方法で測ったかを示します。誰が選ばれ、誰の記録が欠けたか、観察か介入か、無作為化の有無、共通原因や測定の偏り、推定の不確実さも合わせて読みます。例えば、特定の学校で一年間調べた通学時間の平均差は、まずその対象・期間・測定条件に関する結果です。別の集団や期間へ説明を広げるには、それらの条件がどう違うかを確かめます。集団についての比較や推定は、一人の状態や原因が確定したことと同じではなく、そのまま個別の診断や治療の採否を決める根拠にはしません。
用語を確かめる
- 母集団
- 調査で傾向を知りたい対象全体。
- 標本
- 母集団から選んで調べる一部。
- 観測単位
- 一人又は一つの対象など、観察や測定をまとめる基本の単位。
- 変数
- 対象によって値や種類が異なり、調査で記録する項目。
- カテゴリ
- 種類による区分。数の大小や等しい間隔を必ず意味するわけではない。
- 順序尺度
- 順番を表す区分。隣の区分との間隔が等しいとは限らない。
- 系統誤差
- 測定や記録が一定の方向へ偏るずれ。
- 分布
- 値がどこにどれくらい集まって広がるかというまとまり。
- 度数
- ある値や区間に入る観測値の個数。
- ヒストグラム
- 数量を区間に分け、区間ごとの度数を長方形で示す図。
- 階級
- ヒストグラムなどで値をまとめる区間。
- 階級幅
- 階級の区間の長さ。
- 算術平均
- 値の合計を個数で割った代表値。
- 中央値
- 順に並べた中央の値。偶数個では中央の二つの値の平均を用いる。
- 最頻値
- 最も多く現れる値。複数となる場合もある。
- 範囲
- 最大値から最小値を引いた幅。
- 四分位数
- 小さい順のデータをおよそ四等分する位置の値。有限データの算出手順には複数の方法がある。
- 四分位範囲
- 第3四分位数から第1四分位数を引いた、中央付近の半分の幅。
- 分散
- 各値の平均からの差を二乗して集計した散らばりの指標。記述か推定かで割る数の方法を区別する。
- 標準偏差
- 分散の平方根。各観測値の平均からの散らばりを元の単位で表す指標。
- 有病割合
- ある時点に対象集団のうちその状態にある人の割合。
- 発生リスク
- 発生可能な対象者について、定めた期間に新発生する確率又はその割合。
- 累積罹患割合
- 開始時に発生可能な対象集団で、一定期間の新発生者を開始時の人数で割る指標。
- 閉鎖集団
- 観察期間中の対象者の新規参加などの出入りがない集団。
- 人時間
- 各人の発生可能な観察時間を足した量。人月や人年で表す。
- 罹患率
- 新発生数を発生可能な総人時間で割る指標。期間内の発生確率とは分母と単位が異なる。
- 転帰
- 追跡して確認する結果や状態。
- リスク差
- 二群の同期間のリスクを引いた絶対的な差。
- リスク比
- 一群のリスクを基準群のリスクで割った相対的な比。
- オッズ
- 発生確率pを発生しない確率1-pで割った比。人数なら発生した側/しなかった側。
- オッズ比
- 一群のオッズを基準群のオッズで割った比。
- 曝露
- 調べる要因にさらされること又はその条件を持つこと。
- 症例
- 症例対照研究で、調べる転帰があった側として選ぶ人。
- 対照
- 症例対照研究で、調べる転帰がなかった側として比較のため選ぶ人。
- 症例対照研究
- 転帰のあった側となかった側を選び、以前の曝露を比較する研究方法。
- 観察研究
- 研究者が調べる条件を割り付けず、既にある曝露や転帰を観察する研究。
- 介入研究
- 研究者が参加者へ比較する条件を割り付ける研究。無作為化の有無は別の特徴。
- 横断研究
- ある時点の曝露や転帰などを、同じ時点の状態として記録する研究。
- コホート研究
- 曝露の状態を起点に人を比較し、その後の転帰を追う研究。既往記録で時間をたどる場合もある。
- 無作為抽出
- 母集団から標本へ誰を選ぶかを、偶然の仕組みで決めること。
- 無作為割付け
- 研究に参加した人をどの比較群へ入れるかを、偶然の仕組みで決めること。
- 盲検化
- 参加者や評価者などへ割付けの情報を伏せ、情報や期待が評価等へ入る偏りを減らす方法。
- 選択バイアス
- 研究へ選ばれることや記録が残ることによって、対象集団の曝露と転帰の比較から関係が偏ること。
- 情報バイアス
- 曝露や転帰などの測定・記録の仕方によって比較が偏ること。
- 交絡
- 曝露と転帰の共通原因などが比較へ混ざり、別の経路でも関係を説明できること。
- 共通原因
- 考える因果関係で、曝露と転帰の両方へ影響する原因。
- 媒介
- 曝露の影響を途中で受け、その後の転帰へつなぐ過程。
- 散布図
- 同じ対象の二つの変数を、横軸と縦軸の位置で一つの点として示す図。
- 相関
- 二つの変数が一緒に変わる傾向。方向や形、強さを区別して読む。
- 相関係数
- ここではピアソンの相関係数。両変数にばらつきがある条件で、直線的な関係の方向と強さを−1から1で表す値。
- 線形
- 直線で表される関係に関わること。
- 傾き
- 横軸が一単位増えたときの、縦軸の変化の大きさと方向。
- 因果関係
- 原因となる条件が、その後の結果へ影響する関係。観察された関連の説明として検討する。
- 母数
- 対象母集団の平均や割合などを表す値。母集団と条件を固定すれば固定した値として考える。
- 統計量
- 標本から計算する平均や割合などの値。
- 推定量
- 未知の母数を推定するために使う統計量。
- 標準誤差
- 同じ条件で標本を取り直したときの、推定量の変動を表す標準偏差。
- 点推定
- 未知の母数を一つの値で推定すること。
- 区間推定
- 方法の前提に基づき、標本の変動を反映する区間で未知の母数を推定すること。
- 信頼区間
- 標本から作る、未知の母数を推定する区間。反復する方法の包含率と前提を合わせて読む。
- 信頼水準
- 方法の前提の下で、反復して作る信頼区間が長期的に母数を含む割合の水準。
- 帰無仮説
- 母平均の差が0など、検定で基準として置く仮説。
- 対立仮説
- 帰無仮説と比較する、差があるなどの別の条件を表す仮説。
- 検定統計量
- 標本から計算し、検定の比較に使う値。
- P値
- 帰無仮説と検定の確率の仕組みの下で、観察した統計量以上に極端な統計量が得られる確率。
- 有意水準
- 帰無仮説を棄却する基準として事前に決める水準。第一種過誤の確率を管理するために使う。
- 棄却
- 検定の基準に達したとき、帰無仮説に合わないとして判断すること。
- 第一種過誤
- 帰無仮説が真である条件の下で、その帰無仮説を棄却する誤り。
- 第二種過誤
- 指定した対立条件が真である下で、帰無仮説を棄却しない誤り。
- 検出力
- 指定した対立条件が真である下で、帰無仮説を棄却する確率。第二種過誤の確率の補数。
- 統計的有意
- 事前に決めた有意水準の基準を満たし、帰無仮説を棄却する判断に関わること。
- 効果の推定値
- 二群の差や比など、比較する関係の大きさを表す推定値。
- 実務的重要性
- 差の大きさが、目的や影響、負担などに照らしてどれほど重要かという意味。