9 章 . 2 変量 タ 要約
タ 質的変数 量的変数 2種類 あ . ,2 変数 組 合わ
方 , 質的変数×質的変数 , 質的変数×量的変数 , 量的変数×量的変数 3種
類 .2 変数 う ば良い 順 明 .
質的変数×質的変数 方
, 明 作 exampledata.csv 込 .
> data=read.csv("exampledata.csv")
> data #変数data 中身 表示
場合,質的変数 data$sex data$high .質的変数 1 場合 table( )関
数 使 表 作 .質的変数 2 増え う ,table( )関数 使 表
作 う.
> table(data$sex)
f m 4 4
> table(data$high)
high low 5 3
> table(data$sex, data$high)
high low f 2 2 m 3 1
例 変数 順序 逆 ,表 向 逆 .
> table(data$high, data$sex)
f m high 2 3 low 2 1
2 質的変数 方→table( )関数 2重 ロス表 く
質的変数×量的変数 方
例えば,質的変数 sex 量的変数 ht 身長 2 う 要約 ば良い う
?身長 け 平均 要約統計量 求 ば良い ,身長以外 性別 情報
あ ,性別 身長 要約統計量 求 ば良い う. ,質的変数
平均や標準偏差 求 . 層別解析 言いい 層=質的変数
.
質的変数 量的変数 方→質的変数 量的変数 要約
男性
平均 or 中央値
標準偏差 or
四分位範囲
女性
平均 or 中央値
標準偏差 or
四分位範囲
demodata.csv 使 場合 , 男性 女性 タ く mdata, fdata 付け ,
> data=read.csv("demodata.csv")
> mdata=data[data$sex=="m", ]
> fdata=data[data$sex=="f", ]
性別 タ い ,身長 各種要約統計量 求 .要約統計
量 ,中心 キ 指標 平均 標準偏差 ペア , 中央値 四 範
ペア 求 以 う .
> mean(mdata$ht);sd(mdata$ht);median(mdata$ht);IQR(mdata$ht)
[1] 170.2369 [1] 5.942523 [1] 170.4 [1] 8.575
> mean(fdata$ht);sd(fdata$ht);median(fdata$ht);IQR(fdata$ht)
[1] 157.1628 [1] 5.223774 [1] 157.4 [1] 6.7
注 実 ,イ 性別 平均 計算 方法 あ tapply(data$ht, data$sex, mean) ふ .
質的変数 性別 身長 ボ スプロ 描く ,
> boxplot(data$ht ~ data$sex)
.わ わ ,男 タ ”mdata” 女 タ ”fdata” け 必要 い ,
便利 .
層別ボ スプロ →boxplot(量的変数~質的変数)
量的変数×量的変数 方
例えば,身長 ht 体重 wt 2 量的変数 う 要約 ば良い う
?参考 , 2 変数 散布 以 う 描け .
> plot(data$ht,data$wt)
散布 → plot(X軸 タ,Y軸 タ)
#plot(Y軸 タ~X軸 タ) OK
f m
140150160170180
2 量的変数X,Y 関係 表 相関係数 使い .相関係数 ,X Y 間
く い 直線性 あ 表 指標 .
2 変数 タ 一直線 ば相関係数 1 傾 負 場合 -1 .
直線 傾 片 関係あ .
散布 点 直線 近いほ 1 -1 .
140 150 160 170 180
406080100
data$ht
data$wt
-4 -2 0 2 4
-4-2024
x
y2
r=1
-4 -2 0 2 4
-4-2024
x
y1
r=1
-4 -2 0 2 4
-4-2024
x
y3
r=1
あく , く い直線 近い 示 あ ,例えば点 完全 曲線 い
い相関係数 出 .
相関係数 0→1 0→-1 直線 近 点 対称 あ ,直線 傾 正 負
違い け .
-4 -2 0 2 4
-4-2024
x
y4
r=0.7
-4 -2 0 2 4
-4-2024
x
y4
r=0.9
-4 -2 0 2 4
-4-2024
x
y4
r=0.5
-4 -2 0 2 4
-4-2024
x
z
r=0.2
-4 -2 0 2 4
-4-2024
x
z4
r=-0.7
-4 -2 0 2 4
-4-2024
x
z4
r=-0.9
-4 -2 0 2 4
-4-2024
x
z4
r=-0.5
-4 -2 0 2 4
-4-2024
x
y4
r
-4 -2 0 2 4
-4-2024
x
y4
r
-4 -2 0 2 4
-4-2024
x
y4
直線 近い
r=0.9 r=0.7 r=0.5
相関係数 2 量的変数 く い直線 近い 表 指標
2 量的変数 要約 相関係数 使う
例えば,身長ht 体重wt 相関係数 ,
> cor(data$ht, data$wt) [1] 0.6812133
求 . ,身長 体重 順序 入 替え ”cor(data$wt, data$ht)” 結
果 .
相関係数→cor(X, Y)
課題1:demodata.csv タ い 以 問い 答え く い.
関数cut( ) 使う ,量的変数 質的変数 変換 .cut(量的変数X, breaks=c(区 1,区 2,区 3)) う 使えば,量的変数X 区 1,区
2〕, 区 2, 区 3〕 入 う 質的変数 変換 .例えば収縮期血圧
sbp 120,130,140,160,180 区 ,
cut(data$sbp, breaks=c(120,130,140,160,180))
.や ばわ , (0,120], (120,130], (130, 140], (140, 160], (160, 180], (180, Inf] いう区 方 , 閉 方 逆
[0,120), [120,130), [130, 140), [140, 160), [160, 180), [180, Inf) , プション プロ ム 引数 呼び ”right=F” 指定 ,
cut(data$sbp, breaks=c(120,130,140,160,180), right=F)
, う 作 新 タ sbpclass いう変数 入 .
sbpclass=cut(data$sbp, breaks=c(120,130,140,160,180), right=F)
様 ,拡張期血圧 質的変数 置 換え ,dbpclass いう変数 入 . dbpclass=cut(data$dbp,breaks=c(0,80,85,90,100,110,Inf),right=F)
(1) う 2 質的変数sbpclass dbpclass 要約 く い. (2) 変数sex sbpclass 要約 く い.
(3) 変数sex dbpclass 要約 く い.
課題2:demodata.csv タ い 以 問い 答え く い.
(1) BMI (Body Mass Index) 表 新 い変数bmi 定義 式 書い く い. (2) 変数bmi fat 散布 相関係数 求 く い.
(3) 変数fat tc 散布 相関係数 求 く い. (4) 変数fat ggt 散布 相関係数 求 く い.