【Rデータ整理】文字列の追加:mutate/transform
データフレームに列を追加する時の方法2つ。 dplyr::mutate() 普段は dplyr パッケージの dplyr::mutate() を使っている。 文字列は ” ” で括って追加する。 mutate(列名 = c("文字列1", "文字列2",....), データフレーム名) base::transform() Rの標準パッケージだと、 transform() を […]
データフレームに列を追加する時の方法2つ。 dplyr::mutate() 普段は dplyr パッケージの dplyr::mutate() を使っている。 文字列は ” ” で括って追加する。 mutate(列名 = c("文字列1", "文字列2",....), データフレーム名) base::transform() Rの標準パッケージだと、 transform() を […]
文字列を繋げるときには、paste(), paste0(), str_c()などを使う。 paste()とpaste0()は、Rの標準パッケージ(base)。 str_c()は、stringrパッケージの関数。 baseとstringrの違いの詳細は、下記参照。 以下、それぞれの使い方と、使用例、ポイントの比較等のまとめ。 paste() paste()は、文字列を結合する最も基本的な関数。スペー […]
例えば作表の際、列名に「(N = 数字)」という情報をいれたくて、数値は計算式で出したい場合、 stringr::str_c() 文字列操作はstringr パッケージで。 stringr の特徴 処理速度が速い。 関数が全て “str_” で始まる。 パイプ(%>%)で連鎖しやすい。 R標準にはない機能も色々追加されている。 stringr パッケージは tidyv […]
Rにはベクトル専用の関数が多く用意されている。 例えば、 sum() :合計を求める mean() :平均値を求める median() :中央値を求める etc. この時注意したいのが、データフレーム内に「NA」があると、計算結果が全て「NA」になってしまう。 この現象を回避するため、 「ベクトルに含まれている NA を無視する」 という指示を記載しておくと良い。 na.rm = T […]
例えば、あるデータ(Data)内に Alzheimer’s disease neuropathologi change (ADNC) の項目があり、 そのデータフレームに ADNC=”Not” と ADNC=”Low” → ADcopth=”NotLow”、 ADNC=”IntermediateR […]
R で小数点第○○位まで出したい、というときは、Excel でもおなじみの Round 関数が使える。 round(データ, 桁数) round(0.12345, 3) output 0.123 ただこれだと、小数点以下の最後が 0 だった場合、0 より手前までしか表示されない。 round(0.12000, 3) output 0.12 これを、”0.120″ […]
相変わらず R でデータ整理中。 今回は、データベースに記載されている 1+, 2+ などのスコアを数値 1, 2… に変換し、データ型を数値型に変更する方法。 データベースから落としてきたときは、下記のようになっている。 これをそのまま R に取り込むと、文字列として認識される。 全ての文字列を数値化し、中央値とか出しておきたい。 データフレーム内の特定の文字列全てを数値に変換 まず […]
R にデータを取り込んで、そこから最初に行う作業の備忘録。 データのインポート 私は、データベースからエクセル (.xlsx) でデータを取得し、それを R に取り込む場合が多い。 エクセルの取り込みは、 readxl::read_xlsx(ファイル名.xlsx) で行う。 そのままファイル名を指定:同じフォルダ内にデータがある場合 R ディレクトリと同じフォルダにデータがある場合は、そのままファ […]
最近リバイスが返ってきて、データ整理に追われ中…… n数を増やす目的等で他から持ってきたデータを結合させた時の備忘録。 dplyr::join dplyr パッケージの join 関数を使う。 join 関数は4種類。 full_join inner_join left_join right_join この中で一番多く使っているのは left_join と full_join right_join […]
下記のようなデータフレームがあり、この表の行名(左側の列)と列名(一番上のヘッダー行)とを変更したい場合。 Estimate Std. Error Pr(>|z|) OR CI_low CI_high (Intercept) -1.160 2.883 0.687 0.31 0.00 89.13 Age 0.003 0.027 0.915 1.00 0.95 1.06 Sex 0.433 0. […]
例えば下記のように、 症例の年齢 Alzheimer’s Disease Neuropathologic Change (ADNC) で10症例のデータフレームを作った場合。 Age <- c(65, 72, 82, 68, 75, 74, 78, 68, 69, 80) ADNC <- c("Intermediate", "High" , "Low" , "Interme […]
とある csv データを取り込み…… Data1 <- read.csv("Dataset.csv") 「str()」で確認すると、 数値になっていてほしいところが、文字列で認識されている。 これはなんでかというと、 例えば Revenue や Expenses の行は、3桁毎に「,」で区切られているが、R はこれを「数値」だとは認識せず、「文字列」として認識している。 また、Revenue […]
これからデータ整理の色々と書き留めていく予定。 まず、とあるcsv データを取り込み。 取り込みの方法は下記 ▼ Data1 <- read.csv("Dataset.csv") 「str()」で確認すると、 factor になっていてほしいところが、numeric で認識されている。 そして、サマリーをみてみると、 と、西暦なのに最大値とか最小値とか平均値とか四分位とかが出ている……。 & […]