library(readr)
library(dplyr)
Attaching package: 'dplyr'
The following objects are masked from 'package:stats':
filter, lag
The following objects are masked from 'package:base':
intersect, setdiff, setequal, union
library(stringr)
library(tidyr)
library(naniar)
library(ggplot2)
# Import raw data
medical_df<-read_csv("https://raw.githubusercontent.com/lhamo07/Data-607-Assignment/refs/heads/main/project-2/realworld_medical_dirty.csv")Rows: 100 Columns: 10
── Column specification ────────────────────────────────────────────────────────
Delimiter: ","
chr (5): Patient_ID, Gender, Smoker, Diagnosis, Notes
dbl (4): Age, Blood_Pressure, Cholesterol, BMI
date (1): Admission_Date
ℹ Use `spec()` to retrieve the full column specification for this data.
ℹ Specify the column types or set `show_col_types = FALSE` to quiet this message.
medical_df# A tibble: 100 × 10
Patient_ID Age Gender Blood_Pressure Cholesterol BMI Smoker Diagnosis
<chr> <dbl> <chr> <dbl> <dbl> <dbl> <chr> <chr>
1 P1000 55 FEMALE 120 NA 35.4 Yes Heart Disease
2 P1001 65 Male 150 180 27.8 nan None
3 P1002 45 Male 120 220 22.5 No nan
4 P1003 65 Male NA 180 35.4 No nan
5 P1004 65 Male 120 300 40.1 nan None
6 P1005 35 Female 130 200 35.4 N Heart Disease
7 P1006 45 MALE 150 NA 22.5 No None
8 P1007 45 MALE 150 200 NA N nan
9 P1008 45 Male NA 200 NA No Diabetes
10 P1009 65 MALE 130 NA 35.4 No Diabetes
# ℹ 90 more rows
# ℹ 2 more variables: Admission_Date <date>, Notes <chr>