1 Library:

install.packages(“knitr”)

install.packages(“rmarkdown”)

install.packages(“prettydoc”)

install.packages(“equatiomatic”)

2 Pendahuluan

2.1 Latar Belakang

Influenza (flu) adalah penyakit pernapasan menular yang disebabkan oleh virus influenza yang dapat menyebabkan penyakit ringan sampai penyakit berat (Abelson, 2009). Setiap orang sudah mengenal dan sudah pernah menderita penyakit ini. Bila terserang penyakit ini pekerjaan sehari-hari akan terhalang, karena gejala penyakit ini ialah rasa tidak enak badan, demam, rasa pegal linu, lemas, lesu, bersin-bersin dan terasa nyeri di otot-otot dan sendi (Prabu, 1996). Penyebab influenza adalah virus RNA yang termasuk dalam keluarga Orthomyxoviridae yang dapat menyerang burung, mamalia termasuk manusia. Virus ditularkan melalui air liur terinfeksi yang keluar pada saat penderita batuk, bersin atau melalui kontak langsung dengan sekresi (ludah, air liur, ingus) penderita. Ada dua jenis virus influenza yang utama menyerang manusia yaitu virus A dan virus B (Spikler, 2009). Virus ini beredar di seluruh dunia dan dapat mempengaruhi orang tanpa memandang usia dan jenis kelamin. Influenza diketahui menyebabkan epidemi tahunan dan umumnya mencapai puncaknya pada musim dingin di daerah beriklim sedang. Sampai saat ini sudah ditemukan beberapa vaksin yang bisa menangani virus influenza (CDC, 2011).

Untuk menghilangkan gejala yang menyertai dapat menggunakan obatobatan yang sesuai bila diperlukan (Mubarak, 2009). Perlu diperhatikan bahwa obat- obatan ini hanya digunakan untuk meringankan gejala bukan untuk mengatasi virus penyebabnya. Obat-obatan ini dapat diperoleh tanpa resep karena termasuk obat bebas. Untuk itu dalam pemilihan obat flu diperlukan kehati-hatian dan harus didasarkan pada gejala flu yang muncul. Pengetahuan tentang influenza sangat diperlukan dalam pemilihan obatnya sehingga masyarakat dapat memperhatikan komposisi obat flu yang diminum agar komponen obat sesuai dengan gejala yang flu yang dialami (BPOM, 2006).

3 Tinjauan Pustaka

3.1 Statistika Deskriptif

Statistika deskriptif merupakan statistika yang membicarakan deskripsi data. Dalam statistika deskriptif hanya sekadar menyederhanakan dan menata data untuk memperoleh gambaran keseluruhan dari peubah yang dipelajari atau diamati. Diantara perhitungan statistika deskripsi yaitu rata-rata, median, minimum, maksimum, kuartil, range, ragam, dan pie chart

Rata-Rata :

Rata-rata hitung atau nilai tengah, yang biasanya dilambangkan dengan μ(untuk populasi) atau x¯(untuk sampel), merupakan salah satu ukuran pemusatan yang sering digunakan dalam statistika. Hal ini disebabkan oleh sifat-sifatnya yang mudah dipahami dan dipelajari. Nilai tengah ini memainkan peran penting dalam statistika inferensial.

Rata-rata hitung atau nilai tengah menggambarkan pusat distribusi data. Ini dihitung dengan menjumlahkan semua nilai dalam sampel atau populasi, kemudian dibagi dengan jumlah total observasi. Rata-rata memberikan gambaran umum tentang di mana sebagian besar data terkonsentrasi.

Median :

Median adalah ukuran pemusatan yang digunakan dalam statistika yang menggambarkan nilai pengamatan yang terletak di tengah-tengah saat data sudah diurutkan. Untuk menghitung median, data harus diurutkan terlebih dahulu dari yang terkecil hingga yang terbesar atau sebaliknya.

Jika jumlah pengamatan (n) ganjil, maka median akan menjadi nilai pengamatan di tengah-tengah, di mana setengah pengamatan berada di bawahnya dan setengahnya lagi di atasnya. Namun, jika jumlah pengamatan (n) genap, median akan merupakan rata-rata dari dua nilai pengamatan yang berada di tengah.

Minimum :

Nilai minimum merupakan nilai terkecil dalam kumpulan data. Untuk mencari nilai minimum, perlu untuk menyusun data dalam urutan menaik (dari yang terkecil hingga yang terbesar) dan mengidentifikasi nilai yang paling rendah. Dalam statistika deskriptif, nilai minimum memberikan informasi tentang titik terendah dalam kumpulan data. Hal ini dapat membantu untuk memahami rentang nilai yang ada dan memberikan gambaran awal tentang sebaran data tersebut.

Maksimum :

Nilai maksimum merupakan nilai terbesar dalam kumpulan data. Untuk mencari nilai maksimum, perlu untuk menyusun data dalam urutan menurun (dari yang terbesar hingga yang terkecil) dan mengidentifikasi nilai yang paling tinggi. Dalam statistika deskriptif, nilai maksimum memberikan informasi tentang titik tertinggi dalam kumpulan data. Hal ini dapat membantu untuk memahami rentang nilai yang ada dan memberikan gambaran awal tentang sebaran data tersebut.

Kuartil :

Kuartil atau perempatan adalah nilai-nilai yang membagi data ke dalam empat bagian sama besar. Terdapat tiga kuartil yang umum digunakan dalam statistika deskriptif, yaitu kuartil pertama (Q1), kuartil kedua (Q2), dan kuartil ketiga (Q3). Kuartil kedua juga sering disebut sebagai median.

Untuk menghitung kuartil, Anda perlu mengurutkan data dalam urutan menaik dan kemudian mencari nilai yang berada pada posisi tertentu berdasarkan rumus yang telah disebutkan.

Range :

Range mengacu pada selisih antara nilai maksimum dan nilai minimum dalam kumpulan data. Range memberikan informasi tentang sebaran data dan dapat digunakan sebagai ukuran sederhana untuk mengukur rentang nilai yang tercakup dalam data tersebut. Untuk menghitung range, Anda perlu mengurutkan data dalam urutan menaik dan kemudian mengambil selisih antara nilai maksimum dan nilai minimum.

Kekurangan dari range adalah tidak mempertimbangkan semua informasi yang mungkin antara nilai terendah dan tertinggi dalam data tersebut.

Ragam :

Ragam Ukuran penyebaran terpenting dalam setiap pengujian statistik parametrik adalah ragam atau varians yang memiliki simbol σ2 untuk populasi dan §2 untuk sampel.

Hasil perhitungan ragam adalah nilai kuadrat, yang berarti unitnya adalah unit data yang telah dipangkatkan dua. Untuk mendapatkan ukuran dispersi yang serupa dengan data asli, akar kuadrat dari ragam dapat dihitung, dan hasilnya disebut simpangan baku (standar deviasi).

Ragam memberikan informasi tentang sebaran data secara lebih komprehensif daripada range. Semakin besar ragam, semakin besar variabilitas data, sementara ragam yang lebih kecil menunjukkan bahwa data cenderung lebih terkonsentrasi di sekitar nilai rata-rata.

3.2 Analisis Regresi Logistik

Regresi logistik adalah metode statistika yang digunakan untuk memodelkan hubungan antara satu atau lebih variabel independen (variabel prediktor) dengan variabel dependen biner (variabel target) yang memiliki dua kategori atau hasil yang mungkin. Dalam regresi logistik, variabel dependen umumnya diinterpretasikan sebagai probabilitas atau peluang kejadian sukses dalam kategori yang ditentukan.

Regresi logistik menggunakan fungsi logistik atau sigmoid untuk memodelkan hubungan antara variabel prediktor dan peluang kejadian sukses. Fungsi logistik menghasilkan nilai antara 0 dan 1, yang dapat diinterpretasikan sebagai probabilitas kejadian sukses. Regresi logistik memperkirakan koefisien regresi untuk setiap variabel prediktor yang memberikan kontribusi terhadap log-odds (logaritma peluang sukses dibagi dengan peluang kegagalan) dari variabel dependen.

Beberapa konsep yang relevan dalam regresi logistik meliputi:

  1. Variabel dependen biner: Variabel dependen dalam regresi logistik adalah variabel biner yang menggambarkan hasil atau kategori yang mungkin. Misalnya, bisa berupa variabel yang menunjukkan apakah seseorang mengalami suatu kejadian atau tidak.

  2. Koefisien regresi: Koefisien regresi dalam regresi logistik mengindikasikan pengaruh variabel prediktor terhadap peluang kejadian sukses. Koefisien positif menunjukkan hubungan positif, sedangkan koefisien negatif menunjukkan hubungan negatif.

  3. Odds ratio: Odds ratio menggambarkan perubahan dalam peluang kejadian sukses sebagai hasil dari perubahan satu unit dalam variabel prediktor. Odds ratio yang lebih besar dari 1 menunjukkan peningkatan peluang, sementara yang lebih kecil dari 1 menunjukkan penurunan peluang.

  4. Evaluasi model: Dalam regresi logistik, terdapat berbagai metode untuk mengevaluasi kualitas model, seperti akurasi, presisi, recall, dan area di bawah kurva ROC (AUC-ROC).

Multiple Logistic Regression atau Regresi logistik ganda memiliki model regresi logistik yang lebih dari 1 prediktor, yang dinyatakan sebagai: logit (Y) = B0 + B1X1 + … + BpXp , untuk Y = {0,1}.

4 Source Code

4.1 Library

library(readxl)

library(semEff)

library(reshape)

library(MASS)

library(plotrix)

library(pscl)

library(generalhoslem)

4.2 Data

#Import data

library(readxl)

Data <- read_excel(“D:/Data Logistikk.xlsx”)

str(Data)

Y = Data$Outcome

X1 = Data$Umur

X2 = Data$JumlahVaksin

#Membuat Data Frame

data1 = data.frame(Y, X1, X2)

data1

5 Hasil dan Pembahasan

#Statistika Deskriptif

summary (Data)

#Uji Multikolinieritas

modelX1 = lm(X1~X2, Data=data1) vif_X1 = 1/ (1 - summary(modelX1)$r.squared)

modelX2 = lm(X2~X1, Data=data1) vif_X2 = 1/ (1 - summary(modelX2)$r.squared)

VIF = data.frame(vif_X1,vif_X2)

VIF

#Model Regresi Logistik

glm(formula = Y ~ X1 + X2, family = “binomial”, data = data1)

summary(modelredlog)

#Uji Parsial

summary(modelreglog)

#Uji Signifikansi Keseluruhan (Simultan)

library(pscl)

pR2(modelreglog)

Classes and Methods for R originally developed in the Political Science Computational Laboratory Department of Political Science Stanford University (2002-2015), by and under the direction of Simon Jackman. hurdle and zeroinfl functions by Achim Zeileis. Error: object ‘modelreglog’ not found

#Odds Ratio beta = coef(modelreglog)

Error: object ‘modelreglog’ not found

#Uji Kelayakan Model

library(ResourceSelection) hoslem.test(data1$Y,fitted(modelreglog))

Error in library(ResourceSelection) : there is no package called ‘ResourceSelection’

#Ketetapan Klasifikasi

crosstab = table(data1$Y, fitted(modelreglog)>0.5)

Akurasi = ((5+3)/(6+3+3+5))*100

print(paste(Akurasi, “%”))

[1] “47.0588235294118 %”

6 Kesimpulan

Berdasarkan hasil pengujian pada data yang telah ditentukan, dapat dihasilkan beberapa poin yakni

• Model regresi Logistik Biner adalah g(x)= 7.13 + 0.245X1 - 8.04X2

• Faktor yang Berpengaruh Dengan hasil uji signifikansi simultan yang menunjukkan ke-2 variabel prediktor berpengaruh signifikan terhadap variabel respon Keputusan, namun meskipun begitu dengan uji Asumsi Multikolinieritas didapatkan bahwa ke-2 variabel prediktor masih memiliki nilai VIF dibawah 10 dimana ke-2 variabel prediktor masih layak digunakan dalam pemodelan regresi logistik biner. Dan juga didukung oleh tabel klasifikasi dimana akurasi pemodelan menunjukkan akurat seesar 47.06%.

7 Daftar Pustaka

Setyawati, D. U., Korida, B. D., & Febrilia, B. R. A. (2020). Analisis Regresi Logistik Ordinal Faktor-Faktor yang Mempengaruhi IPK Mahasiswa. Jurnal Varian, 3(2), 65-72.

Muflihah, I. Z. (2017). Analisis financial distress perusahaan manufaktur di Indonesia dengan regresi logistik. Majalah Ekonomi, 22(2), 254-269.

Roflin, E., Riana, F., Munarsih, E., & Liberty, I. A. (2023). Regresi Logistik Biner dan Multinomial. Penerbit NEM.