data <- read.table("C:/Users/aiman/Documents/LAST DEGREE/SMS/lab report/lab report 1/gmp.txt")
data
  1. Multiple Linear Reggression
model <- lm(y ~ x1 + x2 + x3 + x4 + x5 + x6 + x7 + x8 + x9 + x10 + x11,data = data)
summary(model)

Call:
lm(formula = y ~ x1 + x2 + x3 + x4 + x5 + x6 + x7 + x8 + x9 + 
    x10 + x11, data = data)

Residuals:
    Min      1Q  Median      3Q     Max 
-5.3441 -1.6711 -0.4486  1.4906  5.2508 

Coefficients:
             Estimate Std. Error t value Pr(>|t|)  
(Intercept) 17.339838  30.355375   0.571   0.5749  
x1          -0.075588   0.056347  -1.341   0.1964  
x2          -0.069163   0.087791  -0.788   0.4411  
x3           0.115117   0.088113   1.306   0.2078  
x4           1.494737   3.101464   0.482   0.6357  
x5           5.843495   3.148438   1.856   0.0799 .
x6           0.317583   1.288967   0.246   0.8082  
x7          -3.205390   3.109185  -1.031   0.3162  
x8           0.180811   0.130301   1.388   0.1822  
x9          -0.397945   0.323456  -1.230   0.2344  
x10         -0.005115   0.005896  -0.868   0.3971  
x11          0.638483   3.021680   0.211   0.8350  
---
Signif. codes:  0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1

Residual standard error: 3.227 on 18 degrees of freedom
  (2 observations deleted due to missingness)
Multiple R-squared:  0.8355,    Adjusted R-squared:  0.7349 
F-statistic:  8.31 on 11 and 18 DF,  p-value: 5.231e-05

Part A

i)Normal Probability Plot

plot(model,which = 2,main = "Normal Probability Plot of Residuals")

Interpretation: The normal probability plot shows that most residuals approximately follow the straight reference line, although some deviations are observed at both tails. This suggests a slight departure from normality; therefore, formal normality tests are conducted to further assess the normality assumption.

ii)Normality Test

install.packages("nortest")
WARNING: Rtools is required to build R packages but is not currently installed. Please download and install the appropriate version of Rtools before proceeding:

https://cran.rstudio.com/bin/windows/Rtools/
trying URL 'https://cran.rstudio.com/bin/windows/contrib/4.5/nortest_1.0-4.zip'
Content type 'application/zip' length 39886 bytes (38 KB)
downloaded 38 KB
package ‘nortest’ successfully unpacked and MD5 sums checked

The downloaded binary packages are in
    C:\Users\aiman\AppData\Local\Temp\RtmpAx0Osb\downloaded_packages
library(nortest)

Shapiro-Wilk

shapiro.test(residuals(model))

    Shapiro-Wilk normality test

data:  residuals(model)
W = 0.964, p-value = 0.3904

Kolmogorov Smirnov (K-S)

ks.test(scale(residuals(model)), "pnorm")

    Exact one-sample Kolmogorov-Smirnov test

data:  scale(residuals(model))
D = 0.14285, p-value = 0.5266
alternative hypothesis: two-sided

Anderson-Darling

ad.test(residuals(model))

    Anderson-Darling normality test

data:  residuals(model)
A = 0.51613, p-value = 0.1756

Interpretation: The Shapiro-Wilk, Kolmogorov-Smirnov, and Anderson-Darling tests produced p-values of 0.3904, 0.5266, and 0.1756, respectively. Since all p-values are greater than the 0.05 significance level, we fail to reject the null hypothesis. Therefore, there is insufficient evidence to conclude that the residuals are not normally distributed. The normality assumption is considered satisfied.

iii)Plot of residuals versus the predicted response.

plot(model,
     which = 1,
     main = "Residuals vs Predicted Response")

Interpretation: The residuals are scattered around the zero line; however, the red smooth line shows a noticeable curved pattern rather than remaining approximately horizontal. This suggests that there may be some non-linearity in the relationship between the response and the explanatory variables. Therefore, the linearity assumption may not be fully satisfied.

Part B

i)Plot the influential observation by Cook’s Distance

cooksd <- cooks.distance(model)
plot(cooksd,pch = "*",cex = 2,main = "Influential Observations by Cook's Distance")
abline(h = 4 * mean(cooksd, na.rm = TRUE), col = "red")
text(x = 1:length(cooksd) + 1,y = cooksd,
labels = ifelse(cooksd > 4 * mean(cooksd,
na.rm = TRUE),names(cooksd),""),col = "red")

Interpretation: The Cook’s Distance plot shows that observations 14 and 17 have Cook’s Distance values above the reference cutoff of 4 times the mean Cook’s Distance. These observations are considered potentially influential observations and should be investigated further.

influential <- as.numeric(names(cooksd)[cooksd > 4 * mean(cooksd, 
na.rm = TRUE)])
influential
[1] 14 17
head(data[influential,])

Interpretation: Observations 14 and 17 were identified as potentially influential observations because their Cook’s Distance values exceeded the reference cutoff. Observation 17 has relatively high values for several explanatory variables, particularly x1, x2, x3, x4 and x8, while observation 14 also has relatively large values for some explanatory variables. These unusual values may contribute to their influence on the fitted regression model. Therefore, observations 14 and 17 should be examined further when assessing the adequacy of the model.

Part C

i)Lack-of-Fit Test

Model 2

model2 <- lm(y ~ x1 + x2 + x3 + x8 + x9 + x10,data = data)
summary(model2)

Call:
lm(formula = y ~ x1 + x2 + x3 + x8 + x9 + x10, data = data)

Residuals:
    Min      1Q  Median      3Q     Max 
-4.7829 -1.6308 -0.2023  1.7894  6.2575 

Coefficients:
             Estimate Std. Error t value Pr(>|t|)
(Intercept) 31.891090  19.188065   1.662    0.110
x1          -0.051858   0.044919  -1.154    0.260
x2           0.001803   0.056564   0.032    0.975
x3           0.031761   0.070140   0.453    0.655
x8           0.129341   0.116709   1.108    0.279
x9          -0.206554   0.275463  -0.750    0.461
x10         -0.003947   0.004986  -0.792    0.437

Residual standard error: 3.206 on 23 degrees of freedom
  (2 observations deleted due to missingness)
Multiple R-squared:  0.7924,    Adjusted R-squared:  0.7383 
F-statistic: 14.64 on 6 and 23 DF,  p-value: 7.75e-07
anova(model2, model)
Analysis of Variance Table

Model 1: y ~ x1 + x2 + x3 + x8 + x9 + x10
Model 2: y ~ x1 + x2 + x3 + x4 + x5 + x6 + x7 + x8 + x9 + x10 + x11
  Res.Df    RSS Df Sum of Sq      F Pr(>F)
1     23 236.43                           
2     18 187.40  5    49.024 0.9418  0.478

Interpretation: H₀: Full model do not adequete H₁: Full model adequate p-value = 0.478 Since p-value(0.478) > alpha=0.05 ,fail to reject H₀ At alpha = 0.05, there is insufficient statistical evidence to conclude that full model provides a significantly better fit than the reduced model containing x1, x2, x3, x8, x9 and x10. Hence, the reduced model is considered adequate compared with the full model.

LS0tDQp0aXRsZTogIkxhYiBSZXBvcnQgMSINCm91dHB1dDogaHRtbF9ub3RlYm9vaw0KLS0tDQoNCg0KMS4NCg0KYGBge3J9DQpkYXRhIDwtIHJlYWQudGFibGUoIkM6L1VzZXJzL2FpbWFuL0RvY3VtZW50cy9MQVNUIERFR1JFRS9TTVMvbGFiIHJlcG9ydC9sYWIgcmVwb3J0IDEvZ21wLnR4dCIpDQpkYXRhDQpgYGANCg0KMi4gTXVsdGlwbGUgTGluZWFyIFJlZ2dyZXNzaW9uDQoNCmBgYHtyfQ0KbW9kZWwgPC0gbG0oeSB+IHgxICsgeDIgKyB4MyArIHg0ICsgeDUgKyB4NiArIHg3ICsgeDggKyB4OSArIHgxMCArIHgxMSxkYXRhID0gZGF0YSkNCnN1bW1hcnkobW9kZWwpDQpgYGANClBhcnQgQQ0KDQppKU5vcm1hbCBQcm9iYWJpbGl0eSBQbG90DQpgYGB7cn0NCnBsb3QobW9kZWwsd2hpY2ggPSAyLG1haW4gPSAiTm9ybWFsIFByb2JhYmlsaXR5IFBsb3Qgb2YgUmVzaWR1YWxzIikNCmBgYA0KSW50ZXJwcmV0YXRpb246IFRoZSBub3JtYWwgcHJvYmFiaWxpdHkgcGxvdCBzaG93cyB0aGF0IG1vc3QgcmVzaWR1YWxzIGFwcHJveGltYXRlbHkgZm9sbG93IHRoZSBzdHJhaWdodCByZWZlcmVuY2UgbGluZSwgYWx0aG91Z2ggc29tZSBkZXZpYXRpb25zIGFyZSBvYnNlcnZlZCBhdCBib3RoIHRhaWxzLiBUaGlzIHN1Z2dlc3RzIGEgc2xpZ2h0IGRlcGFydHVyZSBmcm9tIG5vcm1hbGl0eTsgdGhlcmVmb3JlLCBmb3JtYWwgbm9ybWFsaXR5IHRlc3RzIGFyZSBjb25kdWN0ZWQgdG8gZnVydGhlciBhc3Nlc3MgdGhlIG5vcm1hbGl0eSBhc3N1bXB0aW9uLiANCg0KDQppaSlOb3JtYWxpdHkgVGVzdA0KYGBge3J9DQppbnN0YWxsLnBhY2thZ2VzKCJub3J0ZXN0IikNCmxpYnJhcnkobm9ydGVzdCkNCmBgYA0KDQpTaGFwaXJvLVdpbGsNCmBgYHtyfQ0Kc2hhcGlyby50ZXN0KHJlc2lkdWFscyhtb2RlbCkpDQpgYGANCktvbG1vZ29yb3YgU21pcm5vdiAoSy1TKQ0KYGBge3J9DQprcy50ZXN0KHNjYWxlKHJlc2lkdWFscyhtb2RlbCkpLCAicG5vcm0iKQ0KYGBgDQoNCkFuZGVyc29uLURhcmxpbmcNCmBgYHtyfQ0KYWQudGVzdChyZXNpZHVhbHMobW9kZWwpKQ0KYGBgDQpJbnRlcnByZXRhdGlvbjogVGhlIFNoYXBpcm8tV2lsaywgS29sbW9nb3Jvdi1TbWlybm92LCBhbmQgQW5kZXJzb24tRGFybGluZyB0ZXN0cyBwcm9kdWNlZCBwLXZhbHVlcyBvZiAwLjM5MDQsIDAuNTI2NiwgYW5kIDAuMTc1NiwgcmVzcGVjdGl2ZWx5LiBTaW5jZSBhbGwgcC12YWx1ZXMgYXJlIGdyZWF0ZXIgdGhhbiB0aGUgMC4wNSBzaWduaWZpY2FuY2UgbGV2ZWwsIHdlIGZhaWwgdG8gcmVqZWN0IHRoZSBudWxsIGh5cG90aGVzaXMuIFRoZXJlZm9yZSwgdGhlcmUgaXMgaW5zdWZmaWNpZW50IGV2aWRlbmNlIHRvIGNvbmNsdWRlIHRoYXQgdGhlIHJlc2lkdWFscyBhcmUgbm90IG5vcm1hbGx5IGRpc3RyaWJ1dGVkLiBUaGUgbm9ybWFsaXR5IGFzc3VtcHRpb24gaXMgY29uc2lkZXJlZCBzYXRpc2ZpZWQuDQoNCmlpaSlQbG90IG9mIHJlc2lkdWFscyB2ZXJzdXMgdGhlIHByZWRpY3RlZCByZXNwb25zZS4gDQpgYGB7cn0NCnBsb3QobW9kZWwsDQogICAgIHdoaWNoID0gMSwNCiAgICAgbWFpbiA9ICJSZXNpZHVhbHMgdnMgUHJlZGljdGVkIFJlc3BvbnNlIikNCmBgYA0KSW50ZXJwcmV0YXRpb246IFRoZSByZXNpZHVhbHMgYXJlIHNjYXR0ZXJlZCBhcm91bmQgdGhlIHplcm8gbGluZTsgaG93ZXZlciwgdGhlIHJlZCBzbW9vdGggbGluZSBzaG93cyBhIG5vdGljZWFibGUgY3VydmVkIHBhdHRlcm4gcmF0aGVyIHRoYW4gcmVtYWluaW5nIGFwcHJveGltYXRlbHkgaG9yaXpvbnRhbC4gVGhpcyBzdWdnZXN0cyB0aGF0IHRoZXJlIG1heSBiZSBzb21lIG5vbi1saW5lYXJpdHkgaW4gdGhlIHJlbGF0aW9uc2hpcCBiZXR3ZWVuIHRoZSByZXNwb25zZSBhbmQgdGhlIGV4cGxhbmF0b3J5IHZhcmlhYmxlcy4gVGhlcmVmb3JlLCB0aGUgbGluZWFyaXR5IGFzc3VtcHRpb24gbWF5IG5vdCBiZSBmdWxseSBzYXRpc2ZpZWQuDQoNClBhcnQgQg0KDQppKVBsb3QgdGhlIGluZmx1ZW50aWFsIG9ic2VydmF0aW9uIGJ5IENvb2vigJlzIERpc3RhbmNlDQpgYGB7cn0NCmNvb2tzZCA8LSBjb29rcy5kaXN0YW5jZShtb2RlbCkNCnBsb3QoY29va3NkLHBjaCA9ICIqIixjZXggPSAyLG1haW4gPSAiSW5mbHVlbnRpYWwgT2JzZXJ2YXRpb25zIGJ5IENvb2sncyBEaXN0YW5jZSIpDQphYmxpbmUoaCA9IDQgKiBtZWFuKGNvb2tzZCwgbmEucm0gPSBUUlVFKSwgY29sID0gInJlZCIpDQp0ZXh0KHggPSAxOmxlbmd0aChjb29rc2QpICsgMSx5ID0gY29va3NkLA0KbGFiZWxzID0gaWZlbHNlKGNvb2tzZCA+IDQgKiBtZWFuKGNvb2tzZCwNCm5hLnJtID0gVFJVRSksbmFtZXMoY29va3NkKSwiIiksY29sID0gInJlZCIpDQpgYGANCkludGVycHJldGF0aW9uOiBUaGUgQ29vaydzIERpc3RhbmNlIHBsb3Qgc2hvd3MgdGhhdCBvYnNlcnZhdGlvbnMgMTQgYW5kIDE3IGhhdmUgQ29vaydzIERpc3RhbmNlIHZhbHVlcyBhYm92ZSB0aGUgcmVmZXJlbmNlIGN1dG9mZiBvZiA0IHRpbWVzIHRoZSBtZWFuIENvb2sncyBEaXN0YW5jZS4gVGhlc2Ugb2JzZXJ2YXRpb25zIGFyZSBjb25zaWRlcmVkIHBvdGVudGlhbGx5IGluZmx1ZW50aWFsIG9ic2VydmF0aW9ucyBhbmQgc2hvdWxkIGJlIGludmVzdGlnYXRlZCBmdXJ0aGVyLg0KDQppaSkNCmBgYHtyfQ0KaW5mbHVlbnRpYWwgPC0gYXMubnVtZXJpYyhuYW1lcyhjb29rc2QpW2Nvb2tzZCA+IDQgKiBtZWFuKGNvb2tzZCwgDQpuYS5ybSA9IFRSVUUpXSkNCmluZmx1ZW50aWFsDQpoZWFkKGRhdGFbaW5mbHVlbnRpYWwsXSkNCmBgYA0KSW50ZXJwcmV0YXRpb246IE9ic2VydmF0aW9ucyAxNCBhbmQgMTcgd2VyZSBpZGVudGlmaWVkIGFzIHBvdGVudGlhbGx5IGluZmx1ZW50aWFsIG9ic2VydmF0aW9ucyBiZWNhdXNlIHRoZWlyIENvb2sncyBEaXN0YW5jZSB2YWx1ZXMgZXhjZWVkZWQgdGhlIHJlZmVyZW5jZSBjdXRvZmYuIE9ic2VydmF0aW9uIDE3IGhhcyByZWxhdGl2ZWx5IGhpZ2ggdmFsdWVzIGZvciBzZXZlcmFsIGV4cGxhbmF0b3J5IHZhcmlhYmxlcywgcGFydGljdWxhcmx5IHgxLCB4MiwgeDMsIHg0IGFuZCB4OCwgd2hpbGUgb2JzZXJ2YXRpb24gMTQgYWxzbyBoYXMgcmVsYXRpdmVseSBsYXJnZSB2YWx1ZXMgZm9yIHNvbWUgZXhwbGFuYXRvcnkgdmFyaWFibGVzLiBUaGVzZSB1bnVzdWFsIHZhbHVlcyBtYXkgY29udHJpYnV0ZSB0byB0aGVpciBpbmZsdWVuY2Ugb24gdGhlIGZpdHRlZCByZWdyZXNzaW9uIG1vZGVsLiBUaGVyZWZvcmUsIG9ic2VydmF0aW9ucyAxNCBhbmQgMTcgc2hvdWxkIGJlIGV4YW1pbmVkIGZ1cnRoZXIgd2hlbiBhc3Nlc3NpbmcgdGhlIGFkZXF1YWN5IG9mIHRoZSBtb2RlbC4NCg0KUGFydCBDDQoNCmkpTGFjay1vZi1GaXQgVGVzdA0KDQpNb2RlbCAyDQpgYGB7cn0NCm1vZGVsMiA8LSBsbSh5IH4geDEgKyB4MiArIHgzICsgeDggKyB4OSArIHgxMCxkYXRhID0gZGF0YSkNCnN1bW1hcnkobW9kZWwyKQ0KYGBgDQoNCmBgYHtyfQ0KYW5vdmEobW9kZWwyLCBtb2RlbCkNCmBgYA0KSW50ZXJwcmV0YXRpb246IA0KSOKCgDogRnVsbCBtb2RlbCBkbyBub3QgYWRlcXVldGUNCkjigoE6IEZ1bGwgbW9kZWwgYWRlcXVhdGUNCnAtdmFsdWUgPSAwLjQ3OA0KU2luY2UgcC12YWx1ZSgwLjQ3OCkgPiBhbHBoYT0wLjA1ICxmYWlsIHRvIHJlamVjdCBI4oKADQpBdCBhbHBoYSA9IDAuMDUsIHRoZXJlIGlzIGluc3VmZmljaWVudCBzdGF0aXN0aWNhbCBldmlkZW5jZSB0byBjb25jbHVkZSB0aGF0IGZ1bGwgbW9kZWwgcHJvdmlkZXMgYSBzaWduaWZpY2FudGx5IGJldHRlciBmaXQgdGhhbiB0aGUgcmVkdWNlZCBtb2RlbCBjb250YWluaW5nIHgxLCB4MiwgeDMsIHg4LCB4OSBhbmQgeDEwLg0KSGVuY2UsIHRoZSByZWR1Y2VkIG1vZGVsIGlzIGNvbnNpZGVyZWQgYWRlcXVhdGUgY29tcGFyZWQgd2l0aCB0aGUgZnVsbCBtb2RlbC4NCg0K