Part 1: Definitions

  1. Random Variable
    A random variable is a function that assigns a number to each outcome of a sample space.

    • Discrete Example: Stock market movement (up, down, stable).
    • Continuous Example: Percentage change in stock value over a day.
  2. Probability of X
    The probability of a random variable \(X\) reflects the relative frequency of \(X\) occurring over infinitely repeated trials.

  3. Sampling Distribution
    The distribution of sample statistics (e.g., sample means) obtained from repeated sampling of a population.

  4. Confidence Interval
    A range of values likely to contain a population parameter, assuming random sampling and appropriate statistical conditions.

Part 2: Probability in R

# Normal Distribution Density and Cumulative Functions
x <- seq(0, 8, length = 100)
y_density <- dnorm(x, mean = 4, sd = sqrt(1.5))
y_cdf <- pnorm(x, mean = 4, sd = sqrt(1.5))

# Density plot
plot(x, y_density, type = "l", col = "blue", main = "Density Function (Normal)", 
     xlab = "x", ylab = "Density")

# Cumulative plot
plot(x, y_cdf, type = "l", col = "red", main = "Cumulative Distribution Function (Normal)", 
     xlab = "x", ylab = "Cumulative Probability")

Difference:
The density function shows the probability per unit, while the cumulative function accumulates probabilities up to \(x\).

Part 3: Probabilistic Questions

# Normal Distribution for DAX Example
x <- seq(-5, 7, length = 100)
dax_density <- dnorm(x, mean = 1, sd = 0.75)

# Plot
plot(x, dax_density, type = "l", col = "blue", main = "DAX Growth Distribution",
     xlab = "Growth (%)", ylab = "Density")

# Probability Calculations
p_dax_below_0 <- pnorm(0, mean = 1, sd = 0.75)
p_dax_above_1_5 <- 1 - pnorm(1.5, mean = 1, sd = 0.75)
p_dax_below_0
## [1] 0.09121122
p_dax_above_1_5
## [1] 0.2524925

Part 4: Confidence Intervals

# Data
n <- 50
mean_rating <- 2.1
sd_rating <- 0.76

# 95% Confidence Interval
margin_95 <- qt(0.975, df = n - 1) * sd_rating / sqrt(n)
ci_95 <- c(mean_rating - margin_95, mean_rating + margin_95)

# 99% Confidence Interval
margin_99 <- qt(0.995, df = n - 1) * sd_rating / sqrt(n)
ci_99 <- c(mean_rating - margin_99, mean_rating + margin_99)

# Confidence Intervals for Sample Size of 100
n_100 <- 100
margin_95_100 <- qt(0.975, df = n_100 - 1) * sd_rating / sqrt(n_100)
ci_95_100 <- c(mean_rating - margin_95_100, mean_rating + margin_95_100)

list(ci_95 = ci_95, ci_99 = ci_99, ci_95_100 = ci_95_100)
## $ci_95
## [1] 1.88401 2.31599
## 
## $ci_99
## [1] 1.811958 2.388042
## 
## $ci_95_100
## [1] 1.9492 2.2508

Part 5: Hypothesis Testing

# Standard Error
se <- 19 / sqrt(40)

# Z-Score for Sample Mean
z_score <- (117 - 100) / se

# Probability for Sample Mean
p_sample_mean <- pnorm(z_score, lower.tail = FALSE)

# Individual Probability
p_individual <- dnorm(117, mean = 100, sd = 19)

list(se = se, z_score = z_score, p_sample_mean = p_sample_mean, p_individual = p_individual)
## $se
## [1] 3.004164
## 
## $z_score
## [1] 5.658813
## 
## $p_sample_mean
## [1] 7.621192e-09
## 
## $p_individual
## [1] 0.01407079