In questa presentazione, verrà illustrata la risoluzione di un problema utilizzando il metodo del campionamento stratificato.
L’esposizione sarà divisa in due fasi:
1)Scrittura della funzione generale.
2)Applicazione della funzione al dataset.
Il campionamento stratificato è una tecnica di campionamento in cui la popolazione N viene suddivisa in L gruppi omogenei o strati, e poi viene selezionato un campione casuale da ciascuno di questi strati.
Ogni sotto-campione viene estratto tramite il campionamento casuale semplice senza reimmissione, dunque il numero totale dei possibili campioni è pari al prodotto del numero dei possibili campioni estraibili in ogni strato.
possibilità di dividere una popolazione altamente eterogenea in sotto-popolazioni basando la stratificazione su deteminate informazioni ausiliari;
maggiore precisione nelle stime, minor variabilità;
dimensione campionaria contenuta a parità di efficienza.
Il dataset riguarda il numero degli studenti presenti in aula durante la lezione di statistica, svolta al primo anno del corso di laurea in Scienze Politiche all’Università Federico II.
Gli anni oggetto di studio sono quelli tra il 1988 e il 1995.
Suddividiamo la popolazione in alcune sottopopolazioni distinte, all’interno delle quali le unità sono omogenee secondo qualche criterio.
In questo caso suddividiamo la nostra popolazione in base alla tipologia di diploma conseguito.
Dopo aver diviso la popolazione in 4 strati, dobbiamo selezionare la nostra variabile indipendente in ogni sottopopolazione. Successivamente uniamo tutto in un unica lista.
Stabiliamo la numerosità campionaria per ciascuno strato.
nhp<-function(pop, N, h, C, SP){
dem=0
n=round((((1.96*SP)/5)^2)/(1+1/N*((((1.96*SP)/5)^2)-1)),)
W=list()
S=list()
med=list()
nh=list()
t=0
for (i in 1:h){
W[i]<-(length(pop[[i]])/N)
med[i]<-sum(pop[[i]])/length(pop[[i]])
S[i]<-(sum((pop[[i]]-med[[i]])^2)/(length(pop[[i]])-1))
}
for(i in 1:h){
t<-t+((W[[i]]*S[[i]])/sqrt(C))
}
for (i in 1:h){
nh[i]<-round(n*(((W[[i]]*S[[i]])/sqrt(C))/t),)
}
print(nh)
}Applichiamo quindi la nostra funzione al dataset. Prima però occorre trovare Sp.
SP<-(sum((studenti$altezza-mean(studenti$altezza))^2))/(nrow(studenti)-1)
nh<-nhp(poplista, 2759, 4, 1, SP)[[1]]
[1] 142
[[2]]
[1] 152
[[3]]
[1] 246
[[4]]
[1] 25
Quindi otteniamo il numero di elementi da estrarre per ogni strato.
Applico la funzione e unisco tutti i campioni in un unica lista.
Come costo fisso ho assunto 450, mentre come costo variabile 1.
La media campionaria viene ottenuta come media aritmetica ponderata di tutte le medie yh in ogni strato del campione
Invece qui la media campionaria la otteniamo tenendo conto della numerosità dello strato nella popolazione.
Stimiamo il totale poichè stiamo studiando una variabile quantitativa.
Il campione sistematico è particolarmente utilizzato se vi sono archivi da cui estrarre il campione.
Come nel campione casuale semplice, tutte le unità hanno la stessa probabilità di inclusione.
Per costruire un campione sistematico prima di tutto si procede con l’estrazione casuale tra le prime k unità della popolazione.
Successivamente a partire dall’unità estratta si procede con passo k per la selezione di tutte le altre.
Rispetto al campionamento stratificato, in quello sistematico non vi è indipendenza tra le estrazioni nelle varie sottoliste