Introdução:

Santa Catarina é um estado situado na região sul do Brasil, cuja capital, Florianópolis, é uma ilha famosa por suas praias e belezas naturais. A diversidade de climas, paisagens e relevos no estado favorece o desenvolvimento de diversas atividades econômicas, desde a agricultura até o turismo, atraindo investidores de diferentes setores e evitando a concentração de riqueza em uma única área. Santa Catarina faz fronteira com o Paraná ao norte, o Rio Grande do Sul ao sul, o Oceano Atlântico a leste e a Argentina a oeste.

Neste estudo, serão utilizados dados referentes aos municípios e aos níveis de escolarização para a elaboração de um relatório analítico. O objetivo é explorar a relação entre essas variáveis e aplicar conceitos de probabilidade e estatística para realizar análises descritivas e inferenciais. Serão exemplificadas técnicas de amostragem para investigar padrões e tendências nos dados do banco de dados, visando uma compreensão mais profunda e informada dos indicadores educacionais.


Metodologia:

Para este estudo, serão aplicadas técnicas de amostragem estatística fundamentais, incluindo a amostra aleatória simples, amostra aleatória por conglomerado e amostra aleatória estratificada.

A amostra aleatória simples será utilizada para selecionar aleatoriamente municípios de uma lista completa, garantindo que cada município tenha a mesma probabilidade de ser escolhido, refletindo a diversidade geográfica da população estudada. A amostra aleatória por conglomerado será empregada ao agrupar naturalmente os municípios em conglomerados, como regiões administrativas, e selecionar aleatoriamente alguns desses conglomerados para inclusão na amostra. Isso facilitará a coleta eficiente de dados de grupos similares, minimizando custos e tempo de campo. Por fim, a amostra aleatória estratificada será utilizada para estratificar os municípios por características socioeconômicas, como índices de escolarização, e selecionar aleatoriamente uma amostra representativa de cada estrato. Essa abordagem assegura uma análise detalhada das disparidades educacionais entre diferentes estratos populacionais.

Essas técnicas de amostragem serão aplicadas para garantir a representatividade dos dados coletados e permitir análises robustas sobre os níveis de escolarização nos municípios estudados, utilizando métodos estatísticos para inferências confiáveis.

Utilizarei as bibliotecas readxl(Esta biblioteca em R facilita a importação de dados do Microsoft Excel diretamente para o ambiente R.), dplyr(Ela oferece uma interface consistente e intuitiva para realizar operações comuns em dataframes, como filtragem, seleção, agrupamento, e mutação de variáveis. É especialmente útil para limpeza de dados e preparação de conjuntos de dados para análise estatística.) e DT(utilizada para manipulação de dados e visualização interativa das amostras selecionadas.)

Essas bibliotecas são essenciais para cientistas de dados e pesquisadores que trabalham com análise de dados em R, oferecendo ferramentas robustas para importação, manipulação e visualização de dados de forma eficiente e eficaz.

Os dados apresentados foram retirados no site do IBGE: https://www.ibge.gov.br/cidades-e-estados/sc/




Amostra aleatória simples sem reposição

Para ilustrar o conceito de amostragem aleatória simples sem reposição, utilizei um exemplo utilizando os dados das variáveis “Município” e “Escolarização”. A técnica de amostragem foi aplicada para selecionar aleatoriamente uma amostra representativa de municípios, onde cada município teve uma chance igual de ser selecionado.

Isso permitiu uma análise inicial dos níveis de escolarização em uma amostra específica de municípios, demonstrando a aplicação prática da amostragem estatística na análise de dados educacionais.

Amostra aleatória simples com reposição

Para exemplificar a técnica de amostragem aleatória simples com reposição, assim como no exemplo anterior utilizei dados das variáveis “Município” e “Escolarização”. Neste exemplo, selecionei aleatoriamente uma amostra de municípios permitindo a possibilidade de um mesmo município ser selecionado mais de uma vez. Isso foi feito para explorar como diferentes configurações de amostras podem afetar a análise dos níveis de escolarização, oferecendo insights sobre a variabilidade nos dados educacionais em diferentes cenários de amostragem.

Caso não existam valores duplicados na tabela, abaixo está um breve código que executa uma simples amostragem aleatória com reposição. No caso a seguir, a partir de uma lista de números de 1 a 10, iremos aleatoriamente escolher 5 números com reposição, ilustrando a possibilidade de repetições. Essa técnica possibilita a avaliação da eficácia do nosso método de amostragem.

Amostra aleatória por conglomerado

Nesta abordagem, os municípios foram agrupados em conglomerados naturais, e alguns desses conglomerados foram selecionados aleatoriamente para compor a amostra. Todos os municípios dentro dos conglomerados selecionados foram incluídos na amostra. Essa técnica permitiu analisar os níveis de escolarização de maneira eficiente, ao mesmo tempo em que reduziu custos e tempo de coleta de dados, demonstrando a aplicabilidade prática da amostragem por conglomerado na análise de dados educacionais.

Amostra aleatória estratificada com reposição

Neste exemplo, os municípios foram primeiro divididos em estratos com base em características específicas, como a letra inicial do nome do município e o primeiro digito do código. Em seguida, selecionei aleatoriamente uma amostra de cada estrato, permitindo a possibilidade de um mesmo município ser selecionado mais de uma vez. Essa técnica garantiu que todos os estratos fossem representados proporcionalmente na amostra final, permitindo uma análise detalhada e equilibrada dos níveis de escolarização em diferentes grupos populacionais.

Amostra aleatória estratificada sem reposição

Assim como no exemplo anterior os municípios foram primeiro divididos em estratos com base em características específicas. Em seguida, selecionei aleatoriamente uma amostra de cada estrato, sem permitir que um mesmo município fosse selecionado mais de uma vez. Essa técnica garantiu que todos os estratos fossem representados proporcionalmente na amostra final, permitindo uma análise detalhada e equilibrada dos níveis de escolarização em diferentes grupos populacionais.



Esse comando mostra o total de linhas e colunas do nosso banco de dados.

## [1] 100   4


Conclusão:

Neste estudo, empregamos diferentes técnicas de amostragem estatística para investigar os níveis de escolarização nos municípios de Santa Catarina, utilizando as variáveis “Município” e “Escolarização”. A aplicação dessas técnicas permitiu uma análise abrangente e detalhada das variáveis educacionais, refletindo a diversidade geográfica e socioeconômica do estado. As bibliotecas readxl, dplyr, e DT foram essenciais para a importação, manipulação e visualização dos dados, proporcionando uma abordagem eficiente e eficaz para a análise estatística.

Através da amostra aleatória simples com reposição, ilustramos como selecionar aleatoriamente municípios com a possibilidade de repetição, destacando a variabilidade e a representatividade nos dados. A técnica de amostragem por conglomerado foi aplicada agrupando os municípios em conglomerados naturais e selecionando aleatoriamente alguns desses conglomerados, o que facilitou uma coleta eficiente de dados. Por fim, a amostragem estratificada, tanto com reposição quanto sem reposição, garantiu que diferentes estratos fossem representados proporcionalmente, permitindo uma análise equilibrada das disparidades educacionais entre os diferentes grupos populacionais.

Neste estudo, é evidenciada a utilidade prática das técnicas de amostragem estatística na avaliação de informações educacionais, proporcionando conhecimentos valiosos sobre a educação nos diversos municípios de Santa Catarina. Dessa forma, ele auxilia a ampliar a compreensão e o conhecimento dos indicadores educacionais do estado de maneira mais aprofundada e embasada.



Referências




Códigos Utilizados

library(readxl) 
library(dplyr)
library(DT)

meuxlsx <- "Dados.xlsx"
Dados<- read_excel(path = meuxlsx, sheet = 1)
dados <- as.data.frame(Dados)

dados_agregados <- dados %>%
  group_by(Município) %>%
  summarise(Media_Escolarizacao = mean(Escolarização, na.rm = TRUE))

colnames(dados_agregados) <- c("Municipio", "Media_Escolarizacao")

amostra <- dados_agregados %>%
  sample_n(size = 100, replace = TRUE)

datatable(amostra)

set.seed(123)  

dados <- data.frame(
  Município = rep(1:20, each = 10),  # Exemplo de 20 municípios com 10 observações cada
  Escolarização = rnorm(200, mean = 70, sd = 10)  # Exemplo de variável Escolarizacao
)

amostra <- dados %>%
  sample_n(size = 50, replace = TRUE)

datatable(amostra)

set.seed(123)  # Define uma semente para garantir a reprodutibilidade

dados <- data.frame(
  Município = rep(1:20, each = 10),  # Exemplo de 20 municípios com 10 observações cada
  Escolarização = rnorm(200, mean = 70, sd = 10)  # Exemplo de variável Escolarizacao
)

conglomerados <- unique(dados$Município)
conglomerados_amostrados <- sample(conglomerados, size = 5, replace = FALSE)

dados_amostra <- dados %>%
  filter(Município %in% conglomerados_amostrados)

datatable(dados_amostra)

set.seed(123) 
dados <- data.frame(
  Estrato = rep(letters[1:5], each = 20),  # Exemplo de 5 estratos com 20 observações cada
  Código = rep(1:20, each = 5),  # Exemplo de 20 códigos com 5 observações cada
  Município = rep(LETTERS[1:10], each = 10),  # Exemplo de 10 municípios com 10 observações cada
  Escolarização = rnorm(100, mean = 70, sd = 10)  # Exemplo de variável Escolarizacao
)

estratos <- unique(dados$Estrato)

tamanho_amostra <- 2

dados_amostrados <- dados %>%
  group_by(Estrato) %>%
  sample_n(tamanho_amostra, replace = TRUE)

datatable(dados_amostrados, options = list(dom = 't', paging = FALSE))

set.seed(123)  

dados <- data.frame(
  Estrato = rep(letters[1:5], each = 20),  # Exemplo de 5 estratos com 20 observações cada
  Código = rep(1:20, each = 5),  # Exemplo de 20 códigos com 5 observações cada
  Município = rep(LETTERS[1:10], each = 10),  # Exemplo de 10 municípios com 10 observações cada
  Escolarização = rnorm(100, mean = 70, sd = 10)  # Exemplo de variável Escolarizacao
)

estratos <- unique(dados$Estrato)

tamanho_amostra <- 2

dados_amostrados <- dados %>%
  group_by(Estrato) %>%
  sample_n(tamanho_amostra, replace = FALSE)

datatable(dados_amostrados, options = list(dom = 't', paging = FALSE))

dim(dados)