Aplicación de software libre y datos abiertos para la construcción de una calculadora de tamaño y ditribución de puntos muestrales georeferenciados y estimación de costos. Estudio de caso para viviendas de Asunción - Paraguay

Authors

Diego Bernardo Meza

dmeza.py@gmail.com - +595 971 100835

Published

October 1, 2024

1 Aplicación de Software Libre y Datos Abiertos para la Construcción de una Calculadora de Tamaño Muestral y Estimación de Costos en Asunción

1.1 Introducción

La estadística es una herramienta esencial en la investigación y la toma de decisiones informadas. Uno de los desafíos más comunes en estudios estadísticos es determinar el tamaño de muestra adecuado para obtener resultados representativos y confiables. Con el auge del software libre y el acceso a datos abiertos, es posible desarrollar herramientas accesibles y personalizables que faciliten este proceso.

Este artículo describe el desarrollo de una calculadora interactiva de tamaño muestral y estimación de costos utilizando software libre y datos abiertos de Asunción, Paraguay. Se detallan los fundamentos matemáticos, las metodologías empleadas y los pasos seguidos para construir esta herramienta, que combina cálculos estadísticos con visualizaciones geoespaciales.

1.2 Objetivos

  • Desarrollar una calculadora interactiva que permita calcular el tamaño de muestra necesario para estudios estadísticos en poblaciones finitas.
  • Estimar el costo total asociado con la realización de encuestas basadas en el tamaño de muestra calculado.
  • Visualizar geográficamente los puntos muestrales seleccionados dentro de Asunción utilizando datos abiertos.
  • Promover el uso de software libre y datos abiertos en la investigación estadística y geoespacial.

1.3 Fundamentos Matemáticos

1.3.1 Cálculo del Tamaño de Muestra para Poblaciones Finitas

El tamaño de muestra necesario para estimar una proporción con un nivel de confianza y margen de error específicos en una población finita se calcula en varios pasos:

  1. Tamaño de muestra inicial (n₀):

    Se calcula como si la población fuera infinita:

    \[ n_0 = \frac{Z^2 \cdot p \cdot (1 - p)}{e^2} \]

    Donde:

    • Z es el valor crítico de la distribución normal estándar correspondiente al nivel de confianza deseado.
    • p es la proporción esperada (se suele usar 0.5 para máxima variabilidad).
    • e es el margen de error tolerable (expresado en proporción).
  2. Ajuste para población finita (n):

    Se ajusta el tamaño de muestra inicial considerando el tamaño de la población (N):

    \[ n = \frac{n_0}{1 + \left( \frac{n_0 - 1}{N} \right)} \]

  3. Ajuste por no respuesta (nₐ):

    Se considera un porcentaje de no respuesta esperado (NR):

    \[ n_{final} = \frac{n}{1 - NR} \]

    Donde NR es el nivel de no respuesta (expresado en proporción).

1.3.2 Distribución Normal y Nivel de Confianza

La distribución normal es fundamental en la estimación estadística, especialmente al utilizar intervalos de confianza. El nivel de confianza determina el área bajo la curva normal donde se espera que se encuentren los verdaderos parámetros poblacionales.

  • Valor crítico (Z):

    El valor de Z se obtiene de la distribución normal estándar y depende del nivel de confianza (1 - α):

    \[ Z = Z_{1 - \frac{\alpha}{2}} \]

    Donde α es el nivel de significancia (α = 1 - Nivel de Confianza).

1.4 Descripción de la Herramienta

La calculadora interactiva desarrollada permite a los usuarios ingresar parámetros específicos y obtener instantáneamente el tamaño de muestra necesario, el costo estimado y visualizar los puntos muestrales en un mapa.

1.4.1 Funcionalidades Principales

  • Entrada de Parámetros:

    • Tamaño de la población (N).
    • Nivel de confianza (%).
    • Margen de error (%).
    • Nivel de no respuesta (%).
    • Costo por encuesta (en Guaraníes).
  • Resultados del Cálculo:

    • Tamaño de muestra ajustado por no respuesta.
    • Costo total estimado para realizar las encuestas.
  • Visualizaciones:

    • Gráfico interactivo de la distribución normal, mostrando las áreas de confianza y rechazo según los parámetros ingresados.
    • Mapa interactivo de Asunción con los puntos muestrales seleccionados y los barrios correspondientes.
    • Tabla interactiva con detalles de los puntos muestrales seleccionados.

1.5 Pasos Seguidos en la Construcción de la Herramienta

1.5.1 1. Preparación del Entorno de Trabajo

  • Lenguaje y Herramientas:

    • Se utilizó el lenguaje de programación R y el paquete Shiny para desarrollar la aplicación web interactiva.
    • Para las visualizaciones geoespaciales, se emplearon los paquetes leaflet y sf.
    • Las visualizaciones gráficas se enriquecieron con plotly para interactividad.
  • Datos Utilizados:

    • VIVIENDAS_000.shp: Shapefile con las ubicaciones de viviendas en Asunción.
    • Barrios_Localidades_Asuncion.shp: Shapefile con los límites de los barrios de Asunción.
    • Los datos fueron obtenidos del Geoportal del INE (Instituto Nacional de Estadística).

1.5.2 2. Desarrollo de la Interfaz de Usuario (UI)

  • Diseño Responsivo:

    • Se utilizó fluidPage y fluidRow para estructurar la interfaz en dos columnas principales.
    • Los controles de entrada se ubicaron en la primera columna, junto con el gráfico de la distribución normal.
    • Los resultados, mapa y tabla se ubicaron en la segunda columna.
  • Estilos Personalizados:

    • Se aplicaron estilos CSS para mejorar la apariencia y experiencia del usuario.
    • Se incluyó un encabezado y pie de página con información relevante.

1.5.3 3. Implementación de la Lógica del Servidor

  • Cálculos Reactivos:

    • Se implementaron expresiones reactivas para calcular:
      • El tamaño de muestra ajustado (n_{final}).
      • El costo total estimado.
  • Gráfico de la Distribución Normal:

    • Se creó una función para generar el gráfico interactivo, considerando el nivel de confianza y el margen de error.
    • El gráfico se actualiza dinámicamente al modificar los parámetros.
  • Manejo de Datos Geoespaciales:

    • Se cargaron y transformaron los shapefiles para asegurar que estuvieran en el sistema de coordenadas correcto.
    • Se seleccionaron aleatoriamente los puntos muestrales utilizando sample_n.
    • Se prepararon los datos para su visualización en el mapa y en la tabla.

1.5.4 4. Integración de Visualizaciones

  • Mapa Interactivo con Leaflet:

    • Se configuró el mapa para centrarse en Asunción y mostrar los barrios seleccionados y los puntos muestrales.
    • Se añadieron CircleMarkers para representar los puntos, coloreados según el barrio.
  • Tabla Interactiva con DT:

    • Se utilizó el paquete DT para mostrar una tabla interactiva de los puntos muestrales seleccionados.

1.5.5 5. Añadiendo la Sección del Artículo

  • Pestaña Adicional:

    • Se incorporó una segunda pestaña en la aplicación, titulada “Artículo”, donde se presenta este contenido.
    • Se utilizó tabsetPanel y includeMarkdown para mostrar el artículo completo.

1.6 Soporte Matemático y Descripciones Detalladas

1.6.1 Cálculo Paso a Paso del Tamaño de Muestra

  1. Obtención del Valor Crítico (Z):

    • Se calcula utilizando la función inversa de la distribución normal estándar (qnorm en R): \[ Z = qnorm\left(1 - \frac{1 - \left(\text{Nivel de Confianza} / 100\right)}{2}\right) \]
  2. Asumiendo la Proporción Esperada (p):

    • Se asume ( p = 0.5 ) para maximizar la variabilidad y obtener el tamaño de muestra más conservador.
  3. Conversión del Margen de Error (e):

    • El margen de error ingresado en porcentaje se convierte a proporción: \[ e = \frac{\text{Margen de Error}}{100} \]
  4. Cálculo del Tamaño de Muestra Inicial (n₀):

    • Se aplica la fórmula: \[ n_0 = \frac{Z^2 \cdot p \cdot (1 - p)}{e^2} \]
  5. Ajuste para Población Finita (n):

    • Considerando el tamaño de la población (N): \[ n = \frac{n_0}{1 + \left( \frac{n_0 - 1}{N} \right)} \]
    • Se redondea al entero superior utilizando ceiling.

1.7 Anexos

Pantalla principal del aplicativo