with Data Science

Autor/a

José M. Martínez, M.Sc.

Fecha de publicación

22 de agosto de 2026

1 Resumen Ejecutivo

La reutilización de la primera etapa del Falcon 9 ha transformado la industria aeroespacial al reducir significativamente los costes de acceso al espacio. Mientras que los lanzamientos tradicionales requieren la construcción de un nuevo vehículo para cada misión, SpaceX ha desarrollado un sistema capaz de recuperar, reacondicionar y reutilizar componentes críticos de sus cohetes. Esta capacidad constituye una de las principales ventajas competitivas de la compañía y uno de los factores que explican su liderazgo actual en el mercado de lanzamientos espaciales.

En este contexto, el presente proyecto tiene como objetivo analizar los factores que influyen en el éxito de la recuperación de la primera etapa del Falcon 9 y desarrollar modelos predictivos capaces de anticipar el resultado de futuros aterrizajes utilizando técnicas de Ciencia de Datos y Machine Learning.

Para alcanzar este objetivo se implementó un flujo de trabajo completo de análisis de datos. En primer lugar, se recopilaron datos históricos de lanzamientos mediante la API pública de SpaceX y técnicas de Web Scraping aplicadas a Wikipedia. Posteriormente, se realizó un proceso de limpieza y preparación de datos, corrigiendo valores faltantes, transformando variables y construyendo una variable objetivo binaria que identificara los aterrizajes exitosos y fallidos.

Una vez preparado el conjunto de datos, se llevó a cabo un Análisis Exploratorio de Datos (EDA) mediante visualizaciones estadísticas y consultas SQL. Este procedimiento permitió identificar relaciones significativas entre variables como la masa de la carga útil, la órbita objetivo, el número de vuelo y el centro de lanzamiento. Adicionalmente, se desarrollaron mapas interactivos con Folium y un dashboard analítico mediante Plotly Dash para explorar patrones geográficos y operacionales relacionados con las actividades de lanzamiento y recuperación.

Finalmente, se aplicaron técnicas de aprendizaje automático para construir modelos predictivos capaces de estimar la probabilidad de éxito de un aterrizaje. Se evaluaron distintos algoritmos de clasificación, entre ellos Regresión Logística, Máquinas de Vectores de Soporte (SVM), Árboles de Decisión y K-Nearest Neighbors (KNN), utilizando validación cruzada y optimización de hiperparámetros mediante GridSearchCV.

Los resultados obtenidos permitieron identificar varios factores críticos para el éxito de las recuperaciones. En primer lugar, se observó que la experiencia acumulada por SpaceX constituye una de las variables más influyentes, mostrando una mejora progresiva en las tasas de recuperación conforme aumenta el número de lanzamientos realizados. Asimismo, la masa de la carga útil y el tipo de órbita mostraron una relación directa con la complejidad de las maniobras de aterrizaje. Las misiones con cargas medias dirigidas a órbitas bajas presentaron los mayores porcentajes de éxito, mientras que las misiones energéticamente más exigentes registraron una mayor probabilidad de fallo.

El análisis geoespacial reveló además que las bases de lanzamiento se encuentran estratégicamente ubicadas en zonas costeras con acceso a importantes infraestructuras logísticas, respondiendo simultáneamente a criterios de seguridad, eficiencia operativa y facilidad de transporte de componentes aeroespaciales. Entre todas las instalaciones analizadas, el complejo KSC LC-39A destacó como la plataforma con los mejores resultados operativos.

Desde el punto de vista predictivo, los modelos desarrollados alcanzaron una precisión aproximada del 83,3 % sobre datos no utilizados durante el entrenamiento. Este resultado demuestra que las variables seleccionadas contienen información suficiente para modelar de forma efectiva el comportamiento de las recuperaciones y anticipar futuros resultados con un elevado grado de confianza.

En conjunto, este proyecto demuestra cómo la aplicación de técnicas de Ciencia de Datos, análisis estadístico, inteligencia geoespacial y Machine Learning permite transformar datos históricos en conocimiento accionable, proporcionando una comprensión más profunda de los factores que intervienen en la reutilización de cohetes y evidenciando el valor estratégico de los datos dentro de la industria aeroespacial moderna.

1.1 Principales hallazgos

  • La experiencia acumulada por SpaceX es el principal factor asociado al éxito de los aterrizajes.
  • La masa de la carga útil influye significativamente en la probabilidad de recuperación.
  • El tipo de órbita condiciona el nivel de dificultad de cada misión.
  • KSC LC-39A presenta los mejores indicadores históricos de rendimiento.
  • Las instalaciones de lanzamiento responden a criterios combinados de seguridad y optimización logística.
  • Los modelos de Machine Learning alcanzaron una precisión cercana al 83,3 % en la predicción de aterrizajes exitosos.
  • La Ciencia de Datos constituye una herramienta eficaz para el análisis y la optimización de operaciones aeroespaciales complejas.

2 Recolección de Datos (Data Collection)

La calidad de cualquier proyecto de Ciencia de Datos depende directamente de la calidad de los datos utilizados. Por este motivo, la primera fase del proyecto se centró en la identificación, adquisición y validación de fuentes de información fiables relacionadas con los lanzamientos del Falcon 9.

El objetivo principal de esta etapa consistió en construir un conjunto de datos suficientemente completo para describir las características técnicas de cada misión, las condiciones operativas del lanzamiento y los resultados de recuperación de la primera etapa.

Para minimizar errores y aumentar la fiabilidad de la información, se utilizaron dos fuentes independientes:

  • API pública de SpaceX.
  • Información histórica obtenida mediante Web Scraping desde Wikipedia.

La combinación de ambas fuentes permitió contrastar información y enriquecer el conjunto final de datos.

2.1 Arquitectura de adquisición de datos

Antes de comenzar la extracción, se diseñó un flujo de adquisición capaz de integrar múltiples fuentes de información.

Arquitectura de adquisición de datos

2.2 Obtención de datos desde la API de SpaceX

La fuente principal de información fue la API pública de SpaceX, una interfaz REST que proporciona acceso directo a la información oficial de lanzamientos, vehículos, cargas útiles y plataformas de lanzamiento. La información de lanzamientos fue obtenida mediante la API REST pública de SpaceX (SpaceX, n.d.).

Las API REST constituyen uno de los mecanismos más utilizados para el intercambio de datos entre aplicaciones modernas debido a su simplicidad, escalabilidad y facilidad de integración.

En este proyecto, cada petición HTTP devolvía la información en formato JSON, permitiendo su procesamiento automático mediante Python.

Ventajas de utilizar la API

  • Información oficial y actualizada.
  • Formato estructurado.
  • Acceso automatizable.
  • Alta consistencia de datos.
  • Fácil integración con Pandas.
  • Proceso de extracción

El procedimiento seguido fue:

  1. Realizar una llamada HTTP.
  2. Descargar la respuesta JSON.
  3. Convertir la respuesta en un DataFrame.
  4. Filtrar únicamente lanzamientos Falcon 9.
  5. Seleccionar atributos relevantes.
  6. Almacenar los resultados para el análisis posterior.

Flujo de extracción mediante API
Conexión a la API de SpaceX
import requests
import pandas as pd
url = "https://api.spacexdata.com/v4/launches/past"
response = requests.get(url)
data = response.json()
df_launches = pd.json_normalize(data)
df_launches.head()

2.3 Formato JSON devuelto por la API

La información recibida desde la API se encuentra estructurada en formato JSON. Cada registro representa un lanzamiento individual e incluye decenas de atributos relacionados con la misión.

Ejemplo simplificado de respuesta JSON
{
  "name": "Starlink-15",
  "date_utc": "2020-10-24",
  "success": true,
  "rocket": "5e9d0d95eda69973a809d1ec",
  "payloads": [
    "5fbfedfe54ceb10a5664c80b"
  ]
}

2.4 Variables obtenidas inicialmente

Durante la extracción se recuperaron numerosas variables. Sin embargo, no todas eran relevantes para la predicción del aterrizaje. Las variables seleccionadas inicialmente fueron las siguientes:

Diccionario completo de variables.
Variable Descripción
FlightNumber Número de vuelo
Date Fecha del lanzamiento
Rocket Tipo de cohete
PayloadMass Masa de carga útil
Orbit Órbita destino
LaunchSite Complejo de lanzamiento
Outcome Resultado del aterrizaje
Flights Historial operativo

2.5 Obtención de datos mediante Web Scraping

Aunque la API proporciona gran cantidad de información, algunos atributos históricos aparecían incompletos o resultaban más fáciles de obtener desde Wikipedia. Para complementar la información, se utilizó la técnica denominada Web Scraping. Los registros históricos empleados durante esta fase fueron extraídos de las tablas públicas de Wikipedia relacionadas con los lanzamientos Falcon 9 (Wikipedia Contributors, 2026). Este procedimiento consiste en descargar automáticamente el contenido HTML de una página web y extraer únicamente los elementos relevantes. La librería seleccionada fue BeautifulSoup debido a su sencillez y amplia adopción dentro del ecosistema Python.

Proceso de extracción desde Wikipedia
Descarga del contenido HTML
import requests 
from bs4 import BeautifulSoup
url = wikipedia_url
html = requests.get(url)
soup = BeautifulSoup(html.text, "html.parser")
Extracción de tablas
tables = pd.read_html(str(soup))
launch_table = tables\[0\]
launch_table.head()

2.6 Validación de la calidad de los datos

Una vez obtenidas ambas fuentes se realizó un proceso de validación.

Las comprobaciones incluyeron:

  • Búsqueda de registros duplicados.
  • Verificación de fechas.
  • Detección de valores nulos.
  • Validación de tipos de datos.
  • Comprobación de consistencia entre fuentes.

2.7 Limitaciones encontradas

Durante la adquisición aparecieron varias limitaciones:

  • Campos incompletos en determinadas misiones históricas.
  • Cambios en la estructura de algunas tablas de Wikipedia.
  • Diferencias de nomenclatura entre fuentes.
  • Valores ausentes en masas de carga útil.

Estas incidencias fueron resueltas posteriormente durante la fase de Data Wrangling.

2.8 Resultado de la fase

Como resultado de esta etapa se obtuvo un conjunto consolidado de datos preparado para ser transformado y analizado.

Resumen del dataset obtenido
Métrica Valor
Número de lanzamientos 121
Variables originales 7
Variables seleccionadas 11
Valores nulos detectados 53
Fuentes empleadas API + Wikipedia

3 Limpieza de Datos (Data Wrangling)

3.1 Justificación de la fase de Data Wrangling

La calidad de un modelo predictivo depende directamente de la calidad de los datos utilizados durante su entrenamiento. Por este motivo, antes de iniciar cualquier análisis exploratorio o proceso de Machine Learning, fue necesario realizar una fase exhaustiva de preparación y transformación de los datos.

Los conjuntos de datos obtenidos desde la API de SpaceX y mediante técnicas de Web Scraping presentaban valores faltantes, formatos heterogéneos y variables que debían ser adaptadas para su posterior procesamiento analítico. El objetivo principal de esta etapa fue construir un conjunto de datos consistente, fiable y adecuado para técnicas de aprendizaje supervisado.

3.2 Integración de fuentes de información

Los datos procedentes de las distintas fuentes fueron consolidados en un único conjunto estructurado. Durante este proceso se verificó la correspondencia entre:

  • Identificadores de misión.
  • Fechas de lanzamiento.
  • Centros de lanzamiento.
  • Información de cargas útiles.
  • Resultados de recuperación.

La integración permitió disponer de una visión unificada de cada misión del Falcon 9.

3.3 Tratamiento de valores faltantes

Uno de los principales problemas detectados fue la existencia de registros incompletos, especialmente en variables relacionadas con la masa de carga útil (PayloadMass).

Para minimizar la pérdida de información se aplicaron técnicas de imputación. En aquellos casos donde la ausencia de datos no permitía una recuperación fiable de la información original, se utilizaron valores promedio calculados sobre observaciones equivalentes.

Proceso de limpieza del Dataset

3.4 Ingeniería de características

Además de la limpieza de datos, se crearon nuevas variables destinadas a mejorar la capacidad predictiva de los modelos.

Entre las transformaciones realizadas destacan:

  • Conversión de fechas a formato estándar.
  • Extracción de variables temporales.
  • Normalización de nombres de plataformas.
  • Agrupación de categorías similares.
  • Conversión de variables categóricas a formato utilizable por algoritmos de Machine Learning.

Estas transformaciones permitieron extraer información adicional sin necesidad de recopilar nuevas fuentes de datos.

3.5 Construcción de la variable objetivo

El proceso más importante de esta fase consistió en definir la variable dependiente utilizada por los algoritmos de clasificación.

A partir de los diferentes estados registrados para los aterrizajes del Falcon 9 se construyó la variable binaria Class:

Resultado del aterrizaje Valor
Aterrizaje exitoso 1
Aterrizaje fallido 0

Esta simplificación convirtió el problema en una tarea de clasificación binaria supervisada.

3.6 Distribución de clases

Una vez creada la variable objetivo, se verificó el equilibrio entre observaciones exitosas y fallidas.

El análisis reveló una mayor proporción de aterrizajes exitosos en los años más recientes, reflejando la madurez tecnológica alcanzada por SpaceX y anticipando uno de los principales hallazgos identificados posteriormente durante el análisis exploratorio.

3.7 Validación del conjunto de datos final

Antes de continuar con las fases de Exploratory Data Analysis (EDA) y Machine Learning, se realizaron diversas verificaciones de calidad:

  • Comprobación de valores nulos residuales.
  • Validación de tipos de datos.
  • Eliminación de registros duplicados.
  • Verificación de consistencia temporal.
  • Revisión de rangos válidos para variables numéricas.

Como resultado, se obtuvo un conjunto de datos limpio, estructurado y preparado para las etapas posteriores de análisis estadístico y modelado predictivo.

3.8 Resultado de la fase

La etapa de Data Wrangling permitió transformar datos heterogéneos procedentes de múltiples fuentes en un dataset analítico listo para explotación. Esta fase constituyó el fundamento sobre el que se construyeron todas las visualizaciones, consultas SQL, análisis geoespaciales y modelos predictivos desarrollados en el proyecto.

4 Exploración de Datos (EDA)

4.1 Objetivos del análisis exploratorio

Una vez completada la fase de preparación de datos, el siguiente paso consistió en comprender el comportamiento de las variables antes de construir modelos predictivos.

El Análisis Exploratorio de Datos (EDA) tiene como objetivo identificar patrones, tendencias, anomalías y relaciones entre variables mediante técnicas estadísticas y representaciones visuales.

En el contexto de este proyecto, el EDA persigue responder las siguientes preguntas:

  • ¿Ha mejorado SpaceX con el paso del tiempo?
  • ¿Influye la masa de la carga útil en el aterrizaje?
  • ¿Existen diferencias entre plataformas de lanzamiento?
  • ¿Algunas órbitas presentan más éxito que otras?
  • ¿Qué variables parecen tener mayor capacidad predictiva?

4.2 Metodología de análisis

El análisis visual se desarrolló empleando principalmente:

Pandas
NumPy
Matplotlib
Seaborn

Las bibliotecas utilizadas constituyen herramientas de referencia dentro del ecosistema científico de Python para análisis y visualización de datos (Matplotlib Development Team, 2026; NumPy Developers, 2026; Pandas Development Team, 2026; Waskom, 2026). Estas herramientas permiten representar distribuciones, tendencias temporales y relaciones entre variables de forma intuitiva.

Flujo del análisis exploratorio

4.3 Relación entre experiencia operativa y éxito

Una de las hipótesis iniciales del estudio era que la experiencia acumulada por SpaceX influiría positivamente en la probabilidad de recuperación.

Para comprobarlo se analizó la relación entre:

  • Número de vuelo (Flight Number).
  • Resultado del aterrizaje (Class).

Visualize the relationship between Flight Number and success Rate
Fuente: **SpaceX Falcon 9 First Stage Landing Prediction**

4.3.1 Interpretación

El gráfico muestra una tendencia clara: los primeros vuelos presentan una mayor concentración de fallos, mientras que las misiones más recientes exhiben porcentajes significativamente más altos de éxito.

Este comportamiento refleja el fenómeno conocido como learning curve o curva de aprendizaje.

Cada lanzamiento proporciona información operativa adicional que permite mejorar:

  • Procedimientos de recuperación.
  • Sistemas de guiado.
  • Algoritmos de control.
  • Maniobras de aterrizaje.

Desde una perspectiva empresarial, este resultado evidencia cómo la acumulación de conocimiento técnico genera ventajas competitivas sostenibles.

4.3.2 Conclusión parcial

La experiencia operacional aparece como una de las variables más relevantes para explicar el éxito de los aterrizajes.

4.4 Análisis de la masa de carga útil

La masa transportada constituye uno de los factores más importantes dentro de una misión espacial.

Cuanto mayor es la carga útil transportada:

  • Mayor combustible es necesario.
  • Menor margen energético queda disponible.
  • Más complejas resultan las maniobras de recuperación.

Por este motivo se analizó la relación entre:

  • PayloadMass.
  • Resultados de aterrizaje.

Visualize the relationship between Flight Number and Payload Mass

4.4.1 Interpretación

Los resultados muestran que las cargas extremadamente elevadas presentan una mayor dispersión de resultados y concentran una proporción más elevada de fallos.

Por el contrario, las cargas medias suelen asociarse a porcentajes de éxito más consistentes.

Esto puede explicarse porque la primera etapa dispone de mayores reservas energéticas para realizar maniobras de frenado y posicionamiento cuando la misión exige menores esfuerzos propulsivos.

4.4.2 Conclusión parcial

La masa de la carga útil parece ejercer una influencia significativa sobre el resultado final del aterrizaje.

4.5 Influencia del complejo de lanzamiento

SpaceX opera distintos complejos de lanzamiento.

Cada instalación presenta características específicas relacionadas con:

  • Infraestructura disponible.
  • Tipo de misión.
  • Frecuencia de uso.
  • Ubicación geográfica.

El objetivo de este análisis es determinar si existen diferencias de rendimiento entre complejos.

Visualize the relationship between Flight Number and Launch Site

4.5.1 Instalaciones analizadas

CCAFS SLC-40

Complejo histórico ubicado en Cabo Cañaveral. Ha soportado un elevado número de lanzamientos comerciales y gubernamentales.

KSC LC-39A

Instalación originalmente utilizada por los programas Apollo y Space Shuttle. Actualmente constituye una de las plataformas más importantes para SpaceX.

VAFB SLC-4E

Complejo situado en California destinado principalmente a órbitas polares.

4.5.2 Interpretación

El análisis evidencia diferencias significativas entre instalaciones.

El complejo KSC LC-39A presenta el porcentaje de éxito más elevado, lo que puede explicarse por:

  • Madurez operativa.
  • Infraestructura más moderna.
  • Concentración de misiones recientes.

4.5.3 Conclusión parcial

La localización del lanzamiento constituye una variable relevante dentro del análisis predictivo.

4.6 Relación entre órbita y recuperación

La órbita destino condiciona directamente el perfil de misión.

Algunas órbitas requieren:

  • Mayor velocidad.
  • Más combustible.
  • Trayectorias más exigentes.

Estas condiciones afectan directamente la capacidad de recuperación de la primera etapa.

Visualize the relationship between success rate of each orbit type

4.6.1 Órbitas principales

LEO (Low Earth Orbit)

Órbita terrestre baja.

ISS

Misiones de suministro a la Estación Espacial Internacional.

GTO (Geostationary Transfer Orbit)

Misiones de alta exigencia energética.

Polar y SSO

Órbitas utilizadas principalmente para satélites de observación terrestre.

4.6.2 Interpretación

Las órbitas de transferencia geoestacionaria presentan mayores dificultades de recuperación debido a la energía necesaria para alcanzar la trayectoria requerida.

Por el contrario, las misiones dirigidas a órbitas bajas suelen ofrecer mejores probabilidades de recuperación.

4.6.3 Conclusión parcial

El tipo de órbita constituye uno de los predictores operativos más importantes del proyecto.

4.7 Evolución histórica de la tasa de éxito

Además de analizar variables individuales, resulta importante comprender cómo ha evolucionado el programa de recuperación a lo largo del tiempo.

Visualize the launch success yearly trend

4.7.1 Interpretación

La evolución temporal revela una mejora sostenida durante toda la década analizada.

Los primeros años muestran tasas reducidas de recuperación, mientras que los ejercicios más recientes alcanzan porcentajes cercanos al éxito sistemático.

Este resultado confirma el extraordinario progreso tecnológico logrado por SpaceX en un periodo relativamente corto.

4.8 Hallazgo principal del EDA

Tras completar el análisis exploratorio, se identifican cuatro variables especialmente relevantes:

  1. Número de vuelo.
  2. Masa de carga útil.
  3. Tipo de órbita.
  4. Plataforma de lanzamiento.

Estas variables muestran relaciones claras con el resultado de la recuperación y justifican su utilización posterior en los modelos de Machine Learning.

4.9 Transición hacia la siguiente fase

El análisis exploratorio permitió identificar patrones visuales de interés. Sin embargo, para validar cuantitativamente estas observaciones fue necesario complementar el estudio mediante consultas estructuradas utilizando SQL, tema que se aborda en el capítulo siguiente.

5 Análisis de Datos mediante SQL

5.1 Objetivo de la fase

Aunque las visualizaciones permiten identificar tendencias rápidamente, en muchos casos resulta necesario obtener respuestas exactas a preguntas concretas. Para ello se utilizó SQL (Structured Query Language), uno de los lenguajes más utilizados en entornos empresariales para consultar, transformar y analizar información almacenada en bases de datos.

El almacenamiento y consulta de datos se realizó mediante SQLite, un sistema gestor de bases de datos ligero ampliamente utilizado en aplicaciones analíticas y educativas (SQLite Consortium, 2026). La base de datos fue creada y gestionada utilizando herramientas de línea de comandos y scripts personalizados para garantizar la integridad y consistencia de los datos.

Con el fin de facilitar este análisis, el conjunto de datos fue cargado en una base de datos SQLite denominada spacex.db. Esto permitió realizar consultas complejas de forma eficiente y reproducible.

5.2 Preparación de la base de datos

Antes de ejecutar las consultas, el conjunto de datos fue almacenado en una tabla denominada SPACEXTABLE.

Conexión a la DB
import sqlite3
import prettytable

prettytable.DEFAULT = "DEFAULT"
con = sqlite3.connect("my_data1.db")
cur = con.cursor()

5.3 ¿Qué sitios de lanzamiento utiliza SpaceX?

La primera consulta tuvo como objetivo identificar todas las instalaciones utilizadas por SpaceX durante el periodo analizado.

Consulta 1
SELECT DISTINCT Launch_Site
FROM SPACEXTABLE;

Bases de Lanzamiento Únicas:

Sitios Únicos
CCAFS LC-40
VAFB SLC-4E
KSC LC-39A
CCAFS SLC-40

5.3.1 Interpretación

El análisis confirma que la actividad operacional del Falcon 9 se concentra en un número relativamente reducido de instalaciones.

Esto refleja una estrategia de estandarización operativa que facilita:

  • Reducción de costes.
  • Optimización logística.
  • Reutilización de infraestructuras.
  • Simplificación de procesos de mantenimiento.

5.4 ¿Cuál ha sido la contribución de SpaceX a las misiones de la NASA?

La NASA constituye uno de los principales clientes institucionales de SpaceX.

Para cuantificar esta relación se calculó la masa total transportada para dicha organización.

Consulta 2
SELECT SUM(PAYLOAD_MASS__KG_)
FROM SPACEXTABLE
WHERE CUSTOMER = 'NASA (CRS)';

Peso total transportado para la NASA:

Peso Total NASA (kg)
107010

5.4.1 Interpretación

El resultado muestra la importancia estratégica de los contratos firmados entre SpaceX y la NASA.

Además de generar ingresos recurrentes, estas misiones han servido como plataforma de validación tecnológica para los sistemas de recuperación y reutilización.

5.5 Capacidad de carga del Falcon 9 v1.1

Una de las preguntas más relevantes desde el punto de vista técnico consiste en determinar la capacidad operativa de las distintas versiones del Falcon 9.

Consulta 3
SELECT AVG(PAYLOAD_MASS__KG_)
FROM SPACEXTABLE
WHERE BOOSTER_VERSION = 'F9 v1.1';

Capacidad media de carga del Falcon 9 v1.1:

Capacidad de carga
2928.4

5.5.1 Interpretación

Este resultado permite evaluar las capacidades de una configuración específica del vehículo lanzador y compararla con versiones posteriores.

5.6 Primer aterrizaje exitoso en tierra firme

La recuperación sobre plataforma terrestre representa uno de los hitos más relevantes dentro del programa de reutilización del Falcon 9.

Para identificar este acontecimiento histórico se ejecutó la siguiente consulta.

Consulta 4
SELECT MIN(Date)
FROM SPACEXTABLE
WHERE Landing_Outcome = 'Success (ground pad)';

Primer aterrizaje exitoso en tierra:

Primer aterrizaje
2015-12-22

5.6.1 Interpretación

Esta fecha marca un punto de inflexión dentro de la estrategia de reutilización de SpaceX.

A partir de este momento, la compañía demostró que era posible recuperar etapas de forma consistente y económicamente viable.

5.7 Recuperaciones exitosas sobre barcos autónomos

Una de las innovaciones más relevantes introducidas por SpaceX fue la recuperación sobre plataformas autónomas flotantes.

Estas operaciones son especialmente importantes para misiones que no disponen de suficiente combustible residual para regresar al punto de lanzamiento.

Consulta 5
SELECT BOOSTER_VERSION
FROM SPACEXTABLE
WHERE LANDING_OUTCOME = 'Success (drone ship)'
  AND PAYLOAD_MASS__KG_ > 4000
  AND PAYLOAD_MASS__KG_ < 6000;

Recuperaciones exitosas en droneship:

Recuperaciones Drone Ship
F9 FT B1022
F9 FT B1026
F9 FT B1021.2
F9 FT B1031.2

La existencia de recuperaciones exitosas con cargas relativamente elevadas demuestra la madurez de los sistemas de navegación, guiado y control desarrollados por SpaceX.

5.8 Distribución global de resultados de aterrizaje

Para comprender el rendimiento global del programa se calcularon todos los resultados registrados históricamente.

Consulta 6
SELECT LANDING_OUTCOME,COUNT(*)
FROM SPACEXTABLE
GROUP BY LANDING_OUTCOME
ORDER BY COUNT(*) DESC;

Distribución histórica de resultados:

Tipo Cantidad
Success 38
No attempt 21
Success (drone ship) 14
Success (ground pad) 9
Failure (drone ship) 5
Controlled (ocean) 5
Failure 3
Uncontrolled (ocean) 2
Failure (parachute) 2
Precluded (drone ship) 1
No attempt 1

5.8.1 Interpretación

Se observa una transición progresiva desde situaciones de fallo frecuente hacia escenarios de éxito dominante.

Este hallazgo coincide con las tendencias identificadas previamente durante el análisis exploratorio.

4.7 Identificación de las cargas más pesadas

Para evaluar los límites operativos del Falcon 9 se identificaron las misiones que transportaron la mayor masa útil registrada.

Consulta 7
SELECT BOOSTER_VERSION
FROM SPACEXTABLE
WHERE PAYLOAD_MASS__KG_ = (
    SELECT MAX(PAYLOAD_MASS__KG_)
    FROM SPACEXTABLE
);

Misiones con carga máxima:

Mision
F9 B5 B1048.4
F9 B5 B1049.4
F9 B5 B1051.3
F9 B5 B1056.4
F9 B5 B1048.5
F9 B5 B1051.4
F9 B5 B1049.5
F9 B5 B1060.2
F9 B5 B1058.3
F9 B5 B1051.6
F9 B5 B1060.3
F9 B5 B1049.7

Las cargas más pesadas suelen representar los escenarios de recuperación más exigentes, ya que requieren un consumo adicional de combustible durante la fase de ascenso.

5.9 Análisis de los fallos registrados en 2015

El año 2015 constituye un periodo particularmente interesante debido a la transición entre las primeras pruebas de recuperación y los éxitos posteriores.

Consulta 8
SELECT
    SUBSTR(Date, 6, 2) AS Month,
    Landing_Outcome,
    Booster_Version,
    Launch_Site
FROM SPACEXTABLE
WHERE SUBSTR(Date, 1, 4) = '2015'
  AND Landing_Outcome = 'Failure (drone ship)';

Fallos en droneship durante 2015:

Month Landing_Outcome Booster_Version Launch_Site
01 Failure (drone ship) F9 v1.1 B1012 CCAFS LC-40
04 Failure (drone ship) F9 v1.1 B1015 CCAFS LC-40

5.9.1 Interpretación

Estos registros documentan el periodo de experimentación que permitió posteriormente alcanzar elevadas tasas de recuperación.

Los fallos observados no representan debilidades del sistema, sino etapas naturales del proceso de aprendizaje tecnológico.

5.10 Ranking histórico de resultados

Finalmente, se generó una clasificación completa de resultados para el periodo inicial del programa.

5.11 Conclusiones del análisis SQL

El análisis mediante SQL permitió validar cuantitativamente las observaciones realizadas durante el EDA.

Los principales hallazgos son:

La actividad de SpaceX se concentra en un conjunto reducido de bases estratégicas. Las misiones para la NASA representan una parte significativa de las operaciones históricas. El Falcon 9 ha incrementado progresivamente su capacidad operativa. La recuperación terrestre y marítima ha evolucionado desde una fase experimental hasta convertirse en un procedimiento rutinario. La proporción de aterrizajes exitosos aumenta claramente con el tiempo. Transición al análisis geoespacial

Hasta este punto se ha estudiado qué ocurrió en cada misión y cuáles fueron sus resultados. Sin embargo, todavía queda una pregunta importante: ¿por qué las bases de lanzamiento se encuentran exactamente en esos lugares?

Para responderla se desarrolló un análisis geoespacial utilizando Folium y herramientas de cartografía interactiva, tema que se aborda en el siguiente capítulo.

6 Análisis Geoespacial y Business Intelligence

6.1 Objetivo de la fase

Hasta este punto del proyecto se ha estudiado el comportamiento histórico de los lanzamientos desde una perspectiva estadística. Sin embargo, los lanzamientos espaciales poseen una fuerte dependencia geográfica.

La ubicación de una base de lanzamiento no se elige al azar. Factores como la seguridad pública, la proximidad al océano, la logística industrial y las restricciones regulatorias influyen directamente sobre la viabilidad operativa de una misión.

Por este motivo se desarrolló una fase específica de análisis geoespacial utilizando herramientas de cartografía interactiva.

Los objetivos fueron:

  • Localizar geográficamente todas las bases de lanzamiento.
  • Analizar su entorno inmediato.
  • Identificar infraestructuras cercanas.
  • Medir distancias relevantes.
  • Comprender los criterios utilizados por SpaceX para seleccionar sus emplazamientos.

6.1.1 Introducción a Folium

La implementación cartográfica se desarrolló utilizando Folium, una librería basada en Leaflet que permite generar mapas interactivos desde Python (Folium, n.d.).

Esta herramienta facilita:

  • Incorporar marcadores.
  • Dibujar áreas geográficas.
  • Añadir capas de información.
  • Visualizar coordenadas GPS.
  • Medir distancias entre puntos.

Su utilización permitió transformar datos tabulares en información geográfica fácilmente interpretable.

Arquitectura de la solución geoespacial

Flujo del análisis geoespacial

6.2 Identificación de las bases de lanzamiento

SpaceX opera desde distintos complejos de lanzamiento distribuidos estratégicamente en territorio estadounidense.

Las principales instalaciones analizadas fueron:

Instalación Ubicación
CCAFS SLC-40 Cabo Cañaveral, Florida
KSC LC-39A Kennedy Space Center, Florida
VAFB SLC-4E California
Boca Chica (Starbase) Texas

6.2.1 Coordenadas geográficas

Estas instalaciones fueron representadas mediante coordenadas GPS.

Launch Site Lat Long
0 CCAFS LC-40 28.562302 -80.577356
1 CCAFS SLC-40 28.563197 -80.576820
2 KSC LC-39A 28.573255 -80.646895
3 VAFB SLC-4E 34.632834 -120.610745

Coordenadas de las bases de lanzamiento

Fuente: **Launch Sites Locations Analysis with Folium**
Código
# Start location is NASA Johnson Space Center
nasa_coordinate = [29.559684888503615, -95.0830971930759]
site_map = folium.Map(location=nasa_coordinate, zoom_start=10)

Bases de SpaceX en EEUU

6.2.2 Interpretación

Se observa una clara concentración de infraestructuras en zonas costeras.

Esta característica responde a motivos de seguridad operacional.

En caso de fallo durante el ascenso, la trayectoria del vehículo minimiza el riesgo para áreas densamente pobladas.

6.3 Análisis de proximidad a zonas urbanas

Una vez identificadas las bases, se analizaron las ciudades y áreas pobladas más cercanas.

El objetivo fue estudiar la relación entre:

  • Riesgo operacional.
  • Seguridad pública.
  • Distancia respecto a poblaciones.
Distancias entre complejos espaciales y núcleos urbanos
html_label = (
    '<div style="font-size: 12; color:#d35400;">'
    f'<b>{distance_coastline:10.2f} KM</b>'
    '</div>'
)

distance_marker = folium.Marker(
    [coastline_lat, coastline_lon],
    icon=DivIcon(
        icon_size=(20, 20),
        icon_anchor=(0, 0),
        html=html_label,
    ),
)

site_map.add_child(distance_marker)
site_map

6.3.1 Hallazgos

Las bases presentan una separación considerable respecto a grandes áreas urbanas.

Esto demuestra la aplicación de criterios estrictos de gestión del riesgo.

Entre los factores considerados destacan:

  • Seguridad de la población.
  • Control de accesos.
  • Reducción de exposición ante accidentes.
  • Disponibilidad de zonas de evacuación.

6.4 Proximidad a infraestructuras logísticas

Además de la seguridad, la operación de un programa espacial exige una compleja red logística.

Cada lanzamiento requiere el transporte de:

  • Componentes estructurales.
  • Motores.
  • Equipos electrónicos.
  • Combustible.
  • Personal especializado.

Por este motivo se analizaron elementos como:

  • Carreteras.
  • Ferrocarriles.
  • Puertos.
  • Aeropuertos.

Infraestructuras de transporte cercanas

6.4.1 Interpretación

Los complejos analizados muestran una fuerte integración con las redes de transporte.

Esto permite reducir:

  • Costes logísticos.
  • Tiempos de entrega.
  • Riesgos operativos.

La proximidad a vías ferroviarias resulta especialmente relevante debido al tamaño de determinados componentes del Falcon 9.

6.5 Cálculo de distancias mediante Haversine

Con el fin de cuantificar objetivamente las relaciones espaciales se utilizó la fórmula de Haversine.

Esta ecuación permite calcular distancias entre dos puntos de la superficie terrestre utilizando coordenadas geográficas.

6.5.1 Fundamento matemático

La fórmula tiene en cuenta:

  • Curvatura terrestre.
  • Latitud.
  • Longitud.

Esto proporciona resultados significativamente más precisos que una aproximación euclidiana simple.

Ecuación 1. Fórmula de Haversine

\[ d = 2R \arcsin \left( \sqrt{ \sin^2\left(\frac{\phi_2-\phi_1}{2}\right) + \cos(\phi_1)\cos(\phi_2) \sin^2\left(\frac{\lambda_2-\lambda_1}{2}\right) } \right) \tag{1}\]

La implementación práctica utilizada para el cálculo de distancias geográficas fue desarrollada en Python mediante una función basada en la ecuación de Haversine. El código completo de la implementación puede consultarse en Sección 11.

6.5.2 Aplicaciones dentro del proyecto

La fórmula fue empleada para calcular:

  • Distancias a poblaciones.
  • Distancias a estaciones ferroviarias.
  • Distancias a carreteras.
  • Distancias a infraestructuras estratégicas.

6.6 Hallazgos estratégicos del análisis geoespacial

Tras completar el estudio geográfico se identificaron varios patrones comunes.

6.6.1 Patrón 1: proximidad al océano

Todas las instalaciones se encuentran próximas a zonas costeras.

Ventajas

  • Mayor seguridad.
  • Trayectorias despejadas.
  • Menor riesgo sobre áreas pobladas.

6.6.2 Patrón 2: integración logística

Las bases presentan buena conectividad con redes de transporte.

Beneficios

  • Menores costes operativos.
  • Facilidad de mantenimiento.
  • Transporte eficiente de componentes.

6.6.3 Patrón 3: equilibrio entre seguridad y eficiencia

La ubicación de cada emplazamiento representa una optimización entre:

  • Requisitos orbitales.
  • Restricciones de seguridad.
  • Factores económicos.
  • Necesidades logísticas.

6.7 Dashboard interactivo con Plotly Dash

Además de los mapas geográficos, se desarrolló una aplicación analítica interactiva utilizando Plotly Dash.

La transformación fue realizada utilizando las utilidades de preprocesamiento incluidas en Scikit-learn (Pedregosa et al., 2011).

El objetivo fue proporcionar una herramienta de exploración visual para usuarios no técnicos.

6.7.1 Funcionalidades implementadas

El dashboard permite:

  • Seleccionar centros de lanzamiento.
  • Filtrar por masa de carga útil.
  • Visualizar proporciones de éxito.
  • Comparar resultados entre instalaciones.
  • Analizar tendencias dinámicamente.
  • Visualizar los centros de lanzamiento.
  • Misiones realizadas.

Arquitectura del Dashboard

Vista general del Dashboard

6.8 Despliegue de las aplicaciones analíticas

Con el objetivo de facilitar el acceso a los resultados obtenidos, las aplicaciones desarrolladas durante el proyecto fueron desplegadas en entornos cloud accesibles mediante navegador web.

Las soluciones implementadas incluyen:

  • Dashboard analítico desarrollado con Plotly Dash, Plotly Dash 2.
  • Aplicación interactiva desarrollada con Streamlit.
  • Acceso remoto sin necesidad de instalación local.
  • Visualización dinámica de métricas, indicadores y resultados predictivos.
  • Capacidad de exploración interactiva para usuarios técnicos y no técnicos.

Este enfoque permite transformar los modelos y análisis desarrollados en herramientas de soporte a la toma de decisiones, acercando el proyecto a escenarios reales de explotación empresarial.

6.9 Análisis de resultados del Dashboard

La exploración interactiva permitió confirmar varias observaciones obtenidas previamente.

6.10 Tasa de éxito por centro

KSC LC-39A aparece sistemáticamente como la instalación con mejores resultados.

Éxitos por centro de lanzamiento

6.11 Relación entre masa y éxito

Los filtros dinámicos permiten observar cómo los aterrizajes exitosos se concentran principalmente en intervalos de masa medios.

Relación entre Payload Mass y Class

6.12 Conclusiones de la fase geoespacial

El análisis geoespacial permitió comprender que el éxito de SpaceX no depende únicamente de la ingeniería del cohete. La selección estratégica de las ubicaciones de lanzamiento constituye un factor fundamental dentro de su modelo operativo. Los mapas interactivos y el dashboard confirmaron que:

  • Todas las instalaciones responden a criterios de seguridad rigurosos.
  • Existe una fuerte dependencia de la infraestructura logística circundante.
  • KSC LC-39A se consolida como la plataforma más eficiente.
  • La visualización interactiva facilita la identificación de patrones complejos.
  • La geografía constituye una variable relevante dentro del ecosistema operacional del Falcon 9.

7 Análisis Predictivo mediante Machine Learning

7.1 Introducción

Una vez completadas las fases de recolección, limpieza y exploración de datos, el siguiente paso consistió en desarrollar modelos de aprendizaje automático capaces de predecir el resultado de futuros aterrizajes de la primera etapa del Falcon 9.

El objetivo no era únicamente obtener una predicción correcta, sino comprender hasta qué punto las variables disponibles contienen suficiente información para anticipar el éxito o fracaso de una maniobra de recuperación.

Desde una perspectiva empresarial, la capacidad de anticipar el resultado de un aterrizaje permite estimar con mayor precisión los costes operativos asociados a cada lanzamiento y evaluar el riesgo inherente a cada misión.

7.2 Definición del problema

El problema abordado pertenece a la categoría de clasificación supervisada binaria.

La variable objetivo es:

Class Interpretación
1 Aterrizaje exitoso
0 Aterrizaje fallido

El sistema debe aprender a partir de ejemplos históricos y generar una predicción para observaciones nuevas.

Formalmente:1

\[f(X) \rightarrow \text{Class}\]

7.3 Variables predictoras utilizadas

Tras la fase de preparación de datos se seleccionaron diversas variables con potencial capacidad explicativa.

Entre ellas destacan:

FlightNumber
PayloadMass
Orbit
LaunchSite
Flights
Block
GridFins
Reused
Legs
LandingPad

Algunas variables son numéricas mientras que otras son categóricas.

Por este motivo fue necesario realizar transformaciones previas para que los algoritmos pudieran trabajar correctamente.

7.4 Codificación de variables categóricas

La mayoría de algoritmos de Machine Learning trabajan exclusivamente con datos numéricos.

Sin embargo, variables como:

  • Orbit
  • LaunchSite
  • LandingPad

son categóricas.

Para resolver este problema se utilizó la técnica One-Hot Encoding.

Ejemplo

Antes:

Orbit
LEO
GTO
ISS

Después:

Orbit_LEO Orbit_GTO Orbit_ISS
1 0 0
0 1 0
0 0 1

Transformación One-Hot Encoding

La transformación fue realizada utilizando las utilidades de preprocesamiento incluidas en Scikit-learn (Pedregosa et al., 2011).

7.5 Estandarización de características

Las variables numéricas presentan escalas muy diferentes.

Por ejemplo:

Esta diferencia puede afectar negativamente al entrenamiento de determinados algoritmos.

Para solucionar este problema se aplicó:

La transformación convierte cada variable en una distribución centrada en cero con desviación estándar unitaria. La normalización de variables se realizó mediante StandardScaler de Scikit-learn (Pedregosa et al., 2011).

Fórmula:2 \[z = \frac{x - \mu}{\sigma}\]

scalado de variables
from sklearn import preprocessing
transform = preprocessing.StandardScaler()
X = transform.fit_transform(X)

7.6 División entrenamiento-prueba

Para evaluar correctamente el rendimiento de los modelos fue necesario reservar una parte de los datos para pruebas.

Se utilizó la estrategia:

\begin{center} \texttt{80% Entrenamiento}\ \texttt{20% Prueba} \end{center}

El conjunto de entrenamiento fue utilizado para aprender patrones. El conjunto de prueba permaneció oculto durante el entrenamiento y se utilizó únicamente para la evaluación final.

División de datos

7.7 Selección de algoritmos

Con el objetivo de comparar diferentes enfoques de clasificación se entrenaron cuatro modelos ampliamente utilizados. La implementación de los algoritmos Logistic Regression, Support Vector Machine, Decision Tree y K-Nearest Neighbors se realizó utilizando la biblioteca Scikit-learn (Pedregosa et al., 2011).

7.7.1 Regresión Logística

La regresión logística es uno de los algoritmos más utilizados en problemas de clasificación binaria.

Ventajas:

  • Fácil interpretación.
  • Entrenamiento rápido.
  • Buena capacidad de generalización.

7.7.2 Máquinas de Vectores de Soporte (SVM)

Las SVM buscan encontrar la frontera óptima que separa ambas clases.

Ventajas:

  • Buen rendimiento en espacios multidimensionales.
  • Robusta frente a sobreajuste.

7.7.3 Árboles de Decisión

Los árboles generan reglas de decisión fácilmente comprensibles.

Ejemplo:

árbol de decisión

Ventajas:

  • Alta interpretabilidad.
  • Fácil visualización.

7.7.4 K Nearest Neighbors (KNN)

El algoritmo KNN clasifica observaciones según sus vecinos más próximos.

Ventajas:

  • Simplicidad.
  • Buen comportamiento en datasets reducidos.
Tabla 1: Algoritmos evaluados
Modelo Tipo
Logistic Regression Clasificación Lineal
SVM Clasificación por margen
Decision Tree Clasificación basada en reglas
KNN Clasificación basada en similitud

Cada algoritmo posee parámetros internos que afectan directamente a su rendimiento.

Para encontrar la mejor configuración posible se utilizó:

GridSearchCV[@sklearn].

Esta técnica explora automáticamente múltiples combinaciones de parámetros y selecciona la que produce mejores resultados.

Funcionamiento de Grid Search

7.8 Validación cruzada

La estrategia de validación cruzada empleada sigue las recomendaciones habituales para la evaluación robusta de modelos supervisados (Pedregosa et al., 2011). Para obtener estimaciones más robustas se aplicó validación cruzada de 10 particiones.

cv = 10

Durante este procedimiento:

  1. Los datos se dividen en 10 subconjuntos.
  2. Se utilizan 9 para entrenar.
  3. Se utiliza 1 para validar.
  4. El proceso se repite 10 veces.

Este enfoque reduce la dependencia respecto a una única partición de datos.

Esquema de Validación Cruzada

7.9 Resultados obtenidos

Tras el proceso de optimización y validación se obtuvieron los siguientes resultados.

Modelo Accuracy Entrenamiento Accuracy Prueba Precision Recall F1-score ROC-AUC
Decision Tree 0.8333 0.8889 0.9167 0.9167 0.9167 0.9167
Logistic Regression 0.8750 0.8333 0.8000 1.0000 0.8889 0.8889
SVM 0.8889 0.8333 0.8000 1.0000 0.8889 N/A
KNN 0.8611 0.8333 0.8000 1.0000 0.8889 0.8958

7.9.1 Interpretación

La Tabla X presenta una comparación del rendimiento de los modelos Logistic Regression, SVM, Decision Tree y KNN utilizando los hiperparámetros óptimos obtenidos mediante GridSearchCV. El modelo Decision Tree obtuvo el mejor desempeño global, alcanzando una accuracy de prueba del 88,89%, así como los valores más elevados de precision (91,67%), recall (91,67%), F1-score (91,67%) y ROC-AUC (91,67%). Además, su accuracy de entrenamiento fue del 83,33%, lo que sugiere una adecuada capacidad de generalización sin indicios significativos de sobreajuste.

Por su parte, los modelos Logistic Regression, SVM y KNN alcanzaron una accuracy de prueba similar (83,33%). Sin embargo, Logistic Regression y KNN obtuvieron valores de ROC-AUC de 88,89% y 89,58%, respectivamente, mientras que para SVM no se calculó dicha métrica debido a la ausencia de probabilidades estimadas en la configuración empleada. Los tres modelos presentaron un recall del 100%, indicando que identificaron correctamente todas las instancias positivas del conjunto de prueba, aunque con una precision inferior (80%) respecto al árbol de decisión.

En conjunto, los resultados sugieren que el modelo Decision Tree con criterio de entropía y profundidad máxima de 4 constituye la alternativa más equilibrada y eficaz para este problema, al combinar el mayor rendimiento predictivo con una capacidad de generalización adecuada.

7.10 Matriz de confusión

La precisión global resulta útil, pero no proporciona información detallada sobre los errores cometidos.

Por este motivo se analizó la matriz de confusión.

Interpretación de resultados

Los resultados mostraron:

Realidad Predicción Casos
Falló Falló 5
Aterrizó Aterrizó 11
Falló Aterrizó 1
Aterrizó Falló 1

7.10.1 Implicaciones operativas

El modelo clasificó correctamente 16 de las 18 observaciones del conjunto de prueba (5 + 11), cometiendo únicamente 2 errores.

  • Clase “land”

De las 12 observaciones que realmente correspondían a aterrizajes exitosos (“land”), el modelo identificó correctamente 11 y clasificó erróneamente 1 como “did not land”.

\[Recall = \frac{TP}{TP + FN} = \frac{11}{11 + 1} = 0.9167\]

Por tanto, el modelo recupera correctamente el 91,67% de los aterrizajes exitosos.

  • Clase “did not land”

De las 6 observaciones que realmente correspondían a aterrizajes fallidos (“did not land”), el modelo clasificó correctamente 5 y confundió 1 con un aterrizaje exitoso.

\[Specificity = \frac{TN}{TN + FP} = \frac{5}{5 + 1} = 0.8333\] Esto indica que identifica correctamente el 83,33% de los aterrizajes fallidos.

  • Análisis de los errores

Los dos errores observados son:

Un falso positivo (FP = 1): el modelo predijo “land” cuando realmente el aterrizaje falló. Un falso negativo (FN = 1): el modelo predijo “did not land” cuando realmente el aterrizaje fue exitoso.

La distribución equilibrada de los errores es una característica positiva, ya que el modelo no parece estar sesgado hacia una de las clases.

7.11 Limitaciones del modelo

A pesar de los resultados obtenidos, es importante reconocer ciertas limitaciones.

El modelo no incorpora:

  • Condiciones meteorológicas.
  • Velocidad del viento.
  • Telemetría en tiempo real.
  • Estado técnico detallado de los motores.
  • Información interna de operaciones.

Por tanto, la precisión alcanzada debe interpretarse como una estimación basada exclusivamente en información pública.

7.12 Conclusiones del capítulo

Los resultados demuestran que el éxito de un aterrizaje del Falcon 9 puede predecirse con un nivel elevado de precisión utilizando únicamente datos históricos disponibles antes del lanzamiento. La combinación de ingeniería de datos, análisis exploratorio y aprendizaje automático permitió construir un sistema capaz de anticipar el resultado de una misión con una precisión próxima al 83%. Estos resultados confirman tanto la utilidad de las técnicas de Machine Learning como el valor estratégico de los datos dentro de la industria aeroespacial moderna.

8 Discusión de Resultados

8.1 Interpretación global de los hallazgos

El análisis desarrollado a lo largo del proyecto ha permitido identificar factores técnicos y operativos que contribuyen de manera significativa al éxito de la recuperación de la primera etapa del Falcon 9.

Los resultados obtenidos muestran que la reutilización de cohetes no depende únicamente de avances tecnológicos aislados, sino de la combinación de múltiples variables relacionadas con la experiencia operativa, la planificación de la misión y las características físicas del lanzamiento.

Desde una perspectiva de Ciencia de Datos, el estudio confirma que existen patrones consistentes dentro de los datos históricos de SpaceX y que dichos patrones pueden ser utilizados para generar predicciones fiables.

8.1.1 Impacto de la experiencia operativa

Uno de los hallazgos más consistentes durante todo el análisis fue la influencia positiva del número histórico de vuelos sobre la probabilidad de éxito.

Los gráficos mostraron que las primeras misiones del programa presentaban tasas de fallo considerablemente superiores a las observadas en años recientes.

Este comportamiento evidencia un clásico proceso de aprendizaje organizacional en el que:

  • Se refinan procedimientos.
  • Se mejoran sistemas de control.
  • Se optimizan procesos de fabricación.
  • Se reduce progresivamente la incertidumbre operacional.

La evolución de SpaceX constituye un ejemplo real de mejora continua basada en datos y retroalimentación operativa.

8.2 Influencia de la carga útil

La masa transportada también mostró una relación relevante con el resultado de las recuperaciones.

Las cargas extremadamente pesadas suelen requerir mayores consumos de combustible durante la fase de ascenso, reduciendo el margen operativo disponible para las maniobras de retorno.

Por el contrario, los lanzamientos con masas moderadas mostraron tasas de recuperación significativamente superiores.

Este resultado es coherente con los principios físicos asociados a la dinámica del vuelo espacial.

8.3 Relevancia de la órbita

El análisis confirmó que no todas las órbitas presentan el mismo nivel de dificultad.

Las misiones dirigidas a órbitas bajas suelen requerir menos energía que aquellas orientadas a trayectorias de transferencia geoestacionaria u objetivos más exigentes.

Las diferencias observadas sugieren que el tipo de órbita debe considerarse una variable estratégica en cualquier modelo predictivo relacionado con la recuperación de etapas reutilizables.

8.4 Valor de la localización geográfica

El análisis geoespacial permitió comprender mejor las decisiones de diseño de la infraestructura de SpaceX.

Las instalaciones de lanzamiento analizadas presentan características comunes:

  • Cercanía al océano.
  • Amplias zonas de seguridad.
  • Acceso a infraestructuras logísticas.
  • Distancia adecuada respecto a áreas urbanas.

Estas características contribuyen tanto a la seguridad operacional como a la eficiencia logística de las misiones.

8.5 Limitaciones del Estudio

Como todo proyecto analítico, este trabajo presenta ciertas limitaciones que deben considerarse al interpretar los resultados.

8.5.1 Disponibilidad de datos públicos

El análisis se basa exclusivamente en información disponible públicamente a través de:

  • API de SpaceX.
  • Wikipedia.
  • Datos utilizados en el programa de certificación IBM.

Por tanto, no se dispone de información interna relacionada con operaciones, mantenimiento o telemetría avanzada.

8.5.2 Variables no incluidas

Existen numerosos factores potencialmente influyentes que no pudieron incorporarse al estudio.

Entre ellos:

  • Velocidad del viento.
  • Condiciones meteorológicas.
  • Temperatura ambiental.
  • Estado técnico de los motores.
  • Información detallada de combustible.
  • Parámetros de navegación en tiempo real.

La inclusión de estas variables podría mejorar significativamente la capacidad predictiva de los modelos.

8.5.3 Tamaño del conjunto de datos

Aunque los datos utilizados resultan adecuados para fines educativos y demostrativos, el volumen de observaciones sigue siendo relativamente reducido para ciertos algoritmos avanzados.

Una mayor cantidad de lanzamientos históricos permitiría entrenar modelos más robustos y generalizables.

8.5.4 Evolución tecnológica continua

SpaceX introduce mejoras constantes en sus vehículos y procedimientos.

Como consecuencia, algunos patrones históricos podrían modificarse con el paso del tiempo, reduciendo parcialmente la capacidad predictiva de modelos entrenados exclusivamente con datos pasados.

8.6 Líneas Futuras de Investigación

Los resultados obtenidos abren diversas posibilidades para futuras investigaciones.

8.6.1 Incorporación de datos meteorológicos

Una posible ampliación consistiría en integrar información climática obtenida desde servicios meteorológicos públicos.

Variables potenciales:

  • Velocidad del viento.
  • Humedad.
  • Presión atmosférica.
  • Temperatura.
  • Visibilidad.

8.6.2 Modelos avanzados de Machine Learning

Sería interesante evaluar algoritmos más avanzados como:

  • Random Forest.
  • XGBoost.
  • LightGBM.
  • CatBoost.
  • Redes neuronales profundas.
  • Transformers tabulares.

La comparación con los modelos actuales permitiría determinar si existe margen adicional de mejora.

8.6.3 Predicción en tiempo real

Una evolución natural del proyecto consistiría en desarrollar una aplicación capaz de recibir información previa a un lanzamiento y generar una predicción inmediatamente antes del despegue.

Este enfoque tendría aplicaciones prácticas para:

  • Análisis de riesgos.
  • Simulación de escenarios.
  • Apoyo a la toma de decisiones.

8.6.4 Despliegue en la nube

El proyecto podría evolucionar hacia una arquitectura productiva basada en servicios cloud como:

  • Azure Machine Learning.
  • Azure App Service.
  • Azure Functions.
  • Azure Data Factory.

Esto permitiría implementar un sistema completo de predicción operativa.

9 Repositorio del proyecto.

Todo el código fuente, notebooks, datasets procesados, dashboards interactivos y documentación técnica asociados a este proyecto se encuentran disponibles en el siguiente repositorio:

GitHub: https://github.com/jmmrcp/laboratorio

9.1 Recursos publicados

  • Código Python de adquisición y preparación de datos.
  • Notebooks Jupyter utilizados durante el análisis.
  • Consultas SQL.
  • Visualizaciones del EDA.
  • Aplicación Plotly Dash desplegada online.
  • Aplicación Streamlit desplegada online.
  • Documentación técnica y guía de uso.
  • Acceso a las aplicaciones

Dashboard Plotly Dash: https://jmmrcp.pythonanywhere.com/ , https://dashboard-0l7k.onrender.com/

Aplicación Streamlit: https://dashboard-coursera.streamlit.app/

10 Conclusiones Finales

El presente proyecto ha demostrado la capacidad de la Ciencia de Datos para extraer conocimiento valioso a partir de información histórica relacionada con sistemas aeroespaciales complejos.

Mediante técnicas de adquisición de datos, limpieza, exploración, análisis geoespacial y aprendizaje automático, fue posible identificar los factores más relevantes asociados al éxito de los aterrizajes de la primera etapa del Falcon 9.

Los resultados obtenidos permiten concluir que:

  • La experiencia acumulada constituye uno de los principales factores de éxito.
  • La masa de la carga útil influye significativamente en la recuperación.
  • El tipo de órbita afecta al rendimiento operativo.
  • La localización de las plataformas responde a criterios técnicos y de seguridad claramente identificables.
  • Los modelos de Machine Learning son capaces de predecir el resultado de un aterrizaje con una precisión aproximada del 83%.

Más allá de los resultados técnicos, este proyecto demuestra la importancia de la Ciencia de Datos como disciplina capaz de transformar datos en conocimiento y conocimiento en capacidad predictiva.

10.1 Reflexión Profesional

Este proyecto permitió aplicar de forma integrada conceptos fundamentales de:

  • Ingeniería de Datos.
  • Análisis Exploratorio de Datos.
  • SQL.
  • Visualización de Información.
  • Sistemas Geoespaciales.
  • Machine Learning.
  • Comunicación de resultados analíticos.

La combinación de estas competencias reproduce de forma realista el ciclo completo de trabajo de un profesional de Ciencia de Datos, desde la adquisición inicial de información hasta la generación de conclusiones orientadas a la toma de decisiones.

Además del análisis de datos y la construcción de modelos predictivos, el proyecto incluyó el despliegue de aplicaciones analíticas basadas en Plotly Dash y Streamlit en entornos online, permitiendo la publicación de resultados y la interacción remota con los modelos desarrollados.

En consecuencia, el proyecto no solo constituye un ejercicio técnico sobre lanzamientos espaciales, sino también una demostración práctica de cómo las metodologías de análisis de datos pueden contribuir a resolver problemas complejos en sectores de alta tecnología.

La estructura metodológica seguida durante el proyecto corresponde al itinerario formativo del programa IBM Applied Data Science Capstone desarrollado a través de Coursera (IBM Skills Network, n.d.).

11 Apéndice A: Datos Adicionales

Aquí guardamos algunos de los “planos secretos” y fórmulas matemáticas (código) que usamos durante el proyecto para aquellos que quieran replicar nuestros pasos.

Fórmula matemática para medir la distancia en el planeta Tierra.

Usamos esta función en Python para medir exactamente a cuántos kilómetros de distancia estaba una ciudad del lugar de lanzamiento del cohete en nuestros mapas.

Fórmula de Haversine
from math import sin, cos, sqrt, atan2, radians

def calculate_distance(lat1, lon1, lat2, lon2):
    # Radio aproximado de la Tierra en kilómetros
    R = 6373.0

    lat1 = radians(lat1)
    lon1 = radians(lon1)
    lat2 = radians(lat2)
    lon2 = radians(lon2)

    dlon = lon2 - lon1
    dlat = lat2 - lat1

    a = sin(dlat / 2)**2 + cos(lat1) * cos(lat2) * sin(dlon / 2)**2
    c = 2 * atan2(sqrt(a), sqrt(1 - a))

    distance = R * c
    return distance

Referencias

Folium. (n.d.). Folium Documentation. https://python-visualization.github.io/folium/
IBM Skills Network. (n.d.). Applied Data Science Capstone.
Matplotlib Development Team. (2026). Matplotlib Documentation. https://matplotlib.org
NumPy Developers. (2026). NumPy Documentation. https://numpy.org
Pandas Development Team. (2026). Pandas Documentation. https://pandas.pydata.org
Pedregosa, F., Varoquaux, G., Gramfort, A., Michel, V., Thirion, B., Grisel, O., Blondel, M., Prettenhofer, P., Weiss, R., Dubourg, V., Vanderplas, J., Passos, A., Cournapeau, D., Brucher, M., Perrot, M., & Duchesnay, É. (2011). Scikit-learn: Machine Learning in Python. Journal of Machine Learning Research, 12, 2825-2830.
SpaceX. (n.d.). SpaceX API Documentation. https://github.com/r-spacex/SpaceX-API
SQLite Consortium. (2026). SQLite Documentation. https://www.sqlite.org/docs.html
Waskom, M. (2026). Seaborn Documentation. https://seaborn.pydata.org
Wikipedia Contributors. (2026). List of Falcon 9 and Falcon Heavy Launches. https://en.wikipedia.org/wiki/List_of_Falcon_9_and_Falcon_Heavy_launches

Notas

  1. X representa el conjunto de variables predictoras, y Class representa el resultado esperado.↩︎

  2. \(x\) = valor original, - \(\mu\) = media, \(\sigma\) = desviación estándar.↩︎