L’azienda Texas Realty Insights desidera analizzare le tendenze del mercato immobiliare nello stato del Texas, sfruttando i dati storici relativi alle vendite di immobili. Lo scopo è fornire insight statistici e visivi che supportino le decisioni strategiche di vendita e ottimizzazione delle inserzioni immobiliari.

Obiettivi del progetto

  1. Identificare e interpretare i trend storici delle vendite immobiliari in Texas
  2. Valutare l’efficacia delle strategie di marketing delle inserzioni immobiliari
  3. Offrire una rappresentazione grafica dei dati che evidenzi la distribuzione dei prezzi e delle vendite tra città, mesi e anni

Step 1: Analisi delle variabili

Il dataset Real Estate Texas.csv contiene 240 righe di dati ed 8 variabili. Lo Tabella 1 identifica e descrive il tipo di variabili statistiche presenti nel dataset.

Tabella 1 - Variabili del dataset Texas Realty Insights.

Variabile Tipologia Dimensione (valore) Utilizzo
city Categorical 4 (Beaumont, Bryan-College Station, Tyler, Wichita Falls) distribuzione delle vendite/prezzi per città per identificare aree in crescita o declino nell’anno o nel tempo
year Ordinal/Temporal 5 (2010, 2011, 2012, 2013, 2014) trend temporali
month Ordinal/Temporal 12 trend e pattern annuali/stagionali
sales Quantitative/Discrete Numero totale delle vendite indicazione della domanda del mercato e trend per località, mese ed anno
volume Quantitative/Continuous Valore totale delle vendite in milioni di $ misura del valore del mercato immobiliare e del suo trend
median_price Quantitative/Continuous Prezzo mediano di vendita in $ trend del valore delle case
listings Quantitative/Discrete Numero totale di annunci attivi indicazione dell’offerta del mercato immobiliare con indicazione dei momenti di vendita più alti e bassi negli anni e nei mesi
months_inventory Quantitative/Continuous Mesi necessari per vendere le inserzioni correnti indicazione della domanda/offerta

Step 2: Indici di posizione, variabilità e forma

Gli Indici di posizione, variabilità e forma per le variabili numeriche “Sales”, “Volume”, “Median Price”, “Listings” e “Months Inventory” sono presentati nella Tabella 2.

Tabella 2 - Indici di posizione, variabilità e forma per le variabili numeriche del dataset Texas Realty Insights.
mean median min max sd cv kurtosis skewness
Sales 192.3 175.5 79.0 423.0 79.651 0.41 2.7 0.7
Volume 31.0 27.1 8.2 83.5 16.651 0.54 3.2 0.9
Median Price 132665.4 134500.0 73800.0 180000.0 22662.149 0.17 2.4 -0.4
Listings 1738.0 1618.5 743.0 3296.0 752.708 0.43 2.2 0.6
Months Inventory 9.2 8.9 3.4 14.9 2.304 0.25 2.8 0.0

Le variabili numeriche sono di ordine di grandezza diverso e richiedono un qualche tipo di trasformazione (come per esempio il logaritmo) per essere confrontate. Tutte le variabili (tranne ovviamente median_price che essendo un valore mediano non tiene conto di possibili outliers) presentano una mediana più bassa della media suggerendo la presenza di una asimmetria positiva legata alla presenza di alcuni valori molto alti; questa tendenza è anche confermata dai valori di skewness positivi per sales, volume e listing.

La variabile month_inventory presenta una skewness pari a zero suggerendo invece l’assenza di valori estremi.

La variabile median_price è l’unica variabile ad evere una skewness negativa, suggerendo che i prezzi mediani di vendita con valori più bassi siano più frequenti di quelli con valori alti.

La variabilità espressa sia come deviazione standard (sd) che come coefficnete di variazione (CV) è piuttosto alta per sales, volume e listenings suggerendo una grossa fluttuazione sia del numero di vendite che dei prezzi nel tempo.

I valori di curtosi sono vicini a 3 per quasi tutte le variabili suggerendo una distribuzione vicina ad una distribuzione normale ma con “code” (o valori estremi) più ampie. Per volume la curtosi supera 3 indicando la presenza di valori più estremi rispetto ad una distribuzione normale mentre un valore positivo di skewness suggerisce che questi valori estremi siano verso prezzi più alti.

Le distribuzioni di frequenza per le variabili city, year e month sono mostrate nelle Tabelle 3, 4 e 5 rispettivamente ed indicano che i dati del mercato immobiliare sono stati raccolti in modo omogeneo nelle 4 città, nei 5 anni e nei 12 mesi. Se il numero dei cittadini fosse simile per le 4 città sarebbe possibile un confronto diretto tra gli indici delle variabili senza dover tenere conto (cioe’ pesare) per gli abitanti.

Tabella 3 - Distribuzione di frequenza per la variabile city.
Città Frequenza.Assoluta Frequenza.Relativa
Beaumont 60 0.25
Bryan-College Station 60 0.25
Tyler 60 0.25
Wichita Falls 60 0.25

Tabella 4 - Distribuzione di frequenza per la variabile year.
Year Frequenza.Assoluta Frequenza.Relativa
2010 48 0.2
2011 48 0.2
2012 48 0.2
2013 48 0.2
2014 48 0.2

Tabella 5 - Distribuzione di frequenza per la variabile month.
Month Frequenza.Assoluta Frequenza.Relativa
1 20 0.0833333
2 20 0.0833333
3 20 0.0833333
4 20 0.0833333
5 20 0.0833333
6 20 0.0833333
7 20 0.0833333
8 20 0.0833333
9 20 0.0833333
10 20 0.0833333
11 20 0.0833333
12 20 0.0833333

Step 3: Identificazione delle variabili con maggiore variabilità e asimmetria

Il coefficiente di variazione (cv) aiuta a capire quanto sia grande il valore di una deviazione standard rispetto alla sua media ed è quindi lo strumento che si utilizza per confrontare la variabilità tra diverse variabili. Nel caso del Texas, la variabile con maggiore variabilità è quella con il cv più alto (cv=0.54), cioè volume (vedi Tabella 1).

L’asimmetria statistica (skewness), mostra se i dati tendono a inclinarsi verso un lato, con una coda che si allunga più da un lato rispetto all’altro. Nel caso del Texas, la variabile con il valore (assoluto) maggiore di skewness è sempre volume come anche mostrato dal grafico di densità con asimmetria positiva nella Figura 1.

Figura 1 Density Plot di Volume

La Figura 2 mostra i grafici di densità per le variabili Sales, median_price, listings e months_inventory. I grafici indicano la presenza di più picchi suggerendo differenze tra le città o negli anni.

Figura 2 Density Plot di Sales, median_price, listings, months_inventory.

Step 4: Creazione di classi per una variabile quantitativa

La variabile quantitativa scelta come esempio è sales corrispondente al numero delle vendite. La figura 3 mostra la distribuzione di frequanza in 5 classi di uguale dimensione per sales. Le due prime classi contengono il 67% dei valori indicando una distribuzione asimmetrica con un raggruppamento verso la parte inferiore del range. Una distribuzione di questo tipo è anche indice della presenza di outliers

Figura 3 Grafico a barre della distribuzione di frequenze per la vaiabile quantitativa sales

L’indice di Gini per la vaiabile quantitativa sales è pari a 0.231 suggerendo una lieve eterogeneità della variabile stessa.

Step 5: Calcolo della probabilità

Considerando le tabelle di frequenza per le variabili city e month mostrate nelle Tabelle 2 e 4 rispettivamente, la probabilità che, presa una riga a caso del dataset Texas, esse riportino le righe seguenti sono:

La probabilità che sia estratta la riga con la città “Beaumont” è 0.25.

La probabilità che sia estratta la riga con il mese di luglio è 0.0833333.

La probabilità che sia estratta la riga con il mese di dicembre è 0.0833333.

Step 6: Creazione di nuove variabili

Il codice (uno dei possibili) per generare una nuova colonna che calcoli il prezzo medio degli immobili è riportato sotto. Per calcolare la media, la variabile volume, in milioni di dollari, è stata trasformata in dollari la styessa unit’ di misura della variabile median_price.

Questo valore indica il prezzo medio per proprietà venduta per ognuna delle 240 osservazioni. Si nota che la media è minore della mediana suggerendo la presenza di alcuni valori più bassi. Il grafico della densità di distribuzione (Figura 4) conferma questa indicazione mostrando la presenza di due picchi di cui uno più piccolo e con valore centrale più basso.

volume_mean <- round(((dati$volume)*1000000)/dati$sales,0)
dati1 <- cbind(dati, volume_mean)
head(dati1,3)
##       city year month sales volume median_price listings months_inventory
## 1 Beaumont 2010     1    83 14.162       163800     1533              9.5
## 2 Beaumont 2010     2   108 17.690       138200     1586             10.0
## 3 Beaumont 2010     3   182 28.701       122400     1689             10.6
##   volume_mean
## 1      170627
## 2      163796
## 3      157698
summary(volume_mean)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
##   97010  132939  156589  154320  173915  213234
plot(density(volume_mean),
     main = "Density plot della variabile volume", col="red")
Figura 4 Density Plot di volume.

Il codice per generare una nuova colonna che che misuri l’efficacia degli annunci di vendita (variabile listings_efficiency) è riportato sotto. I valori più alti indicano una maggiore efficienza nel trasformare un annuncio in una vednita per mese. In questo caso la media è maggiore della mediana indicando la presenza di pochi valori molto alti ed una lunga coda a destra, come indicato anche dal grafico mostrato in Figura 5. Questa nuova variabile è utile per indicare località o periodi in cui le vendite sono minori e quindi indicare dove/quando apporre delle modifiche degli gli annunci per migliorare le vendite.

listings_efficiency <- dati$sales/dati$listings
dati2 <- cbind(dati1, listings_efficiency)
head(dati2,3)
##       city year month sales volume median_price listings months_inventory
## 1 Beaumont 2010     1    83 14.162       163800     1533              9.5
## 2 Beaumont 2010     2   108 17.690       138200     1586             10.0
## 3 Beaumont 2010     3   182 28.701       122400     1689             10.6
##   volume_mean listings_efficiency
## 1      170627          0.05414220
## 2      163796          0.06809584
## 3      157698          0.10775607
summary(listings_efficiency)
##    Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
## 0.05014 0.08980 0.10963 0.11874 0.13492 0.38713
plot(density(listings_efficiency),
     main = "Density plot della variabile listings", col = "blue")

Figura 5 Density Plot di listings.

Step 7: Analisi condizionata

Usa il pacchetto dplyr o il linguaggio base di R per effettuare analisi statistiche condizionate per città, anno e mese. Genera dei summary (media, deviazione standard) e rappresenta graficamente i risultati.

La Tabella 6 riporta media e deviazione standard per le variabili Sales, median_price, listings, e months_inventory disgregati per le città.

Tabella 6 Media e deviazione standard per le variabili Sales, median_price, listings, e months_inventory disgregati per le città.

city mean_sales sd_sales mean_volume sd_volume mean_listings sd_listings mean_mon_inv sd_mon_inv
Beaumont 177.4 41.48 26.1 6.97 1679.3 91.13 10.0 1.65
Bryan-College Station 206.0 84.98 38.2 17.25 1458.1 252.53 7.7 2.25
Tyler 269.8 61.96 45.8 13.11 2905.1 226.75 11.3 1.89
Wichita Falls 116.1 22.15 13.9 3.24 909.6 73.76 7.8 0.78

La figura 6 rappresenta la media (sui mesi) del numero di vendite disgregata per città e per anno nel periodo 2010-2014.

Figura 6. Media del numero vendite disgregata per città per il periodo 2010-2014.

Step 8: Creazione di visualizzazioni con ggplot2

Il prezzo mediano delle case (Figura 7 ) varia molto tra città: Wichita Falls risulta la città con il prezzo delle case più basso mentre Bryan-College Station è quella con il prezzo più alto. Le barre dei quantili indicano una ampia variazione di prezzi probabilmente dovuta all’oscillazione del numero delle vendite nei mesi.

Figura 7. Prezzo mediano delle case disgregata per città (periodo 2010-2014).

Il totale delle vendite nelle quattro città, mostrato in Figura 8, indica infatti una certa variabilità stagionale con i mesi tardo-primaverili/estivi in cui le vendite sono più alte in generale. Whicita Fall si conferma la città con minor vendite mentre Tyler quella con le vendite maggiori.

Figura 8. Distribuzione delle vendite per mesi e città (periodo 2010-2014).

Considerando la distribuzione normalizzata del totale delle vendite nelle quattro città nei mesi, si nota un andamento abbastanza costante nei mesi tra le città (Figura 9).

Figura 9. Distribuzione normalizzata delle vendite per mesi e città (periodo 2010-2014).

Il numero delle vendite nella città di Tyler aumenta in modo esponenziale negli anni presi in considerazione (2010-2014). Un aumento si registra anche per le città di Bryan-College Station e Beaumont a partire dal 2011 ma con una inflessione nel 2014. Il numero delle vendite a Whicita Falls, decisamente inferiore a quello delle altre città, varia poco negli anni, alternando periodi con modesti incrementi (come tra il 2011 e il 2013) a periodi dove le vendite diminuiscono rispetto al periodo precedente (come ad esempio tra il 2010 e il 2011 e tra il 2013 e il 2014).

Figura 10. Totale vendite disgregato per anni e città (periodo 2010-2014).

PS. Queste informazioni non sono rappresentabili con un boxplot, come richiesto, per via della grande differenza tra i prezzi. In questo caso dovrei trasformare i dati?

Step 9: Conclusioni

I dati immobiliari del Texas nelle 4 città in esame mostrano che il numero delle vendite e il costo totale: - sono in continua crescita per la città di Tyler nei 5 anni presi in esame; - hanno valori simili per le città di Beaumont e Bryan-College Station e un trend in crescita a parte il primo anno - hanno un trend altalenante per la città di Whicita Fall che mostra anche valori decisamente più bassi. Inoltre, le vendite aumentano per tutte le città nei mesi estivi. Le variazioni associata al numero vendite e al costo totale costi appaionjo più alte per la città di Bryan-College Station mentre sono molto basee per Whicita Fall.