W ramach niniejszego projektu przeprowadzona zostanie eksploracyjna analiza danych (EDA) dotycząca sklepu rowerowego. Celem analizy jest zrozumienie charakterystyk nabywców rowerów oraz identyfikacja czynników, które mogą wpływać na decyzję o zakupie roweru. Dostępny zestaw danych obejmuje informacje o 1000 klientach, w tym szczegółowe cechy demograficzne i behawioralne, a także kategoryczną zmienną wyjściową informującą, czy dana osoba dokonała zakupu roweru. Ponieważ dane zawierają brakujące wartości (NA), konieczne będzie ich odpowiednie przetworzenie, co stanowi istotny element procesu analizy danych.
W ramach projektu zostaną wykonane następujące kroki:
Data Cleansing, Wrangling
Wizualizację Danych
Analizę Opisową
Wnioskowanie (testy statystyczne)
Podsumowanie i wnioski końcowe
Opis zmiennych:
ID – unikalny identyfikator nabywcy
Marital Status – status cywilny (np. „Married”/„Single”)
Gender – płeć (np. „Male”/„Female”)
Income – dochód
Children – liczba dzieci
Education – poziom wykształcenia (np. „Bachelors”, „Partial High School”)
Occupation – zawód (np. „Clerical”, „Professional”)
Home Owner – posiadanie domu (tak/nie)
Cars – liczba posiadanych samochodów
Commute Distance – odległość do pracy (np. „0-1 Miles”, „5-10 Miles”)
Region – region geograficzny (np. „Europe”, „Pacific”, „North America”)
Age – wiek
Purchased Bike – zakup roweru (tak/nie) – zmienna wyjściowa
| ID | Marital Status | Gender | Income | Children | Education | Occupation | Home Owner | Cars | Commute Distance | Region | Age | Purchased Bike |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 12496 | Married | Female | 40000 | 1 | Bachelors | Skilled Manual | Yes | 0 | 0-1 Miles | Europe | 42 | No |
| 24107 | Married | Male | 30000 | 3 | Partial College | Clerical | Yes | 1 | 0-1 Miles | Europe | 43 | No |
| 14177 | Married | Male | 80000 | 5 | Partial College | Professional | No | 2 | 2-5 Miles | Europe | 60 | No |
| 24381 | Single | NA | 70000 | 0 | Bachelors | Professional | Yes | 1 | 5-10 Miles | Pacific | 41 | Yes |
| 25597 | Single | Male | 30000 | 0 | Bachelors | Clerical | No | 0 | 0-1 Miles | Europe | 36 | Yes |
| 13507 | Married | Female | 10000 | 2 | Partial College | Manual | Yes | 0 | 1-2 Miles | Europe | 50 | No |
| 27974 | Single | Male | 160000 | 2 | High School | Management | NA | 4 | 0-1 Miles | Pacific | 33 | Yes |
| 19364 | Married | Male | 40000 | 1 | Bachelors | Skilled Manual | Yes | 0 | 0-1 Miles | Europe | 43 | Yes |
| 22155 | NA | Male | 20000 | 2 | Partial High School | Clerical | Yes | 2 | 5-10 Miles | Pacific | 58 | No |
| 19280 | Married | Male | NA | 2 | Partial College | Manual | Yes | 1 | 0-1 Miles | Europe | NA | Yes |
Czyszczenie danych to proces usuwania, poprawiania lub imputacji brakujących, błędnych i niezgodnych wartości w zbiorze danych. Jest kluczowe dla zapewnienia jakości analizy, ponieważ błędne lub niepełne dane mogą prowadzić do fałszywych wniosków.
## Ilość brakujących wartości: 53
Interpretacja wykresu:
Education,
Occupation, Commute_Distance,
Region, Home_Owner, Income,
Marital_Status, itp.Opis wykresu
Wykres przedstawia rozkład danych w relacji między dochodem (oś X) a wiekiem (oś Y), z uwzględnieniem statusu kompletności danych (“Obecne” lub “Brakujące”). Dane zostały podzielone na trzy regiony: - Europa - Ameryka Północna - Pacyfik
Kolor zielony oznacza dane obecne, natomiast kolor pomarańczowy wskazuje na dane brakujące.
Kluczowe obserwacje
Wnioski
1. Brakujące dane w podziale na poziom wykształcenia W pierwszej analizie dane zostały podzielone według poziomu wykształcenia, a następnie przeanalizowano rozkład brakujących wartości w różnych kategoriach. Wyniki wskazują, że:
Najwięcej brakujących wartości odnotowano w zmiennych Age (Wiek), Children (Dzieci) oraz Cars (Samochody). Szczególnie wysokie braki dotyczą grupy Partial High School oraz Graduate Degree, gdzie niektóre zmienne osiągają poziom braków przekraczający 2,5% obserwacji. Braki w zmiennych takich jak Income (Dochód) oraz Marital Status (Stan cywilny) są bardziej rozproszone, lecz zauważalne w kilku grupach wykształcenia.
2. Brakujące dane w podziale na regiony W drugiej analizie dane zostały podzielone według regionów (Europe, North America, Pacific). Obserwacje wskazują na następujące wnioski:
Najwięcej braków odnotowano w kategorii Income (Dochód) w regionie Pacific, gdzie poziom braków jest najwyższy (powyżej 2,5%). Znaczące luki występują także w kategoriach Gender (Płeć) oraz Cars (Samochody) w Europie, co sugeruje potencjalne błędy w zbieraniu danych w tym regionie.
Braki w pozostałych kategoriach, takich jak Marital Status (Stan cywilny) czy Commute Distance (Dystans dojazdu), są mniej istotne, jednak nadal widoczne w różnych regionach.
3. Brakujące dane w podziale na płeć Ostatnia analiza dotyczyła rozkładu braków danych w zależności od płci. Wyniki wskazują, że:
Najwięcej brakujących danych dotyczy osób, dla których nie określono płci (NA). Szczególnie duże luki występują w kategoriach Age (Wiek), Children (Dzieci) oraz Cars (Samochody), gdzie brakujące wartości osiągają poziom powyżej 7,5%. W grupach Female i Male braki danych są znacznie mniejsze, ale widoczne są w zmiennych Marital Status oraz Income. Możliwe, że brak określenia płci wiąże się z problemami w rejestracji danych lub ich późniejszym przetwarzaniu, co wymaga dalszej weryfikacji.
4. Wnioski i rekomendacje Na podstawie powyższej analizy można sformułować następujące wnioski:
Braki danych są szczególnie widoczne w zmiennych związanych z wiekem, dziećmi oraz dochodem, co może wpłynąć na jakość przyszłych analiz i prognoz. Warto zwrócić uwagę na grupę osób bez określonej płci (NA), gdyż w tej kategorii braki są znacznie większe niż w pozostałych grupach.
Region Pacific wyróżnia się pod względem brakujących wartości w dochodach, co może wskazywać na trudności w zbieraniu tych danych w tym obszarze. W dalszych krokach zaleca się weryfikację źródeł brakujących danych oraz ewentualne zastosowanie metod imputacji, aby poprawić kompletność zbioru danych.
## W naszym pliku nie ma już braków danych
| Zmienna | Reguła |
|---|---|
| ID | większe niż 0 |
| Marital Status | Married lub Single |
| Gender | Male lub Female |
| Income | większe niż 0 |
| Children | większe lub równe 0 |
| Education | Bachelors, Partial College, High School, Partial High School lub Graduate Degree |
| Occupation | Skilled Manual, Clerical, Professional, Manual, lub Management |
| Home Owner | Yes lub No |
| Cars | większe lub równe 0 |
| Commute Distance | 0-1 Miles, 1-2 Miles, 10+ Miles, 2-5 Miles lub 5-10 Miles |
| Region | Europe, Pacific lub North America |
| Age | większe niż 0 |
| Age | mniejsze lub równe 120 |
| Purchased Bike | Yes lub No |
| Podsumowanie |
|---|
| Wszystkie reguły zostały spełnione. Brak błędów. |
Interpretacja wyników
Wykres ilustruje zależność pomiędzy odległością od miejsca pracy (oś X, przedstawiona w milach) a liczbą osób, które zdecydowały się na zakup roweru (oś Y).
Kluczowe obserwacje
Wnioski
Interpretacja wyników
Wykres przedstawia liczbę zakupów rowerów w podziale na typ zawodu
(oś X) oraz płeć klientów. Na osi poziomej (X) uwzględniono kategorie
zawodów: Clerical, Management,
Manual, Professional, Skilled
Manual. Oś pionowa (Y) reprezentuje liczbę osób, które zakupiły
rower.
- Różowe słupki: reprezentują kobiety.
- Niebieskie słupki: reprezentują mężczyzn.
Kluczowe obserwacje
Wnioski
Wnioski
Analiza wskazuje, że nie ma znaczącej różnicy w zainteresowaniu zakupem rowerów między kobietami a mężczyznami. Obydwie grupy dokonują zakupu w niemal równych proporcjach. Można z tego wywnioskować, że strategie marketingowe powinny być kierowane w sposób równomierny do obu płci, bez konieczności istotnej personalizacji ze względu na różnice w zainteresowaniu.
Interpretacja wyników
Załączony wykres przedstawia liczbę zakupów rowerów w różnych grupach
wiekowych. Najważniejsze obserwacje to:
- Najwięcej zakupów dokonują osoby w przedziale wiekowym 30-50
lat, z wyraźnym szczytem w okolicach 40. roku życia.
- Po 50. roku życia zainteresowanie zakupem rowerów stopniowo
maleje.
- Osoby młodsze, poniżej 30. roku życia, kupują rowery w mniejszym
stopniu niż grupy średniowieku.
- Po 70. roku życia liczba zakupów jest marginalna.
Wnioski i rekomendacje
Interpretacja wyników
Drugi wykres przedstawia liczbę zakupów rowerów w trzech regionach:
Europa, Ameryka Północna i Pacyfik. Główne
obserwacje:
- Najwięcej zakupów dokonano w Ameryce Północnej, gdzie
liczba ta przekracza 500.
- Europa znajduje się na drugim miejscu, z wynikiem około 300
zakupów.
- Region Pacyfiku wykazuje najniższą liczbę zakupów, wynoszącą około
200.
Wnioski i rekomendacje
Podsumowanie
Przeprowadzona analiza pokazuje, że głównymi nabywcami rowerów są osoby w wieku 30-50 lat oraz mieszkańcy Ameryki Północnej. Dla firm zajmujących się sprzedażą rowerów kluczowe będzie dostosowanie działań marketingowych do tych grup docelowych. Jednocześnie istnieje potencjał do zwiększenia sprzedaży wśród młodszych konsumentów oraz na rynkach europejskim i pacyficznym.
Interpretacja wyników
Powyższy wykres przedstawia rozkład zarobków w dwóch grupach: osób, które zdecydowały się na zakup roweru (“Yes”), oraz tych, które roweru nie kupiły (“No”). Wykres skrzynkowy umożliwia ocenę mediany, kwartylów, a także identyfikację wartości odstających w obu grupach. - Mediany zarobków w obu grupach są zbliżone, co wskazuje na brak istotnych różnic w przeciętnych zarobkach między osobami, które kupiły rower, a tymi, które tego nie zrobiły. - Rozpiętość zarobków, reprezentowana przez wąsy skrzynki, również jest podobna dla obu grup, co sugeruje, że poziom zarobków nie jest głównym czynnikiem wpływającym na decyzję o zakupie roweru. - W obu grupach zaobserwowano wartości odstające, które wskazują na obecność osób o skrajnie wysokich zarobkach. Wartości te nie wpływają jednak na główny trend wykresu.
Wnioski i rekomendacje
Analiza wykresu nie wskazuje na wyraźną zależność między poziomem zarobków a decyzją o zakupie roweru. Z racji braku wyraźnej korelacji z zarobkami, lepiej byłby zająć się prowadzeniem kampanii marketingowych skierowanych do szerokiego spektrum klientów, nie ograniczając ich do osób o określonym poziomie dochodów.
W ramach analizy statystycznej przeprowadzono obliczenia podstawowych miar opisowych dotyczących wieku, dochodu, liczby dzieci oraz liczby posiadanych samochodów wśród klientów sklepu rowerowego.
| Statystyka | income | children | cars | age |
|---|---|---|---|---|
| Średnia | 56210.00 | 1.91 | 1.46 | 44.21 |
| Odchylenie standardowe | 31017.70 | 1.63 | 1.12 | 11.36 |
| Mediana | 60000.00 | 2.00 | 1.00 | 43.00 |
| Przycięta średnia | 53612.50 | 1.79 | 1.37 | 43.52 |
| Mediana bezwzględnego odchylenia | 29652.00 | 1.48 | 1.48 | 11.86 |
| Minimum | 10000.00 | 0.00 | 0.00 | 25.00 |
| Maksimum | 170000.00 | 5.00 | 4.00 | 89.00 |
| Zakres | 160000.00 | 5.00 | 4.00 | 64.00 |
| Skośność | 0.75 | 0.39 | 0.41 | 0.52 |
| Kurtoza | 0.51 | -1.03 | -0.40 | -0.28 |
| Błąd standardowy | 980.87 | 0.05 | 0.04 | 0.36 |
Analiza statystyk opisowych dotyczących klientów sklepu rowerowego. Analiza opiera się na zmiennych: dochody, liczba dzieci, liczba samochodów oraz wiek. Skośność na poziomie 0.75 wskazuje na lekko prawostronny rozkład dochodów, co oznacza, że większość klientów ma dochody poniżej maksymalnej wartości. Oferta powinna być zdywersyfikowana, aby przyciągnąć klientów z różnych grup dochodowych. Warto rozważyć ekonomiczne modele rowerów dla klientów z niższymi dochodami oraz modele premium dla bardziej zamożnych.
Większość klientów ma dochody oscylujące w granicach 60 000 PLN. Odchylenie standardowe równe 31 017,70 PLN wskazuje na znaczną różnorodność dochodów. Dochody mieszczą się w przedziale od 10.000 PLN do 170.000 PLN. Skośność na poziomie 0.75 wskazuje na lekko prawostronny rozkład dochodów, co oznacza, że większość klientów ma dochody poniżej maksymalnej wartości. Oferta powinna być zdywersyfikowana, aby przyciągnąć klientów z różnych grup dochodowych. Warto rozważyć ekonomiczne modele rowerów dla klientów z niższymi dochodami oraz modele premium dla bardziej zamożnych.
Większość klientów to osoby posiadające rodziny z medianą równą 2. Liczba dzieci waha się od 0 do 5, a odchylenie standardowe wynosi 1,63, co wskazuje na umiarkowaną różnorodność w tej kategorii. Sklep powinien skupić się na promowaniu oferty rodzinnej, takiej jak rowery dziecięce, foteliki rowerowe, przyczepki dla dzieci czy akcesoria dla rodzin.
Większość klientów posiada jeden samochód. Maksymalna liczba samochodów wynosi 4, a skośność 0,41 wskazuje na lekką przewagę klientów z większą liczbą pojazdów. Można promować rowery jako alternatywę dla transportu samochodowego, podkreślając korzyści ekologiczne i zdrowotne.
Oferta powinna uwzględniać potrzeby różnych grup wiekowych i wprowadzić:
Rowery trekkingowe i rekreacyjne dla osób w wieku średnim,
Lekkie i wygodne modele dla starszych klientów,
Sportowe modele dla młodszych.
Większość klientów to osoby w wieku około 40 lat. Minimalny wiek wynosi 25 lat, a maksymalny 89 lat. Odchylenie standardowe to 11,36, co wskazuje na umiarkowaną różnorodność wiekową.
Hipoteza zerowa: Dane posiadają rozkład normalny.
Hipoteza alternatywna: Dane nie posiadają rozkładu normalnego.
Wartość p jest mniejsza niż 0.05, dlatego odrzucamy hipotezę zerową na rzecz hipotezy alternatywnej. Dane nie posiadają rozkładu normalnego.
Interpretacja wyników
Histogram dla zmiennej income
Średni dochód klientów to 56 267,61, a mediana dochodu wynosi 60 000. Mediana jest nieco wyższa od średniej, co sugeruje, że wśród klientów znajduje się pewna liczba osób o niższych dochodach, które obniżają średnią wartość. Rozkład dochodów badanej grupy jest prawoskośny, co oznacza, że większość osób osiąga niższe dochody, podczas gdy wyższe dochody występują rzadziej. Tak jak zostało podane wyżej - średni dochód wynosi 56 267,61, a odchylenie standardowe to 31,017.7, co wskazuje na dużą zmienność w dochodach. Dane nie są zgodne z rozkładem normalnym.
Interpretacja wyników
Histogram dla zmiennej age
Średni wiek kupujących rowery wynosi około 44 lata, natomiast mediana wieku to 43 lata, co oznacza, że połowa klientów ma mniej niż 43 lata, a połowa więcej. To potwierdza wcześniejsze wnioski, że głównymi nabywcami rowerów są osoby w przedziale 30-50 lat. Rozkład wieku badanej grupy jest lekko prawoskośny, z koncentracją osób w wieku około 44 lat (średnia wynosi 44.21, a odchylenie standardowe to 11.36). Wartości są bardziej skupione wokół średniej, co czyni rozkład zbliżonym do normalnego, choć występują niewielkie odchylenia widoczne na ogonie wykresu po prawej stronie.
Interpretacja wyników
Histogram dla zmiennej children
Średnia liczba dzieci wynosi 1,91, a odchylenie standardowe to 1.63. Ze względu na dyskretny charakter zmiennej dane nie odpowiadają rozkładowi normalnemu. Natomiast mediana to 2, co sugeruje, że większość klientów to osoby posiadające jedno lub dwoje dzieci. Może to mieć wpływ na preferencje dotyczące wyboru roweru, np.większe zainteresowanie rowerami rodzinnymi czy dziecięcymi.
Interpretacja wyników*
Histogram dla zmiennej cars
Klienci posiadają średnio 1,46 samochodu, a odchylenie standardowe to 1.12. Rozkład tej zmiennej jest dyskretny i odbiega od kształtu rozkładu normalnego. Natomiast mediana to 1, co oznacza, że większość klientów posiada przynajmniej jedno auto. Warto zastanowić się nad strategiami promocyjnymi skierowanymi do osób, które mogą traktować rower jako alternatywny środek transportu.
Wnioski
Na podstawie analizy histogramów zmiennych income, children, cars oraz age można stwierdzić, że rozkłady badanych cech w większości różnią się od rozkładu normalnego, z wyraźną dyskretnością w przypadku liczby dzieci i samochodów, podczas gdy zmienne income i age są bardziej zbliżone do rozkładów ciągłych, choć wykazują pewne odchylenia w postaci skośności. Dane potwierdzają, że główną grupę nabywców rowerów stanowią osoby w wieku 30-50 lat, co powinno być brane pod uwagę w strategiach marketingowych. Dochód klientów jest na umiarkowanym poziomie, co oznacza, że w ofercie warto uwzględnić zarówno modele premium, jak i bardziej budżetowe rowery. Znaczna część klientów to osoby posiadające dzieci, co sugeruje potencjał w rozwijaniu segmentu rowerów rodzinnych. Wielu klientów posiada samochody, co może wskazywać na potrzebę promowania rowerów jako alternatywnego środka transportu.
Hipoteza zerowa: Dane posiadają rozkład normalny.
Hipoteza alternatywna: Dane nie posiadają rozkładu normalnego.
Wartość p jest mniejsza niż 0.05, dlatego odrzucamy hipotezę zerową na rzecz hipotezy alternatywnej. Dane nie posiadają rozkładu normalnego.
## Zmienna Wartosc_p Test_Wynik
## 1 income 5.069623e-19 Odrzucamy
## 2 children 5.871451e-26 Odrzucamy
## 3 cars 2.504447e-26 Odrzucamy
## 4 age 1.447033e-13 Odrzucamy
##
## Call:
## lm(formula = purchased_bike ~ marital_status + log(income) +
## children + cars, data = zbior)
##
## Residuals:
## Min 1Q Median 3Q Max
## -0.8239 -0.4490 -0.2082 0.4679 0.8258
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) -0.821837 0.265987 -3.090 0.00206 **
## marital_statusSingle 0.122642 0.030874 3.972 7.63e-05 ***
## log(income) 0.134907 0.025323 5.327 1.23e-07 ***
## children -0.026227 0.009944 -2.637 0.00849 **
## cars -0.106271 0.014846 -7.158 1.58e-12 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.4799 on 995 degrees of freedom
## Multiple R-squared: 0.08207, Adjusted R-squared: 0.07837
## F-statistic: 22.24 on 4 and 995 DF, p-value: < 2.2e-16
Model jest statystycznie istotny, ponieważ wartość p dla F-statystyki wynosi:
< 2.2e-16
Na tej podstawie możemy stwierdzić, że przynajmniej jedna ze zmiennych w modelu jest istotnie powiązana z decyzją o zakupie roweru.
Jeżeli dochód wzrośnie o 10% to zwiększa się prawdopobieństwo zakupu roweru o 1.35%. Przydatne byłoby rozważenie wprowadzenia oferty premium dla osób z większym dochodem.
Co interesujące posiadanie dzieci ma ujemny wpływ na zakup roweru, może to wynikać z innych priorytetów, które mają osoby z dziećmi lub potrzeby większego środka transportu jakim jest samochód, gdy ma się dziecko. Dla zwiększenia sprzedaży wśród osób z dziećmi pomocne mogłoby się okazać wprowadzenie oferty z rowerami rodzinnymi.
Posiadanie samochodu również ma negatywny wpływ na zakup roweru,w związku z zwiększeniem liczby samochodów o 1, zmniejsza się prawdopdobieństwo zakupu roweru o 10.63%. Kampania promująca rower jako alternatywny środek transportu dla samochodu podczas np. jazdy do pracy, mógłby wpłynać na zwiększenie sprzedaży wśród tej grupy osób.
Hipoteza zerowa: Dane posiadają rozkład normalny.
Hipoteza alternatywna: Dane nie posiadają rozkładu normalnego.
Wartość p jest mniejsza niż 0.05, dlatego odrzucamy hipotezę zerową na rzecz hipotezy alternatywnej. Dane nie posiadają rozkładu normalnego.
## Wyniki dla zmiennej: age
##
## Asymptotic one-sample Kolmogorov-Smirnov test
##
## data: standardized_data
## D = 0.020066, p-value = 0.8155
## alternative hypothesis: two-sided
## Wyniki dla zmiennej: car
##
## Asymptotic one-sample Kolmogorov-Smirnov test
##
## data: standardized_data
## D = 0.16993, p-value < 2.2e-16
## alternative hypothesis: two-sided
## Wyniki dla zmiennej: children
##
## Asymptotic one-sample Kolmogorov-Smirnov test
##
## data: standardized_data
## D = 0.18152, p-value < 2.2e-16
## alternative hypothesis: two-sided
##
##
## Wyniki dla zmiennej: income
##
## Asymptotic one-sample Kolmogorov-Smirnov test
##
## data: standardized_data
## D = 0.10518, p-value = 4.914e-10
## alternative hypothesis: two-sided
Intepretacja wyników
Wyniki dla zmiennej age Wartość statystyki D wynosi 0.026729, a p-wartość = 0.4726. Ponieważ p-wartość jest większa od poziomu istotności 0.05, brak podstaw do odrzucenia hipotezy zerowej. Oznacza to, że rozkład zmiennej age jest najbardziej zbliżony do rozkładu normalnego.
Wyniki dla zmiennej car Wartość statystyki D wynosi 0.1563, a p-wartość jest mniejsza niż 2.2e-16. Odrzucamy hipotezę zerową na poziomie istotności 0.05. Wynik wskazuje, że rozkład zmiennej car istotnie różni się od rozkładu normalnego.
Wyniki dla zmiennej children Wartość statystyki D wynosi 0.18055, a p-wartość jest mniejsza niż 2.2e-16. Odrzucamy hipotezę zerową na poziomie istotności 0.05. Wynik wskazuje, że rozkład zmiennej children istotnie różni się od rozkładu normalnego.
Wyniki dla zmiennej income Wartość statystyki D wynosi 0.11337, a p-wartość wynosi 1.372e-11. Odrzucamy hipotezę zerową na poziomie istotności 0.05. Wynik wskazuje, że rozkład zmiennej income istotnie różni się od rozkładu normalnego.
Wnioski
Spośród analizowanych zmiennych, tylko zmienna age wykazuje zgodność z rozkładem normalnym. Pozostałe zmienne (car, children, income) istotnie odbiegają od rozkładu normalnego, co zostało już wcześniej przedstawione w formie histogramów.