Średnia – to jedna z podstawowych miar statystycznych, służąca do określania wartości centralnej zbioru danych. Średnią zwykle raportujemy pod oznaczeniem litery M od angielskiego słowa mean. Może być rozumiana na kilka sposobów:
Krok 1: suma wartości = 5 + 10 + 15 + 20 + 25 = 75
Krok 2: liczba elementów = 5
(5 + 10 + 15 + 20 + 25) / 5 = 75 / 5 = 15
Krok 1: suma ważona = (5×1) + (10×2) + (15×3) + (20×4) + (25×5) = 275
Krok 2: suma wag = 1 + 2 + 3 + 4 + 5 = 15
275 / 15 = 18,33
Wzór: H = n / Σ(1/x)
Krok 1: n = 5
H = 5 / (1/5 + 1/10 + 1/15 + 1/20 + 1/25)
H = 5 / 0,4567 ≈ 10,95
Zastosowanie średniej ułatwia porównywanie różnych zbiorów danych oraz analizę trendów i wzorców. W przypadku badań naukowych, powszechnie dokonuje się obliczeń średniej arytmetycznej, w kilku podstawowych celach:
Jak widać na przykładzie, rozkład po prawej stronie jest rozkładem przypominającym rozkład normalny, gdzie średnia (M = 35,16 tys. zł) i mediana (Mdn = 35,09 tys. zł) pokrywają się, a obrazująca je przerywana linia przecina idealnie środek uzyskanych wartości. W przypadku analizy rozkładu danych po lewej (po dodaniu obserwacji), mamy typowy rozkład zarobków w którym pojawiają się wartości skrajne (osoby lepiej zarabiające). Dodanie obserwacji odstających spowodowało przesunięcie średniej z 35 tysięcy do prawie 46 tysięcy zł (nagle zarabiamy o 11 tysięcy więcej jako przeciętny pracownik!), natomiast mediana zareagowała w mniejszym stopniu (z 35,09 tys. zł do 36,27 tys. zł), zatem wartość mediany była bardziej adekwatna do rzeczywistości.
Zwykle średnią wykorzystujemy np. w teście t Studenta, jednak gdy zaobserwujemy wartości skrajne których nie możemy usunąć, alternatywą jest właśnie mediana, która jest naszą statystyką centralnej tendencji porównywanych grup w testach nieparametrycznych.Kontrola naszej próby ma istotne znaczenie w występowaniu obserwacji skrajnych, warto starać się dobierać próby w sposób kwotowy, aby dobierać reprezentatywne próbki osób gorzej lub lepiej zarabiających, odzwierciedlających ich odsetek w populacji. Dobrze wyważone próbki obserwacji pozwolą nam względnie dobrze uniknąć problemu wartości odstających, dlatego zawsze warto przyjrzeć się wstępnym rozkładom zmiennych poprzez zastosowanie statystyk opisowych.
Podsumowując średnia jest kluczowym narzędziem w statystyce, ponieważ pozwala na uogólnienie danych poprzez zredukowanie ich do jednej liczby, jednak jest ona podatna na wartości odstające. Dlatego też, oprócz średniej w analizie danych zwykle stosuje się także inne statystyki opisowe, takie jak mediana czy odchylenie standardowe, aby uzyskać pełniejszy obraz rozkładu wartości w zbiorze.