Data mining – to anglojęzyczne określenie procesu wydobywania użytecznej wiedzy, wzorców i zależności z dużych lub złożonych zbiorów danych. Najczęściej stosowanym polskim odpowiednikiem jest eksploracja danych. Celem data miningu nie jest samo przetwarzanie danych, lecz odkrywanie wzorców, które mogą służyć do opisu, klasyfikacji, predykcji lub wspomagania decyzji.
Rozwój informatyki sprawił, że możliwe stało się analizowanie zbiorów o takiej liczbie obserwacji i zmiennych, których ręczna interpretacja byłaby praktycznie niemożliwa. W eksploracji danych wykorzystuje się zarówno klasyczne metody statystyczne, jak i algorytmy uczenia maszynowego, m.in. analizę skupień, drzewa decyzyjne, regresję, sieci neuronowe czy metody wykrywania anomalii.
Proces data miningu obejmuje zwykle kilka powiązanych etapów. Najpierw dane są przygotowywane, oczyszczane i przekształcane. Następnie wybiera się odpowiednią metodę analizy, buduje model i ocenia jego jakość. Do oceny wykorzystuje się m.in. podział na zbiór treningowy i testowy, walidację krzyżową oraz odpowiednie miary jakości dopasowania lub trafności predykcji. Kluczowym elementem eksploracji danych jest sprawdzenie, czy wykryty wzorzec działa również na nowych danych, a nie tylko dobrze opisuje zbiór wykorzystany do budowy modelu.
Data mining znajduje zastosowanie m.in. w biznesie, finansach, medycynie, inżynierii i nauce. Sklepy mogą analizować miliony transakcji w celu przewidywania popytu, segmentacji klientów lub wykrywania wzorców zakupowych. W medycynie eksploracja danych może wspierać klasyfikację pacjentów, identyfikację czynników ryzyka, wykrywanie nietypowych przypadków oraz budowę modeli prognostycznych.