Kod w R analizujący zbiór danych o winie
Dzień dobry, w celach badawczych do dnia 02.02. potrzebuję kodu w R dla poniższego zbioru danych dot. właściwości chemicznych dla 3 rodzajów wina:
https://archive.ics.uci.edu/ml/datasets/wine
Kod w R musi zawierać:
- normalizację zmiennych objaśniających w modelu
- podział zbioru na zbiór trenujący i testowy, przyjmując, że w zbiorze testowym znajdzie się 25% obserwacji
- klasteryzację za pomocą algorytmu k-średnich dla 3 grup
- sprawdzenie, czy podział na klastry pokrywa się z kategoriami przypisanymi winu
- analiza głównych składowych modelu -> odpowiedź na pytania ile składowych wyjaśnia więcej niż 80% zmienności cechy? Jaka jest trafność klasteryzacji dla tych składowych?
- dla dwóch głównych zmiennych składowych musi zostać wykonana wykonana klasteryzacja i przedstawienie wyniku na wykresie
- Odpowiedź na pytanie: Czy zmiana metryki z euklidesowej na miejską poprawia trafność klasyfikacji? Zarówno dla modelu bazowego jak i opartego na zmiennych składowych