Modul 4: ML Dasar: Regresi & Klasifikasi
Yang akan kamu kuasai
- Konsep supervised learning
- Regresi linear & klasifikasi dengan scikit-learn
- Train/test split pertamamu
1 · Teori (~5–10 mnt baca)
Supervised learning = belajar dari contoh berlabel. Dua jenis utama: regresi (memprediksi ANGKA: harga rumah) dan klasifikasi (memprediksi KATEGORI: spam/ham). Data dibagi: data latih (model belajar) dan data uji (model dinilai pada data yang belum pernah dilihat).
from sklearn.model_selection import train_test_split from sklearn.linear_model import LinearRegression X = [[30], [45], [60], [75], [90]] # ukuran rumah (m2) y = [300, 420, 560, 700, 820] # harga (juta) X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=1) model = LinearRegression().fit(X_train, y_train) print(model.predict([[50]])) # prediksi harga rumah 50 m2
Output:
[461.11111111]Klasifikasi dengan LogisticRegression atau DecisionTree: model belajar dari fitur (panjang teks, kata kunci) → label (spam/ham). scikit-learn menyeragamkan semuanya: model = Model().fit(X, y); pred = model.predict(X_baru). Ganti algoritma = ganti 1 baris.
Fitur menentukan segalanya: model hanya sebagus datanya. Langkah standar sebelum melatih: tangani nilai kosong, ubah kategori jadi angka (one-hot encoding), skala fitur numerik (StandardScaler) bila pakai model berbasis jarak.
2 · Video
Tonton 1 video inti dari kurasi pencarian ini (gratis, di YouTube):
▶ Tonton Video Pilihan3 · Praktek
Langkah praktek: (1) load dataset Iris dari sklearn.datasets, (2) train_test_split, (3) latih LogisticRegression, (4) ukur akurasi di data uji, (5) coba ganti model DecisionTree — bandingkan.
Buka di Google Colab ↗Kuis
0/3 terjawab1. Memprediksi harga rumah (angka) termasuk…
2. Fungsi train_test_split adalah…
3. Library standar ML klasik di Python adalah…