Data Genetik SNP (Single Nucleo_de Polymorphism) terkenal "besar" dan rawan jebakan: fiturnya ribuan, sampelnya terbatas, dan praproses yang keliru bisa membuat hasil tampak hebat padahal bias (data leakage). Buku ini menyajikan resep kerja yang rapi dan mudah direplikasi untuk membangun panel SNP ringkas berbasis korelasi Pearson-mulai dari quality control(MAF, HWE, dan missingness), pengodean geno_pe menjadi angka dosage 0/1/2, sampai imputasi median berbasis data latih (TRAIN-only)agar evaluasi tetap obyektiff. Sebagai studi kasus, digunakan data HapMap yang membandingkan 120 individu dari dua kelompok populasi: keturunan Eropadan Afrika Barat (Yoruba, Nigeria). Dengan uji berulang menggunakan stra_fied Monte Carlo cross-valida_on(MCCV) dan pembanding baseline PCA, buku ini menunjukkan bahwa ke_ka sinyal korelasi cukup kuat, akurasi model dapat mendekati ?99-100%, sekaligus memberi panduan praktis berupa ambang korelasiuntuk target akurasi yang diinginkan. Kajian dalam buku ini difokuskan pada integrasi seleksi SNP berbasis Pearson dengan classifier k-nearest neighbors(k-NN), support vector machine(SVM) linier, dan random forest (RF)dalam skema evaluasi yang ketat untuk menghasilkan baselineklasifikasi yang akurat dan efisien. Buku ini sangat cocok untuk mahasiswa, peneliti, dan praktisi bioinformatika/machine learning yang ingin membangun pipeline analisis SNP yang rapi, reproducible, anti-leakage, dan tetap interpretabeldi level lokus.
Unduh untuk perangkat lain: