IMPLEMENTASI FEATURE SELECTION RELIEFF DAN KLASIFIKASI STATUS KANKER PAYUDARA MENGGUNAKAN RANDOM FOREST DAN LOGISTIC REGRESSION DENGAN INTERPRETASI SHAP

  • Fanny Krisvyanti Informatika, Universitas Multi Data Palembang
  • Abdul Rahman Informatika, Universitas Multi Data Palembang

Abstract

Kanker payudara merupakan salah satu penyakit dengan tingkat prevalensi yang tinggi dan menjadi penyebab utama kematian pada perempuan di seluruh dunia, sehingga diperlukan metode deteksi dini yang akurat dan dapat diinterpretasikan dengan baik. Namun, banyak model machine learning yang masih bersifat kurang transparan sehingga sulit dipahami dalam pengambilan keputusan klinis. Penelitian ini bertujuan untuk membangun model klasifikasi status kanker payudara yang tidak hanya memiliki performa tinggi, tetapi juga mudah diinterpretasikan. Metode yang digunakan meliputi preprocessing data berupa data cleaning, encoding, dan scaling, serta pembagian data dengan rasio 80:20. Seleksi fitur dilakukan menggunakan ReliefF untuk meningkatkan relevansi fitur terhadap kelas target. Model klasifikasi yang digunakan adalah Logistic Regression dan Random Forest, dengan evaluasi menggunakan 5-Fold Cross Validation berdasarkan metrik accuracy, precision, recall, F1-score, dan AUC-ROC. Selain itu, interpretasi model dilakukan menggunakan SHAP (SHapley Additive exPlanations) untuk menjelaskan kontribusi setiap fitur terhadap hasil prediksi. Hasil penelitian menunjukkan bahwa Logistic Regression memberikan performa terbaik dengan accuracy 83,10%, F1-score 82,86%, dan AUC-ROC 83,94%. Selain itu, SHAP mampu memberikan interpretasi yang jelas terhadap pengaruh fitur sehingga meningkatkan transparansi model. Pendekatan kombinasi ReliefF, Logistic Regression, dan SHAP terbukti efektif untuk klasifikasi kanker payudara

Downloads

Download data is not yet available.
Published
2026-09-28