PENERAPAN ALGORITMA BERT UNTUK DETEKSI KOMENTAR SPAM JUDI ONLINE DI YOUTUBE

Fahri Akbar Rosid Asro, Julius Panda Putra Naibaho, Alex De Kweldju

Abstract


Penyebaran komentar spam yang mengandung promosi perjudian daring di YouTube semakin meningkat dan mengganggu kualitas interaksi digital. Deteksi manual tidak lagi efektif karena volume komentar yang tinggi dan kompleksitas gaya bahasa yang digunakan. Penelitian ini bertujuan untuk menerapkan model In-doBERT yang telah di‑fine‑tune guna mendeteksi komentar spam bertema perjudian dalam bahasa Indonesia. Data mentah diperoleh melalui scraping sebanyak 9.056 komentar dari 14 video kategori game. Setelah dilakukan pra‑pemrosesan yang meliputi pembersihan teks, normalisasi, tokenisasi, penghapusan stopword, dan stemming, 263 komentar dihapus sehingga tersisa 8.793 komentar bersih untuk pelabelan. Komentar dikategorikan secara semi‑otomatis ke dalam dua kelas, spam dan non‑spam, dengan bantuan pencocokan kata kunci dan validasi manual. Model IndoBERT dilatih menggunakan pendekatan transfer learning dan dievaluasi dengan metrik akurasi, presisi, recall, dan F1‑score. Hasil eksperimen menunjukkan akurasi sekitar 99,54% (atau dibulatkan menjadi 99,6%) dan F1‑score 1,00, dengan hanya delapan kesalahan klasifikasi dari 1.759 data uji. Vis-ualisasi melalui wordcloud dan histogram mengungkap pola domi-nan istilah promosi dalam komentar spam. Temuan ini menunjukkan bahwa pendekatan berbasis transformer efektif dalam memahami konteks semantik, meskipun disamarkan melalui eufemisme atau kode, serta dapat diandalkan untuk meningkatkan akurasi sistem moderasi otomatis pada platform digital.

Keywords


Deteksi Spam; IndoBERT; Judi Online; Komentar YouTube; Pembelajaran Mesin

Full Text:

PDF

References


L. He, X. Wang, H. Chen, dan G. Xu. (2022). Online spam review detection: A survey of literature. Human-Centric Intelligent Systems, 2, hal. 14–30. [Online]. Tersedia: https://doi.org/10.1007/s44230-022-00001-3

Google. (2023). YouTube Transparency Report: Community Guidelines Enforcement. [Online]. Tersedia: https://transparencyreport.google.com/youtube-policy/removals

The Guardian. (24 Okt. 2024). Gambling poses huge global threat to public health, experts warn. The Guardian. [Online]. Tersedia: https://www.theguardian.com/society/2024/oct/24/gambling-poses-huge-global-threat-to-public-health-experts-warn-lancet-commission

Hendarto dan R. S. Handayani. (2024). Pencegahan kejahatan siber terkait distribusi perjudian online di Indonesia dalam rangka mewujudkan keamanan dan ketertiban masyarakat. Syntax Admiration, vol. 5, no. 5, hal. 1542–1558. DOI: 10.46799/jsa.v5i5.1136

Y. Zhang dan L. Wang. (2023). Deep learning to filter SMS spam. Journal of Artificial Intelligence Research, vol. 15, no. 2, hal. 123–135. [Online]. Tersedia: https://doi.org/10.1016/j.future.2019.09.001

Y. Lukito. (2017). Deteksi komentar spam Bahasa Indonesia pada Instagram menggunakan naïve bayes. Ultimatics: Jurnal Teknik Informatika, vol. 9, no. 1, hal. 50–58. [Online]. Tersedia: https://doi.org/10.31937/ti.v9i1.564

C. Dwinata dan A. F. Hidayatullah. (2021). Kajian literatur: Identifikasi konten negatif pada Twitter dengan deep learning. AUTOMATA, vol. 2, no. 1.

S. Pane dan D. J. W. Ikram. (2023). Deteksi spam bot pada komentar YouTube: Tinjauan literatur sistematis. Computer Science Research and Its Development Journal, vol. 15, no. 2, hal. 103–123.

R. Y. Pratama dan P. F. Ariyani. (2024). Analisis sentimen YouTube terhadap kebijakan Kominfo tentang pemblokiran game kekerasan dengan Naive Bayes. Prosiding SENAFTI, vol. 3, no. 2, hal. 743–752.

T. Sahmoud dan M. Mikki. (2022). Spam detection using BERT. [Online]. Tersedia: https://doi.org/10.48550/arXiv.2206.02443

J. Devlin, M.-W. Chang, K. Lee, dan K. Toutanova. (2018). BERT: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805. [Online]. Tersedia: https://aclanthology.org/N19-1423/

N. Nurwanda, N. Suarna, dan W. Prihartono. (2024). Penerapan NLP dalam analisis sentimen pengguna Telegram di Playstore. JATI, vol. 8, no. 2, hal. 1841–1846. [Online]. Tersedia: https://doi.org/10.36040/jati.v8i2.8469

Z. A. Sriyanti, D. S. Y. Kartika, dan A. R. E. Najaf. (2024). Implementasi model BERT pada analisis sentimen pengguna Twitter terhadap aksi boikot produk Israel. J. Inform. dan Tek. Elektro Terapan, vol. 12, no. 3. [Online]. Tersedia: http://dx.doi.org/10.23960/jitet.v12i3.4743

Jocelynne, I. L. Wijayakusuma, dan L. P. I. Harini. (2025). Detection of political hoax news using fine-tuning IndoBERT. J. Appl. Informatics Comput., vol. 9, no. 2, hal. 354–360. [Online]. Tersedia: https://www.researchgate.net/publication/391287351

J. Gui, Y. Zhou, K. Yu, dan X. Wu. (2024). PSC-BERT: A spam identification and classification algorithm via prompt learning and spell check. Knowledge-Based Systems, 112266. [Online]. Tersedia: https://doi.org/10.1016/j.knosys.2024.112266

Y. Shang, M. Liu, T. Zhao, dan J. Zhou. (2021). T-BERT: A spam review detection model combining group intelligence and personalized sentiment information. J. Inf. Secur. Appl., vol. 60, 102868.

S. Tida dan S. Hsu. (2022). Universal spam detection using transfer learning of BERT model. [Online]. Tersedia: https://doi.org/10.48550/arXiv.2202.03480

H. Ikuma dan R. Murakami. (2022). Filtering relevant comments in social media using deep learning. Dipresentasikan di WI-IAT 2022. [Online]. DOI: 10.1109/WI-IAT55865.2022.00056

Agrawal et al. (2022). BERT-based transfer-learning approach for nested named-entity recognition using joint labeling. Applied Sciences, vol. 12, no. 3, hal. 976. DOI: 10.48550/arXiv.2302.10204

H. D. Sebastian, H. D. Purnomo, dan I. Sembiring. (2022). BERT for natural language processing in Bahasa Indonesia. dalam ICICyTA, hal. 204–209. DOI: 10.1109/ICICyTA57421.2022.10038230

S. Ouni, F. Fkih, dan M. N. Omri. (2022). BERT- and CNN-based TOBEAT approach for unwelcome tweets detection. Social Network Analysis and Mining. [Online]. Tersedia: https://doi.org/10.1007/s13278-022-00970-0

H. Raj, Y. Weihong, S. K. Banbhrani, dan S. P. Dino. (2018). LSTM based short message service (SMS) modeling for spam classification. ACM Int. Conf. Proc. Series. [Online]. Tersedia: https://doi.org/10.1145/3231884.3231895

J. Salminen et al. (2019). Developing an online hate classifier for multiple social media platforms. Hum. Cent. Comput. Inf. Sci. [Online]. Tersedia: https://doi.org/10.1186/s13673-019-0205-6

S. Jamal, H. Wimmer, dan I. H. Sarker. (2023). An improved transformer-based model for detecting phishing, spam, and ham: A large language model approach. Research Square. [Online]. Tersedia: https://doi.org/10.21203/rs.3.rs-2742083/v1

S. Rahmawati. (2023). Implementasi algoritma BERT untuk analisis sentimen ulasan pengguna aplikasi Peduli Lindungi. Skripsi, Universitas Teknologi Digital Indonesia. [Online]. Tersedia: http://eprints.utdi.ac.id/id/eprint/9863

M. Arifin dan D. Mahdiana. (2024). Implementation of deep learning models in hate speech detection on Twitter using an NLP approach. J. Tek. Inform. (JUTIF), vol. 5, no. 5, hal. 1257–1266. [Online]. Tersedia: https://doi.org/10.52436/1.jutif.2024.5.5.2043

F. Jáñez-Martino, E. Fidalgo, S. González-Martınez, dan J. Velasco Mata. (2020). Classification of Spam Emails through Hierarchical Clustering and Supervised Learning. CoRR, abs/2005.08773. [Online]. Tersedia: https://arxiv.org/pdf/2005.08773v2

M. B. M. Amin et al. (2024). Deteksi spam berbahasa Indonesia berbasis teks menggunakan model BERT. Jurnal Teknologi Informasi dan Ilmu Komputer, vol. 11, no. 6, hal. 1291–1302. [Online]. Tersedia: https://doi.org/10.25126/jtiik.2024118121

D. Putra dan A. Wibowo. (2020). Prediksi Keputusan Minat Penjurusan Siswa SMA Yadika 5 Menggunakan Algoritma Naïve Bayes. dalam Prosiding Seminar Nasional Riset Information Science (SENARIS), vol. 2, hal. 84–92.




DOI: https://doi.org/10.29100/jipi.v11i2.8122

Refbacks

  • There are currently no refbacks.


Creative Commons License
This work is licensed under a Creative Commons Attribution-ShareAlike 4.0 International License.

JIPI (Jurnal Ilmiah Penelitian dan Pembelajaran Informatika)
ISSN 2540-8984
Published by
Prodi Pendidikan Teknologi Informasi
Universitas Bhinneka PGRI

Website :https://jurnal.stkippgritulungagung.ac.id/index.php/jipi/index
Email: jipistkippti@gmail.com


Creative Commons License
This work is licensed under a Creative Commons Attribution-ShareAlike 4.0 International License.