Samosir, Fenesia (2026) IMPLEMENTASI NATURAL LANGUAGE PROCESSING UNTUK LABELING DATASET ULASAN ATTRACTION DI INDONESIA. Tugas Akhir (S1) - thesis, Universitas Bakrie.
|
Text (Cover)
00. Cover.pdf - Accepted Version Download (697kB) |
|
|
Text (BAB I-III)
01. BAB I-III.pdf - Accepted Version Restricted to Registered users only Download (1MB) | Request a copy |
|
|
Text (BAB IV)
02. BAB IV.pdf - Accepted Version Restricted to Registered users only Download (2MB) | Request a copy |
|
|
Text (BAB V)
03. BAB V.pdf - Accepted Version Restricted to Registered users only Download (412kB) | Request a copy |
|
|
Text (Daftar Pustaka)
04. BAB Daftar Pustaka.pdf - Accepted Version Download (410kB) |
|
|
Text (Lampiran)
05. Lampiran.pdf - Accepted Version Restricted to Registered users only Download (456kB) | Request a copy |
Abstract
Ketersediaan dataset ulasan wisata berlabel sentimen masih sangat terbatas, khususnya untuk ulasan attraction di Bali yang bersifat multibahasa. Kondisi ini menjadi hambatan dalam pengembangan sistem analisis sentimen yang mendukung pengelolaan pariwisata berbasis data. Penelitian ini bertujuan menghasilkan dataset ulasan attraction di Bali yang berlabel sentimen, serta mengevaluasi dan membandingkan lima pendekatan model Natural Language Processing untuk menentukan model paling efektif dalam klasifikasi sentimen multibahasa. Secara metodologis, penelitian ini dilaksanakan melalui tahapan mulai dari penyusunan dataset hingga evaluasi model klasifikasi sentimen. Data dikumpulkan melalui web scraping dari TripAdvisor dan Google Review, mencakup ulasan berbahasa Inggris, Indonesia, dan Spanyol. Dari 22.128 ulasan awal, proses pembersihan, verifikasi bahasa otomatis, dan praproses menghasilkan 10.777 ulasan. Label awal dibentuk melalui pendekatan proxy berbasis rating, dengan rating 1–2 dipetakan sebagai negatif, rating 3 sebagai netral, dan rating 4–5 sebagai positif. Dataset dibagi dengan rasio 70:15:15 menggunakan stratified sampling berdasarkan kombinasi bahasa dan sentimen. Lima model dievaluasi pada test set yang sama, yaitu XLM-RoBERTa zero-shot, mBERT-XNLI zeroshot, XLM-RoBERTa fine-tuned, mBERT fine-tuned, dan GPT prompt-based zero-shot, dengan macro F1-score sebagai metrik utama karena distribusi kelas tidak seimbang. GPT prompt-based zero-shot memperoleh macro F1-score tertinggi sebesar 70,88%, diikuti XLM-RoBERTa fine-tuned sebesar 70,74%. Namun XLM-RoBERTa fine-tuned unggul pada accuracy sebesar 89,98% dan weighted F1-score sebesar 89,68%, serta lebih layak diterapkan pada keseluruhan data secara mandiri. Model tersebut ditetapkan sebagai model terbaik dan digunakan untuk melabeli seluruh dataset, menghasilkan 10.777 ulasan berlabel sentimen dengan tingkat kesesuaian 93,28% terhadap proxy label sebagai luaran akhir penelitian.
| Item Type: | Thesis (Tugas Akhir (S1) - ) |
|---|---|
| Uncontrolled Keywords: | NLP, BERT, XLM-RoBERTa, klasifikasi sentimen, proxy label, dataset wisata, TripAdvisor, Google Review, Bali |
| Subjects: | Computer Science > Artificial intelligence (Kecerdasan buatan) Computer Science > Data mining (Penggalian data) Thesis > Thesis (S1) |
| Divisions: | Fakultas Teknik dan Ilmu Komputer > Program Studi Informatika |
| Depositing User: | Fenesia Samosir |
| Date Deposited: | 21 Sep 2026 02:31 |
| Last Modified: | 21 Sep 2026 02:31 |
| URI: | https://repository.bakrie.ac.id/id/eprint/15025 |
Actions (login required)
![]() |
View Item |

