Abstak
Fine-Tuning LLM untuk Penerjemahan Speech-To-Speech Indonesia
Sunda Berbasis Undak-Usuk Basa. Bahasa Sunda memiliki sistem tingkat tutur
Undak-Usuk Basa (Loma, Sedeng, Lemes) yang penting untuk menjaga
kesantunan, namun penerapannya oleh generasi muda terkendala keterbatasan
pemahaman kosakata dan konteks sosial, serta keterbatasan data paralel Bahasa
Indonesia–Sunda yang terverifikasi untuk setiap tingkat tutur. Penelitian terdahulu
yang melatih Transformer dari awal dengan sekitar 50.000 kalimat pun masih
menunjukkan dominasi ragam Loma sebesar 56%. Penelitian ini menerapkan fine
tuning Large Language Model (LLM) untuk menghasilkan penerjemahan Bahasa
Indonesia ke Bahasa Sunda yang mempertimbangkan Undak-Usuk Basa serta
mengintegrasikannya dalam sistem speech-to-speech translation (S2ST). Dataset
awal terdiri atas 881 kalimat paralel yang diperluas menggunakan Synonym
Substitution dan Back-Translation hingga menghasilkan 6.843 instruksi unik
setelah deduplikasi. Model Llama 3 8B Instruct diadaptasi menggunakan
Quantized Low-Rank Adaptation (QLoRA), kemudian diintegrasikan dengan
Whisper Small untuk Automatic Speech Recognition (ASR) dan gTTS untuk Text
to-Speech (TTS). Evaluasi menggunakan BLEU, METEOR, dan Human
Evaluation. Dibandingkan model dasar tanpa augmentasi data yang hanya
memperoleh BLEU 13,27 dan METEOR 53,73% pada eksperimen awal, strategi
augmentasi data meningkatkan performa menjadi BLEU 16,85 dan METEOR
54,74%, sebelum diterapkan pada dataset akhir yang menghasilkan BLEU 66,42
dan METEOR 86,77%, sedangkan Human Evaluation memperoleh Grand Mean
3,42 dari skala 4,00 dengan kategori “Sangat Baik”. Hasil tersebut menunjukkan
bahwa fine-tuning QLoRA dapat meningkatkan kemampuan model dalam
menerjemahkan tingkat tutur Sunda pada kondisi data paralel terbatas. Penelitian
selanjutnya disarankan memperluas korpus, menggunakan data audio penutur asli,
dan mengembangkan TTS khusus Bahasa Sunda, serta menguji sistem pada
berbagai konteks komunikasi nyata sehari-hari.
Kata kunci: Bahasa Sunda, fine-tuning, Large Language Model, QLoRA,
speech-to-speech translation, Undak-Usuk Basa.