Panduan Rask AI: Seluruh Proses dan Catatan Uji Coba Saya dalam Menerjemahkan Video Berbahasa Mandarin ke Sulih Suara Bahasa Jepang

Menyewa pengisi suara untuk merekam ulang tiga puluh video biayanya sangat mahal hingga bos saya terkejut. Saya menguji langsung proses lengkap Rask AI dari Mandarin ke Jepang, mulai dari jebakan hitungan per menit, batasan hak cipta suara, hingga langkah-langkah krusial yang tidak boleh dilewatkan, semuanya saya rangkum di sini.

Panduan Rask AI: Proses Lengkap dan Catatan Pengalaman Saya Menerjemahkan Video Bahasa Mandarin ke Sulih Suara Bahasa Jepang

Bulan lalu, saya membantu sebuah merek sabun handmade di Taichung menata ulang saluran YouTube mereka. Ada lebih dari 30 video berbahasa Mandarin, dan pemiliknya ingin merambah pasar Jepang. Saat saya menanyakan biaya perekrutan pengisi suara kepada dua rumah produksi pascaproduksi, tarifnya berkisar antara 2.500 hingga 4.000 NTD per menit untuk hasil akhir. Jika dikalikan 30 video dengan durasi rata-rata enam menit, total biayanya setara dengan harga satu unit sepeda motor. Saya masih ingat jelas ekspresi sang pemilik saat mendengarnya.

Sore itu juga, saya membuka Rask AI dan langsung mencobanya. Hasilnya tentu saja bukan dongeng di mana "pengisi suara manusia bisa digantikan sepenuhnya", tetapi anggarannya berhasil ditekan hingga di bawah sepersepuluh. Setelah mitra di Jepang menonton video sampelnya, mereka berkomentar, "Terdengar seperti AI, tapi masih sangat layak ditonton." Artikel ini merangkum proses, pengaturan, serta beberapa lubang jebakan yang menguras dompet yang saya alami secara langsung.

Apa Alat Ini?

Rask AI adalah platform "lokalisasi video" yang berbasis di Eropa. Fungsi utamanya adalah mengubah sulih suara video Anda yang sudah ada ke dalam bahasa lain. Perbedaannya dengan software penerjemah biasa adalah alat ini tidak hanya memberikan subtitle, melainkan menyediakan solusi ujung-ke-ujung (end-to-end): transkripsi otomatis, penerjemahan, pembuatan suara dalam bahasa target menggunakan karakteristik vokal pembicara asli, hingga opsi sinkronisasi bibir (lip-sync).

Berdasarkan halaman resminya saat ini, platform ini mendukung terjemahan lebih dari 130 bahasa (beberapa halaman anak menyebutkan 135 bahasa), sementara kloning suara (voice cloning) mendukung 32 bahasa. Bahasa Mandarin, Jepang, Korea, dan Inggris—bahasa yang paling sering digunakan merek-merek Taiwan untuk ekspansi global—semuanya tersedia di dalamnya. Angka resmi terkadang disesuaikan, jadi silakan merujuk langsung ke halaman web rask.ai saat Anda mengaksesnya.

Singkatnya, target audiens alat ini sangat jelas: mereka yang sudah memiliki pustaka video dan ingin merambah pasar bahasa asing dengan biaya rendah. YouTuber, instruktur kursus online, dan pemasar video tutorial produk adalah tiga jenis pengguna yang akan paling merasakan manfaatnya.

Apa yang Bisa Dilakukan (dan Tidak Bisa Dilakukan)

Fitur yang bisa dilakukan: Sulih suara multi-bahasa adalah inti utamanya; satu video dapat dikerjakan untuk beberapa bahasa sekaligus. Fitur kloning suara akan menangkap nada suara pembicara asli—ketika suara saya diterjemahkan ke bahasa Jepang, tingkat kemiripannya sekitar 75%, dengan intonasi yang sedikit datar namun tidak terlalu mirip robot. Fitur pengenalan multi-pembicara dapat mengenali dua hingga tiga orang dalam video dialog dan memberikan sulih suara untuk masing-masing. Sinkronisasi bibir adalah lapisan pemrosesan terpisah, di mana efek terbaik dicapai pada sudut pandang close-up wajah depan. Subtitle dapat diunduh dalam format SRT dan VTT, atau Anda bisa mengunggah SRT yang sudah Anda koreksi sendiri untuk menimpa terjemahan bawaannya. Selain itu, terdapat kamus penerjemah (translation glossary) dan prompt terjemahan, yang menjadi pemisah antara pengguna profesional dan amatir. Untuk volume besar, tersedia API untuk pemrosesan batch.

Hal yang tidak bisa dilakukan harus dijelaskan dengan jujur agar ekspektasi Anda tidak meleset. Ini bukan software penyunting video (video editor); transisi, kartu teks, B-roll, atau sampul video tidak bisa dibuat di sini. Biasanya, setelah sulih suara selesai, saya akan membawanya ke VEED.IO untuk tahap penyelesaian akhir. Alat ini tidak bisa menyelamatkan kualitas audio yang buruk. Jika audio asli Anda bergema atau suara bising lingkungan menenggelamkan suara manusia, hasil transkripsinya akan kacau, dan terjemahan dari transkrip yang salah akan menjadi sebuah bencana. Alat ini juga tidak menjamin kebenaran istilah khusus. Ini juga bukan penerjemah siaran langsung (live streaming) secara real-time, melainkan pemrosesan batch offline.

Satu hal lagi, hasil terjemahan dari bahasa Mandarin ke bahasa lain sedikit lebih kurang optimal dibandingkan dari bahasa Inggris. Pemenggalan kalimat, karakter dengan pengucapan ganda, dan cara membaca angka secara alami memang sulit. Saya pernah mengalami "32 gram" yang dibaca dengan cara yang aneh, dan beberapa istilah bahasa Hokkien (Taiwan) diterjemahkan secara paksa. Bahasa Hokkien saat ini belum didukung secara resmi.

Cara Menggunakan: Pembagian Langkah

Langkah Nol: Menyiapkan Materi (Lima hingga Sepuluh Menit)

Banyak orang melewatkan langkah ini dan akhirnya harus mengulang dari awal. Ekspor video dalam resolusi 1080p dengan suara vokal yang jernih. Jika musik latar menenggelamkan suara vokal, kecilkan volumenya atau hapus terlebih dahulu; jika Anda memiliki jalur vokal asli tanpa musik latar, gunakan jalur tersebut. Mulailah dengan menguji coba video berdurasi tiga hingga lima menit terlebih dahulu, jangan langsung mengunggah video ceramah berdurasi 30 menit di awal.

Langkah Terbuka: Membuat Proyek (Sekitar Satu Menit)

Setelah masuk (login), klik "New Project" di sudut kanan atas Dashboard, lalu seret file Anda ke dalam atau tempel tautan YouTube. Selanjutnya, atur tiga hal: Bahasa Sumber (tentukan secara manual sebagai bahasa Mandarin, jangan biarkan sistem mendeteksinya secara otomatis karena campuran Mandarin-Inggris sering salah tebak), Bahasa Target (bisa memilih lebih dari satu tetapi ditagih terpisah, centang satu dulu untuk permulaan), dan Jumlah Pembicara. Jika Anda ingin menggunakan kloning suara, pastikan sakelar voice cloning diaktifkan, jika tidak, sistem akan menggunakan suara sintesis default.

Langkah Kedua: Menunggu Proses Selesai (Video 3 Menit Membutuhkan Waktu 5–15 Menit)

Waktu tunggu tergantung pada kesibukan server; waktu siang hari di zona waktu Eropa biasanya lebih lambat. Anda akan menerima pemberitahuan email setelah selesai, jadi Anda bisa mengerjakan hal lain terlebih dahulu.

Langkah Ketiga: Mengoreksi Transkrip dan Terjemahan (Bagian yang Paling Menghabiskan Waktu)

Setelah masuk ke editor, di sebelah kiri terdapat blok subtitle per bagian, dan di sebelah kanan adalah pemutar video. Teks asli dan teks terjemahan dapat langsung diedit. Kebiasaan saya adalah membaca teks asli bahasa Mandarin dari awal hingga akhir untuk memperbaiki kata-kata yang salah tangkap oleh sistem, baru kemudian memeriksa terjemahannya. Untuk video berdurasi sepuluh menit, langkah ini memakan waktu sekitar 30 hingga 40 menit.

Setelah teks diubah, Anda harus mengeklik tombol regenerate (buat ulang) pada segmen tersebut agar audionya diperbarui. Banyak pengguna baru yang melewatkan langkah ini, sehingga hasil ekspornya masih menggunakan suara yang lama.

Langkah Keempat: Menangani Segmen yang Durasinya Melebihi Batas

Terjemahan dari bahasa Mandarin ke bahasa Jepang sering kali membuat jumlah kata membengkak lebih dari 30%, sehingga terjemahan tidak selesai diucapkan dan terpotong, atau kecepatan bicara ditekan hingga tidak jelas didengar. Editor memungkinkan Anda menyesuaikan durasi satu segmen atau mengizinkan segmen tertentu melampaui garis waktu aslinya. Pendekatan saya adalah kembali dan memperpendek teks terjemahan, yang biasanya terasa lebih natural daripada memaksakan penarikan garis waktu.

Langkah Kelima: Sinkronisasi Bibir / Lip-Sync (Opsional, Membutuhkan Putaran Proses Tambahan)

Fitur lip-sync baru diaktifkan setelah sulih suara difinalisasi. Ini adalah lapisan komputasi terpisah, dan setiap kali teks diubah, prosesnya harus diulang dari awal.

Langkah Keenam: Ekspor

Anda dapat mengunduh trek audio sulih sulara saja (yang sering saya lakukan untuk dibawa kembali ke software editor guna mencocokkan garis waktu), atau mengunduh file MP4 yang sudah digabung dengan video atau file subtitle SRT/VTT.

Kiat Lanjutan

1. Buat Kamus Terjemahan (Glossary) Sebelum Memulai. Masukkan nama merek, nama produk, nama pembicara, dan istilah teknis ke dalam Glossary. Produk klien saya disebut "Sabun Artemisia" (艾草皂). Tanpa kamus, kata ini diterjemahkan menjadi "ヨモギ石鹸" (sabun yomogi secara harfiah), tetapi setelah diatur, terjemahannya mengikuti penulisan resmi di situs web Jepang mereka. Waktu yang dihemat pada langkah ini jauh lebih banyak daripada sepuluh menit yang dihabiskan untuk membuat kamus.

2. Gunakan Prompt Terjemahan untuk Mengontrol Nada Suara. Ini adalah fitur yang menurut saya paling diremehkan. Anda dapat langsung menyalin dan memodifikasi teks berikut:

Translate into casual spoken Japanese suitable for a YouTube lifestyle channel.
Keep the brand name "XXXX" in Latin letters, do not translate it.
Use short sentences under 25 characters; avoid formal keigo except in the closing line.
Convert measurements to the metric phrasing a Japanese speaker would say aloud.

Saya telah menguji kedua cara, dan tingkat kepatuhan terhadap prompt berbahasa Inggris jelas sedikit lebih baik.

3. Buat Video Uji Coba 30 Detik Sebelum Merender Seluruh Video. Durasi sama dengan uang. Potong cuplikan 30 detik yang menampilkan wajah depan, istilah khusus, dan angka, lalu jalankan prosesnya sekali untuk mengonfirmasi nada suara dan intonasi sebelum mengirimkan video penuh. Karena saya terlalu malas melakukan langkah ini sebelumnya, saya sempat membuang kuota delapan menit secara percuma.

4. Terjemahkan Secara Eksternal Terlebih Dahulu, Lalu Unggah Kembali File SRT. Untuk proyek yang menuntut kualitas tinggi, saya biasanya mengunduh file SRT asli, menyerahkannya ke ChatGPT untuk diterjemahkan, mengoreksinya secara manual, lalu mengunggahnya kembali ke Rask untuk menghasilkan audio. Kualitas terjemahan dikendalikan oleh Anda, sementara Rask hanya bertugas memproduksi suara. Dengan meluangkan waktu tambahan 20 menit, kualitas hasil akhirnya akan naik satu tingkat.

5. Pisahkan Proses Sulih Suara dan Penyuntingan Video. Editor di platform ini ada untuk mencocokkan garis waktu, bukan untuk membuat konten. Setelah Anda mendapatkan trek audio, kembalilah ke alur kerja penyuntingan video asli Anda untuk menangani kartu teks, intro, dan rasio aspek untuk media sosial.

Catatan Penting dan Jebakan Umum

Penagihan didasarkan pada durasi video, dan setiap bahasa dihitung terpisah. Video berdurasi sepuluh menit yang diterjemahkan ke dalam tiga bahasa akan memakan kuota 30 menit. Ini adalah fakta yang baru disadari oleh kebanyakan orang setelah mereka melakukan pembayaran. Paket saat ini dibagi menjadi Uji Coba Gratis 3 menit, Creator, Creator Pro, Business, dan Enterprise. Berdasarkan angka yang diumumkan di situs web resmi, paket Creator berharga $60 per bulan atau sekitar $33 per bulan jika dibayar tahunan; Creator Pro berharga $150 per bulan atau sekitar $78 per bulan jika dibayar tahunan; paket Business berharga $750 per bulan, dengan kelebihan kuota dikenakan $3 per menit. Mata uangnya adalah USD, dan situs web resminya juga mencantumkan catatan bahwa harga akan segera disesuaikan, jadi silakan merujuk pada halaman pembayaran yang sebenarnya.

Perhitungan kuota untuk langganan tahunan dan bulanan berbeda. Langganan tahunan memberikan total kuota untuk setahun penuh, sementara langganan bulanan memberikan kuota per bulan dan biasanya tidak dapat diakumulasikan. Langganan tahunan lebih hemat jika Anda memproduksi video secara massal dalam satu kuartal, sedangkan langganan bulanan memberikan fleksibilitas yang lebih baik jika Anda merilis video secara stabil setiap minggu.

Suara dan kemiripan wajah harus memiliki izin (lisensi). Kloning suara menggunakan karakteristik vokal orang nyata; untuk mereplikasi suara seseorang, Anda harus memiliki izin tertulis dari orang tersebut. Hak kepribadian dalam hukum perdata Taiwan serta pengakuan Undang-Undang Perlindungan Data Pribadi terhadap karakteristik biometrik seperti cetak suara (voiceprint) bukanlah area di mana Anda bisa bermain abu-abu. Jika ada karyawan, tamu, atau orang lewat di dalam video, pastikan untuk memperjelas ruang lingkup otorisasi sebelum membuat versi multi-bahasa.

Lisensi musik latar tidak akan hilang hanya karena video diterjemahkan. Musik latar yang awalnya hanya diberi lisensi untuk digunakan di wilayah Taiwan akan menghadapi masalah yang sama ketika diubah ke versi bahasa Jepang dan diunggah ke Jepang.

Sinkronisasi bibir bukanlah solusi ajaib. Fitur ini layak diaktifkan untuk wawancara atau ceramah dengan satu orang menghadap ke depan; namun, untuk sudut samping, pengambilan gambar bergerak, atau beberapa orang dalam satu bingkai, bagian mulut akan menjadi kabur jika diaktifkan. Dalam situasi seperti itu, saya lebih memilih untuk hanya mengubah suaranya saja.

Perbandingan Solusi Alternatif

HeyGen — Jika Anda tidak memiliki video yang sudah jadi dan hanya memiliki naskah teks, avatar digital mereka dapat langsung menghasilkan seseorang untuk berbicara, dan antarmukanya juga lebih mudah dipelajari daripada Rask. Sangat cocok bagi tim pemasaran untuk dengan cepat menghasilkan banyak materi video berdurasi pendek.

ElevenLabs — Khusus untuk audio murni. Untuk konten seperti siniar (podcast), sulih suara (narasi), atau buku audio yang tidak memerlukan pencocokan gerakan bibir, biayanya lebih murah, detail kualitas suaranya lebih baik, dan API-nya juga lebih mudah diintegrasikan. Kekurangannya adalah Anda harus merakit sendiri alur kerja di sisi videonya.

VEED.IO — Jika kebutuhan Anda adalah subtitle multi-bahasa alih-alih sulih suara multi-bahasa, jangkauan bahasa subtitle mereka lebih luas, dan Anda dapat langsung menyelesaikan penyuntingan video di sana. Namun, jumlah bahasa sulih suara jauh lebih sedikit dibandingkan Rask.

Pembagian sederhananya: Pilih Rask untuk kedalaman sulih suara, pilih HeyGen jika ingin menampilkan orang virtual yang berbicara, pilih ElevenLabs jika hanya membutuhkan suara, dan pilih VEED jika membutuhkan penambahan subtitle sekaligus penyuntingan video.

Ulasan TheAI Akademi

Rask AI membawa konsep "lokalisasi sulih suara" ke tingkat yang paling mendalam di pasaran saat ini, namun logika penagihannya per menit akan memaksa Anda untuk membiasakan diri mengoreksi teks terlebih dahulu sebelum melakukan generate—yang sebenarnya merupakan hal baik untuk kualitas produk akhir.

Saran konkret untuk pembaca di Taiwan: Jangan terburu-buru mengambil langganan tahunan. Manfaatkan uji coba gratis 3 menit terlebih dahulu, jalankan konversi Mandarin ke Jepang menggunakan suara Anda sendiri, lalu dengarkan apakah warna suaranya mirip dan apakah nadanya bisa diterima. Setelah itu, hitung secara matang berapa menit video berbahasa asing yang "benar-benar" akan Anda produksi dalam 12 bulan ke depan, kalikan dengan jumlah bahasa, lalu bandingkan dengan paket yang tersedia. Sebagian besar merek UKM di Taiwan menggunakan kurang dari 300 menit per tahun, sehingga paket Creator tahunan sudah lebih dari cukup. Peningkatan ke paket Pro biasanya dilakukan demi sinkronisasi bibir multi-pembicara dan kolaborasi tim, bukan semata-mata karena kuotanya.

Selain itu, ada satu cara yang sangat praktis: rilis video versi subtitle terlebih dahulu ke target pasar untuk menguji respons, dan jika data menunjukkan tren positif, barulah kembali untuk membuat versi sulih suara. Terjemahan adalah biaya, tetapi validasi pasarlah yang menjadi fokus utamanya.

Sumber Data

Pertanyaan yang Sering Diajukan

Apakah Rask AI mendukung bahasa Mandarin dan Hokkien Taiwan?

Bahasa Mandarin (baik Tradisional maupun Sederhana) didukung. Halaman resmi menyatakan tersedia lebih dari 130 bahasa terjemahan dan 32 bahasa untuk kloning suara, termasuk bahasa utama seperti Mandarin, Jepang, Inggris, dan Korea yang sering digunakan untuk ekspansi global. Bahasa Hokkien Taiwan belum didukung secara resmi; istilah dalam bahasa Hokkien pada video akan diterjemahkan secara paksa sebagai bahasa Mandarin. Untuk materi seperti ini, Anda harus mengedit transkripnya secara manual terlebih dahulu. Daftar dukungan aktual tunduk pada halaman situs web resmi rask.ai saat ini.

Bagaimana sistem penagihan Rask AI? Apakah menerjemahkan ke beberapa bahasa akan dikenakan biaya tambahan?

Tagihan dihitung berdasarkan durasi video dalam menit, dan setiap bahasa target dihitung sebagai satu kuota terpisah. Video berdurasi sepuluh menit yang diterjemahkan ke dalam tiga bahasa akan menghabiskan kuota tiga puluh menit—ini adalah hal yang paling sering baru disadari pengguna setelah melakukan pembayaran. Saat ini tersedia uji coba gratis tiga menit, sementara paket berbayar dibagi menjadi Creator, Creator Pro, Business, dan Enterprise. Harga menggunakan mata uang dolar AS dan dapat berubah sewaktu-waktu sesuai kebijakan situs resmi, silakan merujuk ke halaman checkout untuk kepastiannya.

Apakah mengkloning suara orang lain dapat menimbulkan masalah hukum?

Ya. Anda harus mendapatkan persetujuan tertulis dari pemilik aslinya sebelum menyalin warna suara seseorang, termasuk untuk karyawan atau tamu yang muncul dalam video. Perlindungan hak kepribadian dalam hukum perdata serta regulasi undang-undang privasi data terkait karakteristik biometrik seperti sidik suara tetap berlaku, dan dokumen otorisasi sama sekali tidak boleh dilewatkan terutama untuk penggunaan komersial. Sebagai tambahan, cakupan lisensi musik latar pada video asli tidak otomatis diperluas ke pasar baru hanya karena Anda membuat versi bahasa asing.

Apakah sinkronisasi bibir wajib diaktifkan?

Tergantung pada jenis videonya. Untuk materi seperti wawancara atau pidato dengan sorotan wajah penuh, satu orang, dan kamera yang stabil, mengaktifkan fitur ini memberikan nilai tambah yang jelas. Namun, untuk video demonstrasi produk, pengambilan gambar sambil bergerak, atau banyak orang dalam satu frame, bagian mulut cenderung tampak kabur jika diaktifkan, yang justru mengurangi kualitas video. Selain itu, sinkronisasi bibir memerlukan lapisan pemrosesan tambahan; setiap kali teks diubah, prosesnya harus diulang dari awal. Disarankan untuk mengaktifkannya hanya setelah naskah sulih suara benar-benar final.

繁體中文版 →