Gabay sa Rask AI: Pag-translate ng Chinese na Video sa Japanese Voiceover, ang Aking Praktikal na Karanasan at mga Natutunan
Ang pag-hire ng voice actor para i-record ulit ang 30 video ay sobrang mahal kaya napasimangot si Boss. Sinubukan ko ang Rask AI para i-translate ang Chinese sa Japanese, at isinulat ko rito ang mga dapat iwasan tungkol sa per-minute billing, mga patakaran sa voice authorization, at mga hakbang na hinding-hindi dapat laktawan.
Rask AI Tutorial: Pagsasalin ng Bidyong Tsino sa Japanese Dubbing, Buong Proseso at Mga Natutunan Ko sa Sariling Karanasan
Noong nakaraang buwan, tinulungan ko ang isang brand ng artisanal soap sa Taichung na isaayos ang kanilang YouTube channel. Mayroon silang mahigit tatlumpung bidyong Tsino, at nais ng may-ari na subukan ang merkado sa Japan. Nagtanong ako sa dalawang post-production house at sinabing ang isang minutong natapos na obra ay nagkakahalaga ng 2,500 hanggang 4,000 NTD. Kung iisipin ang 30 bidyo na may average na anim na minuto ang haba, katumbas na ito ng presyo ng isang motorsiklo. Hanggang ngayon, tandang-tanda ko pa ang itsura ng reaksyon ngmay-ari.
Nang hapon ding iyon, binuksan ko ang Rask AI para subukan. Hindi ito kuwento ng "ganap na pagpapalit sa mga dubbing artist," ngunit naibaba nito ang budget sa mas mababa sa sampung porsyento. Pagkatapos mapanood ng aming kasosyo sa Japan ang sample video, ang sabi nila: "Halatang AI, pero kaya namang panoorin." Isinulat ko sa artikulong ito ang mismong prosesong ginawa ko, ang mga setting, at ang ilang magastos na pagkakamali para maiwasan ninyo ito.
Ano ang Tool na Ito?
Ang Rask AI ay isang plataporma para sa "video localization" na naka-base sa Europa. Ang pangunahing layunin nito ay palitan ang audio ng iyong umiiral na bidyo ng ibang wika. Ang pinagkaiba nito sa karaniwang translation software ay hindi lang ito nagbibigay ng subtitles; ginagawa nito ang buong proseso: awtomatikong transkripsyon, pagsasalin, pagbuo ng boses sa target na wika gamit ang tono ng orihinal na tagapagsalita, at pagpili ng lip-sync.
Ayon sa opisyal na pahina nito sa kasalukuyan, sinusuportahan nito ang pagsasalin sa mahigit 130 wika (may ilang sub-page na nagsasabing 135), at ang voice cloning naman ay para sa 32 wika. Narito ang Chinese, Japanese, Korean, at English—ang mga wikang madalas gamitin ng mga tatak sa Taiwan na nais lumawak sa ibang bansa. Minsan ay binabago ng opisyal ang mga numerong ito, kaya mas mabuting sundin ang kasalukuyang pahina ng rask.ai.
Sa madaling salita, malinaw ang kanilang target market: ang mga mayroon nang library ng bidyo at nais pumasok sa mga bagong merkado ng wika sa mababang gastos. Ang mga YouTuber, tagapagturo ng online course, at marketer na gumagawa ng product tutorial videos ang pinakamadaling makakita ng benepisyo rito.
Ano ang Kaya Nitong Gawin (at Hindi Kayang Gawin)
Ang mga kaya nitong gawin: Ang multi-language dubbing ang core nito, kung saan ang isang bidyo ay maaaring i-process sa ilang wika nang sabay-sabay. Kinukuha ng voice cloning ang tono ng orihinal na speaker; noong isinalin sa Japanese ang aking sariling boses, binibigyan ko ito ng 7.5 out of 10—medyo patag ang tono pero hindi naman robot. Nakikilala ng multi-speaker recognition ang dalawa o tatlong tao sa isang panayam at binibigyan sila ng kani-kaniyang boses. Ang lip-sync ay isa pang layer ng kalkulasyon, at ang frontal close-up shots ang pinakamaganda ang resulta. Maaaring i-download ang mga subtitle sa SRT o VTT, o kaya ay mag-upload ng sariling SRT na na-edit mo para palitan ang translation nito. Mayroon din itong translation dictionary at translation prompt, na siyang nagpapakita ng pagkakaiba ng mga propesyonal na user. Mayroon ding API para sa batch processing kung maramihan.
Dapat din nating linawin ang mga hindi nito kaya gawin, dahil dito madalas nadidismaya ang mga tao. Hindi ito software sa pag-edit ng bidyo; hindi nito kayang gumawa ng transitions, text cards, B-roll, o mga pabalat. Karaniwan kong dinadala ang nabuong dubbing sa VEED.IO para tapusin. Hindi nito nasasalba ang pangit na pag-record ng tunog—kung ang orihinal na audio ay may echo o ang ingay sa paligid ay mas malakas kaysa sa boses ng tao, magkakamali ang transkripsyon, at ang maling transkripsyon ay magiging trahedya kapag isinalin na. Hindi rin nito ginagarantiya na tama ang mga tiyak na termino (proper nouns). Isa pa, hindi ito real-time live translation; ito ay offline batch processing.
May isa pang punto: ang bisa ng pagsasalin mula Chinese patungo sa ibang wika ay medyo mas mababa kaysa sa English. Ang pagputol ng mga parirala, mga salitang may iba't ibang bigkas, at pagbabasa ng mga numero ay likas na mahirap. Naranasan ko nang ang "tatlumpu't dalawang gramo" ay basahin sa kakaibang paraan, pati na rin ang mga salitang Taiwanese na pinilit isalin. Sa ngayon, walang opisyal na suporta para sa wikang Taiwanese (Hokkien).
Paano Gamitin: Hakbang-hakbang
Hakbang Zero: Ayusin ang mga Materyal (Limang hanggang Sampung Minuto)
Marami ang lumalagtaft sa hakbang na ito at napipilitang umulit. Mag-output ng 1080p na bersyon na may malinaw na boses. Kung ang background music ay mas malakas kaysa sa boses, hinaan muna ito o alisin, o gamitin ang orihinal na vocal track na walang musika kung mayroon man. Pumili muna ng isang bidyo na may habang tatlo hanggang limang minuto para subukan; huwag agad maglagay ng tatlumpung minutong lektura.
Hakbang Una: Gumawa ng Proyekto (Mga Isang Minuto)
Pagka-log in, i-click ang "New Project" sa kanang itaas ng Dashboard, i-drag ang file o i-paste ang URL ng YouTube. Pagkatapos, i-set ang tatlong bagay: Source language (manual na itakda sa Chinese, huwag hayaang i-auto-detect; madalas magkamali kapag halo ang Chinese at English), Target language (maaaring mamili ng marami ngunit sisingilin nang hiwalay ang bawat isa, kaya pumili muna ng isa), at Bilang ng mga tagapagsalita (number of speakers). Kung kailangan mo ng voice cloning, siguraduhing i-on ang switch ng voice cloning, kung hindi ay ibibigay sa iyo ang default synthesized voice.
Hakbang Ikalawa: Maghintay (Mga Limang hanggang Labinlimang Minuto para sa Tatlong Minutong Bidyo)
Ang oras ng paghihintay ay depende kung gaano kaabala ang server; mas mabagal ito tuwing umaga sa Europa. Makakatanggap ka ng email notification kapag tapos na, kaya maaari ka munang gumawa ng ibang bagay.
Hakbang Ikatlo: I-verify ang Transcript at Translation (Ang Bahaging Talagang Kumakain ng Oras)
Pagpasok sa editor, makikita sa kaliwa ang mga bloke ng subtitle ayon sa bahagi, at sa kanang bahagi ang player. Maaari mong direktang baguhin ang orihinal at isinaling teksto. Ang ginagawa ko ay sinusuri muna ang orihinal na tekstong Tsino mula simula hanggang dulo upang ituwid ang mga maling narinig, bago ko tignan ang salin. Para sa sampung minutong bidyo, ang hakbang na ito ay aabot ng tatlumpu hanggang apatnapung minuto.
Matapos baguhin ang teksto, kailangang pindutin ang "Re-generate" para sa audio ng bahaging iyon upang ito ay ma-update. Maraming unang beses na gumagamit ang nakakalimutan ito, kaya ang na-export pa rin ay ang lumang boses.
Hakbang Ikaapat: Ayusin ang mga Bahaging Sumobra ang Haba
Kapag isinalin ang Chinese sa Japanese, karaniwang nadaragdagan ng mahigit tatlumpung porsyento ang bilang ng mga titik, kaya nagiging dahilan ito upang hindi matapos ang pagsasalita ng isinalin na teksto at napuputol ito, o kaya ay pinabibilis ang pagsasalita kaya hindi na maintindihan. Maaaring isaayos sa editor ang haba ng oras ng bawat bloke, o payagang lumagpas ang isang bahagi sa orihinal na timeline. Ang ginagawa ko ay binabalikan at pinaikli ang isinalin na teksto; karaniwan itong mas natural kaysa sa pilit na pag-unat sa timeline.
Hakbang Ikalima: Lip-Sync (Opsyonal, Nangangailangan ng Panibagong Pag-proseso)
Buksan lamang ang lip-sync pagkatapos ma-finalize ang dubbing. Isa itong hiwalay na operasyon, at kailangang ulitin ang proseso sa bawat pagbabago ng teksto.
Hakbang Ika-anim: I-export
Maaari mong i-download lamang ang audio track ng dubbing (ito ang madalas kong gawin para ibalik sa editing software para i-align sa timeline), o i-download ang nai-render na MP4 o SRT/VTT subtitle files.
Mga Advanced na Tip
1. Magtayo muna ng Translation Glossary bago magsimula. Ilagay ang pangalan ng brand, pangalan ng produkto, pangalan ng tagapagsalita, at mga termino sa Glossary. Ang produkto ng kliyente ko ay tinatawag na "Mugwort Soap" (艾草皂); noong walang glossary, isinalin ito bilang "ヨモギ石鹸", at noong nilagay na, sinunod na nito ang isinasaad sa kanilang opisyal na website sa Japan. Ang oras na natipid sa hakbang na ito ay mas malaki kaysa sa sampung minutong ginugol sa paggawa ng glossary.
2. Gamitin ang Translation Prompts upang makontrol ang tono. Sa tingin ko ito ang pinaka-underestimated na feature. Maaari mong direktang kopyahin at baguhin ang bahaging ito:
Translate into casual spoken Japanese suitable for a YouTube lifestyle channel.
Keep the brand name "XXXX" in Latin letters, do not translate it.
Use short sentences under 25 characters; avoid formal keigo except in the closing line.
Convert measurements to the metric phrasing a Japanese speaker would say aloud.
Sinubukan ko ang parehong paraan, at mas maganda ang pagsunod ng English prompt.
3. Maglabas muna ng tatlumpung segundong sample bago i-render ang buong bidyo. Ang bilang ng minuto ay katumbas ng pera. Mag-cut ng tatlumpung segundong clip na may mukha ng tao, mga espesyal na termino, at mga numero para patakbuhin muna; kumpirmahin muna ang boses at tono bago isalang ang buong bidyo. Dahil tinatamad akong gawin ito dati, nasayang ang walong minuto ng aking quota.
4. Isalin muna sa labas, pagkatapos ay i-upload pabalik ang SRT. Para sa mga proyektong may mataas na pamantayan sa kalidad, dina-download ko ang orihinal na SRT, ipinapasalin ito sa ChatGPT para gumawa ng bersyon, at pagkatapos ay mano-manong inaayos bago i-upload pabalik sa Rask upang buuin ang boses. Ikaw ang kumokontrol sa kalidad ng salin, at ang Rask ang bahala sa boses. Ang paggugol ng karagdagang dalawampung minuto ay magbibigay ng mas mataas na antas ng kalidad sa natapos na produkto.
5. Gawing hiwalay ang dubbing at video editing. Ang editor nito ay umiiral para sa pag-align ng timeline, hindi para sa paggawa ng nilalaman. Pagkatapos makuha ang audio track, ibalik ito sa orihinal na proseso ng pag-edit para hawakan ang text cards, intro, at social media aspect ratios.
Mga Pag-iingat at Karaniwang Pagkakamali
Ang pagsingil ay batay sa minuto ng bidyo, at hiwalay na binibilang ang bawat wika. Ang isang sampung minutong bidyo na isinalin sa tatlong wika ay katumbas ng tatlumpung minuto. Ito ang madalas hindi mamalayan ng mga tao hangga't hindi sila nagbabayad. Kasalukuyang nahahati ang mga plano sa libreng pagsubok na tatlong minuto, Creator, Creator Pro, Business, at Enterprise. Batay sa mga numerong inanunsyo sa opisyal na website, ang Creator ay nagkakahalaga ng $60 bawat buwan o humigit-kumulang $33 bawat buwan kapag taunan; ang Creator Pro ay $150 bawat buwan o humigit-kumulang $78 bawat buwan kapag taunan; at ang Business ay $750 bawat buwan, na may sobrang $3 bawat minuto para sa labis na paggamit. Ang pera ay sa US Dollars, at may nakasulat ding babala sa opisyal na website na maaaring magbago ang mga presyo, kaya sumangguni sa checkout page para sa aktwal na halaga.
Magkaiba ang paraan ng pagkalkula ng quota sa taunang pagbabayad at buwanang pagbabayad. Ang taunang pagbabayad ay nagbibigay ng kabuuang minuto para sa buong taon, samantalang ang buwanang pagbabayad ay may buwanang quota na karaniwang hindi naiipon. Mas sulit ang taunang pagbabayad kung magsisiksikan ka ng mga proyekto sa isang quarter, samantalang mas may kakayahang umangkop ang buwanang pagbabayad kung mayroon kang regular na paglabas bawat linggo.
Kailangan mong makuha ang awtorisasyon para sa boses at mukha (likeness). Ang voice cloning ay gumagamit ng totoong boses ng tao, kaya kailangan mo ng nakasulat na pahintulot mula sa taong iyon kung nais mong kopyahin ang kanilang boses. Ang mga karapatan sa personalidad sa ilalim ng batas sibil at ang pagkilala ng Personal Data Protection Act sa mga biometric na katangian tulad ng voiceprints ay hindi mga gray area na maaari mong balewalain. Kung ang bidyo ay may mga empleyado, bisita, o dumadaan, tiyaking linawin ang saklaw ng awtorisasyon bago gumawa ng mga bersyon sa iba't ibang wika.
Ang awtorisasyon para sa background music ay hindi mawawala dahil lamang sa isinalin ito. Ang background music na may pahintulot lamang para sa rehiyon ng Taiwan ay magkakaroon pa rin ng parehong isyu kapag ginawa itong bersyon sa Japanese at dinala sa Japan.
Ang lip-sync ay hindi lunas sa lahat. Sulit itong buksan para sa mga panayam at lektura na may frontal single-person shots; ngunit kung ito ay nasa tagiliran, naglalakad, o may maramihang taong magkakasama, magiging malabo ang bahagi ng bibig kapag binuksan ito. Sa mga ganoong sitwasyon, mas pipiliin ko pang baguhin na lamang ang boses.
Paghahambing ng mga Alternatibo
HeyGen — Kung wala kang handang bidyo at text script lamang ang mayroon ka, ang kanilang mga digital avatar ay direktang makakabuo ng isang taong magsasalita, at mas madaling matutunan ang interface nito kaysa sa Rask. Angkop ito para sa mga marketing team na gustong mabilis na gumawa ng maraming maikling materyal.
ElevenLabs — Para sa purong audio. Ang mga nilalamang tulad ng podcasts, voiceovers, at audiobooks na hindi nangangailangan ng lip-sync ay mas mababa ang gastos, mas magdetalye ang kalidad ng tunog, at madaling gamitin ang API. Ang kawalan nito ay kailangan mong buuin nang mag-isa ang proseso sa panig ng bidyo.
VEED.IO — Kung ang pangangailangan ay multi-language subtitles sa halip na multi-language dubbing, mas malawak ang saklaw ng mga wika ng subtitle nito, at madali mong matatapos ang pag-edit ng bidyo. Gayunpaman, mas kaunti ang mga wika para sa dubbing kumpara sa Rask.
Sa simpleng paghahati: Piliin ang Rask para sa malalim na dubbing, HeyGen kung gusto mong may lumitaw na taong magsasalita, ElevenLabs kung boses lamang ang kailangan, at VEED kung mga subtitle at pag-edit ang habol.
Puna ng TheAI學院
Dinadala ng Rask AI ang "dubbing localization" sa pinakamalalim na antas sa kasalukuyang merkado, ngunit ang lohika nitong naniningil kada minuto ay pipilitin kang magkaroon ng disiplina na mag-proofread muna bago mag-generate—na sa totoo lang ay mabuti para sa kalidad ng natapos na produkto.
Mga partikular na suhestiyon para sa mga m
Mga Madalas Itanong
Sinusuportahan ba ng Rask AI ang Chinese at Taiwanese Hokkien?
Kasama ang Chinese (Traditional at Simplified) sa mga sinusuportahan. Sinasabi sa opisyal na pahina na aabot sa mahigit 130 wika ang translation at 32 wika para sa voice cloning, kasama ang Chinese, English, Japanese, at Korean. Walang opisyal na suporta para sa Taiwanese Hokkien ngayon, kaya ang mga salitang Hokkien sa video ay ituturing na Chinese at kakaririn ang pag-translate, kaya kailangang i-edit muna ang transcript ng tao kung gagamit ng ganitong materyal. Tingnan ang opisyal na website ng rask.ai para sa pinakabagong listahan ng mga sinusuportahang wika.
Paano ang billing sa Rask AI? May dagdag na bayad ba kung marami kang i-translate na wika?
Ito ay binabantayan base sa haba ng video (minutes), at hiwalay na binibilang ang bawat target language. Ang 10 minutong video na tinranslate sa 3 wika ay ubusin ang 30 minutong quota, na siyang madalas madiskubre ng mga tao pagkatapos mag-checkout. May libreng 3 minutong trial ang opisyal, at ang bayarin ay nahahati sa Creator, Creator Pro, Business, at Enterprise. Naka-US dollars ang presyo at posibleng magbago ayon sa website, kaya mangyaring sumangguni sa checkout page.
May legal ba na problema sa pag-clone ng boses ng ibang tao?
Mayroon. Kailangan mong kumuha ng nakasulat na pahintulot mula sa tao bago kopyahin ang kanyang boses, pati na rin sa mga empleyado o bisita na lumalabas sa video. Nalalapat dito ang proteksyon ng personality rights at mga regulasyon sa biometric data tulad ng voiceprint, lalo na kapag para sa komersyal na gamit kung saan hindi pwedeng laktawan ang mga dokumento ng pahintulot. Paalala rin na ang saklaw ng lisensya para sa background music ng orihinal na video ay hindi awtomatikong lumalawak sa mga bagong merkado dahil lang ginawa itong banyagang bersyon.
Kailangan ba talagang i-on ang lip-sync?
Depende sa uri ng video. Malaking tulong ito para sa mga panayam at talumpati kung saan nakaharap ang tao, nag-iisa, at matatag ang camera; ngunit para sa mga video ng pagpapakita ng produkto, pag-shoot habang naglalakad, o maraming tao sa frame, maaaring lumabo ang bahagi ng bibig at maging dahilan pa ng pagbaba ng kalidad. Bukod dito, ang lip-sync ay karagdagang proseso ng pag-compute, kaya kailangang ulitin ang proseso kapag binago ang teksto. Inirerekomendang i-on ito pagkatapos maaprubahan ang huling voiceover.