Chatterbox

TTS sumber terbuka berlesen MIT, ujian buta menunjukkan 65% orang rasa lebih sedap didengar daripada ElevenLabs

Free Canada
Lawati Laman Web ↗

Chatterbox ialah model TTS sumber terbuka bertaraf pengeluaran pertama yang dikeluarkan Resemble AI, menggunakan lesen MIT, dan ini agak jarang dalam bidang penjanaan suara — kebanyakan model suara sumber terbuka mempunyai sekatan bukan komersial atau penyelidikan.

Ciri dan senario penggunaan

Ia mempunyai beberapa spesifikasi yang berbaloi dipandang serius. Pertama, ia model TTS sumber terbuka pertama yang menyokong kawalan keterlaluan emosi (emotion exaggeration), dan anda boleh menyesuaikan tahap kekuatan nada, dan bukan hanya mendapat satu nada bacaan yang mendatar. Kedua, kependaman di bawah 200 milisaat, dan angka ini membolehkannya dimasukkan ke dalam ejen suara serta-merta dan aplikasi interaktif, dan bukan sekadar penjanaan berkelompok luar talian. Ketiga, menyokong lebih 23 bahasa.

Modelnya sendiri berparameter 500 juta, berasaskan seni bina Llama yang ditambah baik gaya CosyVoice, dilatih dengan kira-kira 500,000 jam audio yang telah dibersihkan. Keputusan ujian buta yang diumumkan pihak rasmi ialah: 65.3% pendengar lebih suka Chatterbox-Turbo, 24.5% lebih suka ElevenLabs, 10.2% tiada pilihan — angka ini perlu dilihat dengan sedikit diskaun (ujian yang dibuat sendiri oleh pengusaha), tetapi sekurang-kurangnya menunjukkan ia sudah memasuki tahap boleh guna.

Gabungan lesen MIT dan penggunaan tempatan menjadikannya amat sesuai untuk tiga situasi: keperluan penjanaan dalam jumlah besar yang kos API awannya tidak tertanggung; data yang tidak boleh keluar negara; serta yang mahu membenamkan TTS ke dalam produk sendiri tanpa mahu terikat pada pembekal API.

Harganya ialah anda perlu mengendalikan sendiri penggunaan, sumber GPU dan kemas kini model. Bagi pasukan tanpa keupayaan kejuruteraan ML, membayar untuk menggunakan API masih lebih berbaloi — jangan salah faham hanya kerana empat perkataan "sumber terbuka percuma".

Ciri Utama

  • Lesen MIT, penggunaan komersial sepenuhnya percuma
  • TTS sumber terbuka pertama yang menyokong kawalan keterlaluan emosi
  • Kependaman di bawah 200 milisaat, boleh digunakan untuk ejen suara serta-merta
  • Menyokong lebih 23 bahasa
  • 500 juta parameter, dilatih dengan kira-kira 500,000 jam audio
  • Boleh digunakan sepenuhnya secara tempatan atau awan persendirian

Kelebihan

  • Lesen MIT menjadikan penggunaan komersial berkos lesen sifar, dan ini jarang dalam model suara
  • Penggunaan tempatan, data tidak keluar negara dan tidak terjejas oleh had kadar API
  • Kependaman cukup rendah, boleh dimasukkan ke dalam senario interaksi serta-merta

Kekurangan

  • Perlu mengendalikan sendiri penggunaan, GPU dan penyelenggaraan model
  • Data ujian buta rasmi dikeluarkan sendiri oleh pengusaha, perlu memberi ruang pertimbangan
  • Prestasi bahasa tempatan perlu disahkan sendiri, belum tentu lebih baik daripada model khusus bahasa itu

Kes Penggunaan

  • Penjanaan suara dalam jumlah besar, mengelak pengiraan penggunaan API
  • Aplikasi suara kerajaan atau kewangan yang datanya tidak boleh keluar negara
  • Lapisan output suara bagi ejen suara serta-merta
  • Fungsi suara luar talian yang dibenamkan dalam produk sendiri

Nota Editor

Masalah terbesar TTS sumber terbuka beberapa tahun ini sentiasa lesen — yang sedap tidak boleh digunakan secara komersial, yang boleh digunakan secara komersial tidak sedap. Chatterbox merobohkan tembok ini dengan MIT, dan hal ini sahaja sudah berbaloi diberi perhatian. Tetapi jangan lupa kos tersembunyi hosting sendiri: GPU, penyelenggaraan, kemas kini, kesemuanya digabung belum tentu lebih murah daripada membeli API.

Soalan Lazim

Adakah ia benar-benar boleh digunakan secara komersial?

Lesen MIT membenarkan penggunaan komersial, pengubahsuaian dan pengedaran semula, dan ini salah satu lesen sumber terbuka yang paling longgar. Namun semasa menggunakannya masih perlu diberi perhatian: kesahan data latihan dan kandungan yang anda jana itu sendiri kekal sebagai tanggungjawab pengguna, terutamanya kegunaan meniru suara orang tertentu.

Perkakasan jenis apa yang diperlukan untuk menjalankannya?

Model 500 juta parameter boleh berjalan pada GPU gred pengguna, dan kependaman sebenar bergantung pada kad grafik dan tetapan kuantisasi. Untuk mencapai kependaman di bawah 200 milisaat yang didakwa pihak rasmi, biasanya memerlukan GPU yang sesuai dan tetapan yang dioptimumkan, manakala inferens CPU semata-mata akan jauh lebih perlahan.

Alat AI Berkaitan

繁體中文版 →