Chatterbox
TTS sumber terbuka berlesen MIT, ujian buta menunjukkan 65% orang rasa lebih sedap didengar daripada ElevenLabs
Chatterbox ialah model TTS sumber terbuka bertaraf pengeluaran pertama yang dikeluarkan Resemble AI, menggunakan lesen MIT, dan ini agak jarang dalam bidang penjanaan suara — kebanyakan model suara sumber terbuka mempunyai sekatan bukan komersial atau penyelidikan.
Ciri dan senario penggunaan
Ia mempunyai beberapa spesifikasi yang berbaloi dipandang serius. Pertama, ia model TTS sumber terbuka pertama yang menyokong kawalan keterlaluan emosi (emotion exaggeration), dan anda boleh menyesuaikan tahap kekuatan nada, dan bukan hanya mendapat satu nada bacaan yang mendatar. Kedua, kependaman di bawah 200 milisaat, dan angka ini membolehkannya dimasukkan ke dalam ejen suara serta-merta dan aplikasi interaktif, dan bukan sekadar penjanaan berkelompok luar talian. Ketiga, menyokong lebih 23 bahasa.
Modelnya sendiri berparameter 500 juta, berasaskan seni bina Llama yang ditambah baik gaya CosyVoice, dilatih dengan kira-kira 500,000 jam audio yang telah dibersihkan. Keputusan ujian buta yang diumumkan pihak rasmi ialah: 65.3% pendengar lebih suka Chatterbox-Turbo, 24.5% lebih suka ElevenLabs, 10.2% tiada pilihan — angka ini perlu dilihat dengan sedikit diskaun (ujian yang dibuat sendiri oleh pengusaha), tetapi sekurang-kurangnya menunjukkan ia sudah memasuki tahap boleh guna.
Gabungan lesen MIT dan penggunaan tempatan menjadikannya amat sesuai untuk tiga situasi: keperluan penjanaan dalam jumlah besar yang kos API awannya tidak tertanggung; data yang tidak boleh keluar negara; serta yang mahu membenamkan TTS ke dalam produk sendiri tanpa mahu terikat pada pembekal API.
Harganya ialah anda perlu mengendalikan sendiri penggunaan, sumber GPU dan kemas kini model. Bagi pasukan tanpa keupayaan kejuruteraan ML, membayar untuk menggunakan API masih lebih berbaloi — jangan salah faham hanya kerana empat perkataan "sumber terbuka percuma".
Ciri Utama
- Lesen MIT, penggunaan komersial sepenuhnya percuma
- TTS sumber terbuka pertama yang menyokong kawalan keterlaluan emosi
- Kependaman di bawah 200 milisaat, boleh digunakan untuk ejen suara serta-merta
- Menyokong lebih 23 bahasa
- 500 juta parameter, dilatih dengan kira-kira 500,000 jam audio
- Boleh digunakan sepenuhnya secara tempatan atau awan persendirian
Kelebihan
- Lesen MIT menjadikan penggunaan komersial berkos lesen sifar, dan ini jarang dalam model suara
- Penggunaan tempatan, data tidak keluar negara dan tidak terjejas oleh had kadar API
- Kependaman cukup rendah, boleh dimasukkan ke dalam senario interaksi serta-merta
Kekurangan
- Perlu mengendalikan sendiri penggunaan, GPU dan penyelenggaraan model
- Data ujian buta rasmi dikeluarkan sendiri oleh pengusaha, perlu memberi ruang pertimbangan
- Prestasi bahasa tempatan perlu disahkan sendiri, belum tentu lebih baik daripada model khusus bahasa itu
Kes Penggunaan
- Penjanaan suara dalam jumlah besar, mengelak pengiraan penggunaan API
- Aplikasi suara kerajaan atau kewangan yang datanya tidak boleh keluar negara
- Lapisan output suara bagi ejen suara serta-merta
- Fungsi suara luar talian yang dibenamkan dalam produk sendiri
Nota Editor
Masalah terbesar TTS sumber terbuka beberapa tahun ini sentiasa lesen — yang sedap tidak boleh digunakan secara komersial, yang boleh digunakan secara komersial tidak sedap. Chatterbox merobohkan tembok ini dengan MIT, dan hal ini sahaja sudah berbaloi diberi perhatian. Tetapi jangan lupa kos tersembunyi hosting sendiri: GPU, penyelenggaraan, kemas kini, kesemuanya digabung belum tentu lebih murah daripada membeli API.
Soalan Lazim
Adakah ia benar-benar boleh digunakan secara komersial?
Lesen MIT membenarkan penggunaan komersial, pengubahsuaian dan pengedaran semula, dan ini salah satu lesen sumber terbuka yang paling longgar. Namun semasa menggunakannya masih perlu diberi perhatian: kesahan data latihan dan kandungan yang anda jana itu sendiri kekal sebagai tanggungjawab pengguna, terutamanya kegunaan meniru suara orang tertentu.
Perkakasan jenis apa yang diperlukan untuk menjalankannya?
Model 500 juta parameter boleh berjalan pada GPU gred pengguna, dan kependaman sebenar bergantung pada kad grafik dan tetapan kuantisasi. Untuk mencapai kependaman di bawah 200 milisaat yang didakwa pihak rasmi, biasanya memerlukan GPU yang sesuai dan tetapan yang dioptimumkan, manakala inferens CPU semata-mata akan jauh lebih perlahan.
Alat AI Berkaitan
Lime Health AI
Rekod perubatan AI persekitaran khas untuk penjagaan di rumah dan penjagaan paliatif, boleh merekod di rumah pelanggan sekalipun
AtScale
Lapisan semantik universal jenama lama, membolehkan BI dan AI berkongsi definisi metrik yang sama
Promethium
Lapisan data perusahaan yang menanya terus merentas sistem, membolehkan ejen AI mendapat jawapan berkonteks
bitdrift
Kebolehcerapan masa nyata untuk aplikasi mudah alih, log disimpan dahulu pada peranti dan hanya diambil apabila perlu
Supermemory
Lapisan memori untuk ejen AI, menyimpan pilihan dan pengetahuan pengguna sebagai graf yang boleh dicari
Aloud
Bercakap ke skrin, lalu maklum balas disusun menjadi tugasan yang difahami coding agent