Chatterbox
TTS mã nguồn mở giấy phép MIT, thử mù có 65% người thấy hay hơn ElevenLabs
Chatterbox là mô hình TTS mã nguồn mở cấp sản xuất đầu tiên do Resemble AI ra mắt, theo giấy phép MIT, điều này khá hiếm trong lĩnh vực sinh giọng nói - phần lớn mô hình giọng nói mã nguồn mở đều có giới hạn phi thương mại hoặc chỉ dùng nghiên cứu.
Tính năng nổi bật và tình huống áp dụng
Nó có vài thông số đáng xem xét nghiêm túc. Thứ nhất, nó là TTS mã nguồn mở đầu tiên hỗ trợ kiểm soát mức độ cường điệu cảm xúc (emotion exaggeration), bạn điều chỉnh được độ mạnh của ngữ điệu, chứ không chỉ nhận được một giọng đọc đơn điệu. Thứ hai, độ trễ dưới 200 mili giây, con số này khiến nó đặt vào được các agent giọng nói thời gian thực và ứng dụng tương tác, chứ không chỉ sinh theo lô offline. Thứ ba, hỗ trợ hơn 23 ngôn ngữ.
Bản thân mô hình là 500 triệu tham số, dựa trên kiến trúc Llama cải tiến phong cách CosyVoice, huấn luyện bằng khoảng 500 nghìn giờ âm thanh đã làm sạch. Kết quả thử mù hãng công bố là: 65,3% người nghe thích Chatterbox-Turbo, 24,5% thích ElevenLabs, 10,2% không có thiên hướng - con số này phải chiết khấu mà xem (hãng tự làm thử nghiệm), nhưng ít nhất cho thấy nó đã bước vào mức dùng được.
Tổ hợp giấy phép MIT cộng triển khai tại chỗ khiến nó đặc biệt phù hợp với ba tình huống: cần sinh lượng lớn, chi phí API đám mây gánh không nổi; dữ liệu không được ra khỏi biên giới; và muốn nhúng TTS vào sản phẩm của mình nhưng không muốn bị nhà cung cấp API khóa chặt.
Cái giá là bạn phải tự xử lý triển khai, tài nguyên GPU và cập nhật mô hình. Với đội không có năng lực kỹ thuật ML, trả tiền dùng API vẫn đáng đồng tiền hơn - việc này đừng vì bốn chữ "mã nguồn mở miễn phí" mà hiểu nhầm.
Tính năng chính
- Giấy phép MIT, thương mại hoàn toàn miễn phí
- TTS mã nguồn mở đầu tiên hỗ trợ kiểm soát mức độ cường điệu cảm xúc
- Độ trễ dưới 200 mili giây, dùng được cho agent giọng nói thời gian thực
- Hỗ trợ hơn 23 ngôn ngữ
- 500 triệu tham số, huấn luyện bằng khoảng 500 nghìn giờ âm thanh
- Triển khai hoàn toàn tại chỗ hoặc trên đám mây riêng
Ưu điểm
- Giấy phép MIT khiến thương mại không tốn phí bản quyền, điều rất hiếm trong mô hình giọng nói
- Triển khai tại chỗ, dữ liệu không ra khỏi biên giới cũng không bị giới hạn tốc độ API
- Độ trễ đủ thấp, đặt vào được các tình huống tương tác thời gian thực
Nhược điểm
- Cần tự xử lý triển khai, GPU và bảo trì mô hình
- Dữ liệu thử mù chính thức do hãng tự công bố, nên giữ khoảng cách phán đoán
- Khả năng tiếng Việt cần tự kiểm chứng, chưa chắc vượt các mô hình tiếng Việt chuyên dụng
Trường hợp sử dụng
- Sinh giọng nói lượng lớn, tránh tính phí theo lượng dùng API
- Ứng dụng giọng nói của chính phủ hoặc tài chính không được ra khỏi biên giới
- Lớp đầu ra giọng nói của agent giọng nói thời gian thực
- Tính năng giọng nói offline nhúng vào sản phẩm của mình
Ghi chú biên tập
Vấn đề lớn nhất của TTS mã nguồn mở mấy năm nay luôn là giấy phép - cái hay dùng thì không được thương mại, cái được thương mại thì không hay nghe. Chatterbox dùng MIT phá bức tường này, chỉ điểm này thôi đã đáng chú ý. Nhưng đừng quên chi phí ẩn của việc tự dựng: GPU, vận hành, cập nhật, mấy cái này cộng lại chưa chắc rẻ hơn mua API.
Câu hỏi thường gặp
Có thực sự dùng thương mại được không?
Giấy phép MIT cho phép sử dụng thương mại, sửa đổi và tái phân phối, đây là một trong những giấy phép mã nguồn mở thoáng nhất. Tuy nhiên khi dùng vẫn cần chú ý: tính hợp pháp của dữ liệu huấn luyện và bản thân nội dung bạn sinh ra vẫn là trách nhiệm của người dùng, nhất là các mục đích mô phỏng giọng của người cụ thể.
Cần phần cứng thế nào mới chạy được?
Mô hình 500 triệu tham số chạy được trên GPU cấp tiêu dùng, độ trễ thực tế phụ thuộc vào card đồ họa và cấu hình lượng tử hóa. Để đạt độ trễ dưới 200 mili giây như hãng tuyên bố thường cần GPU phù hợp và cấu hình tối ưu, suy luận thuần CPU sẽ chậm hơn nhiều.
Công cụ AI liên quan
Lime Health AI
AI ambient ghi bệnh án chuyên cho chăm sóc tại nhà và chăm sóc cuối đời, ghi được cả ở nhà khách hàng
AtScale
Lớp ngữ nghĩa phổ quát lâu năm, để BI và AI dùng chung một bộ định nghĩa chỉ số
Promethium
Lớp dữ liệu doanh nghiệp truy vấn thẳng xuyên hệ thống, để AI agent nhận được câu trả lời có ngữ cảnh
bitdrift
Khả năng quan sát thời gian thực cho ứng dụng di động, log lưu trên thiết bị trước, cần mới kéo về
Supermemory
Lớp trí nhớ cho AI agent, lưu sở thích và tri thức người dùng thành một đồ thị tra được
Aloud
Nói vào màn hình là biến phản hồi thành nhiệm vụ mà coding agent hiểu được