Nhân bản giọng
Nhân bản bất kỳ giọng nào từ mẫu 3–8 giây. Không cần phiên âm, không cần fine-tune. Mẫu được khử nhiễu và cắt về ≤ 8 s tự động trước khi nhân bản.
from vieneu import Vieneu
tts = Vieneu()
audio = tts.infer(
"Đây là giọng được nhân bản tức thì.",
ref_audio="my_voice.wav", # mẫu tham chiếu 3–8 s
denoise=True, # mặc định; False nếu mẫu đã sạch
)
tts.save(audio, "cloned.wav")
ref_textv1/v2 cần đúng lời thoại của mẫu (ref_text). v3 Turbo trích speaker embedding và mã tham chiếu thay vào đó, nên không cần phiên âm.
Đăng ký một lần, dùng lại theo tên
tts.add_voice("Giọng của tôi", "my_voice.wav") # khử nhiễu + trích hồ sơ giọng một lần
audio = tts.infer("Câu này dùng giọng đã lưu.", voice="Giọng của tôi")
tts.save_voices() # lưu vào tệp giọng mặc định
# tts.remove_voice("Giọng của tôi")
tts.add_voice("Giọng sạch", "already_clean.wav", denoise=False)
Giọng đã đăng ký dùng được ở mọi nơi giọng có sẵn dùng được, gồm infer_batch, infer_stream và chế độ hội thoại.
Chỉ khử nhiễu
wav, sr = tts.denoise("noisy.wav", out_path="clean.wav") # 44,1 kHz mono
Phong cách đọc đi theo mẫu
Tham số style (tin_tuc, doc_truyen, …) đã bỏ và bị bỏ qua trên v3 Turbo. Tính cách đọc nằm sẵn trong mẫu: chọn giọng có sẵn hoặc mẫu đã đọc theo kiểu bạn muốn. Truyền style vẫn chạy để tương thích ngược.
Thẻ cảm xúc (thử nghiệm)
Thẻ trong dòng cũng chạy với giọng nhân bản: [cười], [thở dài], [hắng giọng].
audio = tts.infer("Nghe hay quá đi [cười]. Để mình nói tiếp [hắng giọng].", voice="Giọng của tôi")
Backend
denoise, add_voice và nhân bản chạy trên mọi backend, kể cả bản CPU/ONNX không cần torch (đường xử lý chạy trên onnxruntime + soxr + kaldi-native-fbank). v3 Nano nhân bản cùng cách; ba graph nhân bản (~110 MB) tải lần đầu dùng.
Mẹo chọn mẫu tốt
- 3–8 s của một người nói, không nhạc, không giọng thứ hai.
- Nói tự nhiên, liên tục tốt hơn từ rời.
- Giữ
denoise=Truetrừ khi bạn đã tự làm sạch mẫu. - Muốn giống hơn nữa hay một phong cách đọc riêng? Fine-tune bằng LoRA trên 10–30 phút audio.
Giống hơn nữa: v4 trên Cloud API
VieNeu-TTS v4 độc quyền tái tạo mẫu với độ giống gần như nguyên bản. Không mở mã nguồn và chỉ có qua Cloud API.