Chuyển tới nội dung chính

Nhân bản giọng

Nhân bản bất kỳ giọng nào từ mẫu 3–8 giây. Không cần phiên âm, không cần fine-tune. Mẫu được khử nhiễu và cắt về ≤ 8 s tự động trước khi nhân bản.

from vieneu import Vieneu

tts = Vieneu()
audio = tts.infer(
"Đây là giọng được nhân bản tức thì.",
ref_audio="my_voice.wav", # mẫu tham chiếu 3–8 s
denoise=True, # mặc định; False nếu mẫu đã sạch
)
tts.save(audio, "cloned.wav")
v3 không cần ref_text

v1/v2 cần đúng lời thoại của mẫu (ref_text). v3 Turbo trích speaker embedding và mã tham chiếu thay vào đó, nên không cần phiên âm.

Đăng ký một lần, dùng lại theo tên​

tts.add_voice("Giọng của tôi", "my_voice.wav")           # khử nhiễu + trích hồ sơ giọng một lần
audio = tts.infer("Câu này dùng giọng đã lưu.", voice="Giọng của tôi")

tts.save_voices() # lưu vào tệp giọng mặc định
# tts.remove_voice("Giọng của tôi")

tts.add_voice("Giọng sạch", "already_clean.wav", denoise=False)

Giọng đã đăng ký dùng được ở mọi nơi giọng có sẵn dùng được, gồm infer_batch, infer_stream và chế độ hội thoại.

Chỉ khử nhiễu​

wav, sr = tts.denoise("noisy.wav", out_path="clean.wav")   # 44,1 kHz mono

Phong cách đọc đi theo mẫu​

Tham số style (tin_tuc, doc_truyen, …) đã bỏ và bị bỏ qua trên v3 Turbo. Tính cách đọc nằm sẵn trong mẫu: chọn giọng có sẵn hoặc mẫu đã đọc theo kiểu bạn muốn. Truyền style vẫn chạy để tương thích ngược.

Thẻ cảm xúc (thử nghiệm)​

Thẻ trong dòng cũng chạy với giọng nhân bản: [cười], [thở dài], [hắng giọng].

audio = tts.infer("Nghe hay quá đi [cười]. Để mình nói tiếp [hắng giọng].", voice="Giọng của tôi")

Backend​

denoise, add_voice và nhân bản chạy trên mọi backend, kể cả bản CPU/ONNX không cần torch (đường xử lý chạy trên onnxruntime + soxr + kaldi-native-fbank). v3 Nano nhân bản cùng cách; ba graph nhân bản (~110 MB) tải lần đầu dùng.

Mẹo chọn mẫu tốt​

  • 3–8 s của một người nói, không nhạc, không giọng thứ hai.
  • Nói tự nhiên, liên tục tốt hơn từ rời.
  • Giữ denoise=True trừ khi bạn đã tự làm sạch mẫu.
  • Muốn giống hơn nữa hay một phong cách đọc riêng? Fine-tune bằng LoRA trên 10–30 phút audio.

Giống hơn nữa: v4 trên Cloud API​

VieNeu-TTS v4 độc quyền tái tạo mẫu với độ giống gần như nguyên bản. Không mở mã nguồn và chỉ có qua Cloud API.