# Nhân bản giọng

Source: https://docs.vieneu.io/vi/docs/sdk/voice-cloning

Nhân bản bất kỳ giọng nào từ mẫu **3–8 giây**. Không cần phiên âm, không cần fine-tune. Mẫu được khử nhiễu và cắt về ≤ 8 s tự động trước khi nhân bản.

```python
from vieneu import Vieneu

tts = Vieneu()
audio = tts.infer(
    "Đây là giọng được nhân bản tức thì.",
    ref_audio="my_voice.wav",    # mẫu tham chiếu 3–8 s
    denoise=True,                # mặc định; False nếu mẫu đã sạch
)
tts.save(audio, "cloned.wav")
```

:::info v3 không cần `ref_text`
v1/v2 cần đúng lời thoại của mẫu (`ref_text`). v3 Turbo trích speaker embedding và mã tham chiếu thay vào đó, nên không cần phiên âm.
:::

## Đăng ký một lần, dùng lại theo tên {#enrol-once-reuse-by-name}

```python
tts.add_voice("Giọng của tôi", "my_voice.wav")           # khử nhiễu + trích hồ sơ giọng một lần
audio = tts.infer("Câu này dùng giọng đã lưu.", voice="Giọng của tôi")

tts.save_voices()                                        # lưu vào tệp giọng mặc định
# tts.remove_voice("Giọng của tôi")

tts.add_voice("Giọng sạch", "already_clean.wav", denoise=False)
```

Giọng đã đăng ký dùng được ở mọi nơi giọng có sẵn dùng được, gồm `infer_batch`, `infer_stream` và chế độ hội thoại.

## Chỉ khử nhiễu {#denoise-on-its-own}

```python
wav, sr = tts.denoise("noisy.wav", out_path="clean.wav")   # 44,1 kHz mono
```

## Phong cách đọc đi theo mẫu {#reading-style-follows-the-reference}

Tham số `style` (`tin_tuc`, `doc_truyen`, …) **đã bỏ và bị bỏ qua** trên v3 Turbo. Tính cách đọc nằm sẵn trong mẫu: chọn giọng có sẵn hoặc mẫu đã đọc theo kiểu bạn muốn. Truyền `style` vẫn chạy để tương thích ngược.

## Thẻ cảm xúc (thử nghiệm) {#emotion-cues-experimental}

Thẻ trong dòng cũng chạy với giọng nhân bản: `[cười]`, `[thở dài]`, `[hắng giọng]`.

```python
audio = tts.infer("Nghe hay quá đi [cười]. Để mình nói tiếp [hắng giọng].", voice="Giọng của tôi")
```

## Backend {#backends}

`denoise`, `add_voice` và nhân bản chạy trên mọi backend, kể cả bản CPU/ONNX không cần torch (đường xử lý chạy trên onnxruntime + soxr + kaldi-native-fbank). **v3 Nano** nhân bản cùng cách; ba graph nhân bản (~110 MB) tải lần đầu dùng.

## Mẹo chọn mẫu tốt {#tips-for-a-good-reference}

- 3–8 s của một người nói, không nhạc, không giọng thứ hai.
- Nói tự nhiên, liên tục tốt hơn từ rời.
- Giữ `denoise=True` trừ khi bạn đã tự làm sạch mẫu.
- Muốn giống hơn nữa hay một phong cách đọc riêng? [Fine-tune bằng LoRA](/docs/advanced/fine-tuning) trên 10–30 phút audio.

## Giống hơn nữa: v4 trên Cloud API {#higher-fidelity-v4-on-the-cloud-api}

**VieNeu-TTS v4** độc quyền tái tạo mẫu với độ giống gần như nguyên bản. Không mở mã nguồn và chỉ có qua [Cloud API](/docs/cloud-api/overview).
