# Giới Thiệu

Source: https://docs.vieneu.io/vi/docs/

VieNeu biến văn bản tiếng Việt thành giọng nói tự nhiên.

:::tip Dùng Claude, ChatGPT hay Cursor? Không cần viết code
Thêm `https://api.vieneu.io/mcp` vào trợ lý AI, đăng nhập tài khoản VieNeu, rồi
nhờ nó đọc bằng giọng Việt — audio phát ngay trong khung chat. Cursor và VS Code
cài được bằng một chạm.
**[Thiết lập trong 1 phút →](./integrations/mcp/index.md)**
:::

Để đưa VieNeu vào code của bạn, có **hai cách dùng**, và đó là hai sản phẩm khác
nhau — hãy chọn một trước.

## Bạn cần cái nào? {#which-one-do-you-want}

### ☁️ Cloud API — `api.vieneu.io`

Gửi văn bản qua HTTPS, nhận lại audio. Không cài gì, không cần GPU, không tải
model. Tính tiền theo ký tự.

Đây là thứ bạn cần nếu đang **thêm giọng Việt vào một sản phẩm**: app, website,
voice agent, quy trình lồng tiếng. Có endpoint tương thích OpenAI, nên nếu code
của bạn đang gọi `/v1/audio/speech` của OpenAI thì chuyển sang VieNeu chỉ là đổi
base URL và API key.

- **[Bắt đầu nhanh](./cloud-api/quickstart.md)** — một key, một giọng, một lời gọi, ra audio
- **[Tổng quan Cloud API](./cloud-api/overview.md)** — xác thực, tính phí, mọi endpoint
- **[Endpoint tương thích OpenAI](./cloud-api/openai-compatible.md)** — cách vào nhanh nhất

### 💻 SDK trên thiết bị — package Python

Chạy model trên chính máy của bạn. Không gọi mạng cho mỗi request, không tính
tiền theo ký tự, văn bản không rời khỏi máy — đổi lại phần cứng và cài đặt là
việc của bạn. Xem các mục **SDK** và **Cài đặt** của trang này, tóm tắt ở dưới.

:::info Hai sản phẩm riêng biệt
Cloud API và SDK chung tên và kho giọng, nhưng **không** chung giao diện: khác
cách cài, khác xác thực, khác dạng request, khác cách tính tiền. Code viết cho
bên này không chạy với bên kia, và tài liệu của bên này không áp dụng cho bên
kia. Hãy chọn đúng bên bạn đang dùng.
:::

---

## SDK trên thiết bị {#the-on-device-sdk}

**VieNeu-TTS** là hệ thống chuyển văn bản thành giọng nói (TTS) tiếng Việt tiên tiến, chạy hoàn toàn trên thiết bị với khả năng **nhân bản giọng nói tức thì**.

Chỉ cần cung cấp văn bản, hệ thống sẽ đọc lại bằng giọng nói tiếng Việt tự nhiên — hoàn toàn offline, không cần API đám mây.

## Tính Năng Nổi Bật

- **Nhân Bản Giọng Nói Tức Thì** — Nhân bản bất kỳ giọng nói nào chỉ với 3-5 giây âm thanh mẫu
- **Chuyển Đổi Ngôn Ngữ** — Chuyển đổi liền mạch giữa tiếng Việt và tiếng Anh
- **Phát Trực Tuyến Thời Gian Thực** — Bắt đầu phát âm thanh trước khi toàn bộ câu được tạo xong
- **Nhiều Backend** — PyTorch (GPU), GGUF lượng tử hoá (CPU), LMDeploy (GPU nhanh), Remote API
- **Sẵn Sàng Cho Production** — Tạo sóng âm 24 kHz, có watermark âm thanh

## Cách Hoạt Động

VieNeu-TTS sử dụng **mô hình ngôn ngữ nhân quả** để tạo giọng nói. Pipeline cốt lõi:

```
Văn bản → Chuẩn hoá → Phiên âm (eSpeak NG) → LLM tạo token âm thanh → Codec giải mã thành audio
```

1. **Chuẩn hoá văn bản** — Chuyển đổi số, viết tắt, dấu câu thành dạng nói
2. **Phiên âm** — eSpeak NG chuyển đổi văn bản thành ký hiệu phát âm
3. **Tạo token** — Transformer LLM dự đoán các token âm thanh rời rạc
4. **Giải mã âm thanh** — NeuCodec chuyển đổi token thành sóng âm 24kHz

## Các Mô Hình

| Mô Hình | Định Dạng | Chất Lượng | Tốc Độ |
|---------|-----------|------------|--------|
| VieNeu-TTS (0.5B) | PyTorch | Tốt nhất | Rất Nhanh (GPU) |
| VieNeu-TTS-0.3B | PyTorch | Tuyệt vời | Siêu Nhanh (2x) |
| GGUF Q8 | GGUF | Tuyệt vời | Nhanh (CPU) |
| GGUF Q4 | GGUF | Tốt | Rất Nhanh (CPU) |

Tất cả mô hình được lưu trữ trên [HuggingFace](https://huggingface.co/pnnbao-ump) và tự động tải về lần đầu sử dụng.

## Bắt Đầu Nhanh

```bash
git clone https://github.com/pnnbao97/VieNeu-TTS.git
cd VieNeu-TTS
uv sync
uv run vieneu-web
```

Mở `http://127.0.0.1:7860` và bắt đầu tạo giọng nói.
