Chuyển tới nội dung chính

Giới Thiệu

VieNeu biến văn bản tiếng Việt thành giọng nói tự nhiên.

Dùng Claude, ChatGPT hay Cursor? Không cần viết code

Thêm https://api.vieneu.io/mcp vào trợ lý AI, đăng nhập tài khoản VieNeu, rồi nhờ nó đọc bằng giọng Việt — audio phát ngay trong khung chat. Cursor và VS Code cài được bằng một chạm. Thiết lập trong 1 phút →

Để đưa VieNeu vào code của bạn, có hai cách dùng, và đó là hai sản phẩm khác nhau — hãy chọn một trước.

Bạn cần cái nào?​

☁️ Cloud API — api.vieneu.io​

Gửi văn bản qua HTTPS, nhận lại audio. Không cài gì, không cần GPU, không tải model. Tính tiền theo ký tự.

Đây là thứ bạn cần nếu đang thêm giọng Việt vào một sản phẩm: app, website, voice agent, quy trình lồng tiếng. Có endpoint tương thích OpenAI, nên nếu code của bạn đang gọi /v1/audio/speech của OpenAI thì chuyển sang VieNeu chỉ là đổi base URL và API key.

💻 SDK trên thiết bị — package Python​

Chạy model trên chính máy của bạn. Không gọi mạng cho mỗi request, không tính tiền theo ký tự, văn bản không rời khỏi máy — đổi lại phần cứng và cài đặt là việc của bạn. Xem các mục SDK và Cài đặt của trang này, tóm tắt ở dưới.

Hai sản phẩm riêng biệt

Cloud API và SDK chung tên và kho giọng, nhưng không chung giao diện: khác cách cài, khác xác thực, khác dạng request, khác cách tính tiền. Code viết cho bên này không chạy với bên kia, và tài liệu của bên này không áp dụng cho bên kia. Hãy chọn đúng bên bạn đang dùng.


SDK trên thiết bị​

VieNeu-TTS là hệ thống chuyển văn bản thành giọng nói (TTS) tiếng Việt tiên tiến, chạy hoàn toàn trên thiết bị với khả năng nhân bản giọng nói tức thì.

Chỉ cần cung cấp văn bản, hệ thống sẽ đọc lại bằng giọng nói tiếng Việt tự nhiên — hoàn toàn offline, không cần API đám mây.

Tính Năng Nổi Bật​

  • Nhân Bản Giọng Nói Tức Thì — Nhân bản bất kỳ giọng nói nào chỉ với 3-5 giây âm thanh mẫu
  • Chuyển Đổi Ngôn Ngữ — Chuyển đổi liền mạch giữa tiếng Việt và tiếng Anh
  • Phát Trực Tuyến Thời Gian Thực — Bắt đầu phát âm thanh trước khi toàn bộ câu được tạo xong
  • Nhiều Backend — PyTorch (GPU), GGUF lượng tử hoá (CPU), LMDeploy (GPU nhanh), Remote API
  • Sẵn Sàng Cho Production — Tạo sóng âm 24 kHz, có watermark âm thanh

Cách Hoạt Động​

VieNeu-TTS sử dụng mô hình ngôn ngữ nhân quả để tạo giọng nói. Pipeline cốt lõi:

Văn bản → Chuẩn hoá → Phiên âm (eSpeak NG) → LLM tạo token âm thanh → Codec giải mã thành audio
  1. Chuẩn hoá văn bản — Chuyển đổi số, viết tắt, dấu câu thành dạng nói
  2. Phiên âm — eSpeak NG chuyển đổi văn bản thành ký hiệu phát âm
  3. Tạo token — Transformer LLM dự đoán các token âm thanh rời rạc
  4. Giải mã âm thanh — NeuCodec chuyển đổi token thành sóng âm 24kHz

Các Mô Hình​

Mô HìnhĐịnh DạngChất LượngTốc Độ
VieNeu-TTS (0.5B)PyTorchTốt nhấtRất Nhanh (GPU)
VieNeu-TTS-0.3BPyTorchTuyệt vờiSiêu Nhanh (2x)
GGUF Q8GGUFTuyệt vờiNhanh (CPU)
GGUF Q4GGUFTốtRất Nhanh (CPU)

Tất cả mô hình được lưu trữ trên HuggingFace và tự động tải về lần đầu sử dụng.

Bắt Đầu Nhanh​

git clone https://github.com/pnnbao97/VieNeu-TTS.git
cd VieNeu-TTS
uv sync
uv run vieneu-web

Mở http://127.0.0.1:7860 và bắt đầu tạo giọng nói.