STT (nhận dạng tiếng nói) — chuẩn mở hiện nay là Whisper:
- Kiến trúc: Transformer encoder-decoder. Audio → phổ log-mel → encoder → decoder sinh token chữ.
- Train đa nhiệm trên ~680k giờ audio kèm văn bản nhiều thứ tiếng, nên cùng một model làm được chép lời, dịch và nhận diện ngôn ngữ. Dữ liệu lấy từ web nhiễu nên chịu tạp âm và giọng vùng miền khá tốt; hỗ trợ 99 ngôn ngữ, có tiếng Việt.
- Nhiều cỡ từ tiny tới large để đổi độ chính xác lấy tốc độ.
- Hạn chế cần biết: bịa nội dung khi gặp đoạn im lặng dài, kém khi nhiều người nói chồng nhau, và không hỗ trợ realtime sẵn vì xử lý theo khối 30 giây — muốn realtime phải tự cắt luồng rồi ghép bản chép tạm.
TTS (tổng hợp giọng nói) — ba nhóm kiến trúc:
- Tự hồi quy (Tacotron, VALL-E): sinh phổ mel từng khung rồi qua vocoder. Giọng tự nhiên nhất nhưng chậm.
- Không tự hồi quy (FastSpeech, StyleTTS): sinh song song nên nhanh hơn nhiều, hợp realtime.
- Diffusion và LLM audio end-to-end: chất lượng cao nhất hiện nay.
Nhân bản giọng chỉ cần 3–10 giây mẫu là tái tạo được giọng cho văn bản bất kỳ. Đây là chỗ phải chủ động về pháp lý: cần sự đồng ý rõ ràng và nên gắn watermark.
Ghép thành voice agent là ca dùng khó nhất:
Mic → VAD (phát hiện có tiếng nói) → STT streaming →
chờ hết câu → LLM → TTS streaming → loa
+ xử lý ngắt lời: người dùng nói đè → huỷ TTS đang phátTổng độ trễ cả vòng cần dưới ~500ms nên phải stream ở cả hai đầu, không chờ trọn câu. Hai việc khó nhất không nằm ở model mà ở phát hiện hết lượt nói (biết khi nào người dùng đã nói xong) và huỷ TTS khi bị ngắt lời.
Xu hướng đáng chú ý: các API audio end-to-end (GPT-4o Realtime, Gemini Live) nhận audio trả audio, bỏ hẳn ba chặng STT → LLM → TTS. Đổi lại: ít mảnh ghép, độ trễ thấp hơn, giữ được ngữ điệu và cảm xúc; nhưng mất quyền kiểm soát từng chặng và khó chen guardrail vào giữa.
Ca dùng phổ biến: chép và tóm tắt cuộc họp, phân tích cuộc gọi tổng đài, phụ đề cho khả năng tiếp cận, trợ lý thoại; phía TTS là sách nói, IVR, trình đọc màn hình, agent gọi điện.
Đo bằng gì: STT dùng WER (Word Error Rate) cộng độ trễ tới từ đầu tiên; voice agent đo độ trễ cả vòng.