Mặc định API thắng: chất lượng hàng đầu, không vận hành GPU, trả theo dùng, scale sẵn. Ở volume nhỏ–vừa, tổng chi phí API gần như luôn thấp hơn thuê/khấu hao GPU cộng người vận hành.
Self-host đáng cân nhắc khi:
- Ràng buộc dữ liệu — dữ liệu không được rời hạ tầng (tài chính, y tế, yêu cầu pháp lý về dữ liệu cá nhân) → model mở chạy trong VPC/on-prem là cách duy nhất thỏa mãn.
- Volume rất lớn + tác vụ hẹp — model mở cỡ vừa fine-tune cho một tác vụ có thể đạt chất lượng đủ dùng với chi phí/token thấp hơn nhiều, nhưng chỉ khi utilization cao — GPU idle là chi phí chết; điểm hòa vốn phụ thuộc utilization, không phụ thuộc giá GPU trên giấy.
- Cần kiểm soát sâu — fine-tune tự do, constrained decoding tùy biến, latency ổn định không phụ thuộc rate limit/sự cố của provider, không lo model bị thay đổi/khai tử.
Với tiếng Việt: các model mở đa ngôn ngữ (Qwen, Llama) xử lý tiếng Việt ngày càng tốt; song song có hướng model Việt hóa — PhoGPT (VinAI, pretrain từ đầu trên corpus tiếng Việt lớn) và Vistral (mở rộng vocab + continual pretraining tiếng Việt trên nền Mistral). Không chọn theo nhãn "chuyên tiếng Việt": eval trên tác vụ của bạn — model đa ngôn ngữ cỡ lớn có thể vẫn thắng model Việt hóa cỡ nhỏ, và ngược lại ở tác vụ bám văn hóa/từ vựng địa phương.
Chi phí ẩn của self-host hay bị đánh giá thấp: dựng serving stack (vLLM/TGI), quantization, monitoring, cập nhật model, bảo mật, on-call — cần kỹ năng ML infra chuyên. Bước trung gian ít rủi ro: managed open-model endpoint hoặc GPU cloud theo giờ để đo chất lượng + utilization thật trước khi cam kết hạ tầng riêng.