Mặc định API thắng: chất lượng hàng đầu, không phải vận hành GPU, trả theo lượng dùng, co giãn sẵn. Ở quy mô nhỏ và vừa, tổng chi phí API gần như luôn thấp hơn tiền GPU cộng tiền người vận hành.
Self-host đáng cân nhắc khi:
- Ràng buộc dữ liệu — dữ liệu không được rời hạ tầng (tài chính, y tế, yêu cầu pháp lý về dữ liệu cá nhân). Đây là lý do duy nhất mà tiền không giải quyết được: không có mức giá API nào làm dữ liệu hết rời khỏi hệ thống.
- Lượng dùng rất lớn trên một tác vụ hẹp — model mở cỡ vừa đã fine-tune có thể đủ tốt với chi phí mỗi token thấp hơn nhiều. Nhưng chỉ đúng khi GPU chạy gần hết công suất: GPU bật mà rảnh vẫn tính tiền, nên điểm hoà vốn phụ thuộc mức sử dụng thực tế, không phụ thuộc giá GPU trên giấy. Đây là chỗ tính sai phổ biến nhất.
- Cần kiểm soát sâu — tự do fine-tune, ràng buộc định dạng đầu ra ở mức thấp, độ trễ không phụ thuộc hạn mức của provider, và không lo model bị đổi hay khai tử bất ngờ.
Về tiếng Việt: các model mở đa ngôn ngữ (Qwen, Llama) xử lý tiếng Việt ngày càng tốt; song song có hướng model Việt hoá như PhoGPT (pretrain từ đầu trên corpus tiếng Việt) và Vistral (mở rộng từ vựng rồi pretrain tiếp trên nền Mistral).
Đừng chọn theo nhãn "chuyên tiếng Việt" — hãy đo trên chính tác vụ của mình. Một model đa ngôn ngữ cỡ lớn thường vẫn thắng model Việt hoá cỡ nhỏ ở các việc cần suy luận, trong khi model Việt hoá lại hơn ở những việc bám sát từ vựng và văn hoá địa phương. Hai kết quả này ngược nhau nên không có câu trả lời chung.
Chi phí ẩn của self-host hay bị đánh giá thấp: dựng serving stack, lượng tử hoá, giám sát, cập nhật model, bảo mật, và trực sự cố — đều cần kỹ năng hạ tầng ML chuyên biệt.
Bước trung gian ít rủi ro: dùng endpoint managed cho model mở, hoặc thuê GPU theo giờ, để đo chất lượng thật và mức sử dụng thật trước khi cam kết dựng hạ tầng riêng.