Chọn sai GPU thì chi phí phục vụ chênh nhau vài lần. Ba yếu tố, và thứ tự quan trọng không như nhiều người nghĩ.
1. VRAM — quyết định có chạy được hay không. Phải chứa đủ:
- Trọng số: số tham số × số byte mỗi tham số. Model 70B ở FP16 cần ~140GB; lượng tử hoá INT4 còn ~35GB.
- KV cache, phần hay bị quên: phình theo độ dài ngữ cảnh × số request đồng thời. Vẫn model 70B với context 8K, một request tốn hơn 1GB, batch 32 đã chiếm ~40GB — tức KV cache có thể lớn ngang trọng số.
- Cộng thêm 10–20% cho buffer và overhead của framework.
2. Băng thông bộ nhớ — quyết định tốc độ sinh token. Đây là chỗ hay nhầm nhất: pha decode phải đọc toàn bộ trọng số cho mỗi token, nên tốc độ bị chặn bởi băng thông chứ không phải FLOPs.
Ước lượng nhanh: token/giây ≲ băng thông / kích thước model. Model 70B FP16 (140GB) trên card băng thông 3,35 TB/s cho trần lý thuyết ~24 token/s mỗi luồng, thực tế 15–20. Cũng model đó trên card 1 TB/s chỉ còn ~7 token/s. Khoảng cách băng thông giữa hai card thường lớn hơn khoảng cách FLOPs, nên khi so card cho inference hãy so băng thông trước.
3. Năng lực tính toán — chủ yếu ảnh hưởng prefill và training. Prefill (nạp prompt dài) mới là phần nghẽn tính toán, và hỗ trợ FP8 giúp phần này nhanh lên đáng kể. Với decode thuần thì FLOPs dư thừa.
| GPU | VRAM | Băng thông |
|---|---|---|
| H100 SXM | 80GB | 3,35 TB/s |
| H200 | 141GB | 4,8 TB/s |
| B200 | 192GB | 8 TB/s |
| A100 80GB | 80GB | 2 TB/s |
| L40S | 48GB | 864 GB/s |
| RTX 4090 | 24GB | 1 TB/s |
Giá thuê thay đổi liên tục nên không ghi ở đây — tra bảng giá hiện hành khi tính chi phí.
Khung chọn nhanh:
- Model dưới 7B, ngân sách hẹp → RTX 4090 hoặc L40S, phục vụ được vài người dùng đồng thời.
- 7B–13B chạy thật → A100 hoặc L40S 48GB.
- 34B–70B → một tới hai card 80GB; ở FP16 phải chia model qua nhiều GPU.
- 70B đã lượng tử hoá INT4 → vừa một card 80GB.
- 100B trở lên → cả một node 8 GPU với tensor parallel.
- Fine-tune → ưu tiên bản SXM có NVLink, vì lúc đó băng thông giữa các GPU mới là nút thắt.
Trước khi mua thêm GPU, hãy dùng hết card đang có: continuous batching, lượng tử hoá INT4 (vừa chứa được model to hơn vừa giảm áp lực băng thông), và prefix caching. Ba thứ này thường cho mức cải thiện lớn hơn việc nâng lên card đắt hơn.