LLM là mô hình ngôn ngữ dựa trên kiến trúc Transformer, được pre-train trên lượng lớn text corpus (hàng trăm tỷ đến hàng nghìn tỷ token). Cốt lõi của LLM là dự đoán token tiếp theo (next-token prediction) dựa trên chuỗi token đầu vào — về bản chất là một hàm xác suất P(token_t | token_0..t-1).
Quy trình hoạt động:
1. Input text được tokenize thành các ID số.
2. Đi qua embedding layer để biến thành vector.
3. Đi qua nhiều lớp Transformer block (self-attention + feed-forward) để học ngữ cảnh.
4. Lớp cuối sinh logits trên toàn bộ vocabulary.
5. Sử dụng các kỹ thuật sampling (greedy / top-k / top-p / temperature) để chọn token tiếp theo.
6. Lặp lại quá trình này (autoregressive) cho đến khi gặp token kết thúc.
Đặc điểm:
- Các khả năng emergent (reasoning, code, dịch thuật, tool use) xuất hiện khi tăng quy mô dữ liệu và tham số.
- Mô hình được fine-tune bằng SFT (Supervised Fine-Tuning) và căn chỉnh qua RLHF/DPO để tuân theo chỉ dẫn tốt hơn và an toàn hơn.