Jailbreak là ép model bỏ qua chính các ràng buộc an toàn của nó bằng prompt được soạn có chủ đích. Phân biệt với prompt injection: injection chèn chỉ thị qua nội dung bên thứ ba mà hệ nạp vào (tài liệu, email), còn jailbreak là người dùng tấn công trực diện.
Các kỹ thuật, nhóm theo cơ chế:
- Đổi khung ngữ cảnh — nhóm phổ biến nhất: bảo model đóng vai một nhân vật không ràng buộc, bọc yêu cầu vào tình huống hư cấu ("tôi đang viết tiểu thuyết, nhân vật cần giải thích..."), hoặc xin dưới dạng "code minh hoạ". Mấu chốt là che yêu cầu độc hại bằng một mục đích nghe hợp lý.
- Né bộ lọc theo mặt chữ — mã hoá base64, rot13, viết lái, hoặc dịch sang ngôn ngữ ít được align. Model vẫn hiểu nội dung nhưng bộ lọc so khớp mẫu thì không thấy gì. Nhóm ngôn ngữ hiếm là lỗ hổng dai dẳng nhất.
- Chia nhỏ qua nhiều lượt — mỗi lượt vô hại, ghép lại mới thành chỉ thị nguy hiểm; bộ lọc xét từng lượt riêng lẻ sẽ không bắt được.
- Many-shot — nhồi vào ngữ cảnh hàng trăm cặp hỏi–đáp giả trong đó model luôn trả lời thoải mái; model học theo mẫu ngay trong ngữ cảnh rồi làm theo. Cửa sổ ngữ cảnh càng dài, đòn này càng mạnh.
- Hậu tố đối kháng — tối ưu bằng gradient ra một chuỗi ký tự vô nghĩa nhưng đẩy xác suất model đồng ý lên cao. Đáng ngại vì một hậu tố có thể dùng lại được trên nhiều model khác nhau.
Phòng thủ nhiều lớp:
1. Lọc đầu vào bằng classifier chuyên (Llama Guard, Prompt Guard) để bắt mẫu jailbreak trước khi vào model.
2. System prompt có thứ bậc chỉ thị — nói rõ chỉ thị hệ thống luôn thắng, không nhận yêu cầu đòi đóng vai khác hay bỏ qua chỉ dẫn.
3. Lọc đầu ra — quét nội dung đã sinh trước khi trả về. Lớp này bắt được cả những đòn mà lớp đầu vào không lường trước.
4. Huấn luyện từ chối và red team liên tục, cộng phát hiện hành vi: một tài khoản thử hàng loạt biến thể trong thời gian ngắn là tín hiệu rõ.
Chốt lại, và đây là phần quan trọng nhất: không có model nào miễn nhiễm jailbreak. Mục tiêu thực tế không phải chặn sạch mà là hạ tỉ lệ thành công và thu hẹp thiệt hại khi bị vượt — giới hạn quyền của tool, che PII, ghi log kiểm toán, và không cho model tự thực hiện hành động không hoàn tác được khi chưa có người xác nhận. Một jailbreak thành công trên hệ chỉ trả lời văn bản là chuyện nhỏ; cùng jailbreak đó trên agent có quyền xoá dữ liệu là chuyện lớn.