Scaling laws mô tả quan hệ giữa chất lượng model và ba đại lượng: số tham số, lượng dữ liệu, và compute bỏ ra. Phát hiện then chốt: loss giảm theo quy luật luỹ thừa khi tăng bất kỳ đại lượng nào — nghĩa là dự đoán được, chứ không phải may rủi. Nhờ vậy người ta đoán trước hiệu quả của một lần train tốn hàng chục triệu đô trước khi bắt đầu.
Kết quả Chinchilla chỉnh lại cách hiểu ban đầu: với một ngân sách compute cố định, tối ưu là tăng tham số và dữ liệu cân nhau, cỡ 20 token dữ liệu cho mỗi tham số. Hệ quả rất cụ thể — nhiều model thế hệ trước quá lớn so với lượng dữ liệu được nạp vào, và một model nhỏ hơn nhưng train trên nhiều dữ liệu hơn đã vượt qua chúng với ít compute hơn. Từ đó ngành đổi hướng: thôi chạy đua số tham số, quay sang lo dữ liệu.
Emergent abilities là những khả năng không có ở model nhỏ rồi xuất hiện khá đột ngột khi vượt một ngưỡng quy mô: suy luận theo chuỗi, học từ vài ví dụ ngay trong prompt, làm theo chỉ dẫn phức tạp, tính toán nhiều bước.
Có tranh cãi về chuyện này và nên biết: một số nghiên cứu chỉ ra "đột ngột" phần lớn là do cách đo. Nếu chấm theo kiểu đúng-sai thì thấy nhảy bậc, nhưng nhìn trên đường loss liên tục thì nó tăng đều. Dù vậy, với người dùng thì ranh giới ấy vẫn có thật: giải được hay không giải được là hai chuyện khác nhau.
Ba hệ quả thực dụng:
- Đừng kết luận một tác vụ là bất khả thi khi mới thử trên model nhỏ. "Không làm được" có thể chỉ là chưa đủ quy mô.
- Fine-tune không tạo ra được năng lực chưa xuất hiện. Nó khơi và định hướng cái đã có sẵn, không thêm cái chưa có — đây là chỗ nhiều dự án kỳ vọng sai.
- Quy mô lớn hơn cũng mở ra rủi ro mới, không chỉ năng lực mới; phải đánh giá lại an toàn sau mỗi lần nâng cấp model.
Hướng đi hiện nay: chỉ tăng quy mô đã giảm hiệu quả rõ rệt, nên trọng tâm chuyển sang compute lúc suy luận (cho model nghĩ lâu hơn thay vì train to hơn), kiến trúc MoE (capacity lớn nhưng chi phí chạy thấp), và chất lượng dữ liệu thay vì khối lượng dữ liệu.