Hai kỹ thuật nâng cấp chuỗi suy luận (CoT), khác nhau ở chỗ một cái lấy số đông, một cái đi tìm kiếm có định hướng.
Self-Consistency — sinh N lời giải CoT khác nhau ở temperature cao rồi lấy đáp án xuất hiện nhiều nhất. Lập luận đằng sau: nếu model thật sự hiểu bài, các đường suy luận khác nhau vẫn hội tụ về một đáp án; còn khi nó đoán mò, các lần đoán sẽ tản ra mỗi lần một kiểu.
- Cải thiện khoảng 10–20% độ chính xác trên các bài toán suy luận.
- Chi phí gấp N lần, nên N cỡ 5 là mức cân bằng hợp lý.
- Chỉ dùng được khi đáp án hữu hạn và so sánh được — bài toán, phân loại, trắc nghiệm. Với văn bản mở thì không có gì để bỏ phiếu.
Tree-of-Thoughts — coi việc suy luận như tìm kiếm trên cây: mỗi bước sinh vài hướng đi, cho model tự đánh giá từng hướng, cắt nhánh kém, mở rộng nhánh tốt, và quay lui khi bí.
- Ăn điểm ở những bài cần thử rồi quay lui: câu đố, trò chơi, bài toán tổ hợp. Trên bài kiểu Game of 24, ToT nâng tỉ lệ giải được từ mức rất thấp lên vượt bảy phần mười.
- Chi phí đắt hơn CoT thường tới hai bậc, và phải tự viết phần điều khiển tìm kiếm chứ không chỉ đổi prompt.
| Self-Consistency | Tree-of-Thoughts | |
|---|---|---|
| Cách làm | sinh N đường, bỏ phiếu | tìm kiếm trên cây, tự chấm từng nhánh |
| Cài đặt | vài dòng | phải viết controller |
| Chi phí | gấp 5–40 lần | gấp 100 lần trở lên |
| Hợp với | đáp án hữu hạn | bài cần lập kế hoạch, thử–sai |
Khi không nên dùng cả hai: việc đơn giản, hệ nhạy độ trễ, hoặc nhạy chi phí. Và một điểm quan trọng của thời điểm hiện tại — các model suy luận thế hệ mới đã nội hoá phần lớn những kỹ thuật này: chúng tự sinh chuỗi suy nghĩ dài và tự kiểm tra bên trong, nên bọc thêm một tầng ToT bên ngoài thường chỉ tốn tiền mà không thêm được gì. Nên đo trước khi áp dụng, đừng mặc định là có lợi.