Reasoning model (OpenAI o-series, Claude với extended thinking, DeepSeek-R1...) là LLM được huấn luyện để suy nghĩ trước khi trả lời: model sinh một chuỗi reasoning token nội bộ (chain-of-thought) để lập kế hoạch, thử phương án, tự kiểm tra và sửa lỗi, rồi mới đưa ra đáp án cuối.
Khác biệt cốt lõi với LLM thường: chúng được RL huấn luyện để lý luận (không chỉ prompt "think step by step"), nên mạnh hơn rõ rệt ở toán, code, lý luận nhiều bước.
Test-time compute (inference-time compute) = bỏ thêm tính toán lúc suy luận để tăng chất lượng, thay vì phải train model lớn hơn. Cụ thể: cho model sinh nhiều reasoning token hơn, hoặc sample nhiều lời giải rồi chọn/bầu. Quan sát then chốt: chất lượng cải thiện theo cả train-time compute và test-time compute — "nghĩ lâu hơn" cho đáp án tốt hơn tới một mức.
Đánh đổi khi dùng: reasoning token tính phí và tăng độ trễ (đôi khi gấp nhiều lần), và với tác vụ đơn giản thường thừa — dùng cho bài khó (lập kế hoạch, chứng minh, debug phức tạp); tác vụ dễ/nhạy độ trễ thì dùng model thường. Nhiều API cho chỉnh mức/budget reasoning để cân bằng chất lượng–chi phí.