Kho tri thức thật (quy chế, báo cáo tài chính, tài liệu kỹ thuật) không chỉ có chữ — còn bảng, ảnh, biểu đồ. RAG chỉ đọc text sẽ mất hẳn phần đó, và tệ hơn là mất mà không báo gì: hệ vẫn trả lời, chỉ là bỏ qua đúng cái bảng chứa số liệu cần tìm.
Bước đầu tiên là parse có hiểu layout, không phải trích text thô. Các parser (LlamaParse, Unstructured, Azure Document Intelligence, Amazon Textract) trả về cấu trúc: khối văn bản, bảng, ảnh kèm chú thích, và cấp bậc tiêu đề.
Bảng — phần đáng giá nhất và cũng dễ làm nhất:
- Chuyển bảng thành markdown rồi embed kèm tiêu đề và chú thích. Model hiện nay đọc bảng markdown khá tốt nên nhiều khi chỉ cần chừng này.
- Bảng lớn thì thêm một bước: cho model viết tóm tắt bảng (có những cột gì, nói lên điều gì) rồi index bản tóm tắt để tìm kiếm; khi trúng thì gửi cả tóm tắt lẫn bảng gốc vào ngữ cảnh. Lý do: câu hỏi của người dùng giống văn xuôi chứ không giống một hàng số, nên embed thẳng bảng thô thường không khớp.
- Bảng rất lớn và cần con số chính xác thì đừng dùng RAG — đưa vào bảng dữ liệu rồi sinh truy vấn SQL.
Ảnh và biểu đồ: cho VLM viết chú thích chi tiết (biểu đồ thì mô tả trục, xu hướng, giá trị đáng chú ý) rồi index phần chữ đó, đồng thời giữ tham chiếu tới ảnh gốc để khi cần thì đính kèm ảnh vào ngữ cảnh. Nếu ảnh là ảnh chụp màn hình hoặc sơ đồ có chữ thì OCR thêm.
Một hướng khác đáng biết: ColPali / ColQwen truy hồi thẳng trên ảnh trang PDF, bỏ qua toàn bộ khâu OCR và parse. Pipeline đơn giản hẳn và tránh được lỗi parse, đổi lại tốn token ảnh và khó trích dẫn chính xác tới từng đoạn.
Chunking phải giữ nguyên cấu trúc: đừng cắt ngang một bảng, đừng tách ảnh khỏi chú thích của nó. Dùng chunk cha–con để truy hồi ở mức nhỏ nhưng sinh câu trả lời với ngữ cảnh cha.
Chỗ hay hỏng: scan mờ hoặc trang bị xoay khiến OCR trượt; bảng tràn qua nhiều trang phải ghép trước khi parse; biểu đồ không có dữ liệu gốc thì mô tả của VLM chỉ là ước lượng, không nên dùng cho con số cần chính xác.
Chi phí: đắt hơn RAG văn bản nhiều lần vì token ảnh. Cách giảm: sinh chú thích một lần rồi cache, và chỉ đính ảnh gốc vào ngữ cảnh khi câu hỏi thật sự cần nhìn ảnh.