Multi-modal AI là model xử lý nhiều loại dữ liệu cùng lúc (chữ, ảnh, âm thanh, video). Chia hai hướng: hiểu đa phương thức (các VLM như GPT-4o, Claude, Gemini) và sinh đa phương thức (DALL·E, Stable Diffusion, Sora).
CLIP là nền của gần như mọi VLM hiện nay. Cấu tạo đơn giản: một encoder cho ảnh, một encoder cho chữ, train trên hàng trăm triệu cặp (ảnh, chú thích) lấy từ web bằng contrastive loss — với một batch N cặp, đẩy độ tương đồng của các cặp khớp đúng lên cao và kéo các cặp ghép sai xuống thấp.
Kết quả là ảnh và câu mô tả nó nằm gần nhau trong cùng một không gian vector. Nhờ đó mới phân loại được ảnh mà không cần huấn luyện thêm (so ảnh với các câu "ảnh một con mèo", "ảnh một con chó") và tìm kiếm ảnh bằng chữ.
VLM hiện đại ghép ba mảnh:
1. Encoder ảnh (thường là ViT đã được CLIP huấn luyện) biến ảnh thành một dãy embedding của các mảnh ảnh.
2. Projector — thường chỉ là một MLP nhỏ — ánh xạ embedding ảnh sang đúng không gian embedding của LLM.
3. LLM nhận dãy gồm cả mảnh ảnh lẫn token chữ rồi sinh câu trả lời như bình thường.
Điểm đáng chú ý: LLM không được sửa gì cả — ảnh chỉ đơn giản được dịch sang thứ ngôn ngữ mà LLM vốn đã hiểu. Nhờ vậy huấn luyện rẻ hơn nhiều: giai đoạn đầu đóng băng cả encoder và LLM, chỉ train projector; giai đoạn sau mới tinh chỉnh theo chỉ dẫn.
VLM làm được: đọc chữ trong ảnh, hỏi đáp về ảnh, đọc biểu đồ và bảng, hiểu giao diện để tự động hoá thao tác, mô tả ảnh y khoa.
Giới hạn cần biết: ảnh bị thu nhỏ trước khi đưa vào nên chi tiết nhỏ hay bị mất (chữ in nhỏ, số trên biểu đồ dày đặc); suy luận về vị trí và quan hệ không gian còn yếu; video dài vẫn là bài toán khó vì tốn token.
Xu hướng: model hợp nhất nhiều phương thức trong một — nhận thẳng chữ, ảnh và âm thanh, trả về cũng nhiều dạng — thay cho việc ghép nối từng model rời cho mỗi chặng.