Thị giác máy tính — từ CNN nền tảng đến ResNet, HRNet và các kiến trúc hiện đại cho phân loại, phát hiện vật thể, phân vùng ảnh; kết thúc bằng Vision Transformer làm cầu nối sang LLM.