Computer Vision

Computer Vision

Thị giác máy tính — từ CNN nền tảng đến ResNet, HRNet và các kiến trúc hiện đại cho phân loại, phát hiện vật thể, phân vùng ảnh; kết thúc bằng Vision Transformer làm cầu nối sang LLM.

6
Bài học
CNN → ViT
Lộ trình
ResNet · HRNet
Kiến trúc lõi
Detection · Segmentation
Bài toán
Lộ trình 6 bài
Bài 1
CNN — Mạng tích chập
Convolution, kernel/stride/padding, pooling, feature map, receptive field — vì sao CNN hợp với ảnh.
ConvolutionPoolingFeature Map
Bài 2
Tiến hóa kiến trúc CNN
LeNet, AlexNet, VGG, GoogLeNet/Inception — con đường làm mạng sâu hơn và vấn đề gặp phải.
AlexNetVGGInception
Bài 3
ResNet — Residual Learning
Vấn đề suy thoái, skip connection, residual & bottleneck block, ResNet-50/101.
ResidualSkip ConnectionBottleneck
Bài 4
HRNet — High-Resolution Net
Duy trì độ phân giải cao xuyên suốt, nhiều nhánh song song & hợp nhất đa tỉ lệ — mạnh cho pose & segmentation.
High-ResolutionMulti-scaleFusion
Bài 5
Detection & Segmentation
R-CNN/Faster R-CNN, YOLO, SSD, FPN; FCN, U-Net, Mask R-CNN, DeepLab — phát hiện & phân vùng.
Faster R-CNNYOLOU-NetMask R-CNN
Bài 6
Vision Transformer (ViT)
Self-attention cho ảnh, patch embedding, ViT, Swin, DETR — cầu nối sang Transformer & LLM (Pha 3).
ViTAttentionSwin
3 ý cốt lõi
Local connectivity & weight sharing
CNN khai thác cấu trúc không gian của ảnh nhờ local connectivity + weight sharing — ít tham số mà vẫn nắm được đặc trưng cục bộ.
Residual connection khai thông
Mạng càng sâu càng mạnh nhưng khó huấn luyện → residual connection (ResNet) khai thông, cho phép xếp chồng hàng trăm lớp.
Giữ độ phân giải cao
Giữ độ phân giải cao (HRNet) rất quan trọng cho định vị & phân vùng chính xác — không để mất chi tiết khi downsample.