Xử lý dữ liệu lớn phân tán bằng PySpark — từ kiến trúc Driver/Executor, DataFrame, Spark SQL, ETL với Parquet, đến Structured Streaming đọc trực tiếp từ Kafka. Lộ trình 6 bài kèm lab Docker chạy tại máy.