2 min read

    ๐Ÿ“š Kafka & Spark Streaming Syllabus

    #kafka#spark#syllabus

    Apache Kafka & Spark Streaming

    This syllabus covers real-time data streaming concepts, focusing on Spark Streaming and Apache Kafka in the exact chronological order of the original presentation.

    01 - Foundations of Spark Streaming.md

    • Batch vs Streaming architectures
    • Micro-batch Architecture and DStreams
    • Continuous data processing and real-time decision making
    • Practical: Socket Word Count

    02 - Advanced Spark Streaming.md

    • Streaming workflow and Uber Use Case
    • Windowed and Stateful Operations (reduceByKeyAndWindow)
    • Slice, ReduceByWindow, and Checkpointing
    • Practical: Real-time Hashtag extraction

    03 - Introduction to Apache Kafka.md

    • Need for Kafka (Real-time, Decoupled Architecture)
    • Core Concepts: Topics, Partitions, Brokers, and Consumer Groups
    • Kafka Architecture: Distributed Broker Cluster and Zookeeper/KRaft Coordination
    • Message Ordering and Offsets

    04 - Kafka Cluster Configuration.md

    • Cluster Metadata Management and Replication
    • Performance and Durability settings (server.properties)
    • Security, Monitoring, and Administration (AdminClient API)
    • Configuring Log Retention and Default Partitions

    05 - Kafka Producers & Advanced Features.md

    • Message Publishing, Partitioning, and Ordering
    • Acknowledgment (acks) and Retries
    • Tuning for Throughput (batch.size, linger.ms, compression)
    • Serializers (String, Integer, Avro, Custom)
    • RoundRobin and Custom Partitioners
    • Headers, Interceptors, Quotas, and Throttling

    06 - Spark Streaming & Kafka Integration.md

    • Setting up StreamingContext with KafkaUtils
    • Direct Stream approach vs Receiver-based approach
    • Subscribing to Topics and parsing JSON/Avro streams
    • Writing Streaming DataFrames to Delta Lake with ACID guarantees

    07 - Kafka Consumer API & Monitoring.md

    • Pull-Based Consumer Model (Auto vs Manual Commits)
    • Single, Multi-Topic, and Pattern-Based Subscriptions
    • Continuous vs Batch Polling Strategies
    • Handling Partition Reassignments (ConsumerRebalanceListener)
    • Monitoring Metrics (Prometheus, Grafana, Consumer Lag)

    08 - Advanced Streaming Architectures.md

    • Cross-Cluster Data Mirroring (MirrorMaker)
    • High Availability and Disaster Recovery (RTO/RPO)
    • Aggregation from Edge Clusters to Central Clusters
    • End-to-End IoT Use Case: Faulty Cell Tower Detection

    Course Contents: