NETFLIX DATA PLATFORM & ANALYTICS ENGINEERING
Skills to Put on Resume for Data Engineer at Netflix
Apache Iceberg, Apache Spark, Flink, Kafka, AWS S3/EMR, Trino, Airflow & Micro-Partition Data Architecture
Netflix Data Engineering Strategy Focus:
Netflix expects Data Engineers to design petabyte-scale, low-latency data
pipelines using cloud-native open source technologies (Apache Iceberg, Apache Spark, Flink, Kafka, Trino/Presto).
Emphasis is placed on data mesh architecture, sub-second streaming analytics, schema evolution, data quality
automation (Great Expectations/Deequ), and cost-efficient distributed compute on AWS.
1. TECHNICAL COMPETENCIES & DATA PLATFORM ENGINEERING
Distributed Data Processing & Compute
Batch Compute Engine:
Apache Spark
(PySpark, Spark SQL, Dataset API), Trino /
Presto, DuckDB, Ray.
Streaming Compute:
Apache Flink, Spark
Structured Streaming, Kafka Streams, Flink
SQL.
Table Formats & Storage:
Apache Iceberg
(Table Specification, Time Travel, Schema
Evolution), Apache Parquet, ORC, Avro.
Data Warehousing & Lakehouse:
Snowflake,
AWS Redshift, Databricks Delta Lake,
BigQuery, AWS S3 Data Lake.
Data Ingestion, Messaging & Orchestration
Event Streaming & Messaging:
Apache
Kafka, Confluent Kafka, AWS Kinesis,
RabbitMQ, Change Data Capture (CDC /
Debezium).
Workflow Orchestration:
Apache Airflow,
Maestro (Netflix Workflow Engine), Dagster,
Prefect.
Data Modeling:
Dimensional Modeling (Kimball
Star/Snowflake Schema), Data Vault 2.0, One
Big Table (OBT), Semantic Layer Design.
Transformation Frameworks:
dbt (data build
tool), Spark SQL pipelines, Custom Python ETL
Frameworks.
Programming, Infrastructure & Cloud
Core Languages:
Python (Pandas, Polars,
PySpark), Scala, Java, Advanced SQL
(Window functions, CTEs, Query Optimization).
AWS Ecosystem:
AWS S3, EMR, Athena,
Glue, MSK (Managed Streaming for Kafka),
Lambda, IAM, ECS/EKS.
Infrastructure as Code (IaC):
Terraform,
CloudFormation, Docker, Kubernetes (K8s),
Helm.
CI/CD & Version Control:
Git, GitHub Actions,
Jenkins, Spinnaker, Automated Testing (PyTest,
Great Expectations).
Data Quality, Governance & Observability
Data Quality Frameworks:
Great
Expectations, AWS Deequ, Soda, Monte Carlo,
Custom Data Profiling.
Governance & Metadata:
Apache Atlas,
Amundsen, Metacat (Netflix), Data Cataloging,
Data Lineage.
Performance Tuning:
Spark Memory Tuning,
Partitioning/Bucketing, Iceberg Compaction, Z-
Ordering, Cost Optimization (FinOps).
Metrics & Observability:
Datadog,
Prometheus, Grafana, SLA Monitoring, Data
Drift Alerting.
•
•
•
•
•
•
•
•
•
•
•
•
•
•
•
•
Data Engineer at Netflix Resume Skills Blueprint
Page 1 of 2