You will architect and implement scalable data hub solutions on AWS.
Responsibilities
Architect and implement scalable data hub solutions on AWS using best practices for ingestion, transformation, storage, and access control.
Design and build data pipelines to extract, transform, and load data from databases, APIs, and flat files using AWS Glue, AWS Batch, or custom ETL processes.
Define data models, lineage, and quality standards, including CDM, LDM, and PDM.
Select AWS services such as S3, Glue, Redshift, Athena, and Lambda based on volume, access patterns, and performance.
Implement data cleansing and normalization techniques to ensure data quality and manage ingestion schedules and error handling.
Required Skills
5+ years of experience in data architecture and engineering.
Deep expertise in AWS services: S3, Glue, Redshift, Athena, Lake Formation, Lambda, CloudWatch, and EventBridge.
Proficiency in Python, SQL, and PySpark for data processing and manipulation.
Strong experience in ETL/ELT processes, data cleansing, and data transformation.
Expertise in dimensional and snowflake data modeling for data warehousing and data lakes.
Knowledge of GCP Data Architecture and Data Lakehouse Architecture.
Experience with MDM, Conceptual Data Architecture, and Dimensional Data Modeling.
Understanding of data governance, including data classification, access control, and lineage tracking.