12–18 years of overall data engineering experience
8+ years of experience in enterprise Data Warehouse and Data Lake platforms
5+ years of hands-on experience with Databricks and Spark at scale
Strong experience in modernizing legacy Cloudera platforms (CDH/CDP, Hive, HBase, Impala, Spark) to Databricks Lakehouse
Redesign ingestion, transformation, and consumption patterns from HDFS-based architecture to cloud object storage and Delta Lake
Refactor legacy Hive/Impala logic into PySpark and Spark SQL ELT pipelines
Ensure data reconciliation, audit integrity, and consistency during migration
Design and govern enterprise Data Warehouse and Data Lake/Lakehouse architectures
Implement layered architecture including Raw/Landing, Curated/Conformed, and Semantic/Consumption layers
Modernize traditional EDW platforms into scalable lakehouse architectures
Strong experience in finance and risk data models including General Ledger, Sub-ledger, financial hierarchies, and risk exposure models (credit, liquidity, market risk)
Enable reporting use cases including aggregation, drill-down, and drill-back capabilities
Build and manage semantic/consumption layers for BI, reporting, and analytics
Define business metrics, dimensions, hierarchies, and KPIs
Experience with Databricks SQL, Delta tables, and dbt or similar frameworks
Develop and optimize large-scale data pipelines using PySpark, Spark SQL, and Delta Lake