Description
You will design and build data architectures, pipelines, and AI integrations for agentic systems.
This role is remote.
Responsibilities
- Design and build data architecture, including databases and data lakes, to support engineering tasks.
- Develop and manage ELT processes to move data from source systems to analytical platforms.
- Implement data pipelines that facilitate feedback loops for human-in-the-loop systems.
- Optimize data storage and retrieval, including determining effective partitioning criteria using Spark.
- Collaborate with data scientists to preprocess data, train models, and integrate AI into applications.
Required Skills
- 10+ years of experience in data engineering.
- Strong programming skills in Python and experience with AI/ML frameworks.
- Proficiency with Spark and Databricks.
- Experience training and fine-tuning LLMs with structured and unstructured datasets.
- Hands-on experience with vector databases and embedding models for retrieval tasks.
- Experience with Azure services: Blob Storage, Data Lakes, Databricks, Machine Learning, AI Search, OpenAI models, and Media Services.
- Knowledge of Graph DB and core machine learning concepts/algorithms.
- Experience with GIS spatial data, including lat/long, road topology, and geolocation.
- Experience with Department of Transportation Data Domains and developing AI Composite Agentic Solutions.
Preferred Skills
- Bachelor's or Master's degree in Computer Science, AI, Data Science, or a related field.