← Back to jobs
Malvern, PA, USA
No related jobs found
ROLE_DESCRIPTION - AWS Cloud Platform Expertise - EC2, EKS, ECS, Lambda, CloudWatch, SNS, SQS, Event Bridge for highly available and scalable services.
Arize AI Observability & Monitoring:
Model performance monitoring, drift detection, evaluation analytics, and AI/LLM observability.
Site Reliability Engineering (SRE):
SLI/SLO definition, Error Budgets, reliability improvement, service resilience, and uptime management.
Incident Management & RCA:
Major Incident Management (MIM), outage tracking, root cause analysis, problem management, and MTTR reduction.
Failure Analysis & Risk Assessment:
FMEA, risk quantification, reliability assessments, and proactive mitigation of platform failures.
Testing & Validation Engineering:
Scenario testing, regression testing, impact analysis, release validation, and upstream change testing.
Monitoring, Alerting & Automation:
CloudWatch, Grafana, Prometheus, PagerDuty, automated notifications, dashboards, and operational metrics.
DevOps & MLOps Practices:
Kubernetes, Terraform, CI/CD pipelines, Python scripting, AI/ML platform operations, and LLM reliability optimization
Any Graduate
No related jobs found
← Back to jobs