On-Call: 24x7 rotation required
Interview Process:
- Step 1: 90-minute technical virtual panel
- Step 2: 30-minute virtual with RTM (onsite for Charlotte candidates)
Role Overview Wells Fargo is seeking a Senior Systems Operations Engineer with a Site Reliability Engineering (SRE) mindset. The role focuses on L2/L3 application and middleware production support, shifting from reactive operations to proactive reliability engineering. Responsibilities include incident response, problem management, observability, automation/IaC, compliance guardrails, and CI/CD-integrated operational automation to reduce toil and improve stability/MTTR.
Core Responsibilities
- Provide senior-level application and middleware support; act as escalation point for L2/L3 incidents.
- Lead troubleshooting, recovery, and stabilization in complex, high-availability environments.
- Embed SRE practices: define reliability signals, improve alert quality, drive blameless post-incident learning.
- Implement observability across applications and middleware (logs, metrics, traces, dashboards, actionable alerting).
- Design and maintain infrastructure-as-code and configuration-as-code for VM and container-adjacent workloads (OpenShift/OCP).
- Build automation for middleware operations (status checks, start/stop/restart patterns).
- Implement intelligent automation and AI-assisted operations with guardrails.
- Monitor configuration drift; support automated compliance checks and remediation.
- Integrate infrastructure and operational automation with CI/CD pipelines.
- Support core platform components including ingress, load balancing, and shared services.
- Develop and maintain runbooks, operational documentation, and validation/testing approaches.
Required Qualifications
- 4+ years Systems Engineering or Infrastructure/Operations Engineering experience.
- 4+ years application/middleware production support in high-availability environments.
- 4+ years automation/configuration management (Ansible preferred) and scripting (Python, Bash, PowerShell).
- 4+ years Linux administration (RHEL preferred) and/or Windows Server administration.
- 4+ years Git-based version control practices.
- Experience with infrastructure-as-code concepts.
- Experience supporting hybrid/private cloud platforms and container-adjacent hosting models (OpenShift/Kubernetes).
- Experience implementing SRE practices (reliability metrics, toil reduction, post-incident learning).
- Experience supporting middleware platforms and shared services with automation patterns.
- Familiarity with observability practices (dashboards, alert engineering, telemetry).
- Exposure to responsible AI usage in operations.
- Strong cross-functional communication skills; experience in regulated environments.
Job Expectations
- Deliver operational engineering and automation outcomes with focus on stability, resiliency, and toil reduction.
- Participate in on-call rotations and operational support coverage.
- Follow enterprise change management, risk, and compliance processes.
- Continuously improve platform reliability and automation maturity.
- Hybrid work schedule (3 days onsite).
- No visa sponsorship or relocation assistance.
- Flexibility to work in a 24/7 environment, including weekends and holidays.
- Frequent on-call availability beyond normal working hours.