Oracle is a leading company in AI and cloud solutions, seeking a Site Reliability Engineering Architect to enhance the reliability and quality of large-scale data center electrical distribution architectures. The role involves evaluating electrical systems, identifying failure points, and developing resiliency concepts while collaborating with various engineering and operational teams.
Responsibilities:
- Evaluate end-to-end data center electrical distribution architectures, including utility or behind-the-meter interfaces, substations, medium-voltage distribution, switchgear, UPS systems, generators, BESS where applicable, protection systems, controls, and downstream power delivery
- Identify design-level failure points, single points of failure, common-mode risks, hidden dependencies, protection coordination concerns, and failure modes that could materially impact availability
- Assess how electrical systems perform under credible failure scenarios, including equipment faults, transfer events, protection operations, control-system failures, degraded-mode operation, maintenance conditions, and abnormal grid or generation events
- Develop system-level resiliency concepts and design recommendations that improve fault isolation, recoverability, maintainability, failure containment, and blast radius reduction
- Partner with electrical design engineering, commissioning, operations, construction, supply chain, and equipment vendors to translate reliability findings into design standards, product requirements, test expectations, acceptance criteria, and corrective action plans
- Apply quality and reliability engineering methods such as FMEA, fault-tree analysis, reliability block diagrams, root-cause analysis, design-for-reliability reviews, lessons-learned integration, and field-performance trend analysis
- Evaluate product quality and reliability across power infrastructure, electrical equipment, standardized electrical products, and repeatable data center design platforms
- Recommend improvements to specifications, supplier qualification, equipment testing, design validation, manufacturing quality controls, inspection processes, and supplier feedback loops
- Create executive-ready reliability risk assessments that clearly communicate availability impact, technical trade-offs, mitigation options, residual risk, and prioritization across large-scale infrastructure programs
- Establish reliability KPIs, defect taxonomies, quality gates, issue review cadence, and design-readiness criteria that improve reliability before construction, commissioning, and operational handoff
- Champion safety, compliance, disciplined change management, and operational excellence while improving reliability at the architecture, product, and system levels
Requirements:
- 10+ years of experience in reliability engineering, quality engineering, electrical design assurance, product quality, mission-critical power systems, data center infrastructure, industrial power, utilities, generation, transmission and distribution, or equivalent high-availability environments
- Strong systems-thinking capability, with demonstrated ability to evaluate electrical architectures under failure scenarios rather than only assessing individual components or equipment ratings
- Deep understanding of data center electrical distribution concepts, including medium-voltage and low-voltage distribution, substations, switchgear, UPS systems, generators, protection schemes, controls, grounding, power quality, redundancy, maintainability, and operational recovery
- Experience identifying failure modes, common-mode vulnerabilities, cascading risks, hidden dependencies, and blast-radius concerns across complex electrical systems
- Proven ability to assess availability impact and reliability tradeoffs using structured engineering methods such as FMEA, fault-tree analysis, reliability block diagrams, event analysis, root-cause analysis, or similar methodologies
- Relevant product quality and reliability experience across power infrastructure, electrical equipment, standardized electrical products, or repeatable data center design platforms
- Ability to influence design standards, supplier requirements, equipment qualification expectations, commissioning acceptance criteria, and operational readiness deliverables
- Strong cross-functional leadership skills, with experience partnering across design engineering, construction, commissioning, operations, vendors, and executive stakeholders
- Excellent communication and executive reporting skills, with the ability to translate complex technical reliability risk into clear decisions, priorities, and implementation plans
- Commitment to safety, compliance, disciplined engineering governance, and operational excellence in high-uptime environments