Data Center Facility Operations Reliability Engineer

Meta

$120K — $145K *
US-AnywhereRemote in Menlo Park, CA
Technical Services
8 - 10 years of experience
Job Overview by Ladders

Qualifications

  • Bachelor's degree in Mechanical, Electrical, Reliability Engineering, or relevant industry experience equivalent to 8+ years.
  • 8+ years of experience in reliability engineering, focusing on electrical or mechanical cooling systems.
  • Skilled in Reliability Centered Maintenance (RCM) and Failure Mode and Effects Analysis (FMEA).
  • Strong problem-solving abilities with a knack for independently managing complex issues.
  • Proficient with Enterprise Asset Management (EAM) tools for data extraction and insights.
  • Knowledge of relevant ISO standards such as ISO 14224 and ISO 55000.
  • Project management experience with a history of effective cross-functional collaboration.

Responsibilities

  • Lead FMEA and establish maintenance strategies.
  • Manage the Global Maintenance Library and ensure adherence to Maintenance Change Management processes.
  • Drive Corrective Maintenance efforts through detailed Failure Mode Analysis.
  • Evaluate and ensure compliance with regulatory requirements across reliability activities.
  • Support Condition-Based Monitoring and Diagnostics programs and optimize performance metrics.
  • Contribute to continuous production risk models to improve operational resilience.
  • Manage supplier engagements for reliability and quality assurance.

Benefits

  • Opportunity to work on complex technical challenges at a leading tech company.
  • Dynamic environment that values innovation and continuous improvement.
  • Collaborative team culture with cross-functional engagement.
  • Travel opportunities for professional development and relationship building.
  • Access to a global network of expertise and resources.
Full Job Description
Meta is seeking an experienced and self-motivated Reliability Engineer to join our Asset Management & Reliability team within Facility Operations. This person will work within Facility Operations to identify and manage asset reliability risks and various stages of end-to-end asset lifecycle for the Data Center Operations. Managing stakeholders spread across time zones and key to the success of our individual projects and overall asset management, and reliability program. In this role, you will be expected to own and execute within your focus areas, contribute to scoping and roadmapping for reliability initiatives, and solve complex technical problems to ensure seamless operations across new and existing sites.

Responsibilities

Lead operational Failure Mode and Effects Analysis (FMEA) and establish maintenance strategies.
• Manage and govern content for the Global Maintenance Library, ensuring rigorous Maintenance Change Management processes are followed.
• Drive Corrective Maintenance initiatives through deep Failure Mode Analysis to identify root causes and implement preventive measures.
• Evaluate regulatory and compliance requirements, providing governance and ensuring adherence across all reliability activities.
• Support and execute Condition-Based Monitoring and Diagnostics programs, including testing, vibration analysis, infrared (IR), partial discharge (PD), and robotics applications.
• Assess and optimize Mean Time To Repair (MTTR) and Mean Time Between Failures (MTBF) metrics to drive continuous improvement.
• Contribute to continuous production risk models to prioritize resources and mitigate operational vulnerabilities.
• Manage non-critical scope and support supplier scope management to ensure external partners meet reliability and quality standards.
• Implement and optimize sensor-based condition monitoring and maintenance (e.g., infrared, temperature, pressure, flow, leak detection) to remotely monitor and assign maintenance tasks.
• Support technical insourcing versus outsourcing decision-making for maintenance and reliability activities.
• Establish Service Bill of Materials (BOM) setups and drive initial and continuous spares selection processes.
• Develop and execute a comprehensive whole-equipment sparing strategy to minimize downtime.
• Identify First-of-Kind (FOK) parts and establish Parts Factory Base Part Number (FBPN) setups.
• Conduct Form-Fit-Function technical analysis to evaluate and approve replacement components.
• Act as the primary liaison to IBOS and ISCE teams for managing replacement parts backlog, timeliness, tooling requirements, and auditing.
• Identify reliability opportunities and contribute to engineering excellence within the team.

Minimum Qualifications
• Bachelor's degree in Mechanical, Electrical, Reliability Engineering, or a similar technical discipline or 6+ years relevant industry experience will be considered in lieu of 8+ years relevant industry experience
• 8+ years of experience in reliability engineering (related to electrical or mechanical cooling equipment) or related Engineering roles
• Experienced in Reliability Centered Maintenance (RCM) and Failure Mode and Effects Analysis (FMEA) activities for maintenance, process, and equipment design optimization to meet reliability requirements
• Proven ability to execute independently within defined scope and manage complex problems with guidance on ambiguous areas
• Proficient in the usage of Enterprise Asset Management (EAM) solutions to extract data and develop meaningful insights
• Knowledgeable of relevant ISO standards (ISO 14224, ISO 17359, ISO 55000)
• Experience with project management and cross-functional collaboration
• Ability to travel 25% domestically and internationally

Preferred Qualifications
• Experience with data center equipment such as critical cooling systems, generators, main switchboards, and network gear
• Proficient in data analysis techniques that can include Process Control, Reliability modeling and prediction, Fault Tree Analysis, Weibull Tree Analysis, and Six Sigma (6σ) Methodology
• Proficient in developing and executing comprehensive test plans for assets
• Experience supporting technical initiatives and advocating for high-quality engineering standards
• Certifications in Maintenance & Reliability such as CMRP, CRL, or CRE

Similar Jobs

More Jobs at Meta

More Technical Services Jobs

Find similar Data Center Facility Operations Reliability Engineer jobs: