Search by job, company or skills

Site Reliability Engineer

  • Posted 25 days ago
  • Be among the first 10 applicants

Job Description

Key Responsibilities

1. Database Administration & Optimization (Primary Focus)

Database Operations

  • Administer and maintain ESB-related databases (DB2, Oracle, SQL Server, PostgreSQL, MySQL, or equivalent).
  • Perform database installation, configuration, upgrades, patching, and lifecycle management.
  • Manage database schemas, tablespaces, indexes, stored procedures, and jobs supporting the integration platform.
  • Ensure database high availability and disaster recovery readiness.

Performance Tuning

  • Monitor database performance and proactively identify bottlenecks.
  • Analyze slow-running queries and optimize execution plans.
  • Implement indexing strategies and database optimization techniques.
  • Perform capacity planning based on transaction growth and integration workloads.

Backup & Recovery

  • Design and execute backup, restoration, and recovery procedures.
  • Validate backup integrity through regular recovery testing.
  • Establish and maintain RPO/RTO requirements for critical integration databases.

Database Security

  • Manage database access control and privileged accounts.
  • Ensure encryption, audit logging, and compliance requirements are implemented.
  • Collaborate with security teams to remediate vulnerabilities and perform security hardening.

2. ESB Platform Reliability Engineering

Platform Availability

  • Ensure ESB services meet defined SLA, SLO, and availability targets.
  • Maintain platform resilience through proactive monitoring and preventive maintenance.
  • Support middleware platforms such as:
  • IBM Integration Bus (ESB Suite)
  • WebMethods
  • Apache Kafka
  • Red Hat
  • MFT
  • Azure Integration Services
  • Hybrid Integration Platforms

Reliability Management

  • Implement reliability engineering practices and operational standards.
  • Conduct root cause analysis (RCA) and problem management activities.
  • Eliminate recurring incidents through automation and service improvements.

3. Monitoring & Observability

  • Implement monitoring and alerting for databases, ESB runtimes, API gateways, and messaging services.
  • Create operational dashboards and health reports.
  • Monitor:
  • Database performance
  • Queue depth
  • Integration transaction volume
  • Service latency
  • Error rates
  • Infrastructure utilization

Preferred Tools

  • Elastic
  • Splunk
  • OpenSearch

4. Incident & Problem Management

  • Act as escalation point for critical production incidents.
  • Lead incident response activities for integration and database-related outages.
  • Perform post-incident reviews and corrective action tracking.
  • Participate in 24x7 on-call support rotation when required.

Key Activities

  • Incident triage
  • Service restoration
  • Root cause analysis
  • Preventive action implementation
  • Knowledge base maintenance

5. Automation & DevOps

  • Develop automation scripts to reduce operational overhead.
  • Automate:
  • Database maintenance activities
  • Backup validation
  • Health checks
  • Monitoring configurations
  • Deployment verification

Common Technologies

  • Python
  • Shell Scripting
  • PowerShell
  • Terraform
  • Jenkins
  • GitHub Actions

6. Capacity & Performance Management

  • Monitor platform utilization and growth trends.
  • Conduct performance benchmarking and stress testing.
  • Forecast infrastructure and database resource requirements.
  • Recommend scaling strategies for integration workloads.

7. Disaster Recovery & Business Continuity

  • Design and maintain DR procedures for ESB platforms and databases.
  • Participate in periodic DR drills.
  • Ensure service recovery objectives meet business requirements.

8. Governance & Compliance

  • Ensure compliance with enterprise security and operational standards.
  • Maintain operational documentation, runbooks, and architecture diagrams.
  • Support audit and regulatory requirements.

Required Qualifications

Education

  • Bachelor's Degree in Computer Science, Information Systems, Engineering, or related discipline.

Experience

  • 3+ years of experience in SRE, Middleware Operations, Database Administration, or Platform Engineering.
  • 3+ years managing enterprise integration platforms.
  • Proven experience supporting mission-critical production environments.

Technical Skills

Database (Mandatory)

  • DBA
  • Database Performance Tuning
  • Backup & Recovery
  • Replication & High Availability
  • Query Optimization
  • Data Security & Auditing

Integration Technologies

  • Enterprise Service Bus (ESB)
  • API Management
  • Kafka
  • MQ Series
  • ActiveMQ
  • RDQM
  • REST/SOAP Services

Infrastructure

  • Linux Administration
  • Windows Server
  • Kubernetes
  • Docker
  • Public Cloud Platforms (Azure preferred)

Monitoring & Observability

  • Elastic
  • Splunk
  • OpenSearch

Soft Skills

  • Strong analytical and troubleshooting capabilities.
  • Ability to work under pressure during production incidents.
  • Stakeholder communication and coordination skills.
  • Continuous improvement mindset.
  • Strong documentation and knowledge-sharing practices.

More Info

Job Type:
Industry:
Employment Type:

About Company

Job ID: 151559665

Beware of Scammers

We don’t charge money for job offers