Site Reliability Engineer

Posted 1hrs ago

Employment Information

Education
Salary
Experience
Job Type

Report this job

Job expired or something wrong with this job?

Job Description

Site Reliability Engineer automatizando, observando y fortaleciendo servicios críticos para EX Squared LATAM, empresa de transformación digital. Gestión de incidentes, confiabilidad cloud y despliegues CI/CD.

Responsibilities:

  • Diseñar e implementar soluciones de automatización para reducir tareas operativas manuales y repetitivas en ambientes productivos.
  • Implementar y evolucionar prácticas de observabilidad utilizando métricas, logs y trazas.
  • Definir y mantener SLIs y SLOs con equipos de desarrollo y stakeholders del negocio.
  • Participar en la atención de incidentes y esquemas de on-call, realizando diagnóstico, contención y recuperación de servicios.
  • Liderar y documentar análisis post-incidente y Root Cause Analysis (RCA), identificando oportunidades de mejora y acciones preventivas.
  • Promover el modelo “you build it, you run it”.
  • Diseñar y mantener mecanismos de control de cambios y despliegues integrados a pipelines de CI/CD.
  • Analizar capacidad, performance y comportamiento bajo carga de los servicios, proponiendo mejoras de arquitectura o configuración.
  • Evaluar y fortalecer la resiliencia, disponibilidad y recuperación ante fallas de plataformas y servicios.
  • Documentar estándares, procedimientos, runbooks y buenas prácticas de Site Reliability Engineering.
  • Trabajar cercanamente con equipos de desarrollo y plataforma.

Requirements:

  • Experiencia profesional en Site Reliability Engineering, DevOps, Cloud, Infrastructure, Systems Engineering u Operations.
  • Experiencia hands-on trabajando con servicios críticos y ambientes productivos.
  • Sólidos conocimientos de Linux y troubleshooting de infraestructura y aplicaciones.
  • Experiencia con plataformas de cloud computing.
  • Experiencia en monitoreo y observabilidad mediante métricas, logs, trazas y alertamiento.
  • Experiencia atendiendo incidentes de producción, troubleshooting y Root Cause Analysis.
  • Conocimiento de conceptos de SLI, SLO y SLA y su aplicación en la gestión de confiabilidad.
  • Experiencia con automatización y scripting.
  • Conocimiento de CI/CD y procesos modernos de deployment.
  • Experiencia con Infrastructure as Code, idealmente Terraform.
  • Conocimiento de principios de alta disponibilidad, resiliencia, disaster recovery y escalabilidad.
  • Capacidad para trabajar de manera colaborativa con equipos de desarrollo, infraestructura y operaciones.
  • Deseable experiencia con AWS y arquitecturas cloud-native.
  • Deseable experiencia con Terraform y automatización de infraestructura.
  • Deseable experiencia con Docker y Kubernetes.
  • Deseable conocimiento de herramientas de observabilidad como Prometheus, Grafana, Datadog, Splunk, CloudWatch o equivalentes.
  • Deseable experiencia trabajando con estrategias de High Availability y Disaster Recovery.
  • Deseable experiencia en análisis de capacidad, performance y escalabilidad.
  • Deseable experiencia participando en esquemas de on-call y gestión de incidentes críticos.
  • Deseables certificaciones relacionadas con AWS, Cloud Operations o Site Reliability Engineering.

Benefits:

  • Seguro médico privado.
  • Asociación solidarista.
  • Vacaciones y feriados de acuerdo con la legislación de Costa Rica.
  • Oportunidades de aprendizaje y crecimiento profesional.
  • Participación en proyectos tecnológicos de alto impacto.