Site Reliability Engineer
Posted 1hrs ago
Employment Information
Report this job
Job expired or something wrong with this job?
Job Description
Site Reliability Engineer automatizando, observando y fortaleciendo servicios críticos para EX Squared LATAM, empresa de transformación digital. Gestión de incidentes, confiabilidad cloud y despliegues CI/CD.
Responsibilities:
- Diseñar e implementar soluciones de automatización para reducir tareas operativas manuales y repetitivas en ambientes productivos.
- Implementar y evolucionar prácticas de observabilidad utilizando métricas, logs y trazas.
- Definir y mantener SLIs y SLOs con equipos de desarrollo y stakeholders del negocio.
- Participar en la atención de incidentes y esquemas de on-call, realizando diagnóstico, contención y recuperación de servicios.
- Liderar y documentar análisis post-incidente y Root Cause Analysis (RCA), identificando oportunidades de mejora y acciones preventivas.
- Promover el modelo “you build it, you run it”.
- Diseñar y mantener mecanismos de control de cambios y despliegues integrados a pipelines de CI/CD.
- Analizar capacidad, performance y comportamiento bajo carga de los servicios, proponiendo mejoras de arquitectura o configuración.
- Evaluar y fortalecer la resiliencia, disponibilidad y recuperación ante fallas de plataformas y servicios.
- Documentar estándares, procedimientos, runbooks y buenas prácticas de Site Reliability Engineering.
- Trabajar cercanamente con equipos de desarrollo y plataforma.
Requirements:
- Experiencia profesional en Site Reliability Engineering, DevOps, Cloud, Infrastructure, Systems Engineering u Operations.
- Experiencia hands-on trabajando con servicios críticos y ambientes productivos.
- Sólidos conocimientos de Linux y troubleshooting de infraestructura y aplicaciones.
- Experiencia con plataformas de cloud computing.
- Experiencia en monitoreo y observabilidad mediante métricas, logs, trazas y alertamiento.
- Experiencia atendiendo incidentes de producción, troubleshooting y Root Cause Analysis.
- Conocimiento de conceptos de SLI, SLO y SLA y su aplicación en la gestión de confiabilidad.
- Experiencia con automatización y scripting.
- Conocimiento de CI/CD y procesos modernos de deployment.
- Experiencia con Infrastructure as Code, idealmente Terraform.
- Conocimiento de principios de alta disponibilidad, resiliencia, disaster recovery y escalabilidad.
- Capacidad para trabajar de manera colaborativa con equipos de desarrollo, infraestructura y operaciones.
- Deseable experiencia con AWS y arquitecturas cloud-native.
- Deseable experiencia con Terraform y automatización de infraestructura.
- Deseable experiencia con Docker y Kubernetes.
- Deseable conocimiento de herramientas de observabilidad como Prometheus, Grafana, Datadog, Splunk, CloudWatch o equivalentes.
- Deseable experiencia trabajando con estrategias de High Availability y Disaster Recovery.
- Deseable experiencia en análisis de capacidad, performance y escalabilidad.
- Deseable experiencia participando en esquemas de on-call y gestión de incidentes críticos.
- Deseables certificaciones relacionadas con AWS, Cloud Operations o Site Reliability Engineering.
Benefits:
- Seguro médico privado.
- Asociación solidarista.
- Vacaciones y feriados de acuerdo con la legislación de Costa Rica.
- Oportunidades de aprendizaje y crecimiento profesional.
- Participación en proyectos tecnológicos de alto impacto.



















