Site Reliability Engineer Sr.

🏢 Acciona IT · all Acciona IT jobs
📍 Argentina
📅 Posted 2026-07-22 · via Himalayas
🏷 Site-Reliability-Engineering,DevOps,Cloud-Infrastructure,Platform-Engineering,SRE,Senior-Site-Reliability-Engineer,Senior-Site-Reliability-Engineering-Architect,Principal-Site-Reliability-Engineer,Site-Reliability-Engineering-Manager,Staff-Site-Reliability-Engineer-(SRE),Site-Reliability-Engineering-Lead
Apply on original site ↗

Site Reliability Engineer Sr. (SRE)
Ubicación
- 100% Remoto

Proyecto

- Asignación para proyecto internacional con equipo de Estados Unidos.

- Ambiente altamente colaborativo y orientado a la confiabilidad, automatización y escalabilidad de plataformas críticas.

Idioma
- Inglés avanzado (oral y escrito) excluyente.

Sobre la posición

Buscamos un/a Site Reliability Engineer Sr. (SRE) con sólida experiencia en infraestructura cloud, automatización, observabilidad y gestión de entornos productivos. La persona será responsable de garantizar la confiabilidad, disponibilidad, escalabilidad y rendimiento de las plataformas, trabajando estrechamente con equipos de desarrollo e infraestructura.
Requisitos
Experiencia

- Más de 5 años de experiencia en posiciones de Site Reliability Engineering, DevOps o Infraestructura.

- Experiencia trabajando en entornos de producción críticos.

- Experiencia en gestión y resolución de incidentes.

- Conocimientos sólidos de administración de sistemas Linux/Unix.

Formación
- Título universitario en Ciencias de la Computación, Ingeniería o carreras afines.

Conocimientos técnicos

- Cloud Platforms: AWS, Azure o Google Cloud Platform.

- Infraestructura como Código (IaC), preferentemente Terraform.

- Automatización y scripting con Python, Bash o tecnologías similares.

- Contenedores y orquestación: Docker y Kubernetes.

- CI/CD: Jenkins, GitHub Actions, GitLab CI o herramientas equivalentes.

- Implementación y gestión de soluciones de monitoreo, logging y alertas.

- Conocimientos de sistemas distribuidos, networking y diseño de arquitecturas escalables.

- Experiencia trabajando con métricas de confiabilidad como SLIs, SLOs y SLAs.

Principales responsabilidades
Automatización y eficiencia operativa

- Automatizar procesos operativos, despliegues, aprovisionamiento y monitoreo.

- Desarrollar scripts y herramientas internas.

- Diseñar, implementar y optimizar pipelines de CI/CD.

- Reducir tareas manuales y repetitivas mediante automatización.

Gestión de infraestructura cloud

- Provisionar y mantener infraestructura en AWS, Azure o GCP.

- Gestionar infraestructura mediante Terraform u otras herramientas IaC.

- Garantizar escalabilidad, resiliencia y alta disponibilidad.

- Implementar mecanismos de auto-scaling y self-healing.

Confiabilidad y performance

- Monitorear aplicaciones e infraestructura mediante métricas, logs y trazas.

- Definir y mejorar indicadores de servicio (SLIs, SLOs y SLAs).

- Realizar análisis de rendimiento y optimización de sistemas.

- Ejecutar actividades de capacity planning.

Gestión de incidentes

- Participar activamente en incidentes críticos de producción.

- Realizar troubleshooting y resolución de problemas complejos.

- Liderar análisis de causa raíz (RCA).

- Impulsar acciones de mejora continua para prevenir recurrencias.

Observabilidad

- Implementar y administrar herramientas de monitoreo y alertamiento.

- Diseñar dashboards e indicadores de salud de aplicaciones y plataformas.

- Mejorar la visibilidad end-to-end de los sistemas.

Colaboración con equipos de desarrollo

- Trabajar junto a equipos de ingeniería para mejorar arquitectura y despliegues.

- Promover buenas prácticas de código resiliente y escalable.

- Integrar prácticas DevOps y SRE dentro del ciclo de desarrollo.

Resiliencia y continuidad operativa

- Implementar prácticas de Chaos Engineering.

- Ejecutar pruebas de carga y estrés.

- Garantizar estrategias de Disaster Recovery y planes de contingencia.

Gobernanza y buenas prácticas

- Definir estándares operativos y de confiabilidad.

- Documentar procesos, procedimientos y arquitecturas.

- Promover y garantizar prácticas de seguridad bajo enfoques DevSecOps.

Originally posted on Himalayas

← All remote jobs