Analista de SRE Pleno - Vaga Afirmativa para Mulheres

🏢 Experian · all 103 jobs
📍 Brazil
📅 Posted Sep 14, 2026 · via Himalayas
🏷 Site Reliability Engineering, Cloud Engineer, Platform Engineering, DevOps, AWS Cloud, Analista De SRE
Apply on original site ↗

Estamos em busca de uma Site Reliability Engineer (SRE) Plena altamente motivada para integrar nossa equipe de Cloud, Data & AI Platform . Nesta função, você será responsável por projetar, operar e aprimorar continuamente a confiabilidade, escalabilidade, observabilidade e desempenho de plataformas cloud-native que suportam aplicações críticas para o negócio, pipelines de dados e cargas de trabalho de IA/ML.

Você trabalhará em estreita colaboração com as equipes de Engenharia de Software, Engenharia de Dados, Engenharia de IA e Plataforma para criar sistemas resilientes, automatizar operações, melhorar a experiência dos desenvolvedores e estabelecer as melhores práticas de confiabilidade em toda a organização.

Como engenheira plena, você desempenhará um papel fundamental no avanço da excelência operacional por meio de automação, observabilidade, gestão de incidentes, otimização de custos e modernização da infraestrutura.
Principais Responsabilidades:

- Projetar e operar plataformas em nuvem altamente disponíveis, escaláveis e seguras na AWS.

- Construir e manter infraestrutura baseada em Kubernetes para suportar aplicações, dados e cargas de trabalho de IA.

- Melhorar a confiabilidade da plataforma por meio de automação, Infraestrutura como Código (IaC) e recursos de autoatendimento (self-service).

- Implementar e aprimorar soluções de observabilidade utilizando Datadog, incluindo monitoramento, logs, rastreamento (tracing), alertas, dashboards e gestão de SLOs.

- Suportar e otimizar ambientes de processamento de dados em larga escala utilizando Airflow, Amazon EMR, S3 e outros serviços de dados da AWS.

- Trabalhar em parceria com as equipes de Dados e IA para melhorar a confiabilidade, escalabilidade e maturidade operacional de plataformas de Machine Learning e Inteligência Artificial.

- Liderar atividades de resposta a incidentes, análises de causa raiz e revisões pós-incidente, promovendo a melhoria contínua.

- Definir e medir Indicadores de Nível de Serviço (SLIs), Objetivos de Nível de Serviço (SLOs) e orçamentos de erro (error budgets).

- Aprimorar processos de implantação, pipelines de CI/CD e a confiabilidade das releases.

- Otimizar a utilização, desempenho e custos da infraestrutura em nuvem.

- Mentorar membros da equipe e promover as melhores práticas de SRE em toda a organização de engenharia.

O que define o sucesso nessa função

- Aumento da disponibilidade e confiabilidade da plataforma.

- Melhoria da observabilidade e redução do tempo de resolução de incidentes.

- Maior automação e redução de esforços operacionais manuais e repetitivos.

- Plataformas de Dados e IA confiáveis, escaláveis e com eficiência de custos.

- Forte colaboração com as equipes de Engenharia para entregar sistemas de produção resilientes.

Qualificações obrigatórias

- Ensino Superior cursando/completo.

- Experiência sólida em Site Reliability Engineering, Platform Engineering, Cloud Engineering ou funções de DevOps.

- Forte experiência prática com serviços AWS e arquiteturas cloud-native.

- Conhecimento profundo de Kubernetes e workloads conteinerizadas em ambientes de produção.

- Experiência na gestão e resolução de problemas em sistemas distribuídos de grande escala.

- Sólida experiência com plataformas de observabilidade, preferencialmente Datadog.

- Experiência no suporte a plataformas e fluxos de dados utilizando tecnologias como Airflow, EMR, Spark e S3.

- Expertise em Infraestrutura como Código (IaC) utilizando Terraform ou ferramentas similares.

- Experiência na construção e manutenção de pipelines de CI/CD e automação de plataformas.

- Sólidos conhecimentos em Linux, redes e troubleshooting de desempenho de sistemas.

- Proficiência em scripts e automação utilizando Python, Bash ou linguagens similares.

Qualificações desejáveis

- Experiência no suporte a plataformas cloud-native de grande escala em ambientes AWS.

- Experiência com operações de plataformas Kubernetes e gerenciamento do ciclo de vida

← All remote jobs

Want more like this? Browse every live remote developer role.All remote developer jobs →

Get remote developer jobs like this by email

One weekly digest. No spam, unsubscribe anytime.

Similar for you