Analista Operações Cloud (SRE) | Pleno (13443)

🏢 Sensedia · all Sensedia jobs
📍 Brazil
📅 Posted 2026-08-21 · via Himalayas
🏷 Site-Reliability-Engineering,Cloud-Operations,DevOps,Cloud-Infrastructure,Platform-Engineering,Analista-De-Operações-Cloud,Analista-De-SRE,Analista-De-Operações-De-Sistemas,Analista-De-Operações,SRE-Analyst,Analista-De-Monitoração
Apply on original site ↗

Vaga 100% remota
Aqui a gente conecta o mundo

Sensedia é uma multinacional brasileira provedora de plataforma de gerenciamento de APIs, governança de agentes e soluções de integração, além de serviços profissionais. A companhia impulsiona a transformação digital de grandes empresas habilitando arquiteturas mais ágeis, modernas e escaláveis, possibilitando assim que seus clientes ofereçam produtos e experiências digitais a todo o seu ecossistema.

Trabalhar aqui é pertencer a uma cultura plural, descontraída e inovadora. É para quem tem coragem de ir além, pensar e agir fora da caixa. Preferimos pedir desculpas ao invés de pedir permissão e estamos sempre dispostos a nos transformar, nos reinventar.
Nossas pessoas são incríveis e você pode fazer parte disso tudo. Nos comprometemos em garantir um ambiente de trabalho acolhedor e respeitoso.

Conheça + em nosso site:

Qual a missão do Cargo?

Manter de pé, observável e previsível a plataforma que sustenta as operações de Soluções Open em produção. É um ambiente multi-tenant, em cloud (AWS, Kubernetes, Terraform), onde indisponibilidade não é inconveniente operacional — é descumprimento de obrigação regulatória, com janela de reporte e prazo definidos por regulador. O desafio central é deslocar a operação de reativa para preventiva: construir observabilidade que antecipe problema em vez de constatá-lo depois, e eliminar por automação o trabalho manual repetitivo. A pessoa nesta posição irá responder pelas soluções Open atuando junto de arquitetos cloud e de software, além de desenvolvedores, com responsabilidade compartilhada pelo que está no ar.

Quais serão suas atividades do dia-a-dia?

- Observabilidade e monitoração: Construir e evoluir a monitoração dos ambientes de produção, com foco em antecipar falha; Definir e instrumentar indicadores que representem experiência real de uso, não apenas saúde de recurso; Reduzir ruído de alerta e falso positivo; Manter dashboards que sustentem decisão técnica.

- Automação e redução de toil: Identificar e eliminar trabalho manual repetitivo: provisionamento, configuração, rotinas operacionais; Evoluir infraestrutura como código (Terraform, Helm) como fonte única de verdade; Desenvolver scripts e automações em Python e Shell para operações recorrentes; Converter procedimento não documentado em runbook executável.

- Sustentação e resposta a incidente: Atuar na triagem, mitigação e resolução de incidentes de produção; Documentar e apoiar post-mortem com foco em causa raiz e ação preventiva; Sustentar os ambientes junto do time de engenharia; Acompanhar consumo e custo de infraestrutura, gerando visibilidade para decisão técnica

Quais são os requisitos obrigatórios para esse cargo?

Experiência demonstrável, não familiaridade conceitual:

- Ter operado Kubernetes em produção: debug de pod, análise de consumo de recurso, entendimento de modos de falha Cloud em ambiente de missão crítica — AWS preferencialmente

- Ter escrito e mantido infraestrutura como código com Terraform e Helm, incluindo revisão de mudança de outra pessoa

- Ter construído monitoração com Prometheus e Grafana: criação de métrica e regra de alerta, não apenas consumo de dashboard pronto

- Troubleshooting em Linux com autonomia: serviços, processos, rede, disco, análise de log

- Automações em Python ou Shell que outras pessoas passaram a usar

- Participação em resposta a incidente de produção, com clareza sobre quando resolver e quando escalar

- Conhecimento de rede suficiente para investigar: segmentação, DNS, TLS, VPN, ferramentas de debug

Quais serão os requisitos diferencias para este cargo?

- Experiência em ambiente regulado: financeiro, seguros ou similar

- Vivência com APIs, REST e gateway de API

- Gerenciamento de logs em escala (Elasticsearch, OpenSearch, Loki ou equivalente)

- Construção e manutenção de pipelines de CI/CD

- Prática de definição de SLI e SLO, e uso de error budget para orientar decisão

- Configuração como código (Ansible

← All remote jobs