Analista de Observabilidade Sênior - Vaga Afirmativa para Mulheres

🏢 Experian · all Experian jobs
📍 Brazil
📅 Posted 2026-08-16 · via Himalayas
🏷 Observability-Engineering,Site-Reliability-Engineering,Infrastructure-Monitoring,DevOps-Engineer,IT-Operations,Analista-De-Monitoração
Apply on original site ↗

Sobre a oportunidade

Estamos em busca de uma pessoa Analista de Observabilidade Sênior para liderar a evolução da estratégia de observabilidade da organização, tendo o Datadog como principal plataforma corporativa de monitoramento e observabilidade .

Esta posição será responsável por definir padrões, promover boas práticas e garantir a implementação de uma abordagem proativa baseada em métricas, logs, traces e indicadores de negócio. O profissional atuará na construção de uma cultura orientada à confiabilidade, apoiando times de Engenharia, Arquitetura, Desenvolvimento, SRE e Operações na identificação antecipada de riscos e na redução contínua de incidentes.

Buscamos alguém com forte conhecimento técnico em Datadog e capacidade de transformar dados operacionais em ações concretas para melhoria da experiência dos usuários, estabilidade das aplicações e eficiência operacional.
Principais responsabilidades

- Atuar como referência técnica e funcional da plataforma Datadog dentro da organização.

- Projetar, implementar e evoluir soluções de observabilidade utilizando os módulos de APM, Infrastructure Monitoring, Logs Management, Dashboards, Real User Monitoring (RUM), Synthetic Monitoring e Continuous Testing.

- Definir padrões corporativos de observabilidade para aplicações, APIs, microsserviços e workloads em cloud.

- Estruturar e manter dashboards executivos, operacionais e analíticos para acompanhamento da saúde das plataformas.

- Desenvolver estratégias de monitoramento proativo baseadas em SLIs, SLOs, SLAs e indicadores de negócio.

- Criar, revisar e otimizar monitores e alertas inteligentes utilizando recursos avançados do Datadog para redução de ruído operacional e falsos positivos.

- Apoiar times de desenvolvimento na instrumentação de aplicações utilizando OpenTelemetry e integrações nativas do Datadog.

- Conduzir análises de causa raiz (RCA) de incidentes críticos e propor ações estruturantes para evitar recorrências.

- Identificar oportunidades de automação, predição de falhas e iniciativas de self-healing.

- Desenvolver treinamentos, playbooks, padrões e documentações relacionados à plataforma Datadog.

- Realizar análises periódicas de capacidade, performance, disponibilidade e experiência do usuário final.

- Atuar como agente de transformação na disseminação da cultura de observabilidade e excelência operacional.

Qualificações Obrigatórias

- Formação superior completa em Ciência da Computação, Engenharia, Sistemas de Informação ou áreas correlatas.

- Experiência avançada com Datadog, atuando tanto na implementação quanto na administração e evolução da plataforma.

- Experiência prática com:
- Datadog APM

- Datadog Infrastructure Monitoring

- Datadog Logs Management

- Datadog Dashboards

- Datadog Monitors

- Monitoring Service Catalog

- Conhecimento avançado dos pilares de observabilidade: Logs, Métricas, Tracing Distribuído

- Experiência em observabilidade de APIs e arquiteturas de microsserviços.

- Experiência com ambientes AWS.

- Vivência em troubleshooting e investigação de incidentes complexos.

- Conhecimento em OpenTelemetry e instrumentação de aplicações.

- Conhecimento de automação utilizando Python, Shell Script ou PowerShell.

- Experiência com Kubernetes, Docker e ecossistemas cloud-native.

- Conhecimento sólido sobre disponibilidade, performance, escalabilidade e confiabilidade de sistemas.

- Capacidade de traduzir indicadores técnicos em impactos para negócio.

- Excelente comunicação e habilidade para atuar com múltiplos stakeholders.

Desejáveis

- Certificação Datadog Certified Associate ou superior.

- Experiência com práticas de SRE (Site Reliability Engineering).

- Experiência em implementação de estratégias de observabilidade para ambientes distribuídos de alta escala.

- Conhecimento em CI/CD e DevSecOps.

- Experiência com automação de resposta a incidentes e processos de self-healing.

- Vivência em governança operacional, gestão de incidentes, Problem Manage

← All remote jobs