Engenheiro(a) de Observabilidade
- Início
- Engenheiro(a) de Observabilidade
Remoto, Brasil · senior · remote · pj
Engenheiro(a) de Observabilidade
Buscamos um(a) Engenheiro(a) de Observabilidade sênior para dar visibilidade real do que acontece em produção, sem afogar o time em alerta que ninguém lê. Você vai instrumentar aplicações, centralizar logs e métricas, e construir dashboards que realmente respondem perguntas.
O trabalho exige critério: nem todo dado precisa virar métrica, nem todo desvio precisa virar alerta. Você define o que é sinal e o que é ruído, e constrói runbooks que ajudam quem está de plantão a agir, não só a se preocupar.
Esperamos alguém que usa IA para acelerar correlação de sinais e criação de dashboards, mas valida cada alerta com critério de negócio antes de ativá-lo.
Dê visibilidade real do que acontece em produção, sem ruído desnecessário.
Responsabilidades
- Instrumentar aplicações com logs, métricas e traces estruturados.
- Centralizar dados de observabilidade e definir retenção adequada ao contexto.
- Construir dashboards que respondem perguntas reais de negócio e operação.
- Definir alertas com critério, evitando ruído e fadiga de alerta no time.
- Criar e manter runbooks de incidente acionáveis.
- Colaborar com SRE e engenharia na definição de sinais críticos de saúde do sistema.
- Usar IA para acelerar correlação de sinais e criação de dashboards e alertas.
Requisitos
- Experiência sólida instrumentando aplicações e construindo stacks de observabilidade.
- Domínio de ferramentas de logs, métricas e tracing distribuído.
- Conhecimento de arquitetura de sistemas para identificar sinais críticos por serviço.
- Experiência prática com ambientes cloud onde a stack de observabilidade roda.
- Uso prático de IA para correlacionar sinais e acelerar criação de dashboards.
- Comunicação clara para traduzir dado técnico em informação acionável para o time.
Diferenciais
- Experiência com OpenTelemetry e instrumentação padronizada.
- Vivência com stacks open source (Prometheus, Loki, Grafana) e managed (Datadog, New Relic).
- Conhecimento de SLIs/SLOs e cultura de error budget.
- Experiência reduzindo MTTR em ambientes de alta criticidade.
- Certificações em observabilidade ou cloud.
PrometheusGrafanaLokiOpenTelemetryAWS
Benefícios
- Modelo remoto e flexível: você organiza sua rotina em torno das entregas, não do relógio.
- Verba de crescimento para cursos, certificações e eventos técnicos.
- Auxílio saúde e bem-estar.
- Acesso e propriedade real sobre o stack de ferramentas e IA que usamos no dia a dia de engenharia.
- Cultura orientada a resultado: entregou bem, tem autonomia para decidir como e quando trabalhar.
- Squads enxutos e sêniores, com espaço real para decisão técnica.
