Engenheiro(a) de Observabilidade

  • Início
  • Engenheiro(a) de Observabilidade

Remoto, Brasil · senior · remote · pj

Engenheiro(a) de Observabilidade

Buscamos um(a) Engenheiro(a) de Observabilidade sênior para dar visibilidade real do que acontece em produção, sem afogar o time em alerta que ninguém lê. Você vai instrumentar aplicações, centralizar logs e métricas, e construir dashboards que realmente respondem perguntas.

O trabalho exige critério: nem todo dado precisa virar métrica, nem todo desvio precisa virar alerta. Você define o que é sinal e o que é ruído, e constrói runbooks que ajudam quem está de plantão a agir, não só a se preocupar.

Esperamos alguém que usa IA para acelerar correlação de sinais e criação de dashboards, mas valida cada alerta com critério de negócio antes de ativá-lo.

Dê visibilidade real do que acontece em produção, sem ruído desnecessário.

Responsabilidades

  • Instrumentar aplicações com logs, métricas e traces estruturados.
  • Centralizar dados de observabilidade e definir retenção adequada ao contexto.
  • Construir dashboards que respondem perguntas reais de negócio e operação.
  • Definir alertas com critério, evitando ruído e fadiga de alerta no time.
  • Criar e manter runbooks de incidente acionáveis.
  • Colaborar com SRE e engenharia na definição de sinais críticos de saúde do sistema.
  • Usar IA para acelerar correlação de sinais e criação de dashboards e alertas.

Requisitos

  • Experiência sólida instrumentando aplicações e construindo stacks de observabilidade.
  • Domínio de ferramentas de logs, métricas e tracing distribuído.
  • Conhecimento de arquitetura de sistemas para identificar sinais críticos por serviço.
  • Experiência prática com ambientes cloud onde a stack de observabilidade roda.
  • Uso prático de IA para correlacionar sinais e acelerar criação de dashboards.
  • Comunicação clara para traduzir dado técnico em informação acionável para o time.

Diferenciais

  • Experiência com OpenTelemetry e instrumentação padronizada.
  • Vivência com stacks open source (Prometheus, Loki, Grafana) e managed (Datadog, New Relic).
  • Conhecimento de SLIs/SLOs e cultura de error budget.
  • Experiência reduzindo MTTR em ambientes de alta criticidade.
  • Certificações em observabilidade ou cloud.

PrometheusGrafanaLokiOpenTelemetryAWS

Benefícios

  • Modelo remoto e flexível: você organiza sua rotina em torno das entregas, não do relógio.
  • Verba de crescimento para cursos, certificações e eventos técnicos.
  • Auxílio saúde e bem-estar.
  • Acesso e propriedade real sobre o stack de ferramentas e IA que usamos no dia a dia de engenharia.
  • Cultura orientada a resultado: entregou bem, tem autonomia para decidir como e quando trabalhar.
  • Squads enxutos e sêniores, com espaço real para decisão técnica.