Engenheiro(a) de Confiabilidade (SRE)

  • Início
  • Engenheiro(a) de Confiabilidade (SRE)

Remoto, Brasil · senior · remote · pj

Engenheiro(a) de Confiabilidade (SRE)

Buscamos um(a) Engenheiro(a) de Confiabilidade (SRE) sênior para garantir que sistemas em produção fiquem no ar, e quando não ficarem, que o time descubra e reaja rápido, não depois do cliente reclamar.

Você vai definir SLIs e SLOs relevantes ao negócio, automatizar resposta a incidentes recorrentes e reduzir trabalho manual repetitivo (toil) que consome tempo do time sem gerar valor.

Esperamos alguém que usa IA para acelerar análise de incidentes e correlação de sinais, mas participa de post-mortems com rigor, buscando causa raiz de verdade, não culpado.

Garanta a confiabilidade de sistemas em produção e reduza trabalho manual repetitivo.

Responsabilidades

  • Definir e acompanhar SLIs e SLOs relevantes ao negócio para os sistemas em produção.
  • Automatizar resposta a incidentes recorrentes e reduzir trabalho manual repetitivo.
  • Participar de plantão (on-call) e liderar resposta a incidentes críticos.
  • Conduzir post-mortems focados em causa raiz, não em culpados.
  • Colaborar com engenharia na definição de arquitetura resiliente a falhas.
  • Automatizar capacidade e escalabilidade de sistemas com base em demanda real.
  • Usar IA para acelerar análise de incidentes e correlação de sinais de falha.

Requisitos

  • Experiência sólida operando sistemas críticos em produção com exigência de alta disponibilidade.
  • Domínio de ambientes cloud e automação de infraestrutura como código.
  • Conhecimento de arquitetura de sistemas distribuídos para identificar pontos únicos de falha.
  • Uso prático de IA para análise de incidentes e correlação de sinais.
  • Experiência com testes de resiliência (chaos engineering, load testing).
  • Comunicação clara para liderar resposta a incidente sob pressão, com calma e transparência.

Diferenciais

  • Experiência com plataformas de observabilidade (Grafana, Prometheus, Datadog).
  • Vivência com Kubernetes em ambientes de alta escala.
  • Conhecimento de error budgets e cultura de confiabilidade.
  • Experiência conduzindo exercícios de chaos engineering.
  • Certificações em cloud ou SRE.

KubernetesPrometheusGrafanaAWSTerraform

Benefícios

  • Modelo remoto e flexível: você organiza sua rotina em torno das entregas, não do relógio.
  • Verba de crescimento para cursos, certificações e eventos técnicos.
  • Auxílio saúde e bem-estar.
  • Acesso e propriedade real sobre o stack de ferramentas e IA que usamos no dia a dia de engenharia.
  • Cultura orientada a resultado: entregou bem, tem autonomia para decidir como e quando trabalhar.
  • Squads enxutos e sêniores, com espaço real para decisão técnica.