Engenheiro(a) de Confiabilidade (SRE)
- Início
- Engenheiro(a) de Confiabilidade (SRE)
Remoto, Brasil · senior · remote · pj
Engenheiro(a) de Confiabilidade (SRE)
Buscamos um(a) Engenheiro(a) de Confiabilidade (SRE) sênior para garantir que sistemas em produção fiquem no ar, e quando não ficarem, que o time descubra e reaja rápido, não depois do cliente reclamar.
Você vai definir SLIs e SLOs relevantes ao negócio, automatizar resposta a incidentes recorrentes e reduzir trabalho manual repetitivo (toil) que consome tempo do time sem gerar valor.
Esperamos alguém que usa IA para acelerar análise de incidentes e correlação de sinais, mas participa de post-mortems com rigor, buscando causa raiz de verdade, não culpado.
Garanta a confiabilidade de sistemas em produção e reduza trabalho manual repetitivo.
Responsabilidades
- Definir e acompanhar SLIs e SLOs relevantes ao negócio para os sistemas em produção.
- Automatizar resposta a incidentes recorrentes e reduzir trabalho manual repetitivo.
- Participar de plantão (on-call) e liderar resposta a incidentes críticos.
- Conduzir post-mortems focados em causa raiz, não em culpados.
- Colaborar com engenharia na definição de arquitetura resiliente a falhas.
- Automatizar capacidade e escalabilidade de sistemas com base em demanda real.
- Usar IA para acelerar análise de incidentes e correlação de sinais de falha.
Requisitos
- Experiência sólida operando sistemas críticos em produção com exigência de alta disponibilidade.
- Domínio de ambientes cloud e automação de infraestrutura como código.
- Conhecimento de arquitetura de sistemas distribuídos para identificar pontos únicos de falha.
- Uso prático de IA para análise de incidentes e correlação de sinais.
- Experiência com testes de resiliência (chaos engineering, load testing).
- Comunicação clara para liderar resposta a incidente sob pressão, com calma e transparência.
Diferenciais
- Experiência com plataformas de observabilidade (Grafana, Prometheus, Datadog).
- Vivência com Kubernetes em ambientes de alta escala.
- Conhecimento de error budgets e cultura de confiabilidade.
- Experiência conduzindo exercícios de chaos engineering.
- Certificações em cloud ou SRE.
KubernetesPrometheusGrafanaAWSTerraform
Benefícios
- Modelo remoto e flexível: você organiza sua rotina em torno das entregas, não do relógio.
- Verba de crescimento para cursos, certificações e eventos técnicos.
- Auxílio saúde e bem-estar.
- Acesso e propriedade real sobre o stack de ferramentas e IA que usamos no dia a dia de engenharia.
- Cultura orientada a resultado: entregou bem, tem autonomia para decidir como e quando trabalhar.
- Squads enxutos e sêniores, com espaço real para decisão técnica.
