[CLOUD] ESPECIALISTA SRE
- Publicação
- 21 de ago. de 2026
- Última verificação
- 8 de set. de 2026
- Fonte responsável
- TOTVS — via ATS TOTVS
Sobre a vaga
Estamos em busca de um(a) SRE para integrar o time responsável pela nova plataforma de IaaS daTOTVS. É um time em formação, com a oportunidade de participar desde o início da definição de arquitetura, padrões de operação e cultura de confiabilidade da plataforma. Mais do que operar infraestrutura, buscamos alguém que trate confiabilidade como produto:automação e IA em primeiro lugar, decisões guiadas por dados e melhoria contínua dos serviços que sustentam a plataforma.
Queremos quem use IA não como enfeite, mas como alavanca real para diagnosticar mais rápido, encontrar causa-raiz e reduzir o esforço operacional.
Responsabilidades e atribuições
Definir, implementar e acompanhar SLIs, SLOs e error budgets para os serviços da plataforma. de IaaS. Construir e evoluir a stack de observabilidade (métricas, logs, traces e alertas), garantindo. visibilidade fim a fim dos serviços. Automatizar provisionamento, configuração e operação da infraestrutura com práticas de. Infrastructure as Code. Atuar na resposta a incidentes, conduzindo diagnósticos, mitigações e post-mortems sem. culpabilização (blameless).
Projetar e operar pipelines de CI/CD e estratégias de deploy seguras (rollbacks, canary, feature. flags). Realizar planejamento de capacidade, análise de performance e otimização de custos na OCI. Reduzir toil por meio de automação, runbooks e ferramentas internas. Colaborar com os times de desenvolvimento na construção de serviços confiáveis por design. (resiliência, escalabilidade, segurança). Contribuir para a cultura de confiabilidade do time, disseminando boas práticas e apoiando.
tecnicamente colegas menos experientes. Incorporar práticas de AIOps na operação: detecção de anomalias, correlação de eventos e. redução de ruído de alertas para que o time foque no que importa. Acelerar troubleshooting e análise de causa-raiz com apoio de IA (análise de logs/traces. sumarização de incidentes, assistentes de diagnóstico), sempre com validação criteriosa antes. de agir.
Requisitos e qualificações
Experiência comprovada como SRE, DevOps Engineer, Platform Engineer ou em operação de. infraestrutura cloud em produção. Sólidos conhecimentos de Linux e fundamentos de redes (TCP/IP, DNS, load balancing. firewalls). Experiência com pelo menos um provedor de nuvem pública (OCI, AWS, Azure ou GCP). Experiência com Infrastructure as Code (Terraform, Pulumi ou similares). Experiência com containers e orquestração (Docker e Kubernetes). Vivência com ferramentas de observabilidade (Prometheus, Grafana, OpenTelemetry ou.
equivalentes). Programação e automação em pelo menos uma linguagem (Go, Python ou similar). Experiência com pipelines de CI/CD (GitHub Actions, Jenkins ou similares). Vivência com práticas de resposta a incidentes e post-mortems. Requisitos desejáveis: Experiência prática com Oracle Cloud Infrastructure (OCI) e suas certificações. Experiência com Pulumi. Vivência na construção de plataformas internas, ofertas de IaaS/PaaS ou produtos de infraestrutura.
Conhecimento de bancos de dados relacionais em produção (PostgreSQL). Experiência com práticas de segurança em cloud (IAM, segregação de redes, gestão de. segredos). Certificações em cloud, Kubernetes (CKA/CKS) ou Linux. Familiaridade com conceitos de Platform Engineering e Team Topologies. Experiência prática com AIOps ou ferramentas de observabilidade com IA (detecção de. anomalias, correlação de eventos, RCA assistido), e/ou uso de LLMs/assistentes no fluxo de operação e troubleshooting.
Tenho aderência a esta vaga?Compare seu perfil com os requisitos antes de se candidatar.Verificar minha aderência
Revise os requisitos obrigatórios antes de decidir.
Não deixe de se candidatar apenas por não cumprir itens desejáveis. Dê prioridade aos requisitos explicitamente obrigatórios e nunca invente experiências.Fonte: TOTVS — via ATS TOTVS