[Tech] Especialista SRE | IA | REMOTO
- Publicação
- 22 de ago. de 2026
- Última verificação
- 16 de set. de 2026
- Fonte responsável
- TOTVS — via ATS TOTVS
Sobre a vaga
Você fará parte do time de Site Reliability Engineering (SRE), sendo responsável por estabelecer padrões de qualidade dos serviços de infraestrutura, acompanhando as inovações do mercado e garantindo a excelência do ecossistema tecnológico dos ambientes Cloud TOTVS.
Será responsável por assegurar a confiabilidade, disponibilidade, desempenho, segurança e evolução contínua dos serviços sob sua responsabilidade, atuando como referência técnica na implementação de soluções, automação de processos, observabilidade, governança e melhoria contínua, contribuindo diretamente para os objetivos estratégicos da companhia.
Responsabilidades e atribuições
O QUE VOCÊ VAI FAZER: Monitorar continuamente a saúde dos sistemas, criar alertas eficazes e garantir cobertura proativa de incidentes. Responder rapidamente a incidentes críticos, coordenando mitigação, comunicação e resolução. Gerir mudanças, atualizações e implantações com foco em segurança, estabilidade e disponibilidade. Construir e manter pipelines, bibliotecas e automações para provisionamento, deploy e operação em ambientes Cloud de alta disponibilidade.
Estabelecer e garantir padrões de security by design em infraestrutura, código e dados. Projetar e evoluir soluções de observabilidade ponta a ponta, integrando logs, métricas, traces e eventos. Criar, gerenciar e melhorar indicadores de confiabilidade (SLIs, SLOs, MTTR, MTTA). Conduzir post-mortems blameless e implementar ações corretivas e preventivas. Influenciar decisões arquiteturais e operacionais visando resiliência, escalabilidade e custo eficiente.
Documentar padrões técnicos, playbooks e comunicar impactos técnicos em linguagem de negócio. Definir prioridades estratégicas do backlog de SRE, equilibrando confiabilidade, velocidade de entrega, segurança e custos. Apoiar auditorias, conformidade e governança de segurança em alinhamento com times de risco e compliance. Capacidade de mentorar e influenciar tecnicamente outros times, promovendo cultura de automação, segurança e confiabilidade e fomentando a cultura de ownership sobre sistemas em produção.
Disseminar conhecimento técnico por meio de mentorias, treinamentos, workshops, documentações e apresentações internas e externas, contribuindo para o desenvolvimento da equipe. Buscar continuamente novas tecnologias, soluções e referências de mercado junto a fabricantes e fornecedores, avaliando sua viabilidade técnica e de negócio.
Requisitos e qualificações
O QUE ESPERAMOS DE VOCÊ: Domínio de conceitos avançados de SRE, DevSecOps e gestão de incidentes. js ou Groovy. Experiência com monitoramento e observabilidade distribuída (Prometheus, Grafana, Loki, ELK/Elastic Stack, Datadog, New Relic, OpenTelemetry). Atuação sólida com Cloud pública (GCP, AWS ou equivalente), incluindo provisionamento, automação e otimização de custos. Experiência em CI/CD e DevSecOps avançado, com ferramentas como Git/GitOps, Jenkins, ArgoCD, Maven, SonarQube/Cloud.
Proficiência em contêineres e orquestração (Docker, Kubernetes) e Infraestrutura como Código (Terraform, Ansible, CloudFormation, Chef). Vivência com serviços de mensageria e data streaming como Kafka, Redis Streams, Google Pub/Sub, Dataflow. Experiência com bancos de dados SQL e NoSQL, incluindo PostgreSQL, AloyDB, MySQL, MongoDB, Elasticsearch, BigQuery. Experiência em gestão de incidentes e troubleshooting em sistemas complexos, utilizando PagerDuty, Opsgenie, StatusPage, Splunk ou equivalentes.
Conhecimento em segurança da informação, compliance e governança de ambientes cloud (LGPD, Privacy by Design, SAST/DAST, IAM, Secret Management). Familiaridade com ambientes de alto volume de dados, tráfego e experiência com design resiliente. Experiência ou interesse em DataOps/MLOps, atuando com pipelines de dados e IA em larga escala (desejável). Background em arquitetura e desenvolvimento de software, com domínio de versionamento, APIs, microserviços e padrões REST/gRPC.
Vivência em metodologias ágeis (Scrum, Kanban ou similares). Uso de IA assistiva e ferramentas de produtividade como GitHub Copilot, ChatGPT ou similares (diferencial). Conhecimento de redes TCP/IP, DNS, HTTP/HTTPS, TLS, Load Balancers, CDN, VPN, proxies e troubleshooting de conectividade. Administração avançada Linux, análise de performance, gerenciamento de processos, memória, disco, rede e troubleshooting em ambientes produtivos.
Requisitos desejáveis: SERIA LEGAL SE TIVESSE: Certificações relevantes (AWS, GCP, Kubernetes, ITIL, Security+). Experiência com políticas de segurança como zero-trust. Experiência em FinOps e gestão de custos em ambientes distribuídos. Experiência com blue/green deployments, canary releases e chaos engineering. Experiência com padronização de deploys por templates (Helm/Kustomize). Prática com observabilidade unificada via OpenTelemetry e tracing distribuído.
Vivência em construção de plataformas internas (IDP), uso de Backstage, automação de ambientes. Inglês: Intermediário/Avançado.
Tenho aderência a esta vaga?Compare seu perfil com os requisitos antes de se candidatar.Verificar minha aderência
Revise os requisitos obrigatórios antes de decidir.
Não deixe de se candidatar apenas por não cumprir itens desejáveis. Dê prioridade aos requisitos explicitamente obrigatórios e nunca invente experiências.Fonte: TOTVS — via ATS TOTVS