[Infra] Especialista II de Infraestrutura de Cloud (IA)
- Publicação
- 24 de mar. de 2026
- Última verificação
- 14 de set. de 2026
- Fonte responsável
- TOTVS — via ATS TOTVS
Sobre a vaga
Arquitetar, evoluir e operar a infraestrutura da plataforma de IA da Cloud TOTVS de forma segura, escalável e sustentável, garantindo previsibilidade operacional, baixo acoplamento tecnológico e eficiência financeira, suportando os serviços de inferência e suas dependências ao longo do crescimento dos produtos de IA da companhia.
Responsabilidades e atribuições
Arquitetar e operar infraestrutura de inferência e suporte a treinamento e fine-tuning de modelos (GPU-first), em ambientes on-premises, cloud e serviços externos. Definir arquitetura física e lógica (rede, isolamento, alta disponibilidade, capacidade e resiliência). Planejar e executar a implantação da plataforma de IA, garantindo compatibilidade entre hardware, SO, drivers, CUDA, Kubernetes e stacks de inferência.
Operar a plataforma de inferência em produção, assegurando disponibilidade, desempenho e continuidade. Atuar na resolução de incidentes complexos (GPUs, Kubernetes, redes, storage e workloads de IA). Aplicar práticas de SRE (SLOs, SLIs, error budgets e gestão de incidentes). Operar e evoluir stacks de inferência (comerciais e open source), garantindo portabilidade e mitigação de lock-in. : Triton, NIM).
Arquitetar e operar clusters Kubernetes para IA (multi-tenant, scheduling de GPU, filas, concorrência, backpressure e escala). Implementar observabilidade full stack (infraestrutura, GPUs, Kubernetes e serviços de inferência). Garantir visibilidade de consumo de recursos, capacidade, riscos operacionais e impacto financeiro. Apoiar capacity planning e planejamento orçamentário. Integrar práticas de DevSecOps ao ciclo completo da plataforma.
Garantir conformidade com segurança, auditoria, acessos e segregação de ambientes. Disseminar padrões técnicos, boas práticas e conhecimento (documentação e mentoria). Apoiar fóruns técnicos e decisões estratégicas relacionadas à infraestrutura de IA.
Requisitos e qualificações
Experiência mínima de 5 anos em infraestrutura de TI, cloud ou sistemas distribuídos em ambientes críticos. Experiência em arquitetura e operação de sistemas distribuídos (preferencialmente com dados, analytics ou IA). Vivência em equipes multidisciplinares com interação com produto, dados, segurança e arquitetura. Graduação em TI, Engenharia, Ciência da Computação ou áreas correlatas. Inglês avançado (leitura, escrita e conversação técnica).
Domínio de sistemas distribuídos (concorrência, balanceamento, filas, isolamento e backpressure). Experiência sólida com Kubernetes (EKS, GKE, AKS, scheduling avançado, multi-tenant). Conhecimento avançado em ambientes de missão crítica (alta disponibilidade e resiliência). Domínio de redes (TCP/IP, DNS, load balancers, firewalls, SDN). Experiência com storage para workloads intensivos em I/O e larga escala. Experiência com cloud pública (AWS, Azure e/ou GCP). Domínio de observabilidade (métricas, logs e traces).
Experiência com Infraestrutura como Código (IaC) e automação. Conhecimento em práticas DevSecOps e SRE. Forte capacidade analítica para resolução de problemas complexos. Comunicação clara e orientada a impacto técnico e operacional. Entendimento de contexto de negócio para embasar decisões técnicas. Requisitos desejáveis: Pós-graduação ou MBA em áreas como Arquitetura de Software, Cloud, Sistemas Distribuídos ou Segurança. Certificações Kubernetes (CKA, CKAD ou CKS).
Certificações Linux (LPIC-3, RHCE ou equivalente). Certificações em cloud (AWS, Azure ou GCP). Certificações NVIDIA (NCP - AI ou NCA - AI). : CISSP, CCSK, TOGAF).
Tenho aderência a esta vaga?Compare seu perfil com os requisitos antes de se candidatar.Verificar minha aderência
Revise os requisitos obrigatórios antes de decidir.
Não deixe de se candidatar apenas por não cumprir itens desejáveis. Dê prioridade aos requisitos explicitamente obrigatórios e nunca invente experiências.Fonte: TOTVS — via ATS TOTVS