Buscamos uma pessoa Especialista DevOps Pleno ou Sênior, com experiência prática em Google Cloud Platform, Kubernetes e CI/CD. Essa pessoa será responsável por construir e evoluir ambientes seguros, escaláveis, observáveis e resilientes, trabalhando em parceria com os times de engenharia em clientes da NEKI. Procuramos alguém com forte capacidade de automação, resolução de problemas e melhoria contínua, além de boa comunicação e senso de responsabilidade sobre os ambientes produtivos.
Missão da posição
Projetar, automatizar e operar ambientes seguros, escaláveis e resilientes na Google Cloud Platform (GCP), promovendo boas práticas de infraestrutura como código, observabilidade, segurança e entrega contínua.
Principais responsabilidades
- Criar, evoluir e manter infraestrutura na GCP utilizando Terraform com Git.
- Construir e aprimorar pipelines de CI/CD.
- Administrar ambientes baseados em containers e Kubernetes, especialmente GKE.
- Implantar práticas de observabilidade, incluindo métricas, logs, traces e alertas.
- Automatizar tarefas operacionais e reduzir intervenções manuais.
- Aplicar práticas de segurança, gestão de identidades, segredos e menor privilégio.
- Investigar incidentes, conduzir análises de causa raiz e implementar ações preventivas.
- Apoiar times de desenvolvimento na adoção de práticas DevOps e cloud-native.
- Monitorar custos e contribuir para iniciativas de FinOps.
- Criar e manter documentação técnica, runbooks e procedimentos operacionais.
- Participar de plantões ou sobreavisos, quando aplicável.
Conhecimentos técnicos obrigatórios
- Experiência prática com serviços da GCP, principalmente:
- GKE;
- Compute Engine;
- Cloud Run;
- Cloud Storage;
- Cloud SQL;
- VPC, Load Balancing, Cloud DNS e Cloud NAT;
- IAM e service accounts;
- Secret Manager;
- Cloud Monitoring e Cloud Logging.
- Infraestrutura como código com Terraform.
- Containers com Docker.
- Kubernetes em ambientes de produção.
- Pipelines de CI/CD com ferramentas como GitHub Actions, desejável Cloud build
- Básico de administração de sistemas Linux.
- Básico na automação com Bash, Python ou linguagem equivalente.
- Git e estratégias de versionamento.
- Conceitos de redes, DNS, HTTP/TLS, balanceamento de carga e firewalls.
- Observabilidade, gestão de incidentes e troubleshooting.
- Boas práticas de segurança em nuvem.
Conhecimentos desejáveis
- Helm, Kustomize ou ferramentas equivalentes.
- GitOps com Argo CD ou Flux.
- Prometheus, Grafana e OpenTelemetry.
- Service mesh, preferencialmente Istio.
- Arquiteturas orientadas a eventos com Pub/Sub.
- Bancos de dados gerenciados e estratégias de backup e recuperação.
- Práticas de SRE, incluindo SLI, SLO, SLA, error budgets e post-mortems.
- FinOps e otimização de custos em cloud.
- Ambientes multi-cloud ou híbridos.
- Certificações Google Cloud, especialmente Professional Cloud DevOps Engineer, Professional Cloud Architect ou Associate Cloud Engineer.
Competências comportamentais
- Capacidade analítica e abordagem estruturada para resolução de problemas.
- Comunicação clara com públicos técnicos e não técnicos.
- Senso de responsabilidade sobre disponibilidade e segurança dos ambientes.
- Organização e disciplina na documentação das soluções.
- Colaboração com engenharia, segurança, dados e produto.
- Postura preventiva e foco em automação e melhoria contínua.
- Capacidade de atuar com autonomia, prioridades concorrentes e incidentes críticos.
Diferenciação de senioridade
Nível Pleno
Espera-se que a pessoa:
- Tenha experiência relevante em infraestrutura, cloud ou DevOps.
- Implemente soluções a partir de arquiteturas e padrões já estabelecidos.
- Opere ambientes produtivos com autonomia na maioria das atividades.
- Resolva incidentes de média complexidade.
- Contribua para automações, pipelines e módulos de infraestrutura.
- Saiba identificar riscos e solicitar apoio em decisões de maior impacto.
Nível Sênior
Espera-se que a pessoa:
- Tenha experiência relevante, com atuação consistente em ambientes produtivos críticos.
- Defina arquiteturas, padrões técnicos e estratégias de evolução da plataforma.
- Antecipe riscos relacionados a segurança, disponibilidade, desempenho e custos.
- Lidere tecnicamente incidentes críticos e análises de causa raiz.
- Influencie decisões entre diferentes equipes.
- Desenvolva profissionais menos experientes por meio de mentoria e revisão técnica.
- Traduza necessidades de negócio em decisões de infraestrutura sustentáveis.
- Questione soluções existentes e proponha melhorias com base em dados.
