05 - Site Reliability Engineer
PPM Coachers
A PPM Coachers, com 17 anos de experiência no mercado, atua na capacitação, consultoria e reforço de equipas, apoiando organizações na definição de modelos operacionais, melhoria contínua e transformação ágil.
Porquê a PPM Coachers?
- Participação em projetos estratégicos de grande impacto.
- Possibilidade de colaboração com equipas multidisciplinares e em contextos de evolução digital.
- Acompanhamento próximo, desenvolvimento contínuo e integração numa equipa experiente e orientada para a excelência.
Integrar uma equipa internacional de tecnologia, assumindo um papel ativo na operação, monitorização e fiabilidade de aplicações distribuídas em ambiente cloud. A função envolve a gestão operacional de workloads em Azure e Kubernetes, o diagnóstico de incidentes complexos e a colaboração com equipas de plataforma e de desenvolvimento para garantir a disponibilidade, o desempenho e a resiliência dos serviços.
- Assumir a responsabilidade técnica de primeira linha pelas aplicações executadas em diferentes localizações regionais.
- Realizar diagnósticos aprofundados ao nível dos serviços, recorrendo a ferramentas de observabilidade como Grafana, Loki e Mimir, bem como métricas, logs e traces.
- Monitorizar e analisar o comportamento de aplicações distribuídas e microserviços.
- Trabalhar com bases de dados e sistemas de messaging para identificar e resolver problemas ao nível dos serviços.
- Participar na resposta a incidentes, na análise de causa raiz (RCA) e na recuperação dos serviços.
- Operar e suportar workloads executados em plataformas Kubernetes baseadas em Microsoft Azure.
- Analisar o ciclo de vida dos pods, networking, storage, scaling e diferentes cenários de falha em Kubernetes.
- Colaborar com as equipas de Platform Engineering na resolução de problemas ao nível dos clusters.
- Trabalhar em conjunto com as equipas de desenvolvimento na resolução de problemas ao nível das aplicações e serviços.
- Identificar e reportar bugs e problemas às equipas de Product e Platform quando estes não puderem ser resolvidos através de diagnóstico técnico.
- Contribuir para a melhoria contínua da fiabilidade, disponibilidade e performance dos sistemas.
- Trabalhar com práticas de GitOps, CI/CD e Infrastructure as Code (IaC).
- Utilizar tecnologias como Helm, Kustomize, Terraform, Git, Azure DevOps e ArgoCD.
- Trabalhar com diferentes tecnologias de bases de dados e messaging, incluindo MongoDB, Microsoft SQL Server, PostgreSQL e Kafka.
- Licenciatura em Engenharia Informática, Computer Science, Engenharia ou área equivalente, sendo valorizada a experiência profissional equivalente.
- Mínimo de 5 anos de experiência em funções de Site Reliability Engineer (SRE) ou funções similares.
- Experiência sólida e prática com Kubernetes e ambientes containerizados.
- Experiência com Microsoft Azure e plataformas cloud.
- Conhecimentos de Kubernetes ao nível de pod lifecycle, networking, storage, scaling e troubleshooting.
- Experiência com ferramentas de observabilidade, incluindo Grafana, Loki, Mimir, métricas, logs e traces.
- Experiência com bases de dados e sistemas de messaging, nomeadamente MongoDB, Microsoft SQL Server, PostgreSQL e Kafka.
- Conhecimentos de Helm e Kustomize.
- Experiência com sistemas de controlo de versões e CI/CD, nomeadamente Git, Azure DevOps e ArgoCD.
- Conhecimentos de Infrastructure as Code (IaC), preferencialmente Terraform.
- Experiência em troubleshooting, incident management e root cause analysis.
- Forte capacidade analítica e de resolução de problemas técnicos complexos.
- Boa capacidade de comunicação e colaboração com equipas multidisciplinares.
- Experiência em ambientes internacionais e equipas de trabalho em inglês.
- Domínio de inglês, escrito e falado (obrigatório).
- Certificação AZ-104 – Microsoft Azure Administrator Associate, CKA – Certified Kubernetes Administrator ou experiência equivalente será valorizada.
- Residência em Portugal definitiva e documentação válida para trabalho no país.
Modelo de trabalho: Híbrido (2x)