05 - Site Reliability Engineer

PPM Coachers

Procuras uma empresa sólida nas áreas de Project Management, Business Analysis e Agile Transformation?

A PPM Coachers, com 17 anos de experiência no mercado, atua na capacitação, consultoria e reforço de equipas, apoiando organizações na definição de modelos operacionais, melhoria contínua e transformação ágil.

Porquê a PPM Coachers?

  • Participação em projetos estratégicos de grande impacto.
  • Possibilidade de colaboração com equipas multidisciplinares e em contextos de evolução digital.
  • Acompanhamento próximo, desenvolvimento contínuo e integração numa equipa experiente e orientada para a excelência.

A PPM Coachers está a recrutar para a função de Site Reliability Engineer (SRE) | Azure & Kubernetes!

Integrar uma equipa internacional de tecnologia, assumindo um papel ativo na operação, monitorização e fiabilidade de aplicações distribuídas em ambiente cloud. A função envolve a gestão operacional de workloads em Azure e Kubernetes, o diagnóstico de incidentes complexos e a colaboração com equipas de plataforma e de desenvolvimento para garantir a disponibilidade, o desempenho e a resiliência dos serviços.

  • Assumir a responsabilidade técnica de primeira linha pelas aplicações executadas em diferentes localizações regionais.
  • Realizar diagnósticos aprofundados ao nível dos serviços, recorrendo a ferramentas de observabilidade como Grafana, Loki e Mimir, bem como métricas, logs e traces.
  • Monitorizar e analisar o comportamento de aplicações distribuídas e microserviços.
  • Trabalhar com bases de dados e sistemas de messaging para identificar e resolver problemas ao nível dos serviços.
  • Participar na resposta a incidentes, na análise de causa raiz (RCA) e na recuperação dos serviços.
  • Operar e suportar workloads executados em plataformas Kubernetes baseadas em Microsoft Azure.
  • Analisar o ciclo de vida dos pods, networking, storage, scaling e diferentes cenários de falha em Kubernetes.
  • Colaborar com as equipas de Platform Engineering na resolução de problemas ao nível dos clusters.
  • Trabalhar em conjunto com as equipas de desenvolvimento na resolução de problemas ao nível das aplicações e serviços.
  • Identificar e reportar bugs e problemas às equipas de Product e Platform quando estes não puderem ser resolvidos através de diagnóstico técnico.
  • Contribuir para a melhoria contínua da fiabilidade, disponibilidade e performance dos sistemas.
  • Trabalhar com práticas de GitOps, CI/CD e Infrastructure as Code (IaC).
  • Utilizar tecnologias como Helm, Kustomize, Terraform, Git, Azure DevOps e ArgoCD.
  • Trabalhar com diferentes tecnologias de bases de dados e messaging, incluindo MongoDB, Microsoft SQL Server, PostgreSQL e Kafka.

Requisitos mínimos

  • Licenciatura em Engenharia Informática, Computer Science, Engenharia ou área equivalente, sendo valorizada a experiência profissional equivalente.
  • Mínimo de 5 anos de experiência em funções de Site Reliability Engineer (SRE) ou funções similares.
  • Experiência sólida e prática com Kubernetes e ambientes containerizados.
  • Experiência com Microsoft Azure e plataformas cloud.
  • Conhecimentos de Kubernetes ao nível de pod lifecycle, networking, storage, scaling e troubleshooting.
  • Experiência com ferramentas de observabilidade, incluindo Grafana, Loki, Mimir, métricas, logs e traces.
  • Experiência com bases de dados e sistemas de messaging, nomeadamente MongoDB, Microsoft SQL Server, PostgreSQL e Kafka.
  • Conhecimentos de Helm e Kustomize.
  • Experiência com sistemas de controlo de versões e CI/CD, nomeadamente Git, Azure DevOps e ArgoCD.
  • Conhecimentos de Infrastructure as Code (IaC), preferencialmente Terraform.
  • Experiência em troubleshooting, incident management e root cause analysis.
  • Forte capacidade analítica e de resolução de problemas técnicos complexos.
  • Boa capacidade de comunicação e colaboração com equipas multidisciplinares.
  • Experiência em ambientes internacionais e equipas de trabalho em inglês.
  • Domínio de inglês, escrito e falado (obrigatório).
  • Certificação AZ-104 – Microsoft Azure Administrator Associate, CKA – Certified Kubernetes Administrator ou experiência equivalente será valorizada.
  • Residência em Portugal definitiva e documentação válida para trabalho no país.

Local de trabalho: Lisboa / Setúbal

Modelo de trabalho: Híbrido (2x)

Como aplicar?

Para se candidatar a este emprego, você precisa autorizar em nosso site. Se você ainda não possui uma conta, registre-se.