Sobre a Vaga
Local de atuação: Remoto
Tempo de Projeto: Indeterminado
Escala: 5x2 (folgas fixas)
Início previsto: Imediato
Atuar como SRE Sênior na sustentação e evolução de serviços críticos de produção (incluindo IoT e integrações), conduzindo diagnósticos complexos, automações e prevenções. Requer autonomia técnica, colaboração com equipes multidisciplinares e espanhol fluente para comunicação diária com clientes e equipes.
Responsabilidades Principais:
Gestão de Incidentes: conduzir criticamente incidentes de produção, acionamentos e comunicação de riscos.
Troubleshooting: investigar falhas em aplicações, APIs, bancos, integrações e infraestrutura, correlacionando logs, métricas e rastreamentos.
Análise de Causa Raiz: Elaborar RCA pós-incidente e acompanhar ações preventivas/corretivas.
Observabilidade e SLOs:
- Evoluir painéis, alertas acionáveis, SLIs, SLOs e error budgets.
• Automação e Resiliência: automatizar rotinas de recuperação, reduzir tarefas manuais e avaliar riscos de mudanças.
• Capacidade e Documentação: Analisar consumo de recursos, gargalos e manter runbooks atualizados.
Requisitos Técnicos (Obrigatório):
• SRE & Nuvem: Sólida experiência em SRE, ambientes críticos, AWS/GCP e redes (Unix/Linux, DNS, HTTP/HTTPS, TLS).
• Containers & GitOps: Kubernetes (diagnóstico de pods/escalabilidade), Terraform, Ansible, Git e ArgoCD.
• Stack & Dados: Diagnóstico de APIs REST, aplicações Java, fundamentos de SQL/NoSQL e automação em Python/Shell.
• Observabilidade & Gestão: Datadog, Dynatrace, Kibana e/ou Grafana; Jira para incidentes/mudanças; Azure DevOps para pipelines de CI/CD.
Requisitos
- Vivência em telecomunicações, IoT, Apigee, OpenShift e testes de resiliência.
- Idioma:
- Espanhol fluente: obrigatório para reuniões, condução de incidentes e comunicação oral/escrita com o cliente.
Benefícios
Não informado.
Vagas semelhantes para você
Selecionadas com base na tecnologia, modalidade, nível e localização desta oportunidade.