Por favor, actualiza tu navegador para tener una mejor experiencia, prueba con Chrome, Internet explorer.
Gracias por haberte postulado a la oferta de empleo Ingeniero/a sre2 - site reliability engineer, en Digital profit colombia s.a.s.
En Digital Profit estamos buscando un/a Ingeniero/a SRE2 – Site Reliability Engineer, para fortalecer la confiabilidad, resiliencia y disponibilidad de servicios digitales (SECTOR ASEGURADOR)
¿Qué buscamos?
Profesional en Ingeniería de Sistemas, Electrónica, Telecomunicaciones o carreras afines.
Deseable especialización en Ingeniería de Software, Arquitectura TI o áreas relacionadas.
Experiencia: 3 a 5 años en operación de servicios digitales de misión crítica.
Certificaciones: SRE Foundation (requerida)
¿Cuál será tu reto?
Implementar técnicamente las prácticas de Site Reliability Engineering (SRE) en las tribus asignadas, liderar la resolución de incidentes mayores, impulsar mejoras estructurales de confiabilidad y transferir conocimiento a los SRE1, trabajando con autonomía y mínimo acompañamiento.
Monitoreo & Observabilidad
• Instrumentalizar la observabilidad en las tribus.
• Impulsar la adopción de prácticas de observabilidad.
• Mejorar el SLO Score.
• Coordinar y gestionar necesidades de monitoreo y observabilidad.
SLIs & SLOs
• Implementar los SLIs y SLOs definidos con el dueño del servicio.
• Configurar alertas y tableros.
• Dar seguimiento a los indicadores de confiabilidad de los servicios.
Presupuesto de Error
• Liderar la aplicación de la política de Error Budget.
• Participar desde el Planning.
• Recomendar prioridades de acuerdo con los niveles de confiabilidad.
• Aplicar las reglas de decisión establecidas.
Automatización & reducción de Toil
• Identificar y priorizar oportunidades de automatización.
• Diseñar y liderar iniciativas para reducir Toil.
• Implementar mejoras que disminuyan tareas operativas repetitivas y aumenten la eficiencia.
Ingeniería del Caos
• Diseñar escenarios e hipótesis de prueba.
• Preparar planes y decks para ejercicios de resiliencia.
• Liderar técnicamente las pruebas de Chaos Engineering.
Postmortem & mejora continua
• Liderar el análisis técnico posterior a incidentes.
• Identificar la causa raíz (RCA).
• Definir y priorizar acciones de mejora de confiabilidad.
• Dar seguimiento a las acciones preventivas y correctivas.
Ingeniería de Lanzamiento
• Evaluar el riesgo de confiabilidad asociado a nuevos cambios.
• Identificar desviaciones.
• Proponer mejoras para realizar lanzamientos más seguros y confiables.
?? Incidentes Mayores
Serás parte fundamental del gobierno técnico de incidentes, liderando:
• Resolución técnica.
• Formulación de hipótesis.
• Definición de estrategias de mitigación.
• Validación de recuperación del servicio.
• Coordinación técnica durante situaciones críticas.
?? Buscamos un perfil con mentalidad SRE
Confiabilidad + Observabilidad + Automatización + Resiliencia + Análisis de incidentes + Mejora continua
Una persona con capacidad para pasar de la reacción ante un incidente a la prevención y mejora estructural del servicio.
Ubicación: Bogotá, Colombia
Modalidad: Híbrida 3x2
Contrato: Indefinido
Horario: Lunes a viernes, 8:00 a.m. – 6:00 p.m.
Experiencia: 3 a 5 años
Cuéntales a las empresas lo nuevo: actualiza tu hoja de vida en elempleo.com