Ingénieur SRE HF
Job Summary
Dans le cadre du maintien en conditions opérationnelles du SI le SRE intervient pour garantir la fiabilité la disponibilité et la performance des services en sappuyant sur des outils dobservabilité et des pratiques orientées automatisation et amélioration continue.
Objectifs
- Assurer la disponibilité et la performance des services du SI RC
- Réduire les incidents et améliorer la résilience des systèmes
- Mettre en place des actions préventives pour éviter les dégradations de service
- Faciliter lexploitation via lobservabilité et lautomatisation
Missions principales
- Maintien en conditions opérationnelles
- Surveiller le SI et traiter les alertes selon les engagements de service (SLA/SLO)
- Diagnostiquer et résoudre les incidents en coordination avec les équipes applicatives et infra
- Contribuer à la gestion des incidents majeurs
- Interventions préventives
- Analyser les tendances (alertes récurrentes saturation dérives de performance)
- Mettre en place des actions préventives (optimisation tuning scaling patching)
- Anticiper les risques via lanalyse des métriques traces et logs
- Participer à la réduction du run correctif au profit du run préventif
- Observabilité & supervision
- Faire évoluer la plateforme dobservabilité
- Concevoir maintenir et améliorer les dashboards Grafana
- Définir et ajuster les alertes Prometheus (seuils pertinence réduction du bruit)
- Améliorer en continu la supervision et la qualité des indicateurs
- Amélioration continue
- Identifier les points de fragilité du SI et proposer des actions correctives et préventives
- Contribuer à la fiabilisation (automatisation standardisation)
- Participer aux retours dexpérience (post-mortem)
- Collaboration & support
- Travailler en lien avec les équipes dev infra et métier
- Apporter un support technique aux équipes pour améliorer lexploitabilité et la robustesse des services
Organisation & contraintes
Plage normale dintervention : 7h30 18h30 (jours ouvrés)
Participation aux astreintes en soirée week-end et jours fériés
Compétences attendues
Bonne maîtrise des outils dobservabilité (Grafana Prometheus)
Connaissance des environnements systèmes réseaux et cloud
Compréhension des concepts SRE : SLA SLO SLI error budget
Capacité danalyse proactive et prévention des incidents
Automatisation (scripts / outils : Bash Python etc.)
Qualifications :
- Formation Bac5 en informatique
- Expérience de plus de 5 ans sur un poste similaire
- Esprit analytique et orienté résolution de problème
- Proactivité et capacité danticipation
- Culture de lamélioration continue
- Bon relationnel et travail transverse
- Rigueur et sens du service
Informations supplémentaires :
10 RTT en plus des 27 jours de congés payés
Des avantages groupes : 9/jour sur votre carte Swile une bonne mutuelle prise en charge de 70% de votre abonnement de transports des indemnités kilométriques vélo
Un CSE : subvention sport et loisir chèques vacances chèques cadeaux
De la flexibilité avec 2 jours de télétravail/semaine en moyenne
Remote Work :
No
Employment Type :
Full-time
About Company
Inetum is a European leader in digital services. Inetums team of 28,000 consultants and specialists strive every day to make a digital impact for businesses, public sector entities and society. Inetums solutions aim at contributing to its clients performance and innovation as well ... View more