The role
03Du möchtest Verantwortung übernehmen, moderne IT-Umgebungen zuverlässig betreiben und den Bereich IT Reliability Engineering aktiv mit aufbauen? Als IT Reliability Engineer bist du Teil unseres Engineering-Teams und übernimmst die Verantwortung für die Stabilität, Überwachung und kontinuierliche Verbesserung bestehender Kundenumgebungen. Du sorgst dafür, dass Systeme zuverlässig betrieben werden, technische Risiken frühzeitig erkannt werden und Monitoring-, Backup-, Update- sowie Lifecycle-Prozesse nachhaltig funktionieren. Dabei leistest du einen wichtigen Beitrag zur Servicequalität und zur langfristigen Stabilität unserer Kundenumgebungen. Die Themen Monitoring, Betriebsstabilität, Lifecycle-Management und technische Qualitätsstandards haben bei MDigital bereits heute einen hohen Stellenwert und werden aktiv durch unser Engineering-Team gelebt. Aufgrund des Unternehmenswachstums und der zunehmenden Bedeutung dieser Aufgaben investieren wir nun gezielt in eine spezialisierte Rolle innerhalb des Engineering-Teams. Da diese Position neu geschaffen wird, hast du die Möglichkeit, die zukünftige Ausgestaltung der Rolle aktiv mitzuprägen. Mit dem weiteren Wachstum des Unternehmens besteht zudem die Perspektive, den Bereich IT Reliability Engineering langfristig weiter auszubauen und zusätzliche Mitarbeitende in diesem Umfeld zu etablieren.
01Überwachung sämtlicher Kundensysteme über unsere Monitoring-Plattformen
02Analyse, Priorisierung und Nachverfolgung von Warnmeldungen
03Sicherstellung der vollständigen Integration produktiver Systeme ins Monitoring
04Überwachung von Verfügbarkeit, Diensten, Hardware- und Storage-Zuständen
05Frühzeitige Erkennung technischer und sicherheitsrelevanter Risiken
06Eskalation kritischer Ereignisse
07Kontinuierliche Verbesserung und Weiterentwicklung bestehender Monitoring-Prozesse
08Identifikation und Umsetzung von Verbesserungen zur Erhöhung der Betriebsstabilität
09Förderung von Standardisierung und Automatisierung im täglichen Betrieb
10Sicherstellung funktionierender Backup- und Recovery-Prozesse
11Nachverfolgung fehlerhafter Sicherungen
12Integration neuer Systeme in bestehende Backup-Konzepte
13Planung, Durchführung und Dokumentation regelmässiger Restore-Tests
14Überwachung des Update- und Sicherheitsstatus von Clients und Servern
15Sicherstellung aktueller Sicherheits- und Systemstände
16Standardisierung und Automatisierung von Update-Prozessen
17Verwaltung von Serversystemen über Microsoft Azure Arc
18Verwaltung von Clients über Microsoft Intune und bestehende Endpoint-Management-Lösungen
19Überwachung von EOL- und EOS-Systemen
20Kontrolle von Firmware-, Software- und Security-Ständen
21Erarbeitung von Handlungsempfehlungen für Engineering und Management
22Überwachung von SSL-Zertifikaten und Laufzeiten
23Kontrolle von Softwarelizenzen und Wartungsverträgen
24Dokumentation und Pflege technischer Kundendokumentationen
25Erstellung und Aktualisierung von Betriebsanleitungen