Beschreibung
Kubernetes | Operations | SRE | Observability | Managed Services
Für den Betrieb und die Weiterentwicklung einer hochverfügbaren Cloud- und Kubernetes-Umgebung suchen wir einen erfahrenen Cloud DevOps Operations Specialist – Kubernetes Platform & Managed Services (m/w/d).
Der Schwerpunkt dieser Position liegt klar auf Operations, Kubernetes, Observability, Automatisierung und dem zuverlässigen Betrieb produktionskritischer Managed Services.
Gesucht wird eine technisch starke Persönlichkeit, die sich in komplexen Linux- und Kubernetes-Umgebungen wohlfühlt und auch bei Incidents strukturiert und lösungsorientiert arbeitet.
Die Position ist zunächst als temporärer Einsatz für 9 Monate vorgesehen. Der Start erfolgt nach Vereinbarung, spätestens im Oktober 2026. Bei erfolgreicher Zusammenarbeit besteht die Möglichkeit einer anschliessenden Übernahme in eine Festanstellung.
Deine Aufgaben
- Betrieb, Überwachung und kontinuierliche Verbesserung einer produktiven Kubernetes-Plattform
- Betrieb verschiedener Managed Services wie MongoDB, PostgreSQL und Kafka
- Sicherstellung von Hochverfügbarkeit, Skalierbarkeit und Ausfallsicherheit
- Proaktives Monitoring und Incident Management
- Durchführung von Day-2-Operations wie Upgrades, Patches, Backup/Restore und Capacity Management
- Fehleranalyse und Root Cause Analysis (RCA) in produktionsnahen Umgebungen
- Aufbau, Pflege und Weiterentwicklung moderner Observability-Stacks
- Arbeit mit Prometheus, Grafana, Logging und ELK/OpenSearch
- Automatisierung von Betriebsprozessen mittels Infrastructure as Code
- Arbeit mit Ansible, Terraform und Helm
- Unterstützung bei der kontinuierlichen Verbesserung der Betriebs- und Automatisierungsprozesse
- Teilnahme am Pikett-Dienst zur Sicherstellung des 24/7-Betriebs
Dein Profil
- Sehr gute Kubernetes-Kenntnisse
- Mehrjährige praktische Erfahrung mit containerisierten und produktionskritischen Plattformen
- Fundierte Linux- und System-Engineering-Erfahrung
- Erfahrung mit Prometheus, Grafana sowie ELK/OpenSearch
- Gute Kenntnisse in Automatisierung und Infrastructure as Code
- Erfahrung mit Ansible, Terraform und Helm
- CI/CD-Erfahrung mit GitLab und Docker
- Betriebserfahrung mit MongoDB, PostgreSQL und/oder Kafka
- Erfahrung mit Monitoring, Incident Management und Root Cause Analysis
- Strukturierte Problemlösungsfähigkeit und Belastbarkeit bei produktionskritischen Incidents
- Bereitschaft zur Teilnahme am Pikett-Dienst
- Gute Deutsch- und sehr gute Englischkenntnisse
Nice to have
Eine CKA- oder CKAD-Zertifizierung sowie Erfahrung mit ArgoCD, Velero, Cilium, Kyverno, Security Hardening, RBAC/IAM oder ITIL sind von Vorteil. Erfahrung im Telco-, Managed-Services- oder Service-Provider-Umfeld ist ebenfalls interessant.
Rahmenbedingungen
- Anstellung: Temporär mit Option auf Festanstellung
- Einsatzdauer: zunächst 9 Monate
- Start: Nach Vereinbarung, spätestens Oktober 2026
- Pensum: 80–100 %, mindestens 60 % möglich
- Arbeitsort: Zürich
- Homeoffice: Nach der Onboarding-Phase bis max. 2 Tage pro Woche
- Sprachen: Deutsch und Englisch zwingend
- Pikett: Bereitschaft zum Pikett-Dienst erforderlich
- Perspektive: Übernahme in eine Festanstellung möglich
