Introduction FACT-Finder entwickelt Product-Discovery-Technologie für den eCommerce und ist mit den Produkten Next Generation und Infinity bei führenden Online-Shops in Europa im Einsatz.
Beide Produkte bewegen sich aktuell in Richtung einer modernen, hybriden Plattform auf Basis von Kubernetes und Harvester – mit der Option, mittelfristig vollständig in die Cloud zu skalieren.
Als Senior Site Reliability Engineer (SRE) sorgst du dafür, dass unsere Systeme über diese Transformation hinweg schnell, verfügbar und skalierbar bleiben.
Du arbeitest mit dem Hosting-Team und erfahrenen Engineers zusammen und gestaltest den Weg zu einer modernen SaaS-Company aktiv mit.
Deine Aufgaben Du definierst und verantwortest SLOs, SLIs und Error Budgets über beide Produkte hinweg und triffst datenbasierte Entscheidungen zu Reliability und Performance.
Du treibst Incident Response voran: schnelle Detektion, klare Kommunikation, blameless Postmortems und nachhaltige Follow-ups.
Du reduzierst manuelle Arbeit konsequent durch Automatisierung und GitOps (z.
Argo CD / Flux) und baust self-healing sowie self-service Fähigkeiten aus.
Du unterstützt den Aufbau eines NG Search Operators (Custom Kubernetes Operator / CRDs) und die Einführung von Auto-Scaling (HPA, VPA, KEDA, Cluster Autoscaler).
Du entwickelst unsere Observability weiter – Metrics, Logs, Traces, Alerting und Runbooks, die on-call wirklich helfen.
Du planst Kapazität und Kosten über On-Premise (Frankfurt, Stockholm) und Cloud hinweg – inklusive Burst-Szenarien in die Public Cloud.
Du nutzt AI-Tools, um Diagnose, Alerting und operative Workflows spürbar zu Dein Profil Erfahrung als SRE, Infrastructure oder Production Engineer in einem SaaS- oder Plattform-Umfeld – oder ein starker Software-/Operations-Hintergrund mit klarem Willen, in die SRE-Rolle hineinzuwachsen.
Solides Verständnis von SLOs, Error Budgets, Incident Management und Observability.
Hands-on Erfahrung mit Kubernetes und Interesse an Cluster-Lifecycle, Upgrade.