Fact Finder

Senior Site Reliability Engineer (all genders)

Remote, United States remote Entry Salary not listed
remote Technology & IT Curated
Sign in to apply Free account — we bring you straight back to this role.

About the role

IntroductionFACT-Finder entwickelt Product-Discovery-Technologie für den eCommerce und ist mit den Produkten Next Generation und Infinity bei führenden Online-Shops in Europa im Einsatz. Beide Produkte bewegen sich aktuell in Richtung einer modernen, hybriden Plattform auf Basis von Kubernetes und Harvester – mit der Option, mittelfristig vollständig in die Cloud zu skalieren. Als Senior Site Reliability Engineer (SRE) sorgst du dafür, dass unsere Systeme über diese Transformation hinweg schnell, verfügbar und skalierbar bleiben. Du arbeitest mit dem Hosting-Team und erfahrenen Engineers zusammen und gestaltest den Weg zu einer modernen SaaS-Company aktiv mit.

Deine AufgabenDu definierst und verantwortest SLOs, SLIs und Error Budgets über beide Produkte hinweg und triffst datenbasierte Entscheidungen zu Reliability und Performance.
Du treibst Incident Response voran: schnelle Detektion, klare Kommunikation, blameless Postmortems und nachhaltige Follow-ups.
Du reduzierst manuelle Arbeit konsequent durch Automatisierung und GitOps (z. B. Argo CD / Flux) und baust self-healing sowie self-service Fähigkeiten aus.
Du unterstützt den Aufbau eines NG Search Operators (Custom Kubernetes Operator / CRDs) und die Einführung von Auto-Scaling (HPA, VPA, KEDA, Cluster Autoscaler).
Du entwickelst unsere Observability weiter – Metrics, Logs, Traces, Alerting und Runbooks, die on-call wirklich helfen.
Du planst Kapazität und Kosten über On-Premise (Frankfurt, Stockholm) und Cloud hinweg – inklusive Burst-Szenarien in die Public Cloud.
Du nutzt AI-Tools, um Diagnose, Alerting und operative Workflows spürbar zu

Dein ProfilErfahrung als SRE, Infrastructure oder Production Engineer in einem SaaS- oder Plattform-Umfeld – oder ein starker Software-/Operations-Hintergrund mit klarem Willen, in die SRE-Rolle hineinzuwachsen.
Solides Verständnis von SLOs, Error Budgets, Incident Management und Observability.
Hands-on Erfahrung mit Kubernetes und Interesse an Cluster-Lifecycle, Upgrades und Operator-Pattern.
Erfahrung oder starkes Interesse an Harvester bzw. vergleichbaren HCI-/Virtualisierungsplattformen (KubeVirt, vSphere/ESXi, OpenStack).
Vertrautheit mit GitOps (Argo CD / Flux), Container Storage (Longhorn, Ceph) und Kubernetes Networking (Load Balancing, Ingress).
Kenntnisse zu Auto-Scaling-Primitiven (HPA, VPA, Cluster Autoscaler, KEDA) und Kapazitätsplanung on-prem und in der Cloud.
Verständnis für Netzwerke in produktionsnahen Rechenzentren (u. a. VLAN).
Ausgeprägter Automatisierungsinstinkt und eine Haltung, Toil strukturell zu eliminieren.
Praktische Erfahrung im Einsatz von AI-Tools im operativen Betrieb.
Sehr gute Englischkenntnisse; Deutsch von Vorteil.

THE JOY OF WORKING WITH USImpact from day one: Deine Arbeit wirkt direkt auf die Umsätze führender eCommerce-Marken in Europa.
Moderner Tech-Stack: Kubernetes, Harvester, GitOps, Auto-Scaling und ein spannender Weg in Richtung Cloud – mit Raum, Dinge neu und richtig zu bauen.
AI-first Mindset: Wir nutzen AI nicht als Buzzword, sondern als festen Bestandteil unserer täglichen Arbeit.
Ownership & Wachstum: Klare Verantwortung, kurze Entscheidungswege und die Möglichkeit, deine Rolle aktiv mitzugestalten.
Flexibles Arbeiten: Hybrides Arbeitsmodell mit Fokus auf Ergebnisse.
Starkes Team: Erfahrene Engineers, offene Feedback-Kultur und ein Umfeld, in dem Reliability als Engineering-Disziplin ernst genommen wird.

StandortBerlin, München, Pforzheim oder Stockholm (Hybrid)
Find more English Speaking Jobs in Germany on Arbeitnow

Interview prep

Walk in with sharper answers.

Use this as a quick practice sheet before you speak with the employer.

Role
Technology & IT Operations Senior Site Reliability Engineer remote

Likely questions

  1. Tell us about work you have done that is close to the Senior Site Reliability Engineer (all genders) role.
  2. How would you approach your first 30 days at Fact Finder?
  3. Which of Operations, Senior and Site have you used recently, and what did it help you achieve?
  4. Describe a time you solved a problem without waiting to be told exactly what to do.
  5. How do you stay organised and communicate clearly when working remotely?

Prepare before the call

  • A recent example that proves your experience with Operations, Senior and Site.
  • One short story with a problem, your action, and the result.
  • Two examples that show the strengths listed on your CV.
  • A clear reason why this role and company interest you.
  • Your availability, preferred work style, and salary expectations.

Ask them

  • What would success look like in the first 90 days?
  • What are the main problems this hire should help solve?
  • How does the team give feedback and measure good work?
  • What does a normal working week look like for this role?
Practice line

I am interested in the Senior Site Reliability Engineer (all genders) role because I can bring practical experience in Operations, Senior and Site, learn the team quickly, and contribute to the outcomes Fact Finder needs from this hire.

Related jobs.

More roles from this company or category.