O tym stanowisku
Numery telefonów i adresy e-mail w tym ogłoszeniu są ukryte do momentu zalogowania.
auto_translated_note
Budujemy wielomarkową platformę iGaming, która pomaga operatorom prowadzić działalność na regulowanych rynkach na całym świecie. Łączy w sobie trzy główne produkty - zarządzanie kontami graczy (PAM), zakłady sportowe i kasyno - wszystkie zbudowane w oparciu o nowoczesną architekturę mikrousług przy użyciu języka Scala, z zapleczem React/TypeScript. Poszukujemy Senior SRE, który dołączy do naszego zespołu i pomoże nam budować i utrzymywać niezawodną, obserwowalną i skalowalną infrastrukturę. Będziesz ściśle współpracować z programistami, wdrażać własne praktyki dotyczące niezawodności i przyczyniać się do rozwoju kultury DevOps zespołu.
Wymagane wymagania: Umiejętności techniczne - Linux - pewne rozwiązywanie problemów z terminalem, dziennikami, procesami, podstawami sieci, wykorzystaniem zasobów. - Kubernetes / GKE - praktyczna wiedza na temat obciążeń, podów, usług, ruchu przychodzącego/bramy, sond, kontroli RBAC, zasobów, automatycznego skalowania i rozwiązywania problemów. - GCP - praktyczne doświadczenie z infrastrukturą chmurową, szczególnie w obszarze GKE, IAM, networkingu, równoważenia obciążenia, rejestracji artefaktów i diagnostyki produkcyjnej. - Docker / Kontenery - obrazy, rejestry, debugowanie w czasie wykonywania, cykl życia kontenera. - Helm - rozumie wydania, wartości, stan wdrożenia i wycofywanie Helma. - GitOps / FluxCD - potrafi zrozumieć i rozwiązać problemy związane z przepływem wdrażania GitOps, dryfowaniem, automatyzacją obrazów i wycofywaniem w oparciu o Git. - Zrozumienie CI/CD - może badać uszkodzone potoki i problemy z wdrażaniem; nie musi być głównym twórcą potoku, jeśli DevOps jest jego właścicielem. - Obserwowalność - Prometheus, Alertmanager, Grafana; rozumie metryki, dzienniki, ślady, pulpity nawigacyjne, alerty i monitorowanie produkcji. - Podstawy sieci - DNS, moduły równoważenia obciążenia, ruch przychodzący, bramy, TLS, routing, firewall/reguły bezpieczeństwa. - SLI / SLO / SLA - potrafi zdefiniować i zastosować cele w zakresie niezawodności, a nie tylko wyjaśnić pojęcia. - Reagowanie na incydenty - doświadczenie w zakresie incydentów produkcyjnych, wycofywania zmian, przywracania usług, RCA/pośmiertne. - Podstawy obsługi baz danych/komunikacji - PostgreSQL, Couchbase, Kafka, Elasticsearch/ELK lub podobne; wystarczające do monitorowania stanu, migracji, indeksów, tematów i sygnałów o błędach. - Podstawy bezpieczeństwa/zgodności - tajemnice, IAM/RBAC, ścieżka audytu, dowody wydania/zmiany. Must Have: Niezawodność / Umiejętności operacyjne - Potrafi ocenić, czy kontynuacja wydania jest technicznie bezpieczna. - Potrafi zdefiniować, co powinno być monitorowane w trakcie i po wdrożeniu. - Może zweryfikować stan produkcji po wydaniu. - Potrafi przygotowywać lub zatwierdzać plany wycofywania zmian. - Może prowadzić lub wspierać zegarek po premierze. - Może ulepszyć elementy Runbook i procedury reagowania na incydenty. - Potrafi zidentyfikować luki w pulpitach nawigacyjnych, alertach, kontrolach wdrożenia i dowodach wydania. - Może współpracować z DevOps bez powielania własności. Must Have: Umiejętności miękkie - Własność i odpowiedzialność - śledzi problemy produkcyjne aż do zamknięcia. - Spokojny pod presją - może działać sprawnie podczas incydentów, nieudanych wdrożeń i wycofywania zmian. - Jasna komunikacja - zapewnia zwięzłe aktualizacje: wpływ, bieżące działania, ETA, ryzyko, potrzebna decyzja. - Rozwiązywanie problemów strukturalnych - dzieli problemy według aplikacji, infrastruktury, sieci, bazy danych, konfiguracji, różnic w wersjach i zależności zewnętrznych. - Świadomość ryzyka - potrafi stwierdzić, kiedy publikacja jest ryzykowna i wyjaśnić dlaczego. - Współpraca - dobrze współpracuje z deweloperami, kontrolą jakości, produktem, wsparciem, menedżerem wersji i DevOps. - Dyscyplina w dokumentacji - utrzymuje elementy Runbook, kroki wycofywania, harmonogramy zdarzeń i dowody operacyjne. - Nienaganne nastawienie - koncentruje się na przyczynach źródłowych i zapobieganiu. - Proaktywność - znajduje brakujące alerty, pulpity nawigacyjne, elementy Runbook i luki w procesach przed incydentami. - Priorytetyzacja - oddziela rzeczywisty wpływ na produkcję od hałasu ostrzegawczego.
Miło mieć - doświadczenie Terraform / IaC. - Zaawansowany projekt infrastruktury GCP. - ArgoCD lub inne narzędzia GitOps. - Zaawansowane dostrajanie bazy danych lub wydajności. - Doświadczenie w zakresie sieci usług. - Doświadczenie w rotacji na wezwanie z PagerDuty/Opsgenie lub podobnym. - Doświadczenie w prowadzeniu sesji RCA/pośmiertnych. - Doświadczenie w domenie zakładów/gier. - Dobra znajomość języka angielskiego na potrzeby aktualizacji incydentów, notatek o wydaniu i dowodów audytu. - Podstawowa znajomość pojęć związanych ze sztuczną inteligencją: agenci, umiejętności, MCP. Obowiązki - Własne praktyki niezawodności produkcji wraz z DevOps i zespołami inżynierskimi. - Monitoruj stan produkcji i poprawiaj obserwowalność. - Wersje wsparcia, poprawki, wycofywanie i oglądanie po wydaniu. - Sprawdź gotowość do wdrożenia i wycofania. - Uczestnictwo w reagowaniu na incydenty i RCA/pośmiertne. - Utrzymuj elementy Runbook, pulpity nawigacyjne, reguły alertów i dokumentację operacyjną. - Zapewnij identyfikowalność dowodów wydania i gotowość do audytu. - Koordynacja z deweloperami, kontrolą jakości, produktem, wsparciem, menedżerem wersji i DevOps podczas wydarzeń produkcyjnych. Aplikuj bezpośrednio na RemoteJobs.org: https://remotejobs.org/remote-jobs/senior-sre-production-reliability-engineer-symphony-solutions
Pytania spolecznosci
Ktos tu pracowal? Zapytaj przed aplikacja.
Brak watkow dla tej oferty lub firmy.