O tym stanowisku
Numery telefonów i adresy e-mail w tym ogłoszeniu są ukryte do momentu zalogowania.
auto_translated_note
O roliJesteśmy dobrze finansowaną firmą AI/ML działającą na styku inteligencji geoprzestrzennej i analityki infrastruktury. Nasz zespół inżynierów jest rozproszony po Europie i Ameryce Północnej. Poszukujemy starszego inżyniera ds. niezawodności lokalizacji, który przejmie odpowiedzialność za naszą infrastrukturę chmurową i ulepszy nasze praktyki DevOps i niezawodność.
Na tym stanowisku będziesz rozwijać naszą infrastrukturę Google Cloud Platform (GCP), udoskonalać naszą platformę obserwowalności, kierować procesami zarządzania incydentami i ściśle współpracować z zespołami ds. produktów i inżynierii, aby dostarczać niezawodne oprogramowanie wysokiej jakości. Będziesz kluczowym głosem w promowaniu SLO, budżetów błędów i wskaźników DORA w całej organizacji.Co będziesz robić Projektowanie, ewoluowanie i skalowanie naszej infrastruktury chmurowej w oparciu o GCP.Tworzenie narzędzi i automatyzacji, które promują autonomię zespołu i zmniejszają trud.Rozwijaj naszą platformę obserwowalności, poprawiając średni czas do odzyskania (MTTR) i widoczność systemu.Buduj przejrzystość w kosztach infrastruktury i prowadź inicjatywy optymalizacji kosztów.Prowadź najlepsze praktyki w zakresie niezawodności, w tym SLO/SLI, budżety błędów, i przeglądy po incydencie. Kieruj rotacją dyżurów i zarządzaniem incydentami, wspierając nienaganną kulturę.
Pomagaj zespołom inżynieryjnym skutecznie wykorzystywać GCP i zarządzać wykorzystaniem na dużą skalę. Czego szukamy Wymagane: ponad 3 lata doświadczenia w inżynierii niezawodności witryn lub doświadczeniu w produkcyjnym SRE. Dobra znajomość Google Cloud Platform (GCP), w tym optymalizacji kosztów i zarządzania.
Miło mieć / Dodatkowe umiejętności: Praktyczne doświadczenie z Kubernetes do zarządzania klastrami i obciążeniami. Infrastruktura jako Doświadczenie w tworzeniu kodu - Terraform, Deployment Manager lub podobne. Umiejętność pisania skryptów i automatyzacji w Pythonie, Bash lub Go.
Duże doświadczenie w zakresie obserwowalności stosu: Prometheus, Grafana, OpenTelemetry, logowanie i śledzenie. Sprawdzona umiejętność definiowania i wdrażania SLO/SLI oraz budżetów błędów. Doświadczenie w zarządzaniu incydentami, przeglądach po incydencie i rotacjach podczas dyżurów.
Lokalizacja. Jest to stanowisko w pełni zdalne, otwarte dla kandydatów z UE, Wielkiej Brytanii lub Ameryka Północna. Główny węzeł znajduje się w Holandii.
Należy pamiętać, że na tym stanowisku nie jest możliwe sponsorowanie wiz. Wynagrodzenie i świadczeniaW przypadku tej roli nie podano szczegółów wynagrodzenia. Nasz zespół obejmuje wiele krajów i oferujemy konkurencyjne pakiety dostosowane do lokalizacji.
Dalsze szczegóły zostaną omówione podczas rozmowy kwalifikacyjnej. Znajdź pracę w Wielkiej Brytanii na Arbeitnow
Pytania spolecznosci
Ktos tu pracowal? Zapytaj przed aplikacja.
Brak watkow dla tej oferty lub firmy.