Starszy inżynier ds. niezawodności obiektu
United Kingdom, United States
£145,000 - £185,000 / za rok
O tym stanowisku
Numery telefonów i adresy e-mail w tym ogłoszeniu są ukryte do momentu zalogowania.
auto_translated_note
Informacje o roliSunCore Digital poszukuje praktycznego starszego inżyniera ds. niezawodności lokalizacji, który będzie oceniał obecną niezawodność i skalowalność naszych systemów, identyfikował zagrożenia i wdrażał zmiany techniczne wymagane do ich rozwiązania. Nie jest to stanowisko przeznaczone wyłącznie do monitorowania ani doradcze. SRE zbada istniejące aplikacje i infrastrukturę, ustali podstawy niezawodności, rozwinie możliwości obserwowalności i testowania oraz bezpośrednio wdroży środki ograniczające niezawodność w domenie SRE.
Gdy środki ograniczające wymagają zmian w kodzie aplikacji lub zmianach w przepływie pracy biznesowej, zespół będący właścicielem systemu wdroży i będzie utrzymywał te zmiany zgodnie ze wskazówkami SRE. Ponieważ platforma nie została jeszcze sprawdzona pod kątem rzeczywistego ruchu klientów, pojemność i skalowalność będą traktowane jako otwarte ryzyko, dopóki testy nie wykażą, że jest inaczej. ObowiązkiOcena niezawodności i działania naprawczeOceniaj niezawodność aplikacji internetowych, usług mobilnych Flutter, interfejsów API, systemów zaplecza, infrastruktury, baz danych, kolejek i stron trzecich integracje.
Identyfikuj pojedyncze punkty awarii, delikatne zależności, ręczne procesy operacyjne i tryby awarii. Odróżnij potwierdzone problemy od podejrzanych zagrożeń i obszarów, które nie zostały jeszcze ocenione. Projektuj i wdrażaj wspólne możliwości i ulepszenia niezawodności w domenie SRE.
Zdefiniuj zmiany niezawodności specyficzne dla aplikacji i współpracuj z zespołami będącymi właścicielami systemów w celu ich wdrożenia; zespoły te zachowują odpowiedzialność za swój kod i usługi. Po przetestowaniu i wzmocnieniu rozwiązania przenieś oprzyrządowanie specyficzne dla usług, elementy Runbook i bieżące obowiązki w zakresie konserwacji do odpowiednich właścicieli systemów. Śledź zidentyfikowane ryzyko poprzez wdrożenie i walidację, a nie poprzestawanie na zaleceniach. Wydajność, obciążenie i pojemność.
Opracuj praktyczny program testowania wydajności i pojemności. Współpracuj z działem kontroli jakości i interesariuszami produktu, aby zidentyfikować krytyczne przepływy pracy i realistyczne scenariusze użycia. Ustal podstawowe czasy reakcji, przepustowość, współbieżność i zasoby. zużycia energii.
Projektuj i wykonuj testy obciążenia, obciążenia, trwałości, skalowalności i awarii. Identyfikuj wąskie gardła obejmujące aplikacje, bazy danych, sieci, kolejki, pamięci podręczne, infrastrukturę i usługi zewnętrzne. Wdrażaj współdzielone rozwiązania łagodzące SRE i koordynuj prace łagodzące specyficzne dla aplikacji z zespołami będącymi właścicielami systemów, którzy zachowują odpowiedzialność za swój kod i usługi.
Powtarzaj testowanie po zmianach, aby zweryfikować wyniki. Dokumentuj przetestowaną pojemność, zaobserwowane ograniczenia i pozostałe niewiadome. Zdefiniuj bezpieczne limity operacyjne i wskaźniki wczesnego ostrzegania.
Testy wydajności i obciążenia nie zostały jeszcze zakończone na całej platformie. Utworzenie tej możliwości będzie priorytetem. Obserwowalność Oceniaj bieżące rejestrowanie, metryki, śledzenie, kontrole stanu, pulpity nawigacyjne i alerty.
Ustanawiaj spójne standardy obserwowalności we wszystkich usługach. Wdrażaj i wzmacniaj współdzielone możliwości sprawdzania stanu i obserwowalności, przekazuj współdzielone komponenty wyznaczonemu długoterminowemu właścicielowi i współpracuj z zespołami będącymi właścicielami systemów nad oprzyrządowaniem specyficznym dla usług, które będą konserwować po przekazaniu. Zdefiniuj znaczące wskaźniki poziomu usług i wstępne cele w zakresie niezawodności z właścicielami systemów i inżynierami przywództwa.
Twórz wspólne pulpity nawigacyjne niezawodności i wstępne widoki specyficzne dla usług, a następnie szkol właścicieli systemów w zakresie obsługi pulpitów nawigacyjnych i alertów specyficznych dla usług. Upewnij się, że alerty są wykonalne, kierowane do odpowiedzialnych właścicieli i testowane. Identyfikuj słabe punkty monitorowania.
Udoskonalaj instrumentację aplikacji we współpracy z programistami. Upewnij się, że dzienniki i dane telemetryczne nie ujawniają poufnych informacji. Gotowość na incydenty Pomóż w ustaleniu początkowego modelu dyżuru i eskalacji.
Twórz i testuj reakcję na incydenty oraz rozwiązywanie problemów Runbooks.Definiuj poziomy ważności i ścieżki eskalacji technicznych.Prowadź dochodzenie w sprawie incydentów lub wspieraj je.Ulepszaj możliwości wykrywania, diagnozowania, łagodzenia skutków i przywracania.Ułatwiaj techniczne przeglądy po incydencie.Śledź działania naprawcze i wzorce powtarzających się awarii.W stosownych przypadkach przeprowadzaj ćwiczenia kontrolowanych awarii.Automatyzacja SREAutomatyzuj powtarzalne prace związane z inżynierią niezawodności, w tym kontrole stanu, diagnostykę, wzbogacanie alertów, segregację incydentów, kontrole wydajności i gromadzenie dowodów.Opracuj bezpieczną automatyzację naprawa lub samonaprawa w przypadku jasno zdefiniowanych i dobrze przetestowanych warunków awarii. Ogranicz czynności związane z ręczną diagnostyką, konserwacją, reagowaniem na incydenty i walidacją niezawodności w ramach funkcji SRE. Zdefiniuj i wdrażaj kontrole niezawodności, logikę testów i automatyzację SRE, które powinny przechodzić przez CI/CD.
Współpracuj z DevOps, aby zintegrować je ze strukturą współdzielonego dostarczania, oraz z zespołami będącymi właścicielami systemów, aby utrzymać konfigurację specyficzną dla aplikacji po przekazaniu. Twórz narzędzia i wzorce niezawodności wielokrotnego użytku, wzmacniaj je i dokumentuj, przekazuj współdzielone komponenty wyznaczonemu długoterminowemu właścicielowi i szkolić zespoły aplikacji w zakresie obsługi części specyficznych dla usług, które posiadają. Dokumentuj własność automatyzacji, zabezpieczenia, ograniczenia, zachowanie wycofywania i warunki wymagające interwencji człowieka.
Współpraca Współpracuj z inżynierem ds. odzyskiwania po awarii i inżynierem odporności w zakresie odzyskiwania usług i danych zależności. Współpracuj z działem Security Operations przy przeglądzie bezpieczeństwa wdrożeń SRE przed przyjęciem do środowiska produkcyjnego. Zapewnij wymagania dotyczące niezawodności w zakresie zabezpieczeń wdrożeniowych i stanu środowiska oraz współpracuj z DevOps i personelem platformy w zakresie integracji współdzielonej.
SRE nie jest właścicielem automatyzacji wdrożeń ani rutynowych wdrożeń aplikacji. Współpracuje z kontrolą jakości w celu zdefiniowania realistycznych scenariuszy użytkownika i weryfikacji po łagodzeniu skutków. Współpracuje z zespołami aplikacji w zakresie zmian w kodzie i oprzyrządowaniu specyficznych dla systemu.
Dostarcza kierownictwu inżynieryjnemu faktyczne ustalenia techniczne bez przedstawiania niezweryfikowanych założeń jako potwierdzonych wniosków. Priorytety początkowe Inwentaryzacja usług krytycznych i ich zależności. Ocena ryzyka niezawodności i potencjalnych pojedynczych punktów awarii.
Ustalanie przejrzystości systemu i opóźnień. Zdefiniowanie krytycznych przepływów pracy pod kątem wydajności. testowanie.Zbuduj wstępne możliwości testowania wydajności, obciążenia i pojemności.Ustanów techniczne podstawy.Identyfikuj i wdrażaj rozwiązania ograniczające niezawodność i skalowanie o najwyższym priorytecie.Twórz wstępne elementy Runbook i rekomendacje na wezwanie.Identyfikuj procesy SRE, które powinny zostać zautomatyzowane, w tym diagnostykę, obsługę alertów, sprawdzanie wydajności, reakcję na incydenty i bezpieczne środki zaradcze.Udokumentuj sprawdzone zachowanie, nierozwiązane ryzyko i niewiadome.Wymagane kwalifikacjePięć lub więcej lat doświadczenia doświadczenie w zakresie niezawodności lokalizacji, inżynierii produkcji, inżynierii infrastruktury, DevOps lub na porównywalnym stanowisku.Praktyczne doświadczenie we wspieraniu aplikacji hostowanych w chmurze i systemów rozproszonych.Doświadczenie we wdrażaniu ulepszeń niezawodności, a nie tylko w tworzeniu ocen.Doświadczenie w testowaniu wydajności, obciążenia, obciążenia lub pojemności.Doświadczenie w diagnozowaniu wąskich gardeł aplikacji, baz danych, sieci i infrastruktury.Doświadczenie w zakresie monitorowania, rejestrowania, metryk, alertów i reagowania na incydenty.Doświadczenie w automatyzacji niezawodności i tworzeniu skryptów.Doświadczenie w pracy z Systemy CI/CD.Doświadczenie w rozwiązywaniu problemów z interfejsami API, usługami backendowymi, bazami danych, kolejkami, pamięciami podręcznymi i integracją zewnętrzną.Zrozumienie wzorców przekroczeń limitu czasu, ponownych prób, limitów szybkości, łamania obwodów i płynnej degradacji.Umiejętność bezpośredniej pracy w nieznanych bazach kodu i środowiskach.Doskonała dokumentacja techniczna i umiejętności komunikacyjne.Umiejętność odróżniania potwierdzonych wyników, podejrzeń ryzyka i niewiadomych.Komfort pracy w małej organizacji, w której praktyki operacyjne są wciąż ustalane.Premia PunktyDoświadczenie w przygotowaniu platformy dla pierwszych użytkowników zewnętrznych.Doświadczenie w ustanawianiu możliwości SRE w startupie lub małej organizacji inżynieryjnej.Doświadczenie z platformami finansowymi, zasobami cyfrowymi, telemetrią, monitorowaniem sprzętu lub platformami operacyjnymi.Doświadczenie w pracy z usługami mobilnymi wspieranymi przez Flutter.Doświadczenie w chaosie lub testowaniu metodą wstrzykiwania błędów.Doświadczenie z systemami intensywnie korzystającymi z danych lub opartymi na zdarzeniach.Doświadczenie w zdalnym, asynchronicznym środowisku.Jak wygląda sukcesUsługi krytyczne i zależności są inwentaryzowane. Ryzyka niezawodności są widoczne i mają priorytety.
Dla krytycznych przepływów pracy istnieją wartości bazowe wydajności i pojemności. Wdrażane i testowane są zabezpieczenia o wysokim priorytecie dotyczące niezawodności i skalowania. Usługi krytyczne mają istotne kontrole stanu, pulpity nawigacyjne, alerty i elementy Runbook.
Firma może identyfikować awarie i reagować na awarie, nie polegając wyłącznie na jednej osobie. Zespoły aplikacyjne rozumieją i utrzymują ulepszenia niezawodności wprowadzone w ich systemach. Pozostałe ryzyka dotyczące wydajności i niezawodności są dokumentowane jasne.Wynagrodzenie • Do negocjacji w zależności od lokalizacji • Odroczone ukończenie wersji demonstracyjnej • Późniejsze przeniesienie ról na stałe zatrudnienie Dlaczego warto dołączyć do SunCore Digital • Rola o dużym wpływie kształtująca podstawy bezpieczeństwa szybko skalującej się firmy cyfrowej • W pełni zdalny zespół z elastycznością asynchroniczną i opcjonalną współpracą w Londynie lub Bellevue • Bezpośrednie partnerstwo z kierownictwem wykonawczym oraz czołowymi partnerami w zakresie inżynierii, marketingu i projektowania • Konkurencyjne wynagrodzenie zwiększające wydajność Oryginalnie opublikowano w Himalajach
Pytania spolecznosci
Ktos tu pracowal? Zapytaj przed aplikacja.
Brak watkow dla tej oferty lub firmy.