Inżynier ds. niezawodności obiektu (SRE)
Remote
£100,000 - £180,000 / za rok
O tym stanowisku
Numery telefonów i adresy e-mail w tym ogłoszeniu są ukryte do momentu zalogowania.
auto_translated_note
Site Reliability Engineer (SRE) - Remote Bright Vision Technologies is a technology consulting and software development company delivering cloud, AI, data, and enterprise solutions across the United States. To fantastyczna okazja, aby dołączyć do uznanej i szanowanej organizacji oferującej ogromny potencjał rozwoju kariery. Job Title: Site Reliability Engineer (SRE) Location: 100% Remote (U.S.) Position Type: Full-time, Direct W2 Salary Range: $100,000 - $180,000 Annually Experience Required: 10+ years Sponsorship: U.S.
Citizens, Green Card Holders, EAD Holders, and H-1B transfer candidates are encouraged to apply. Nie możemy sponsorować nowych petycji wizowych H-1B na to stanowisko. Job Summary: We are seeking an experienced Site Reliability Engineer to ensure the availability, performance, and operational excellence of large-scale distributed systems in production.
As an SRE you will live at the boundary between development and operations, applying strong software engineering principles to infrastructure and operations problems, and continually pushing the platform toward higher reliability with lower operational toil. Idealny kandydat będzie łączyć głęboką wiedzę systemową z silnymi umiejętnościami programowania, nastawieniem opartym na pomiarach oraz dyscypliną w projektowaniu, automatyzacji i obsłudze złożonych usług, tak aby niezawodność stała się pierwszorzędnym produktem inżynieryjnym, a nie reaktywnym problemem.
Key Responsibilities
- Define, instrument, and continually refine service-level objectives (SLOs), service-level indicators (SLIs), and error budgets for critical services, and use those measures to drive concrete engineering and prioritization decisions. - Lead incident response and resolution for production issues, acting as a calm and effective incident commander when needed, and ensuring high-quality post-incident reviews that drive lasting improvements. - Projektuj i wdrażaj kompleksowe strategie monitorowania, rejestrowania i śledzenia przy użyciu Prometheus, Grafana, OpenTelemetry, ELK/EFK, Datadog lub podobnych narzędzi, aby operatorzy mieli bogaty i praktyczny wgląd w zachowanie systemu. - Twórz i utrzymuj niezawodne procesy na wezwanie, elementy Runbook i ścieżki eskalacji, które skracają średni czas wykrywania i rozwiązywania problemów, jednocześnie chroniąc dobro inżynierów pracujących w ramach rotacji. - Agresywnie automatyzuj pracę operacyjną, pisząc narzędzia klasy produkcyjnej w Pythonie, Go, Bash lub podobnych językach, zastępując ręczne przepływy pracy niezawodną, kontrolowaną automatyzacją. - Projektuj i obsługuj wielkoskalowe klastry Kubernetes i obciążenia oparte na kontenerach, w tym automatyczne skalowanie, planowanie wydajności, zasady sieciowe i integrację z siatkami usług. - Projektuj potoki CI/CD, które promują bezpieczne, częste i obserwowalne wydania, wspierane przez automatyczne testowanie, wdrożenia kanaryjskie, flagi funkcji i strategie stopniowego wdrażania. - Kierowanie działaniami związanymi z planowaniem wydajności i inżynierią wydajności, budowaniem modeli przewidujących wzrost i obciążenie oraz weryfikacją tych modeli poprzez testowanie obciążenia i eksperymenty z chaosem. - Partner closely with application development teams to embed reliability practices early in design - including failure-mode analyses, graceful degradation patterns, and dependency hardening. - Wzmocnij odporność platformy poprzez inżynierię chaosu, wstrzykiwanie błędów, izolację zależności, ponowne próby, przekroczenia limitu czasu, wyłączniki automatyczne i dobrze przetestowane ścieżki przełączania awaryjnego. - Ciągłe ulepszanie stanu zabezpieczeń we współpracy z zespołami ds. bezpieczeństwa, w tym zarządzanie poprawkami, usuwanie luk w zabezpieczeniach i domyślne domyślne ustawienia platformy. - Wkład w techniczny plan działania dotyczący narzędzi zapewniających niezawodność, platform obserwowalności i ulepszeń w zakresie doświadczenia programistów, które zmniejszają tarcia i poprawiają wyniki zespołów inżynieryjnych. - Wspieraj inżynierów w całej organizacji w zakresie praktyk SRE i wspieraj silną, nienaganną kulturę doskonałości operacyjnej. Wymagane kwalifikacje - tytuł licencjata w dziedzinie informatyki, inżynierii lub pokrewnej dyscypliny technicznej. - Dziesięć lub więcej lat doświadczenia w SRE, DevOps lub inżynierii produkcji we wspieraniu wielkoskalowych systemów rozproszonych. - Silne umiejętności programowania w co najmniej jednym języku Python, Go lub Java, z możliwością tworzenia solidnej automatyzacji i narzędzi. - Głębokie, praktyczne doświadczenie w obsłudze systemu Linux na dużą skalę, w tym w pracy w sieci, dostrajaniu wydajności i rozwiązywaniu problemów na poziomie systemu. - Doświadczenie produkcyjne w obsłudze Kubernetes i obciążeń opartych na kontenerach. - Dobra praktyczna wiedza na temat narzędzi obserwowalności, takich jak Prometheus, Grafana, OpenTelemetry, ELK/EFK lub ich komercyjnych odpowiedników. - Praktyczne doświadczenie w projektowaniu i obsłudze rurociągów CI/CD zarówno dla infrastruktury, jak i aplikacji. - Solidne zrozumienie projektu systemu rozproszonego, w tym modeli spójności, partycjonowania i semantyki awarii. - Udokumentowane doświadczenie w kierowaniu reakcją na incydenty i przeprowadzaniu skutecznych przeglądów po incydencie. - Doskonałe umiejętności komunikacyjne i dokumentacyjne. Preferowane kwalifikacje - doświadczenie w definiowaniu i operacjonalizacji SLO i budżetów błędów w rzeczywistych środowiskach produkcyjnych. - Ekspozycja na praktyki i narzędzia inżynierii chaosu, takie jak Chaos Monkey, Gremlin lub Litmus. - Praktyczne doświadczenie z co najmniej jedną główną platformą chmurową (AWS, Azure lub GCP). - Doświadczenie w planowaniu wydajności, inżynierii wydajności lub testowaniu obciążenia na dużą skalę. - Znajomość technologii siatki usług, takich jak Istio, Linkerd lub Consul. Jak aplikować Chcesz dowiedzieć się więcej o tej możliwości? W celu natychmiastowego rozpatrzenia oferty wyślij swoje CV na adres lub skontaktuj się z nami pod numerem 90*** *** 899. Dowiedz się więcej o technologiach Bright Vision na stronie . Firma Bright Vision Technologies jest pracodawcą zapewniającym równe szanse. Oświadczenie dotyczące równych szans w zatrudnieniu (EEO) Firma Bright Vision Technologies (BV Teck) zobowiązuje się do zapewnienia równych szans zatrudnienia (EEO) dla wszystkich pracowników i kandydatów bez względu na rasę, kolor skóry, religię, płeć, orientację seksualną, tożsamość lub ekspresję płciową, pochodzenie narodowe, wiek, informacje genetyczne, niepełnosprawność, status weterana lub jakikolwiek inny status chroniony zgodnie z obowiązującymi przepisami federalnymi, stanowymi lub lokalnymi. Zobowiązanie to rozciąga się na wszystkie aspekty zatrudnienia, w tym rekrutację, zatrudnianie, szkolenia, wynagrodzenia, awanse, przeniesienia, urlopy, rozwiązania stosunku pracy, zwolnienia i odwołania. BV Teck wyraźnie zabrania wszelkich form molestowania lub dyskryminacji w miejscu pracy. Jakakolwiek niewłaściwa ingerencja w zdolność pracowników do wykonywania obowiązków służbowych może skutkować wszczęciem postępowania dyscyplinarnego, aż do rozwiązania stosunku pracy włącznie. Aplikuj bezpośrednio na RemoteJobs.org: https://remotejobs.org/remote-jobs/site-reliability-engineer-sre-bright-vision-technologies-himala
Pytania spolecznosci
Ktos tu pracowal? Zapytaj przed aplikacja.
Brak watkow dla tej oferty lub firmy.