Staff Network Engineer (AI Fabric, Datacenter and Edge Networking) - Radian Arc
United Kingdom
Do uzgodnienia
O tym stanowisku
Numery telefonów i adresy e-mail w tym ogłoszeniu są ukryte do momentu zalogowania.
auto_translated_note
Lokalizacja i sposób pracy: Europa/Zdalny start: sierpień 2026 r. Rodzaj umowy: Pełny etat lub Umowa o firmie Radian ArcRadian Arc zapewnia platformę infrastruktury jako usługi (IaaS) do obsługi gier w chmurze, aplikacji sztucznej inteligencji i uczenia maszynowego w sieciach operatorów telekomunikacyjnych. Nasze zespoły w USA, Australii, Europie Środkowej, Malezji, Singapurze i Japonii oferują operatorom telekomunikacyjnym platformę przetwarzania brzegowego opartą na procesorach graficznych bez konieczności nakładów kapitałowych, zapewniając niskie opóźnienia i lepszą ekonomikę usług o wartości dodanej oraz monetyzację inwestycji 5G.
Jaki będziesz mieć wpływZaprojektuj, wdroż i obsługuj infrastrukturę sieciową zasilającą platformę chmurową GPU, w tym wysokowydajne struktury AI, a także klasyczne komponenty sieciowe centrów danych, takie jak routing, bezpieczeństwo i łączność zewnętrzna. Ta rola obejmuje zarówno wysokowydajną sieć wschód-zachód dla rozproszonych obciążeń AI, jak i łączność północ-południe, bezpieczeństwo i transport między centrami danych. Jako pierwsza dedykowana rola sieciowa w organizacji, Staff Network Engineer łączy własność architektoniczną na poziomie personelu, kierownictwo techniczne i wpływ międzyfunkcyjny z praktyczną realizacją w zakresie projektowania, wdrażania, rozwiązywania problemów, automatyzacji i doskonalenia operacyjnego.
Inżynier sieci Staff jest właścicielem długoterminowego kierunku technicznego i strategii operacyjnej dla sieci wzajemnych AI Radian Arc, projektowania skalowalne struktury GPU i zapewniające przewidywalną wydajność o niskim opóźnieniu w przypadku rozproszonych obciążeń szkoleniowych i wnioskowania. Ta rola obejmuje projektowanie wielkoskalowych sieci RoCE i Ethernet, kierowanie decyzjami dotyczącymi architektury i zapewnianie doskonałości operacyjnej we wdrożeniach na całym świecie, od hiperskalowych centrów danych po mniejsze lokalizacje brzegowe. Będziesz ściśle współpracować z zespołami zajmującymi się platformami, obliczeniami, pamięcią masową, obserwowalnością i operacjami, aby zapewnić głęboką integrację sieci z ogólną architekturą infrastruktury.
Ta rola pełni również funkcję starszego punktu eskalacji w przypadku złożonych incydentów sieciowych, prowadząc dogłębne dochodzenia techniczne i ulepszenia systemowe, które zwiększają niezawodność, spójność opóźnień i dojrzałość operacyjną na całej platformie. Ponieważ jest to obecnie główna rola sieciowa w firmie, stanowisko to jest celowo hybrydowe: oczekuje się, że będziesz działać na poziomie L6 / Personel pod względem kierunku technicznego, standardów, wpływu między zespołami i długoterminowego projektu, jednocześnie bezpośrednio wykonując krytyczne prace sieciowe, które w większej organizacji byłyby rozproszone pomiędzy wiele inżynierowie.Co będziesz robić AI Fabric & HPC Networking Projektowanie i obsługa wysokowydajnych struktur sieciowych GPU obsługujących rozproszone obciążenia AI. Projektuj wielkoskalowe struktury RoCE zoptymalizowane pod kątem rozproszonego uczenia i wnioskowania.
Zoptymalizuj wydajność sieci pod kątem wzorców komunikacji GPU i ruchu wschód-zachód. Projektuj topologie sieci szkieletowej, takie jak: ○ Liść-kręgosłup○ Fat-Tree○ Architektury kolejowe○ Wielopłaszczyznowe wdrażanie wysokowydajnych technologii sieciowych, w tym:○ RDMA○ RoCE○ Szybkoprzepustowe struktury wschód-zachód○ Spectrum-XWspółpracuj z zespołami obliczeniowymi w celu wspierania rozproszonych ram szkoleniowych i bibliotek komunikacyjnych GPU.Zdefiniuj architektury referencyjne i zasady projektowania dla struktur AI, aby zapewnić zgodność z przyszłymi wdrożeniami standardy wielokrotnego użytku, a nie jednorazowe wdrożenia. Oceń kompromisy architektoniczne pod względem wydajności, odporności, kosztów, funkcjonalności i szybkości wdrażania oraz przekaż jasne zalecenia interesariuszom.
Sieć w centrach danych Projektuj i obsługuj sieci w centrach danych w warstwie 2 i 3. Wdrażaj skalowalne architektury routingu oparte na BGP i ECMP. Projektuj mechanizmy izolacji sieci dzierżawców w środowiskach z wieloma dzierżawcami.
Wdrażaj i utrzymuj: ○ Mosty sieciowe ○ Stosy routingu ○ Nakładane systemy sieciowe Utrzymuj routing wejściowy/wyjściowy północ-południe oraz zarządzanie ruchem. Zdefiniuj standardy i wzorce wielokrotnego użytku na potrzeby segmentacji, routingu i integracji nakładek we wdrożeniach platform. Technologie obejmują: Routery VyOS Stosy sieciowe Linux OVS / OVN Segmentacja BGP / ECMP VLAN / VRF Bezpieczeństwo i łączność brzegowa Wdrażanie i utrzymywanie infrastruktury bezpieczeństwa północ-południe Wdrażanie zabezpieczeń WAF i warstwy aplikacji Integracja kontroli bezpieczeństwa z usługami platformy Technologie obejmują: Citrix NetScaler / Citrix WAF Zakończenie TLS Ograniczenie DDoS Ochrona API i bramy proxy Sieć między centrami danych Projektowanie i obsługa prywatnych połączeń między centrami danych Wdrażanie i obsługa prywatnych połączeń między centrami danych utrzymywanie ciemnych architektur pierścieniowych Obsługa łączności WAN o dużej przepustowości między regionami Integracja struktur centrów danych z globalną siecią szkieletową Zdefiniowanie skalowalnych zasad projektowania dotyczących ewolucji szkieletu, routingu między lokacjami, redundancji i izolacji domen awarii Technologie obejmują: Transport DWDM / ciemne włókna Routing między lokacjami BGP Nadmiarowe architektury pierścieni światłowodowych Transport optyczny 100 - 400 G Inżynieria Spectrum-XGS Wykonanie i dostawa Wiodąca kompleksowa dostawa inżynieryjna infrastruktury sieciowej, od projektu i walidacji laboratoryjnej po wdrożenie produkcyjne.
Weryfikuj BOM sieci wraz z zespołami ds. zakupów i wdrożeń. Dostarczaj szczegółowych informacji na temat układu centrum danych i wysokości szafy. Planowanie pojemności dysków, modelowanie wydajności i strategie skalowania.
Zapewnienie, że zmiany w sieci są wykonywane bezpiecznie przy minimalnym wpływie na klienta. Pełnienie roli zarówno właściciela architektury, jak i praktycznego lidera wykonawczego dla krytycznych inicjatyw sieciowych w fazie rozbudowy funkcji sieciowej. Ustal standardy wdrażania, kryteria walidacji, podejścia do wycofywania zmian i wzorce akceptacji, które przyszli inżynierowie i zespoły będą mogli ponownie wykorzystać.
Niezawodność Własna wydajność operacyjna i niezawodność infrastruktury sieciowej Automatyzacja w zakresie: ○ Dostarczania ○ Zarządzania konfiguracją ○ Monitorowania○ Zarządzania cyklem życia Ulepszanie operacji drugiego dnia dzięki automatyzacji i narzędziom operacyjnym Kierowanie reakcją na incydenty i analizą głównych przyczyn głównych zdarzeń sieciowych Definiowanie i śledzenie umów SLA, SLO i wskaźników niezawodności Przekładanie głównych incydentów i problemów operacyjnych na trwałe standardy, zmiany projektowe i długoterminowe ulepszenia architektury Ustanawianie mierzalnych punktów odniesienia w zakresie niezawodności, spójności opóźnień, funkcjonalność i zachowanie podczas odzyskiwania w różnych wdrożeniach sieciowych. Współpraca międzyfunkcyjna Ściśle współpracuj z zespołami zajmującymi się infrastrukturą, platformą, SRE, obliczeniami, pamięcią masową, obserwowalnością i centrami danych. Zapewnij przywództwo techniczne w zakresie inicjatyw infrastrukturalnych.
Jasno komunikuj decyzje architektoniczne, kompromisy i ryzyko zainteresowanym stronom. Wpływaj na długoterminowy plan działania i architekturę sieci platform. Działaj jako główny organ odpowiedzialny za projektowanie sieci w całej organizacji, kierując sąsiadującymi zespołami w zakresie tego, w jaki sposób ograniczenia i możliwości sieci powinny kształtować decyzje dotyczące platform.
Podnieś poprzeczkę techniczną, doradzając inżynierom z sąsiednich dziedzin i pomagając w budowaniu przyszłej funkcji sieciowej. Technical Stack Sieć w centrach danych BGP EVPN / VXLAN ECMP VLAN / VRF OVS / OVN Sieć Linux BlueField DPU Routing & Control Plane VyOS Architektury routingu oparte na BGP Tkaniny ECMP Bezpieczeństwo Citrix NetScaler / WAF Ochrona przed DDoS Transport i szkielet Ciemne włókna Metro pierścienie światłowodowe Transport DWDM Sieć optyczna 100 - 1600G AI Networking RDMA RoCE GPU Tkaniny na dużą skalę sieci obliczeniowe wschód-zachód Kontrola przeciążenia Czego potrzebujesz Doświadczenie rdzenia Duże, praktyczne doświadczenie w projektowaniu i obsłudze wielkoskalowych sieci w centrach danych Specjalna wiedza na temat nowoczesnych protokołów sieciowych, w tym: ○ BGP○ OSPF○ ECMP○ EVPN / VXLAN Udokumentowane doświadczenie w obsłudze szybkich sieci Ethernet w środowiskach produkcyjnych Doświadczenie w obsłudze platform sieciowych NVIDIA / Mellanox Doświadczenie w posiadaniu zarówno architektury, jak i bezpośredniego wdrażania w oszczędnych lub szybko skalowalnych środowiskach Zdecydowanie preferowana jest zaawansowana tkanina AI Doświadczenie w zakresie sieci Kandydat powinien posiadać głęboką wiedzę specjalistyczną w zakresie projektowania i obsługi struktur sieciowych zoptymalizowanych pod kątem dużych klastrów GPU i rozproszonych obciążeń AI. Obejmuje to dobre zrozumienie wzorców komunikacji GPU oraz wymagań sieciowych rozproszonych systemów szkoleniowych i wnioskowujących.
Odpowiednia wiedza specjalistyczna obejmuje: Głębokie zrozumienie wzorców komunikacji NCCL i ich wpływu na topologię i wydajność sieci. Doświadcz dostrajania sieci RoCE pod kątem klastrów GPU na dużą skalę. Dobra znajomość zachowań transportowych RDMA i trybów awarii.
Praktyczne doświadczenie we wdrażaniu i dostrajaniu PFC i ECN pod kątem zarządzania ograniczeniami. Zrozumienie wzorców komunikacji zbiorowej GPU, takich jak all-reduce, all-gather, rozgłaszanie, redukuj-rozproszenie, i ich wpływu na ruch sieciowy wschód-zachód. Doświadczenie w projektowaniu zoptymalizowanych pod kątem kolei sieci szkieletowych GPU na potrzeby rozproszonych klastrów szkoleniowych i wnioskowania.
Znajomość diagnozowania problemów z wydajnością związanych z: ○ Przestojami NCCL ○ Przeciążeniem RDMA ○ Hotspotami Fabric ○ Utrata pakietów wpływająca na szkolenia rozproszone. Zrozumienie, w jaki sposób wydajność sieci wpływa na rozproszone platformy sztucznej inteligencji, takie jak PyTorch i TensorFlow. Kandydat powinien także umieć blisko współpracować z zespołami ds. platform obliczeniowych, aby zapewnić optymalizację infrastruktury sieciowej pod kątem rozproszonego szkolenia, rozproszonego wnioskowania i wysokoprzepustowej sztucznej inteligencji obciążenia.
Systemy i rozwiązywanie problemów Możliwość debugowania złożonych problemów międzywarstwowych obejmujących: ○ Sprzęt ○ Oprogramowanie sprzętowe ○ Sieć jądra ○ Warstwy komunikacji aplikacji rozproszonych Dobra znajomość sprzętu sieciowego, optyki i szybkich połączeń wzajemnych. Doświadczenie w projektowaniu systemów obserwowalności sieci. Silna umiejętność pełnienia roli starszego punktu eskalacji w przypadku niejednoznacznych, istotnych i wielodomenowych problemów technicznych.
Automatyzacja Silne umiejętności automatyzacji przy użyciu Pythona i/lub Bash. Doświadczenie w stosowaniu praktyk inżynierii oprogramowania do automatyzacji infrastruktury. Doświadczenie w tworzeniu narzędzi, standardów i metod walidacji wielokrotnego użytku, które zwiększają dźwignię w zespołach.
Przywództwo Udokumentowana umiejętność prowadzenia złożonych inicjatyw technicznych w zespołach. Wygodna współpraca pomiędzy inżynierami, operatorami i dostawcami. Silne myślenie na poziomie systemów, równoważące wydajność, niezawodność, skalowalność i koszty operacyjne.
Wykazana umiejętność wyznaczania kierunku architektury i napędzania przyjęcia standardów inżynieryjnych w całej organizacji. Udokumentowana umiejętność przewodzenia poprzez wpływ techniczny na wiele zespołów i domen, bez polegania na formalnych uprawnieniach do zarządzania ludźmi. Silne zdolności mentorskie i zdolność do podnoszenia poziomu technicznego sąsiadujących zespołów inżynierskich.
Potrafi zrównoważyć krótkoterminowe potrzeby wykonawcze z długoterminowym projektem platformy, trwałością operacyjną i efektywnością kosztową. Co oferujemy Atrakcyjny pakiet wynagrodzeń odzwierciedlający Twoją wiedzę i doświadczenie. Świetne środowisko pracy charakteryzujące się przyjaznością, międzynarodową różnorodnością, elastycznością i podejściem przyjaznym hybrydom. Będziesz częścią szybko rozwijającej się firmy, której misją jest wywarcie pozytywnego wpływu i oferowanie ekscytującej ewolucji kariery.
Nasze stanowiska mogą obejmować więcej niż jeden poziom stanowiska. Rzeczywista płaca podstawowa zależy od wielu czynników, takich jak umiejętności, które można przenieść, doświadczenie zawodowe, potrzeby biznesowe i wymagania rynkowe. Nasza włączająca odpowiedzialnośćRadian Arc angażuje się w tworzenie zróżnicowanego i włączającego środowiska i jest dumny z tego, że jest pracodawcą zapewniającym równe szanse.
Wszyscy wykwalifikowani kandydaci otrzymają wynagrodzenie za zatrudnienie bez względu na rasę, kolor skóry, religię, płeć, tożsamość lub ekspresję płciową, orientację seksualną, pochodzenie narodowe, genetykę, niepełnosprawność, wiek, status weterana lub jakąkolwiek inną kategorię chronioną na mocy obowiązującego prawa. Oryginalnie opublikowano w Himalajach
Pytania spolecznosci
Ktos tu pracowal? Zapytaj przed aplikacja.
Brak watkow dla tej oferty lub firmy.