O tym stanowisku
Numery telefonów i adresy e-mail w tym ogłoszeniu są ukryte do momentu zalogowania.
auto_translated_note
Inżynier infrastruktury ML - Remote Bright Vision Technologies to firma zajmująca się doradztwem technologicznym i tworzeniem oprogramowania, dostarczająca rozwiązania w zakresie chmury, sztucznej inteligencji, danych i rozwiązań dla przedsiębiorstw w całych Stanach Zjednoczonych. To fantastyczna okazja, aby dołączyć do uznanej i szanowanej organizacji oferującej ogromny potencjał rozwoju kariery. Stanowisko: Inżynier infrastruktury ML Lokalizacja: W 100% zdalne (USA) Rodzaj stanowiska: Pełny etat, bezpośrednie Zakres wynagrodzeń W2: 100 000 - 150 000 USD Wymagane roczne doświadczenie: ponad 6 lat Sponsoring: Obywatele USA, posiadacze zielonej karty, posiadacze EAD i kandydaci do przeniesienia H-1B zachęcani są do składania wniosków.
Nie możemy sponsorować nowych petycji wizowych H-1B na to stanowisko. Podsumowanie stanowiska Poszukujemy inżyniera infrastruktury AI do projektowania, budowania i obsługi warstwy platformy, która obsługuje obciążenia szkoleniowe i wnioskowania AI na dużą skalę. Rola ta koncentruje się na klastrach GPU, rozproszonych ramach szkoleniowych, harmonogramowaniu, wydajności pamięci masowej i doświadczeniu programistów dla inżynierów i badaczy ML, ze szczególnym naciskiem na niezawodność, wydajność i kontrolę kosztów.
Idealny kandydat zbudował lub obsługiwał produkcyjną infrastrukturę AI na dużą skalę, rozumie interakcję między sprzętem, jądrem, harmonogramem i strukturą ML oraz wnosi silną dyscyplinę inżynierii oprogramowania do pracy na platformie. Kluczowe obowiązki - Projektowanie i obsługa infrastruktury procesorów graficznych i akceleratorów na potrzeby szkolenia i wnioskowania, obejmującej klastry lokalne, usługi zarządzane w chmurze i konfiguracje hybrydowe. - Twórz systemy planowania, kolejkowania i udostępniania zasobów, które maksymalizują wykorzystanie akceleratora w wielu zespołach. - Zintegruj platformy takie jak PyTorch, JAX, DeepSpeed, FSDP, Megatron-LM i Ray Train w ujednoliconą ofertę platformy. - Obsługuj wysokowydajne systemy pamięci masowej i potoki danych, które dostarczają akceleratorom dane szkoleniowe z szybkością zbliżoną do liniowej. - Projektowanie architektur sieciowych obsługujących RDMA, InfiniBand, NCCL i komunikację zbiorową o dużej przepustowości. - Buduj obserwowalność obciążeń AI, w tym wykorzystanie, przepustowość, stabilność szkolenia i analizę trybu awarii. - Wdrażaj wzorce punktów kontrolnych, ponownego uruchamiania i odporności na błędy w przypadku długotrwałych zadań szkoleniowych na dużą skalę. - Optymalizuj koszty obliczeń, pamięci masowej i sieci poprzez planowanie, lokalną pojemność i odpowiedni rozmiar. - Opracuj narzędzia dla programistów i przepływy pracy o utwardzonej nawierzchni, które pozwolą naukowcom bezpiecznie i wydajnie przeprowadzać eksperymenty. - Współpracuj z zespołami badawczymi i stosowanymi w zakresie uczenia maszynowego, aby zaplanować pojemność na nadchodzące przebiegi szkoleniowe. - Wdrażaj kontrolę bezpieczeństwa, izolację i zarządzanie dostępem dla infrastruktury AI obsługującej wielu dzierżawców. - Zwiększ automatyzację w zakresie udostępniania klastrów, zarządzania cyklem życia i egzekwowania konfiguracji. - Utrzymuj elementy Runbook, pulpity nawigacyjne pojemności i dokumentację operacyjną platformy AI. - Bądź na bieżąco z badaniami nad infrastrukturą AI, sprzętem akceleracyjnym i pojawiającymi się narzędziami AI typu open source. Wymagane kwalifikacje - tytuł licencjata lub magistra w dziedzinie informatyki lub pokrewnej dziedziny. - Sześć lub więcej lat doświadczenia w infrastrukturze, platformie lub inżynierii HPC. - Praktyczne doświadczenie w obsłudze klastrów GPU lub infrastruktury szkoleniowej ML na dużą skalę. - Dobra znajomość języka Python i co najmniej jednego języka systemowego, takiego jak Go lub C++. - Dogłębne zrozumienie rozproszonego szkolenia, architektury akceleratorów i komunikacji zbiorowej. - Doświadczenie z Kubernetes, Slurm, Ray lub podobnymi systemami planowania dla obciążeń ML. - Dobra znajomość wewnętrznych elementów systemu Linux, sieci i wydajnej pamięci masowej. - Doświadczenie w zakresie infrastruktury ML oferowanej przez co najmniej jednego głównego dostawcę usług w chmurze. - Solidne praktyki inżynierii oprogramowania, w tym testowanie, CI/CD i przegląd kodu. - Doskonałe umiejętności komunikacji i współpracy międzyfunkcyjnej.
Preferowane kwalifikacje - doświadczenie w obsłudze sieci InfiniBand lub RDMA na dużą skalę. - Wkład w projekty infrastruktury ML typu open source. - Znajomość niestandardowych orkiestratorów lub zestawów szkoleniowych o poziomie badawczym. - Ekspozycja na pionierskie operacje szkoleniowe w zakresie modeli. - Doświadczenie z FinOps dla obciążeń AI. Jak aplikować Chcesz dowiedzieć się więcej o tej możliwości? W celu natychmiastowego rozpatrzenia oferty wyślij swoje CV na adres J***y@***.com lub skontaktuj się z nami pod numerem 90*** *** 544.
Dowiedz się więcej o technologiach Bright Vision na stronie www.bvteck.com. Firma Bright Vision Technologies jest pracodawcą zapewniającym równe szanse. Oświadczenie dotyczące równych szans w zatrudnieniu (EEO) Firma Bright Vision Technologies (BV Teck) zobowiązuje się do zapewnienia równych szans zatrudnienia (EEO) wszystkim pracownikom i kandydatom bez względu na rasę, kolor skóry, religię, płeć, orientację seksualną, tożsamość lub ekspresję płciową, pochodzenie narodowe, wiek, informacje genetyczne, niepełnosprawność, status weterana lub jakikolwiek inny status chroniony zgodnie z obowiązującymi przepisami federalnymi, stanowymi lub lokalnymi.
Zobowiązanie to rozciąga się na wszystkie aspekty zatrudnienia, w tym rekrutację, zatrudnianie, szkolenia, wynagrodzenia, awanse, przeniesienia, urlopy, rozwiązania stosunku pracy, zwolnienia i odwołania. BV Teck wyraźnie zabrania wszelkich form molestowania lub dyskryminacji w miejscu pracy. Jakakolwiek niewłaściwa ingerencja w zdolność pracowników do wykonywania obowiązków służbowych może skutkować wszczęciem postępowania dyscyplinarnego, aż do rozwiązania stosunku pracy włącznie.
Aplikuj bezpośrednio na RemoteJobs.org: https://remotejobs.org/remote-jobs/ml-infrastructure-engineer-bright-vision-technologies
Pytania spolecznosci
Ktos tu pracowal? Zapytaj przed aplikacja.
Brak watkow dla tej oferty lub firmy.