Inżynier pomocy technicznej (klastry GPU) - weekendy w USA
Remote
£160,000 - £230,000 / za rok
O tym stanowisku
Numery telefonów i adresy e-mail w tym ogłoszeniu są ukryte do momentu zalogowania.
auto_translated_note
Informacje o stanowisku Jako inżynier wsparcia technicznego w pionierskiej firmie zajmującej się sztuczną inteligencją będziesz pierwszą linią obrony wspierającą klientów w opracowywaniu rozwiązań szkoleniowych, dostrajających i wnioskowujących za pomocą Together AI. Zanurzysz się w złożone wyzwania techniczne, zapewniając szybkie i skuteczne rozwiązania, jednocześnie pełniąc funkcję eksperta ds. produktów. Jako część organizacji Customer Experience będziesz ściśle współpracować z działem produktu i sprzedaży, przyczyniając się do ciągłego doskonalenia naszej oferty.
Jest to ekscytująca szansa dla profesjonalisty o głębokim doświadczeniu technicznym, pasjonującego się sztuczną inteligencją i sukcesem klientów, aby wywrzeć znaczący wpływ w dynamicznym, innowacyjnym środowisku. Wymagane godziny pracy - jest to stanowisko na pełen etat, pracujące w godzinach dziennych w USA. Rola będzie pracować zarówno w dni weekendowe (sobota i niedziela), jak i dwa dodatkowe dni powszednie. - Jest to zmiana 4-dniowa, 10 godzin dziennie, z dodatkowymi 2 godzinami dyżuru w soboty i niedziele. - Ta rola zacznie się od poniedziałku do piątku przez pierwsze kilka miesięcy, aby umożliwić rozwój i uczenie się od kolegów z zespołu.
Po uznaniu, że stanowisko jest w pełni rozwinięte, stanowisko zostanie przeniesione na 4-dniową zmianę weekendową. Obowiązki - Bezpośrednia współpraca z klientami w celu stawiania czoła złożonym wyzwaniom technicznym związanym z naszymi najnowocześniejszymi klastrami GPU Kubernetes; za każdym razem zapewniają szybkie i skuteczne rozwiązania. - Działaj jak klient mający do czynienia z SRE, aby zapewnić, że klastry Kubernetes naszego klienta pozostają sprawne i stabilne - Zostań ekspertem produktowym w naszej usłudze klastra GPU, służąc jako ostatnia linia obrony technicznej, zanim problemy zostaną eskalowane do zespołów inżynieryjnych i produktowych. - Monitoruj stan klastra GPU i proaktywnie komunikuj klientom problemy ze sprzętem (dławienie termiczne, awarie BMC, brakujące procesory graficzne i degradacja NVLink/InfiniBand) za pomocą jasnych kroków zaradczych - Obsługuj i konserwuj infrastrukturę produkcyjną dla klientów korzystających z procesorów graficznych dla przedsiębiorstw, w tym równoważenie floty, konserwację klastrów Slurm, naprawę/migrację węzłów i zarządzanie obciążeniem w oparciu o Kubernetes - Zbadaj i rozwiąż problemy z pamięcią masową i siecią, takie jak degradacja systemu plików Weka, łącze InfiniBand awarie i anomalie przepustowości w środowiskach typu bare-metal i maszynach wirtualnych - płynna współpraca między zespołami inżynieryjnymi, badawczymi i produktowymi w celu rozwiązywania problemów klientów; współpracować z liderami wyższego szczebla zarówno wewnętrznie, jak i zewnętrznie, aby zapewnić najwyższy poziom zadowolenia klientów. - Przekształcaj spostrzeżenia klientów w działania, identyfikując wzorce w przypadkach wsparcia i współpracując z zespołami inżynieryjnymi i zespołami ds. wejścia na rynek, aby opracować plan działania Together (np. przyszłe modele do wsparcia). - Utrzymuj szczegółową dokumentację konfiguracji systemu, procedur, przewodników dotyczących rozwiązywania problemów i często zadawanych pytań, aby ułatwić dzielenie się wiedzą z zespołem i klientami. - Bądź elastyczny w zapewnianiu wsparcia w święta, w nocy i w weekendy, zgodnie z potrzebami biznesowymi, aby zapewnić naszym klientom spójne i niezawodne usługi. Wymagania - Ponad 3 lata doświadczenia na stanowisku technicznym związanym z klientem, z co najmniej 1 rokiem na stanowisku wsparcia dla usługi AI lub we wspieraniu krytycznego API w SaaS - Doświadczenie jako inżynier SRE lub DevOps w pracy z Kubernetes - Silne zaplecze techniczne ze znajomością technologii AI, ML, GPU i ich integracji ze środowiskami obliczeń o wysokiej wydajności (HPC). - Zaawansowana wiedza na temat usług infrastrukturalnych (np.
Kubernetes, SLURM), infrastruktury w postaci rozwiązań kodowych (np. Ansible) wysokowydajnych struktur sieciowych, zarządzania pamięcią masową w oparciu o NFS, infrastruktury kontenerów oraz języków skryptowych i programowania. - Doświadczenie ze środowiskami klastrowymi HPC/Slurm - opróżnianie węzłów, planowanie zadań, przepływy prac konserwacyjnych - Znajomość koncepcji szybkich sieci - InfiniBand, RDMA, diagnostyka interfejsu sieciowego - Doświadczenie z rozproszonymi systemami pamięci masowej (np. Weka, NFS) i rozwiązywaniem problemów związanych z wejściami/wyjściami i przepustowością - Podstawowa wiedza na temat instalacji, konfiguracji, administracji, rozwiązywania problemów i zabezpieczania klastrów obliczeniowych. - Kompleksowe rozwiązywanie problemów technicznych i rozwiązywanie problemów, z proaktywnym podejściem do rozwiązywania problemów. - Możliwość współpracy międzyfunkcyjnej z zespołami takimi jak sprzedaż, inżynieria, wsparcie, produkt i badania w celu zapewnienia sukcesu klienta. - Silne poczucie odpowiedzialności i chęć uczenia się nowych umiejętności, aby zapewnić sukces zarówno zespołowi, jak i klientom. - Doskonałe umiejętności komunikacyjne i interpersonalne, z umiejętnością wyjaśniania złożonych koncepcji technicznych interesariuszom nietechnicznym. - Umiejętność działania w dynamicznych środowiskach, biegłość w zarządzaniu wieloma projektami i umiejętność częstego przełączania kontekstu i ustalania priorytetów.
O firmie Together AI Together AI to firma zajmująca się sztuczną inteligencją opartą na badaniach. Wierzymy, że otwarte i przejrzyste systemy sztucznej inteligencji będą napędzać innowacje i zapewniać najlepsze wyniki dla społeczeństwa, a razem mamy misję znacznego obniżenia kosztów nowoczesnych systemów sztucznej inteligencji poprzez współprojektowanie oprogramowania, sprzętu, algorytmów i modeli. Przyczyniliśmy się do wiodących badań, modeli i zbiorów danych o otwartym kodzie źródłowym, aby poszerzyć granice sztucznej inteligencji, a nasz zespół stoi za postępem technologicznym, takim jak FlashAttention, Hyena, FlexGen i RedPajama.
Zapraszamy Cię do przyłączenia się do grupy badaczy z pasją w naszej podróży ku budowaniu infrastruktury sztucznej inteligencji nowej generacji. Wynagrodzenie Oferujemy konkurencyjne wynagrodzenie, kapitał startowy, ubezpieczenie zdrowotne i inne świadczenia, a także elastyczność w zakresie pracy zdalnej. Podstawowy zakres wynagrodzeń w USA na tym stanowisku w pełnym wymiarze godzin wynosi: 160 tys.
USD - 230 tys. USD + kapitał własny + świadczenia. Nasze zakresy wynagrodzeń zależą od lokalizacji, poziomu i roli.
Indywidualne wynagrodzenie będzie ustalane na podstawie doświadczenia, umiejętności i wiedzy zawodowej. Równe Szanse Razem AI jest pracodawcą zapewniającym równe szanse i z dumą oferuje równe szanse zatrudnienia każdemu, bez względu na rasę, kolor skóry, pochodzenie, religię, płeć, pochodzenie narodowe, orientację seksualną, wiek, obywatelstwo, stan cywilny, niepełnosprawność, tożsamość płciową, status weterana i inne. Zapoznaj się z naszą Polityką prywatności na stronie Aplikuj bezpośrednio na RemoteJobs.org: https://remotejobs.org/remote-jobs/technical-support-engineer-gpu-clusters-us-weekends-together-ai
Pytania spolecznosci
Ktos tu pracowal? Zapytaj przed aplikacja.
Brak watkow dla tej oferty lub firmy.