O tym stanowisku
Numery telefonów i adresy e-mail w tym ogłoszeniu są ukryte do momentu zalogowania.
auto_translated_note
O OLIXAI rozwija się szybciej niż jakakolwiek technologia w historii, a eksplozja popytu stworzyła ogromną lukę w infrastrukturze; nie możemy już budować chipów ani elektrowni wystarczająco szybko, aby dotrzymać kroku. Branża nadal opiera się na dziesięcioletnim projekcie sprzętowym, który osiągnął swój limit. Nowy paradygmat, szybszy i wydajniejszy, będzie największą szansą gospodarczą następnego stulecia i stworzy najważniejszą firmę następnej dekady.
OLIX Decode Accelerator 1 (DX-1) to pierwszy akcelerator zaprojektowany specjalnie do dekodowania. Wspólne projektowanie logiki, przenoszenia danych, pakowania, optyki i połączeń wzajemnych w skali szafy umożliwia skokową zmianę wydajności na poziomie systemu. Rola Poszukujemy inżyniera oprogramowania systemów architekta/personelu, który będzie odpowiedzialny za wdrażanie naszego akceleratora DX-1 nowej generacji jako platformy wnioskowania produkcyjnego.
DX-1 to architektura przepływu danych zbudowana specjalnie do dekodowania, wdrożona w zdezagregowanym środowisku wnioskowania. Twoja misja polega na tym, aby ten sprzęt obsługiwał duże modele AI w skali szafy, budując i rozszerzając środowisko wykonawcze i stos obsługujący, który łączy PyTorch i JAX aż do metalu. Jest to rola systemów obejmujących cały stos.
Będziesz pracować tam, gdzie spotykają się środowisko wykonawcze, sieć i akcelerator, ściśle współpracując z zespołami zajmującymi się sprzętem, kompilatorami i modelowaniem, aby zoptymalizować wydajność udostępniania. Twój wpływ mierzy się nie tylko tym, co tworzysz, ale także dźwignią, którą tworzysz: ustalonymi standardami, systemami i narzędziami, na których opierają się inne zespoły, oraz kierunkiem, jaki obierasz na platformie. Obowiązki Posiadanie stosu środowiska wykonawczego i obsługi: Projektuj, buduj i rozszerzaj rozproszone wnioskowanie i stos obsługujący (np. vLLM, SGLang, NVIDIA Dynamo, TensorRT-LLM) na DX-1, zamiast traktować dowolną warstwę jak czarną skrzynkę.
Skaluj wnioskowanie rozproszone: zdefiniuj sposób skalowania wnioskowania w wielu akceleratorach: równoległość tensora/potoku/danych, wzorce komunikacji zbiorowej, zarządzanie i odciążanie pamięci podręcznej KV oraz planowanie uwzględniające pamięć w zdezagregowanej topologii. Inżynier ds. niezawodności na dużą skalę: Zapewnij niezawodność wnioskowania rozproszonego we wszystkich domenach awarii (obsługa błędów, płynna degradacja, równoważenie obciążenia i odzyskiwanie) oraz zdefiniuj standardy obserwowalności, śledzenia i narzędzi, które pozwolą zespołom diagnozować problemy w środowisku wykonawczym, sieci i akceleratorze, a nie na podstawie samych dzienników. Wdrożenie napędu: Oceń zachowanie systemu, zanim układ krzemowy będzie w pełni dostępny (symulacja, emulacja, prototypowanie FPGA, modelowanie analityczne), wykryj przyczyny awarii podczas uruchamiania i wpływaj na decyzje projektowe w zespołach zajmujących się sprzętem i oprogramowaniem.
Ustanawiaj standardy w zespołach: Zidentyfikuj problemy systemowe o największym wpływie w zespołach i upewnij się, że zostaną rozwiązane; trzymaj i wyrażaj jasną poprzeczkę techniczną oraz podnoś do niej innych poprzez ocenę, łączenie w pary i bezpośrednie wyzwania; buduj efekt dźwigni poprzez systemy, ramy i rozwijaj talenty starszych pracowników, zamiast rozwiązywać wszystko osobiście. Kształtuj kierunek: nadaj strukturę i jasny kierunek niejednoznacznym problemom obejmującym wiele zespołów, pilnie wprowadzaj ulepszenia strukturalne i kształtuj kierunek strategiczny w domenie platformy w oparciu o badania zewnętrzne, świadomość konkurencyjności i powiązania branżowe, które pomagają generować talenty i kanały partnerstwa. Umiejętności i doświadczenie Głębokie doświadczenie w oprogramowaniu systemowym, z praktycznym językiem C/C++ i mocnymi podstawami systemów na granicy środowiska wykonawczego / sieci / akceleratora.
Wykazano, że jesteś właścicielem trudnego, kompleksowego problemu z systemami, w idealnym przypadku rozszerzając rozproszony stos wnioskowania/obsługi (vLLM, SGLang, NVIDIA Dynamo, TensorRT-LLM) w środowisku produkcyjnym, ze szczegółami dotyczącymi tego, co zbudowałeś lub zmieniłeś i dlaczego. Rozproszone wnioskowanie na dużą skalę: strategie równoległości, komunikacja zbiorowa, pamięć podręczna KV i zarządzanie pamięcią oraz niezawodność w domenach rozproszonych awarii w skali klastra. Płynność na granicy platformy, łączenie akceleratorów z PyTorch/JAX i udostępnianie stosów bez traktowania żadnego z nich jako nieprzejrzystego.
Debugowanie całego stosu: śledzenie od końca do końca i na osi czasu, odtwarzanie obciążenia i wnioskowanie na podstawie ograniczeń architektonicznych (SRAM, opóźnienie hosta-urządzenia, ślad KV, przepustowość pamięci, opóźnienie zbiorowe) aż do pierwotnej przyczyny. Silna, świadoma biznesowo ocena kompromisu w zakresie szybkości, kosztów i jakości oraz doświadczenie w ustrukturyzowanym, spokojnym postępowaniu z późno pojawiającym się ryzykiem. Doskonała komunikacja oraz umiejętność łączenia i wpływania na zespoły interdyscyplinarne (sprzęt, kompilator, modelowanie) bez polegania na formalnych autorytetach.
Wykształcenie wyższe lub wyższe w dziedzinie informatyki, elektrotechniki, matematyki lub pokrewnej dziedziny. Miło jest mieć doświadczenie z przepływem danych lub architekturami akceleratorów innych niż GPU; przygotowanie przed/po krzemie na niestandardowym sprzęcie (ASIC/FPGA); obserwowalność produkcji na dużą skalę (liczniki sprzętowe, eksport w stylu Prometheus/Grafana, widoki urządzeń i klastrów). Mile widziana jest dodatkowa wiedza: projektowanie klastrów HPC, szybkie sieci, systemy rozproszone lub heterogeniczne platformy obliczeniowe.
Wynagrodzenie i kapitał własny Konkurencyjne wynagrodzenie: proporcjonalne do Twojego doświadczenia, umiejętności i lokalizacji Kapitał własny i własność: Znaczące opcje na akcje. Nie tylko przyłączasz się do misji; masz jego część. Bonus zbliżeniowy: cenimy Twój czas.
Aby zminimalizować czas dojazdów do pracy i zmaksymalizować Twoje życie, oferujemy roczną premię Living-Local Bonus, jeśli Twoje miejsce zamieszkania znajduje się w promieniu 20 minut od biura. Świadczenia emerytalne: plany emerytalne finansowane przez pracodawcę, które pomogą Ci zbudować długoterminowe bezpieczeństwo finansowe. Ze względu na amerykańskie przepisy dotyczące kontroli eksportu, uprawnienia kandydatów do pracy w OLIX zależą od ich ostatniego obywatelstwa lub statusu stałego pobytu. Zasadniczo nie jesteśmy w stanie brać pod uwagę kandydatów, których ostatnie obywatelstwo lub miejsce stałego pobytu znajduje się w niektórych krajach objętych ograniczeniami (obecnie Iran, Korea Północna, Syria, Kuba, Rosja, Białoruś, Chiny, Hongkong, Makau i Wenezuela).
Kandydaci, którzy następnie uzyskali obywatelstwo lub pobyt stały w innym kraju niepodlegającym tym ograniczeniom, mogą nadal się kwalifikować.Wynagrodzenie: 337 GBP w Londynie • Od 337 GBP Znajdź pracę w Wielkiej Brytanii w serwisie Arbeitnow
Pytania spolecznosci
Ktos tu pracowal? Zapytaj przed aplikacja.
Brak watkow dla tej oferty lub firmy.