Starszy inżynier ds. niezawodności witryny - Token Factory (platforma wnioskowania)
Amsterdam, Netherlands; Berlin, United Kingdom; Prague, Czech Republic; Remote - Europe
Do uzgodnienia
O tym stanowisku
Numery telefonów i adresy e-mail w tym ogłoszeniu są ukryte do momentu zalogowania.
auto_translated_note
<div class="content-intro"><p><strong>O firmie Nebius:</strong></p> <p>Nebius wyznacza nową erę infrastruktury chmurowej dla globalnej gospodarki opartej na sztucznej inteligencji. Budujemy kompleksową platformę chmurową AI, która wspiera programistów i przedsiębiorstwa od szkolenia w zakresie danych i modeli po wdrożenie produkcyjne, bez kosztów i złożoności budowania dużej wewnętrznej infrastruktury AI/ML.</p> <p>Zbudowana przez inżynierów dla inżynierów. Od orkiestracji procesorów graficznych na dużą skalę po optymalizację wnioskowania - jesteśmy odpowiedzialni za trudne problemy związane z obliczeniami, pamięcią masową, sieciami i stosowaną sztuczną inteligencją.</p> <p>Jesteśmy notowani na giełdzie Nasdaq (NBIS) i z siedzibą w Amsterdamie.
Mamy globalny zasięg z centrami badawczo-rozwojowymi w Europie, Wielkiej Brytanii, Ameryce Północnej i Izraelu. Nasz zespół liczący ponad 1500 osób składa się z setek inżynierów posiadających głęboką wiedzę specjalistyczną w zakresie sprzętu, oprogramowania oraz badań i rozwoju sztucznej inteligencji.</p></div><p>Token Factory jest częścią <strong data-stringify-type="bold">Nebius Cloud</strong>, jednej z największych na świecie chmur GPU, obsługującej dziesiątki tysięcy procesorów graficznych. Budujemy platformę wnioskowania, która sprawia, że każdy rodzaj podstawowego modelu - tekst, wizja, dźwięk i powstające architektury multimodalne - jest szybki, niezawodny i łatwy do wdrożenia na masową skalę.
Aby spełnić tę obietnicę, potrzebujemy inżyniera, który sprawi, że platforma będzie działać bezbłędnie pod ekstremalnym obciążeniem i sprawnie przywracać działanie, gdy wydarzy się nieoczekiwane.</p> <p>W tej roli będziesz odpowiadać za niezawodność, wydajność i obserwowalność całego stosu wnioskowania. Twój dzień zaczyna się od projektowania i udoskonalania potoków telemetrycznych - metryk, dzienników i śladów, które zamieniają setki terabajtów sygnału w jasne, przydatne informacje. Stamtąd możesz dostroić automatyczne skalery Kubernetesa, aby wycisnąć większą wydajność z procesorów graficznych, stworzyć moduły Terraform, które zwiększają odporność każdego nowego klastra, lub wzmocnić naszą logikę routingu żądań i ponawiania prób, tak aby nawet przejściowe awarie pozostały niezauważone przez użytkowników.
Gdy wystąpią jakieś incydenty, będziesz polegać na automatyzacji i elementach Runbook, które pomogłeś stworzyć, aby wykrywać, izolować i naprawiać problemy w ciągu kilku minut, a następnie wspierać kulturę pośmiertną, która zapobiega ich ponownemu wystąpieniu. Wszystkie te wysiłki zmierzają do jednego celu: płynnego skalowania platformy przy jednoczesnym osiągnięciu ambitnych celów w zakresie kosztów i niezawodności.</p> <p>Sukces na tym stanowisku wymaga głębokiej biegłości w posługiwaniu się Kubernetesem, Prometheusem, Grafaną, Terraform i umiejętnością tworzenia infrastruktury jako kodu. Potrafisz swobodnie pisać skrypty w Pythonie lub Bash, rozumiesz niuanse projektowania alertów i SLO dla wysokoprzepustowych interfejsów API i spędziłeś wystarczająco dużo czasu w środowisku produkcyjnym, aby wiedzieć, jak rozproszone back-endy zawodzą w prawdziwym świecie.
Doświadczenie w zarządzaniu obciążeniami obciążającymi procesor graficzny - czy to z vLLM, Triton, Ray, czy innym stosem akceleratorów - będzie Ci przydatne, podobnie jak doświadczenie w MLOps lub platformach do hostowania modeli. Przede wszystkim zależy Ci na budowaniu systemów samonaprawiających się, lubisz debugować wydajność od jądra po warstwę aplikacji i lubisz współpracować z inżynierami oprogramowania, aby przekształcić niezawodność w funkcję, o której użytkownicy nie muszą myśleć.</p> <p>Jeśli pomysł ochrony infrastruktury, która napędza multimodalną sztuczną sztuczną inteligencję jutra, napawa Cię energią, chętnie poznamy Twoją historię.</p><div class="content-conclusion"><p><strong>Korzyści i korzyści:</strong></p> <ul> <li>Konkurencyjne wynagrodzenie</li> <li>Rozwój kariery i możliwości uczenia się</li> <li>Elastyczność i odpowiedzialność</li> <li>Kultura współpracy i innowacyjności</li> <li>Możliwość pracy nad wpływowymi projektami AI</li> <li>Międzynarodowe środowisko i utalentowane zespoły</li> </ul> <p><strong>Jak to jest pracować w Nebiusie:</strong></p> <p>Szybka praca - odważne myślenie - Stały rozwój - Znaczący wpływ - Zaufanie i rzeczywista własność - Możliwość kształtowania przyszłości sztucznej inteligencji </p> <p><strong>Oświadczenie o równych szansach:</strong></p> <p>Nebius jest pracodawcą zapewniającym równe szanse. Zależy nam na wspieraniu włączającego i zróżnicowanego miejsca pracy oraz zapewnianiu równych możliwości zatrudnienia we wszystkich aspektach zatrudnienia.
Nie dyskryminujemy ze względu na rasę, kolor skóry, religię, płeć (w tym ciążę), pochodzenie narodowe, pochodzenie, wiek, niepełnosprawność, informacje genetyczne, stan cywilny, status weterana, orientację seksualną, tożsamość lub ekspresję płciową lub jakąkolwiek inną cechę chronioną przez obowiązujące prawo.</p> <p>Aplikanci muszą mieć zezwolenie na pracę w kraju, w którym składają wniosek, i będą zobowiązani do przedstawienia dokumentu potwierdzającego uprawnienia do zatrudnienia jako warunku zatrudnienia. </p> <p>Jeśli potrzebujesz zakwaterowania w trakcie procesu aplikacyjnego, daj nam znać.</p></div>Znajdź więcej anglojęzycznych ofert pracy w Niemczech na Arbeitnow
Pytania spolecznosci
Ktos tu pracowal? Zapytaj przed aplikacja.
Brak watkow dla tej oferty lub firmy.