Menedżer produktu technicznego - platforma obliczeniowa AI
Europe, Netherlands
Do uzgodnienia
O tym stanowisku
Numery telefonów i adresy e-mail w tym ogłoszeniu są ukryte do momentu zalogowania.
auto_translated_note
O Nebiusie: Nebius wyznacza nową erę w infrastrukturze chmurowej dla globalnej gospodarki opartej na sztucznej inteligencji. Budujemy kompleksową platformę chmurową AI, która wspiera programistów i przedsiębiorstwa od szkolenia danych i modeli po wdrożenie produkcyjne, bez kosztów i złożoności budowania dużej wewnętrznej infrastruktury AI/ML. Zbudowany przez inżynierów dla inżynierów.
Od orkiestracji procesorów graficznych na dużą skalę po optymalizację wnioskowania - jesteśmy odpowiedzialni za trudne problemy związane z obliczeniami, pamięcią masową, siecią i zastosowaną sztuczną inteligencją. Jesteśmy notowani na giełdzie Nasdaq (NBIS) z siedzibą w Amsterdamie. Mamy globalny zasięg z ośrodkami badawczo-rozwojowymi w Europie, Wielkiej Brytanii, Ameryce Północnej i Izraelu.
Nasz zespół liczący ponad 1500 osób składa się z setek inżynierów posiadających głęboką wiedzę specjalistyczną w zakresie sprzętu, oprogramowania oraz badań i rozwoju sztucznej inteligencji. Rola Nasi klienci budują granice sztucznej inteligencji na platformie Nebius - szkoląc najnowocześniejsze modele, przeprowadzając wnioskowanie produkcyjne na dużą skalę, dostarczając badania i produkty, które określają dalszy kierunek rozwoju dziedziny. Budujemy chmurę sztucznej inteligencji, którą osoby tworzące granice sztucznej inteligencji wybierają celowo - nie na podstawie ceny, nie samej pojemności, ale sposobu, w jaki działa w codziennym użytkowaniu.
Aby to osiągnąć, powiększamy zespół ds. produktu AI Compute Platform i zatrudniamy wielu technicznych menedżerów ds. produktów na całej powierzchni platformy. Twój zakres zostanie określony na podstawie tego, co wniesiesz. Dopasujemy Twoje mocne strony techniczne, doświadczenia klientów i instynkty produktowe do obszaru platformy, na który możesz wywrzeć największy wpływ.
Platforma jest szeroka - i na naszą skalę każdy jej fragment ma kluczowe znaczenie. Jeśli chcesz pomóc w budowie najlepszej chmury AI na świecie - i masz zaplecze techniczne, aby zaangażować liderów inżynierii w charakterze partnera (a nie tłumacza) oraz komfort bezpośredniej rozmowy z klientami - ten zespół jest dla Ciebie. Platforma, którą pomożesz zbudować: Platformy sprzętowe i uruchomienie - wprowadzanie nowych platform GPU i CPU (GB300, Vera Rubin, ARM/Grace, przyszłe generacje) do produkcji z pełną gotowością do wprowadzenia na rynek na całym stosie.
Cykl życia klastra i operacje floty - wprowadzenie nowych regionów, uruchomienie klastrów z ponad 100 000 procesorów graficznych, architektura podziału i alokacji platformy, inżynieria wydań, automatyzacja cyklu życia hosta, wydajność operacyjna. Niezawodność i kontrola misji - automatyczna naprawa, kontrole stanu, SLA, szkolenia odporne na awarie, redukcja MTTR, zaufanie klientów na dużą skalę, obserwowalność jako produktu. Doświadczenie klienta i powierzchnia dla programistów - oblicz interfejsy API, konsolę, CLI, IMDS i sygnały w maszynie wirtualnej, samoobsługowe przepływy pracy, powiadomienia, możliwość obserwacji bezpośrednio przed klientem, ujednolicony UX w całej linii produktów.
Podstawowe usługi GPU i InfiniBand - sterowniki, oprogramowanie sprzętowe, topologia NCCL, IB/RoCE, NVLink, warstwa podstawowa, na której opiera się wszystko inne. Platformy zarządzanego środowiska wykonawczego - Soperator (Slurm-on-Kubernetes) i MK8S (zarządzany Kubernetes dla obciążeń AI), wspierające szkolenia i wnioskowanie dla pionierskich laboratoriów. Integracje platform i pojawiające się obciążenia - integracja Token Factory, infrastruktura RL i obciążenie agentowe, dzielenie się wydajnością, nowe powierzchnie biznesowe w miarę ich pojawiania się.
Program i dostawa międzyplatformowe - programy partnerskie NVIDIA, orkiestracja głównych prac konserwacyjnych, wydania wielostrumieniowe. Będziesz właścicielem jednego z fragmentów tej platformy od początku do końca - od strategii i planu działania, poprzez dostawę, przyjęcie i mierzalne wyniki. Twoje obowiązki będą obejmować (niezależnie od tego, który wycinek posiadasz): Własna kompleksowa odpowiedzialność za produkt w Twoim obszarze - strategia, plan działania, odkrywanie, dostawa, przyjęcie, mierzalne wyniki dla klientów i platformy.
Projektuj i twórz umowy dotyczące platform, na których polegają klienci - interfejsy API, semantyka, zdarzenia systemowe, powierzchnie skierowane do klienta, zachowania operacyjne - w jakości hiperskalera. Wspieraj realizację zadań między zespołami w zakresie inżynierii platform, sieci, pamięci masowej, Soperator/MK8S, obserwowalności, IAM, rozliczeń, planowania wydajności, wsparcia i projektowania produktów. Zamień ból klienta w zobowiązanie do produktu poprzez ustrukturyzowane odkrywanie - wywiady, analizy użytkowania, wzorce wsparcia, sekcje zwłok incydentów.
Zamknij pętlę, aby nie powtórzyła się awaria lub tarcie tej samej klasy. Zaangażuj inżynierów jako eksperta technicznego - omów projekt interfejsu API, uzasadnij kompromisy w zakresie systemu, oceń jakość elementów wewnętrznych platformy i sprzeciwiaj się, gdy projekt jest błędny. Zdefiniuj i opracuj wskaźniki sukcesu - to, co wysyłasz, mierzy się tym, co zmieniło się dla klienta lub platformy, a nie wielkością specyfikacji.
Bądź głosem produktu, do którego zwracają się zespoły mające kontakt z klientem (wsparcie, CX, TAM), gdy zachowanie systemu, umowa API lub wzorzec operacyjny wymagają decyzji dotyczącej produktu, a nie obejścia. Oczekujemy, że będziesz mieć ponad 6 lat doświadczenia w zarządzaniu produktami, kierowniku ds. platform, kierowniku ds. infrastruktury lub kierowniku działu SRE/inżynierii z silnym instynktem produktowym. Solidne podstawy techniczne i głębokość infrastruktury chmurowej - wygodne rozumowanie dotyczące semantyki API, zachowania płaszczyzny kontrolnej i płaszczyzny danych, zdarzeń systemowych i cyklu życia, realiów operacyjnych z wieloma dzierżawcami.
Możesz zaangażować liderów inżynierii jako rówieśników, a nie jako tłumacza. Doświadczenie z infrastrukturą chmurową, procesorem graficznym lub HPC - budowanie jej lub eksploatacja na znaczącą skalę (tysiące węzłów, wiele regionów, wielu dzierżawców). Historia dostarczania technicznie złożonych produktów platformowych o wymiernym wpływie na klienta lub platformę - wyniki ilościowe, a nie ambitne cele.
Silne umiejętności analityczne: wygodne definiowanie i opracowywanie metryk produktów, praca z telemetrią, tworzenie planów działania opartych na danych. Doświadczenie w prowadzeniu prac wymagających dużej liczby odkryć - ustrukturyzowanych wywiadów z klientami, analiz użytkowania, analiz zgłoszeń do pomocy technicznej - i przekształcania spostrzeżeń w dostarczony produkt. Dobra komunikacja i umiejętność łączenia inżynierii, SRE, zespołów zajmujących się kontaktem z klientem i interesariuszy wykonawczych.
Wysoki poziom własności, nastawienie na wysyłkę, wygoda w chaotycznej rzeczywistości operacyjnej i instynkt odsuwania się od inżynierii, gdy ucierpi na tym doświadczenie klienta lub jakość platformy. Będzie to dodatkowy bonus, jeśli posiadasz (nie wszystkie są wymagane - różne mocne strony pasują do różnych segmentów platformy): Doświadczenie w kontakcie z klientem i perspektywa przeżycia: Bezpośrednie doświadczenie PM z pionierskimi klientami AI - zespoły platform ML, inżynierowie MLOps, szkolenia i wnioskowanie na dużą skalę. Znajomość środowisk Kubernetes, Slurm, czy HPC od strony użytkownika oraz przepływów pracy szkoleniowych ML.
Praktyczne doświadczenie w zakresie szkoleń ML i przepływów pracy z wnioskowaniem - zwłaszcza rozproszone szkolenia na dużą skalę (wielowęzłowe, wiele procesorów graficznych; wygoda dzięki punktom kontrolnym, NCCL, szkoleniu odpornym na błędy, debugowaniu dużych zadań szkoleniowych). Doświadczenie jako klient infrastruktury chmurowej AI na dużą skalę - szczególnie jako członek wewnętrznego zespołu ds. platformy ML, który zbudował i obsługiwał infrastrukturę dla inżynierów ML w Twojej firmie. Jeśli doświadczyłeś tego, co frustruje klientów w chmurach, będziesz dokładnie wiedział, co staramy się naprawić.
Głębokość sprzętu, procesora graficznego i HPC: Bezpośrednie doświadczenie z architekturami referencyjnymi NVIDIA (NVL72, SuperPOD, MGX, DGX) i stosem NVIDIA (sterowniki, CUDA, NCCL, DCGM). Znajomość struktur InfiniBand / RoCE, cyklu życia oprogramowania sprzętowego, planowania uwzględniającego topologię. Praktyczne korzystanie z klastrów GPU lub struktur HPC w skali tysięcy węzłów.
Operacje na klastrach i flotach: podstawy cyklu życia Kubernetes (CAPI, aktualizacje klastrów, zarządzanie pulami węzłów) lub Slurm na dużą skalę. Doświadczenie w uruchamianiu nowych regionów chmurowych lub kompleksowym wdrażaniu centrów danych. Doświadczenie w inżynierii wydań, zarządzaniu zmianami lub orkiestracji głównych prac konserwacyjnych w środowiskach produkcyjnych.
Doświadczenie klienta i powierzchnia programisty: Ekspozycja na projektowanie konsoli/CLI/API w jakości hiperskalera - AWS, GCP, Azure, głębokość spójności, wersjonowanie, idempotencja, semantyka błędów, zasady wycofywania. Tło produktu obserwowalności - Grafana, Datadog, Honeycomb, New Relic. Znajomość artefaktów zaufania klientów - stron stanu, przepływów pracy RCA, dzienników audytu, raportowania SLA, powiadomień o konserwacji.
Znajomość wzorców produktów deweloperskich - Stripe, Cloudflare, Vercel, Supabase, Render. Niezawodność i wyniki operacyjne: doświadczenie w SRE, inżynierii niezawodności lub systemach odpornych na awarie dla płacących klientów. Znajomość istotnych wskaźników niezawodności: Goodput, MFU, MTTR, MTBF.
Doświadczenie z systemami automatycznej naprawy i płynną semantyką awarii. Pojawiające się obciążenia i integracje: Znajomość wzorców obciążeń RL / agentów / wnioskowania - vLLM, SGLang, Ray, obsługa w stylu Token Factory, technologie piaskownicy (Firecracker, gVisor, Kata). Doświadczenie w integracji wielu produktów w chmurze - udostępnianie pojemności, modele rozliczeniowe, pakowanie między produktami.
Tło strategii cenowej dla produktów infrastrukturalnych (poziomy zarezerwowane / na żądanie / z możliwością wywłaszczenia, ceny dwuczęściowe). O Nebiusie Nebius AI to platforma chmurowa AI z jedną z największych pojemności GPU w Europie. Uruchomiona w listopadzie 2023 r. platforma Nebius AI zapewnia wysokiej klasy infrastrukturę zoptymalizowaną pod kątem szkoleń dla specjalistów zajmujących się sztuczną inteligencją.
Jako preferowany przez firmę NVIDIA dostawca usług w chmurze, Nebius AI oferuje szeroką gamę procesorów graficznych NVIDIA do szkolenia i wnioskowania, a także zestaw narzędzi do wydajnego szkolenia z wieloma węzłami. Nebius AI jest właścicielem centrum danych w Finlandii, zbudowanego od podstaw przez zespół badawczo-rozwojowy firmy i odzwierciedlającego nasze zaangażowanie w zrównoważony rozwój. W centrum danych znajduje się ISEG, najpotężniejszy dostępny na rynku superkomputer w Europie i 16. najpotężniejszy na świecie (lista 500 najlepszych, listopad 2023 r.).
Siedziba firmy Nebius znajduje się w Amsterdamie w Holandii, a zespoły pracują w centrach badawczo-rozwojowych w Europie i na Bliskim Wschodzie. Nebius AI powstał dzięki talentowi ponad 500 wysoko wykwalifikowanych inżynierów z udokumentowanym doświadczeniem w opracowywaniu zaawansowanych rozwiązań chmurowych i uczenia maszynowego oraz projektowaniu najnowocześniejszego sprzętu. Dzięki temu wszystkie warstwy chmury Nebius AI - od sprzętu po interfejs użytkownika - mogą być budowane we własnym zakresie, co wyraźnie odróżnia Nebius AI od większości wyspecjalizowanych chmur: klienci Nebiusa otrzymują prawdziwie hiperskalerową chmurę dostosowaną do praktyków AI.
Każdego dnia rozwijamy się i poszerzamy nasze produkty. Jeśli podejmujesz wyzwanie i tak samo jak my ekscytujesz się sztuczną inteligencją i uczeniem maszynowym, dołącz do nas! Korzyści i korzyści: Konkurencyjne wynagrodzenie Możliwość rozwoju zawodowego i uczenia się Elastyczność i własność Kultura współpracy i innowacyjności Możliwość pracy nad wpływowymi projektami AI Międzynarodowe środowisko i utalentowane zespoły Jak to jest pracować w Nebiusie: Szybkość ruchu - Odważne myślenie - Stały rozwój - Znaczący wpływ - Zaufanie i prawdziwa własność - Możliwość kształtowania przyszłości AI Równe szanse Oświadczenie: Nebius jest pracodawcą zapewniającym równe szanse.
Zależy nam na wspieraniu włączającego i zróżnicowanego miejsca pracy oraz zapewnianiu równych możliwości zatrudnienia we wszystkich aspektach zatrudnienia. Nie dyskryminujemy ze względu na rasę, kolor skóry, religię, płeć (w tym ciążę), narodowość, pochodzenie, wiek, niepełnosprawność, informacje genetyczne, stan cywilny, status weterana, orientację seksualną, tożsamość lub ekspresję płciową lub jakąkolwiek inną cechę chronioną przez obowiązujące prawo. Kandydaci muszą posiadać zezwolenie na pracę w kraju, w którym składają wniosek, a jako warunek zatrudnienia będą zobowiązani do przedstawienia dowodu potwierdzającego uprawnienia do zatrudnienia.
Jeśli potrzebujesz zakwaterowania w trakcie procesu aplikacyjnego, daj nam znać.
Pytania spolecznosci
Ktos tu pracowal? Zapytaj przed aplikacja.
Brak watkow dla tej oferty lub firmy.