O tym stanowisku
Numery telefonów i adresy e-mail w tym ogłoszeniu są ukryte do momentu zalogowania.
auto_translated_note
Informacje o Wizard Wizard to najskuteczniejszy agent zakupowy AI, dostarczający najlepsze produkty z całej sieci z niezrównaną dokładnością, jakością i zaufaniem. Rola Poszukujemy naukowca stosowanego, który będzie odpowiedzialny za sposób mierzenia, rozumienia i ulepszania dokładności naszego agenta AI. Rola ta leży na styku stosowanego uczenia maszynowego, nauki o ewaluacji i produktu.
Zdefiniujesz, jak „dobrze” wygląda w przypadku naszego agenta, zbudujesz systemy do pomiaru tego stanu i poprowadzisz prace naukowe nad jego udoskonaleniem, w tym dostrajając sędziów LLM, którzy zasilają nasz proces oceny. Będziesz współpracować z ML Engineering i AI Engineering. Będziesz musiał naukowo odpowiedzieć na najważniejsze pytanie w Wizard: czy nasz agent czuje się coraz lepiej i skąd o tym wiemy?
To podstawowa osoba w naszym zespole naukowym. Ocena jest punktem wyjścia, a jej rola może przerodzić się w szersze prace w zakresie nauk stosowanych w miarę zwiększania się obszaru działania agenta (rekomendacje, personalizacja, ranking, zrozumienie multimodalne, konwersacyjne). Co będziesz robić - Zdefiniuj i rozwijaj metryki dokładności w całym procesie zakupowym (wyszukiwanie, ranking, rekomendacje, wyniki) - Projektuj i przeprowadzaj eksperymenty w celu pomiaru ulepszeń i regresji - Buduj i zarządzaj zbiorami danych ewaluacyjnych, wzorcami i ramami punktacji - Udoskonalaj sędziów LLM, którzy napędzają nasz proces oceny: podpowiadanie, kalibracja i dostrajanie tam, gdzie ma to znaczenie - Przekładaj niejednoznaczne pytania dotyczące produktu na jasne, mierzalne hipotezy i analizy - Współpracuj z inżynierami ML w celu walidacji zmiany modelu i prowadzenie iteracji - Identyfikuj tryby awarii i przypadki brzegowe oraz wprowadzaj ulepszenia za pomocą danych - Spraw, aby wydajność agenta była widoczna, zaufana i możliwa do podjęcia w odniesieniu do wszystkich produktów i inżynierii Pierwsze 3 miesiące - Zgłębij agenta, bieżący proces ewaluacji i metryki, których używamy dzisiaj - Audyt istniejących wskaźników dokładności i testów porównawczych; identyfikować luki, martwe punkty i sygnały, które nie są godne zaufania - Buduj relacje z ML, inżynierią AI i produktem - Zapewnij jedną szybką wygraną: brakujący punkt odniesienia, ulepszony wskaźnik lub poprawkę wprowadzającego w błąd sygnału - Ustal bazowy obraz wydajności agenta, wokół którego zespół może się skupić Miesiące 3 do 6 - Posiadaj ramy oceny: zbiory danych, metryki, scoring, raportowanie, zarówno offline, jak i online - Wprowadź wymierne ulepszenia jakości sędziego LLM (kalibracja, dostrajanie tam, gdzie to konieczne) - Przeprowadzaj eksperymenty, które mają wpływ na co najmniej jedną znaczącą zmianę modelu lub produktu - Przeprowadź automatyczną ocenę, której zespół ufa, przed i po każdym uruchomieniu - Twórz dashboardy i raporty, dzięki którym wyniki agentów będą czytelne dla kierownictwa Ponad 6 miesięcy - Kieruj pracami naukowymi na kolejnych frontach w miarę rozwoju agenta: wieloetapowa ocena, multimodalność, personalizacja, ranking jakości, zrozumienie poprzez konwersację - Wpływ na strategię na poziomie zespołu dotyczącą tego, co mierzymy, co ulepszamy i dlaczego - Opiekuj się mentorem i pomagaj w rozwijaniu funkcji naukowej Jak wygląda sukces Podobnie jak - Jasne, wiarygodne wskaźniki dokładności są konsekwentnie stosowane w przypadku wszystkich produktów i inżynierii - Solidne, zautomatyzowane ramy oceny zarówno dla eksperymentów offline, jak i na żywo - Zmiany modeli i produktów są stale mierzone przed i po wprowadzeniu na rynek - Wyraźna poprawa jakości sędziów LLM i zakresu ocen - Przywództwo naukowe, które informuje, co budujemy, a nie tylko czy to działa.
Rozwój kariery - Ścieżka dogłębna: zostań autorytetem organizacji w zakresie oceny sztucznej inteligencji: strategia ewaluacyjna, modele sędziowskie, testy porównawcze agentów - Ścieżka ogólna: rozszerzenie na inne problemy nauk stosowanych (zalecenia, personalizacja, ranking, multimodalność, zrozumienie konwersacyjne), gdy te obszary zostaną udostępnione online - Ścieżka przywództwa: starszy naukowiec / pracownik naukowy z kierownictwem technicznym w całej funkcji naukowej - W miarę zwiększania się kompetencji agenta, problemy naukowe stają się bogatsze Idealne tło - ponad 5 lat w stosowanym systemie uczenia się, badaniach nad sztuczną inteligencją lub naukach stosowanych (zdecydowanie preferowany stopień doktora lub równoważny) - Praktyczne doświadczenie w ocenie nowoczesnych systemów AI/ML: LLM, agenci, rankingi lub rekomendacje - Bezpośrednie doświadczenie z systemami opartymi na LLM: modele oceny, RAG, szybka inżynieria, dostrajanie, RLHF lub podobne - Solidne podstawy eksperymentalne: testy A/B, wnioskowanie przyczynowe, rygor statystyczny - Udowodniona umiejętność działania w niejednoznaczności: definiowanie problemów, a nie tylko rozwiązywanie wcześniej zdefiniowanych - Jasna, ustrukturyzowana komunikacja, która ma wpływ na ML, inżynierię i produkt Wynagrodzenia i świadczenia Oczekiwany zakres podstawowego wynagrodzenia na tym stanowisku wynosi 225 000 USD - 280 000 USD i będzie się różnić w zależności od umiejętności, doświadczenia, poziomu roli i lokalizacji geograficznej. Ostateczne wynagrodzenie zostanie ustalone na podstawie tych czynników oraz ogólnego zakresu roli i obowiązków. Oprócz wynagrodzenia podstawowego Wizard oferuje: - Kapitał własny w formie opcji na akcje - Ubezpieczenie medyczne, stomatologiczne i okulistyczne - Plan 401(k) - Elastyczny PTO i urlopy firmowe - Całkowicie zdalną pracę na terenie Stanów Zjednoczonych - Okresowe wyjazdy do firmy i spotkania zespołu Wizard zobowiązuje się do uczciwych, przejrzystych i konkurencyjnych praktyk w zakresie wynagrodzeń.
Aplikuj bezpośrednio na RemoteJobs.org: https://remotejobs.org/remote-jobs/ai-applied-scientist-wizard
Pytania spolecznosci
Ktos tu pracowal? Zapytaj przed aplikacja.
Brak watkow dla tej oferty lub firmy.