O tym stanowisku
Numery telefonów i adresy e-mail w tym ogłoszeniu są ukryte do momentu zalogowania.
auto_translated_note
O roliTa firma tworzy asystenta wykonawczego AI, który obsługuje pocztę e-mail, kalendarze, spotkania i oprogramowanie biznesowe. Jako analityk danych - oceny i jakość agentów będziesz właścicielem systemu pomiarowego, który określi, czy asystent rzeczywiście poprawia się w niejednoznacznych, rzeczywistych środowiskach. Będziesz współpracować bezpośrednio z inżynierami AI Agent Capabilities, aby generować dowody, które kształtują decyzje dotyczące produktu, wybór modeli i jakość wydania.
Jest to rola o wysokim poziomie własności, o głębokim technicznym charakterze, na styku stosowanej nauki o danych, oceny LLM i jakości produktu - idealna dla kogoś, kto lubi przekształcać trudne, otwarte pytania dotyczące jakości w rygorystyczne, praktyczne odpowiedzi. Co zrobisz: Architekt i utrzymywanie zautomatyzowanych procesów oceny, które mierzą jakość agentów na powierzchni produktu. Przekładaj możliwości agenta na jawne kryteria pozytywnego, częściowego pozytywnego wyniku i niepowodzenia dla złożonych, wieloetapowych zadań.
Twórz reprezentatywne złote zestawy danych i zestawy regresji obejmujące rzeczywiste przepływy pracy, przypadki brzegowe i scenariusze kontradyktoryjne. Zdefiniuj znaczące wskaźniki - powodzenie zadania, dokładność wyboru narzędzia, przestrzeganie instrukcji, spójność faktów, opóźnienia, koszt i niezawodność. Projektuj deterministyczne i oparte na modelach równiarki, kalibruj systemy LLM jako sędzia i uzgadniaj z równiarkami torowymi.
Porównuj modele, podpowiedzi i implementacje, korzystając z rygorystycznych eksperymentów offline i dowodów produkcyjnych. Analizuj ślady i wyniki produkcji, aby zidentyfikować pierwotne przyczyny i zbudować praktyczną taksonomię błędów. Zamień awarie produkcyjne w przypadki regresji i stale uzupełniaj luki w zakresie oceny.
Twórz pulpity nawigacyjne i publikuj sygnały jakości, które sprawią, że wyniki będą przydatne dla inżynierów, produktów i przywództwa. Polecaj ulepszenia inżynierom ds. możliwości i sprawdzaj, czy poprawki podnoszą jakość bez niedopuszczalnych regresji. Czego szukamyWymagane ponad 4 lata pracy na stanowisku Applied Data Science lub Machine Learning, z doświadczeniem w budowaniu i dostarczaniu systemów ewaluacyjnych, zautomatyzowanych potoków danych lub produkcyjnej infrastruktury ML.
Doświadczenie w projektowaniu i wdrażaniu zautomatyzowanych ram oceny, kryteriów sukcesu i zestawów regresji dla złożonych systemów AI/ML lub agentów. Biegłość na poziomie produkcyjnym w językach Python i SQL, z doświadczeniem w budowaniu i utrzymywaniu zautomatyzowanych potoków analitycznych na dużych zbiorach danych. Stosowane umiejętności statystyczne i eksperymentalne: testowanie istotności, analiza wariancji i pobieranie próbek w celu oceny niedeterministycznych systemów AI/ML.
Doświadczenie w opracowywaniu oznaczonych etykiet zbiorów danych, wytycznych dotyczących adnotacji i procesów kontroli jakości dla podstawowych danych w dynamicznych środowiskach produktów. Solidne zrozumienie zachowań agentów LLM: użycie narzędzi, wieloetapowe wykonanie, odzyskiwanie i praktyczne tryby awarii. Wykazana umiejętność analizowania śladów modelu, wywołań narzędzi i wyników w celu identyfikacji głównych przyczyn w modelu, podpowiedzi, narzędziu i warstwach danych.
Doświadczenie w korzystaniu z telemetrii produkcyjnej i danych dotyczących obserwowalności w celu monitorowania jakości systemu, tworzenia pulpitów nawigacyjnych i analizowania rzeczywistych wyników użytkowników. Miło jest mieć praktyczne doświadczenie z systemami LLM-a-a-sędziego, ocenianiem opartym na modelach lub platformami porównawczymi AI. Doświadczenie w wysyłaniu lub obsłudze produkcyjnych produktów ML, systemów agentowych lub oprogramowania konsumenckiego skierowanego do klienta.
Doświadczenie w przeglądaniu i dostosowywaniu publicznych standardów badawczych lub metodologii oceny akademickiej do rzeczywistych problemów związanych z produktami. Co sprawia, że świetnie pasujesz? Jesteś zorientowany na produkt - priorytetowo traktujesz wskaźniki powiązane z rzeczywistymi wynikami użytkowników, a nie tylko wygodne pomiary.
Zadajesz niejednoznaczne pytania dotyczące jakości, począwszy od projektu oceny, aż po decyzje dotyczące produktu. Piszesz łatwy w utrzymaniu kod o jakości produkcyjnej - a nie tylko doraźne notatniki. W naturalny sposób współpracujesz z inżynierami i swobodnie zagłębiasz się w ślady i elementy wewnętrzne systemu.
LokalizacjaTa rola jest na miejscu. Sponsoring wizowy nie jest dostępny dla tego stanowiska. Wynagrodzenie i świadczeniaW przypadku tej oferty nie podano szczegółów dotyczących wynagrodzenia.
Na tym etapie rozwoju firmy oczekiwany jest konkurencyjny pakiet współmierny do doświadczenia. Oryginalnie opublikowano w Himalajach
Pytania spolecznosci
Ktos tu pracowal? Zapytaj przed aplikacja.
Brak watkow dla tej oferty lub firmy.