Starszy inżynier języka Python - ocena agenta kodującego AI (niezależny)
United Kingdom
Do uzgodnienia
O tym stanowisku
Numery telefonów i adresy e-mail w tym ogłoszeniu są ukryte do momentu zalogowania.
auto_translated_note
Prześlij swoje CV w języku angielskim i określ swój poziom znajomości języka angielskiego. Mindrift łączy specjalistów z możliwościami AI opartymi na projektach dla wiodących firm technologicznych, koncentrujących się na testowaniu, ocenie i ulepszaniu systemów AI. Uczestnictwo jest oparte na projektach, a nie na stałym zatrudnieniu.
Na czym polega ta możliwość: Budujemy zbiór danych do oceny agentów kodujących AI - jak dobrze model radzi sobie z zadaniami programistów w świecie rzeczywistym. Będziesz tworzyć wymagające zadania i kryteria oceny w realistycznie symulowanych środowiskach: Zbuduj realistyczne środowiska programistyczne - wirtualną firmę z bazą kodu, infrastrukturą i kontekstem (zgłoszenia, dokumenty, rozmowy), które tworzą wiarygodną historię rozwoju Projektuj zadania na podstawie stanów pośrednich tych środowisk - twórz podpowiedzi, zdefiniuj, co „rozwiązane” oznacza i upewnij się, że zadanie jest możliwe do rozwiązania przez agenta AI. Napisz testy weryfikujące rozwiązania agenta - zaakceptuj wszystkie prawidłowe podejścia i odrzuć nieprawidłowe, ani zbyt rygorystyczne, ani zbyt łagodne.
Iteruj po zadaniach i testach w oparciu o informacje zwrotne dotyczące kontroli jakości - przeglądaj rozwiązania agenta, analizuj błędy i udoskonalaj, aż ocena będzie rzetelna i solidna. Czego to NIE jest: Brak etykietowania danych Nie szybka inżynieria Nie pisanie kodu od zera - agent pisze większość kodu; prowadzisz i oceniasz Czego szukamy: Ponad 8 lat w tworzeniu oprogramowania Core stack: Python (FastAPI), JavaScript/TypeScript (React), Docker, Postgres, Kafka, Redis Doświadczenie w pisaniu testów (funkcjonalnych, integracyjnych) Znajomość języka angielskiego - B2+ Dlaczego to jest trudne: Modele Frontier są już dobrzy w kodowaniu. Stworzenie zadania, które rzeczywiście rzuca wyzwanie najlepszym modelom, nie jest trywialne.
Musisz głęboko zrozumieć, gdzie modele zawodzą i jakie scenariusze ujawniają różnicę między dobrym a złym rozwiązaniem. Zadania mają wiele poprawnych rozwiązań - pisanie testów, które akceptują wszystkie poprawne rozwiązania i odrzucają nieprawidłowe, jest trudniejsze, niż się wydaje. Jak to działa Aplikuj → Zdaj kwalifikacje → Dołącz do projektu → Wykonaj zadania → Zarabiaj Szacowany wysiłek Ukończenie zadań w tym projekcie szacuje się na 30 godzin, w zależności od złożoności.
Jest to szacunek, a nie wymóg harmonogramu; Ty wybierasz, kiedy i jak pracujesz. Zadania muszą zostać przesłane w terminie i spełniać wymienione kryteria akceptacji, aby zostały zaakceptowane. Wynagrodzenie: równowartość do 200 USD za godzinę, w zależności od poziomu i tempa.
Zadania szacowane są na ~30 godzin każde; ustalasz swój własny harmonogram. Oryginalnie opublikowano w Himalajach
Pytania spolecznosci
Ktos tu pracowal? Zapytaj przed aplikacja.
Brak watkow dla tej oferty lub firmy.