Starszy inżynier języka Python - ocena agenta kodującego AI (niezależny)
Remote
£150 / za rok
O tym stanowisku
Numery telefonów i adresy e-mail w tym ogłoszeniu są ukryte do momentu zalogowania.
auto_translated_note
Prosimy o przesłanie CV w języku angielskim oraz wskazanie poziomu znajomości języka angielskiego. Mindrift łączy specjalistów z możliwościami sztucznej inteligencji opartymi na projektach dla wiodących firm technologicznych, koncentrujących się na testowaniu, ocenie i ulepszaniu systemów AI. Uczestnictwo jest oparte na projektach, a nie na stałym zatrudnieniu.
Na czym polega ta możliwość: Tworzymy zbiór danych w celu oceny agentów kodujących AI - tego, jak dobrze model radzi sobie z zadaniami programistów w świecie rzeczywistym. Będziesz tworzyć wymagające zadania i kryteria oceny w realistycznie symulowanych środowiskach: - Zbuduj realistyczne środowiska programistyczne - wirtualną firmę z bazą kodu, infrastrukturą i kontekstem (zgłoszenia, dokumenty, rozmowy), które tworzą wiarygodną historię rozwoju - Projektuj zadania na podstawie pośrednich stanów tych środowisk - twórz podpowiedzi, zdefiniuj, co oznacza „rozwiązane” i upewnij się, że zadanie jest możliwe do rozwiązania przez agenta AI - Napisz testy weryfikujące rozwiązania agentów - Akceptuj wszystkie prawidłowe podejścia i odrzucaj nieprawidłowe, ani zbyt rygorystyczne, ani zbyt łagodne - Wykonuj iteracje zadań i testów w oparciu o informacje zwrotne dotyczące kontroli jakości - przeglądaj rozwiązania agentów, analizuj awarie i udoskonalaj, aż ocena będzie rzetelna i solidna. Czego to NIE jest: - Brak etykietowania danych - Brak szybkiej inżynierii - Nie pisanie kodu od zera - agent pisze większość kodu; prowadzisz i oceniasz Czego szukamy: - Ponad 8 lat w tworzeniu oprogramowania - Core stack: Python (FastAPI), JavaScript/TypeScript (React), Docker, Postgres, Kafka, Redis - Doświadczenie w pisaniu testów (funkcjonalnych, integracyjnych) - Znajomość języka angielskiego - B2+ Dlaczego to jest trudne: Modele Frontier są już dobre w kodowaniu.
Stworzenie zadania, które rzeczywiście rzuca wyzwanie najlepszym modelom, nie jest trywialne. Musisz głęboko zrozumieć, gdzie modele zawodzą i jakie scenariusze ujawniają różnicę między dobrym a złym rozwiązaniem. Zadania mają wiele poprawnych rozwiązań - pisanie testów, które akceptują wszystkie poprawne rozwiązania i odrzucają błędne, jest trudniejsze niż się wydaje.
Jak to działa Aplikuj → Zdaj kwalifikacje → Dołącz do projektu → Wykonaj zadania → Zarabiaj Szacowany wysiłek Ukończenie zadań w tym projekcie szacuje się na 30 godzin, w zależności od złożoności. Jest to szacunek, a nie wymóg harmonogramu; Ty wybierasz, kiedy i jak pracujesz. Zadania, aby zostały przyjęte, muszą zostać przesłane w terminie i spełniać podane kryteria akceptacji.
Wynagrodzenie: równowartość do 150 dolarów za godzinę, w zależności od poziomu i tempa. Zadania szacowane są na ~30 godzin każde; ustalasz swój własny harmonogram. Aplikuj bezpośrednio na RemoteJobs.org: https://remotejobs.org/remote-jobs/senior-python-engineer-ai-coding-agent-evaluation-freelance-mindrift
Pytania spolecznosci
Ktos tu pracowal? Zapytaj przed aplikacja.
Brak watkow dla tej oferty lub firmy.