O tym stanowisku
Numery telefonów i adresy e-mail w tym ogłoszeniu są ukryte do momentu zalogowania.
auto_translated_note
Prześlij swoje CV w języku angielskim i określ swój poziom znajomości języka angielskiego. Mindrift łączy specjalistów z możliwościami AI opartymi na projektach dla wiodących firm technologicznych, koncentrujących się na testowaniu, ocenie i ulepszaniu systemów AI. Uczestnictwo opiera się na projektach, a nie na stałym zatrudnieniu.
Informacje o roli Będziesz projektować zadania kodowania, które będą stanowić wyzwanie dla pionierskich agentów kodujących AI. Każde zadanie jest samodzielnym środowiskiem Dockera z uszkodzonym oprogramowaniem; agent AI próbuje naprawić; testy automatyczne weryfikują wynik. Twoim dostawcą jest pełny pakiet zadań: zepsuty kod, testy, instrukcje i rozwiązanie referencyjne potwierdzające, że zadanie jest możliwe do rozwiązania.
Obowiązki: Wymyśl realistyczny scenariusz dla programistów - prawdziwy błąd, uszkodzony ETL, brakująca funkcja - a nie problem z zabawką. Zbuduj odtwarzalne środowisko Docker z przypiętymi zależnościami. Napisz pytest, który weryfikuje wyniki, a nie konkretne polecenia - deterministyczny, niestabilny i nie powodujący wycieku poprawki.
Napisz plik instrukcji.md, który będzie brzmieć jak bilet do Jira, który otrzyma programista. Napisz referencję w pliku Solve.sh udowadniającą, że zadanie jest możliwe do rozwiązania. Skalibruj trudność tak, aby najnowocześniejsi agenci rozwiązali zadanie w 20 - 60% przypadków.
Wykonaj iterację w oparciu o opinie ekspertów zajmujących się kontrolą jakości. Później: przejrzyj zadania innych autorów jako recenzent kontroli jakości. Nie wchodzi w zakres Etykietowanie danych, szybka inżynieria.
Kod produkcyjny do wysyłki - projektujesz problemy i weryfikujesz je dla agentów AI. Zagadki Leetcode - scenariusze muszą wyglądać jak prawdziwa praca programisty. Nie każde proponowane zadanie jest realizowane - jakość ponad ilość.
Wymagania Ponad 3 lata tworzenia oprogramowania produkcyjnego w jednym stosie backendu - Python, Go, Node.js, Java lub Rust. Głębokość w jednym stosie bije szerokość. Płynność Python + pytest - wymagana niezależnie od podstawowego stosu.
Zespół zadań jest oparty na pyteście, nawet jeśli uszkodzona aplikacja jest w innym języku. Terminarze, parametryzacja, małpa, limity czasu, conftest.py. Tworzenie Dockera - odtwarzalne pliki Docker, przypięte zależności, wieloetapowe kompilacje w razie potrzeby, użytkownik inny niż root.
Linux i Bash - wygodne debugowanie w kontenerach (strace, lsof, journalctl); powłoka poza zestawem -euo pipefail. Doświadczenie agenta kodującego AI - Claude Code, Cursor, Roo Code lub podobne, w przypadku nietrywialnych prac. Możesz podać konkretny moment, w którym sztuczna inteligencja z całą pewnością się myliła i sposób, w jaki to wyłapałeś.
Angielski - poziom B2+ w piśmie. Nie nadają się na inżynierów Data Science, ML lub Computer Vision bez doświadczenia w zakresie inżynierii zaplecza. Manualni testerzy QA bez automatyzacji i tworzenia testów.
Tylko frontend, z małą ilością kodu/bez kodu, wsparcie IT lub analitycy biznesowi. Inżynierowie, którzy nigdy nie pisali pytestu od zera. Junior, stażysta lub asystent jako ostatnia rola.
Preferowane kwalifikacje Znajomość domeny w zakresie bezpieczeństwa, administracji systemem (nginx / systemd / cron), obliczeń naukowych (NumPy / PyTorch / SciPy), DevOps lub wewnętrznych elementów Git. Nowoczesne narzędzia Pythona (uv, poezja, pyproject.toml). Narzędzia do pokrycia (pytest-cov, zasięg.py, gcov, llvm-cov, kcov).
Fuzzing lub testowanie oparte na właściwościach (hipoteza). Wcześniejszy wkład w standardy oceny agentów lub powiązane ramy. ProcessApply → Zdaj kwalifikację (90-minutowy ekran przykładowego zadania + krótki wywiad behawioralny) → Dołącz do projektu → Wykonaj zadania → Zarabiaj.
Zaangażowanie czasowe Wdrożenie: ~10 godzin na pierwsze zadanie. Stan ustalony: ~5 godzin na zadanie, 2 - 4 równoległe zadania na autora. Realistyczne obciążenie tygodniowe: 8 - 20 godzin.
Większy wolumen dostępny dla najlepszych wykonawców. Ty wybierasz, kiedy i jak wnieść swój wkład; zadania muszą zostać przesłane w terminie i spełniać kryteria akceptacji. Wynagrodzenie: Płatne składki, stawki do 35 USD/godzinę*.
Wynagrodzenie oparte na zadaniu odpowiadające stawce godzinowej, w zależności od wydajności i objętości. Niektóre projekty obejmują płatności motywacyjne. *Stawki różnią się w zależności od wiedzy specjalistycznej, oceny umiejętności, lokalizacji, potrzeb projektu i innych czynników. Wysoce wyspecjalizowanym ekspertom mogą zostać przyznane wyższe stawki.
Niższe stawki mogą obowiązywać w fazie wdrażania lub na etapach projektu innych niż podstawowe. Szczegóły płatności są wspólne dla każdego projektu. AplikujPrześlij swoje CV za pośrednictwem platformy Mindrift.
Podaj swój poziom języka angielskiego, zanotuj tę rolę (Specjalista ds. oceny inżynierii oprogramowania - Terminal Bench) i dołącz link do profilu GitHub, jeśli jest dostępny. Oryginalnie opublikowano w Himalayas
Pytania spolecznosci
Ktos tu pracowal? Zapytaj przed aplikacja.
Brak watkow dla tej oferty lub firmy.