O tym stanowisku
Numery telefonów i adresy e-mail w tym ogłoszeniu są ukryte do momentu zalogowania.
auto_translated_note
Kim jesteśmy: Budujemy infrastrukturę, która dostarcza ogromne ilości danych internetowych firmom szkolącym najpotężniejsze modele sztucznej inteligencji na świecie. Jesteśmy zespołem, który pomaga w zasilaniu i obsłudze Grass - sieci współdzielącej przepustowość, która pozwala nam obsługiwać ogromny rozproszony robot indeksujący, zapewniający nam unikalny dostęp do wysokiej jakości publicznych danych internetowych na skalę globalną. Co więcej, stworzyliśmy potoki umożliwiające pozyskiwanie, segmentowanie i dodawanie adnotacji do miliardów filmów, transkrypcji i plików audio, umożliwiając tworzenie zbiorów danych dla pionierskich laboratoriów.
Jesteśmy szczupli, sprawni technicznie i działamy szybko. Bez biurokracji i powolnego podejmowania decyzji; to tylko zespół twórców dążący do rozszerzenia możliwości otwartych danych internetowych i sztucznej inteligencji. Omówienie: Jako inżynier ds. indeksowania badań będziesz projektować i obsługiwać wielkoskalowe systemy gromadzenia danych internetowych na potrzeby badań i opracowywania modeli.
Będziesz pracować obejmie systemy rozproszone, infrastrukturę skrobania i potoki danych. Zadania Obowiązki: Tworzenie i utrzymywanie wielkoskalowych robotów indeksujących w różnych domenach Projektowanie wysokoprzepustowych, odpornych na błędy systemów do gromadzenia danych (miliony do miliardów adresów URL dziennie) Obsługa systemów antybotowych, limitów szybkości i witryn dynamicznych/obciążonych JS Opracowywanie potoków czyszczenia, deduplikacji, filtrowania i normalizacji Konstruowanie i utrzymywanie zbiorów danych do celów badawczych i szkolenia modeli Monitorowanie wydajności indeksowania, zasięgu i jakości danych; szybko iteruj Współpracuj z zespołami badawczymi, aby dostosować gromadzenie danych do potrzeb modelowania Optymalizuj infrastrukturę pod kątem kosztów, opóźnień i niezawodności Wymagania Wymagania: Silne doświadczenie w programowaniu w jednym lub kilku z: Go, Rust, Python, Java lub C++ Doświadczenie w budowaniu robotów sieciowych lub wielkoskalowych potoków danych Solidne zrozumienie protokołu HTTP, sieci i zachowania przeglądarek Znajomość systemów rozproszonych i przetwarzania równoległego Doświadczenie w pracy z dużymi zbiorami danych (preferowana skala TB - PB) Możliwość debugowania niestabilnych lub kontradyktoryjnych środowisk Preferowane / Premia: Doświadczenie z potokami NLP lub selekcją zbiorów danych dla ML Znajomość systemów wstępnego uczenia i pobierania danych LLM Doświadczenie z przeglądarkami bezgłowymi (np.
Chrome Dev
Tools Protocol, Playwright, Puppeteer) Znajomość systemów proxy, rotacji adresów IP i orkiestracji żądań na dużą skalę Doświadczenie w zakresie oceny jakości danych lub testów porównawczych Doświadczenie w uruchamianiu obciążeń w chmurze lub infrastrukturze typu bare-metal Na czym polega ta rola: Działanie na granicy skali i niezawodności Ciągłe dostosowywanie się do zmieniające się środowiska sieciowe Równoważenie przepustowości, zasięgu i jakości danych Posiadanie kompleksowych potoków pozyskiwania danych Kryteria oceny: Możliwość projektowania systemów skalowalnych bez pogarszania jakości Praktyczne rozwiązywanie problemów w warunkach ograniczeń rzeczywistych Szybkość iteracji i własności Wymierna poprawa zakresu danych, jakości lub wydajności Korzyści Wynagrodzenie: W oparciu o doświadczenie i wykazaną zdolność do działania na dużą skalę Przykładowe projekty: Zbuduj rozproszony przeszukiwacz do stale aktualizowanego projektu internetowego o wysokiej jakości Zaprojektuj system do klasyfikacji i filtruj miliardy stron na potrzeby wstępnego szkolenia Wyodrębniaj na dużą skalę uporządkowane dane z dynamicznych witryn z dużym obciążeniem JS Ulepsz deduplikację i ocenianie jakości w multimodalnych zestawach danych Dlaczego warto z nami współpracować: Szansa. Jesteśmy liderem w opracowywaniu robota indeksującego i wykresu wiedzy na skalę internetową, który poprawia dostęp do publicznych danych internetowych i rozszerza wartość sztucznej inteligencji na ludzi. Kultura.
Jesteśmy chudym zespołem z wysoką poprzeczką. Przychodzimy do pracy nie po to, żeby czuć się komfortowo, ale żeby dowiedzieć się, do czego jesteśmy zdolni i wykonać pracę, która ma znaczenie. Nie wzywamy ludzi, którzy utrzymują porządek.
Wzywamy ludzi, którzy sprawiają, że wszyscy wokół nich stają się lepsi. Stawiamy na pierwszym miejscu niskie ego i wysoką wydajność. To zespół w pełni zdalny.
Odszkodowanie. Otrzymasz konkurencyjne wynagrodzenie, świadczenia i pakiet kapitałowy. Znajdź więcej ofert pracy ze znajomością języka angielskiego w Wielkiej Brytanii na Arbeitnow
Pytania spolecznosci
Ktos tu pracowal? Zapytaj przed aplikacja.
Brak watkow dla tej oferty lub firmy.