O tym stanowisku
Numery telefonów i adresy e-mail w tym ogłoszeniu są ukryte do momentu zalogowania.
auto_translated_note
Kim jesteśmy: Budujemy infrastrukturę, która dostarcza ogromne ilości danych internetowych firmom szkolącym najpotężniejsze modele sztucznej inteligencji na świecie. Jesteśmy zespołem, który pomaga w zasilaniu i wspieraniu Grass, sieci współdzielącej przepustowość, która pozwala nam obsługiwać ogromny rozproszony robot indeksujący, zapewniając nam unikalny dostęp do wysokiej jakości publicznych danych internetowych na skalę globalną. Co więcej, stworzyliśmy potoki umożliwiające pozyskiwanie, segmentowanie i dodawanie adnotacji do miliardów filmów, transkrypcji i plików audio, umożliwiając tworzenie zbiorów danych dla pionierskich laboratoriów.
Jesteśmy szczupli, techniczni i szybko się poruszamy. Bez biurokracji i powolnego podejmowania decyzji; to tylko zespół programistów dążący do rozszerzenia możliwości otwartych danych internetowych i sztucznej inteligencji. Informacje ogólne: Jako inżynier ds. indeksowania badawczego będziesz projektować i obsługiwać wielkoskalowe systemy gromadzenia danych internetowych na potrzeby badań i opracowywania modeli.
Będziesz pracować nad systemami rozproszonymi, infrastrukturą scrapingową i potokami danych. Zadania Obowiązki: Budowanie i utrzymywanie wielkoskalowych robotów indeksujących sieci w różnych domenach Projektowanie wysokoprzepustowych, odpornych na błędy systemów do gromadzenia danych (miliony do miliardów adresów URL dziennie) Obsługa systemów antybotowych, limitów szybkości i witryn dynamicznych/obciążonych JS Opracowywanie potoków czyszczenia, deduplikacji, filtrowania i normalizacji Konstruowanie i utrzymywanie zbiorów danych na potrzeby badań i szkolenia modeli Monitorowanie wydajność indeksowania, zasięg i jakość danych; szybko iteruj Współpracuj z zespołami badawczymi, aby dostosować gromadzenie danych do potrzeb modelowania Optymalizuj infrastrukturę pod kątem kosztów, opóźnień i niezawodności WymaganiaWymagania: Duże doświadczenie w programowaniu w jednym lub kilku z: Go, Rust, Python, Java lub C++ Doświadczenie w budowaniu robotów sieciowych lub wielkoskalowych potoków danych Solidna znajomość protokołu HTTP, sieci i zachowania przeglądarek Znajomość systemów rozproszonych i przetwarzania równoległego Doświadczenie w pracy z dużymi zbiorami danych (preferowana skala TB - PB) Możliwość debugowania niestabilnych lub kontradyktoryjnych środowisk Preferowane/Premia: Doświadczenie z potokami NLP lub zarządzaniem zbiorami danych dla ML Znajomość systemów wstępnego uczenia i pobierania danych LLM Doświadczenie z przeglądarkami typu headless (np.
Chrome Dev
Tools Protocol, Playwright, Puppeteer) Znajomość systemów proxy, rotacji adresów IP i orkiestracji żądań na dużą skalę Doświadczenie w ocenie jakości danych lub testowaniu porównawczym Doświadczenie w uruchamianiu obciążeń w chmurze lub infrastrukturze typu bare-metal Na czym polega ta rola: Działanie na granicy skali i niezawodności Dostosowanie do stale zmieniających się środowisk internetowych Równowaga przepustowości, zasięgu i jakości danych Posiadanie kompleksowych potoków gromadzenia danych Kryteria oceny: Możliwość projektowania systemów skalowalnych bez pogarszania jakości Praktyczne rozwiązywanie problemów w warunkach ograniczeń rzeczywistych Szybkość iteracji i własności Wymierna poprawa zakresu danych, jakości lub wydajności Korzyści Wynagrodzenie: W oparciu o doświadczenie i wykazaną zdolność do działania na dużą skalę Przykładowe projekty: Zbudowa rozproszonego robota dla stale aktualizowanej sieci o wysokiej jakości projekt Zaprojektuj system do klasyfikowania i filtrowania miliardów stron na potrzeby wstępnego uczenia. Wyodrębniaj na dużą skalę ustrukturyzowane dane z dynamicznych witryn z dużym obciążeniem JS. Popraw deduplikację i ocenianie jakości w multimodalnych zbiorach danych.
Dlaczego warto z nami współpracować: Szansa. Jesteśmy liderem w opracowywaniu robota indeksującego i wykresu wiedzy na skalę internetową, który poprawia dostęp do publicznych danych internetowych i rozszerza wartość sztucznej inteligencji na ludzi. Kultura.
Jesteśmy chudym zespołem z wysoką poprzeczką. Przychodzimy do pracy nie po to, żeby czuć się komfortowo, ale żeby dowiedzieć się, do czego jesteśmy zdolni i wykonać pracę, która ma znaczenie. Nie wzywamy ludzi, którzy utrzymują porządek.
Wzywamy ludzi, którzy sprawiają, że wszyscy wokół nich stają się lepsi. Stawiamy na pierwszym miejscu niskie ego i wysoką wydajność. To zespół w pełni zdalny.
Odszkodowanie. Otrzymasz konkurencyjne wynagrodzenie, świadczenia i pakiet kapitałowy. Pierwotnie opublikowany w Himalajach
Pytania spolecznosci
Ktos tu pracowal? Zapytaj przed aplikacja.
Brak watkow dla tej oferty lub firmy.