O tym stanowisku
Numery telefonów i adresy e-mail w tym ogłoszeniu są ukryte do momentu zalogowania.
auto_translated_note
Informacje o ApprovalMax ApprovalMax to szybko rozwijająca się firma B2B SaaS, która pomaga firmom zautomatyzować przepływy pracy związane z zatwierdzaniem i kontrolę finansową. Dzięki globalnemu zespołowi składającemu się z ponad 150 osób w Wielkiej Brytanii, Europie, Ameryce Północnej, Australii i Afryce Południowej tworzymy oprogramowanie, które ma znaczenie i szybko się skaluje. Produkt Role Our Capture co miesiąc wyodrębnia uporządkowane dane z setek tysięcy dokumentów finansowych - faktur, rachunków, zamówień zakupu - za pomocą potoku OCR, który dopasowuje wyodrębnione pola do systemów księgowych klientów.
Twój KPI to współczynnik braku kontaktu: odsetek dokumentów, których dane wyjściowe systemu nie wymagają żadnej ręcznej korekty. Twoim zadaniem jest podnoszenie tego poziomu - systematycznie, wymiernie i trwale. Zbudowaliśmy fundament, zweryfikowaną strukturę pomiaru dokładności na pełnych danych produkcyjnych, kompleksową taksonomię błędów pierwotnych przyczyn, metodologię identyfikacji błędów i pierwsze dostarczone poprawki produkcyjne.
Dziedziczysz metodologię i zaległości. Potrzebujemy oddanego właściciela, który to wykona i skaluje. Prace dzielą około 70% badań danych kryminalistycznych i 30% inżynierii ML, przesuwając się w kierunku 50/50 w miarę trafiania modeli do produkcji.
Plan działania opiera się na czterech źródłach błędów: Dopasowywanie jednostek (~50% możliwych do naprawienia błędów). OCR poprawnie wyodrębnia wartości pól, ale potok dopasowuje je do niewłaściwego konta, dostawcy lub kodu podatku. Planowane: wyszukiwanie podobieństw oparte na osadzaniu, systemy rekomendacyjne, przewidywanie kodowania w oparciu o konsensus - samodzielna usługa uczenia maszynowego, którą wywołuje główny potok.
Logika rurociągu (~25%). Nasz proces przetwarzania końcowego wprowadza błędy poprzez własną deterministyczną logikę - błędna klasyfikacja traktowania podatkowego, zaokrąglenia, fałszywe linie korekty. Planowane: badania kryminalistyczne według wzorca, śledzenie danych na poszczególnych etapach przetwarzania, projektowanie i weryfikacja poprawek opartych na regułach.
Ekstrakcja OCR (~25%). Silnik OCR błędnie odczytuje dokument - zła waluta, fantomowe pozycje wiersza, błędy analizy strukturalnej. Planowane: zbuduj warstwę korekcji OCR - właściwym podejściem może być LLM z poręczami, alternatywny silnik OCR, model korekcji z HuggingFace lub kombinacja.
Wolność wyboru; rygorystyczność wymagana do walidacji. Zastąpienia użytkownika (~równa sumie powyższych, niższy priorytet). Użytkownicy zmieniają prawidłowe wartości ze względów biznesowych.
Przyszłość: naucz się wzorców korygowania organizacji/dostawców, buduj systemy rekomendacji na podstawie danych historycznych. Zdalnie - kandydaci muszą mieć siedzibę w Wielkiej Brytanii, Serbii lub Mołdawii. Kluczowe obowiązki: Badanie i pomiary dokładności (początkowo ~ 70%) Badanie, dlaczego dokumenty zawodzą w skali populacji - przeszukiwanie produkcyjnych zbiorów danych, porównywanie wielu reprezentacji danych w dokumencie, znajdowanie wzorców statystycznych wyjaśniających setki błędów jednocześnie.
W razie potrzeby zrównoważ analizę na poziomie populacji z analizą kryminalistyczną poszczególnych dokumentów. Posiadaj i rozwijaj ramy pomiaru dokładności. Każda poprawka ma oczekiwany wzrost, zmierzony wzrost i plan monitorowania po wdrożeniu.
Dziedzicz i ulepszaj metodologię identyfikacji błędów. Dwa tryby: analiza wspomagana przez LLM do odkrywania nowych wzorców w dużych partiach dokumentów oraz bezpośrednie badanie SQL pod kątem wzorców z czystymi podpisami statystycznymi. Metodologia jest sprawdzona i udokumentowana; ulepszasz go, korzystając z własnego instynktu analitycznego i wiedzy DS.
Projektuj poprawki błędów logiki potoku, czytając bazę kodu C#, rozumiejąc sekwencję kroków przetwarzania i identyfikując główne przyczyny. Ręcznie sprawdzane projekty dla inżynierów C# w celu wdrożenia produkcyjnego. Sprawdź zmierzone wyniki.
ML Engineering & Model Development (początkowo ~30%, rośnie) Zbuduj usługę dopasowywania jednostek opartą na osadzaniu: koduj sygnały dostawcy/opisu w reprezentacje wektorowe, oceniaj jakość wyszukiwania w porównaniu z podstawową prawdą, iteruj w rankingu. Wdróż jako usługę Python zintegrowaną z podstawowym potokiem C#. Zbuduj warstwę korekcji OCR, aby naprawić błędy wyodrębniania przed przetwarzaniem potoku.
Oceń kandydatów: wizyjne LLM z ustrukturyzowaną walidacją wyników, alternatywne silniki OCR, modele korekcji zorientowane na dokumenty. Projektuj wiązki ewaluacyjne według wzorca błędów, mierz współczynnik korekcji i ryzyko fałszywie dodatnich wyników, twórz produkty, które działają. Skonfiguruj orkiestrację potoków ML i praktyki MLOps: śledzenie eksperymentów, wersjonowanie modeli, zarządzanie potokami w oparciu o DAG (Airflow, Azure ML Pipelines lub równoważne), udostępnianie modeli kontenerowych, monitorowanie produkcji i alerty.
Poznaj metody rekomendacji i wykrywania wzorców w celu uczenia się zastępowania przez użytkownika. Twórz zbiory danych historii korekt, oceniaj algorytmy konsensusu, projektuj zrozumiałe rekomendacje. Współpraca: Praca osadzona w zespole Capture - stójki, kontekst sprintu, zrozumienie produktu.
Dokładność to Twoja misja; zespół to Twoje środowisko operacyjne. Współpracuj z zespołem AI w zakresie architektury modelu, najlepszych praktyk ML/AI i infrastruktury wdrożeniowej. Są właścicielami platformy ML; posiadasz na nim aplikację dokładności. Ściśle współpracuj z inżynierami backendu C# w zespole Capture.
Badasz i projektujesz; wdrażają i wysyłają. Ścisła, codzienna współpraca. Niezbędne umiejętności: badania i pomiary Rygor pomiaru jako dyscyplina podstawowa. Projekt oparty na podstawie prawdy, kontrola fałszywie dodatnia, weryfikacja wstrzymania, świadomość błędu selekcji.
Nie ufasz pewnym wynikom, dopóki nie zostaną niezależnie zweryfikowane. Badanie danych kryminalistycznych na dużą skalę. Znalazłeś systematyczne błędy w milionach rekordów w nieuporządkowanych, rzeczywistych danych - wykrywanie oszustw, uzgadnianie płatności, dokładność rozliczeń, jakość danych lub podobne domeny.
Myślisz dystrybucjami i czytasz surowe dane źródłowe przed sformułowaniem hipotez. Silny SQL (PostgreSQL, złożone zapytania analityczne) i Python (pandas, NumPy, scikit-learn) jako Twoje codzienne narzędzia badawcze. ML Engineering - Przetwarzanie dokumentów strukturalnych Praktyczne doświadczenie w dziedzinie przetwarzania dokumentów strukturalnych: analiza układu dokumentu, ekstrakcja tabeli, ekstrakcja informacji na poziomie pola, korekta wyniku OCR.
Zrozumienie, jak działają silniki OCR, gdzie zawodzą i jak zbudować przetwarzanie końcowe, które to kompensuje. Praktyczne umiejętności ML umożliwiające kompleksową realizację projektów: osadzanie (transformatory zdań / Hugging Face) i wyszukiwanie podobieństw wektorowych (FAISS, pgvector); systemy rekomendacyjne i rankingowe; ocena wyszukiwania; klasyfikacja (scikit-learn, wzmacnianie gradientu). Od eksperymentu, poprzez walidację, aż po wdrożenie produkcyjne.
Integracja LLM do zadań związanych z danymi strukturalnymi: szybka inżynieria ekstrakcji i korekcji (LangChain / LangGraph), analiza i walidacja ustrukturyzowanych danych wyjściowych (Pydantic, schemat JSON), punktacja pewności, ocena kompromisu koszt/dokładność/opóźnienie. MLOps i wdrażanie: orkiestracja potoków ML (Airflow lub Azure ML Pipelines), śledzenie eksperymentów (MLflow), śledzenie i ocena LLM (Langfuse), udostępnianie modeli kontenerowych, monitorowanie produkcji. Dostarczasz modele, które działają niezawodnie, a nie notebooki, które dobrze się prezentują.
Styl pracy: Samodzielny i autonomiczny. Jesteś jedyną osobą, która w pełnym wymiarze godzin poświęca się dokładności. Masz kierownictwo analityczne, ustalasz priorytety dla własnego dochodzenia i osiągasz wyniki przy minimalnym nadzorze.
Współpraca międzydyscyplinarna. Na co dzień współpracujesz z inżynierami C#, menedżerem produktu i zespołem AI. Przekazujesz wnioski na tyle jasno, aby inżynier mógł je wdrożyć, i na tyle technicznie, aby zespół AI mógł je przejrzeć.
Wygodny odczyt i śledzenie kodu C#/.NET. Naszą podstawową platformą i potokiem przetwarzania jest C# - nie będzie to przepisywane, chociaż nowe usługi można oddzielić. Diagnozujesz awarie czytając potok.
Pisanie w języku C# jest opcjonalne i można je delegować inżynierom C#. Mile widziane: Znajomość dokumentów finansowych lub księgowości (faktury, plany kont, traktowanie podatkowe, Xero/QBO). Doświadczenie z zarządzanymi usługami OCR (Azure DI, Google Cloud Vision, AWS Textract) lub alternatywami typu open source.
Doświadczenie z wstępnie wytrenowanymi modelami rozumienia dokumentów (LayoutLM, Donut lub podobne). Doświadczenie w budowaniu systemów oceny LLM jako sędzia lub LLM jako korektor. Doświadczenie w pracy z narzędziami do przetwarzania zorientowanego na dokumenty (docling, pdfplumber, PyPDF lub ich odpowiedniki).
Co oferujemy Rosnący międzynarodowy biznes z ponad 20 000 subskrybentów Regularne przeglądy wynagrodzeń oparte na wynikach 26 dni płatnego urlopu 1 dodatkowy dzień wolny na urodziny Pomoc zdalna w biurze Nagroda finansowa za lata pracy Pierwotnie opublikowane w Himalajach
Pytania spolecznosci
Ktos tu pracowal? Zapytaj przed aplikacja.
Brak watkow dla tej oferty lub firmy.