O tym stanowisku
Numery telefonów i adresy e-mail w tym ogłoszeniu są ukryte do momentu zalogowania.
auto_translated_note
Synthesia to wiodąca na świecie platforma wideo AI dla biznesu, z której korzysta ponad 90% firm z listy Fortune 100. Założona w 2017 roku firma ma siedzibę w Londynie, a biura i zespoły w Europie i USA. W miarę jak sztuczna inteligencja w dalszym ciągu kształtuje nasz sposób życia i pracy, Synthesia opracowuje produkty usprawniające komunikację wizualną i rozwój umiejętności w zakresie przedsiębiorczości, pomagając ludziom lepiej pracować i pozostać w centrum odnoszących sukcesy organizacji.
Po naszej ostatniej rundzie finansowania serii E, w ramach której zebraliśmy 200 milionów dolarów, nasza wycena wynosi 4 miliardy dolarów. Nasze całkowite finansowanie przekracza 530 milionów dolarów od czołowych inwestorów, w tym Accel, NVentures (oddział VC Nvidii), Kleiner Perkins, GV i Evantic Capital, a także założycieli i operatorów Stripe, Datadog, Miro i Webflow. Co będziesz robić w Synthesia Jako inżynier ds. badań dołączysz do zespołu ponad 40 badaczy i inżynierów w dziale badawczo-rozwojowym, pracujących nad najnowocześniejszymi wyzwaniami w przestrzeni generatywnej sztucznej inteligencji, ze szczególnym naciskiem na tworzenie wysokiej jakości, ekspresyjnych i syntetycznych głosów w czasie rzeczywistym.
W zespole będziesz miał okazję pracować nad zastosowaną stroną naszych wysiłków badawczych i bezpośrednio wpływać na nasze rozwiązania, z których korzysta ponad 60 000 firm na całym świecie. Jeśli jesteś ekspertem w dziedzinie uczenia maszynowego, LLM, generowania mowy i modeli konwersacji, to Twoja szansa na wywarcie globalnego wpływu. Dołączysz do naszego zespołu poszkoleniowego audio, który pracuje nad generatywną syntezą mowy i głosu, zapewniając, że nasze wewnętrzne modele głosu osiągną jakość, szybkość i solidność na poziomie produkcyjnym.
Typowe projekty obejmują: Opracowywanie i ocenę systemów przesyłania strumieniowego i zamiany mowy na mowę, umożliwiających interaktywną syntezę głosu o niskim opóźnieniu. Dostosuj modele do nowych sygnałów wejściowych warunkujących (emocje, prędkość, prozodia, sterowanie głośnikami itp.). Wdrażaj techniki optymalizacji po szkoleniu (kwantyzacja, przycinanie, destylacja), aby poprawić wydajność i opóźnienia w generowaniu mowy w czasie rzeczywistym.
Integruj i testuj nowatorskie architektury, takie jak kodeki neuronowe, modele dyfuzyjne lub modele dopasowujące przepływ, aby zwiększyć realizm i szybkość reakcji. Udział w definiowaniu nowych wskaźników oceny mowy konwersacyjnej, w tym uwzględniających opóźnienia i internetowych systemach przewidywania MOS. Bądź na bieżąco z najnowszymi badaniami w zakresie dyfuzji dźwięku, modeli autoregresyjnych, kodeków neuronowych i multimodalnych LLM.
Zastosuj DPO (bezpośrednią optymalizację preferencji) i destylację, aby dostroić wielkoskalowe modele mowy. Czego szukamy: Silnego zrozumienia modelowania generatywnego, idealnie zastosowanego do danych sekwencyjnych lub multimodalnych. Praktyczne doświadczenie z dużymi modelami językowymi (LLM) lub podobnymi architekturami opartymi na transformatorach.
Wysoka biegłość w PyTorch, w tym doświadczenie w zakresie szkoleń rozproszonych i optymalizacji modeli. Solidna znajomość modelowania i tokenizacji szeregów czasowych, najlepiej w kontekście dźwięku lub mowy. Wykazana umiejętność szybkiego prototypowania, testowania hipotez i wydajnej iteracji.
Udokumentowane doświadczenie w kompleksowym szkoleniu modeli głębokiego uczenia się, od przygotowania danych po ocenę. Silne ogólne umiejętności inżynierii oprogramowania, umożliwiające wkład w dużą, wspólną infrastrukturę badawczą. Miło jest mieć doświadczenie: doświadczenie z architekturami czasu rzeczywistego lub transmisji strumieniowej jest dużym plusem.
Znajomość najnowocześniejszych architektur generowania dźwięku i mowy (np. modele dyfuzyjne, kodeki neuronowe, modele dopasowywania przepływu, dekodery autoregresyjne). Doświadczenie z systemami zamiany mowy na mowę lub tekstu na mowę (TTS). Dowody oryginalnego wkładu badawczego, takiego jak publikacje lub prace typu open source w czołowych ośrodkach (np.
ICASSP, Interspeech, NeurIPS, ICML).
Pytania spolecznosci
Ktos tu pracowal? Zapytaj przed aplikacja.
Brak watkow dla tej oferty lub firmy.