Ta strona używa plików cookies, aby zapewnić najlepszą jakość korzystania z naszego serwisu oraz do celów analitycznych. Klikając "Akceptuję", wyrażasz zgodę na używanie wszystkich plików cookies. Możesz również odrzucić zgodę, co spowoduje zablokowanie plików cookies analitycznych. Więcej informacji znajdziesz w naszej Polityce Prywatności.
Modulate pozyskało 25 mln dolarów na wykrywanie głosowych deepfake’ów
Modulate pozyskało dodatkowe 25 mln dolarów, a całkowite finansowanie firmy wzrosło do 60 mln dolarów.
Platforma Velma łączy ponad 100 wyspecjalizowanych modeli analizujących między innymi emocje, intencje i syntetyczną mowę.
Firma deklaruje analizę ponad 10 mln godzin dźwięku miesięcznie.
Technologia ma wspierać ochronę organizacji, moderację rozmów i monitorowanie agentów głosowych.
Sponsorowane
Odkryj rewolucyjną metodę nauki języków
Sprawdź jak w 30 dni opanować podstawy dowolnego języka obcego bez wychodzenia z domu.
Nadużywanie głosu generowanego przez sztuczną inteligencję staje się coraz większym problemem dla organizacji, platform internetowych i twórców usług głosowych. Na tym rynku chce działać firma Modulate, która pozyskała dodatkowe 25 mln dolarów od funduszu Future Ventures, przy udziale Hyperplane i Lakestar. Po tej rundzie całkowite finansowanie spółki wzrosło do 60 mln dolarów. Firma rozwija narzędzia mające wykrywać syntetyczną mowę, rozpoznawać szkodliwe zachowania i umożliwiać reakcję jeszcze w trakcie rozmowy.
Finansowanie ma przyspieszyć rozwój platformy Velma
Modulate zamierza przeznaczyć nowe środki na rozbudowę zespołu i infrastruktury technologicznej. Finansowanie ma także pomóc w rozwijaniu modeli, interfejsów API, zestawów SDK, integracji oraz sposobów wdrażania dostępnych dla deweloperów i partnerów tworzących aplikacje głosowe. Firma deklaruje jednocześnie dalsze inwestycje w podstawowe badania oraz własną technologię. Oznacza to, że celem nie jest wyłącznie udostępnienie pojedynczej funkcji do rozpoznawania deepfake’ów, lecz stworzenie warstwy analizy dźwięku, którą można wykorzystywać w różnych usługach.
System analizuje głos, emocje i przebieg rozmowy
Słownik artykułu
Pojęcia, które warto znać
Krótkie objaśnienia terminów występujących w tekście. Każde hasło prowadzi do szerszej definicji i przykładów użycia.
Modulate buduje modele AI przeznaczone do rozumienia niuansów ludzkiej rozmowy, niezależnie od tego, czy rozmowa jest naturalna, czy została wygenerowana albo zmodyfikowana. Firma wykorzystuje własną architekturę Ensemble Listening Model, określaną skrótem ELM, do tworzenia wyspecjalizowanych modeli zasilających platformę Velma. Velma łączy ponad 100 takich modeli. Każdy z nich może koncentrować się na innych sygnałach, między innymi emocjach, tonie wypowiedzi, intencji, syntetycznej mowie oraz zachowaniu rozmówcy. Podejście to ma pozwalać na analizowanie nie tylko tego, co zostało powiedziane, ale także sposobu prowadzenia rozmowy i cech samego dźwięku.
Modulate podaje, że jej system analizuje obecnie ponad 10 mln godzin dźwięku miesięcznie, a łączny analizowany wolumen przekroczył 600 mln godzin.
Firma twierdzi, że jej modele transkrypcji i wykrywania deepfake’ów zajęły pierwsze miejsca w publicznych testach porównawczych, takich jak Hugging Face.
Według deklaracji Modulate platforma Velma osiąga dwukrotnie wyższą dokładność niż tradycyjne LLM-y i generuje siedmiokrotnie mniej fałszywych alarmów.
Technologia jest rozwijana przede wszystkim do analizy głosu, a nie do tworzenia nowych głosów.
Wykrywanie ma prowadzić do reakcji w czasie rzeczywistym
Istotną cechą Velmy ma być działanie w czasie rzeczywistym. Aplikacja wykorzystująca platformę nie musi ograniczać się do późniejszego opisania lub zapisania rozmowy. Może także rozpoznawać sygnały wskazujące na syntetyczną mowę, określony sposób zachowania albo potencjalnie szkodliwy przebieg interakcji, a następnie zareagować, gdy rozmowa nadal trwa. To rozróżnienie jest ważne w sytuacjach, w których sama transkrypcja nie pokazuje całego kontekstu. Tekst może oddać treść wypowiedzi, ale nie zawsze zawiera informacje o tonie, emocjach, sposobie artykulacji lub oznakach maskowania głosu.
Zastosowania obejmują ochronę instytucji i moderację rozmów
Modulate wskazuje kilka obszarów, w których analiza głosu może być wykorzystana. Jednym z nich jest ochrona instytucji medycznych przed atakami z użyciem deepfake’ów. Kolejnym jest wsparcie agentów głosowych, które mają lepiej rozpoznawać emocje i odpowiadać w bardziej empatyczny sposób. Platforma może też służyć do ograniczania ekstremizmu i nękania na serwisach społecznościowych, monitorowania jakości pracy agentów głosowych oraz wykrywania rozmów, w których dochodzi do groomingu dzieci. Firma wymienia również ochronę pracowników działających w sytuacjach podwyższonego ryzyka, gdy zaawansowane maskowanie głosu może ułatwiać identyfikację osoby lub utrudniać ocenę, z kim faktycznie prowadzona jest rozmowa.
Głos staje się kolejnym obszarem wyścigu między generowaniem a wykrywaniem
Carter Huffman, dyrektor generalny i współzałożyciel Modulate, ocenia, że głos staje się podstawowym interfejsem kontaktu ze sztuczną inteligencją. Według niego tworzy to problemy, których nie da się rozwiązać wyłącznie na podstawie transkrypcji. Firma chce wykorzystywać analizę audio do ochrony organizacji przed atakami z użyciem deepfake’ów, rozpoznawania emocji w rozmowach, identyfikowania niebezpiecznych zachowań w usługach internetowych oraz sprawdzania, czy agenci głosowi działają zgodnie z założeniami. W tym ujęciu technologia nie ma zastępować wszystkich mechanizmów bezpieczeństwa, lecz dostarczać dodatkową warstwę analizy dla systemów, które już obsługują rozmowy głosowe.
Rozwój generatywnej AI sprawia, że fałszywe nagrania, syntetyczne głosy i nadużycia języka mogą pojawiać się w wielu rodzajach komunikacji. Modulate zakłada, że ręczne budowanie osobnej warstwy analizy audio dla każdej aplikacji byłoby zbyt trudne i czasochłonne. Dlatego chce dostarczać gotowe modele oraz infrastrukturę, aby zespoły tworzące usługi głosowe mogły skupić się na działaniu własnych produktów. W praktyce znaczenie takich narzędzi będzie zależeć nie tylko od samej skuteczności wykrywania, ale również od sposobu wdrożenia, jakości danych, zasad reagowania i kontroli liczby fałszywych alarmów.
Nowe środki mają zwiększyć skalę i dostępność rozwiązania
Firma przekonuje, że opracowana technologia została już sprawdzona przy dużej skali analiz, a nowe finansowanie pozwoli szybciej odpowiadać na popyt na rozwiązania do ochrony aplikacji głosowych. Rozbudowa modeli, API, SDK i integracji ma ułatwić korzystanie z platformy partnerom oraz deweloperom. Jednocześnie deklarowane wyniki dotyczące dokładności i liczby fałszywych alarmów pochodzą od samej Modulate i należy je odczytywać w kontekście testów oraz porównań wskazywanych przez firmę. Najważniejszym kierunkiem pozostaje połączenie wykrywania syntetycznego głosu z analizą zachowania i możliwością szybkiej reakcji na nadużycie.