Wstęp
Wyobraźcie sobie technologię, która potrafi w kilka minut sklonować dowolny głos. Głos aktora, polityka… albo Wasz własny. Może przeczytać audiobook, zdubbingować film na kilkanaście języków albo prowadzić rozmowę z klientem w call center tak naturalnie, że większość ludzi nawet nie zorientuje się, że po drugiej stronie nie ma człowieka.
To nie jest futurystyczna wizja, ale technologia, która już dziś zmienia sposób, w jaki powstają podcasty, filmy, audiobooki i cała branża cyfrowej komunikacji.
I jedną z firm, która stoi dziś w samym centrum tej rewolucji, jest startup założony przez dwóch Polaków: ElevenLabs. Powstał w 2022 roku… a dziś jest wyceniany na około 11 miliardów dolarów.
W tym materiale pokażę Wam, jak działa ich technologia, na czym polega model biznesowy spółki i dlaczego inwestorzy uwierzyli, że właśnie w tym miejscu może powstać globalna infrastruktura głosu dla całego Internetu.
Polacy stworzyli firmę wartą 11 miliardów. AI, które sklonuje każdy głos! ElevenLabs podbija świat.
Kim są założyciele ElevenLabs i skąd wziął się ten pomysł
ElevenLabs to startup technologiczny założony w 2022 roku przez dwóch polskich przedsiębiorców. Firma wyspecjalizowała się w tworzeniu realistycznych głosów syntetycznych i narzędzi do przetwarzania mowy.
Za projektem stoją Piotr Dąbkowski i Mati Staniszewski. Pierwszy odpowiada za technologię i pełni funkcję CTO, czyli Chief Technology Officer. Studiował na Uniwersytecie Oksfordzkim, gdzie koncentrował się na uczeniu maszynowym. Oprócz tego studiował w Cambridge. Przed ElevenLabs pracował w Google, w zespołach zajmujących się modelami AI. Oprócz tego pracował także dla Opera Software i Tessian. Klasyczny współzałożyciel techniczny.
Mati Staniszewski reprezentuje z kolei stronę strategiczno-biznesową. To on pełni rolę CEO firmy. Ukończył studia matematyczne w Imperial College London. Zawodowo był związany między innymi z Palantirem, firmą znaną z pracy na dużych zbiorach danych i projektów o wysokiej złożoności operacyjnej. Pracował w roli związanej z wdrożeniami i rozwojem projektów dla klientów instytucjonalnych. Oprócz tego ma doświadczenie w pracy w Opera Software, BlackRock i Klarna.
Motywacja biznesowa też nie była tu przypadkowa. Punktem wyjścia była bardzo konkretna obserwacja: dubbing jest drogi, powolny i często brzmi sztucznie. W momencie, gdy generatywne modele tekstu zaczęły pisać na poziomie zbliżonym do człowieka, warstwa audio wciąż odstawała od ludzkiego głosu. Przedsiębiorcy uznali, że to właśnie głos stanie się kolejnym fundamentalnym elementem cyfrowej komunikacji, takim, który pozwoli tworzyć i dystrybuować treści szybciej, taniej i bez barier językowych. Odbiorcy chcą słuchać treści w swoim języku, naturalnym głosem i w wysokiej jakości.
Ekonomika tradycyjnego dubbingu tylko utwierdzała ich w przekonaniu, że w branży jest przestrzeń na zmianę. Firma oszacowała koszt na około 100 dolarów za minutę materiału, wliczając honoraria lektorów, studio i postprodukcję. Do tego dochodził problem czasu: nawet dziesięciominutowe wideo może wymagać dwóch tygodni pracy. To model, który w świecie natychmiastowej dystrybucji treści zwyczajnie nie nadąża. W tym segmencie założyciele dostrzegli realną lukę rynkową.
Kluczową kwestią było oparcie modelu na sprzedaży oprogramowania. Produkt dostępny online nie wymaga magazynów, logistyki ani lokalnej infrastruktury. Dzięki temu spółka mogła jednocześnie obsługiwać klientów w wielu krajach, bez fizycznej obecności na każdym rynku.
Sporo szczęścia było też w momencie wejścia na rynek. Segment generowania głosu w obszarze sztucznej inteligencji był i wciąż jest na wczesnym etapie rozwoju i nie wykształcił jeszcze trwałych, globalnych liderów. W dojrzałych branżach, takich jak e-commerce, ekspansja międzynarodowa oznacza bezpośrednią konfrontację z dominującymi platformami pokroju Amazona czy Temu. W przypadku branży generowania głosu przy użyciu AI rynek dopiero się kształtuje.
Jak działa technologia ElevenLabs
Tym bardziej, że narzędzia ElevenLabs są wyjątkowe. Firma dostarcza technologię, która służy do generowania i przetwarzania mowy, opartą na zaawansowanych modelach sztucznej inteligencji. W praktyce chodzi o syntezę głosu, czyli text-to-speech, klonowanie głosu oraz jego adaptację do wielu języków. Użytkownik wprowadza tekst, a model generuje wypowiedź, która brzmi naturalnie, z odpowiednią intonacją, tempem i emocjami. To jakościowy skok względem starszych syntezatorów, które brzmiały poprawnie, ale mechanicznie.
Kluczową różnicą jest sposób modelowania dźwięku. System nie „składa” mowy z gotowych fragmentów, tak jak robiły to starsze syntezatory mowy. Uczy się wzorców ludzkiego głosu na podstawie ogromnych zbiorów danych audio i generuje dźwięk od podstaw, przewidując nie tylko brzmienie pojedynczych słów, ale też ich kontekst emocjonalny. Dzięki temu narracja może być dynamiczna, spokojna, dramatyczna, w zależności od potrzeb.
Istotnym elementem jest też możliwość odtworzenia konkretnego głosu na podstawie krótkiej próbki.
Technologia klonowania głosu ma jednak także drugą stronę. Ten sam mechanizm, który pozwala twórcy wygenerować audiobook własnym głosem, może zostać użyty do stworzenia realistycznego deepfake’a.
W ostatnich latach pojawiały się przypadki, w których przestępcy wykorzystywali syntetyczne głosy do podszywania się pod członków zarządu firm czy członków rodziny w celu wyłudzenia pieniędzy. Wystarczy krótka próbka nagrania, aby stworzyć wiarygodną imitację głosu.
Z tego powodu firmy rozwijające tę technologię, w tym ElevenLabs, wprowadzają systemy weryfikacji użytkowników, mechanizmy zgłaszania nadużyć oraz cyfrowe znakowanie generowanego audio.
Zwłaszcza że stworzenie takiego głosu może zająć tylko kilka minut. Model analizuje charakterystyczne cechy mówcy i tworzy jego cyfrowy odpowiednik, co pozwala generować nowe treści w stylu danego lektora bez konieczności każdorazowego nagrywania w studiu. Ta sama technologia umożliwia także zachowanie barwy głosu przy zmianie języka, co ma ogromne znaczenie dla globalnej dystrybucji treści.
Wyobraźcie sobie hollywoodzki film, gdzie gra na przykład Keanu Reeves i słyszycie oryginalny głos aktora, tylko że… po polsku. Już nigdy więcej dylematu: dubbing czy lektor.
Dlaczego voice AI zmienia ekonomię treści
W praktyce oznacza to coś jeszcze bardziej przełomowego. Twórca w jednym kraju może przygotować materiał, który niemal natychmiast pojawi się w kilkunastu językach. Podcast nagrany w Polsce może kilka minut później brzmieć tak, jakby prowadził go native speaker z Japonii, Brazylii czy Francji.
W świecie Internetu oznacza to ogromną zmianę ekonomii tworzenia treści. Dotąd globalna dystrybucja wymagała zespołów tłumaczy, studiów nagrań i lokalnych lektorów. W modelu opartym na AI jeden twórca może produkować globalne treści praktycznie samodzielnie.
Dla twórców treści oznacza to w praktyce obniżenie kosztu i progu wejścia w produkcję audio. Audiobook, dubbing czy profesjonalna narracja przestają wymagać rozbudowanej infrastruktury. Twórca może wygenerować wysokiej jakości materiał z poziomu komputera. To zmienia ekonomię rynku: barierą nie jest już studio nagrań, ale pomysł i zdolność dotarcia do odbiorcy.
Na TikToku i w krótkich formach wideo pełno jest głosów generowanych przez AI, ale często są one słabo dopasowane i nienaturalne. Wystarczy kilka sekund, by usłyszeć sztuczność: błędną wymowę, złe akcentowanie, brak emocji. Szczególnie widać to w zagranicznych dokumentach, na przykład z polskim dubbingiem, gdzie wyrazy są kaleczone, a intonacja brzmi obco. To poziom, który zdradza technologię zamiast ją ukrywać.
W przypadku ElevenLabs punkt wyjścia jest inny. Platforma oferuje bibliotekę gotowych, profesjonalnych głosów w wielu językach, które nie brzmią jak typowa „sztuczna synteza”. Intonacja, tempo i emocjonalność są na tyle naturalne, że w wielu przypadkach trudno odróżnić je od nagrania człowieka.
Jeśli gotowe głosy z systemu nie wystarczają, można stworzyć własny, generowany na podstawie opisu, czyli promptu, albo poprzez klonowanie. Klonowanie polega na wgraniu próbki swojego głosu.
Platforma umożliwia też tworzenie audiobooków i automatyczny dubbing oraz oferuje Eleven API, czyli interfejs pozwalający firmom zintegrować generowanie głosu bezpośrednio z własnymi aplikacjami.
W praktyce technologia ta zaczyna pojawiać się w wielu segmentach rynku. Twórcy YouTube wykorzystują ją do tworzenia wielojęzycznych wersji swoich filmów. Wydawcy audiobooków mogą produkować znacznie więcej tytułów bez konieczności angażowania studiów nagraniowych. W branży gier pozwala ona szybko generować dialogi postaci w wielu językach.
Coraz częściej pojawia się też w systemach obsługi klienta, gdzie syntetyczne głosy zastępują tradycyjne komunikaty telefoniczne.
Wśród klientów ElevenLabs znajdują się dziś zarówno globalne korporacje, jak i twórcy indywidualni. Spółka publicznie wskazywała między innymi na współpracę z Deutsche Telekom, Revolut czy rządem Ukrainy. Jak na tym zarabiać?
Model biznesowy ElevenLabs
ElevenLabs działa w systemie subskrypcyjnym. Użytkownik płaci za plan i otrzymuje określoną pulę kredytów do wykorzystania w danym cyklu rozliczeniowym. Kredyty przeliczane są głównie na liczbę znaków tekstu przetworzonego na mowę. Im więcej generujesz audio, zwłaszcza przy dłuższych narracjach czy wielu wersjach językowych, tym szybciej zużywasz limit.
Wyższe plany oferują większą liczbę znaków, czyli w praktyce więcej godzin wygenerowanego materiału.
Plan spółki jest jednak szerszy niż po prostu oferowanie subskrypcji na dubbing. Chodzi o zbudowanie globalnej infrastruktury głosu, która stanie się standardem w tworzeniu, tłumaczeniu i przetwarzaniu mowy.
W krótkim terminie firma rozwija automatyczny dubbing i dostosowuje treści tak, aby wideo, podcast czy audiobook mogły być szybko dostępne w wielu językach.
W średnim horyzoncie celem jest AI głosowe w czasie rzeczywistym. Tłumaczenie rozmów na żywo, konwersja głosu w trakcie połączeń, zastosowania w call center, grach online, wideokonferencjach. To nie będzie etap postprodukcji, ale komunikacja w czasie rzeczywistym.
To też kierunek, który zbiega się z rozwojem tzw. agentów AI. W takim modelu sztuczna inteligencja generuje odpowiedź tekstową, która natychmiast zamieniana jest na naturalnie brzmiącą mowę.
Głos przestaje więc być tylko narzędziem do nagrywania treści, a zaczyna być podstawowym interfejsem komunikacji między człowiekiem a systemami AI.
Wyobraźcie sobie, że na czacie głosowym w grze wideo możecie rozmawiać z graczami z całego świata w rodzimym języku, bo narzędzia ElevenLabs po prostu na bieżąco będą tłumaczyć, co do siebie mówicie. Albo wyobraźcie sobie, że wchodzicie na konferencję wynikową spółki z dowolnego zakątka świata, a technologia ElevenLabs tłumaczy całą konferencję na język polski w czasie rzeczywistym, a to nie wszystko.
Długofalowo ElevenLabs chce stać się warstwą technologiczną osadzoną w platformach medialnych i komunikacyjnych. Tak, by globalne serwisy streamingowe, aplikacje społecznościowe czy systemy obsługi klienta korzystały z ich silnika jako domyślnego rozwiązania do obsługi języka i głosu, a na tym rynku jest o co walczyć.
Jak duży jest rynek voice AI
Wykres pokazuje skalę rynku. Rynek technologii głosowych rozwija się bardzo szybko. Audiobooki, podcasty, gry wideo, systemy obsługi klienta czy platformy streamingowe generują ogromny popyt na wysokiej jakości narrację. Według różnych analiz globalny rynek technologii voice AI w najbliższych latach może osiągnąć wartość kilkudziesięciu miliardów dolarów.
To właśnie w tym rosnącym segmencie ElevenLabs próbuje zbudować swoją pozycję jako dostawca technologii.
Prezentacja pochodzi z 2022 roku, czyli roku założenia spółki. Warto to podkreślić, bo od tamtej pory ten rynek niemal na pewno urósł. Jednak ta branża jest jeszcze na tyle niszowa, że cierpi na deficyt branżowych raportów. Spółka określiła w prezentacji liczbę potencjalnych użytkowników swoich narzędzi.
Ponad 50 milionów twórców treści na świecie, czyli całkowity rynek. To wszyscy twórcy publikujący wideo i audio. Poniżej mamy 2 miliony profesjonalnych twórców, czyli segment o najwyższej skłonności do płacenia za narzędzia premium. Jeszcze wężej: 100 tysięcy twórców YouTube z ponad 500 tysiącami subskrybentów, duży, wysoce widoczny segment o wysokiej intensywności produkcji. Na samym dole 10 tysięcy twórców, którzy już dodają napisy do filmów, „natychmiastowy segment”, czyli użytkownicy najbardziej skłonni do wdrożenia automatycznego dubbingu.
Na slajdzie przedstawiono również uproszczony scenariusz przychodowy oparty na grupie około 100 tysięcy twórców YouTube, którzy potencjalnie mogliby najszybciej wdrożyć taką technologię. Przyjęto założenie, że każdy z nich publikuje średnio trzy filmy miesięcznie, po 10 minut każdy, a materiał jest dubbingowany na trzy języki. To przekłada się na około 9 milionów minut generowanego audio miesięcznie. Przy modelowej stawce 1 dolara za minutę oznaczałoby to około 110 milionów dolarów rocznego przychodu.
To nie są rzeczywiste wyniki finansowe, lecz scenariusz projekcyjny sprzed 3 lat. Spółka pokazywała inwestorom, że nawet przy stosunkowo wąskiej grupie profesjonalnych twórców można zbudować znaczącą skalę przychodów. Logika jest prosta: nie trzeba zdobywać całego rynku 50 milionów twórców. Wystarczy skoncentrować się na dobrze monetyzowanym segmencie, który generuje duży wolumen treści i ma realną potrzebę lokalizacji. I jak widać po dotychczasowych wynikach, firma chyba nie podrasowywała starych slajdów za bardzo.
Wyniki, ARR i tempo wzrostu spółki
Oczywiście jeśli chodzi o faktyczne wyniki, to ElevenLabs jako firma prywatna nie publikuje pełnych sprawozdań finansowych. Zamiast tego, jak wiele spółek technologicznych na etapie wzrostu, komunikuje się wskaźnikiem ARR, czyli Annual Recurring Revenue, a więc rocznych powtarzalnych przychodów z subskrypcji i kontraktów.
Pierwszy produkt firmy trafił na rynek w 2023 roku. Według deklaracji założycieli osiągnięcie poziomu 100 mln USD ARR zajęło 20 miesięcy. Kolejne 10 miesięcy pozwoliło podwoić tę wartość do 200 mln USD, a następne 5 miesięcy przyniosło wzrost do około 330 mln USD ARR. Taki profil dynamiki wskazuje na bardzo szybkie tempo skalowania, charakterystyczne dla firm, które trafiły w moment rynkowy i mają produkt o globalnym zastosowaniu.
Nic więc dziwnego, że spółka posiada duże zainteresowanie wśród inwestorów i z sukcesem przeprowadza kolejne rundy finansowania. Sukces ElevenLabs wynika z kilku czynników. Po pierwsze, firma trafiła w moment gwałtownego rozwoju generatywnej sztucznej inteligencji. Po drugie, bardzo szybko osiągnęła jakość technologii, która w wielu zastosowaniach zbliża się do naturalnej mowy. Po trzecie, od początku budowała produkt w modelu globalnym, dostępny przez internet dla użytkowników z całego świata. Połączenie tych trzech elementów pozwoliło spółce bardzo szybko zdobyć dużą bazę użytkowników.
Kapitał do ElevenLabs popłynął więc szeroko. Od startu domykała kolejne rundy finansowania szybko i przy rosnących wycenach. Firma przeprowadziła dotąd kilka rund finansowania.
Finansowanie ElevenLabs i zainteresowanie inwestorów
Runda pre-seed została zamknięta w styczniu 2023 r. Spółka pozyskała 2 mln USD przy wycenie około 10 mln USD. Był to kapitał typowo zalążkowy dla bardzo wczesnego etapu rozwoju technologii.
W czerwcu 2023 r. odbyła się runda serii A, w ramach której spółka pozyskała 19 mln USD przy wycenie około 100 mln USD. Finansowanie to miało charakter klasycznego venture capital i pozwoliło na skalowanie produktu oraz zespołu.
W styczniu 2024 r. przeprowadzono rundę serii B o wartości 80 mln USD, co podniosło wycenę do około 1,1 mld USD i nadało firmie status jednorożca. Był to etap finansowania wzrostowego, związany z dynamiczną ekspansją.
Rok później, w styczniu 2025 r., spółka pozyskała kolejne 180 mln USD w rundzie serii C, osiągając wycenę około 3,3 mld USD. Najnowsza runda, serii D, ogłoszona w lutym 2026 r., przyniosła 500 mln USD przy wycenie około 11 mld USD. Sekwencja tych rund pokazuje niesamowite wręcz tempo wzrostu wartości całej spółki. Skalę rozwoju pokazuje też struktura zatrudnienia. Na początku zespół liczył kilka osób, obecnie jest to ponad 300.
Konkurencja i pozycja ElevenLabs na rynku
Rynek, na którym działa ElevenLabs, zmienia się jednak bardzo szybko, a ElevenLabs nie działa w próżni. Nad technologią generowania mowy pracują również największe firmy technologiczne świata. Google rozwija system WaveNet i własne modele głosowe, Microsoft oferuje platformę Azure Speech, a Amazon rozwija usługę Polly. W ostatnich latach także OpenAI zaczęło rozwijać modele generowania głosu zbliżone do ludzkiej mowy.
Oprócz gigantów technologicznych istnieje również grupa wyspecjalizowanych startupów, takich jak PlayHT, Resemble AI czy WellSaid Labs, które koncentrują się na podobnych rozwiązaniach.
Spółka przedstawia swoją pozycję na mapie konkurencyjnej o dwóch osiach. Oś pionowa oznacza jakość — im wyżej, tym bliżej poziomu dubbingu porównywalnego z pracą profesjonalnych aktorów głosowych. Oś pozioma odnosi się do dostępności i szybkości — im dalej w prawo, tym łatwiejsze i szybsze tworzenie wersji językowych przy minimalnym udziale człowieka.
W lewym górnym rogu znajdują się tradycyjne studia postprodukcyjne współpracujące z aktorami głosowymi. Oferują najwyższą jakość, ale kosztem czasu i pieniędzy.
W prawym dolnym rogu umieszczono klasyczne systemy automatycznej syntezy mowy. Są szybkie, tanie i łatwo dostępne, lecz brakuje im naturalności i brzmią sztucznie.
W środkowej części wykresu znajdują się rozwiązania częściowo zautomatyzowane, łączące technologię z istotnym udziałem człowieka. To model pośredni, lepsza jakość niż w czystej automatyzacji, ale nadal ograniczona skalowalność i wyższe koszty.
ElevenLabs pozycjonuje się w prawym górnym rogu, czyli tam, gdzie wysoka jakość spotyka się z szybkością i ograniczonym udziałem pracy ręcznej.
Ta teza jest uzasadniana wynikami ankiet, w których respondenci oceniali, która technologia generuje najbardziej wyraźny, naturalny i zbliżony do ludzkiego głos. W tym zestawieniu rozwiązania ElevenLabs uzyskały najwyższe noty, choć do maksymalnej oceny w skali 100 punktów pozostawał wyraźny dystans. Oprócz tego ElevenLabs wygrywa z konkurencją także liczbą dostępnych głosów.
Co dalej z ElevenLabs
Naturalnym krokiem w rozwoju firmy będzie też w końcu debiut na giełdzie. Przy okazji ostatniej rundy finansowania współzałożyciel i CEO, Mati Staniszewski, wskazał, że spółka buduje swoją strukturę i skalę działalności z myślą o debiucie giełdowym. Horyzont tego wydarzenia to 2–3 lata. Firma oczywiście nie pojawi się wprost na GPW, bo to dla niej za mały rynek, ale już Mati Staniszewski otwarcie mówi, że dopuszcza dual listing, gdzie notowania będą również miały miejsce w Warszawie.
ElevenLabs to fenomen, jakiego Polacy nie założyli od dawna. Nie tylko pod względem wyceny czy medialnego rozgłosu, ale przede wszystkim tempa wzrostu i globalnego wpływu.
Jednocześnie warto pamiętać, że spółka mimo wszystko funkcjonuje operacyjnie i kapitałowo głównie w środowisku anglosaskim. To tam znajdują się największe rynki, inwestorzy oraz infrastruktura regulacyjna sprzyjająca skalowaniu technologii. Jeśli Polska chce realnie korzystać z takich sukcesów, musi stworzyć warunki do budowania i rozwijania firm technologicznych na miejscu, a nie jedynie obserwować ich ekspansję z dystansu.
ElevenLabs pokazuje, jak szybko może dziś powstać globalna firma technologiczna. W ciągu kilku lat startup przeszedł drogę od pomysłu do spółki wycenianej na kilkanaście miliardów dolarów i obsługującej klientów na całym świecie, ale w tej historii chodzi o coś więcej niż tylko jedną firmę.
Bo jeśli modele językowe zmieniły sposób, w jaki piszemy i komunikujemy się w Internecie, to technologie generowania głosu mogą w najbliższych latach równie mocno zmienić sposób, w jaki mówimy i słuchamy treści.
Wtedy głos przestanie być dodatkiem do technologii. Stanie się jej podstawowym interfejsem, a to oznacza, że firmy budujące dziś infrastrukturę głosu mogą znaleźć się dokładnie tam, gdzie kilkanaście lat temu były firmy budujące infrastrukturę Internetu. I właśnie o to toczy się dziś gra.
Do zarobienia,
Piotr Cymcyk









