Jak zrobić transkrypcję w ElevenLabs Scribe v2
Ta instrukcja jest napisana dla osób, które chcą zamieniać nagrania na tekst bez programowania. Wystarczy przeglądarka i konto w serwisie ElevenLabs. Tym narzędziem powstają transkrypcje publikowane w tym serwisie.
W skrócie
- Czego dotyczy: zamiany nagrania audio albo wideo na tekst w narzędziu Scribe v2 firmy ElevenLabs
- Co dostajesz: pełny tekst, podział na mówców, znaczniki czasu przy każdym słowie i pliki gotowe do dalszej pracy
- Najważniejsze: jakość nagrania wpływa na wynik bardziej niż jakiekolwiek ustawienie
- Koszt: w panelu w przeglądarce ok. 3,60 USD za godzinę nagrania, przez API ok. 0,22 USD
- Czego tekst nie obiecuje: automatyczna transkrypcja jest materiałem roboczym. Każdy cytat, nazwisko i liczbę trzeba sprawdzić w nagraniu
Co potrafi Scribe v2
Według dokumentacji ElevenLabs Scribe v2 rozpoznaje ponad 90 języków, w tym polski. W jednym nagraniu rozróżnia do 32 mówców i przypisuje znacznik czasu każdemu słowu. Przyjmuje pliki audio i wideo do 3 GB i 10 godzin nagrania.
Co otrzymujesz:
- pełny tekst nagrania — język można wskazać albo zostawić do automatycznego rozpoznania, także gdy rozmówcy przechodzą z polskiego na angielski
- podział na mówców — wypowiedzi oznaczone etykietami „Mówca 1”, „Mówca 2” i kolejnymi
- znaczniki czasu przy każdym słowie — pozwalają szybko odnaleźć cytat w nagraniu
- opis dźwięków otoczenia — na przykład (śmiech) albo (oklaski)
- wykrywanie danych wrażliwych — nazwisk, numerów telefonów czy adresów, z opcją ich zamaskowania
Narzędzie ma dwie wersje. Scribe v2 służy do gotowych nagrań. Scribe v2 Realtime zapisuje mowę na żywo, na przykład podczas konferencji, z opóźnieniem około 150 milisekund.
Jak zacząć
Najprościej zacząć od panelu w przeglądarce: elevenlabs.io/app/speech-to-text. Wgrywasz plik, wybierasz ustawienia i pobierasz gotowy tekst.
| sposób | dla kogo | kiedy wybrać |
|---|---|---|
| panel w przeglądarce | każdy użytkownik | pojedyncze wywiady, napisy do jednego filmu, pierwsze próby |
| API, czyli połączenie przygotowane przez programistę | redakcje i zespoły | dziesiątki nagrań tygodniowo, archiwum, napisy na żywo |
Praca przez API jest ok. 16 razy tańsza niż w panelu. Szczegóły w części o kosztach. Jeśli nagrywasz regularnie, warto poprosić osobę techniczną o prostą automatyzację. Pełny opis parametrów zawiera dokumentacja API ElevenLabs.
Praca w panelu wygląda tak:
- Załóż konto w ElevenLabs i zaloguj się.
- Otwórz zakładkę Speech to Text i wgraj plik. Obsługiwane są wszystkie popularne formaty audio i wideo, m.in. MP3, WAV, M4A, MP4 i MOV.
- Ustaw język, liczbę mówców i pozostałe opcje. Opisuje je część o ustawieniach.
- Uruchom transkrypcję, przejrzyj tekst i pobierz plik w wybranym formacie.
Przygotowanie nagrania
Jakość dźwięku decyduje o wyniku bardziej niż ustawienia programu. Wyraźne nagranie oznacza mniej poprawek i pewniejsze cytaty.
Podczas nagrywania
- Mikrofon blisko ust. Mikrofon krawatowy albo dyktafon 20–30 cm od rozmówcy daje wyraźnie lepszy wynik niż telefon leżący na stole. Bliski mikrofon podnosi jednak poziom dźwięku, więc pilnuj parametrów nagrania. Ustaw czułość tak, żeby wskaźnik poziomu nie dochodził do czerwonego pola: szczyty najlepiej w okolicy −12 dBFS, z zapasem przed 0 dBFS, gdzie zaczyna się przester. Przesterowanego nagrania nie da się naprawić, a zniekształcone słowa silnik rozpoznaje z błędami. Jeśli rejestrator na to pozwala, nagrywaj w formacie WAV, 48 kHz i 24 bity.
- Osobny mikrofon dla każdego rozmówcy. Gdy każdy głos trafia na osobną ścieżkę nagrania, Scribe przypisuje wypowiedzi według ścieżek, a nie według barwy głosu. Obsługuje do pięciu takich ścieżek.
- Cisza w tle. Kawiarnia, klimatyzacja, muzyka i otwarte okno pogarszają wynik. Wycisz powiadomienia w telefonach.
- Mówcie po kolei. Wchodzenie sobie w słowo to najczęstsza przyczyna błędów w podziale na mówców.
- Przedstawcie się na początku. Krótkie „Nazywam się…” ułatwia późniejszą zamianę etykiet „Mówca 1” na nazwiska.
Przed wgraniem pliku
- Wgraj plik oryginalny. Nie kompresuj go dodatkowo. Wystarczy dobrej jakości WAV albo MP3.
- Oczyść słabe nagranie. Przy szumie albo pogłosie przepuść plik przez narzędzie do usuwania zakłóceń i porównaj oba wyniki.
- Nie dziel nagrania na części. Długie pliki Scribe przetwarza w całości.
Ustawienia
Najwięcej zmieniają trzy ustawienia: język, liczba mówców i słowa kluczowe. Pozostałe włączasz zależnie od potrzeby. Nazwy opcji w panelu mogą się nieco różnić od podanych niżej.
| ustawienie | co robi | kiedy użyć |
|---|---|---|
| język | wskazuje język nagrania | wybierz „polski”, gdy całe nagranie jest po polsku; przy rozmowie w kilku językach zostaw rozpoznawanie automatyczne |
| rozpoznawanie mówców | dzieli tekst na wypowiedzi osób | zawsze przy wywiadach, panelach i podcastach |
| liczba mówców | podaje, ile osób mówi | ustaw, jeśli wiesz — zmniejsza ryzyko pomyłek |
| słowa kluczowe | podpowiada nazwiska i trudne pojęcia | nazwiska, instytucje, miejscowości, skróty, słownictwo branżowe |
| znaczniki dźwięków | oznacza (śmiech), (oklaski) itp. | napisy do filmów i reportaże; wyłącz, gdy potrzebujesz samego tekstu |
| wersja oczyszczona | usuwa „yyy”, powtórzenia i urwane zdania | napisy i streszczenia; nie do cytatów, bo zmienia dosłowne brzmienie wypowiedzi |
| osobne ścieżki | traktuje każdą ścieżkę jako innego mówcę | gdy każdy rozmówca miał własny mikrofon na osobnej ścieżce |
Jak przygotować słowa kluczowe
- Wpisuj hasła w formie podstawowej: „Kowalski”, „Najwyższa Izba Kontroli”, „NIK”. Formy odmienione model rozpozna z kontekstu.
- Jedno hasło może mieć najwyżej 5 słów i mniej niż 50 znaków.
- Od 5 do 30 haseł na nagranie w praktyce wystarcza. Nie wpisuj słów powszechnych.
- Słowa kluczowe podnoszą koszt o ok. 20%, ale oszczędzają czas przy poprawianiu nazwisk i nazw własnych.
Gdy podział na mówców się myli
- Jedna osoba rozbita na dwie etykiety: podaj dokładną liczbę mówców i uruchom transkrypcję ponownie.
- Dwie osoby połączone w jedną: zwykle z powodu podobnej barwy głosu albo wspólnego mikrofonu. Przy kolejnych nagraniach pomogą osobne mikrofony.
Po transkrypcji
Transkrypcja jest materiałem roboczym. Przed publikacją każdy cytat, nazwisko i liczbę sprawdź w nagraniu.
Jak poprawiać
- Najpierw nazwiska i liczby. Tu pomyłki zdarzają się najczęściej. Odszukaj je w tekście i odsłuchaj.
- Cytaty odsłuchuj w całości. Kliknięcie znacznika czasu przenosi do właściwego miejsca w nagraniu.
- Etykiety „Mówca 1” zamieniaj na nazwiska dopiero wtedy, gdy masz pewność, kto mówi.
- Sprawdź trudne fragmenty: szum, śmiech, nakładające się głosy, nagrania z telefonu.
- Zachowaj pliki źródłowe. Trzymaj nagranie i nieedytowaną transkrypcję w jednym miejscu.
Który format pobrać
| format | do czego |
|---|---|
| SRT | napisy do wideo: YouTube, Premiere, DaVinci Resolve, media społecznościowe; dla czytelności ok. 42 znaki w wierszu i do 6 sekund na napis |
| DOCX | redagowanie wywiadów i autoryzacja; włącz nazwy mówców i znaczniki czasu |
| archiwum i wersje do wglądu | |
| TXT | wklejanie tekstu do innych narzędzi, na przykład do streszczeń |
| HTML | publikacja transkrypcji na stronie |
Scribe nie tworzy napisów w formacie WebVTT (.vtt). Większość programów do montażu i darmowych konwerterów zamienia SRT na VTT w kilka sekund.
Poufność
Wgrane nagranie trafia na serwery ElevenLabs. Przy materiałach poufnych decyzję o użyciu usługi podejmij przed transkrypcją, nie po niej.
- Źródła chronione tajemnicą dziennikarską. Nie wgrywaj takich nagrań bez zgody redakcji. Przez API można wyłączyć zapisywanie nagrań po stronie ElevenLabs — dokumentacja nazywa to trybem zero retention. Alternatywą jest transkrypcja na własnym komputerze.
- Usuwaj transkrypcje z konta, gdy nie są już potrzebne.
- Maskowanie danych zastępuje w tekście nazwiska, numery telefonów czy adresy znacznikami. Pomaga w anonimizacji, ale jej nie gwarantuje: pseudonimy, opisy miejsc i szczegóły biograficzne nadal mogą zdradzić tożsamość. Tekst zawsze sprawdź przed publikacją.
Koszty
Ceny według cennika API ElevenLabs we wrześniu 2026 roku, w przeliczeniu na godzinę nagrania. Stawki mogą się zmienić, aktualne są w cenniku.
| usługa | koszt |
|---|---|
| transkrypcja nagrania (Scribe v2) | 0,22 USD za godzinę |
| transkrypcja na żywo (Scribe v2 Realtime) | 0,39 USD za godzinę |
| słowa kluczowe | +0,05 USD za godzinę |
| wykrywanie danych wrażliwych | +0,07 USD za godzinę |
| osobne ścieżki | każda ścieżka rozliczana osobno |
Panel czy API
Panel w przeglądarce rozlicza się kredytami: według cennika ElevenLabs minuta transkrypcji kosztuje 330 kredytów. Plan Creator (22 USD miesięcznie) zawiera 121 tysięcy kredytów, czyli ok. 6 godzin nagrań. Ten sam plan przez API obejmuje 100 godzin.
| plan Creator, 22 USD miesięcznie | panel w przeglądarce | API |
|---|---|---|
| godziny transkrypcji w planie | ok. 6 | 100 |
| koszt godziny nagrania | ok. 3,60 USD | 0,22 USD |
Liczby w kolumnie „panel” to przeliczenie z kredytów, nie wartości podane w cenniku wprost. Panel wystarcza przy okazjonalnych nagraniach i do nauki. Przy kilku wywiadach tygodniowo różnica kosztów przemawia za API.
Darmową drogą jest model Parakeet uruchamiany w Google Colab. Wymaga pracy w notatniku, ale nie kosztuje nic — opisuje go poradnik Jak zrobić transkrypcję z pliku audio?
Ściągawka
| sytuacja | język | mówcy | słowa kluczowe | wersja tekstu | format |
|---|---|---|---|---|---|
| wywiad do tekstu prasowego | polski | włączone, podaj liczbę | nazwiska, instytucje | dosłowna | DOCX ze znacznikami czasu i mówcami |
| wywiad nagrany na dwie ścieżki | polski | osobne ścieżki | nazwiska | dosłowna | DOCX |
| napisy do filmu albo rolki | polski | wyłączone, przy dialogach włączone | nazwy własne | oczyszczona | SRT |
| konferencja, panel, debata | automatyczny | włączone | nazwiska prelegentów | dosłowna | DOCX albo PDF |
| podcast | polski | włączone, podaj liczbę | nazwy własne, goście | oczyszczona do opisu, dosłowna do cytatów | TXT i SRT |
| rozmowa po polsku i angielsku | automatyczny | włączone | nazwiska | dosłowna | DOCX |
| transmisja na żywo | polski | — | krótka lista, do 50 haseł | zależnie od potrzeby | Scribe v2 Realtime, wymaga API |
Pięć zasad
- Jakość nagrania jest ważniejsza niż ustawienia programu.
- Ustawiaj język i liczbę mówców zawsze, gdy je znasz.
- Dopisuj słowa kluczowe: nazwiska i specjalistyczne pojęcia.
- Do cytatów używaj wersji dosłownej i zawsze sprawdzaj tekst w nagraniu.
- Przed transkrypcją materiałów poufnych upewnij się, że spełniasz wymogi bezpieczeństwa.
Źródła
- Speech to Text — opis funkcji, dokumentacja ElevenLabs
- Speech to Text — dokumentacja API, ElevenLabs
- Cennik API i cennik planów, ElevenLabs