Przejdź do treści
Jak zrobić transkrypcję w ElevenLabs Scribe v2

Jak zrobić transkrypcję w ElevenLabs Scribe v2

Ta instrukcja jest napisana dla osób, które chcą zamieniać nagrania na tekst bez programowania. Wystarczy przeglądarka i konto w serwisie ElevenLabs. Tym narzędziem powstają transkrypcje publikowane w tym serwisie.

W skrócie

  • Czego dotyczy: zamiany nagrania audio albo wideo na tekst w narzędziu Scribe v2 firmy ElevenLabs
  • Co dostajesz: pełny tekst, podział na mówców, znaczniki czasu przy każdym słowie i pliki gotowe do dalszej pracy
  • Najważniejsze: jakość nagrania wpływa na wynik bardziej niż jakiekolwiek ustawienie
  • Koszt: w panelu w przeglądarce ok. 3,60 USD za godzinę nagrania, przez API ok. 0,22 USD
  • Czego tekst nie obiecuje: automatyczna transkrypcja jest materiałem roboczym. Każdy cytat, nazwisko i liczbę trzeba sprawdzić w nagraniu

Co potrafi Scribe v2

Według dokumentacji ElevenLabs Scribe v2 rozpoznaje ponad 90 języków, w tym polski. W jednym nagraniu rozróżnia do 32 mówców i przypisuje znacznik czasu każdemu słowu. Przyjmuje pliki audio i wideo do 3 GB i 10 godzin nagrania.

Co otrzymujesz:

  • pełny tekst nagrania — język można wskazać albo zostawić do automatycznego rozpoznania, także gdy rozmówcy przechodzą z polskiego na angielski
  • podział na mówców — wypowiedzi oznaczone etykietami „Mówca 1”, „Mówca 2” i kolejnymi
  • znaczniki czasu przy każdym słowie — pozwalają szybko odnaleźć cytat w nagraniu
  • opis dźwięków otoczenia — na przykład (śmiech) albo (oklaski)
  • wykrywanie danych wrażliwych — nazwisk, numerów telefonów czy adresów, z opcją ich zamaskowania

Narzędzie ma dwie wersje. Scribe v2 służy do gotowych nagrań. Scribe v2 Realtime zapisuje mowę na żywo, na przykład podczas konferencji, z opóźnieniem około 150 milisekund.

Jak zacząć

Najprościej zacząć od panelu w przeglądarce: elevenlabs.io/app/speech-to-text. Wgrywasz plik, wybierasz ustawienia i pobierasz gotowy tekst.

sposóbdla kogokiedy wybrać
panel w przeglądarcekażdy użytkownikpojedyncze wywiady, napisy do jednego filmu, pierwsze próby
API, czyli połączenie przygotowane przez programistęredakcje i zespołydziesiątki nagrań tygodniowo, archiwum, napisy na żywo

Praca przez API jest ok. 16 razy tańsza niż w panelu. Szczegóły w części o kosztach. Jeśli nagrywasz regularnie, warto poprosić osobę techniczną o prostą automatyzację. Pełny opis parametrów zawiera dokumentacja API ElevenLabs.

Praca w panelu wygląda tak:

  1. Załóż konto w ElevenLabs i zaloguj się.
  2. Otwórz zakładkę Speech to Text i wgraj plik. Obsługiwane są wszystkie popularne formaty audio i wideo, m.in. MP3, WAV, M4A, MP4 i MOV.
  3. Ustaw język, liczbę mówców i pozostałe opcje. Opisuje je część o ustawieniach.
  4. Uruchom transkrypcję, przejrzyj tekst i pobierz plik w wybranym formacie.

Przygotowanie nagrania

Jakość dźwięku decyduje o wyniku bardziej niż ustawienia programu. Wyraźne nagranie oznacza mniej poprawek i pewniejsze cytaty.

Podczas nagrywania

  • Mikrofon blisko ust. Mikrofon krawatowy albo dyktafon 20–30 cm od rozmówcy daje wyraźnie lepszy wynik niż telefon leżący na stole. Bliski mikrofon podnosi jednak poziom dźwięku, więc pilnuj parametrów nagrania. Ustaw czułość tak, żeby wskaźnik poziomu nie dochodził do czerwonego pola: szczyty najlepiej w okolicy −12 dBFS, z zapasem przed 0 dBFS, gdzie zaczyna się przester. Przesterowanego nagrania nie da się naprawić, a zniekształcone słowa silnik rozpoznaje z błędami. Jeśli rejestrator na to pozwala, nagrywaj w formacie WAV, 48 kHz i 24 bity.
  • Osobny mikrofon dla każdego rozmówcy. Gdy każdy głos trafia na osobną ścieżkę nagrania, Scribe przypisuje wypowiedzi według ścieżek, a nie według barwy głosu. Obsługuje do pięciu takich ścieżek.
  • Cisza w tle. Kawiarnia, klimatyzacja, muzyka i otwarte okno pogarszają wynik. Wycisz powiadomienia w telefonach.
  • Mówcie po kolei. Wchodzenie sobie w słowo to najczęstsza przyczyna błędów w podziale na mówców.
  • Przedstawcie się na początku. Krótkie „Nazywam się…” ułatwia późniejszą zamianę etykiet „Mówca 1” na nazwiska.

Przed wgraniem pliku

  • Wgraj plik oryginalny. Nie kompresuj go dodatkowo. Wystarczy dobrej jakości WAV albo MP3.
  • Oczyść słabe nagranie. Przy szumie albo pogłosie przepuść plik przez narzędzie do usuwania zakłóceń i porównaj oba wyniki.
  • Nie dziel nagrania na części. Długie pliki Scribe przetwarza w całości.

Ustawienia

Najwięcej zmieniają trzy ustawienia: język, liczba mówców i słowa kluczowe. Pozostałe włączasz zależnie od potrzeby. Nazwy opcji w panelu mogą się nieco różnić od podanych niżej.

ustawienieco robikiedy użyć
językwskazuje język nagraniawybierz „polski”, gdy całe nagranie jest po polsku; przy rozmowie w kilku językach zostaw rozpoznawanie automatyczne
rozpoznawanie mówcówdzieli tekst na wypowiedzi osóbzawsze przy wywiadach, panelach i podcastach
liczba mówcówpodaje, ile osób mówiustaw, jeśli wiesz — zmniejsza ryzyko pomyłek
słowa kluczowepodpowiada nazwiska i trudne pojęcianazwiska, instytucje, miejscowości, skróty, słownictwo branżowe
znaczniki dźwiękówoznacza (śmiech), (oklaski) itp.napisy do filmów i reportaże; wyłącz, gdy potrzebujesz samego tekstu
wersja oczyszczonausuwa „yyy”, powtórzenia i urwane zdanianapisy i streszczenia; nie do cytatów, bo zmienia dosłowne brzmienie wypowiedzi
osobne ścieżkitraktuje każdą ścieżkę jako innego mówcęgdy każdy rozmówca miał własny mikrofon na osobnej ścieżce

Jak przygotować słowa kluczowe

  • Wpisuj hasła w formie podstawowej: „Kowalski”, „Najwyższa Izba Kontroli”, „NIK”. Formy odmienione model rozpozna z kontekstu.
  • Jedno hasło może mieć najwyżej 5 słów i mniej niż 50 znaków.
  • Od 5 do 30 haseł na nagranie w praktyce wystarcza. Nie wpisuj słów powszechnych.
  • Słowa kluczowe podnoszą koszt o ok. 20%, ale oszczędzają czas przy poprawianiu nazwisk i nazw własnych.

Gdy podział na mówców się myli

  • Jedna osoba rozbita na dwie etykiety: podaj dokładną liczbę mówców i uruchom transkrypcję ponownie.
  • Dwie osoby połączone w jedną: zwykle z powodu podobnej barwy głosu albo wspólnego mikrofonu. Przy kolejnych nagraniach pomogą osobne mikrofony.

Po transkrypcji

Transkrypcja jest materiałem roboczym. Przed publikacją każdy cytat, nazwisko i liczbę sprawdź w nagraniu.

Jak poprawiać

  1. Najpierw nazwiska i liczby. Tu pomyłki zdarzają się najczęściej. Odszukaj je w tekście i odsłuchaj.
  2. Cytaty odsłuchuj w całości. Kliknięcie znacznika czasu przenosi do właściwego miejsca w nagraniu.
  3. Etykiety „Mówca 1” zamieniaj na nazwiska dopiero wtedy, gdy masz pewność, kto mówi.
  4. Sprawdź trudne fragmenty: szum, śmiech, nakładające się głosy, nagrania z telefonu.
  5. Zachowaj pliki źródłowe. Trzymaj nagranie i nieedytowaną transkrypcję w jednym miejscu.

Który format pobrać

formatdo czego
SRTnapisy do wideo: YouTube, Premiere, DaVinci Resolve, media społecznościowe; dla czytelności ok. 42 znaki w wierszu i do 6 sekund na napis
DOCXredagowanie wywiadów i autoryzacja; włącz nazwy mówców i znaczniki czasu
PDFarchiwum i wersje do wglądu
TXTwklejanie tekstu do innych narzędzi, na przykład do streszczeń
HTMLpublikacja transkrypcji na stronie

Scribe nie tworzy napisów w formacie WebVTT (.vtt). Większość programów do montażu i darmowych konwerterów zamienia SRT na VTT w kilka sekund.

Poufność

Wgrane nagranie trafia na serwery ElevenLabs. Przy materiałach poufnych decyzję o użyciu usługi podejmij przed transkrypcją, nie po niej.

  • Źródła chronione tajemnicą dziennikarską. Nie wgrywaj takich nagrań bez zgody redakcji. Przez API można wyłączyć zapisywanie nagrań po stronie ElevenLabs — dokumentacja nazywa to trybem zero retention. Alternatywą jest transkrypcja na własnym komputerze.
  • Usuwaj transkrypcje z konta, gdy nie są już potrzebne.
  • Maskowanie danych zastępuje w tekście nazwiska, numery telefonów czy adresy znacznikami. Pomaga w anonimizacji, ale jej nie gwarantuje: pseudonimy, opisy miejsc i szczegóły biograficzne nadal mogą zdradzić tożsamość. Tekst zawsze sprawdź przed publikacją.

Koszty

Ceny według cennika API ElevenLabs we wrześniu 2026 roku, w przeliczeniu na godzinę nagrania. Stawki mogą się zmienić, aktualne są w cenniku.

usługakoszt
transkrypcja nagrania (Scribe v2)0,22 USD za godzinę
transkrypcja na żywo (Scribe v2 Realtime)0,39 USD za godzinę
słowa kluczowe+0,05 USD za godzinę
wykrywanie danych wrażliwych+0,07 USD za godzinę
osobne ścieżkikażda ścieżka rozliczana osobno

Panel czy API

Panel w przeglądarce rozlicza się kredytami: według cennika ElevenLabs minuta transkrypcji kosztuje 330 kredytów. Plan Creator (22 USD miesięcznie) zawiera 121 tysięcy kredytów, czyli ok. 6 godzin nagrań. Ten sam plan przez API obejmuje 100 godzin.

plan Creator, 22 USD miesięczniepanel w przeglądarceAPI
godziny transkrypcji w planieok. 6100
koszt godziny nagraniaok. 3,60 USD0,22 USD

Liczby w kolumnie „panel” to przeliczenie z kredytów, nie wartości podane w cenniku wprost. Panel wystarcza przy okazjonalnych nagraniach i do nauki. Przy kilku wywiadach tygodniowo różnica kosztów przemawia za API.

Darmową drogą jest model Parakeet uruchamiany w Google Colab. Wymaga pracy w notatniku, ale nie kosztuje nic — opisuje go poradnik Jak zrobić transkrypcję z pliku audio?

Ściągawka

sytuacjajęzykmówcysłowa kluczowewersja tekstuformat
wywiad do tekstu prasowegopolskiwłączone, podaj liczbęnazwiska, instytucjedosłownaDOCX ze znacznikami czasu i mówcami
wywiad nagrany na dwie ścieżkipolskiosobne ścieżkinazwiskadosłownaDOCX
napisy do filmu albo rolkipolskiwyłączone, przy dialogach włączonenazwy własneoczyszczonaSRT
konferencja, panel, debataautomatycznywłączonenazwiska prelegentówdosłownaDOCX albo PDF
podcastpolskiwłączone, podaj liczbęnazwy własne, gościeoczyszczona do opisu, dosłowna do cytatówTXT i SRT
rozmowa po polsku i angielskuautomatycznywłączonenazwiskadosłownaDOCX
transmisja na żywopolski—krótka lista, do 50 hasełzależnie od potrzebyScribe v2 Realtime, wymaga API

Pięć zasad

  1. Jakość nagrania jest ważniejsza niż ustawienia programu.
  2. Ustawiaj język i liczbę mówców zawsze, gdy je znasz.
  3. Dopisuj słowa kluczowe: nazwiska i specjalistyczne pojęcia.
  4. Do cytatów używaj wersji dosłownej i zawsze sprawdzaj tekst w nagraniu.
  5. Przed transkrypcją materiałów poufnych upewnij się, że spełniasz wymogi bezpieczeństwa.

Źródła