Wszystkie artykuły
AI mowy 2 min czytania

Szybka, Zrównoważona, Najlepsza: który poziom jakości wybrać

Trzy poziomy, trzy różne modele. Co naprawdę się między nimi zmienia i kiedy najwolniejszy wart jest czekania.

Czym są trzy poziomy

Każde wgranie idzie jednym z trzech poziomów, a każdy to inny model:

  • Szybka — Whisper large-v3-turbo. Destylowana wersja dużego modelu: mniej warstw dekodera, większość dokładności, ułamek czasu.
  • Zrównoważona — Whisper large-v3. Pełny model i ustawienie domyślne.
  • Najlepsza — GPT-4o Transcribe. Nowsza architektura, która radzi sobie z akcentami, mówieniem jeden przez drugiego i szumem lepiej niż Whisper.

Wszystkie trzy zwracają czasy na poziomie słów, więc odtwarzacz wszędzie nadąża za tekstem, a eksport napisów działa tak samo na każdym poziomie.

Co się naprawdę zmienia

Przy czystym dźwięku niewiele. Jedna osoba z przyzwoitym mikrofonem w cichym pokoju wychodzi niemal tak samo na wszystkich trzech poziomach — i właśnie dlatego czekanie na Najlepszą przy takim pliku to strata.

Różnica otwiera się tam, gdzie dźwięk robi się trudny: nakładające się głosy, mocny akcent, hałas w tle, słownictwo techniczne, nazwy własne. Szybka zaczyna wtedy gubić krótkie wtrącenia i zgadywać nazwiska. Najlepsza je zachowuje.

Wybór bez długiego namysłu

Zostaw Zrównoważoną. Jest domyślna, bo najczęściej ma rację.

Sięgnij po Szybką, gdy chcesz prędko poznać sedno długiego nagrania albo gdy dźwięk jest czysty, a stawka niska: notatka głosowa, nagranie solo, coś, co i tak przejrzysz.

Sięgnij po Najlepszą, gdy błąd kosztuje: wywiady, które będziesz cytować, nagrania prawne lub medyczne, ciężkie akcenty, kilka osób mówiących naraz, albo cokolwiek publikujesz jako napisy.

Plik zawsze można przetworzyć ponownie na wyższym poziomie. Oryginalny dźwięk pozostaje dostępny tak długo, jak przechowuje go Twój plan.

Blog

Zamień własne nagranie w tekst

Wgraj plik i przeczytaj transkrypcję w kilka minut — bez zakładania konta.

Transkrypcja pliku