TTS-1
OpenAI · USA · 2023
Pierwszy model mowy syntetycznej OpenAI, pokazany na DevDay 2023 i nastawiony na szybkość. Cena 15 dolarów za milion znaków nie zmieniła się od dnia premiery.
TTS-1 pojawił się 6 listopada 2023 jako jedna połowa pierwszej pary modeli mowy OpenAI, obok stawiającego na jakość TTS-1 HD. Zamienia tekst na mowę przez punkt końcowy speech w Audio API i jest nastawiony na pracę w czasie rzeczywistym, gdzie opóźnienie liczy się bardziej niż ostatnie procenty wierności dźwięku. W komplecie jest sześć gotowych głosów, a OpenAI zaznacza wprost, że są to głosy sztuczne, nadzorowane przez firmę, a nie klony prawdziwych osób. Model jest celowo wąski: tekst na wejściu, dźwięk na wyjściu, bez rozumowania, bez okna kontekstu, bez narzędzi. Ta wąskość jest też powodem, dla którego zestarzał się na tyle dobrze, że wciąż stoi w cenniku. OpenAI sprzedaje dziś nowsze modele mowy zbudowane na linii multimodalnej — gpt-4o-mini-tts i rodzinę realtime — którym można polecić nie tylko co powiedzieć, ale i jak. TTS-1 tego nie potrafi. Oferuje w zamian stały, przewidywalny koszt za znak i dobrze rozpoznane opóźnienie. Jego cenę warto podać dokładnie, bo jest nietypowa. W dniu premiery OpenAI podawał 0,015 dolara za 1000 znaków wejścia; dzisiejszy cennik podaje 15 dolarów za milion znaków. To ta sama liczba. Minęły prawie trzy lata premier, obniżek w linii tekstowej i dwie generacje modeli dźwiękowych, a ten model ani nie staniał, ani nie zdrożał.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!