MDL-4706EST.2025 · IDX.592
AudioW produkcji

GPT-4o mini TTS

OpenAI · USA · 2025

Pierwszy model mowy OpenAI, któremu można powiedzieć, jak ma coś powiedzieć, a nie tylko co. Zbudowany na GPT-4o mini, rozliczany za tokeny, nie za znaki.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

GPT-4o mini TTS trafił do oferty 20 marca 2025 w tym samym wydaniu co para gpt-4o-transcribe i wyznacza moment, w którym synteza mowy OpenAI przestała być samodzielnym konwerterem, a stała się modelem językowym z wyjściem dźwiękowym. Praktycznym skutkiem jest sterowalność: programista może poinstruować model co do sposobu wypowiedzi — tonu, tempa, charakteru — a nie tylko co do słów. Sam producent zakreśla użycia od obsługi klienta po opowiadanie historii. Głosy pozostają sztucznymi presetami, nadzorowanymi przez OpenAI pod kątem zgodności z zestawem syntetycznym; ten model nie klonuje prawdziwych głosów. Wejście jest ograniczone do 2000 tokenów na żądanie, co wyklucza podanie całego rozdziału w jednym wywołaniu i czyni z niego narzędzie do pojedynczych wypowiedzi, a nie do renderowania hurtem. Zmienił się też sposób rozliczania. Starsza para TTS-1 liczy za znaki; ten model liczy 0,60 dolara za milion tokenów tekstu wejściowego i 12 dolarów za milion tokenów dźwięku wyjściowego. Ponieważ jeden token tekstu daje znacznie więcej niż jeden token dźwięku, obu cenników nie da się zestawić wprost — i właśnie dlatego starsze, prostsze modele wciąż mają swoich zwolenników. Bieżąca migawka domyślna to gpt-4o-mini-tts-2025-12-15.

#text-to-speech#audio#steerable#gpt-4o
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję