Gemini 3.5 Transcribe
Google DeepMind · USA / UK · 2026
Model Google'a zamieniający mowę na tekst, sprzedawany jako dwa punkty dostępu o różnych możliwościach: wersja plikowa spisuje godzinę nagrania i rozpoznaje mówców, wersja na żywo nie robi ani jednego, ani drugiego.
Gemini 3.5 Transcribe to pierwszy model Google'a do zamiany mowy na tekst sprzedawany osobno, a nie jako poboczna zdolność ogólnego modelu Gemini. Trafił do powszechnej dostępności 26 sierpnia 2026 r. w dwóch wersjach, które dzielą nazwę i cennik, ale nie zestaw możliwości. Wersja plikowa, gemini-3.5-transcribe, przyjmuje nagrania do godziny, rozpoznaje język w obrębie pojedynczej wypowiedzi spośród ponad 85 języków, w tym polskiego, nadąża za mówcą zmieniającym język w środku zdania, rozdziela do ośmiu głosów i znakuje czasem poszczególne słowa. Dwie z tych funkcji mają cenę, którą podaje sam Google: po włączeniu rozdzielania mówców albo znaczników czasu limit nagrania spada z godziny do trzydziestu minut, a znaczniki na poziomie słów, jak pisze producent, pogarszają dokładność transkrypcji. Przypisywanie wypowiedzi przy trzech i więcej mówcach jest opisane jako eksperymentalne. Wersja na żywo, gemini-3.5-transcribe-live, nadaje przez WebSockety, zwracając wyniki wstępne przed ostatecznymi i obsługując kilka strategii wykrywania mowy. Nie potrafi rozpoznać mówców ani postawić znaczników czasu przy słowach, a sesja trwa dziesięć minut. Podpowiadanie własnego słownictwa, do tysiąca haseł, działa w obu wersjach, choć Google zaznacza, że najlepsze wyniki daje najwyżej sto haseł. Cennik przeczy intuicji. Droższy jest właśnie ten uboższy punkt dostępu, na żywo: około 0,009 dolara za minutę nagrania według uśrednionego szacunku producenta, wobec około 0,005 dolara za wersję plikową, która umie więcej. W stawkach cennikowych wersja plikowa kosztuje 2,00 dolara za milion tokenów wejścia dźwiękowego i 12,00 dolarów za milion tokenów tekstu na wyjściu, wersja na żywo odpowiednio 3,50 i 21,00 dolara. Obie mają darmowy próg, na którym — jak zapisano w cenniku — zapytania służą do ulepszania produktów Google; na progu płatnym już nie. Żadna z wersji nie obsługuje pamięci podręcznej, wykonywania kodu, przeszukiwania plików, wywoływania funkcji ani trybu rozumowania znanego z ogólnych modeli Gemini. To narzędzie do spisywania nagrań, nie do rozmowy.
▸Newsy
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!