MDL-6647EST.2026 · IDX.103
AudioW produkcji

Gemini 3.5 Transcribe

Google DeepMind · USA / UK · 2026

Model Google'a zamieniający mowę na tekst, sprzedawany jako dwa punkty dostępu o różnych możliwościach: wersja plikowa spisuje godzinę nagrania i rozpoznaje mówców, wersja na żywo nie robi ani jednego, ani drugiego.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Gemini 3.5 Transcribe to pierwszy model Google'a do zamiany mowy na tekst sprzedawany osobno, a nie jako poboczna zdolność ogólnego modelu Gemini. Trafił do powszechnej dostępności 26 sierpnia 2026 r. w dwóch wersjach, które dzielą nazwę i cennik, ale nie zestaw możliwości. Wersja plikowa, gemini-3.5-transcribe, przyjmuje nagrania do godziny, rozpoznaje język w obrębie pojedynczej wypowiedzi spośród ponad 85 języków, w tym polskiego, nadąża za mówcą zmieniającym język w środku zdania, rozdziela do ośmiu głosów i znakuje czasem poszczególne słowa. Dwie z tych funkcji mają cenę, którą podaje sam Google: po włączeniu rozdzielania mówców albo znaczników czasu limit nagrania spada z godziny do trzydziestu minut, a znaczniki na poziomie słów, jak pisze producent, pogarszają dokładność transkrypcji. Przypisywanie wypowiedzi przy trzech i więcej mówcach jest opisane jako eksperymentalne. Wersja na żywo, gemini-3.5-transcribe-live, nadaje przez WebSockety, zwracając wyniki wstępne przed ostatecznymi i obsługując kilka strategii wykrywania mowy. Nie potrafi rozpoznać mówców ani postawić znaczników czasu przy słowach, a sesja trwa dziesięć minut. Podpowiadanie własnego słownictwa, do tysiąca haseł, działa w obu wersjach, choć Google zaznacza, że najlepsze wyniki daje najwyżej sto haseł. Cennik przeczy intuicji. Droższy jest właśnie ten uboższy punkt dostępu, na żywo: około 0,009 dolara za minutę nagrania według uśrednionego szacunku producenta, wobec około 0,005 dolara za wersję plikową, która umie więcej. W stawkach cennikowych wersja plikowa kosztuje 2,00 dolara za milion tokenów wejścia dźwiękowego i 12,00 dolarów za milion tokenów tekstu na wyjściu, wersja na żywo odpowiednio 3,50 i 21,00 dolara. Obie mają darmowy próg, na którym — jak zapisano w cenniku — zapytania służą do ulepszania produktów Google; na progu płatnym już nie. Żadna z wersji nie obsługuje pamięci podręcznej, wykonywania kodu, przeszukiwania plików, wywoływania funkcji ani trybu rozumowania znanego z ogólnych modeli Gemini. To narzędzie do spisywania nagrań, nie do rozmowy.

#speech-to-text#diarization#streaming#85+ languages#low latency
Strona oficjalna

Newsy

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję