MDL-4133EST.2026 · IDX.145
AudioW produkcji

Cohere Transcribe

Cohere · Canada · 2026

Model Cohere zamieniający mowę na tekst: dwa miliardy parametrów, 14 języków z polskim włącznie — dokładny i szybki, ale bez znaczników czasu, rozdzielania mówców i rozpoznawania języka.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

Cohere Transcribe, wydany 24 marca 2026 r. pod nazwą cohere-transcribe-03-2026, to dedykowany model rozpoznawania mowy: na wejściu dźwięk, na wyjściu tekst, dwa miliardy parametrów i nic więcej. Obsługuje 14 języków — angielski, niemiecki, francuski, włoski, hiszpański, portugalski, grecki, niderlandzki, polski, wietnamski, chiński, arabski, japoński i koreański — a więc polski jest w zestawie wspieranym, a nie w długim ogonie. Architektura to Conformer, czyli wariant Transformera przystosowany do mowy: falę dźwiękową zamienia się w spektrogram melowy, przetwarza go koder Conformer skupiający większość parametrów, a celowo lekki dekoder Transformera zamienia wynik na tokeny tekstu. Cohere trenowało model od zera zwykłą entropią krzyżową, celując przede wszystkim w niski wskaźnik błędu słów. Firma podaje najlepszą w klasie dokładność na swoich 14 językach i współczynnik czasu rzeczywistego do trzech razy lepszy niż w innych dedykowanych modelach ASR podobnej wielkości. To, czego model nie robi, opisane jest równie wprost — i przy wyborze narzędzia waży więcej. Nie ma automatycznego rozpoznawania języka: język trzeba wskazać z góry, a model działa najlepiej, gdy nagranie z niego nie wychodzi. Nie ma znaczników czasu ani rozdzielania mówców, więc napisy i zapisy spotkań z wieloma osobami są poza jego zasięgiem bez drugiego narzędzia. Pliki wejściowe mają limit 25 MB. Jeden szczegół wart jest nazwania dokładnie. Cohere opisuje to jako otwarte wydanie badawcze na licencji Apache 2.0 — i licencja rzeczywiście jest Apache 2.0 — ale repozytorium wag na Hugging Face jest zamknięte: pobranie wymaga zatwierdzonego wniosku o dostęp i zalogowanego konta, więc samej karty modelu nie da się przeczytać publicznie. To odwrotność typowego układu, w którym plik jest łatwy do wzięcia, a ograniczenia siedzą w licencji. W czerwcu 2026 r. doszło osobne wydanie nakierowane na arabski, cohere-transcribe-arabic-07-2026.

#speech recognition#open weights#Apache 2.0#Polish#Conformer
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję