Fun-ASR-Nano 2512
Alibaba Cloud · China · 2025
Dwa modele transkrypcji po 800 mln parametrów wydane tego samego dnia: jeden słyszy siedem chińskich dialektów i dwadzieścia sześć akcentów, drugi trzydzieści jeden języków. Żaden nie słyszy jednego i drugiego.
Fun-ASR-Nano to otwarta część grudniowego zestawu do transkrypcji, który Alibaba wydała z laboratorium Tongyi. Są to dwa modele po 800 milionów parametrów, opublikowane razem na licencji Apache 2.0, a podział między nimi znaczy więcej, niż sugeruje wspólna nazwa. Zwykły Nano jest tym głębokim: obsługuje tylko chiński, angielski i japoński, ale za to siedem głównych dialektów chińskich — wu, kantoński, min, hakka, gan, xiang i jin — oraz dwadzieścia sześć akcentów regionalnych, ucząc się na, jak podaje producent, dziesiątkach milionów godzin prawdziwej mowy. Wariant MLT jest tym szerokim: trzydzieści jeden języków, w tym polski, ale wytrenowany na setkach tysięcy godzin, czyli mniej więcej sto razy mniejszym materiale w przeliczeniu na język. Model jest nastawiony na warunki, w których zwykłe programy do transkrypcji zawodzą. W testach branżowych producenta odnotowuje 5,79 procent błędnych słów przy nagraniu z daleka wobec 22,21 u Whisper-large-v3, 28,18 na mowie dialektalnej wobec 66,14 i 30,85 na tekstach piosenek wobec 54,82 — a to kategoria, której większość programów wprost odmawia. Na standardowych zbiorach publicznych różnica zanika albo odwraca się na niekorzyść: 1,76 na LibriSpeech clean wobec 1,86 u Whispera, ale 4,33 na LibriSpeech other wobec 3,43. Model pracuje strumieniowo z niskim opóźnieniem, a od połowy 2026 roku uruchamia się też jako samodzielny plik GGUF na procesorze, bez Pythona i bez karty graficznej. Dwie uwagi dla porządku. W opublikowanych tabelach porównawczych mały otwarty model stoi obok Fun-ASR o 7,7 miliarda parametrów, który wygrywa niemal każdy wiersz — ten większy jest w tej samej tabeli oznaczony jako niedostępny na otwartej licencji i działa wyłącznie jako usługa hostowana. Liczby, które czytelnik najchętniej zacytuje, nie dotyczą więc modelu, który może pobrać. Druga uwaga: etykiety modelu na Hugging Face reklamują znaczniki czasu i rozdzielanie mówców, podczas gdy lista zadań w tej samej karcie odnotowuje jedno i drugie jako jeszcze niezrobione.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!