MDL-2190EST.2025 · IDX.119
AudioW produkcji

CSM-1B

Sesame · USA · 2025

Otwarty silnik spod głośnego dema głosowego — model bazowy, a nie gotowy rozmówca.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

CSM-1B to konwersacyjny model mowy o otwartych wagach, opublikowany przez firmę Sesame w marcu 2025 roku — spółkę współzałożoną przez Brendana Iribe'a, współtwórcę Oculusa. Stoi pod Mayą i Milesem, hostowanymi rozmówcami głosowymi, których demo zwróciło uwagę tym, że brzmiało niepokojąco podobnie do człowieka po drugiej stronie telefonu. Architektura jest dla systemu mowy nietypowa: rdzeń oparty na Llamie połączony z mniejszym dekoderem dźwięku wytwarzającym kody Mimi, dzięki czemu tekst i kontekst dźwiękowy trafiają do modelu razem, a nie przez osobny stopień syntezy mowy — i to właśnie ten wspólny kontekst pozwala utrzymać rytm rozmowy, wahanie i wejście w słowo. Redakcyjnie najważniejsza jest jednak różnica między demem a plikiem do pobrania. Udostępnione wagi to model bazowy bez dostrojenia do konkretnego głosu, przede wszystkim anglojęzyczny, wydany wprost do celów badawczych i edukacyjnych i w ogóle niezdolny do generowania tekstu; osobowość, na którą ludzie zareagowali, mieszka w hostowanym produkcie Sesame, a nie w tym punkcie kontrolnym. Licencja to Apache 2.0, a karta modelu wprost zakazuje podszywania się bez zgody i tworzenia treści wprowadzających w błąd.

#text to speech#open weights#conversational#apache 2.0#research
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję