CSM-1B
Sesame · USA · 2025
Otwarty silnik spod głośnego dema głosowego — model bazowy, a nie gotowy rozmówca.
CSM-1B to konwersacyjny model mowy o otwartych wagach, opublikowany przez firmę Sesame w marcu 2025 roku — spółkę współzałożoną przez Brendana Iribe'a, współtwórcę Oculusa. Stoi pod Mayą i Milesem, hostowanymi rozmówcami głosowymi, których demo zwróciło uwagę tym, że brzmiało niepokojąco podobnie do człowieka po drugiej stronie telefonu. Architektura jest dla systemu mowy nietypowa: rdzeń oparty na Llamie połączony z mniejszym dekoderem dźwięku wytwarzającym kody Mimi, dzięki czemu tekst i kontekst dźwiękowy trafiają do modelu razem, a nie przez osobny stopień syntezy mowy — i to właśnie ten wspólny kontekst pozwala utrzymać rytm rozmowy, wahanie i wejście w słowo. Redakcyjnie najważniejsza jest jednak różnica między demem a plikiem do pobrania. Udostępnione wagi to model bazowy bez dostrojenia do konkretnego głosu, przede wszystkim anglojęzyczny, wydany wprost do celów badawczych i edukacyjnych i w ogóle niezdolny do generowania tekstu; osobowość, na którą ludzie zareagowali, mieszka w hostowanym produkcie Sesame, a nie w tym punkcie kontrolnym. Licencja to Apache 2.0, a karta modelu wprost zakazuje podszywania się bez zgody i tworzenia treści wprowadzających w błąd.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!