CSM-1B to konwersacyjny model mowy o otwartych wagach, opublikowany przez firmę Sesame w marcu 2025 roku — spółkę współzałożoną przez Brendana Iribe'a, współtwórcę Oculusa. Stoi pod Mayą i Milesem, hostowanymi rozmówcami głosowymi, których demo zwróciło uwagę tym, że brzmiało niepokojąco podobnie do człowieka po drugiej stronie telefonu. Architektura jest dla systemu mowy nietypowa: rdzeń oparty na Llamie połączony z mniejszym dekoderem dźwięku wytwarzającym kody Mimi, dzięki czemu tekst i kontekst dźwiękowy trafiają do modelu razem, a nie przez osobny stopień syntezy mowy — i to właśnie ten wspólny kontekst pozwala utrzymać rytm rozmowy, wahanie i wejście w słowo. Redakcyjnie najważniejsza jest jednak różnica między demem a plikiem do pobrania. Udostępnione wagi to model bazowy bez dostrojenia do konkretnego głosu, przede wszystkim anglojęzyczny, wydany wprost do celów badawczych i edukacyjnych i w ogóle niezdolny do generowania tekstu; osobowość, na którą ludzie zareagowali, mieszka w hostowanym produkcie Sesame, a nie w tym punkcie kontrolnym. Licencja to Apache 2.0, a karta modelu wprost zakazuje podszywania się bez zgody i tworzenia treści wprowadzających w błąd.
#text to speech#open weights#conversational#apache 2.0#research