Mixtral 8x22B
Mistral AI · France · 2024
Największy model Mistrala na licencji Apache 2.0: 141 mld parametrów w pamięci, 39 mld używanych na token, kontekst 64 tys. i wywoływanie funkcji.
Mixtral 8x22B, opublikowany 17 kwietnia 2024 roku, przeskalował rzadką architekturę poprzednika do największego modelu, jaki Mistral kiedykolwiek wydał na swobodnej licencji. Przechowuje 141 miliardów parametrów, a na token uruchamia 39 miliardów, dzięki czemu pozostaje szybszy od dowolnego gęstego modelu 70-miliardowego, a w testach rozumowania i wiedzy wyprzedzał wszystkie ówczesne modele z otwartymi wagami. Od Mixtrala 8x7B odróżniają go — poza samym rozmiarem — dwie rzeczy. Okno kontekstu podwojono do 64 tysięcy tokenów, co wystarcza, by zmieścić w jednym zapytaniu długą umowę albo moduł kodu. Ważniejsze jest jednak wywoływanie funkcji wbudowane w model, a nie doklejone z boku: w połączeniu z trybem wymuszonego formatu odpowiedzi na platformie Mistrala pozwalało wpiąć model w istniejące oprogramowanie jako element zwracający uporządkowany wynik, a nie prozę. Model nadal biegle obsługiwał angielski, francuski, włoski, niemiecki i hiszpański, a także matematykę i programowanie. Licencja znów brzmiała Apache 2.0, a Mistral wydał obok wersji dostrojonej także model bazowy właśnie po to, by inni mogli go douczać. To był szczytowy punkt tej strategii: począwszy od Mistral Large firma przeniosła swoje największe modele na licencję badawczą z płatnymi warunkami komercyjnymi i późniejszych flagowców nie otwierała już w ten sposób. Mixtral 8x22B nie należy dziś do oferty API Mistrala, a daty wyłączenia nie ogłoszono; niezależni dostawcy nadal go serwują, a wagi pozostają do pobrania.
▸Newsy
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!