Mixtral 8x7B
Mistral AI · France · 2023
Pierwszy swobodnie licencjonowany model typu mieszanka ekspertów, który dorównał GPT-3.5: 46,7 mld parametrów w pamięci, tylko 12,9 mld używanych na token.
Mixtral 8x7B ogłoszono 11 grudnia 2023 roku i zmienił on wyobrażenie o tym, ile powinno kosztować uruchomienie otwartego modelu. Zamiast jednej gęstej sieci każdy blok przetwarzający mieści osiem osobnych grup parametrów; dla każdego tokenu, w każdej warstwie, mały router wybiera dwie z nich. Model przechowuje więc 46,7 miliarda parametrów, ale zużywa tylko 12,9 miliarda na token — odpowiada z szybkością i w koszcie modelu trzynastomiliardowego, a punktuje jak znacznie większy. Porównanie producenta stawiało go na poziomie Llamy 2 70B lub wyżej w większości testów, przy około sześciokrotnie szybszym wnioskowaniu, oraz na poziomie bazowego GPT-3.5 — czyli modelu, który stał wtedy za darmową wersją ChatGPT. Obsługiwał kontekst 32 tysięcy tokenów, języki angielski, francuski, włoski, niemiecki i hiszpański, a także sensownie pisał kod. Licencja znów brzmiała Apache 2.0 i to była rzecz handlowo najważniejsza: firma mogła dorównać płatnemu produktowi z górnej półki na własnym sprzęcie, bez żadnych negocjacji. Warto tę deklarację przeczytać wiersz po wierszu, bo tabela jest bliższa remisu, niż brzmi podsumowanie. Z siedmiu wierszy Mixtral wygrywa cztery — MMLU 70,6% wobec 70,0% GPT-3.5 i 69,9% Llamy 2 70B, ARC Challenge 85,8%, MBPP 60,7% i GSM-8K 58,4% — a trzy z tych czterech wygrywa różnicą poniżej 1,4 pkt; jedyna wyraźna przewaga to MBPP, 8,5 pkt nad GPT-3.5. W pozostałych trzech wierszach jest z tyłu: HellaSwag zabiera Llama 2 70B, 87,1% wobec 86,7%; WinoGrande zabierają obaj rywale, 83,2% i 81,6% wobec 81,2%; a MT-Bench — wiersz modeli dostrojonych — wygrywa GPT-3.5 dwiema setnymi, 8,32 wobec 8,30, i jest to jedyna liczba w całej tabeli pogrubiona dla GPT-3.5. Sformułowanie Mistrala, „porównywalny z GPT-3.5", jest ścisłe. Zdanie, że wersja dostrojona „uzyskała 8,3", bez podania sąsiedniej kolumny — jak stało dotąd w tym profilu — już nie. Sama premiera była przy tym spektaklem, który branża potem kopiowała. Mistral wypuścił wagi najpierw jako goły odnośnik magnet na platformie X — bez publikacji naukowej, bez tabeli wyników i bez wpisu na blogu — i pozwolił społeczności zmierzyć model przez trzy dni, zanim podał własne liczby. Rzadkie mieszanki ekspertów stały się później domyślnym rozwiązaniem w dużych modelach całej branży. Mixtral 8x7B nie występuje już w ofercie API Mistrala, a daty wyłączenia nigdy nie ogłoszono; na licencji Apache 2.0 wagi pozostają do pobrania.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!