ChatGLM3-6B
Z.ai (Zhipu AI) · China · 2023
Ostatnia generacja ChatGLM: model, który dołożył wywoływanie narzędzi i interpreter kodu do sześciomiliardowego czat-modelu działającego na domowej karcie graficznej.
ChatGLM3-6B, opublikowany pod koniec października 2023 roku, zamyka nazewniczą linię ChatGLM — wszystko późniejsze nosi już markę GLM-4. Jego wkładem jest format zapytania. To pierwszy model rodziny z przeprojektowaną strukturą promptu, która natywnie obsługuje wywoływanie funkcji, interpreter kodu i zadania agentowe obok zwykłej rozmowy wieloturowej, co postawiło sześciomiliardowy model lokalny w jednym szeregu z hostowanymi asystentami, które miały te funkcje wcześniej. Model bazowy nie został załatany, tylko wytrenowany od nowa: bardziej zróżnicowane dane, więcej kroków treningu, poprawiony harmonogram. Producent deklarował wtedy najlepsze wyniki wśród modeli wstępnie trenowanych poniżej 10 mld parametrów — to twierdzenie o bardzo zatłoczonym polu z końca 2023 roku i należy je czytać jako migawkę, a nie trwały rekord. Szczegółem wartym sprawdzenia jest dostarczana konfiguracja. Domyślny kontekst to 8192 tokeny, a nie 32 768 jak w ChatGLM2-6B; wersja długokontekstowa to osobne wydanie ChatGLM3-6B-32K. Poza tym architektura nie zmieniła się wobec drugiej generacji: 28 warstw, wymiar ukryty 4096, 32 głowy uwagi na 2 głowach klucz-wartość, słownik 65 024 tokenów, 6,24 mld parametrów w formacie float16. Razem z modelem czatowym wydano bazowy ChatGLM3-6B-Base. Licencja jest zgodna ze wzorcem rodziny: własny dokument producenta, bezpłatnie do badań naukowych, a komercyjnie dopiero po rejestracji przez formularz producenta.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!