DALL·E
OpenAI · USA · 2021
Pierwszy DALL·E: wariant GPT-3 o 12 miliardach parametrów nauczony rysować. Nigdy nie sprzedawany, nigdy w API — a od niego zaczęła się cała linia.
DALL·E, pokazany w styczniu 2021 r., to model, który wprowadził generowanie obrazu z tekstu do powszechnej świadomości. OpenAI opisuje go wprost: wariant GPT-3 o 12 miliardach parametrów, wytrenowany na zbiorze par tekst–obraz tak, by tworzyć obrazy z zapisanych opisów. Sam pomysł architektoniczny znaczył tyle co obrazki — to był model językowy, ta sama rodzina sieci, która pisze teksty, zmuszona do wypuszczenia obrazu. Możliwości, które producent wtedy pokazał, to dokładnie te, z których rozlicza się dziś każdy generator: sterowanie cechami przedmiotu, rysowanie kilku obiektów we właściwej relacji do siebie, oddanie perspektywy i trójwymiarowości, pokazanie wewnętrznej budowy przedmiotu, domyślenie się szczegółów, których w poleceniu nie było, łączenie niepowiązanych pojęć i przekształcanie istniejącego obrazu. Firma demonstrowała też wnioskowanie wizualne bez uczenia na przykładach oraz wiedzę geograficzną i czasową — model potrafił narysować telefon z zadanej dekady. Czego DALL·E nigdy nie miał, to użytkowników. Był pokazem badawczym: bez API, bez produktu, bez cennika. Publiczność widziała tylko przykłady wybrane przez OpenAI, w rozdzielczości, którą następca pomnożył przez cztery. Masowy odbiorca pojawił się rok później, przy DALL·E 2, a do szerokiej publiczności generowanie obrazów trafiło dopiero przez ten model i ChatGPT. Profil zostaje jako pozycja historyczna. Model nie jest dziś dostępny w żadnej formie; obecne możliwości opisuje profil GPT Image 2.
▸Wideo
Brak materiałów wideo.
▸Recenzje
Brak recenzji. Bądź pierwszy!