MDL-4349EST.2021 · IDX.127
ObrazWycofany

DALL·E

OpenAI · USA · 2021

Pierwszy DALL·E: wariant GPT-3 o 12 miliardach parametrów nauczony rysować. Nigdy nie sprzedawany, nigdy w API — a od niego zaczęła się cała linia.

Ocena wujec.ai

/10

Ocena społeczności

brak głosów
Zaloguj się, aby ocenić

DALL·E, pokazany w styczniu 2021 r., to model, który wprowadził generowanie obrazu z tekstu do powszechnej świadomości. OpenAI opisuje go wprost: wariant GPT-3 o 12 miliardach parametrów, wytrenowany na zbiorze par tekst–obraz tak, by tworzyć obrazy z zapisanych opisów. Sam pomysł architektoniczny znaczył tyle co obrazki — to był model językowy, ta sama rodzina sieci, która pisze teksty, zmuszona do wypuszczenia obrazu. Możliwości, które producent wtedy pokazał, to dokładnie te, z których rozlicza się dziś każdy generator: sterowanie cechami przedmiotu, rysowanie kilku obiektów we właściwej relacji do siebie, oddanie perspektywy i trójwymiarowości, pokazanie wewnętrznej budowy przedmiotu, domyślenie się szczegółów, których w poleceniu nie było, łączenie niepowiązanych pojęć i przekształcanie istniejącego obrazu. Firma demonstrowała też wnioskowanie wizualne bez uczenia na przykładach oraz wiedzę geograficzną i czasową — model potrafił narysować telefon z zadanej dekady. Czego DALL·E nigdy nie miał, to użytkowników. Był pokazem badawczym: bez API, bez produktu, bez cennika. Publiczność widziała tylko przykłady wybrane przez OpenAI, w rozdzielczości, którą następca pomnożył przez cztery. Masowy odbiorca pojawił się rok później, przy DALL·E 2, a do szerokiej publiczności generowanie obrazów trafiło dopiero przez ten model i ChatGPT. Profil zostaje jako pozycja historyczna. Model nie jest dziś dostępny w żadnej formie; obecne możliwości opisuje profil GPT Image 2.

#image-generation#openai#historic#research
Strona oficjalna

Wideo

Brak materiałów wideo.

Recenzje

Brak recenzji. Bądź pierwszy!

Zaloguj się, aby napisać recenzję