Po wygenerowaniu milionów i milionów obrazów, sztuczna inteligencja przygotowuje się do zyskania ruchu i wymiaru. Rola modelowania 3D w przemyśle jest ogromna, a jeśli nowa platforma zdoła jeszcze bardziej usprawnić proces tworzenia, może rozpocząć prawdziwą rewolucję. Z myślą o tym odkrywamy Point-E, system zaprojektowany przez OpenAI, który generuje trójwymiarowe modele, łącząc tekst i chmury punktów.

Point-E: Nowy DALL-E do tworzenia obiektów 3D za pomocą tekstu
Point-E

Od astronautycznych kociąt po fantastyczne sceny pełne detali, generatywne modele obrazów wywołały eksplozję aktywności w sieci. Część publiczności skupiła się na debacie nad kwestiami prawnymi i etycznymi niektórych rozwiązań, ale jedno jest pewne: postęp tej technologii nie zatrzyma się.

Co jest następne na liście? Oprócz wideo, kolejnym priorytetem jest modelowanie 3D. Zazwyczaj profesjonalne narzędzia mają dość złożoną krzywą uczenia się, ale jeśli koncepcja „tekst-na-3D” stanie się rzeczywistością, nie byłoby szaleństwem mówić o demokratyzacji projektowania trójwymiarowego. W tym kierunku zmierza OpenAI po potwierdzeniu otwarcia swojego projektu Point-E, odpowiednika DALL-E do obiektów 3D.

Point-E: od tekstu do obiektów 3D z inteligencją sztuczną

Point-E: Nowy DALL-E do tworzenia obiektów 3D za pomocą tekstu
Przykład tego, co potrafi Point-E, wraz z odpowiadającymi mu promptami

Zgodnie z oficjalnym artykułem, jedną z głównych zalet Point-E jest jego szybkość. Podczas gdy DreamFusion od Google potrzebuje znacznej ilości czasu i kart graficznych do generowania modeli, Point-E tarda menos de dos minutos sobre una unidad Nvidia V100 (Point-E zajmuje mniej niż dwie minuty na układzie Nvidia V100). Jim Fan z Nvidii wyjaśnia, że Point-E jest 600 razy szybszy niż DreamFusion, choć pod względem jakości ustępuje mu.

Wynika to z metody generowania w Point-E. System wykorzystuje chmury punktów do reprezentowania obiektu trójwymiarowego. To ograniczenie zmniejsza precyzję niektórych cech, takich jak tekstura czy ostateczny kształt, ale obiekty są znacznie łatwiejsze do odtworzenia. Sztuczką Point-E, która to kompensuje, jest konwersja chmury punktów na siatki (meshes). W luźnych słowach możemy mówić o trzech modelach: jeden od tekstu do obrazu, drugi od obrazu do chmury punktów 3D, a trzeci odpowiedzialny za siatkę.

Point-E: Nowy DALL-E do tworzenia obiektów 3D za pomocą tekstu
Daleko od doskonałości, ale jego potencjał jest zauważalny

OpenAI wytrenowało ten system na kilku milionach obiektów 3D, w tym metadanych. Point-E często popełnia błędy, zwłaszcza podczas interpretacji obrazu wygenerowanego przez pierwszy model, ale przed nami dużo pracy, co nieuchronnie doprowadzi do bardziej zoptymalizowanych modeli.

Oficjalna strona: Kliknij tutaj

Dostęp do badania (PDF): Kliknij tutaj