W ostatnich tygodniach użytkownicy wygenerowali miliony obrazów za pomocą sztucznej inteligencji. Fantastyczne sceny, absurdalne kombinacje, niezwykłe trafienia i przerażające błędy są istotną częścią tych modeli, które wciąż się rozwijają, ale ludzie z NVIDIA Research pracują już nad tym, co można uznać za ich ewolucyjny skok: GET3D, system generatywny do trójwymiarowych obiektów z teksturami, oparty na zbiorze danych z obrazów 2D.
«Krajobraz starego lasu, jesienna pora roku, brązowe i złote liście, promienie słońca przechodzące między drzewami, stara wyboista droga, olej na płótnie, bardzo szczegółowy»
«Krajobraz starodawnego lasu, jesienna pora, brązowe i złote liście, promienie słoneczne przechodzące między drzewami, stara zużyta droga, olej na płótnie, wysoki detal»
Po około dziesięciu minutach i kilku poprawkach Stable Diffusion przedstawił to:
I nawet się nie stara, bo użyłem dość ogólnego promptu. Gdybym wstrzyknął bardziej specyficzny styl lub nazwisko artysty, wynik byłby jeszcze lepszy. To tylko próbka tego, co potrafi dziś generowanie obrazów za pomocą sztucznej inteligencji. Wciąż ma wiele pracy przed sobą, zwłaszcza jeśli chodzi o anatomię człowieka (ręce z siedmioma palcami, trzy ramiona itp.), ale czas i technologia są po jej stronie.
Właściwie już mówiliśmy o generowaniu wideo za pomocą tekstu, a teraz przychodzi kolej na NVIDIA z jej projektem GET3D, który ma na celu tworzenie trójwymiarowych obiektów i postaci:
NVIDIA GET3D: od 2D do 3D, dzięki sztucznej inteligencji
Jednym z najciekawszych aspektów GET3D jest to, że jego trening opiera się na zbiorze danych z obrazami dwuwymiarowymi. Wszystkie wygenerowane modele przyjmują popularny format, który pozwala łatwo importować je do głównych aplikacji edycyjnych, czy to do późniejszego renderowania, czy do wstawiania do silników graficznych. Oczywiście każdy algorytm jest tak dobry, jak trening, który otrzymuje, i GET3D nie jest wyjątkiem. Krótkie demo od Nvidii skupia się na samochodach (od pickupów po samochody wyścigowe), motocyklach, krzesłach, ludziach i zwierzętach.
Jednym z priorytetów GET3D jest szczegół. Wszystkie poprzednie modele generatywne mają poważne ograniczenia w tym zakresie, ale GET3D stawia na większe i bardziej zróżnicowane zbiory danych, jednocześnie optymalizując ilość: Nvidia przewiduje, że przy użyciu pojedynczego GPU (wyobrażam sobie coś w rodzaju A100), GET3D może generować 20 obiektów na sekundę, a trening z milionem obrazów zajął dwa dni (ponownie z GPU A100).
Najlepsza część? GET3D jest open source. Nvidia utworzyła już profil na GitHubie, a w nadchodzących dniach podzieli się dalszymi informacjami.
Oficjalne ogłoszenie: Kliknij tutaj