Jeste li čuli za Moravčev paradoks? Paradoks kaže da napredno obrazloženje zahtijeva vrlo malo računarske moći za umjetni inteligencijski (AI) sistem, dok implementira perceptivno-motoričke sposobnosti koje ljudi uzimaju zdravo za gotovo. U suštini su složeni logički zadaci lakši za AI nego osnovni senzorni zadaci da ljudski instinkti mogu ostvariti. Ovaj paradoks ističe razliku između AI i ljudskih kognitivnih sposobnosti u ovoj fazi.
Ljudi su svojstveno multimodalni. Svako od nas je poput inteligentnog terminala koji obično treba ići u školu da bi se educirali (obučeni), ali svrha i rezultat te obuke i učenja je da imamo sposobnost da radimo i živemo autonomno bez da živemo samo na vanjskim uputama i Kontrola.
Saznajemo o svijetu oko nas kroz više senzornih modaliteta kao što su vid, govor, zvuk, dodir, ukus i miris na analizu, razum, odlučivati i poduzeti akciju.
Nakon godina senzora fuzije i ai evolucije, roboti su u ovoj fazi uglavnom opremljeni multimodalnim senzorima. Dok donosimo više računarskog moći za ivice uređaja poput robota, ovi uređaji postaju pametniji i pametniji, sposobni da osjete svoje okruženje, razumijevanje i komuniciranje na prirodnom jeziku, kao i osjetiti specifičnu silu, kao i osjetljivost na specifičnu silu robota, kao i osjetiti specifičnu silu robota, Kutna brzina, pa čak i magnetno polje oko robota kroz kombinaciju akcelerometara, žiroskopa i magneta, i još mnogo toga.
Prema novoj eri robotike i strojno kognicije
Prije transformatora i velikih jezičnih modela (LLMS), implementacija multimodalnosti u AI obično je potrebna upotreba više zasebnih modela odgovornih za različite vrste podataka (tekst, slike, audio) i integraciju različitih modaliteta kroz složen proces.
Uz pojavu transformatorskih modela i LLMS-a, multimodalnost je postala integriraniji, omogućujući jedinstvenom modelu istovremeno procesuirati i razumjeti više vrsta podataka, što rezultira AI sistemima koji su sposobniji da sveobuhvatniju ometaju svoje okruženje. Ova pomak je uvelike poboljšala efikasnost i efikasnost multimodalnih AI aplikacija.
Dok se LLMS poput GPT-a -3 temelje na tekstu, industrija je učinila brz napredak prema multimodalnosti. Iz Openaijevog isječka i Dall-e, a sada Sore i GPT -4 O, primjeri su modela koji su se preselili prema multimodalnosti i prirodniju interakciju ljudskog računara. Na primjer, Clip razumije slike uparene s prirodnim jezikom, čime premoštava jaz između vizualnih i tekstualnih informacija; Dall-E ima za cilj generirati slike na osnovu tekstualnih opisa. Vidimo da je model Google Gemini koji je podvrgnut sličnoj evoluciji.
2024. godine multimodalna evolucija ubrzava. U februaru je Openai objavio Soru, koji stvara realne ili maštovite video zapise na osnovu tekstualnih opisa. Kad razmišljate o tome, ovo bi moglo pružiti perspektivni put za izgradnju univerzalnih svjetskih simulatora ili postati važan alat za obuku robota. Nakon tri mjeseca, GPT -4 o značajno je poboljšao performanse interakcije ljudskog robota i u stanju je razum u stvarnom vremenu između zvuka, vizije i teksta. Kombinovanje tekstualnih, vizualnih i audio podataka za obuku novog modela krajnji kraj eliminira dva modalna prijelaza iz ulaznog modaliteta na tekst, a zatim iz teksta do izlaznog modaliteta, koji zauzvrat dramatično poboljšava performanse.
Iste sedmice u februaru, Google je objavio Blizanci 1.5, koji je dramatično proširio dužinu konteksta na milion tokena. To znači da 1.5 Pro može obraditi velike količine informacija odjednom, uključujući sat vremena, 11 sati audio, i šifre koji sadrži više od 30, 000 linije koda ili 700, {9}} Words.gemini 1.5 izgrađen je na glavnom istraživanju Googlea na transformatoru i mješovito-članu stručnu arhitekturu (MO) i otvorenim modelima 2b i 7B koji se mogu rasporediti na rubnoj strani. Na Google I / O konferenciji u maju, osim udvostručenja dužine konteksta i oslobađanja niz generativnih AI alata i aplikacija, Google je istraživao svoju viziju za budućnost projekta ASA, a pomoćnik opće namjene koji procesuiraju multimodalne informacije , razumije kontekst u kojem se postavlja korisnik, te interakcije s ljudima u razgovorima na vrlo prirodan način.
Kao kompanija koja stoji iza otvorenog koda LLM Llama, Meta se takođe pridružio opštoj stazi za umjetnu inteligenciju (AGI).
Ta istinski multimodalnost uvelike povećava nivo mašinske inteligencije i dovest će do novih paradigmi za mnoge industrije.
Na primjer, roboti su nekada bili vrlo homogeni, sa nekim senzorima i sposobnostima lokomotiva, ali generalno nisu imali "mozak" da nauče nove stvari i prilagođavaju se nestrukturiranim i nepoznatim okruženjima.
Očekuje se da će multimodalni LLMS transformirati sposobnost robota za analizu, razum i učenje, premještanje iz specijalizacije do generalizacije. PC-ovi, serveri i pametni telefoni su lideri na računarskim platformama opće namjene i mogu pokrenuti mnoge različite vrste softverskih aplikacija za postizanje širokog broja funkcija. Generalizacija će pomoći u skaliranju, generirajući ekonomiju razmjera, a cijene se mogu dramatično smanjiti jer se pohranjuju, što dovodi do virtuoznog ciklusa usvajanja u više područja.
Elon Musk rano su primijetili prednosti generalizirane tehnologije, jer su Teslinovi roboti evoluirali iz BumbleBee-a u 2022. godine u optimus Gen 1, najavljeni u martu 2023. godine, a Gen 2, najavljeni su na kraju 2023. godine, sa sve većim svestimljištima i mogućnostima učenja. Tijekom prošle {6}} meseci, bili smo svedoci višestrukih proboja u oblasti robotike i humanoidne robotike.
Nove tehnologije iza robotike i utjelovljene inteligencije nove generacije
Nema sumnje da još uvijek imamo puno posla prije utjelovljene inteligencije dostiže masovnu proizvodnju. Potrebni su nam lakši dizajni, duže pokretanje i brže, snažnije rubne računarske platforme za obradu i osiguravanje podataka o senzorima kako bi se provjerile pravovremene odluke i kontrole.
I krećemo prema stvaranju humanoidnih robota; Hiljade godina ljudske civilizacije proizvelo je sveprisutna okruženja dizajnirana za ljude, a očekuje se da će humanoidni robotski sustavi biti u mogućnosti udobno komunicirati sa ljudima i okolišu i obavljati potrebne operacije u ljudsko-postojećim okruženjima zbog njihove sličnosti u obliku ljudi. Ovi će sustavi biti dobro za rješavanje prljavih, opasnih i dosadnih zadataka kao što su briga o pacijentima i rehabilitaciji, uslužnim radom u ugodne industriji, nastavni pomagali ili učenje u obrazovnom polju, kao što su odziva katastrofa i rukovanje opasnim materijalima . Takve aplikacije koriste humanoidne mašine ljudske atribute kako bi se olakšale prirodne interakcije ljudskog robota, čine u razmacima u središta ljudi i obavljaju zadatke koji su često teški za postizanje tradicionalnih robota.
Mnoge kompanije AI i robotike lansiraju nova istraživanja i suradnju oko toga kako trenirati robote na bolji razlog i planirati u novim nestrukturiranim okruženjima. Kao novi "mozak" robota, modeli koji su unaprijed obučeni o velikim količinama podataka imaju odlične generalizacije, omogućavajući robotima da vide i razumiju svoje okruženje sveobuhvatnije, prilagođavaju njihove potencijalne povratne informacije i optimiziraju njihove performanse u raznim dinamičnim okruženjima.
Kao zanimljiv primjer, Boston Dinamics 'pseći robot, spot, može djelovati kao turistički vodič u muzeju, u interakciji s posjetiteljima, uvodeći ih na različite eksponate i odgovaranje na njihova pitanja. Možda je teško povjerovati, ali u ovom slučaju, tački za zabavu, interaktivni i suptilni nastupi su važniji od osiguravajući da su činjenice tačne.
Robotični transformator: novi mozak robotike
Robotics Transformer (RT) se brzo razvija za prevođenje multimodalnih ulaza direktno u djelotvorni kod. Google Deepmind je RT -2, kao i njegov prethodnik, RT -1, sa skorom 100% uspješnosti prilikom obavljanja zadataka koji su viđeni prije. Međutim, kada je obučen sa Palm-e (osvojen model orijentiran na robot) i Pali-X (veliki višejezični model i jezični model, koji nije posebno dizajniran za robote), RT -2 ima bolje mogućnosti generalizacije i nadmašuje RT -1 na neviđene zadatke.
Microsoft je predstavio Llavu, veliki asistent za jezik i viziju. Prvobitno dizajniran za zadatke zasnovane na tekstu, Llava koristi snagu GPT-a -4 da stvori novu paradigmu za multimodalne upute za praćenje podataka, neprimjetno integrirajući tekstualne i vizualne komponente, što može biti korisno za robotske zadatke. Po njegovom uvodu, Llava je postavio nove evidencije za višemodalne zadatke za chat i naučne testiranje, već prekoračenja ljudskih prosječnih mogućnosti.
Kao što je ranije spomenuto, Robotika Tesline u humanoidu i AI opće namjene značajna je ne samo zato što je dizajniran za razmjenu i masovne proizvodnje, ali i zato što se zatoče za strogo za samopouzdanje (FSD) tehnologije za automobile za automobile za automobile može koristiti za automobile za automobile za automobile za automobile Roboti. Tesla ima i pametnu futrolu za proizvodnju za primjenu Optimus u svoj novi proces proizvodnje energetskog vozila.
Ruka je kamen temeljac budućnosti robotike
Arm vjeruje da bi robotski mozak, i "veliki mozak" i "mali mozak", trebao biti heterogeni AI računarski sustav koji pruža vrhunske performanse, reakciju u stvarnom vremenu i energetsku efikasnost.

Robotika uključuje širok spektar zadataka, uključujući osnovno računanje (npr. Slanje i primanje signala na i iz motora), napredne obrade podataka (npr. Tumačenje podataka o slikama i senzorima), a prevođenje multimodalnih llmsa ranije. CPU je dobro prilagođen zadacima opće namjene, dok ai plinske papučice i GPU mogu efikasnije rukovati paralelnim zadacima obrade, kao što su mašinska učenje (ML) i grafičke obrade. Dodatne gasne papučice kao što su procesori signala i video kodeka također se mogu integrirati kako bi se poboljšala sposobnosti za vid robota i efikasnost skladištenja / prenosa. Pored toga, CPU bi trebao imati reagiranje u stvarnom vremenu i treba moći pokrenuti operativne sisteme kao što su Linux i Ros paketi.
Kada se proširi na robotski softver, sloj operativnog sistema također može zahtijevati operativni sistem u stvarnom vremenu (RTOS) koji može pouzdano rješavati vremenske kritične zadatke, kao i Linux distribuciju prilagođenu za robotiku, poput ROS-a, koji mogu pružiti Usluge dizajnirane za heterogene računarske klastere. Vjerujemo da će standardi i programi za sponzorirani za pokretanje pokretača poput SystemReady i PSA certificirani pomoći razvoju robotskog softvera. Systemready je dizajniran da osigura da se standardne bogate distribucije OS-a pokreću na širokom rasponu sistemskih čipova (Socs) na bazi arhitektore za ruke, dok PSA certificirani pomaže u pojednostavljenju sigurnosnih rješenja za ispunjavanje regionalnih sigurnosnih i regulatornih zahtjeva za povezane uređaje.
Napredak u velikim multimodalnim modelima i generativni Ai Herald Nova era u razvoju AI robota i humanoidnih robota. Uz AI računarstvo i ekosustave, energetsku efikasnost, sigurnost i funkcionalnu sigurnost su od suštinskog značaja za izradu mainstream robotike u ovoj novoj eri. Procesori za ruke već se široko koriste u robotici i radujemo se što ćemo usko surađivati s ekosustavom kako bi se naoružao kamen temeljac budućnosti AI robotike.




