Al gran model cap a la multimodalitat

Jan 04, 2025 Deixa un missatge

Heu sentit a parlar de la paradoxa de Moravec? La paradoxa afirma que el raonament avançat requereix molt poc poder computacional per a un sistema d’intel·ligència artificial (AI), alhora que s’implementa les habilitats perceptuals-motors que els humans donen per descomptat requereix enormes recursos computacionals. En essència, les tasques lògiques complexes són més fàcils per a la IA que les tasques sensorials bàsiques que els instints humans poden realitzar. Aquesta paradoxa posa de manifest la diferència entre la IA i les habilitats cognitives humanes en aquesta etapa.


La gent és inherentment multimodal. Cadascú de nosaltres és com un terminal intel·ligent que normalment necessita anar a l'escola per ser educat (format), però el propòsit i el resultat d'aquesta formació i aprenentatge és que tenim la capacitat de treballar i viure de forma autònoma sense confiar sempre en instruccions externes i control.


Aprenem sobre el món que ens envolta a través de múltiples modalitats sensorials com ara la vista, la parla, el so, el tacte, el gust i l’olor per analitzar, raonar, decidir i prendre mesures.


Després d’anys de fusió del sensor i evolució de l’IA, els robots estan equipats en gran mesura amb sensors multimodals en aquesta fase. A mesura que aportem més potència informàtica a dispositius de vora com els robots, aquests dispositius són cada cop més intel·ligents, capaços de detectar el seu entorn, comprendre i comunicar -se en el llenguatge natural, adquirir haptics mitjançant interfícies de detecció digital, a més de detectar la força específica del robot, Velocitat angular, i fins i tot el camp magnètic al voltant del robot mitjançant una combinació d’acceleròmetres, giroscopis i magnetòmetres i molt més.


Cap a una nova era de la robòtica i la cognició de màquines


Abans del transformador i dels models de llenguatge gran (LLMS), la implementació de la multimodalitat en IA normalment requeria l’ús de diversos models separats responsables de diferents tipus de dades (text, imatges, àudio) i la integració de les diferents modalitats mitjançant un procés complex.


Amb l’arribada de models de transformadors i LLMS, la multimodalitat s’ha integrat més, permetent a un model un sol processar i comprendre diversos tipus de dades, donant lloc a sistemes d’AI més capaços de sensibilitzar de forma exhaustiva el seu entorn. Aquest canvi ha millorat molt l’eficàcia i l’efectivitat de les aplicacions d’IA multimodals.


Si bé els LLM com GPT -3 es basen principalment en text, la indústria ha avançat ràpidament cap a la multimodalitat. Des de Openai's Clip i Dall-E, i ara Sora i GPT -4 o, són exemples de models que s'han dirigit cap a la multimodalitat i la interacció més natural de l'ésser humà. Per exemple, Clip entén les imatges combinades amb un llenguatge natural, aconseguint així el buit entre la informació visual i textual; Dall-E té com a objectiu generar imatges basades en descripcions textuals. Veiem que el model de Google Gemini experimenta una evolució similar.


El 2024, l’evolució multimodal s’accelera. Al febrer, Openai va llançar Sora, que genera vídeos realistes o imaginatius basats en descripcions de text. Quan hi penseu, això podria proporcionar un camí prometedor per construir simuladors del món universal o convertir -se en una eina important per a la formació de robots. Després de tres mesos, GPT -4 o ha millorat significativament el rendiment de la interacció humana-robot i és capaç de raonar en temps real entre àudio, visió i text. Combinant informació de text, visual i àudio per entrenar un nou model de final a extrem elimina dues transicions modals de la modalitat d’entrada al text i de la modalitat de text a la sortida, que al seu torn millora dràsticament el rendiment.


La mateixa setmana de febrer, Google va llançar Gemini 1.5, que va ampliar dràsticament la durada del context fins a un milió de fitxes. Això significa que 1,5 Pro pot processar grans quantitats d'informació alhora, incloent una hora de vídeo, 11 hores d'àudio i una base de codi que conté més de 30, 000 línies de codi o 700, 000 Words.Gemini 1.5 es basa en la investigació líder de Google sobre Transformer i Mixt Member Expert Architecture (MOE) i models de Sources Open 2B i 7B que es poden desplegar al costat de la vora. A la conferència de Google E/S al maig, a més de duplicar la durada del context i publicar una sèrie d’eines i aplicacions generatives d’AI, Google va explorar la seva visió per al futur del projecte Astra, un assistent d’AI de propòsit general que processa informació multimodal , entén el context en què es col·loca un usuari i interactua amb les persones en converses de manera molt natural.


A mesura que la companyia darrere de l'Open-Source LLM LLAMA, Meta també s'uneix a la pista general d'intel·ligència artificial (AGI).


Aquesta veritable multimodalitat augmenta considerablement el nivell d’intel·ligència de màquines i conduirà a nous paradigmes per a moltes indústries.


Per exemple, els robots solien ser molt homogenis, amb alguns sensors i capacitats de locomoció, però generalment no tenien el "cervell" per aprendre coses noves i adaptar -se a entorns no estructurats i poc coneguts.


Es preveu que els LLM multimodals transformin la capacitat dels robots per analitzar, raonar i aprendre, traslladar -los de l’especialització a la generalització. Els PC, els servidors i els telèfons intel·ligents són líders en plataformes informàtiques de propòsit general i poden executar diversos tipus d’aplicacions de programari per aconseguir una gran varietat de funcions. La generalització ajudarà a escalar, generant economies d’escala i els preus es poden reduir dràsticament a mesura que augmenten, donant lloc a un cicle d’adopció virtuós en més àrees.


Elon Musk va notar els avantatges de la tecnologia generalitzada ben aviat, ja que els robots de Tesla van evolucionar des de Bumblebee el 2022 fins a Optimus Gen 1, anunciats el març de 2023 i Gen 2, anunciats a finals de 2023, amb una versatilitat i capacitats d’aprenentatge cada cop més creixents. Durant els últims 6-12, hem estat testimonis de diversos avenços en el camp de la robòtica i la robòtica humanoide.


Noves tecnologies darrere de la robòtica de nova generació i la intel·ligència encarnada


No hi ha dubte que encara tenim molta feina a fer abans que la intel·ligència encarnada arribi a la producció massiva. Necessitem dissenys més lleugers, temps d’execució més llargs i plataformes informàtiques més potents i potents per processar i fusionar informació sobre dades del sensor per prendre decisions oportunes i accions de control.


I ens dirigim cap a la creació de robots humanoides; Milers d’anys de civilització humana han produït entorns omnipresents dissenyats per a humans, i s’espera que els sistemes robòtics humanoides puguin interactuar còmodament amb els humans i el medi ambient i realitzar operacions necessàries en entorns existents als humans per la seva similitud en forma amb les persones. Aquests sistemes seran adequats per gestionar tasques brutes, perilloses i avorrides, com ara l’atenció i la rehabilitació del pacient, els treballs de servei a la indústria de l’hostaleria, l’ensenyament de les ajudes o els companys d’aprenentatge en l’àmbit educatiu i tasques perilloses com la resposta a desastres i el maneig de materials perillosos . Aquestes aplicacions utilitzen atributs humans de màquines humanoides per facilitar les interaccions naturals del robot humà, actuar en espais centrats en els humans i realitzar tasques que sovint són difícils de realitzar els robots tradicionals.


Moltes empreses de la IA i la robòtica estan llançant noves investigacions i col·laboracions sobre com formar robots per a una raó millor i planificar en nous entorns no estructurats. Com a nous "cervells" dels robots, els models que es formen pre-formats en grans quantitats de dades tenen excel·lents capacitats de generalització, permetent als robots veure i comprendre els seus entorns de manera més exhaustiva, ajustar els seus moviments i accions basades en la retroalimentació sensorial i optimitzar el seu rendiment En diversos entorns dinàmics.


Com a exemple interessant, el gos robot de Boston Dynamics, Spot, pot actuar com a guia turístic en un museu, interactuant amb els visitants, introduint -los a les diverses exposicions i responent a les seves preguntes. Pot ser difícil de creure, però en aquest cas d’ús, les actuacions entretingudes, interactives i subtils de Spot són més importants que assegurar -se que els fets siguin correctes.


Transformador de robòtica: el nou cervell de la robòtica


Robotics Transformer (RT) està evolucionant ràpidament per traduir les entrades multimodals directament en un codi actuable. RT -2 de Google DeepMind, així com el seu predecessor, rt -1, amb una taxa d'èxit prop del 100% quan es realitza tasques que s'han vist abans. Tanmateix, quan s’entrena amb Palm-E (un model de llenguatge multimodal encarnat orientat al robot) i Pali-X (un model de visió i llenguatge multilingüe a gran escala, no dissenyat específicament per a robots), Rt -2 té millors capacitats de generalització i supera Rt -1 en tasques no vistos.


Microsoft va introduir Llava, un assistent de llengua i visió a gran escala. Originalment dissenyat per a tasques basades en text, Llava aprofita la potència de GPT -4 per crear un paradigma nou per a instruccions multimodals per seguir les dades, integrant perfectament components textuals i visuals, que poden ser útils per a tasques robòtiques. A la seva introducció, Llava va establir nous registres per a les tasques multimodals de xat i proves científiques, que ja superen les capacitats mitjanes humanes.


Com s'ha esmentat anteriorment, la incursió de Tesla a l'humanoide i la robòtica de propòsit general AI és significativa no només perquè està dissenyada per a la producció d'escala i en massa, sinó també perquè es pot utilitzar la forta Fundació Tecnològica de Drivant Total (FSD) del Tesla Autopilot per a Automòbils per a Automòbils Robots. Tesla també té un cas d’ús de fabricació intel·ligent per aplicar Optimus al seu nou procés de producció de vehicles energètics.


El braç és la pedra angular del futur de la robòtica


ARM creu que el cervell robotitzat, tant el "cervell gran" com el "petit cervell", hauria de ser un sistema informàtic Heterogenós AI que proporciona un rendiment superior, una resposta en temps real i una eficiència energètica.

 

news-800-1

 

La robòtica implica una àmplia gamma de tasques, inclosa la computació bàsica (per exemple, l’enviament i la recepció de senyals a i des de motors), processament avançat de dades (per exemple, interpretar dades d’imatges i sensors) i executar els LLM multimodals esmentats anteriorment. La CPU s’adapta bé a les tasques de propòsit general, mentre que els pedals de gas i les GPU poden gestionar de manera més eficient les tasques de processament paral·lel, com ara l’aprenentatge de màquines (ML) i el processament gràfic. Els pedals de gas addicionals com els processadors de senyal d’imatge i els còdecs de vídeo també es poden integrar per millorar les capacitats de visió del robot i l’eficiència d’emmagatzematge/transmissió. A més, la CPU hauria de tenir una resposta en temps real i ha de ser capaç d’executar sistemes operatius com els paquets Linux i ROS.


Quan s’estengui a la pila de programari robòtica, la capa del sistema operatiu també pot requerir un sistema operatiu en temps real (RTOS) que pugui gestionar de manera fiable tasques crítiques al temps, així com una distribució de Linux personalitzada per a la robòtica, com ROS, que pot proporcionar Serveis dissenyats per a clústers informàtics heterogenis. Creiem que els estàndards i programes de certificació patrocinats per ARM com SystemReady i PSA certificats ajudaran a escalar el desenvolupament de programari robotitzat. SystemReady està dissenyat per assegurar que les distribucions de sistemes operatius rics estàndard s’executen en una àmplia gamma de sistemes en xips (SOCs) basats en l’arquitectura ARM, mentre que el certificat PSA ajuda a simplificar les solucions d’implementació de seguretat per satisfer els requisits regionals de seguretat i regulació per a dispositius connectats.


Els avenços en models multimodals a gran escala i AI generatius van anunciar una nova era en el desenvolupament de robots AI i robots humanoides. Juntament amb la informàtica i els ecosistemes d’AI, l’eficiència energètica, la seguretat i la seguretat funcional són essencials per fer que la robòtica sigui corrent en aquesta nova era. Els processadors de braços ja s’utilitzen àmpliament en la robòtica i esperem treballar estretament amb l’ecosistema per fer del braç una pedra angular del futur de la robòtica de l’IA.

Enviar la consulta

whatsapp

Telèfon

Correu electrònic

Investigació