Google DeepMind's Gemini Robotics 2 controlla interi umanoidi
Google DeepMind vuole un cervello AI per gestire ogni robot, e ha appena insegnato a quel cervello a usare tutto il suo corpo. Ha rilasciato Gemini Robotics 2, una famiglia di modelli che possono controllare un umanoide dai piedi alle punte delle dita. Il sistema può anche coordinare diverse macchine contemporaneamente e adattarsi a un nuovo corpo robotico in poche ore.
È il segnale più chiaro finora di ciò che l'industria chiama "AI fisica", e Wired lo ha inquadrato come un vero passo verso "AGI fisica". L'idea è semplice. Lo stesso tipo di modello che scrive le tue email sta ora imparando a camminare in una stanza disordinata e a sistemarla.
Dalle braccia all'intero corpo
Il cambiamento principale è il controllo. I modelli robotici precedenti di DeepMind si muovevano principalmente con la parte superiore del corpo per svolgere compiti su tavolo. Gemini Robotics 2 guida l'intera macchina. Può far camminare un umanoide, accovacciarsi, allungarsi e mantenere l'equilibrio mentre manipola oggetti in spazi ristretti progettati per gli esseri umani.
In una demo, il robot Apollo 2 di Apptronik ha ricevuto un'unica istruzione: mettere l'annaffiatoio nel bidone verde sullo scaffale inferiore. È andato a un tavolo, ha preso l'annaffiatoio, si è spostato verso gli scaffali, si è chinato e lo ha posato. Sembra banale. Coordinare gambe, torso, braccia e mani da un'unica istruzione non lo è.
Anche la destrezza è migliorata. Il modello può guidare la mano a cinque dita e 22 giunti di Apollo per fare nodi e sigillare un sacchetto ziplock, e può gestire gripper più semplici a due dita su altre piattaforme. "Il nostro obiettivo è portare l'AI nel mondo fisico e poi costruire il livello di intelligenza che può essere utilizzato da ogni robot", ha detto Carolina Parada, responsabile della robotica di DeepMind.
Tre modelli, un sistema
Il rilascio è in realtà tre modelli. Gemini Robotics 2 è il modello visione-linguaggio-azione che trasforma ciò che un robot vede e sente in comandi motori. Gestisce il fare fisico.
Gemini Robotics ER 2 è il livello di ragionamento, un cervello di alto livello che pianifica lavori a più fasi. Nella sua presentazione agli sviluppatori, Google ha mostrato come tracciava i propri progressi su un feed video in diretta. Può chiamare strumenti come Google Search e persino guidare un robot Spot di Boston Dynamics per prendere uno snack. Permette anche a diversi robot di lavorare come una squadra, una macchina su ruote e un umanoide che dividono un compito. È disponibile ora per gli sviluppatori tramite l'API Gemini e Google AI Studio.
Il terzo, On-Device 2, funziona localmente senza connessione a Internet. Può essere adattato a un corpo robotico completamente nuovo con meno di 200 esempi e poche ore di addestramento. Questo ultimo punto è importante, perché trasferire un'abilità appresa da una macchina a un'altra è da tempo uno dei problemi più difficili della robotica.
Impressionante, e ancora lento
DeepMind è stata insolitamente franca sui limiti. I propri numeri mostrano il divario. Bloomberg ha riportato che il sistema potrebbe svitare una lampadina il 92% delle volte, ma i lavori più complicati hanno mostrato un forte ritardo. Il Chosun Daily ha messo la legatura del sacchetto della spazzatura al 44% e la sigillatura del sacchetto ziplock al 40%.
I robot sono anche lenti. Si fermano per riflettere sui movimenti che una persona fa senza pensarci due volte. Kanishka Rao, direttore della robotica di DeepMind, ha detto che la vera destrezza rimane un obiettivo lontano, e che i robot apprendono ancora in modo molto meno efficiente rispetto agli esseri umani, che si adattano dopo uno o due errori.
Questo è un modello comune nel campo. Gli sforzi concorrenti da parte di startup di modelli di robotica e il lavoro sulla destrezza di umanoidi rivali continuano a incontrare lo stesso ostacolo. Le dimostrazioni sono sbalorditive, ma le macchine sono ancora lontane dall'essere pronte per la casa.
La sicurezza sale nella gerarchia
Man mano che i robot acquisiscono la capacità di muoversi tra le persone, DeepMind ha posto maggiore enfasi sulla sicurezza. Gemini Robotics ER 2 è il suo modello più sicuro finora, afferma, migliore nel riconoscere quando una persona è vicina e fermarsi fino a quando l'area non è libera. Riprende solo quando lo spazio è di nuovo vuoto.
L'azienda ha anche rilasciato un benchmark, ASIMOV-Agentic, che testa se il modello di ragionamento rifiuterà un comando non sicuro dal modello di azione e se segnala quando un compito è impossibile o chiede aiuto a un umano. Dare il nome a un benchmark di sicurezza robotica in onore di Isaac Asimov è appropriato. La preoccupazione sottostante, macchine che agiscono su istruzioni errate, non lo è.
Un problema hardware che Google non può risolvere
C'è uno sfondo scomodo. Google produce il software, non i robot, e la fornitura di hardware sta diventando politica. Come ha notato Axios, gli Stati Uniti hanno appena deciso di vietare le vendite future di robot prodotti in Cina per motivi di sicurezza. Molti dei corpi su cui questo software potrebbe funzionare sono costruiti in Cina.
Google sta lavorando con partner occidentali tra cui Apptronik, Boston Dynamics e Agile Robots, e più di 100 tester fidati. I suoi rivali stanno circondando lo stesso premio. OpenAI e Nvidia stanno entrambe costruendo modelli di robot, e tutti stanno inseguendo la stessa idea: un modello, qualsiasi corpo.
DeepMind è attenta a definire questo un traguardo, non il traguardo finale. Gemini Robotics 2 rende i robot più generali e più utili rispetto a prima. Rende anche chiaro quanto sia lontana una macchina dalla competenza facile di un umano che sistema una stanza.
Altri articoli
Google DeepMind's Gemini Robotics 2 controlla interi umanoidi
Google DeepMind's Gemini Robotics 2 offre a un modello di intelligenza artificiale il controllo totale del corpo degli umanoidi e consente ai robot di lavorare come una squadra, anche se la destrezza è ancora in ritardo.
