Figura rilasciata l'elica modello VLA: un'istruzione a una frase, robot umanoide per fare lavori domestici in modo collaborativo

Feb 27, 2025 Lasciate un messaggio

Di recente, Figure AI, una società innovativa nel campo della robotica negli Stati Uniti, ha pubblicato un importante modello di azione per il linguaggio visivo (VLA) chiamato Helix. Per la prima volta, questo modello realizza il controllo continuo ad alta velocità della parte superiore del corpo di un robot umanoide e integra perfettamente la percezione, la comprensione del linguaggio e il controllo dell'apprendimento.

 

L'avvento del modello Helix segna un importante passo avanti nella flessibilità operativa dei robot umanoidi. Con semplici comandi in linguaggio naturale, il robot può facilmente comprendere quasi tutti i piccoli oggetti domestici, anche quelli che non sono mai stati toccati durante la formazione, senza alcuna dimostrazione precedente o programmazione personalizzata. Questa capacità è dovuta alla potente capacità di generalizzazione del modello Helix.

humanoid robot

La figura AI ha evidenziato che il modello Helix ha creato un numero di primi del settore. Per la prima volta, consente il controllo continuo ad alta velocità di tutta la parte superiore del corpo di un robot umanoide, incluso il controllo flessibile del polso, del busto, della testa e di ogni dito. Nei test, il robot ha elaborato con successo migliaia di nuovi articoli ingombra di disorganizzazione, da vetreria e giocattoli a strumenti e vestiti, senza dimostrazione o programmazione preventiva.

 

Ciò che è ancora più sorprendente è che il modello Helix ha anche funzionalità di collaborazione multi-robot. Nel test, i due robot sono stati in grado di lavorare insieme a compiti complessi a lungo termine, lavorando insieme su articoli mai visti prima, come risolvere la spesa sconosciuta insieme. Questa capacità apre più possibilità per l'applicazione pratica dei robot nell'ambiente domestico.

 

Il modello Helix dimostra anche un'eccellente comprensione della scena e capacità di analisi semantica. Quando viene richiesto di "raccogliere un oggetto desertico", il robot non è solo in grado di riconoscere che il cactus giocattolo si adatta a questo concetto astratto, ma seleziona anche la mano più vicina ed esegue un'azione di presa precisa. Questa funzione di avvincente universale, dal linguaggio al movimento, offre maggiore comodità per lo spiegamento di robot umanoidi in ambienti non strutturati.

 

Il modello Helix è stato in grado di ottenere queste scoperte grazie alla sua rivoluzionaria architettura a doppio sistema. L'architettura è costituita dal sistema 1 e dal sistema 2, che sono responsabili rispettivamente di controllo preciso, comprensione della scena e analisi semantica ad alta velocità. Il sistema 2 si basa sul VLM open source con parametri 7B, che opera a una frequenza di 7-9 Hz per garantire la generalizzazione tra oggetti e scenari. Il sistema 1 è un modello di strategia motoria visiva da 80 m, che converte la rappresentazione semantica del sistema 2 in istruzioni di azione continua a una frequenza di 200Hz per raggiungere la risposta in tempo reale a livello di millisecondi. Questa architettura disaccoppiata consente ai due sistemi di svolgere le rispettive funzioni e lavorare insieme per ottenere un efficiente controllo del robot umanoide.

 

I modelli Helix utilizzano pochissime risorse durante la formazione. Utilizzando solo circa 500 ore di dati supervisionati di alta qualità, il team è stato in grado di ottenere una solida generalizzazione degli oggetti. Questi dati rappresentano meno del 5% delle dimensioni dei set di dati VLA precedentemente raccolti e non si basano sulla raccolta di entità multi-bot o sulla formazione a più stadi. Questo risultato non solo dimostra l'efficienza del modello di elica, ma fornisce anche maggiori possibilità per lo sviluppo di robot umanoidi in futuro.