HomeTecnologiaNVIDIA Cosmos 3 Edge per robotica: 4 miliardi di parametri senza cloud

NVIDIA Cosmos 3 Edge per robotica: 4 miliardi di parametri senza cloud

NVIDIA ha lanciato Cosmos 3 Edge, un modello open world da 4 miliardi di parametri progettato per portare l’intelligenza artificiale avanzata direttamente sui dispositivi edge, rivoluzionando le capacità di robotica e visione AI in tempo reale senza dipendere dal cloud.

Punti chiave

  • Cosmos 3 Edge è un modello open world da 4 miliardi di parametri per robotica e visione AI su dispositivi edge
  • Supporta inferenza ad alta efficienza su hardware NVIDIA Jetson, RTX PRO GPUs e DGX
  • Raggiunge il controllo robotico in tempo reale a 15 Hz con 32 azioni per inferenza
  • Si classifica al primo posto su VANTAGE-Bench per l’analisi visiva
  • Include una policy specializzata per attività robotiche di pick-and-place

Caratteristiche principali del modello open world

Cosmos 3 Edge rappresenta un significativo passo avanti nell’integrazione tra intelligenza artificiale e robotica su dispositivi edge. Il modello, disponibile attraverso il repository Cosmos 3 di Hugging Face, offre prestazioni paragonabili a quelle dei data center su sistemi con memoria limitata.

La compatibilità hardware include tutta la gamma di dispositivi edge NVIDIA, dai moduli Jetson appena annunciati T2000 e T3000 fino alle GPU RTX PRO, DGX e GeForce RTX. Questa versatilità consente di implementare il modello in contesti operativi reali come fabbriche, magazzini e ambienti sanitari.

Prestazioni e compatibilità hardware

Le prestazioni di Cosmos 3 Edge sono particolarmente impressionanti sul modulo NVIDIA Jetson Thor, dove raggiunge il controllo robotico in tempo reale a 15 Hz generando 32 azioni per ogni inferenza. Questa capacità di elaborazione consente ai robot di comprendere l’ambiente circostante, ragionare in tempo reale e generare azioni direttamente sui dispositivi edge.

Architettura innovativa per ragionamento e azioni

L’architettura di Cosmos 3 Edge combina due torri transformer distinte ma complementari: una torre autoregressiva per l’elaborazione di token visivi e testuali per la comprensione e il ragionamento, e una torre diffusion per la gestione di token visivi, audio e azioni per la previsione e la generazione.

Le due torri mantengono layer di normalizzazione separati ma condividono layer di attenzione multimodale, allineando le informazioni tra linguaggio, video, audio e azioni. Questo design permette al modello di ragionare su una scena prima di generare un output, adattando il pattern di attenzione al tipo di informazione elaborata.

Rappresentazione geometrica condivisa per azioni fisiche

Uno degli aspetti più innovativi di Cosmos 3 Edge è la sua capacità di mappare diverse embodiment fisiche in una rappresentazione d’azione comune. Le azioni vengono codificate come vettori geometrici compatti che catturano movimento, relazioni spaziali e input di controllo, creando una connessione diretta tra controllo e struttura visiva del mondo.

Applicazioni ed estensioni in robotica

Oltre al modello base, NVIDIA ha rilasciato Cosmos 3 Edge Policy (DROID), una policy di manipolazione robotica post-addestrata sul dataset DROID specificamente per attività di pick-and-place. Questo componente specializzato include script di post-addestramento che permettono agli sviluppatori di adattare il modello ai loro carichi di lavoro specifici.

Gli sviluppatori possono utilizzare cluster di H100 o stazioni NVIDIA DGX per effettuare fine-tuning efficiente di Cosmos 3 Edge prima della distribuzione sulle piattaforme edge NVIDIA. Questo approccio modulare consente una personalizzazione approfondita per applicazioni specifiche senza compromettere le prestazioni.

Risorse per sviluppatori e personalizzazione

NVIDIA fornisce checkpoint post-addestrati di riferimento e ricette di training per aiutare gli sviluppatori ad adattare e ottimizzare Cosmos 3 per le proprie applicazioni. Questi strumenti includono il checkpoint Cosmos 3 Super 4-Step Distillation, che riduce i passaggi di denoising da 35-50 a soli 4, offrendo inferenze fino a 25 volte più veloci preservando la qualità dell’immagine e del video.

Leadership nei benchmark e sviluppi futuri

Tra i modelli di dimensioni simili (4 miliardi di parametri), Cosmos 3 Edge si classifica al primo posto su VANTAGE-Bench per l’analisi visiva e rappresenta lo stato dell’arte per l’apprendimento delle policy robotiche. Questa leadership nei benchmark dimostra l’efficacia del modello nel settore dell’infrastruttura intelligente e della robotica.

NVIDIA continua ad avanzare lo sviluppo di Cosmos 3 per il Physical AI, con miglioramenti previsti nella generazione interattiva di mondi, nella simulazione di scenari di guida e nelle policy robotiche. L’azienda sta anche investendo in inferenza più veloce e post-addestramento più efficiente su una gamma più ampia di hardware.

Miglioramenti previsti e ottimizzazioni

Il roadmap di sviluppo include l’ottimizzazione dei checkpoint di Cosmos 3 con framework open di inferenza e ottimizzazione come vLLM, con ulteriori ottimizzazioni e tooling per sviluppatori in arrivo. Questi miglioramenti ridurranno ulteriormente il tempo e la potenza di calcolo necessari per costruire modelli downstream.

FAQ

Cos’è NVIDIA Cosmos 3 Edge?

È un modello open world da 4 miliardi di parametri che permette a robot e agenti di visione AI di comprendere, ragionare e agire in tempo reale su dispositivi edge.

Quale hardware supporta Cosmos 3 Edge per l’inferenza?

Supporta inferenza efficiente sulla memoria su hardware edge NVIDIA inclusi i moduli Jetson (T2000, T3000, Thor), GPU NVIDIA RTX PRO, NVIDIA DGX e GPU GeForce RTX.

Come raggiunge Cosmos 3 Edge il controllo robotico in tempo reale?

Il modello genera 32 azioni per inferenza e controlla i robot a 15 Hz su NVIDIA Jetson Thor, abilitando ragionamento e controllo in tempo reale.

Gli sviluppatori possono personalizzare Cosmos 3 Edge per i propri use case?

Sì, gli sviluppatori possono effettuare fine-tuning del modello utilizzando cluster con hardware NVIDIA H100 o DGX e utilizzare checkpoint post-addestrati di riferimento e ricette di training.

Contenuto realizzato con l’assistenza dell’intelligenza artificiale e con revisione editoriale umana.

Francesco Antonio Russo
Francesco Antonio Russo è un analista e divulgatore nel settore delle criptovalute, del Web3 e dell’Intelligenza Artificiale. Da più di 6 anni studia l’evoluzione dei mercati digitali e delle tecnologie decentralizzate, con particolare attenzione all’impatto economico e sociale della blockchain. Su Cryptonomist approfondisce trend, regolamentazioni e innovazioni, offrendo contenuti accurati e comprensibili anche ai non addetti ai lavori.
RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST