
NVIDIA Cosmos 3 Edge per robotica: 4 miliardi di parametri senza cloud
NVIDIA ha lanciato Cosmos 3 Edge, un modello open world da 4 miliardi di parametri progettato per portare l’intelligenza artificiale avanzata direttamente sui dispositivi edge, rivoluzionando le capacità di robotica e...
Bitcoin 1 Minute
Ecco gli ultimi aggiornamenti dai mercati delle attività digitali: NVIDIA ha lanciato Cosmos 3 Edge, un modello open world da 4 miliardi di parametri progettato per portare l’intelligenza artificiale avanzata direttamente sui dispositivi edge, rivoluzionando le capacità di robotica e visione AI in tempo reale senza dipendere dal cloud. Punti chiave Cosmos 3 Edge è un modello open world da 4 miliardi di parametri per robotica e visione AI su dispositivi edge Supporta inferenza ad alta efficienza su hardware NVIDIA Jetson, RTX PRO GPUs e DGX Raggiunge il controllo robotico in tempo reale a 15 Hz con 32 azioni per inferenza Si classifica al primo posto su VANTAGE-Bench per l’analisi visiva Include una policy specializzata per attività robotiche di pick-and-place Caratteristiche principali del modello open world Cosmos 3 Edge rappresenta un significativo passo avanti nell’integrazione tra intelligenza artificiale e robotica su dispositivi edge. Il modello, disponibile attraverso il repository Cosmos 3 di Hugging Face, offre prestazioni paragonabili a quelle dei data center su sistemi con memoria limitata.
La compatibilità hardware include tutta la gamma di dispositivi edge NVIDIA, dai moduli Jetson appena annunciati T2000 e T3000 fino alle GPU RTX PRO, DGX e GeForce RTX. Questa versatilità consente di implementare il modello in contesti operativi reali come fabbriche, magazzini e ambienti sanitari. Prestazioni e compatibilità hardware Le prestazioni di Cosmos 3 Edge sono particolarmente impressionanti sul modulo NVIDIA Jetson Thor, dove raggiunge il controllo robotico in tempo reale a 15 Hz generando 32 azioni per ogni inferenza.
Dinamiche di mercato
Questa capacità di elaborazione consente ai robot di comprendere l’ambiente circostante, ragionare in tempo reale e generare azioni direttamente sui dispositivi edge. Architettura innovativa per ragionamento e azioni L’architettura di Cosmos 3 Edge combina due torri transformer distinte ma complementari: una torre autoregressiva per l’elaborazione di token visivi e testuali per la comprensione e il ragionamento, e una torre diffusion per la gestione di token visivi, audio e azioni per la previsione e la generazione. Le due torri mantengono layer di normalizzazione separati ma condividono layer di attenzione multimodale, allineando le informazioni tra linguaggio, video, audio e azioni.
Questo design permette al modello di ragionare su una scena prima di generare un output, adattando il pattern di attenzione al tipo di informazione elaborata. Rappresentazione geometrica condivisa per azioni fisiche Uno degli aspetti più innovativi di Cosmos 3 Edge è la sua capacità di mappare diverse embodiment fisiche in una rappresentazione d’azione comune. Le azioni vengono codificate come vettori geometrici compatti che catturano movimento, relazioni spaziali e input di controllo, creando una connessione diretta tra controllo e struttura visiva del mondo.
Applicazioni ed estensioni in robotica Oltre al modello base, NVIDIA ha rilasciato Cosmos 3 Edge Policy (DROID), una policy di manipolazione robotica post-addestrata sul dataset DROID specificamente per attività di pick-and-place. Questo componente specializzato include script di post-addestramento che permettono agli sviluppatori di adattare il modello ai loro carichi di lavoro specifici. Gli sviluppatori possono utilizzare cluster di H100 o stazioni NVIDIA DGX per effettuare fine-tuning efficiente di Cosmos 3 Edge prima della distribuzione sulle piattaforme edge NVIDIA.
Impatto sui mercati
Questo approccio modulare consente una personalizzazione approfondita per applicazioni specifiche senza compromettere le prestazioni. Risorse per sviluppatori e personalizzazione NVIDIA fornisce checkpoint post-addestrati di riferimento e ricette di training per aiutare gli sviluppatori ad adattare e ottimizzare Cosmos 3 per le proprie applicazioni. Questi strumenti includono il checkpoint Cosmos 3 Super 4-Step Distillation, che riduce i passaggi di denoising da 35-50 a soli 4, offrendo inferenze fino a 25 volte più veloci preservando la qualità dell’immagine e del video.
Leadership nei benchmark e sviluppi futuri Tra i modelli di dimensioni simili (4 miliardi di parametri), Cosmos 3 Edge si classifica al primo posto su VANTAGE-Bench per l’analisi visiva e rappresenta lo stato dell’arte per l’apprendimento delle policy robotiche. Questa leadership nei benchmark dimostra l’efficacia del modello nel settore dell’infrastruttura intelligente e della robotica. NVIDIA continua ad avanzare lo sviluppo di Cosmos 3 per il Physical AI, con miglioramenti previsti nella generazione interattiva di mondi, nella simulazione di scenari di guida e nelle policy robotiche.
L’azienda sta anche investendo in inferenza più veloce e post-addestramento più efficiente su una gamma più ampia di hardware. Miglioramenti previsti e ottimizzazioni Il roadmap di sviluppo include l’ottimizzazione dei checkpoint di Cosmos 3 con framework open di inferenza e ottimizzazione come vLLM, con ulteriori ottimizzazioni e tooling per sviluppatori in arrivo. Questi miglioramenti ridurranno ulteriormente il tempo e la potenza di calcolo necessari per costruire modelli downstream.
I mercati delle criptovalute seguono da vicino questo sviluppo, mentre gli investitori valutano il potenziale impatto sui prezzi.



