NVIDIA ha lanciato Cosmos 3, un open world foundation model per physical AI basato su un’architettura mixture-of-transformers. Il modello combina vision reasoning, world generation e action prediction in un unico sistema, con l’obiettivo di supportare robot, veicoli autonomi e sistemi di visione AI che devono operare nel mondo fisico.
Cosmos 3 è un omnimodel completamente aperto, capace di comprendere e generare nativamente testo, immagini, video, suono ambientale e azioni con accuratezza fisica. NVIDIA indica una riduzione dei cicli di addestramento e valutazione del physical AI da mesi a giorni, partendo da un’architettura pensata per integrare ragionamento, generazione e previsione delle azioni.
Architettura mixture-of-transformers per mondi fisici
Cosmos 3 affronta un problema tecnico del physical AI: permettere a robot, veicoli autonomi e agent di visione di generalizzare nel mondo reale partendo da dati di addestramento limitati e da stack di simulazione frammentati. La risposta di NVIDIA passa da un’architettura mixture-of-transformers che abbina un transformer di ragionamento a un expert generation transformer.
Questa impostazione consente al modello di interpretare interazioni tra oggetti, movimento e relazioni spazio-temporali prima di generare video e traiettorie di azione. In pratica, Cosmos 3 unisce in un unico sistema la lettura del contesto fisico, la generazione di stati futuri e la previsione delle azioni, invece di separare queste funzioni in componenti distinte.
Jensen Huang, fondatore e CEO di NVIDIA, collega Cosmos 3 ai progressi in multimodal reasoning language, visione e world models, richiamando l’obiettivo di fornire agli sviluppatori strumenti per costruire robot, veicoli autonomi e sistemi di visione AI capaci di percepire, ragionare, pianificare e agire nel mondo fisico.
Le tre modalità operative di Cosmos 3
Gli sviluppatori possono usare Cosmos 3 in tre modalità principali. La prima è quella di vision language model, dove il sistema comprende e ragiona attraverso più modalità, integrando testo, immagini, video, suono ambientale e azioni.
La seconda modalità è quella di world model o video foundation model. In questo caso Cosmos 3 simula ambienti fisici e prevede stati futuri del mondo, supportando attività di addestramento e valutazione. La terza modalità riguarda l’uso come backbone per world action models, cioè modelli che aiutano ad addestrare robot nello svolgimento di compiti specifici.
- Vision language model: comprensione e ragionamento tra modalità diverse.
- World model o video foundation model: simulazione di ambienti fisici e previsione di stati futuri del mondo.
- Backbone per world action models: supporto all’addestramento di robot per compiti specifici.
Cosmos Coalition e sviluppo aperto di world model
Con Cosmos 3, NVIDIA ha lanciato anche la NVIDIA Cosmos Coalition, una collaborazione globale tra sviluppatori di world model, sviluppatori AI e leader del physical AI. L’obiettivo della coalizione è far avanzare i world model aperti nei diversi settori, mantenendo il modello di sviluppo su una base collaborativa tra costruttori di modelli, sviluppatori e attori del physical AI.
I membri fondatori della coalizione includono Agile Robots, Black Forest Labs, Generalist, LTX, Runway e Skild AI. La presenza di questi nomi definisce un perimetro operativo orientato allo sviluppo aperto di modelli capaci di rappresentare ambienti fisici, generare scenari e supportare attività di addestramento e valutazione.
Dataset e skill per lo stack physical AI di NVIDIA
La piattaforma Cosmos alimenta lo stack di physical AI di NVIDIA e mira ad accelerare i workflow di addestramento e valutazione in diversi settori. Oltre ai modelli, la piattaforma include nuovi dataset dedicati a robotica, fisica, movimento umano, guida autonoma, sicurezza in magazzino e ragionamento spaziale.
Sono presenti anche nuove skill per agent di physical AI, tra cui ricostruzione neurale di scene, generazione di immagini di difetti e video augmentation. Queste funzioni ampliano l’uso della piattaforma nella preparazione di dati e scenari destinati ad addestramento, valutazione e generazione di contenuti sintetici.
Disponibilità e strumenti per gli sviluppatori
Cosmos 3 Super e Cosmos 3 Nano sono disponibili ora. Cosmos 3 Edge arriverà a breve ed è destinato all’inferenza in tempo reale. La disponibilità differenziata consente agli sviluppatori di accedere subito ai modelli Super e Nano, lasciando a Edge il ruolo di modello per esecuzione real-time quando sarà rilasciato.
Gli sviluppatori possono provare Cosmos 3 su build.nvidia.com, scaricare modelli aperti da Hugging Face, personalizzare i modelli e generare dati sintetici con Diffusers di Hugging Face e risorse su GitHub. I modelli possono essere distribuiti come microservizi NVIDIA NIM.
Per gli sviluppatori, il percorso operativo parte dalla prova su build.nvidia.com, passa per il download dei modelli aperti e la personalizzazione tramite Hugging Face Diffusers e GitHub, e arriva alla distribuzione tramite microservizi NVIDIA NIM. Cosmos 3 Super e Cosmos 3 Nano sono già accessibili, mentre Cosmos 3 Edge è previsto per l’inferenza in tempo reale.
Partecipa al forum per Progettisti!
La tua esperienza è fondamentale per la comunità. Unisciti a noi e contribuisci con le tue conoscenze!
Entra ora nel ForumCondividi, impara e cresci con i migliori professionisti del settore.