Home IT - Hardware - AI NVIDIA lancia Cosmos 3, il modello foundation dedicato all’AI fisica.

NVIDIA lancia Cosmos 3, il modello foundation dedicato all’AI fisica.

NVIDIA ha lanciato Cosmos 3, un open world foundation model per physical AI basato su un’architettura mixture-of-transformers. Il modello combina vision reasoning, world generation e action prediction in un unico sistema, con l’obiettivo di supportare robot, veicoli autonomi e sistemi di visione AI che devono operare nel mondo fisico.

Cosmos 3 è un omnimodel completamente aperto, capace di comprendere e generare nativamente testo, immagini, video, suono ambientale e azioni con accuratezza fisica. NVIDIA indica una riduzione dei cicli di addestramento e valutazione del physical AI da mesi a giorni, partendo da un’architettura pensata per integrare ragionamento, generazione e previsione delle azioni.

Architettura mixture-of-transformers per mondi fisici

Cosmos 3 affronta un problema tecnico del physical AI: permettere a robot, veicoli autonomi e agent di visione di generalizzare nel mondo reale partendo da dati di addestramento limitati e da stack di simulazione frammentati. La risposta di NVIDIA passa da un’architettura mixture-of-transformers che abbina un transformer di ragionamento a un expert generation transformer.

Questa impostazione consente al modello di interpretare interazioni tra oggetti, movimento e relazioni spazio-temporali prima di generare video e traiettorie di azione. In pratica, Cosmos 3 unisce in un unico sistema la lettura del contesto fisico, la generazione di stati futuri e la previsione delle azioni, invece di separare queste funzioni in componenti distinte.

Jensen Huang, fondatore e CEO di NVIDIA, collega Cosmos 3 ai progressi in multimodal reasoning language, visione e world models, richiamando l’obiettivo di fornire agli sviluppatori strumenti per costruire robot, veicoli autonomi e sistemi di visione AI capaci di percepire, ragionare, pianificare e agire nel mondo fisico.

Le tre modalità operative di Cosmos 3

Gli sviluppatori possono usare Cosmos 3 in tre modalità principali. La prima è quella di vision language model, dove il sistema comprende e ragiona attraverso più modalità, integrando testo, immagini, video, suono ambientale e azioni.

La seconda modalità è quella di world model o video foundation model. In questo caso Cosmos 3 simula ambienti fisici e prevede stati futuri del mondo, supportando attività di addestramento e valutazione. La terza modalità riguarda l’uso come backbone per world action models, cioè modelli che aiutano ad addestrare robot nello svolgimento di compiti specifici.

  • Vision language model: comprensione e ragionamento tra modalità diverse.
  • World model o video foundation model: simulazione di ambienti fisici e previsione di stati futuri del mondo.
  • Backbone per world action models: supporto all’addestramento di robot per compiti specifici.

Cosmos Coalition e sviluppo aperto di world model

Con Cosmos 3, NVIDIA ha lanciato anche la NVIDIA Cosmos Coalition, una collaborazione globale tra sviluppatori di world model, sviluppatori AI e leader del physical AI. L’obiettivo della coalizione è far avanzare i world model aperti nei diversi settori, mantenendo il modello di sviluppo su una base collaborativa tra costruttori di modelli, sviluppatori e attori del physical AI.

I membri fondatori della coalizione includono Agile Robots, Black Forest Labs, Generalist, LTX, Runway e Skild AI. La presenza di questi nomi definisce un perimetro operativo orientato allo sviluppo aperto di modelli capaci di rappresentare ambienti fisici, generare scenari e supportare attività di addestramento e valutazione.

Dataset e skill per lo stack physical AI di NVIDIA

La piattaforma Cosmos alimenta lo stack di physical AI di NVIDIA e mira ad accelerare i workflow di addestramento e valutazione in diversi settori. Oltre ai modelli, la piattaforma include nuovi dataset dedicati a robotica, fisica, movimento umano, guida autonoma, sicurezza in magazzino e ragionamento spaziale.

Sono presenti anche nuove skill per agent di physical AI, tra cui ricostruzione neurale di scene, generazione di immagini di difetti e video augmentation. Queste funzioni ampliano l’uso della piattaforma nella preparazione di dati e scenari destinati ad addestramento, valutazione e generazione di contenuti sintetici.

Disponibilità e strumenti per gli sviluppatori

Cosmos 3 Super e Cosmos 3 Nano sono disponibili ora. Cosmos 3 Edge arriverà a breve ed è destinato all’inferenza in tempo reale. La disponibilità differenziata consente agli sviluppatori di accedere subito ai modelli Super e Nano, lasciando a Edge il ruolo di modello per esecuzione real-time quando sarà rilasciato.

Gli sviluppatori possono provare Cosmos 3 su build.nvidia.com, scaricare modelli aperti da Hugging Face, personalizzare i modelli e generare dati sintetici con Diffusers di Hugging Face e risorse su GitHub. I modelli possono essere distribuiti come microservizi NVIDIA NIM.

Per gli sviluppatori, il percorso operativo parte dalla prova su build.nvidia.com, passa per il download dei modelli aperti e la personalizzazione tramite Hugging Face Diffusers e GitHub, e arriva alla distribuzione tramite microservizi NVIDIA NIM. Cosmos 3 Super e Cosmos 3 Nano sono già accessibili, mentre Cosmos 3 Edge è previsto per l’inferenza in tempo reale.


Partecipa al forum per Progettisti!

La tua esperienza è fondamentale per la comunità. Unisciti a noi e contribuisci con le tue conoscenze!

Entra ora nel Forum

Condividi, impara e cresci con i migliori professionisti del settore.