AccueilAINVIDIA Cosmos 3 Edge fait fonctionner des robots à 15 Hz sans...

NVIDIA Cosmos 3 Edge fait fonctionner des robots à 15 Hz sans cloud

NVIDIA a lancé Cosmos 3 Edge, un modèle de monde ouvert de 4 milliards de paramètres conçu pour apporter des capacités de raisonnement IA de niveau data center directement aux robots et aux appareils edge opérant dans des usines, des entrepôts, des hôpitaux et au-delà. Le modèle, désormais disponible sur Hugging Face, est conçu pour aider les robots et les agents de vision IA à comprendre leur environnement, raisonner en temps réel et générer des actions physiques — le tout sans avoir besoin de renvoyer les calculs vers le cloud.

Points clés à retenir

  • Cosmos 3 Edge est un modèle de monde ouvert de 4 milliards de paramètres pour la robotique et la vision IA sur appareils edge, publié par NVIDIA sur Hugging Face.
  • Il offre un contrôle robotique en temps réel à 15 Hz, en générant 32 actions par inférence sur NVIDIA Jetson Thor.
  • Le modèle combine deux tours de transformeur — autoregressive et diffusion — partageant des couches d’attention multimodale pour un raisonnement et une génération d’actions unifiés.
  • Il se classe n°1 sur VANTAGE-Bench pour l’analytique de vision parmi les modèles de 4 milliards de paramètres et est en tête pour l’apprentissage de politiques robotiques.
  • Un modèle de politique dédié, Cosmos 3 Edge Policy (DROID), est disponible pour les tâches de préhension et de dépose (pick-and-place), avec un affinage pris en charge sur H100 ou des clusters NVIDIA DGX.

NVIDIA lance Cosmos 3 Edge pour la robotique et la vision IA à la périphérie (edge)

Le défi central pour les machines déployées en edge a toujours été le même : mémoire limitée, puissance de calcul restreinte, mais des exigences du monde réel qui, elles, ne ralentissent pas. Cosmos 3 Edge est la réponse de NVIDIA à cet écart. Selon Pranjali Joshi, évangéliste développeurs chez NVIDIA, le modèle est optimisé pour une inférence à haut débit et économe en mémoire sur une large gamme de matériels edge NVIDIA — y compris les nouveaux modules NVIDIA Jetson T2000 et T3000, NVIDIA Jetson Thor, les GPU NVIDIA RTX PRO, NVIDIA DGX et les GPU NVIDIA GeForce RTX.

Cette large compatibilité matérielle est importante. La plupart des déploiements d’IA en edge sont limités non pas par l’ambition, mais par ce que le matériel local peut réellement exécuter. Un modèle qui s’étend de modules Jetson compacts à des systèmes DGX complets offre aux développeurs un cadre unique pour travailler sur un large spectre de déploiements.

Des chiffres de performance en temps réel qui comptent

Les chiffres de performance cités par NVIDIA sont remarquables. Sur NVIDIA Jetson Thor, Cosmos 3 Edge génère 32 actions par inférence tout en maintenant un contrôle robotique en temps réel à 15 Hz. Pour les applications robotiques, où la différence entre un mouvement fluide et un échec saccadé tient souvent à la latence d’inférence, atteindre 15 Hz sur un module edge est un seuil significatif. Parmi les modèles de 4 milliards de paramètres, il se classe premier sur VANTAGE-Bench pour l’analytique de vision et revendique des performances de pointe pour l’apprentissage de politiques robotiques.

Architecture de modèle innovante : deux tours de transformeur, une représentation partagée

Ce qui distingue Cosmos 3 Edge d’un modèle vision-langage standard, c’est son architecture à double tour de transformeur. Le modèle combine une tour autoregressive et une tour de diffusion, chacune gérant différentes modalités mais partageant des couches d’attention multimodale qui alignent les informations entre le langage, la vidéo, l’audio et les données d’action.

La tour autoregressive traite les jetons de vision et de texte pour la compréhension et le raisonnement. La tour de diffusion gère les jetons de vision, d’audio et d’action pour la prédiction, la génération et ce que NVIDIA appelle la simulation neuronale. Les deux tours conservent des couches de normalisation et des perceptrons multicouches distincts, mais les couches d’attention partagées sont le lieu de l’intégration — forçant le modèle à construire une image cohérente unique d’une scène avant de décider quoi faire ensuite.

Représentation vectorielle géométrique partagée pour les actions physiques

L’une des caractéristiques techniques les plus distinctives est la manière dont le modèle gère les actions physiques à travers différentes incarnations robotiques. Un bras robotique se déplace différemment d’un véhicule à roues ou d’une plateforme de caméra, et la plupart des modèles traitent ces cas comme des problèmes séparés. Cosmos 3 Edge les projette tous dans une représentation vectorielle géométrique compacte partagée — encodant les actions de manière à capturer les relations spatiales et les commandes de contrôle de façon cohérente entre les différents types d’incarnation.

Cette conception crée un lien direct entre les changements visuels au niveau des pixels et le mouvement physique. La vidéo générée cesse d’être une simple prédiction visuelle et devient une représentation de la façon dont le monde est censé changer en réponse à une action spécifique. Pour les développeurs qui construisent des pipelines d’entraînement, cela signifie des données synthétiques ancrées dans le mouvement, la causalité et le contrôle — et pas seulement dans l’apparence visuelle.

Applications et extensions : modèles de politique et outils pour développeurs

Au-delà du modèle de base, NVIDIA publie Cosmos 3 Edge Policy (DROID) — une politique de manipulation robotique post-entraînée sur le jeu de données DROID, ciblant les tâches de pick-and-place. Il est livré avec des scripts de post-entraînement, offrant aux développeurs un point de départ concret pour adapter le modèle à leurs propres flux de travail de manipulation.

Post-entraînement, personnalisation et ressources pour développeurs

Les développeurs qui souhaitent aller plus loin peuvent affiner Cosmos 3 Edge sur un petit cluster de GPU H100 ou une station NVIDIA DGX. NVIDIA publie également des points de contrôle de post-entraînement de référence et des recettes d’entraînement aux côtés des poids du modèle de base, y compris un point de contrôle Cosmos 3 Super 4-Step Distillation qui réduit l’inférence par diffusion de 35–50 étapes de débruitage à seulement 4, offrant jusqu’à 25× plus de rapidité d’inférence pour les tâches de génération d’images et de vidéos sans sacrifier la fidélité des résultats.

La stratégie d’écosystème plus large mérite d’être soulignée. En publiant ensemble des poids ouverts, des scripts d’entraînement et des points de contrôle de référence, NVIDIA positionne Cosmos 3 Edge non pas seulement comme un modèle autonome, mais comme une base pour des modèles de monde adaptés à des domaines spécifiques. Les développeurs peuvent le post-entraîner avec des données spécialisées, le distiller pour la vitesse ou le déployer tel quel — le tout au sein du même cadre ouvert disponible sur Hugging Face.

Leadership sur les benchmarks et perspectives

Le classement de NVIDIA sur VANTAGE-Bench place Cosmos 3 Edge en tête de sa catégorie de poids pour l’analytique de vision, et la revendication en matière d’apprentissage de politiques robotiques ajoute un poids concurrentiel dans un espace où la plupart des modèles edge privilégient soit la compréhension visuelle, soit le contrôle — rarement les deux simultanément.

Pour la suite, NVIDIA a présenté des plans pour faire progresser Cosmos 3 vers ce qu’elle appelle l’IA physique (Physical AI), avec des améliorations à venir couvrant la génération de mondes interactifs, la simulation de scénarios de conduite et des politiques robotiques plus larges. La feuille de route inclut également l’optimisation des points de contrôle Cosmos 3 avec des cadres d’inférence ouverts, notamment vLLM, un post-entraînement plus rapide sur une gamme plus large de matériels et des outils supplémentaires pour développeurs.

Cette orientation signale quelque chose de plus large qu’une simple sortie de modèle. À mesure que le matériel edge devient plus performant et que les déploiements robotiques se multiplient dans les environnements industriels, la demande pour des modèles de monde compacts et déployables ne fera que s’intensifier. Un modèle qui raisonne sur la cause et l’effet, simule les conséquences physiques et génère des actions de contrôle — le tout en edge, à 15 Hz — commence à ressembler moins à une étape de recherche et davantage à une infrastructure de production.

FAQ

Qu’est-ce que NVIDIA Cosmos 3 Edge ?

Cosmos 3 Edge est un modèle de monde ouvert de 4 milliards de paramètres publié par NVIDIA qui permet aux robots et aux agents de vision IA de comprendre leur environnement, de raisonner et de générer des actions physiques en temps réel sur des appareils edge.

Quel matériel Cosmos 3 Edge prend-il en charge pour l’inférence ?

Le modèle prend en charge une inférence à haut débit et économe en mémoire sur une large gamme de matériels edge NVIDIA, y compris les modules NVIDIA Jetson T2000, T3000 et Thor, les GPU NVIDIA RTX PRO, NVIDIA DGX et les GPU NVIDIA GeForce RTX.

Comment Cosmos 3 Edge parvient-il à un contrôle robotique en temps réel ?

Sur NVIDIA Jetson Thor, le modèle génère 32 actions par inférence et maintient un contrôle robotique à 15 Hz, permettant un raisonnement et un contrôle physique en temps réel sans dépendre du calcul dans le cloud.

Les développeurs peuvent-ils personnaliser Cosmos 3 Edge pour leurs propres cas d’usage ?

Oui. Les développeurs peuvent affiner le modèle à l’aide d’un petit cluster de GPU H100 ou d’une station NVIDIA DGX, et NVIDIA fournit des points de contrôle de post-entraînement de référence ainsi que des recettes d’entraînement pour aider à adapter le modèle à des charges de travail personnalisées et à des applications spécialisées.

{« @context »: »https://schema.org », »@type »: »FAQPage », »mainEntity »:[{« @type »: »Question », »name »: »Qu’est-ce que NVIDIA Cosmos 3 Edge ? », »acceptedAnswer »:{« @type »: »Answer », »text »: »Cosmos 3 Edge est un modèle de monde ouvert de 4 milliards de paramètres publié par NVIDIA qui permet aux robots et aux agents de vision IA de comprendre leur environnement, de raisonner et de générer des actions physiques en temps réel sur des appareils edge. »}},{« @type »: »Question », »name »: »Quel matériel Cosmos 3 Edge prend-il en charge pour l’inférence ? », »acceptedAnswer »:{« @type »: »Answer », »text »: »Le modèle prend en charge une inférence à haut débit et économe en mémoire sur une large gamme de matériels edge NVIDIA, y compris les modules NVIDIA Jetson T2000, T3000 et Thor, les GPU NVIDIA RTX PRO, NVIDIA DGX et les GPU NVIDIA GeForce RTX. »}},{« @type »: »Question », »name »: »Comment Cosmos 3 Edge parvient-il à un contrôle robotique en temps réel ? », »acceptedAnswer »:{« @type »: »Answer », »text »: »Sur NVIDIA Jetson Thor, le modèle génère 32 actions par inférence et maintient un contrôle robotique à 15 Hz, permettant un raisonnement et un contrôle physique en temps réel sans dépendre du calcul dans le cloud. »}},{« @type »: »Question », »name »: »Les développeurs peuvent-ils personnaliser Cosmos 3 Edge pour leurs propres cas d’usage ? », »acceptedAnswer »:{« @type »: »Answer », »text »: »Oui. Les développeurs peuvent affiner le modèle à l’aide d’un petit cluster de GPU H100 ou d’une station NVIDIA DGX, et NVIDIA fournit des points de contrôle de post-entraînement de référence ainsi que des recettes d’entraînement pour aider à adapter le modèle à des charges de travail personnalisées et à des applications spécialisées. »}}]}

Article produit avec l’assistance de l’intelligence artificielle et relu par l’équipe éditoriale.

RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST