AccueilAILes modèles d’IA agentique de NVIDIA atteignent une vitesse 4x avec Nemotron...

Les modèles d’IA agentique de NVIDIA atteignent une vitesse 4x avec Nemotron 3.5 Lightning

NVIDIA va plus loin dans les modèles d’IA agentique avec le lancement de Nemotron 3.5 Lightning, un nouveau modèle ouvert conçu spécifiquement pour le type de tâches permanentes et à haut volume que les agents d’IA autonomes gèrent désormais 24h/24. Parallèlement, l’entreprise a publié NeMo Switchyard, un outil de routage open source conçu pour envoyer chaque requête d’IA vers le modèle capable de la traiter le plus rapidement et au moindre coût. Ensemble, ces deux sorties marquent la dernière tentative de NVIDIA pour rendre les systèmes d’IA agentique non seulement plus intelligents, mais réellement efficaces à exploiter à grande échelle.

Points clés à retenir

  • NVIDIA a publié Nemotron 3.5 Lightning, un modèle ouvert à 30 milliards de paramètres de type mixture-of-experts, conçu pour des charges de travail d’IA agentique à haut volume.
  • Le modèle offre une vitesse de génération jusqu’à 4x plus rapide et une exécution des tâches 30 % plus rapide que les modèles comparables de sa catégorie.
  • NVIDIA a également lancé NeMo Switchyard, une bibliothèque de routage open source qui peut réduire le coût d’exécution des tâches à près d’un tiers de celui de l’utilisation d’un seul modèle de pointe.
  • Nemotron 3.5 Lightning s’exécute localement sur les PC NVIDIA RTX, DGX Spark, DGX Station et Jetson, ou se met à l’échelle vers les centres de données et le cloud.
  • Les deux sorties sont ouvertes, personnalisables et déjà soutenues par des partenaires de l’écosystème, dont CrowdStrike, Harvey, CodeRabbit et Lila Sciences.

NVIDIA lance Nemotron 3.5 Lightning pour les charges de travail d’IA agentique

Nemotron 3.5 Lightning est le tout dernier ajout à la famille Nemotron 3 de NVIDIA, et l’entreprise le décrit comme le modèle le plus efficace de sa catégorie pour les tâches agentiques de longue durée. Il arrive après Nemotron 3 Nano et prolonge un schéma que NVIDIA a suivi avec chaque version de Nemotron : privilégier les poids ouverts, la personnalisation et la vitesse brute plutôt que la taille brute.

Un modèle de 30 milliards de paramètres conçu pour la vitesse

Nemotron 3.5 Lightning est un modèle mixture-of-experts de 30 milliards de paramètres, ce qui signifie qu’il n’active que les parties de son réseau nécessaires pour une tâche donnée, plutôt que de faire tourner l’intégralité du modèle à chaque fois. Ce choix de conception se reflète directement dans les performances : NVIDIA indique que le modèle offre jusqu’à 4x plus de vitesse de sortie, ce qui se traduit par une exécution des tâches agentiques 30 % plus rapide par rapport aux autres modèles de sa catégorie de taille. Selon le benchmarking interne PinchBench cité par NVIDIA, ces gains de vitesse sont obtenus sans sacrifier la précision par rapport aux modèles concurrents.

Le modèle est conçu pour un rôle spécifique au sein de systèmes multi-agents plus vastes. Plutôt que d’essayer de planifier à lui seul l’ensemble d’un flux de travail, Nemotron 3.5 Lightning est destiné à gérer des tâches étroites, répétitives et à haut volume — le type de travail qui s’accumule rapidement lorsqu’un agent d’IA fonctionne en continu plutôt que de répondre à des invites occasionnelles.

Personnalisation et post-entraînement pour une précision spécifique à un domaine

Parce que Nemotron 3.5 Lightning est ouvert, les organisations peuvent le post-entraîner avec NVIDIA NeMo sur leurs propres données de domaine, outils internes et flux de travail. Cette personnalisation de modèle d’IA ouvert est au cœur de la manière dont NVIDIA positionne cette sortie : au lieu d’un modèle universel, les entreprises disposent d’une base qui peut être façonnée pour un travail spécifique, qu’il s’agisse d’analyser des contrats juridiques ou de signaler des alertes de sécurité.

Plusieurs entreprises l’ont déjà fait. CrowdStrike personnalise le modèle pour des charges de travail de cybersécurité, Harvey travaille avec Trajectory sur des applications de services juridiques, et CodeRabbit l’a associé à Baseten pour la revue de code automatisée. Lila Sciences l’utilise pour améliorer le raisonnement sur des tâches en sciences physiques et de la vie, tandis que Fastino Labs rapporte une précision de premier plan après avoir ajusté le modèle pour des charges de travail en développement logiciel, finance et santé. NVIDIA indique que le modèle a été développé avec la contribution de la Nemotron Coalition, dont les membres ont apporté des méthodologies d’évaluation, des logiciels d’inférence et des jeux de données qui ont contribué à façonner la version finale.

NeMo Switchyard apporte un routage intelligent aux agents d’IA

NeMo Switchyard résout un problème qui s’aggrave à mesure que les systèmes agentiques se développent : s’appuyer sur un modèle par défaut unique gaspille de l’argent pour des tâches qui ne nécessitent pas de raisonnement lourd, ou nuit à la qualité lorsqu’un modèle léger se voit confier trop de travail. La réponse de NVIDIA est une bibliothèque open source qui décide automatiquement, requête par requête, quel modèle doit traiter la tâche.

Réduction des coûts grâce à la sélection dynamique de modèles

NeMo Switchyard achemine chaque étape du flux de travail d’un agent vers le modèle le plus capable et le plus rentable pour cette tâche spécifique, sans obliger les développeurs à réécrire leurs applications. Les développeurs peuvent ajuster ou remplacer l’algorithme de routage en fonction de ce qui compte le plus pour eux — latence, qualité ou coût. Les benchmarks internes de NVIDIA montrent que cette approche de routage NeMo Switchyard maintient une précision proche de celle des modèles de pointe tout en réduisant le coût d’exécution des tâches à près d’un tiers de ce qu’il en coûterait pour tout faire tourner uniquement sur Opus 4.8.

Cet écart est important. Dans les systèmes où les agents fonctionnent en continu, la différence entre un routage intelligent et le recours par défaut à un seul modèle se cumule rapidement sur des milliers de tâches quotidiennes — transformant ce qui semble être un gain d’efficacité modeste en une réduction significative des coûts d’exploitation au fil du temps.

Intégration dans l’ensemble de l’écosystème IA

NVIDIA travaille déjà avec un large éventail de partenaires pour intégrer ce type de routage directement dans les outils que les développeurs utilisent au quotidien. Les premiers résultats de ce travail d’écosystème illustrent à quel point le routage peut modifier les coûts et les performances :

  • Boomi a atteint 100 % de précision de routage par domaine tout en envoyant 59 % du trafic vers un modèle affiné 5x plus rapide, réduisant la latence des tours ultérieurs de 21 %.
  • Cognition a intégré un routeur en plusieurs étapes dans Devin Desktop, réduisant le coût moyen de 28 % par rapport au routage de tout vers un seul modèle de pointe.
  • LangChain a réduit les coûts de 74 % sur 145 tâches multi-tours Deep Agents en n’envoyant que 7 % des appels vers un modèle de pointe, avec un compromis de précision de 6 %.
  • Ramp a égalé les performances d’un modèle de pointe tout en réduisant les coûts de 58 % et le temps d’exécution de 33 % dans ses tests SWE-Bench.
  • Classmethod a signalé une réduction des coûts de 27 % tout en maintenant la qualité sur ses charges de travail opencode et Fireworks.

Kong, LiteLLM, Nous Research, Cadence et Siemens intègrent également ou évaluent NeMo Switchyard au sein de leurs propres plateformes, des passerelles d’IA à la vérification formelle de puces et aux agents d’ingénierie.

Flexibilité de déploiement sur le matériel NVIDIA

L’un des principaux arguments de cette sortie est l’endroit où Nemotron 3.5 Lightning peut réellement s’exécuter. Il prend en charge le déploiement local et cloud sur les PC NVIDIA RTX, DGX Spark, DGX Station et les appareils Jetson, permettant aux organisations d’utiliser le matériel qu’elles possèdent déjà plutôt que de tout déplacer vers le cloud. À partir de là, il se met à l’échelle vers les stations de travail RTX PRO, les appareils en périphérie, les centres de données et les environnements cloud complets pour des déploiements d’entreprise plus importants.

Cette flexibilité donne aux organisations un véritable contrôle sur la confidentialité et la latence. Exécuter le modèle localement ou sur site convient aux tâches spécialisées à haut volume qui nécessitent des réponses rapides et un contrôle plus strict des données, tandis que le déploiement dans le cloud reste disponible pour les charges de travail qui doivent se mettre à l’échelle à la demande.

Données ouvertes et disponibilité de la plateforme

Comme pour chaque sortie Nemotron, NVIDIA indique qu’elle publie autant de données d’entraînement et de techniques que les licences le permettent, offrant aux chercheurs externes un moyen de retracer, d’auditer et même d’entraîner d’autres modèles sur le même matériel. Parallèlement à Lightning, NVIDIA publie Nemotron-RL-Agentic-Terminal-Pivot, un jeu de données de renforcement agentique utilisé pour post-entraîner le modèle pour des tâches d’agents de codage.

Nemotron 3.5 Lightning est disponible dès maintenant sur Hugging Face, ModelScope et OpenRouter, ainsi que sur build.nvidia.com en tant que microservice NVIDIA NIM, avec un accès plus large à venir via les partenaires cloud NVIDIA, les plateformes de post-entraînement et d’autres fournisseurs de services cloud. NeMo Switchyard est disponible dès aujourd’hui sur GitHub, avec une prise en charge de davantage de plateformes partenaires attendue prochainement.

FAQ

Qu’est-ce que Nemotron 3.5 Lightning et qu’est-ce qui le différencie ?

Nemotron 3.5 Lightning est un modèle d’IA ouvert de 30 milliards de paramètres, optimisé pour les tâches d’IA agentique à haut volume, offrant jusqu’à 4x plus de vitesse de sortie et 30 % d’exécution des tâches plus rapide que les modèles comparables.

Comment NeMo Switchyard améliore-t-il l’efficacité de l’IA ?

NeMo Switchyard est une bibliothèque de routage open source qui dirige dynamiquement les requêtes d’IA vers le modèle le plus adapté, réduisant les coûts d’exécution des tâches à environ un tiers par rapport à l’utilisation d’un seul modèle.

Nemotron 3.5 Lightning peut-il être personnalisé pour des besoins organisationnels spécifiques ?

Oui. Nemotron 3.5 Lightning peut être post-entraîné sur les propres données d’une organisation à l’aide de NVIDIA NeMo afin d’améliorer la précision pour des tâches spécialisées et spécifiques à un domaine.

Sur quelles plateformes Nemotron 3.5 Lightning est-il disponible pour le déploiement ?

Nemotron 3.5 Lightning prend en charge le déploiement local et cloud sur les PC NVIDIA RTX, les systèmes DGX, Jetson et les appareils en périphérie, et il est disponible sur des plateformes telles que Hugging Face, ModelScope, OpenRouter et les partenaires cloud NVIDIA.

{« @context »: »https://schema.org », »@type »: »FAQPage », »mainEntity »:[{« @type »: »Question », »name »: »Qu’est-ce que Nemotron 3.5 Lightning et qu’est-ce qui le différencie ? », »acceptedAnswer »:{« @type »: »Answer », »text »: »Nemotron 3.5 Lightning est un modèle d’IA ouvert de 30 milliards de paramètres, optimisé pour les tâches d’IA agentique à haut volume, offrant jusqu’à 4x plus de vitesse de sortie et 30 % d’exécution des tâches plus rapide que les modèles comparables. »}},{« @type »: »Question », »name »: »Comment NeMo Switchyard améliore-t-il l’efficacité de l’IA ? », »acceptedAnswer »:{« @type »: »Answer », »text »: »NeMo Switchyard est une bibliothèque de routage open source qui dirige dynamiquement les requêtes d’IA vers le modèle le plus adapté, réduisant les coûts d’exécution des tâches à environ un tiers par rapport à l’utilisation d’un seul modèle. »}},{« @type »: »Question », »name »: »Nemotron 3.5 Lightning peut-il être personnalisé pour des besoins organisationnels spécifiques ? », »acceptedAnswer »:{« @type »: »Answer », »text »: »Oui. Nemotron 3.5 Lightning peut être post-entraîné sur les propres données d’une organisation à l’aide de NVIDIA NeMo afin d’améliorer la précision pour des tâches spécialisées et spécifiques à un domaine. »}},{« @type »: »Question », »name »: »Sur quelles plateformes Nemotron 3.5 Lightning est-il disponible pour le déploiement ? », »acceptedAnswer »:{« @type »: »Answer », »text »: »Nemotron 3.5 Lightning prend en charge le déploiement local et cloud sur les PC NVIDIA RTX, les systèmes DGX, Jetson et les appareils en périphérie, et il est disponible sur des plateformes telles que Hugging Face, ModelScope, OpenRouter et les partenaires cloud NVIDIA. »}}]}

Article produit avec l’assistance de l’intelligence artificielle et relu par l’équipe éditoriale.

RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST