NVIDIA alza l’asticella sui modelli AI agentici NVIDIA con il lancio di Nemotron 3.5 Lightning, un modello open da 30 miliardi di parametri pensato per gestire compiti ad alto volume all’interno di sistemi di agenti sempre attivi. Accanto al nuovo modello arriva NeMo Switchyard, una libreria open source che smista automaticamente le richieste tra più modelli, riducendo tempi e costi di esecuzione. Le due novità, presentate insieme, segnano un passo avanti nella strategia di NVIDIA per rendere l’intelligenza artificiale agentica più veloce, più economica e più facile da personalizzare per le aziende.
Summary
Punti chiave
- Nemotron 3.5 Lightning è un modello mixture-of-experts open da 30 miliardi di parametri, ottimizzato per carichi di lavoro agentici ad alto volume.
- Rispetto ad altri modelli della sua categoria, offre output fino a 4 volte più veloce e completa i task il 30% più rapidamente.
- NeMo Switchyard instrada dinamicamente le richieste al modello più adatto, abbattendo il costo di completamento dei task a circa un terzo rispetto all’uso di un singolo modello.
- Il modello supporta il deploy locale su hardware NVIDIA RTX, DGX e Jetson, oltre al cloud e ai data center.
- È disponibile su Hugging Face, ModelScope, OpenRouter e attraverso la rete di NVIDIA Cloud Partners.
NVIDIA lancia Nemotron 3.5 Lightning per i carichi agentici ad alto volume
Nemotron 3.5 Lightning nasce per rispondere a un’esigenza precisa: i sistemi agentici moderni non funzionano più con un solo modello monolitico, ma come vere e proprie squadre di modelli, ciascuno specializzato in un compito. In questa architettura, un modello di ragionamento più ampio come Nemotron 3 Ultra o GPT-5.6 pianifica e orchestra il flusso di lavoro, mentre modelli più piccoli e mirati come Nemotron 3.5 Lightning eseguono attività specifiche: revisione del codice, uso di strumenti, monitoraggio di alert di sicurezza o risposta a richieste di fatturazione.
Un modello aperto da 30 miliardi di parametri pensato per la velocità
Il nuovo modello arriva dopo Nemotron 3 Nano ed estende la famiglia Nemotron 3 con quello che NVIDIA presenta come il modello più efficiente della sua categoria per attività agentiche di lunga durata. Le prestazioni parlano chiaro: output fino a 4 volte più rapido e completamento dei task il 30% più veloce rispetto ad altri modelli comparabili. I benchmark PinchBench, citati da NVIDIA, mostrano che Nemotron 3.5 Lightning raggiunge questi risultati mantenendo un’accuratezza di livello frontier. Al progetto ha contribuito anche la Nemotron Coalition, la rete di partner che ha fornito metodologie di valutazione, software di inferenza e dataset per affinare il modello prima del rilascio.
Personalizzazione e post-training per la precisione di settore
Essendo un modello aperto, Nemotron 3.5 Lightning può essere sottoposto a post-training tramite NVIDIA NeMo utilizzando i dati, gli strumenti e i flussi di lavoro propri di ogni organizzazione, per aumentare la precisione su compiti specifici. Diverse aziende hanno già intrapreso questa strada: CrowdStrike lo sta personalizzando per la cybersicurezza, Harvey insieme a Trajectory per i servizi legali e CodeRabbit con Baseten per la revisione del codice. Lila Sciences sta lavorando per migliorare le capacità di ragionamento su compiti agentici nelle scienze fisiche e della vita, mentre Fastino Labs ha personalizzato il modello ottenendo accuratezze elevate su carichi di sviluppo software, finanza e sanità.
Il modello supporta inoltre nativamente il fine-tuning per attività di coding: accanto a Lightning, NVIDIA rilascia Nemotron-RL-Agentic-Terminal-Pivot, un dataset di reinforcement learning agentico usato per addestrare il modello sulle capacità di agente da terminale nella scrittura di codice.
NeMo Switchyard: l’instradamento intelligente che abbassa i costi degli agenti AI
NeMo Switchyard risolve un problema molto concreto per chi costruisce applicazioni agentiche: affidarsi a un solo modello di default significa spesso spendere troppo o perdere qualità, mentre gestire manualmente l’instradamento tra modelli diversi diventa un lavoro di integrazione che frena lo sviluppo. La libreria, rilasciata in open source, instrada automaticamente ogni richiesta verso il modello più capace ed efficiente per quel passaggio specifico del flusso di lavoro, senza obbligare gli sviluppatori a riscrivere le loro applicazioni.
Come funziona il routing dinamico e perché conviene
Gli sviluppatori possono modificare l’algoritmo di instradamento in base alle proprie priorità, che siano qualità, latenza o costo. Secondo i benchmark interni di NVIDIA, NeMo Switchyard mantiene un’accuratezza di livello frontier mentre riduce il costo di completamento dei task a circa un terzo rispetto all’uso del solo modello Opus 4.8. È qui che si misura l’impatto reale per le aziende: in un sistema di modelli ben orchestrato, gli agenti AI diventano non solo più rapidi ma anche economicamente sostenibili su larga scala, un aspetto che finora ha frenato l’adozione enterprise dell’AI agentica ad alto volume.
I risultati dei partner che stanno già testando lo Switchyard
NVIDIA ha lavorato con un ampio ecosistema di partner per integrare il routing intelligente direttamente negli strumenti che gli sviluppatori usano già. I primi riscontri, riportati da NVIDIA, mostrano guadagni di efficienza significativi:
- Boomi ha raggiunto il 100% di accuratezza nel domain-routing, indirizzando il 59% del traffico verso un modello fine-tuned 5 volte più veloce e riducendo la latenza del 21% nei turni successivi.
- Cadence ha migliorato l’efficienza del 9,9% usando il ChipStack AI Super Agent per la verifica formale.
- Classmethod registra una riduzione dei costi del 27% mantenendo la qualità nei carichi opencode e Fireworks.
- Cognition ha integrato lo Switchyard in Devin Desktop, ottenendo prestazioni quasi frontier con un costo medio ridotto del 28% rispetto a instradare tutto verso un unico modello frontier.
- LangChain ha ottenuto un costo inferiore del 74% instradando solo il 7% delle chiamate verso un modello frontier, con un compromesso di accuratezza del 6%.
- Ramp ha eguagliato le prestazioni di un modello frontier tagliando i costi del 58% e i tempi di esecuzione del 33% nel test SWE-Bench.
Altri nomi noti si stanno muovendo nella stessa direzione: Kong offre il routing nativamente tramite Kong AI Gateway, LiteLLM lo integra come plug-in nel proprio proxy layer, Nous Research lo ha incorporato in Hermes e Siemens lo sta testando per migliorare l’efficienza del proprio Fuse EDA AI Agent.
Deploy flessibile: dal PC di casa al data center
Uno dei punti di forza di questa generazione di modelli aperti è il controllo su dove e come l’AI viene eseguita. Nemotron 3.5 Lightning può girare su sistemi locali — inclusi NVIDIA RTX PC, DGX Spark, DGX Station e Jetson — per sfruttare infrastrutture già esistenti, oppure scalare su dispositivi edge, workstation RTX PRO, data center e ambienti cloud per casi d’uso enterprise. Questa flessibilità permette di eseguire compiti specializzati e ad alto volume localmente o on-premise, quando serve velocità di risposta e controllo sulla privacy dei dati, senza dover rinunciare alla possibilità di scalare in cloud quando il carico lo richiede.
Dati aperti e disponibilità su più piattaforme
Come per ogni lancio della famiglia Nemotron, NVIDIA pubblica quanti più dati e tecniche di addestramento possibile, nei limiti consentiti dalle licenze, per garantire tracciabilità, possibilità di audit e riutilizzo per addestrare altri modelli. Questo approccio distingue i modelli Nemotron da molte soluzioni proprietarie chiuse e resta uno degli argomenti principali con cui NVIDIA cerca di consolidare la propria posizione nel mercato dei modelli aperti per l’AI agentica.
Nemotron 3.5 Lightning è già disponibile su Hugging Face, ModelScope, OpenRouter e su build.nvidia.com come microservizio NVIDIA NIM, oltre che attraverso un ampio ecosistema di NVIDIA Cloud Partners, piattaforme di post-training e inferenza e provider cloud. NeMo Switchyard è disponibile su GitHub, con l’arrivo su ulteriori piattaforme partner previsto nei prossimi mesi.
FAQ
Cos’è Nemotron 3.5 Lightning e cosa lo rende diverso?
Nemotron 3.5 Lightning è un modello AI open da 30 miliardi di parametri ottimizzato per compiti agentici ad alto volume, capace di offrire un output fino a 4 volte più veloce e un completamento dei task il 30% più rapido rispetto ai modelli concorrenti della stessa categoria.
Come migliora l’efficienza AI NeMo Switchyard?
NeMo Switchyard è una libreria di instradamento open source che indirizza dinamicamente le richieste al modello più adatto per ogni passaggio del flusso di lavoro, riducendo il costo di completamento dei task a circa un terzo rispetto all’uso di un singolo modello.
Nemotron 3.5 Lightning può essere personalizzato per esigenze specifiche di un’organizzazione?
Sì: il modello può essere sottoposto a post-training con NVIDIA NeMo utilizzando i dati propri di un’organizzazione, per migliorare l’accuratezza su compiti specializzati come cybersicurezza, servizi legali o revisione del codice.
Su quali piattaforme è disponibile Nemotron 3.5 Lightning per il deploy?
Il modello supporta deploy locale e cloud su NVIDIA RTX PC, sistemi DGX, Jetson, dispositivi edge e data center, ed è disponibile su piattaforme come Hugging Face, ModelScope, OpenRouter e la rete di NVIDIA Cloud Partners.
Contenuto realizzato con l’assistenza dell’intelligenza artificiale e con revisione editoriale umana.

