Architettura AI agentica ibrida tramite Nemotron 3.5 Lightning e NeMo Switchyard
AIoT Solutions

1. Panoramica del Sistema: Il Paradigma dei "Sistemi di Modelli"
Principali Vantaggi Architettonici:
- Maggiore Accuratezza: Utilizzo delle capacità ottimali del modello per ogni specifico passaggio del flusso di lavoro.
- Migliore Efficienza: Modelli più piccoli e specializzati gestiscono attività ad alto volume; i modelli di frontiera affrontano la complessità.
- Latenza inferiore: Tempi di risposta ridotti nei flussi di lavoro agentici multi-step.
- Sicurezza e Sovranità dei Dati: Regole di routing configurabili possono vincolare strettamente i dati sensibili (ad esempio, informazioni sui clienti, cifre finanziarie o codice sorgente proprietario)
2. NVIDIA Nemotron 3.5 Lightning
Architettura e Capacità del Modello:
- Architettura: Mixture-of-Experts (MoE) con 30 miliardi di parametri totali e solo 3 miliardi di parametri attivi per token.
- Lineage: Distillata dal modello di frontiera Nemotron 3 Ultra di NVIDIA per mantenere la capacità agentica in un footprint più piccolo.
- Ottimizzazione: Progettato per agent harness popolari; fornisce anche un'accuratezza leader nel coding, nella chiamata di strumenti, nel seguire le istruzioni e nei flussi di lavoro multi-turn.
- Personalizzabilità: Completamente aperto e personalizzabile, permettendo alle organizzazioni di post-addestrare il modello su dati proprietari per compiti specializzati.
Obiettivi di Distribuzione Hardware:
- MSI EdgeXpert basato su NVIDIA DGX Spark (GB10)
- MSI XpertStation WS300 basato su NVIDIA DGX Station (GB300)
- Scalabile a NVIDIA DGX SuperPOD (H100/B200) per configurazioni ibride.
3. NVIDIA NeMo Switchyard
Funzionalità Principale:
- Routing Automatico: Funge da una libreria di routing open-source che seleziona il miglior modello disponibile per ogni fase di un flusso di lavoro dell'agente da un pool definito dall'utente (mix di modelli chiusi e aperti).
- Avvio Senza Configurazione: Include algoritmi di routing di avvio integrati che funzionano subito senza dati di addestramento, ottimizzazione o configurazione complessa richiesta.
- Miglioramento Autonomo: Il modello di routing diventa più intelligente nel tempo; i dati di utilizzo dalle esecuzioni dell'agente migliorano automaticamente le decisioni di routing senza riaddestramento manuale.
Modalità di Integrazione:
- Server autonomo
- Libreria Python leggera
- Incorporato nativamente all'interno di un'infrastruttura agente (tramite gateway LLM o ISP).
4. Logica del flusso di lavoro operativo
- Osservazione: L'agente incontra una fase del compito (ad esempio, pianificazione, codifica, verifica).
- Valutazione: NeMo Switchyard valuta il contesto della query rispetto alle forze del modello disponibili.
- Decisione di routing:
- Compiti ad alto volume/specializzati: Instradati al Nemotron 3.5 Lightning locale per efficienza e privacy (ad esempio, routine... Indirizzato al Nemotron 3.5 Lightning locale per efficienza e privacy (ad esempio, classificazione di routine, estrazione dati).
- Compiti di Ragionamento Complesso: Indirizzato ai Modelli Frontier quando la capacità specializzata viene superata.
- Esecuzione e Feedback: Il modello selezionato elabora la richiesta. I dati di telemetria delle prestazioni vengono riacquisiti in Switchyard per perfezionare le future decisioni di instradamento.
5. Casi d'uso del settore
- Agenti Personali: Gestione di email, calendario, progetti e prenotazioni localmente su DGX Spark/RTX Spark.
- Sviluppo Software: riepilogo PR, classificazione del codice e triage dei test.Riassunto PR, classificazione del codice e triage dei test.
- Servizi Finanziari: Estrazione di dati da documenti, verifica delle regole delle polizze, monitoraggio dei segnali di rischio e generazione di riassunti.
- Cybersecurity: Arricchimento degli avvisi, classificazione degli incidenti, query sui log, validazione dei controlli e preparazione dei risultati.
- Telecom & Healthcare: Triage degli allarmi di rete/risposta alle query di fatturazione (Telecom); automazione della pianificazione/fatturazione/comunicazioni standardizzate (Healthcare Admin).
6. Risultati delle prestazioni e prove
- Harvey Legal: Riduzione dei costi di inferenza del modello di oltre 10 volte abbinando Switchyard con modelli Nemotron post-addestrati e su misura per il loro dominio legale.
- Applied Compute: Ottenuta una riduzione del 25% nei costi complessivi del modello mantenendo al contempo l'accuratezza di livello frontiera sui benchmark verificati SWE-bench attraverso un instradamento intelligente.