# LLM Context URL: https://diegocecato.dcsolution.it/din-deploy-ai-locale-cpp-onnx-runtime/ # L’AI locale diventa software quando il modello smette di comandare l’architettura DIN Deploy è una raccolta open source di sample C++ pubblicata da NVIDIA per applicazioni AI locali. La pipeline separa la conversione del modello dal deployment: exporter Python trasformano checkpoint Hugging Face in artefatti ONNX, mentre applicazioni native C++ eseguono l’inferenza tramite ONNX Runtime. ## Tesi Il valore principale non è un benchmark specifico ma il confine architetturale. L’applicazione può dipendere dalle API di ONNX Runtime invece che dal runtime specifico del modello; l’accelerazione viene delegata a un Execution Provider, nel caso NVIDIA a TensorRT RTX. Questo rende più esplicito e sostituibile il punto di dipendenza dal vendor, senza eliminare i vincoli hardware o di compatibilità. ## Cosa coprono i sample DIN Deploy include workload di speech recognition con Whisper, Parakeet TDT e Nemotron ASR Streaming, segmentazione con SAM 2.1 e generazione immagini con FLUX.2-klein-4B. Sono disponibili preset CMake per Windows e Linux, x86-64 e Arm64; DirectX è specifico di Windows. ## Portabilità e limiti ONNX Runtime offre un’API comune fra diversi Execution Provider, ma portabilità dell’API non equivale a prestazioni identiche o compatibilità universale. Operatori supportati, shape, memoria, precisione, versione del provider e GPU continuano a incidere. ## Benchmark NVIDIA riporta misure su DGX Spark, tra cui 206,41x real-time per Parakeet TDT e 38,3 FPS per SAM 2.1 contro 0,5 FPS CPU. Sono benchmark del vendor su quella piattaforma e non vanno trasferiti automaticamente a GPU RTX consumer. ## Conclusione DIN Deploy è utile soprattutto come riferimento per trasformare l’inferenza locale da demo a componente software: modello esportabile, contratto ONNX, runtime comune e backend di accelerazione separato.