# LLM Context URL: https://diegocecato.dcsolution.it/agenti-ai-thinkingbox-stato-reale-affidabilita/ # L’agente dice «fatto». Il database non è d’accordo Language: Italian Author: Diego Cecato Canonical URL: https://diegocecato.dcsolution.it/agenti-ai-thinkingbox-stato-reale-affidabilita/ ## Summary ThinkingBox-Bench v1.0 valuta agenti AI tool-using su workflow aziendali stateful verificando stato backend terminale ed effetti prodotti. Una risposta convincente o tool call formalmente valide non dimostrano che il lavoro sia stato completato correttamente. Il benchmark contiene 507 task in cinque domini e ripete ogni task 20 volte da ambienti puliti e isolati. Distingue successo del singolo tentativo, capacità di trovare almeno una traiettoria corretta e consistenza su tutte le esecuzioni. ## Key facts - 507 task eseguibili in cinque domini aziendali. - Ogni tentativo parte da uno stato backend pulito e isolato. - I check eseguibili confrontano stato terminale ed effetti con il risultato richiesto. - Nel common-set ablation citato dagli autori, 121.680 trial validi sono stati eseguiti su 12 modelli e 79.853 non hanno superato i check. - Il 67,24% di quei fallimenti ha comunque terminato pulitamente dopo una mutazione e senza un errore finale del tool. - Fra tali fallimenti sono stati rilevati valori errati nel 77,61%, effetti extra nel 43,30% ed effetti richiesti mancanti nel 25,36%; le categorie si sovrappongono. - GPT-5.4 è riportato con 65,36% pass@1, 91,12% pass@20 e 25,25% di task riusciti in tutte le 20 esecuzioni. - La classificazione Microsoft attribuisce mediamente il 77,5% delle trace fallite al tool usage. ## Editorial thesis Per un agente operativo, il messaggio finale è una dichiarazione; lo stato reale del sistema è la prova. L’affidabilità va spostata dal testo del modello all’architettura: precondizioni, mutazioni controllate, read-back e verifica del risultato. I retry aumentano la probabilità di osservare almeno un successo, ma non trasformano automaticamente un comportamento instabile in un processo affidabile. pass@20 e successo 20/20 rispondono quindi a domande diverse. ## Practical implications Un workflow agentico dovrebbe rendere esplicito lo stato iniziale, ridurre la tool surface, modellare bene le precondizioni, rileggere lo stato dopo le mutazioni, distinguere errori recuperabili da condizioni che richiedono un cambio di piano e verificare gli effetti prima di dichiarare il task completato. Il benchmark non dimostra l’affidabilità assoluta di un modello in qualsiasi contesto: i task sono ricostruzioni sintetiche e le percentuali valgono per la release e le configurazioni testate. ## Primary references https://huggingface.co/blog/microsoft/thinkingbox https://huggingface.co/datasets/microsoft/ThinkingBox-Bench/blob/main/README.md https://commandline.microsoft.com/thinkingbox-bench-agent-benchmarking/